llama

牛马工作号2 天前
人工智能·语言模型·llama
RK3588 使用 rk-llama.cpp + RKNPU2 部署 Qwen3.5:从零开始的 NPU 本地大模型实战图 1:本文以 RK3588 上的文本推理为目标。板卡为概念示意,CPU 与三核 NPU 均属于 RK3588 SoC。
书源丶2 天前
网络·语言模型·embedding·llama
Qwen3-Embedding-0.6B 纯 CPU😫 痛点引入:4 核小机器跑个 0.6B 的 embedding 模型,一条长文本要等 一百多秒? 内存常年顶满、swap 疯狂读写、CPU 明明闲着却慢得离谱? 网上一搜全是「vLLM + FP16 + FlashAttention」,可你这台机器连个独显都没有🤡?
论文复现现场3 天前
llama·qwen·vllm·大模型推理·大模型部署·rtx4090
Llama/Qwen 70B 部署需要几张 RTX 4090?2卡、4卡、8卡显存、量化与 vLLM 选型直接答案:70B/72B 模型用 2 张 RTX 4090 只能主打 4-bit、低并发推理;4 张是量化部署的均衡配置;8 张可以考虑 BF16 或双副本吞吐,但性能不会随卡数线性增长。
谢白羽4 天前
笔记·python·llm·llama·sglang
在4×B300用SGLang部署DeepSeek-V4.1 Flash优化实录本文提到的 DeepSeek-V4.1 的 Day 0 适配和 kernel 优化由 SGLang 团队共同完成。最终在 4×B300、TP4 / EP4 配置下,配合 DSpark 达到
renzao_ai7 天前
python·llama·免费ai大模型
本地 35B 大模型部署实战:Ollama 跑 Ornith-35B 全流程本地 35B 大模型部署实战:Ollama 跑 Ornith-35B 全流程桌面级 AI 扩展坞 · 实战案例 #001 日期:2026-09-13 环境:Windows 11 / i5-13600KF / 32 GB DDR5 / RTX 3060 Ti 8 GB 模型:Ornith-1.0 35B MoE(Q4_K_M,21 GB)
Είναι η κοπέλα7 天前
macos·llama·vllm
本地大模型部署完全指南:Ollama / vLLM / llama.cpp / MLX 四大引擎横评与选型实战数据说明:本文的安装命令、特性、硬件支持全部来自各项目官方 README(2026 年 9 月版本),关键论断标注了出处。不写没验证过的性能数字。 适合谁:想在自己机器或公司服务器上跑开源模型,但被 Ollama、llama.cpp、vLLM、MLX 这些名词绕晕的人。
小饕7 天前
人工智能·机器人·llama
RK3588 NPU 跑大模型实测:rknn-llm 解码 25.9 tok/s,是 llama.cpp 的 4 倍!附三天完整踩坑记录上周折腾了一件大事:手头有块 Orange Pi 5 Plus(RK3588,16GB 内存,带 6 TOPS 的 NPU),之前已经在 Jetson Orin 上跑通了 Qwen2.5,这次想看看 RK3588 这块国产芯片能不能也把大模型跑起来。而且光跑起来还不够——RK3588 上有大模型推理的两条主流路线:llama.cpp(社区 NPU fork) 和 rknn-llm(瑞芯微官方工具链),到底谁快?网上众说纷纭,干脆自己动手,同板同模型同协议测一遍。
一航jason8 天前
android·人工智能·ai·架构·ai编程·llama
Android平台推理框架及试用场景模型对比核心结论:文本 LLM 用 llama.cpp 一站通吃,视觉/语音/图像生成各归专项工具(whisper.cpp、sherpa-onnx、stable-diffusion.cpp),NPU 能效交给 AI Edge SDK,PyTorch 模型下放给 ExecuTorch。 llama.cpp 虽然模型覆盖最广,但 ASR/TTS/图像生成不在它的范畴内,别硬塞。
一航jason8 天前
android·人工智能·ai·ai编程·llama·ai-native
Android 端侧大模型推理框架对比CPU 上限选 llama.cpp,GPU 上限选 MLC-LLM,NPU 能效上限选 MediaPipe / AI Edge SDK(Qualcomm AI Engine Direct),PyTorch 生态选 ExecuTorch,"能跑就行"选 PocketPal / Ollama 移动端。 没有"全能王",瓶颈决定了上限——想跑得更稳更快,关键是选对硬件路径(CPU / GPU / NPU)再选框架。
零依赖极客8 天前
c语言·arm开发·人工智能·llama
Day 8·1 自注意力机制:Q·K^T/softmax/V的在线计算对第 t 个位置的 query,注意力要“回看”前面所有已缓存的 token:vllm_transformer.c 有一段“教科书式”的因果注意力(第 77–128 行),三步与公式一一对应:
微软技术分享10 天前
llama
LLama-Factory 实现大模型LoRA-SFT微调指南LLaMA Factory 是一款开源、低代码、一站式大语言与多模态模型微调框架,用于降低大模型的微调落地门槛。框架兼容 Qwen、LLaMA、ChatGLM、LLaVA 等上百款主流开源模型,支持增量预训练、SFT 监督微调、DPO、KTO、ORPO 等多种训练对齐方案,原生集成 LoRA、QLoRA 量化微调技术,可在消费级显卡完成轻量级模型微调。框架支持可视化网页端和命令行双操作模式,完整覆盖模型训练、评估、权重合并、推理部署全流程,适配科研实验、行业轻量化模型定制等场景。
七牛云行业应用11 天前
人工智能·ai编程·llama
OpenCode 跑本地 Llama:编程 Agent 接入本地大模型的完整思路发布日期:2026年9月9日OpenCode 是一款开源的 AI 编程智能体(Agent)命令行工具,由 sst 团队开发并以 MIT 协议开源,核心能力是在终端里以 Agent 模式理解代码库、执行文件编辑和命令调用。它的 Provider 层采用 OpenAI 兼容协议,这意味着开发者不仅能接入云端大模型,也能把请求指向本地运行的 Llama 等开源模型,实现完全离线、数据不出本机的编程辅助。本文梳理 OpenCode 接入本地 Llama 的两种主流路径(Ollama、llama.cpp),以及实际
一航jason12 天前
人工智能·ai·ai编程·llama·ai-native
GPU 推荐用吗?——8295 上 Adreno 695 的现实评估结论:不推荐作为 LLM 主力推理单元。8295 的 Adreno 695 GPU 优先留给图形渲染(仪表/中控/AR-HUD/多屏),GPU 推理只能作为 CPU 的备选降级路径,不要主动抢占。 这不是"保守派"观点,而是 llama.cpp 社区在骁龙平台上的实测共识——OpenCL 跑 LLM 的解码速度普遍比纯 CPU 还慢 40~50%。
小饕14 天前
人工智能·llama·大模型端侧部署
llama.cpp 参数调优指南:Jetson 8GB 实战手记llama.cpp 参数调优指南:Jetson 8GB 实战手记 平台:Jetson Orin Nano Super 8GB(JetPack 6.2 / CUDA 12.6) 模型:Qwen2.5-3B Q4_K_M、Qwen2.5-VL-3B Q4_K_M + mmproj-f16 数据基准:全部真机实测(tegrastats + 自写 bench 脚本),未实测处明确标注 很多人用 llama.cpp 就是 ./llama-server -m model.gguf 一把梭,能用,但在 8GB 这种资源
chinesegf14 天前
服务器·架构·llama
现代互联网服务的经典架构以物理机gpu部署模型和推理框架llama,虚拟机部署 agent(类似pi)并开放前端监听端口,局域网其他电脑可以调用为例:
μθημα16 天前
llama·maxkb
Ollama 本地大模型部署实战:虚拟机环境下的完整操作指南随着大语言模型技术的快速发展,越来越多的开发者和企业希望在自己的环境中部署本地大模型,以满足数据隐私、定制化和成本控制等需求。Ollama 作为一款开源的大模型管理平台,凭借其简洁的命令行界面和强大的模型管理能力,成为本地部署的首选工具之一。
论文复现现场16 天前
人工智能·python·云计算·llama·gpu算力
RTX 4090 24GB 能跑 Qwen3.8-27B 吗?单卡显存计算与云端部署指南更新日期:2026 年 9 月 1 日 适用对象:希望在单张 RTX 4090 上部署 Qwen3.8-27B 的开发者
zhangphil16 天前
android·llama
AI大模型生成maxTokens 与上下文contextmaxTokens 表示:本次生成最多允许模型输出多少个 token。简单说:maxTokens 是“回答长度上限”,不是模型一定会生成这么多,也不是输入长度。
淼澄研学19 天前
llama
英伟达参投Hugging Face,本地部署Llama 3实操指南2024年5月,AI开源社区平台Hugging Face宣布完成2.35亿美元D轮融资,估值达到45亿美元。本轮融资由Salesforce领投,英伟达、AMD、英特尔等芯片巨头参投。这一资本动作表明开放权重AI模型在硅谷的受关注程度达到新高。随着Meta发布Llama 3等高质量开源模型,开放权重模型不再仅仅是学术研究的附属品,而是成为科技巨头战略布局的核心资产。截至2024年,Hugging Face已托管超过80万个机器学习模型。 开放权重模型受关注源于其技术架构的演进。Hugging Face底层依
qyyyyy57024 天前
数据库·pdf·json·erlang·llama
PDF 转 JSON 怎么做?从表格和元数据提取到 LLM 结构化处理摘要: PDF 适合阅读,却不天然等于结构化数据。本文从页面文本、坐标与表格的差异出发,给出“翻译辅助理解—PDF 转 JSON—Schema 设计—清洗校验—接入 LLM 或知识库”的完整流程,并说明复杂表格、公式、扫描件和跨页结构为什么仍需人工抽检。