llama.cpp

n112124 天前
llama·llama.cpp·本地大模型·gguf
4G 显存老显卡怎么跑模型:llama.cpp 加 GGUF 配置手头有块 4G 显存的老显卡,好几年前买的,平时就看看视频。今年想在家跑个本地大模型,一开始图省事装 Ollama,拉了个 7B 的模型,一跑就报 CUDA out of memory,显存直接爆掉。后来换 llama.cpp 配 GGUF 量化模型,才算在这张卡上把模型跑起来。这篇把配置和踩的坑写下来。
半甜柠檬7 天前
大模型·qwen·量化·本地部署·llama.cpp
llama.cpp 部署 Qwen3.8-27B:无独显轻薄本实测一提本地部署大模型,很多人的第一反应就是得先买张四五千的显卡。我原来也这么想,直到把天天背去上班的ThinkBook 14翻开,折腾三个晚上,硬是把一个270亿参数的模型跑起来了。
智码看视界11 天前
开源·中文·llama.cpp·百川智能·国产大模型·baichuan 5
开源大模型前沿:Baichuan 5 :单卡 H100 跑国产,长上下文 + 中文 Agentic 硬刚海外同档项目信息发布方百川智能(Baichuan Inc.,中国)发布时间2026-07-30(开源权重 + 技术报告)
阆遤25 天前
ai·编译·llama.cpp
llama.cpp 0.4.0-dev 本地编译指南这是我在笔记本电脑上本地编译 llama.cpp 源代码的个人经验。目前在version: 0.4.0-dev (build 10960, commit e760451cb) 编译通过。
JiMoKuangXiangQu1 个月前
人工智能·llama.cpp·推理引擎
在 AllWinner T507 上部署 Qwen2.5-0.5B 大语言模型AllWinner T507 是一款面向工业控制的 Arm Cortex-A53 四核处理器,主频最高 1.5GHz,常见于嵌入式 HMI、工业网关等场景。本文记录在这类资源受限的嵌入式设备上,通过交叉编译 llama.cpp 并部署 Qwen2.5-0.5B-Instruct 量化模型的完整过程。
智码看视界1 个月前
c#·.net·llama.cpp·.net 10·tensorsharp·本地大模型推理·开源推理引擎
.NET 10 推理大模型TensorSharp 3.3.0 部署实测:纯.NET推理引擎反超llama.cpp 1.5倍,DFlash2提速62%TensorSharp 是开发者傅忠恺打造的原生 .NET 10 大模型推理引擎,直接加载 GGUF,跨 Windows/macOS/Linux 运行,自带 CLI、Web 聊天界面与 Ollama/OpenAI 双兼容 API。2026-08-30 发布的 3.3.0.0 版本合入约 40 个 PR:首发 Wan 视频生成、落地 GLM-5.2 与 Muse-Glimmer、推出 DFlash2 投机解码并补齐服务端安全。社区背靠背实测显示其 prefill 吞吐较 llama.cpp 最高快 1.50
容沁风2 个月前
llama.cpp·2080ti·gemma4·vbr
使用ninja编译llama.cpp使用的电脑没有nvidia显卡,但是可以编译llama.cpp的CUDA版。C盘没有空间了,把cuda安装在D:\cuda12,我的显卡是2080ti 11G, turing架构。 也会在C盘安装少量文件(C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.4\extras\visual_studio_integration\MSBuildExtensions) 在path变量中设置路径
撞强2 个月前
diffusers·vllm·llama.cpp·amm·6000d
AMM:一套支持 llama.cpp / vLLM / Diffusers 的 AI 模型统一调度平台背景:中小企业内部,20万以内成本,搭建全套算力业务平台。 测试:Unraid+NV RTX 6000D+AMD 7543*2+256G DDR4 AI:积算MaaS平台
寒水馨2 个月前
linux·ubuntu·llm·llama·本地部署·llama.cpp·推理引擎
Linux下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-ubuntu-vulkan-x64.tar.gz)llama.cpp 是由保加利亚软件工程师 Georgi Gerganov 于 2023 年 3 月创建的开源 LLM(Large Language Model,大语言模型)推理引擎。最初是 Gerganov 在一个周末为了让 Meta 的 LLaMA 模型在 MacBook 上运行而发起的项目,如今已发展成为本地 AI 推理领域的事实标准。截至 2026 年中,该项目在 GitHub 上已获得约 12 万颗星(Stars)、超过 1600 位贡献者,增长速度超过 PyTorch 和 TensorFlow
Briwisdom3 个月前
模型部署·vllm·eagle·llama.cpp·prefill·speculative·decoding
Speculative Decoding:用小模型给大模型“打草稿“,推理加速 2-3×副标题: 大模型每生成一个 token 都要搬一次 KV Cache——瓶颈在搬数据,不在算。投机解码做的事就是:用更快的方式"猜"出几个 token 凑成一批,大模型一次验证,用"批处理"省掉重复搬运。
SNOWPIAOP3 个月前
llama.cpp·5090·qwen3coder
RTX 5090 本地部署 Qwen3-Coder-30B-A3B 实测:90 Tokens/s,128K 上下文,仅占用 22.4GB 显存最近体验了一下 Qwen3-Coder-30B-A3B-Instruct 的 GGUF 版本,在 RTX 5090 D V2(24GB) 上使用 llama.cpp 进行部署,整体效果超出预期。
Ki13814 个月前
人工智能·llama.cpp·rtx pro 4000
N记消费/专业级Blackwell架构GPU,以编译方式安装llama.cpp搞了块RTX PRO 4000显卡,配置了24G VRAM,做实验发挥的余地又拓展了一些了。Ollama毫无难度的跑了起来,所以还想试试其它更适合生产环境的推理框架。但问了下AI,当前(2026年5月)。一些主流推理框架对英伟达Blackwell架构的GPU(尤其是消费级的)优化仍在进行中,llama.cpp算是比较推荐的一种了(毕竟Ollama也是以它为基础),因此先拿它来折腾。
碳基硅坊4 个月前
人工智能·vllm·llama.cpp·模型加速·mtp
MTP在vLLM与llama.cpp上的性能对比:Qwen3.6与Gemma4实测MTP(Multi-Token Prediction,多Token预测)是一项新兴的大模型推理优化技术。本文基于完整测试数据,对比vLLM和llama.cpp在MTP模式下的性能表现,并提供可操作的部署指南。
cooldream20095 个月前
大模型微调·llama.cpp·unsloth
利用网络算力使用 Unsloth 实现llama大模型的微调部署调用大模型微调是让通用大模型适应特定任务或领域的重要技术。传统全参数微调需要昂贵的 GPU 资源,而 Unsloth 通过 QLoRA 4bit 量化技术,将微调的显存需求降低 50% 以上,同时保持训练速度提升 2-5 倍。本文详细介绍在 AutoDL 云服务器上使用 Unsloth 进行大模型微调的完整操作流程,包括环境配置、模型下载、微调训练、权重合并以及 API 部署。
JOJO___5 个月前
windows·cpu·amd·llama.cpp·llama.cpp编译·千问3.5·本地大语言模型
【2026】记录在windows编译llama.cpp步骤,AMD CPU本地部署千问3.5本地大模型,内存占用低我的电脑是AMD的+32G内存,没有GPU,偏要玩一玩千问3.5本地大语言模型,github上下载的llama安装包,无法使用,只有自己编译试试了。注意我是编译CPU版本的,你有GPU这篇别看了。 以下是我的CPU型号:
曦云沐5 个月前
macos·llama.cpp
MacOS 上使用 Metal GPU 加速编译 llama.cpp 完整指南本文详细记录了在 MacOS 上使用 Metal GPU 加速编译 llama.cpp 的全过程,涵盖 cmake 安装、仓库克隆、编译配置、模型下载、GPU 验证、多模型运行测试以及性能监控工具的使用,适合需要在 Apple Silicon Mac 上本地运行大语言模型的开发者参考。
feasibility.5 个月前
人工智能·llm·多模态·量化·llama.cpp·vlm·llama-factory
多模态模型Qwen-3.5在Llama-Factory使用+llama.cpp量化导出+部署流程(含报错处理)可以去huggingface或hf-mirror镜像站等下载Qwen3.5的模型,比如https://huggingface.co/Qwen/Qwen3.5-0.8B/tree/main 或https://hf-mirror.com/Qwen/Qwen3.5-0.8B/tree/main下载模型相关文件,保存到合适路径,比如/Users/Zhuanz/Desktop/work/Qwen3.5/model
晨欣6 个月前
llama.cpp·qwen3.6-35b-a3b·qwen3.5-35b-a3b
单卡 L20 48GB实测 | 同是 Q8_0,为什么 Qwen3.6 在 llama.cpp 长上下文下比 Qwen3.5 更慢?关键词: Qwen3.5、Qwen3.6、llama.cpp、GGUF、Q8_0、TTFT、Prefill、长上下文、L20 48GB、推理性能、单卡部署
d1z8886 个月前
人工智能·llama·显卡·llama.cpp
(二十)32天GPU测试从入门到精通-llama.cpp CPU/GPU 混合推理day18llama.cpp 是最流行的 CPU 推理引擎,让大语言模型在无 GPU 设备上运行成为可能,是边缘部署、隐私保护、成本敏感场景的首选方案。2023 年初,当整个行业都在追求更大模型、更多 GPU 时,llama.cpp 的作者反其道而行之:如何让 7B 模型在普通笔记本上流畅运行?通过精心优化的量化技术和 CPU 指令集利用,llama.cpp 做到了这一点,并迅速成为 GitHub 上最热门的 AI 项目之一。
gergul6 个月前
python·llama·llama.cpp·llamacpppython
在llama-cpp-python中使用自己编译的llama.cpp,解决pip install llama-cpp-python报错Q:在使用“pip install llama-cpp-python”安装llama-cpp-python出现错误,最后几句错误是这样的: