本地部署模型,推理框架,量化,蒸馏

Ollama 的作用可:让你在本地像"调用 API 一样运行大模型"

视频讲解

Ollama = "本地大模型运行 + API 服务封装器"




Open WebUI





主流大模型部署方式

Ollama

vLLM

视频讲解

TGI(HuggingFace 推理服务)

LM Studio(GUI 本地运行)

llama.cpp(极致轻量 CPU 部署)

LLM、推理框架到底是什么关系。

👉 LLM 是"脑子(模型)"

👉 推理框架是"让脑子能工作起来的发动机 + 操作系统"

在大模型系统里,其实是三层:

① 模型(LLM权重)

② 推理框架(Inference Engine)

③ 应用(Web UI / API / Chat

❗ LLM 不是软件

❗ LLM 是"数据(权重)"

👉 推理框架才是"运行系统"
模型 = 文件(权重)

推理框架 = 运行这个文件的程序
👉 LLM 是模型的一种

👉 模型只是"参数文件"

👉 推理框架才是真正运行模型的系统

模型(Model)是什么?任何机器学习训练出来的函数"


LLM 是什么?一堆参数(几十 GB),不会自己运行,只是数学函数,只是文件

为什么不能直接用模型?

因为模型文件本身:

❌ 不会接收 HTTP 请求

❌ 不会管理 GPU

❌ 不会做并发

❌ 不会 batch

❌ 不会 stream 输出

👉 换句话说:

模型 ≠ 可运行服务


推理框架是什么?运行模型的引擎

显存分配 / KV cache???




应用层是什么?把输入发给模型,把输出展示给用户"

量化 把"模型参数精度降低",换取更快更省显存



蒸馏:用"大模型的输出结果当输入

蒸馏:

把问题交给大模型 , 让它生成"标准回答" , 用这些回答训练小模型





相关推荐
林澈在路上9 小时前
AI翻唱软件哪个好 2026国产AI写歌工具对比推荐
大数据·人工智能·深度学习·github·aigc·音视频·音频
咖啡星人k9 小时前
2026 MCP 模型上下文协议:让 AI 自己动手接工具,告别手写接口(MonkeyCode 实战)
人工智能·深度学习·机器学习·语言模型·自然语言处理
yyuuuzz9 小时前
记一次 VPS 性能排查:共享 CPU 突发额度导致的限流
运维·服务器·人工智能
恋猫de小郭9 小时前
看懂大模型架构术语,帮助你理解目前常见的大模型开源架构
前端·人工智能·ai编程
tachibana29 小时前
复杂任务怎么做的任务拆分?
人工智能·ai·大模型·llm·agent
tachibana29 小时前
ReAct、Plan-and-Execute、Reflection 三种范式有什么核心区别
人工智能·ai·大模型·llm·agent
————A9 小时前
Agent 接收用户上传文件
人工智能·笔记·python·状态模式
Huazhongzhanhui9 小时前
极智防护与绿色表改:2026中国(武汉)国际表面处理展览会涂装涂料展会前瞻
人工智能·云计算
金融小师妹9 小时前
多因子智能推演:黄金震荡回升,杰克逊霍尔“沃什首秀”政策如何重塑金价路径的AI预测框架
大数据·人工智能·python·线性回归
阿童木写作9 小时前
跨马翻译:AI批量图片翻译与视频字幕翻译工具推荐
人工智能·python·音视频