基础LLM 和指令调优LLM

基础LLM

基础LLM已经过训练,可以进行预测。根据文本训练数据(通常是训练数据)预测下一个词基于来自大量数据,通过互联网和其他资源来了解接下来会发生什么,最有可能紧随其后的词

复制代码
你问:"中国的首都是..."
它想:"根据我看过的书,'首都'后面最常见的是'北京'"
它答:"北京"

你问:"帮我总结一下这篇文章"
它想:"'总结'?我的训练数据里没有这个模式...还是继续写文章吧"
它答:把文章继续写下去了(而不是总结)

指令调优LLM

训练就是从基础开始。

使用大量文本数据训练的LLM模型,并进一步训练它,并使用作为指令的输入和输出对其进行进一步微调。

并努力遵循这些说明,然后通常会使用一种称为"技术"的技术进一步完善。

RLHF,即基于人类反馈的强化学习,使系统更有能力提供帮助,遵循指示。因为针对特定指令调整的LLM已经过训练。要乐于助人、诚实守信、无害

复制代码
你问:"帮我总结一下这篇文章"
它想:"哦,这是'总结'指令,我要提取要点"
它答:给出了简洁的总结

你问:"翻译成英文:今天天气好"
它想:"这是'翻译'指令,我要把中文转英文"
它答:"The weather is nice today"

对比

训练方式

基础LLM训练

text 复制代码
数据:[大量文本,如网页、书籍、论文]
目标:最大化 P(下一个词 | 前文)

例如:
输入: "今天天气真"
目标: "好"

指令调优LLM训练

text 复制代码
数据:[指令-回答] 对
目标:让模型学会"听到指令 → 执行任务"

例如:
输入: "指令:翻译成英文\n文本:你好"
目标: "Hello"

场景选择

用基础LLM的场景

  • 需要创意续写(小说、文案)

  • 需要代码补全

  • 你想自己控制输出风格

  • 资源有限,基础模型更小更快

用指令调优LLM的场景

  • 需要执行具体任务(翻译、总结、分类)

  • 需要对话式交互

  • 需要遵循格式要求(JSON输出、特定模板)

  • 用户不擅长写复杂提示词

相关推荐
桃西西呀1 小时前
LangChain 之八:流式与透传
人工智能·langchain·llm
桃西西呀1 小时前
LangChain 之九:一个能检索又会调工具的流式问答助手
人工智能·langchain·llm
lucas_AI3 小时前
删掉失败经验,agent 反而变强了:Sentry 想明白『攻略该什么时候看』
llm·agent
lucas_AI3 小时前
Hinton 下场写 RSI 论文:今天一年的 AI 进步,未来可能只要 5 周
人工智能·llm
DevOps老兵3 小时前
AIOps实战03:两代AIOps,传统机器学习与大模型该怎么配合
人工智能·机器学习·大模型·llm·aiops·老计聊技术
叮当猫_ddm3 小时前
vLLM 与 SGLang 并发实验:如何让性能数字可复现、可解释
llm
bullkingluo3 小时前
从零到一搭建企业级智能问答系统:Ch14 · 三层记忆与断点续跑
架构·llm·agent
10年前端老司机4 小时前
LangChain 五种工具定义方式踩坑总结
python·langchain·llm
AINative软件工程5 小时前
LLM 多租户 Prompt Isolation 工程实践:为 100 个租户定制 Prompt,但别让它们互相污染
后端·llm
stereohomology5 小时前
ZCode 是如何处理超长上下文的
llm·总结·薅羊毛