一.⼤模型常⻅应⽤场景
我们来感受⼀些⼤家⽣活或者⼯作中更加常⻅的使⽤⼤模型的应⽤
1.对话与交互类
⼤模型出来后最常⻅的使⽤⽅式就是进⾏对话.
- 智能客服与问答:替代传统⼈⼯客服,处理咨询、投诉、售后等问题,能够7×24⼩时响应,如银⾏、电商、电信运营商中的智能助⼿。
- 虚拟⻆⾊扮演:在游戏或社交应⽤中,扮演特定⻆⾊(如历史⼈物、动漫⻆⾊)与⽤⼾进⾏情感陪伴或剧情互动。
下⾯是中国电信的AI客服信息,我们可以使⽤腾讯应用宝电脑版下载 - 在电脑上玩手机游戏,移动应用大屏丝滑体验。在电脑上体验下

2.内容创作与⽣成类
⼤模型在⽣成领域已经⾮常成熟了
- ⽂案写作:⽣成营销⽂案、⼴告语、新闻稿、剧本、诗歌、⼩说⼤纲等。例如,电商卖家常⽤它来批量⽣成商品描述。
- 图像与视频⽣成:通过⽂本描述⽣成⾼质量的图像(如Midjourney)、视频或3D内容,⼴泛应⽤于设计、⼴告、影视前期制作。
- ⾳乐与⾳频合成:根据提⽰词⽣成背景⾳乐、歌曲,或进⾏语⾳克隆、有声书朗读等。我们刷抖⾳、头条、红果短剧等短视频的时候经常可以看⻅AI⽣成的动漫视频,效果⾮常震憾。 短剧背后的⽣成链路很⻓,这个是⼀个开源视频⽣成系统,我们可以看下

3.编程与软件开发类
软件⼯程的范式正在被⼤模型改变。
- 码⽣成与补全:根据⾃然语⾔描述⽣成代码⽚段、函数或整个模块,⽀持多种编程语⾔,如GitHub Copilot、Cursor等。
- 代码解释与调试:帮助开发者理解复杂的遗留代码、⾃动查找Bug、提出修复建议,并⽣成单元测试⽤例。
- ⾃动化运维:通过⾃然语⾔⽣成运维脚本,分析⽇志⽂件,辅助排查系统故障。使⽤编程⼯具,输⼊⾃然语⾔就可以快速的完成应⽤的搭建,下图为使⽤https://aistudio.google.com/apps制作的俄罗斯⽅块游戏。

4.教育与知识类
⼤模型可以作为个性化的知识导师。
- 个性化辅导:根据学⽣的学习进度和薄弱点,提供定制化的讲解、习题和答疑,⽀持数学、编程、语⾔学习等多种学科。
- 内容总结与提炼:快速总结⻓篇⽂档、会议纪要、学术论⽂的核⼼内容,帮助⽤⼾⾼效获取信息。
- 试题⽣成:为教师或培训机构⾃动⽣成试卷、练习题和参考答案。
下图是秘塔AI搜索制作的在线讲解课程,⽀持输⼊PDF就可以完成在线课程的讲解。

5.数据分析与商业智能类
将⾃然语⾔与数据打通,降低了数据使⽤⻔槛。
- ⾃然语⾔查询(NL2SQL):⽤⼾直接问"上个⽉销量最⾼的产品是什么?",模型⾃动将其转化为SQL语句并执⾏查询,返回结果。
- 报告⾃动⽣成:⾃动从Excel、数据库或ERP系统中提取数据,⽣成周报、⽉报的⽂字分析部分,并推断数据变化的原因。
- 市场分析与洞察:分析社交媒体评论、客⼾反馈,提炼出⽤⼾对产品的正负⾯评价,辅助产品决策。
下图是ChatExcel的在线智能分析

分析结果

6.企业服务与⾏业垂直应⽤
⼤模型结合企业内部知识库,解决特定⾏业问题。
- 企业知识库:将公司内部的规章制度、技术⽂档、历史项⽬资料"向量化"后,员⼯可以⽤⾃然语⾔提问,精准找到所需信息,解决企业内部"数据多但找不到"的痛点。
- 医疗辅助:辅助医⽣进⾏病历撰写、医学影像初步分析、⽂献检索和诊疗建议参考(通常需⼈⼯复核)。
- 法律与⾦融:辅助审查合同条款、识别法律⻛险;在⾦融领域⽤于财报分析、⻛险评估、智能投顾等。
下图是阿⾥云AI助⼿,⾃动读取技术⽂档进⾏回复。

二.开源和闭源⼤模型
1.开源⼤模型
LLaMA 到底是什么?
LLaMA 的全称是 "Large Language Model Meta AI",直译就是 "Meta 公司的大型语言模型"。简单来说,它是 Meta(原 Facebook)开发的一款 "通用语言 AI 大模型"------ 就像一个天生会 "读" 会 "写" 的智能大脑,既能理解文字含义,也能生成连贯的内容。
但它和 ChatGPT、⽂⼼⼀⾔有个本质区别:完全开源。你可以把 ChatGPT 想象成 "苹果⼿机"------
成品直接给你⽤,功能强⼤但封闭,你没法改它的核⼼逻辑;⽽ LLaMA 更像 "安卓系统"------Meta
把模型的核⼼代码、训练框架都公开了,任何⼈都能下载、修改、⼆次开发。举个直观的例⼦:如果⼀家⼩公司想做⼀款 "电商客服 AI",⽤ ChatGPT 得花钱调⽤ API,还受限于平台规则;但⽤
LLaMA,他们可以下载基础模型,再⽤⾃⼰的客服对话数据 "调教" 它,最后部署在⾃⼰的服务器
上,不仅免费,还能完全适配⾃⼰的业务。
Meta 当初开源 LLaMA 的初衷也很明确:打破⼤公司对⼤模型的垄断,让更多开发者、中⼩企业能参与到 AI 创新中。就像把 "AI 造⻋的图纸" 免费公开,普通⼈也能试着改装出⾃⼰的 "专属汽⻋"。
由于模型开源且性能优异,Llama迅速成为了开源社区中最受欢迎的⼤模型之⼀,以Llama为核⼼的⽣态圈也由此崛起。与此同时,众多研究者将其作为基座模型,进⾏了继续预训练或者微调,衍⽣出了众多变体模型(⻅下图),极⼤地推动了⼤模型领域的研究进展。

a.概念
开源⼤模型指的是模型的权重公开,任何⼈都可以下载、部署、微调、甚⾄研究其代码。虽然训练数据通常不公开,但"开源"的核⼼在于使⽤权。
b.优点
1.数据安全与隐私 :这是最核⼼的优势。模型可以完全部署在企业内部的本地服务器或私有云上,敏感数据不出域,杜绝了数据被⼚商⽤于训练或泄露的⻛险,尤其适合⾦融、医疗、政务等⾼合规要求⾏业。
2. 成本可控: 虽然初期需要采购GPU服务器,但⼀旦部署完成,推理成本极低。对于⼤规模、⾼频次调⽤的场景,⻓期总拥有成本远低于按API调⽤次数付费的闭源模型。
3. ⾼度的定制化: 开发者可以获取模型权重,针对特定垂直领域进⾏微调,甚⾄修改模型架构。这种"⾃主可控"的能⼒,让企业能构建差异化的核⼼竞争⼒。
**4. 透明与持久性:**模型权重下载后即属于⽤⼾,不会因为⼚商倒闭、政策变动或接⼝升级⽽⽆法使⽤,不存在"供应商锁定"⻛险。
c.缺点
1.技术⻔槛⾼:需要企业具备较强的AI⼯程化能⼒,包括GPU运维、分布式推理框架、显存优化等技术栈,普通中⼩企业难以独⽴驾驭。
隐形成本⾼:虽然模型权重免费,但⾼性能GPU服务器的采购、机房电费、专业运维⼈员的薪资构成了较⾼的隐性成本。
⽣态碎⽚化:市⾯上模型版本众多(Llama、Qwen、DeepSeek等),质量参差不⻬,选型试错需要耗费⼤量精⼒,且缺乏统⼀的技术标准。
d.典型代表

三.闭源⼤模型
1.概念
闭源⼤模型指的是模型仅通过API接⼝或付费界⾯提供服务,核⼼代码和权重完全保密,⽤⼾⽆法获取底层模型,只能调⽤功能。
2.优点
1.开箱即⽤:⽆需关注底层硬件和部署细节,注册账号获取API Key即可通过⼏⾏代码调⽤,极⼤降低了AI应⽤的⼊⻔⻔槛。
初期成本低:对于初创团队或验证阶段的项⽬,⽆需在硬件上投⼊巨额资本,采⽤按量付费模式,资⾦灵活性⾼。
性能天花板⾼:头部闭源⼚商(如OpenAI、Anthropic)通常拥有最顶尖的算⼒和未公开的算法技术,在多模态识别、复杂逻辑推理等任务上,通常保持着略微领先的"上限"性能。
维护成本低:由⼚商负责模型的版本更新、安全补丁和算⼒扩容,⽤⼾⽆需操⼼底层基础设施的稳定性。
3.缺点
数据合规⻛险:将业务数据通过API传输给第三⽅⼚商,可能⾯临数据出境、数据被⽤于模型训练、隐私泄露等合规红线。许多⼤型企业明令禁⽌将内部数据上传⾄闭源API。
⻓期成本不可控:⼀旦业务量上涨,API调⽤费⽤呈线性增⻓,成本可能远超⾃建开源模型。此外,⼚商随时可能涨价或更改计费策略。
缺乏定制能⼒:⽤⼾只能通过提⽰词或有限的微调接⼝来影响模型⾏为,⽆法针对专属业务逻辑进⾏深度定制,难以形成独特的竞争壁垒。
供应商锁定:业务深度依赖特定⼚商的API,⼀旦该⼚商服务中断、政策变更或停⽌服务,迁移成本极⾼,甚⾄导致业务停摆。
4.典型代表

5.典型场景选择
- 选开源:如果你的业务涉及核⼼数据、敏感信息,或者⻓期调⽤量⾮常⼤,且团队具备⼀定的⼯程能⼒。
- 选闭源:如果你是快速验证想法、开发轻量级应⽤,或者团队缺乏GPU或者运维能⼒,追求最短的上线时间。
⽬前随着DeepSeek等⾼性能开源模型的出现,两者的性能差距已⼤幅缩⼩,越来越多的企业开始采⽤"核⼼业务私有化部署开源模型 + ⾮核⼼业务调⽤闭源API"的混合架构。
四.开源社区
1.Hugging Face
简介:
Hugging face 起初是⼀家总部位于纽约的聊天机器⼈初创服务商,他们本来打算创业做聊天机器⼈,然后在github上开源了⼀个Transformers库,虽然聊天机器⼈业务没搞起来,但是他们的这个库在机器学习社区迅速⼤⽕起来。⽬前已经共享了超100,000个预训练模型,10,000个数据集,变成了机器学习界的github。
其之所以能够获得如此巨⼤的成功,⼀⽅⾯是让⼀些不懂⼤模型的,尤其是⼊⻔者也能快速⽤得上科研⼤⽜们训练出的超⽜模型。另⼀⽅⾯是,这种特别开放的⽂化和态度,以及利他利⼰的精神特别吸引⼈。huggingface上⾯很多业界⼤⽜也在使⽤和提交新模型,这样我们就是站在⼤⽜们的肩膀上⼯作,⽽不是从头开始。
官⽹
核⼼组成部分
- Models(模型库)
托管了数⼗万个预训练模型。从⼤名⿍⿍的 Llama、QWen、Gemma、DeepSeek、Stable
Diffusion 到各种细分的语⾳识别、图像分类模型,你⼏乎可以找到所有最尖端的开源 AI 权重。

可以看到各⼤公司已经⼊驻:
百度

阿⾥千问

腾讯

- Datasets(数据集)
包含了海量的⽂本、图像、⾳频数据集。对于研究⼈员来说,这⾥是训练和评估模型的"粮仓"。

- Spaces(应⽤空间)
Hugging Face的Space是⼀个免费的AI应⽤托管平台,允许开发者快速将机器学习模型部署为可交互的Web应⽤,⽆需管理服务器或处理部署复杂性,只需⼏分钟即可创建并分享可运⾏的AI演⽰。免费基础配置:默认提供2个CPU核⼼、16GB内存、50GB临时磁盘空间,完全免费使⽤,也可以按需付费使⽤GPU或者定制化硬件。
下⾯链接是⼀个在线体验的站点
https://huggingface.co/spaces/Sa-m/Auto-Translation

技术基⽯
Transformers 库,这是 Hugging Face 开源的 Python 库,⽬前已成为深度学习领域的"标配",
- 简化使⽤:它抽象了复杂的模型加载、训练和推理逻辑,通常只需要三⾏代码,就能加载⼀个顶级的预训练模型(如 Llama 3)进⾏⽂本⽣成。
- 统⼀接⼝:⽆论是 Google 的 BERT、Meta 的 Llama 还是 OpenAI 的 GPT 架构,在 Transformers库中都⽤⼏乎相同的 API 调⽤。
地址 : https://huggingface.co/docs/transformers/pipeline_tutorial
实战:使⽤Space搭建聊天机器⼈(ChatBot)
- 进⼊官⽹,点击右上⻆注册,输⼊邮箱、密码等信息完成注册

2. 点击头像创建Space

3. 设置名字,选择框架,我们选择Gradio,模板我们选择chatbot,点击创建后完成创建

4.可以看到是运⾏在docker 容器上

5. 运⾏⽇志的位置

6. 状态变为Running,我们点击APP就可以体验了

7. 使⽤Git可以管理对应的仓库,官⽅提供了操作命令

8. Files是我们容器⾥⾯的代码⽂件

9. app.py是核⼼的启动⽂件,我们点击去后⽀持在线编辑提交

10. 编辑提交后,容器会⾃动重启
修改下⾯代码
python
chatbot = gr.ChatInterface(
respond, # 核心:聊天响应的回调函数
additional_inputs=[ # 额外控制参数(显示在聊天框下方)
gr.Textbox( # 文本输入框:系统提示词
value="You are a friendly Chatbot.",
label="System message"
),
gr.Slider( # 滑块:控制最大输出长度
minimum=1, maximum=2048, value=512, step=1,
label="Max new tokens"
),
gr.Slider( # 滑块:控制随机性(温度)
minimum=0.1, maximum=4.0, value=0.7, step=0.1,
label="Temperature"
),
gr.Slider( # 滑块:控制采样范围(核采样)
minimum=0.1, maximum=1.0, value=0.95, step=0.05,
label="Top-p (nucleus sampling)"
),
],
)
11. 修改提交后这⾥重新构建重启了

12. 重启后可以看到,设置和内容都变了

13. 当然我们的这应⽤也可以通过api来调⽤,官⽅提供了具体的demo

14. 这个推理是消耗的Hugging Face的服务器的GPU,每个⽉有0.1$的免费额度。

2.魔搭社区(ModelScope)
简介
ModelScope(魔搭社区) 是⼀个由阿⾥巴巴达摩院联合中国计算机学会开源发展委员会发起的AI模型开源社区及⼀站式服务平台,致⼒于构建开放、⾼效、易⽤的⼈⼯智能模型⽣态系统。作为国内⾸个综合性AI模型共享服务平台,它为开发者、研究⼈员和企业⽤⼾提供从模型探索、训练优化到部署应⽤的全流程解决⽅案。平台汇聚了⾃然语⾔处理(NLP)、计算机视觉(CV)、语⾳识别、多模态等前沿领域的数百个优质预训练模型,⽀持昇腾、GPU等多种硬件平台,旨在降低AI模型使⽤⻔槛,推动⼤模型⽣态建设。⾃2022年发布以来,魔搭社区已成为国内最⼤的开源⼤模型社区之⼀,吸引了⼤量国内外优质模型和开发者参与。
简单理解 ModelScope 就是⽬前国内规模最⼤、模型最全的"中⽂版 Hugging Face"。
官⽹
核⼼组成部分
- a.模型库 (Model Hub)
社区的核⼼,汇集了海量的开源模型。它不仅包含Qwen、Kimi、DeepSeek等国内外主流的头部
模型,还有⼤量由开发者贡献的衍⽣模型,覆盖了视觉、语⾳、⾃然语⾔处理等多个领域**。**

- b.数据集 (Datasets)
提供了丰富的数据集资源,例如中⽂语料库、医学影像数据集等,⽤于⽀持模型的训练和微调。数
据集⽀持Git版本管理,⽅便开发者追踪和使⽤。

- c.创空间 (Studios)
⼀个专为AI应⽤⽽设的平台,开发者可以在这⾥创建、展⽰和分享⾃⼰的AI应⽤。⽬前,创空间已
沉淀了超过1万个创新AI应⽤,覆盖了跨模态交互、效率⼯具、科学智能等多个场景。

- d.Skills中⼼ (Skills Center)
⾯向Agentic智能(智能体)⽣态推出的新组件。它提供了封装好的复杂技能,开发者可以将其快
速集成到模型⼯作流中,从⽽提升AI智能体的开发效率和能⼒。

- e.MCP⼴场 (MCP Marketplace)
⼀个聚合了模型上下⽂协议(MCP)服务的平台。它为⼤模型提供了连接外部⼯具和数据的"统⼀
度量衡",例如⽀付宝⽀付能⼒、⾼德地图服务等。开发者可以通过MCP⼴场轻松为AI智能体
(Agent)集成各种能⼒,实现⼀键部署和开箱即⽤。

核⼼技术框架
1. ModelScope Library
这是ModelScope的基础核⼼库,践⾏了"模型即服务(MaaS)"的理念。它提供了⼀个统⼀的
pipeline 接⼝,让开发者可以⽤⼏⾏代码就轻松调⽤社区中数千个预训练模型,极⼤地简化了
AI模型的开发和部署流程。⽆论是图像、⽂本还是语⾳处理,都可以通过这个统⼀的框架快速上
⼿。
2. SWIFT
这是⼀个专注于⼤语⾔模型(LLM)全流程开发与部署的训练框架。它的全称是"ModelScope
Swift",旨在让开发者能够轻松完成⼤模型的微调、评测与上线。
- ⽀持模型:⽀持Qwen(通义千问)、ChatGLM、Baichuan等数⼗种主流⼤模型。
- 核⼼功能:提供轻量化微调(如QLoRA)、⼀键式Web UI(⽆需代码即可微调)、⽣产级服务导出等能⼒。
- 适⽤场景:特别适合需要对通义千问等模型进⾏定制化微调,并希望快速部署到⽣产环境的研究⼈员和企业⽤⼾
3. EvalScope
EvalScope 是魔搭社区倾⼒打造的模型评测与性能基准测试框架,为您的模型评估需求提供⼀站式解决⽅案。⽆论您在开发什么类型的模型,EvalScope 都能满⾜您的需求。
实战⼀:对话⽅式快速创建⼀个聊天机器⼈
注意:升级后该功能去除
- 进⼊官⽹(ModelScope),点击右上⻆登录/注册完成账号注册

2. 创建⼀个创空间,选择交互式创建

3. 选择对应的参数配置,⽐如我们可以配置模型

4. 右侧可以体验模型的效果

5.到达效果后选择去发布

6. 有个获取API Key,API Key就是⼀个钥匙,有了这个钥匙就有权利使⽤对应的模型了,当然费⽤信息都是绑定到API Key的。⽬前是基于阿⾥云的API key,我们进⼊帮助后有个API key,点击后可以进去阿⾥云API key 创建⻚⾯,就是我们介绍的阿⾥云百炼平台的API key。

7. 点击创建API key完成创建

8. 点击模型⽤量可以看到阿⾥云推送的免费额度,注意免费额度有⼀定的时效。

9. 回到魔搭社区,我们配置好API key,继续发布,我们配置好名字,然后点击创建

10. 可以看到空间正在发布

11. 点击空间内容就可以看到我们的应⽤已经发布了。

实战⼆:代码⽅式快速创建⼀个聊天机器⼈
1. 创建代码
cpp
import gradio as gr
from modelscope.pipelines import pipeline
from modelscope.utils.constant import Tasks
model_id = "Qwen/Qwen2.5-0.5B-Instruct"
pipe = pipeline(
task=Tasks.chat,
model=model_id,
device='cpu'
)
def respond(message, history):
tokenizer = pipe.tokenizer
prompt = tokenizer.apply_chat_template(
[{"role": "user", "content": message}],
tokenize=False,
add_generation_prompt=True
)
outputs = pipe(prompt, max_new_tokens=256)
return outputs["text"]
demo = gr.ChatInterface(
fn=respond,
title="极简聊天",
description="ChatBot机器人"
)
if __name__ == "__main__":
demo.launch()
2. 创建Python依赖信息
cpp
modelscope>=1.38.0
transformers==4.55.4
gradio==5.50.0
3. 创建创空间

4. 创建 requirements.txt 依赖文件
在项目根目录下创建 requirements.txt 文件,内容如下:
cpp
modelscope==1.38.0
transformers==4.55.4
gradio==5.50.0
torch>=2.0.0
说明 :
torch(PyTorch)是运行Qwen模型的底层框架,虽然代码里没显式写,但modelscope.pipelines依赖它,必须装上。
5. 创建 app.py 主程序文件
将你的代码保存为 app.py(注意:文件名必须是 app.py,ModelScope创空间默认入口):
python
import gradio as gr
from modelscope.pipelines import pipeline
from modelscope.utils.constant import Tasks
model_id = "Qwen/Qwen2.5-0.5B-Instruct"
pipe = pipeline(
task=Tasks.chat,
model=model_id,
device='cpu'
)
def respond(message, history):
tokenizer = pipe.tokenizer
prompt = tokenizer.apply_chat_template(
[{"role": "user", "content": message}],
tokenize=False,
add_generation_prompt=True
)
outputs = pipe(prompt, max_new_tokens=256)
return outputs["text"]
demo = gr.ChatInterface(
fn=respond,
title="极简聊天",
description="ChatBot机器人"
)
if __name__ == "__main__":
demo.launch()
6. 在创空间页面完成创建
| 字段 | 填写内容 |
|---|---|
| 英文名称 | qwen-chatbot-demo(或你自己取,如 my-first-chatbot) |
| 中文名称 | 极简聊天机器人(或留空) |
| 所有者 | maxhou222(已自动填好) |
| 是否公开 | 选 公开(如果想让他人能访问) |
| License | Apache License 2.0(保持默认) |
| 描述 | 填:基于Qwen2.5-0.5B-Instruct模型和Gradio搭建的极简聊天机器人,用于大模型实战课程演示。 |
| 封面图 | 可上传一张AI相关的图,或使用默认 |
然后点击 「创建」 按钮。
7. 上传代码并运行
创建成功后,进入空间详情页,按以下步骤操作:
方式一:网页直接编辑
点击文件标签页
点击 上传文件 ,分别上传
app.py和requirements.txt等待系统自动安装依赖并启动(首次启动约需3-5分钟)
方式二:Git 推送(推荐,更专业)
cpp
# 1. 克隆你的空间仓库
git clone https://www.modelscope.cn/maxhou222/qwen-chatbot-demo.git
# 2. 进入目录,放入 app.py 和 requirements.txt
cd qwen-chatbot-demo
cp /path/to/app.py .
cp /path/to/requirements.txt .
# 3. 提交并推送
git add .
git commit -m "init: 极简聊天机器人"
git push
启动后查看
等待构建完成后,点击 空间 标签页,就会看到可访问的聊天界面URL,类似:
cpp
https://www.modelscope.cn/studio/maxhou222/qwen-chatbot-demo
完整文件结构(部署时需要)
cpp
qwen-chatbot-demo/
├── app.py # 主程序(入口文件,必须有)
├── requirements.txt # Python依赖(必须有)
└── README.md # 可选,项目说明
实战三:Notebook创建和使⽤
1. 申请Notebook资源

2. 绑定阿⾥云账号

3. 进⼊Notebook

4. 新建Python⽂件输⼊下⾯简单推理代码
cpp
from modelscope.pipelines import pipeline
from modelscope.utils.constant import Tasks
# 指定模型ID
model_id = "Qwen/Qwen2.5-0.5B-Instruct"
# 创建文本生成pipeline,并明确指定使用CPU
pipe = pipeline(
task=Tasks.text_generation,
model=model_id,
device='cpu' # 关键参数:指定使用CPU进行推理
)
# 准备输入 prompt
prompt = "你好,请介绍一下你自己。"
# 执行推理
result = pipe(prompt, max_new_tokens=256, do_sample=True, temperature=0.7)
# 打印结果
print(result['text'])
5. 测试是否⼯作
cpp
python test.py
五.⼤语⾔模型⼯作原理
简单说,模型到底是怎么⽣成回复的?
1.核⼼原理
a.⼯作机制: 预测下⼀个词
抛开复杂的算法,其底层运⾏机制极其简单:给定前⽂,计算下⼀个最可能出现的词是什么。
我们代⼊具体的案例看下

可以看到⼤语⾔模型的能⼒就是每次根据输⼊的内容产⽣下⼀个词,我们输⼊的内容就是⼤家经常听到的提⽰词(Prompt),预测出来的下⼀个词就是Token.
2.完整的⼯作过程
⼤语⾔模型⽣成⼀个完整回答的过程,本质上是⼀个 "逐字预测、⽂字接⻰" 的过程。它并不是像⼈⼀样先想好整句话再写出来,⽽是根据已有的⽂本,⼀步⼀步地预测下⼀个最可能出现的 Token,直到认为回答已经完整。
举个例⼦
⽤⼾输⼊:"中国的⾸都是哪⾥?" 我们来看下模型怎么回复的?

可以看到每次LLM会预测出来下⼀个token,把下⼀个token拼接起来作为新的提⽰词喂给⼤模型,⼤模型根据新的提⽰词预测出来下⼀个token。这样循环往复直到遇到结束符。
DeepSeek的默认的终⽌符是 <|end▁of▁sentence|> 。不同模型的终⽌符不⼀样。
3.如何决定下⼀个token
⼤语⾔模型(LLM)决定下⼀个 token 的核⼼机制是:基于前⽂上下⽂,计算词表中所有 token 的概率分布,再通过采样策略选出⼀个 token 输出,循环往复。整个过程是⾃回归⽣成(AutoregressiveGeneration)。
⾃回归⽣成就是"⽤⾃⼰刚刚⽣成的结果,作为预测下⼀个结果的依据,像滚雪球⼀样,⼀步接⼀步地往外推"
