系列为笔者在实习过程中的所见所闻记录,内容为技术摘要,旨在提供关于Agent领域相关技术名词的通俗和简要介绍,详细内容暂不展开,供同在该领域进修的童鞋们参考。
01 基座模型 VS 推理模型
基座模型是"脱口而出"的快思考,推理模型是"打草稿再回答"的慢思考。
| 维度 | 基座模型 | 推理模型 |
|---|---|---|
| 训练目标 | 预测下一个词 | 学会推理步骤,通过强化学习奖励正确答案 |
| 回答方式 | 直接输出最终答案 | 先输出一长串思维链,再输出答案 |
| 计算资源分配 | 训练时烧钱,推理时便宜 | 训练烧钱,推理时也极其烧钱 |
| 自我纠错能力 | 几乎没有 | 强 |
| 类型 | 代表模型 | 擅长场景 |
|---|---|---|
| 基座/通用对话模型 | GPT-4o, DeepSeek-V3, Qwen-Max, Claude 3.5 Sonnet | 日常聊天、写邮件、翻译、写普通代码、总结文章 |
| 推理模型 | OpenAI o1 / o3, DeepSeek-R1, Claude 3.5 | 数学竞赛题、复杂逻辑推导、底层代码架构设计、科研论文分析 |
大家发现,单纯把基座模型做得更大,喂更多的数据,它的逻辑推理能力并没有成正比提升,它依然会在简单的脑筋急转弯或者复杂的数学题上翻车。
于是,行业找到了新方向,Test-Time Compute(推理时计算) ,既然模型脱口而出 容易错,那我就逼它在回答前多花点时间思考,多生成一些中间 token,实验证明,只要给模型足够的时间打草稿,它的智商会产生涌现式的飞跃,能解出以前绝对解不出的奥数题和编程难题。
这就是为什么 DeepSeek-R1 和 OpenAI o1 震动了整个硅谷------它们证明了让 AI 学会思考 比让 AI 死记硬背更有前途。
02 Flash
Flash 就是模型家族里的极速、便宜、性价比款,主打一个天下武功,唯快不破。
- 参数变少了: 旗舰模型可能有 1000 亿个参数,而 Flash 模型可能只有 70 亿或 140 亿个,参数少,计算量就小,速度自然就快,占用的显卡显存也少。
- MoE 架构: 想象一个有 100 个医生的大医院,普通模型,你去看个感冒,100 个医生全跑出来给你会诊,MoE 模型,门口有个导诊台,一看你是感冒,只叫醒 2 个内科医生来给你看病,其他 98 个医生在睡觉,虽然医院很大,但每次看病的计算量极小,速度飞快!
- 量化技术: 把模型里高精度的数字(比如 3.1415926)压缩成低精度的(比如 3.14),虽然损失了一丁点智商,但体积和计算量直接减半。
03 联邦学习
联邦学习(Federated Learning,FL)是一种协作训练范式,即多个参与方把原始训练数据保留在本地,通过交换模型更新等信息,共同训练模型。
以经典 FedAvg 为例,假设三家公司想共同训练客服模型,但各自的对话数据不能集中存储。它们可以运行以下循环:
- 下发模型:协调服务器把同一个全局模型参数发给本轮参与方
- 本地训练:每家公司用自己的数据执行若干步梯度下降,得到本地参数
- 上传更新:参与方上传模型参数或参数增量,原始训练样本保留在本地
- 聚合更新:服务器按规则合并,得到下一轮全局模型,再重复上述过程
FedAvg 的典型聚合公式是:
θt+1=∑k∈Stnk∑j∈Stnjθt+1(k) \theta_{t+1} = \sum_{k\in S_t} \frac{n_k}{\sum_{j\in S_t} n_j} \theta_{t+1}^{(k)} θt+1=k∈St∑∑j∈Stnjnkθt+1(k)
其中,S_t是本轮参与方集合,n_k 是参与方 k 的本地样本数,直观上,就是对从同一个全局模型出发,分别经过本地训练的模型参数,按数据量做加权平均,共同的初始化、参数结构和训练协议很重要。
一个难点是 Non-IID(非独立同分布),例如,一家公司主要处理金融客服,另一家主要处理电商客服,各自的本地更新可能朝不同方向优化。另一个难点是安全和隐私,模型更新仍然携带训练数据的信息,在特定条件下,攻击者可以利用共享梯度重建部分训练样本。因此,隐私要求较高的联邦系统通常还需要结合:
- 安全聚合(Secure Aggregation):让服务器获得多个参与方更新的聚合结果,同时隐藏单个参与方的更新
- 差分隐私(Differential Privacy):通过裁剪、加噪和隐私预算管理,限制单条记录或单个用户对可观察结果的影响
04 分布式机器学习
分布式机器学习(Distributed Machine Learning)指把机器学习的计算和存储分配到多个计算节点上,通过通信与协调共同完成任务。
在训练语境中,通常就是让多张 GPU、多台服务器协同训练模型。
① 数据并行
以 4 张 GPU 训练同一个模型为例,在各卡样本数相同、损失取样本平均的简单情形下:
g=14∑k=14gk,θt+1=θt−ηg g=\frac{1}{4}\sum_{k=1}^{4}g_k, \qquad \theta_{t+1}=\theta_t-\eta g g=41k=1∑4gk,θt+1=θt−ηg
其中 g_k是第 k 张卡计算的梯度,eta 是学习率。
② 模型并行
大模型训练中,显存不仅用于存储参数,还要存储梯度、优化器状态和中间激活。
Ⅰ张量并行:TP,拆分同一层内部的张量及计算,比如一个大型矩阵乘法由多张 GPU 共同完成。
Ⅱ 流水线并行:PP,将不同层分配到不同设备,比如GPU 0 计算前几层,再把激活传给 GPU 1。
Ⅲ 状态分片:FSDP,分片存储参数、梯度和优化器状态,比如每张卡只常驻部分状态,计算时按需通信获取参数。