Agent 技术摘要 03 —— 基座模型、推理模型、Flash、联邦学习、分布式机器学习

系列为笔者在实习过程中的所见所闻记录,内容为技术摘要,旨在提供关于Agent领域相关技术名词的通俗和简要介绍,详细内容暂不展开,供同在该领域进修的童鞋们参考。

01 基座模型 VS 推理模型

基座模型是"脱口而出"的快思考,推理模型是"打草稿再回答"的慢思考。

维度 基座模型 推理模型
训练目标 预测下一个词 学会推理步骤,通过强化学习奖励正确答案
回答方式 直接输出最终答案 先输出一长串思维链,再输出答案
计算资源分配 训练时烧钱,推理时便宜 训练烧钱,推理时也极其烧钱
自我纠错能力 几乎没有 强
类型 代表模型 擅长场景
基座/通用对话模型 GPT-4o, DeepSeek-V3, Qwen-Max, Claude 3.5 Sonnet 日常聊天、写邮件、翻译、写普通代码、总结文章
推理模型 OpenAI o1 / o3, DeepSeek-R1, Claude 3.5 数学竞赛题、复杂逻辑推导、底层代码架构设计、科研论文分析

大家发现,单纯把基座模型做得更大,喂更多的数据,它的逻辑推理能力并没有成正比提升,它依然会在简单的脑筋急转弯或者复杂的数学题上翻车。

于是,行业找到了新方向,Test-Time Compute(推理时计算) ,既然模型脱口而出 容易错,那我就逼它在回答前多花点时间思考,多生成一些中间 token,实验证明,只要给模型足够的时间打草稿,它的智商会产生涌现式的飞跃,能解出以前绝对解不出的奥数题和编程难题。

这就是为什么 DeepSeek-R1 和 OpenAI o1 震动了整个硅谷------它们证明了让 AI 学会思考 比让 AI 死记硬背更有前途。

02 Flash

Flash 就是模型家族里的极速、便宜、性价比款,主打一个天下武功,唯快不破。

  • 参数变少了: 旗舰模型可能有 1000 亿个参数,而 Flash 模型可能只有 70 亿或 140 亿个,参数少,计算量就小,速度自然就快,占用的显卡显存也少。
  • MoE 架构: 想象一个有 100 个医生的大医院,普通模型,你去看个感冒,100 个医生全跑出来给你会诊,MoE 模型,门口有个导诊台,一看你是感冒,只叫醒 2 个内科医生来给你看病,其他 98 个医生在睡觉,虽然医院很大,但每次看病的计算量极小,速度飞快!
  • 量化技术: 把模型里高精度的数字(比如 3.1415926)压缩成低精度的(比如 3.14),虽然损失了一丁点智商,但体积和计算量直接减半。

03 联邦学习

联邦学习(Federated Learning,FL)是一种协作训练范式,即多个参与方把原始训练数据保留在本地,通过交换模型更新等信息,共同训练模型。

以经典 FedAvg 为例,假设三家公司想共同训练客服模型,但各自的对话数据不能集中存储。它们可以运行以下循环:

  • 下发模型:协调服务器把同一个全局模型参数发给本轮参与方
  • 本地训练:每家公司用自己的数据执行若干步梯度下降,得到本地参数
  • 上传更新:参与方上传模型参数或参数增量,原始训练样本保留在本地
  • 聚合更新:服务器按规则合并,得到下一轮全局模型,再重复上述过程

FedAvg 的典型聚合公式是:

θt+1=∑k∈Stnk∑j∈Stnjθt+1(k) \theta_{t+1} = \sum_{k\in S_t} \frac{n_k}{\sum_{j\in S_t} n_j} \theta_{t+1}^{(k)} θt+1=k∈St∑∑j∈Stnjnkθt+1(k)

其中,S_t是本轮参与方集合,n_k 是参与方 k 的本地样本数,直观上,就是对从同一个全局模型出发,分别经过本地训练的模型参数,按数据量做加权平均,共同的初始化、参数结构和训练协议很重要。

一个难点是 Non-IID(非独立同分布),例如,一家公司主要处理金融客服,另一家主要处理电商客服,各自的本地更新可能朝不同方向优化。另一个难点是安全和隐私,模型更新仍然携带训练数据的信息,在特定条件下,攻击者可以利用共享梯度重建部分训练样本。因此,隐私要求较高的联邦系统通常还需要结合:

  • 安全聚合(Secure Aggregation):让服务器获得多个参与方更新的聚合结果,同时隐藏单个参与方的更新
  • 差分隐私(Differential Privacy):通过裁剪、加噪和隐私预算管理,限制单条记录或单个用户对可观察结果的影响

04 分布式机器学习

分布式机器学习(Distributed Machine Learning)指把机器学习的计算和存储分配到多个计算节点上,通过通信与协调共同完成任务。

在训练语境中,通常就是让多张 GPU、多台服务器协同训练模型。

① 数据并行

以 4 张 GPU 训练同一个模型为例,在各卡样本数相同、损失取样本平均的简单情形下:

g=14∑k=14gk,θt+1=θt−ηg g=\frac{1}{4}\sum_{k=1}^{4}g_k, \qquad \theta_{t+1}=\theta_t-\eta g g=41k=1∑4gk,θt+1=θt−ηg

其中 g_k是第 k 张卡计算的梯度,eta 是学习率。

② 模型并行

大模型训练中,显存不仅用于存储参数,还要存储梯度、优化器状态和中间激活。

Ⅰ张量并行:TP,拆分同一层内部的张量及计算,比如一个大型矩阵乘法由多张 GPU 共同完成。

Ⅱ 流水线并行:PP,将不同层分配到不同设备,比如GPU 0 计算前几层,再把激活传给 GPU 1。

Ⅲ 状态分片:FSDP,分片存储参数、梯度和优化器状态,比如每张卡只常驻部分状态,计算时按需通信获取参数。

相关推荐
reasonsummer1 小时前
【办公类-200-01】20260820课题的查重报告比例(AI写结题报告+人工插图+PaperYY免费查重(标红文字修改:口语化)+知网查重结果对比)
人工智能·aigc·知网查重·paperyy
xianghongtao01161 小时前
Deloitte_2026_GenZ_Millennial_CSDN_解读
人工智能
天远数科1 小时前
零信任架构实战:基于天远股权穿透构建自动化供应商准入合规网关
大数据·人工智能·架构·自动化
KKKLWX1 小时前
@电气自动化人,2026年湖北省厅电子信息、计算机、自动化、电气职称申报开始
人工智能
mit6.8241 小时前
古法编程->用Agent
人工智能
一木 之林1 小时前
DDPM 扩散模型原理详解
人工智能·深度学习
科技强国、科技兴国1 小时前
《思维机器:英伟达如何开启人工智能革命》
人工智能
yl45301 小时前
水下清淤机器人设备制造商哪家靠谱
大数据·人工智能·机器人
桃西西呀1 小时前
LangChain 之三:模型与消息抽象
人工智能·langchain·llm