写在前面

欢迎大家关注Rocky的公众号:WeThinkIn
欢迎大家关注Rocky的知乎:Rocky Ding
《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群 (涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0
大家好,我是Rocky。
核心导读
MiniCPM5-2B 最容易被传播的故事,是一个 2B 级小模型在若干榜单上超过了更大的模型。这个说法有吸引力,却不是这次发布最值得研究的部分。
Rocky 更关心的是另一个事实:MiniCPM5-2B 没有依赖一种神秘的新架构。它仍然是标准的稠密因果语言模型,采用 LlamaForCausalLM,总参数量为 2,516,756,480,非词嵌入参数约 19.82 亿。真正把能力推上去的,是一条贯穿预训练、中期训练、SFT、强化学习、在策略蒸馏和部署适配的完整链路。
MiniCPM5-2B 的本质,不是证明"小模型已经打赢大模型",而是说明小模型竞争正在从参数规模竞争,转向数据、后训练、Agent 轨迹、训练基础设施与部署生态共同决定的系统效率竞争。
这也是"训练数据开源"比"某个榜单第一"更重要的原因。模型权重告诉我们结果是什么,分阶段检查点、训练数据和训练框架则让研究者有机会继续追问:能力究竟从哪里来?哪一步有效?代价是什么?结果能否复现?
一、先把结论说清楚:它证明的是参数效率,不是参数无效
从第三方榜单快照看,MiniCPM5-2B 的 Intelligence Index 为 23,在截图所列模型中处于第一位。

同一组快照里,MiniCPM5-2B 的 Agentic Index 为 20,也明显高于截图中的其他小尺寸模型。

GDPval-AA v2 的截图给出了 891 的原始展示分数,并把它放在一组模型的首位。

但这三张图只能支持一个有时间边界的结论:在截图对应的榜单版本、模型集合和评测配置下,MiniCPM5-2B 表现突出。 它们不能自动推出"2B 普遍超过 12B",更不能推出"参数量已经不重要"。榜单会更新,模型集合会变化,推理预算、工具配置和评分归一化方式也会改变。
还要特别注意,GDPval-AA v2 截图中的 891,与官方模型卡对比表中的 19.6,不是可以直接相等的两个数字。前者是第三方页面截图中的原始展示尺度,后者是模型卡比较表采用的归一化尺度。比较模型时,必须同时绑定:
- 同一个 benchmark 版本;
- 同一种分数定义;
- 同一组推理和工具配置;
- 同一时间截面的候选模型;
- 同一套聚合方法。
离开这些条件,数字就只剩传播价值,没有科学比较价值。
二、2B 到底有多小:先看模型结构,而不是看修辞
MiniCPM5-2B 的官方模型信息很朴素:
| 项目 | MiniCPM5-2B |
|---|---|
| 模型类型 | 稠密因果语言模型 |
| 架构 | 标准 LlamaForCausalLM |
| 总参数量 | 2,516,756,480 |
| 非词嵌入参数量 | 1,981,982,720 |
| Transformer 层数 | 42 |
| GQA 注意力头 | 16 个 Q 头 / 2 个 KV 头 |
| 原生上下文长度 | 131,072 tokens |
| 许可证 | Apache-2.0 |
因此,名称里的"2B"是尺寸类别,而不是精确参数计数。若把所有参数都算进去,它更接近 2.52B;若只看非词嵌入参数,则约为 1.98B。严谨讨论模型尺寸时,应说明采用哪一种口径。
GQA 的 16 个查询头共享 2 个键值头,对 KV Cache 很关键。粗略忽略其他维度后,相对于 16 个独立 KV 头的多头注意力,KV 头数量压缩比例为:
r K V = n K V n Q = 2 16 = 1 8 . r_{\mathrm{KV}}=\frac{n_{\mathrm{KV}}}{n_{\mathrm{Q}}}=\frac{2}{16}=\frac{1}{8}. rKV=nQnKV=162=81.
这不意味着端到端显存一定精确下降到八分之一,因为权重、激活、框架开销、批大小和量化方式仍会影响总占用;它说明在头维度相同的近似下,KV Cache 的头数项显著降低。对 128K 长上下文和本地 Agent 来说,这种结构选择直接影响"能不能跑"和"能以多大并发跑"。
更重要的是,MiniCPM5-2B 没有用自定义模型结构制造部署门槛。标准 LlamaForCausalLM 意味着主流推理引擎可以直接加载,不需要为模型格式维护专用 fork,也不以专用 kernel 作为基本前提。小模型的价值不只是权重小,还包括接入成本低。
三、"智能密度"可以观察,但不能被神化为物理定律
参数量与第三方 Intelligence Index 的快照形成了一张很醒目的 Pareto 图:MiniCPM5-2B 位于较高分、较低参数量区域。

我们可以定义一个仅用于同表比较的朴素指标:
D = S N , D=\frac{S}{N}, D=NS,
其中 S S S 是固定评测协议下的综合分数, N N N 是参数量。这个比值可以帮助观察"单位参数承载了多少被测能力",但它不是模型的内禀常数,更不是脱离评测集后仍成立的物理量。
原因很简单。 S S S 会受到题集、提示词、采样预算、工具、Harness、上下文长度、评分器甚至是否允许思维链的影响; N N N 也没有计入训练 token、教师模型、数据清洗、RL rollouts、推理时计算量和外部工具成本。只用 S / N S/N S/N 衡量系统效率,会漏掉大量被转移到训练阶段和运行时的成本。
所谓 Densing Law,更适合作为一个经验趋势来理解:随着数据治理、训练配方和后训练方法进步,同等参数规模的模型可以覆盖更强能力。MiniCPM5-2B 是这条趋势的一份新证据,却不是单个模型就能证明的普适定律。
四、官方对比表应该怎么读:平均分领先,不等于每项都赢
官方模型卡在一组 2B 和 4B 级开源模型中报告了 53.9 的平均分。这个数字在该比较集合中最高,第二名 Qwen3.5-4B 为 51.1。

MiniCPM5-2B 在若干项目上的官方报告值包括:
| 评测 | MiniCPM5-2B |
|---|---|
| LiveCodeBench v6 | 69.1 |
| AIME 2025 | 86.5 |
| AIME 2026 | 86.5 |
| BFCL v4 | 66.6 |
| SWE-bench Verified | 46.4 |
| SWE-bench Pro | 14.4 |
| Terminal-Bench v2.1 | 8.6 |
| GDPval-AA v2(表内归一化尺度) | 19.6 |
| 官方所选比较集平均分 | 53.9 |
这里至少有三条边界不能省略。
第一,53.9 是官方选定比较集合内的平均分,不是跨所有模型、所有尺寸和所有任务的全局结论。
第二,MiniCPM5-2B 并非每一项 Agent 评测都领先。例如同表中的 Qwen3.5-4B 在 SWE-bench Pro 和 Terminal-Bench v2.1 上分别为 28.2 和 25.8,高于 MiniCPM5-2B 的 14.4 和 8.6。这说明"Agent 能力"不是一个单一标量。函数调用、浏览器操作、仓库修复、终端任务和长程规划,依赖的能力结构并不相同。
第三,模型卡明确说明:带剑标记的分数来自 Artificial Analysis 官方发布,其余比较分数由团队内部复现。内部复现不是无效证据,但它与独立第三方复现属于不同证据等级。最稳妥的表达不是"全部断层第一",而是"在官方公开的比较设置中体现出很高的参数效率,并在多个代码、数学、工具和 Agent 任务上具有竞争力"。
五、真正的技术主线:Base、Mid-training、SFT、RL、OPD
MiniCPM5-2B 的训练流程可以分成三个大阶段,后训练又可以继续拆成三步:
Base Training → Mid-training → SFT → RL → OPD . \text{Base Training} \rightarrow \text{Mid-training} \rightarrow \text{SFT} \rightarrow \text{RL} \rightarrow \text{OPD}. Base Training→Mid-training→SFT→RL→OPD.

Base Training 负责建立语言建模底座与训练稳定性,包含稳定训练和衰减训练;Mid-training 让模型进一步适配目标数据分布、强化代码、数学、长上下文等目标能力;SFT 把通用生成能力整理成可交互、可遵循指令的行为;RL 针对数学、代码、Agent、写作等领域分别强化;最后 OPD 把多个专家模型的能力重新合并到一个发布模型。
这条链路解释了为什么"只是 2B"会成为误导。最终参数量确实只有 2B 级,但它背后使用了大量数据治理、教师信号、在线采样和专家训练。推理时的小,不等于训练过程简单;端侧成本低,也不等于能力是低成本自然长出来的。
六、UltraX 与分层数据治理:小模型更不能浪费容量
MiniCPM5-2B 同期公开的数据资产包括 Ultra-FineWeb、Ultra-FineWeb-L3、UltraX、UltraData-Code、UltraData-Math、UltraData-SFT-Agent-2609 和 UltraData-RL-2609。官方介绍中,Agent SFT 数据约 50 万条,RL 数据超过 8 万条。

UltraX 的核心问题是:当网络语料规模已经足够大,继续堆原始 token 是否仍是最有效路径?对于小模型,答案尤其可能是否定的。模型容量有限,低质量、重复、模板化、缺乏推理结构的数据,不只是"没帮助",还会占用宝贵的表示容量和训练预算。
数据治理可以粗略写成一个效用问题:
max D ′ E x ∼ D ′ U ( x ) s.t. C o s t ( D ′ ) ≤ B , \max_{\mathcal{D}'}\; \mathbb{E}_{x\sim\mathcal{D}'}U(x) \quad \text{s.t.}\quad \mathrm{Cost}(\mathcal{D}')\le B, D′maxEx∼D′U(x)s.t.Cost(D′)≤B,
其中 U ( x ) U(x) U(x) 不是一个固定可知的"数据质量真值",而是样本对目标能力的预期贡献, B B B 是清洗、编辑和训练预算。分层数据管理的意义,是让不同质量等级、领域和难度的数据进入不同阶段,而不是把所有 token 当成同质燃料。
Rocky 认为,小模型时代最重要的数据观念变化是:数据不再只是规模变量,而是容量分配机制。 大模型可以用冗余容量消化一部分噪声,小模型的每一层、每一个注意力头都更珍贵,因此更依赖样本密度、课程顺序和目标能力之间的匹配。
不过,"数据开源"也不能被理解为已经完整复现训练。公开数据集仍需继续核对版本、去重规则、采样权重、混合比例、训练顺序、过滤器和未公开数据边界。数据可见性提高了可审计性,但从可下载到可复现,中间还有训练配置和算力鸿沟。
七、400B tokens 的 SFT:这里的"深度思考"不是一句提示词
官方模型卡称,后训练首先使用 400B tokens 的 deep-thinking SFT,建立深度思考和通用对话能力。这一规模提示我们:MiniCPM5-2B 的推理能力并不是只靠少量高质量问答做出来的,而是把 SFT 当成一个大规模能力塑形阶段。
SFT 的基本目标仍然是条件语言建模:
L S F T ( θ ) = − ∑ t = 1 T log p θ ( y t ∣ x , y < t ) . \mathcal{L}{\mathrm{SFT}}(\theta) =-\sum{t=1}^{T}\log p_{\theta}(y_t\mid x,y_{<t}). LSFT(θ)=−t=1∑Tlogpθ(yt∣x,y<t).
真正决定效果的不是公式本身,而是 ( x , y ) (x,y) (x,y) 的构成:任务是否需要多步推理,工具轨迹是否正确,失败路径是否被过滤,答案是否包含可验证中间状态,长上下文样本是否真的需要利用远距离信息。
Agent SFT 的 50 万样本也不能只看数量。一个高价值 Agent 样本通常至少包含目标、环境状态、可用工具、动作、观察、错误恢复和终止条件。若训练数据只有"用户问题 + 最终答案",模型学到的是回答;若包含可执行且经验证的轨迹,模型才有机会学到行动策略。
八、RL 的作用:把"会生成"推向"能通过验证"
MiniCPM5-2B 为数学、代码、Agent、写作等领域训练专门的 RL 教师。官方说明采用 JustRL II 中的 critic-based 算法以改善稳定性。对可验证任务,一个典型的 RL 目标可抽象为:
J ( θ ) = E y ∼ π θ ( ⋅ ∣ x ) R ( x , y ) − β D K L ( π θ ( ⋅ ∣ x ) ∥ π r e f ( ⋅ ∣ x ) ) . J(\theta)= \mathbb{E}{y\sim\pi\theta(\cdot\mid x)}R(x,y) -\beta D_{\mathrm{KL}}\!\left( \pi_\theta(\cdot\mid x)\,\|\,\pi_{\mathrm{ref}}(\cdot\mid x) \right). J(θ)=Ey∼πθ(⋅∣x)R(x,y)−βDKL(πθ(⋅∣x)∥πref(⋅∣x)).
第一项鼓励通过单元测试、数学验证器、工具执行结果或任务评分器获得更高奖励;第二项限制策略偏离参考模型过远。没有约束,模型可能利用奖励漏洞;约束太强,模型又学不到新的策略。critic 的价值在于估计动作或 token 对最终回报的贡献,降低只依赖稀疏终局奖励带来的方差。
对 Agent 而言,RL 最难的往往不是公式,而是环境。工具必须真实可调用,观察必须回传,执行错误必须保留,奖励要区分"看起来像完成"和"真的完成"。如果环境只检查最后一段自然语言,模型就容易学会写一份像成功报告的答案;如果环境检查文件、测试、页面状态和外部副作用,训练信号才更接近真实任务。
九、OPD 的本质:把 16 个 RL 专家重新压回一个模型
单独训练领域专家容易,难的是把它们合并后不互相伤害。数学专家、代码专家、Agent 专家和写作专家可能在相同提示上给出不同分布,简单权重平均或顺序微调容易发生能力干扰。
MiniCPM5-2B 的 OPD(On-Policy Distillation,在策略蒸馏)使用 16 个 RL 专家模型,其中包含 5 个 Agent 专家。官方描述是在学生生成的响应位置上,计算学生与教师全词表分布的反向 KL,并把它作为 advantage 估计。
对某个位置 t t t,可以把这种信号写成:
A t O P D = − D K L ( p θ ( ⋅ ∣ s t ) ∥ p T ( ⋅ ∣ s t ) ) , A_t^{\mathrm{OPD}} =-D_{\mathrm{KL}}\!\left( p_\theta(\cdot\mid s_t) \,\|\, p_T(\cdot\mid s_t) \right), AtOPD=−DKL(pθ(⋅∣st)∥pT(⋅∣st)),
其中 p θ p_\theta pθ 是学生分布, p T p_T pT 是对应领域教师分布, s t s_t st 是学生在策略生成到第 t t t 个位置时的状态。展开反向 KL:
D K L ( p θ ∥ p T ) = ∑ v ∈ V p θ ( v ∣ s t ) log p θ ( v ∣ s t ) p T ( v ∣ s t ) . D_{\mathrm{KL}}(p_\theta\|p_T) =\sum_{v\in\mathcal{V}}p_\theta(v\mid s_t) \log\frac{p_\theta(v\mid s_t)}{p_T(v\mid s_t)}. DKL(pθ∥pT)=v∈V∑pθ(v∣st)logpT(v∣st)pθ(v∣st).
它不是只告诉学生"最终答案对不对",而是在每个响应位置上比较整个词表分布。学生在自己真正访问到的状态上学习,因此比只蒸馏教师离线答案更贴近部署时分布;全词表信号也比单个采样 token 更稠密。

官方报告称,在图中所列评测上,RL + OPD 让推理与通用能力平均增加 10.96 分,让 Agent 能力平均增加 6.96 分。这个结果支持"后训练贡献显著",但仍属于官方消融结果;要确认收益能否跨训练栈复现,还需要公开超参数、训练日志、随机种子、教师选择规则和第三方重复实验。
十、为什么还要开源 Meshy:模型结果背后还有 RL 生产系统
如果把强化学习理解成一个 loss.backward(),就会低估 Agent RL 的工程复杂度。一次训练至少涉及推理服务、rollout、奖励计算、训练器、教师模型、轨迹存储和权重同步。同步训练容易让 GPU 在等待中空转,异步训练又会引入策略陈旧和数据一致性问题。
Meshy 把这些角色建模成独立服务,通过 TransferQueue 传递样本、权重、信号和 GPU 所有权;拓扑由每个进程根据声明式 recipe 在本地推导。官方实现基于 SGLang 与 TorchTitan,不使用 Ray,也没有一个负责转发所有 RPC 和张量的中心控制器。

这套设计的关键不是"微服务"三个字,而是把 RL 中的数据依赖显式化:
Prompt → Rollout → Reward / Teacher → Training → New Weights → Rollout . \text{Prompt} \rightarrow \text{Rollout} \rightarrow \text{Reward / Teacher} \rightarrow \text{Training} \rightarrow \text{New Weights} \rightarrow \text{Rollout}. Prompt→Rollout→Reward / Teacher→Training→New Weights→Rollout.
Meshy 用 pacing window 控制 rollout 可以领先训练多少批次,从同一组服务组合出 on-policy、bounded off-policy 和 fully asynchronous 三种配方。窗口越小,策略更新更"新鲜",但流水线等待可能更多;窗口越大,设备利用率更高,训练样本与当前策略的偏差也可能变大。
因此,MiniCPM5-2B 的开放价值不应只看模型权重。数据让外界研究样本结构,Base、Midtrain、SFT 和 Final 检查点让外界做阶段消融,Meshy 则把训练系统本身暴露出来。三者结合,才接近一条可研究的能力生成链。
十一、Agent 能力为什么能进入 2B:能力被"预装"进权重
大模型 Agent 常把复杂性放在推理时:更长思维链、更多采样、更多反思、更多工具重试。小模型若照搬这条路线,虽然权重更小,却可能因长序列和频繁调用失去延迟与能耗优势。
MiniCPM5-2B 的路线更像是把一部分推理时搜索提前支付到训练阶段:
- 用分层数据减少低价值 token 对容量的占用;
- 用大规模 SFT 固化推理与对话模式;
- 用 Agent 轨迹训练工具选择和状态推进;
- 用领域 RL 教师探索更优策略;
- 用 OPD 把专家能力压回一个稠密学生模型;
- 用标准架构和量化格式降低落地摩擦。
这并没有消灭计算,而是改变了计算发生的位置。训练侧付出更大成本,换取推理侧更小的模型、更低的传输成本和更可控的本地运行。
对于高频部署,这种交换可能很划算。若训练成本为 C t r a i n C_{\mathrm{train}} Ctrain,每次推理相对大模型节省 Δ c \Delta c Δc,调用次数为 M M M,那么只有在
M ⋅ Δ c > C t r a i n + C a d a p t M\cdot \Delta c > C_{\mathrm{train}}+C_{\mathrm{adapt}} M⋅Δc>Ctrain+Cadapt
时,系统总成本优势才真正成立。 C a d a p t C_{\mathrm{adapt}} Cadapt 还包括量化、评测、端侧适配和维护成本。企业选择小模型,不能只比较下载文件大小,而要比较完整生命周期成本。
十二、部署生态比单次跑通更重要
官方已经提供 Final、Base、Midtrain、SFT、GGUF、MLX、GPTQ 和 DSpark 等版本。vLLM 与 SGLang 可以提供 OpenAI 兼容服务;GGUF 对应 llama.cpp、Ollama 和 LM Studio;MLX 版本面向 Apple Silicon;FlagOS 列出了 9 类芯片架构的适配。
工具调用方面,MiniCPM5-2B 生成 XML 风格的工具调用,SGLang 内置的 minicpm5 parser 会把它转换成 OpenAI 兼容的 tool_calls。这揭示了一个容易被忽略的分层:
- 模型层负责产生结构化意图;
- parser 层负责协议转换;
- Harness 负责参数校验、权限、执行与错误反馈;
- 工具和环境负责产生真实状态变化。
模型在 BFCL 上得分高,不代表实际产品中的工具链就天然可靠。参数 schema、超时、幂等性、权限边界、失败恢复和观察压缩,仍然属于 Agent 系统工程。
标准架构的意义正在这里体现。一个模型如果榜单很高,却只能在特定 fork、特定 kernel 和特定硬件上运行,它的工程价值会被集成成本打折。MiniCPM5-2B 把"模型能力"和"可部署性"同时放进产品定义,这是端侧 Agent 更现实的方向。
十三、端侧 Agent 的真正价值:隐私、延迟、个性化与离线可用
端侧并不意味着所有任务都应该完全本地化。它更像一种分层调度:高频、隐私敏感、低延迟任务由本地模型处理;需要更强通用知识或大规模搜索的任务,再升级到云端模型。
MiniCPM5-2B 适合探索的场景包括:
- 本地文件检索、摘要与结构化整理;
- IDE 中的代码导航、局部修改和工具编排;
- 设备侧个人偏好与长期记忆处理;
- 弱网或离线环境中的基础助理;
- 企业内网中的受限工具调用;
- 云端大模型之前的意图识别、路由与结果校验。
端侧的隐私收益也不是自动成立。只要 Agent 能调用 shell、浏览器、文件系统或企业 API,就仍需最小权限、审计日志、敏感信息脱敏和人工确认。权重运行在本地,只解决"输入是否必须发往第三方服务"的一部分问题,并不等于整个 Agent 已经安全。
十四、五个最容易被误读的结论
误读一:2B 已经全面超过 12B
正确结论是:MiniCPM5-2B 在特定比较集和若干任务上体现出很高参数效率。任务分布变化后,大模型的知识容量、鲁棒性和复杂推理上限仍可能占优。
误读二:榜单平均分高,所以每种 Agent 都强
Agent 是多维能力集合。SWE-bench Pro、Terminal-Bench、BFCL 和 GDPval 测量的对象不同,平均分会掩盖短板。部署前必须用自己的工具、数据和失败条件重测。
误读三:标准 Llama 架构说明技术没有创新
架构创新只是模型创新的一部分。MiniCPM5-2B 的主要技术变量集中在数据治理、训练阶段设计、RL 教师、OPD 合并、训练基础设施和部署生态。标准架构反而降低了复现与迁移成本。
误读四:数据开源等于训练完全可复现
数据集、权重和代码显著提高了透明度,但完整复现仍需要数据混合比例、过滤规则、超参数、训练日志、算力配置和评测环境。开源是可复现的必要条件之一,不是充分条件。
误读五:本地运行等于私密、安全、免费
本地运行仍有硬件、电力、维护与安全成本。Agent 获得工具权限后,也可能误删文件、泄露凭证或执行错误操作。模型小,只降低了一部分基础设施门槛。
十五、如何严谨复测 MiniCPM5-2B
如果要判断它是否适合自己的 Agent 系统,建议把复测分成四层。
第一层是纯模型能力。固定提示模板、采样参数、最大输出长度和推理后端,分别测试代码、数学、长上下文和结构化输出。
第二层是工具协议。检查 XML 工具调用经 parser 转换后的 schema 合法率、参数正确率、工具选择准确率和无效调用率。
第三层是端到端任务。让模型在真实沙箱里完成文件修改、测试执行、网页操作和失败恢复,以最终环境状态而不是自述成功作为奖励。
第四层是系统成本。记录首 token 延迟、输出吞吐、峰值内存、KV Cache 增长、能耗、并发能力和长任务总时长。
一份可比较的实验记录至少应包含:
- 模型权重的精确版本与校验值;
- BF16、GGUF、GPTQ 或 MLX 等量化格式;
- vLLM、SGLang、llama.cpp 等后端及版本;
- chat template、tool parser 与 system prompt;
- temperature、top-p、最大 token 与思考模式;
- GPU、CPU、内存和操作系统;
- 任务集版本、成功判定器与重试策略;
- 是否使用工具、Harness、反思或多次采样。
只有这些条件足够透明,"2B 与 4B、8B、12B 的比较"才具有工程决策价值。
十六、Rocky 的判断:小模型竞争进入"训练系统开源"阶段
过去谈开源模型,行业往往只问三个问题:权重有没有放出来,许可证是否宽松,能不能本地部署。MiniCPM5-2B 往前走了一步:它同时提供不同训练阶段的检查点、分层数据资产、Agent SFT/RL 数据、部署配方,以及与强化学习相关的 Meshy 系统。
这会改变小模型的竞争方式。
第一,模型公司的护城河不再只是参数和架构,而是持续生产高密度数据、可验证轨迹和稳定 RL 教师的能力。
第二,开源竞争会从"给权重"走向"给研究路径"。Base、Midtrain、SFT、RL+OPD 的阶段产物,让社区能够研究能力增益与遗忘,而不是只能面对一个不可分解的最终模型。
第三,端侧 Agent 会推动云边协同。2B 模型不必替代所有大模型,只要能稳定承担路由、检索、工具编排、隐私任务和局部代码工作,就可能显著降低系统平均成本。
第四,未来真正稀缺的不是一次榜单峰值,而是跨版本保持数据、训练、评测和部署闭环的能力。参数效率必须能够被连续生产,才会形成产品优势。
所以,MiniCPM5-2B 最值得记住的不是"一个参数抵两个"这类口号,而是一个更朴素也更重要的判断:
当架构保持标准、参数保持克制,模型能力的上限越来越取决于训练系统能否把高质量数据、可验证反馈、领域专家和部署约束组织成一个闭环。
这不是参数规模竞争的终点,而是模型工业化进入下一阶段的起点。
推荐阅读
Rocky一直在运营技术交流群(WeThinkIn-技术交流群),这个群的初心主要聚焦于技术话题的讨论与学习,包括但不限于算法、开发、竞赛、科研以及工作求职等。群里有很多人工智能行业的大牛,欢迎大家入群一起学习交流~(请添加小助手微信Jarvis8866,拉你进群~)
1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:
深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:
深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
Rocky对AIGC时代"中场时刻"之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:
入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
5. 深入浅出完整解析DeepSeek系列核心基础知识
Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:
6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识
Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion(SD)核心基础知识
9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:
深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
对于AIGC时代中的"ResNet"------LoRA模型,Rocky进行了深入浅出的全面讲解:
深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
11. 深入浅出完整解析ControlNet核心基础知识
AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。
ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中:
12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析:
深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
13. 深入浅出完整解析AIGC时代Transformer核心基础知识
在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统"AI江湖"之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:
深入浅出完整解析AIGC时代Transformer核心基础知识
14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等 。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的"PyTorch"、Stable Diffusion WebUI就是AIGC时代的"TensorFlow"、Diffusers就是AIGC时代的"Caffe":
深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?
Don't worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:
手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!
16. AIGC产业的深度思考与分析
2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。
Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。
那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:
深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)
17. AI算法工程师的独孤九剑秘籍
为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:
【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)
18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识
GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的"得力助手",广泛活跃于AlGC图像创作的产品与工作流中:
深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识