2025 大模型的发展

AI的2025关键进展

从Karpathy的视角来看

1. 模型训练方法

经典的模型获取范式(对数据和算力的强依赖,典型地通过预训练-- 监督微调-- RLHF三个步骤, 2020-2025年初)-->由于数据无法达到像算力的增长水平,所以寻找新的模型能力提升变得尤为关键

  • 思路1: 获取高质量数据 > 获取海量数据()
  • 思路2:更有效的训练方法(摆脱数据强依赖),典型的就是DRPO,泛化来讲就是RLVR(Reinforcement Learning from Verifiable Rewards,RLVR)
  • 关键创新来自于让模型在可自动验证环境中接受强化学习训练,例如数据题、代码或者逻辑题等。基于模型自行探索的策略,把复杂问题拆解为中间步骤,并反复试探、修正,进而逼近答案(在DeepSeek R1中很多优秀的案例)
  • 相比以往的SFT或者RLHF,有些_推理过程_是很难认为设计的。RLVR则是通过奖励函数优化,让模型自行摸索,找到最有效的解题方式
  • 此外,与SFT和RLH这种_计算量相对较小的薄层微调_来说,RLVR使用更客观、难以被投机取巧的奖励函数,使得训练可以跑的更久。结果就是RLVR提供了更高的能力/成本比,大量吞噬了原本用于预训练的算力

结论:2025年的大部分模型性能提升,不是来自于模型规模的暴涨,而是来自相似规模模型 + 更长的RL训练。并在此阶段引入了新的 scaling law:通过推理阶段生成更长的思考链条、投入更多的测试时算力,模型能力持续提升,呈现出新的scaling law

  • OpenAI的 o1 是第一个明确展示RLVR思路的模型,而2025年初的o3则是让人直观感受到质变拐点的版本
相关推荐
明月_清风6 分钟前
MCP vs ACP vs LSP:AI 时代三大协议的「三足鼎立」
人工智能·网络协议·agent
Kobebryant-Manba14 分钟前
学习Bert微调
人工智能·学习·bert
Java后端的Ai之路17 分钟前
20、Python - 备忘录模式
开发语言·人工智能·python·外观模式·备忘录模式
飞哥数智坊18 分钟前
我对 AI 生图的一点工程化理解
人工智能·aigc
ACP广源盛1392462567320 分钟前
M6/M5 Pro Mac mini 端侧 AI 新形态@ACP#GSV5800 Serdes 长距离视频传输在 AI 服务中的机会与落地场景
大数据·网络·数据库·人工智能·嵌入式硬件·macos·音视频
xian_wwq29 分钟前
【学习笔记】深度认知系列-第14讲 端侧AI崛起——为什么AI正在从云端走向本地
人工智能·笔记·学习
火山引擎开发者社区31 分钟前
火山引擎 Milvus Vector Lakebase 正式公测
人工智能
ocean210338 分钟前
2025-2026年AI部署与MLOps大厂面试高频问题
人工智能·面试·大模型推理·ai部署
嘿嘿-661 小时前
Windows 一键使用 GPT-6 Astra:Codex CLI 配置教程
java·人工智能·windows·gpt·chatgpt·web
冬奇Lab1 小时前
Code Agent 解剖(22):从零扩展——用 Markdown 写一个 Skill
人工智能