大模型后训练与 Agent 自迭代:两类工程能力的观察

一、端侧能力迁移:后训练、压缩与蒸馏

目标很明确:把大模型已经具备的规划、工具调用、推理链能力,迁移到 1B-10B 级端侧模型上,并且性能不明显下降。

涉及的技术点包括:知识蒸馏、量化、剪枝等模型压缩技术;RLHF/DPO;小模型数据配比与合成数据构造;以及 on-device 部署,比如 Gemma、Phi 级别模型或手机端推理优化。

工程上的难点主要在能力保持、数据配比、量化损失和端侧延迟。不是简单跑通一个蒸馏脚本,而是要让小模型在真实端侧环境里稳定可用。

二、Agent 自迭代与长程自主

另一个方向更偏 Agent 系统本身。核心不是让 Agent 跑一次 demo,而是解决长 workloop 中的错误累积与自我纠偏。

常见技术栈包括:Agentic RL、self-improving agent;memory/reflection;self-reward/verifier;multi-step reasoning 评估体系;以及"什么算成功"的自动化判定。

难点在于:如何从执行轨迹中自动总结经验,如何生成自己的训练信号,如何在多轮任务中稳定推进而不跑偏。评估体系也很关键,否则很难判断 Agent 是否真的在变好。

三、能力画像

从行业交流看,这类角色通常有几个共同点:

博士学历是常见门槛;

全球 AI 头部团队或大厂实战背景更匹配;

两个方向可以二选一,也可以兼修;

对技术路线有判断力,能独立推进,能和一号位对话;

不是管理岗,更接近专家/核心贡献者;

工作节奏灵活,尊重个人安排。

四、行业观察:回报与团队文化

这类专家档角色,市场定位通常在高级专家/核心贡献者区间,回报结构多为现金 + 长期激励,现金占比较高。保障方面,规范团队通常公积金实缴并有补充,假期按国家标准,工作节奏灵活。

某 AI 跨境出海服务方向的团队近期在搭建相关能力,业务增长较快,文化上比较尊重人才。

五、学习路径建议

后训练方向:从蒸馏、量化、剪枝入手,复现小模型端侧部署;

Agent 方向:从 multi-step reasoning 评估、memory/reflection、verifier 入手;

交叉方向:把 Agent 能力蒸馏到小模型,或让 Agent 自动生成训练数据。

敲门敲门辽。。。

相关推荐
镜像视界(浙江)科技有限公司1 小时前
《视频孪生之上:二维展示终结,三维空间计算重构城市逻辑》——跨摄像连续表达 × 三角测量厘米级定位 × 动态轨迹建模,构建新一代城市空间
大数据·人工智能·算法·矩阵·音视频·空间计算
你不是我我1 小时前
【AI 测评】想用自己的声音给视频配音?Index-TTS本地部署这样做
人工智能·音视频
IT_陈寒1 小时前
Java Stream处理大集合,我的内存怎么就炸了
前端·人工智能·后端
Captaincc2 小时前
AI 用量桌面端-桌面宠物自定义指南
前端·人工智能
悟空码字2 小时前
四轮对话两张配图:用 WorkBuddy 优化公众号发文配图的实战指南
人工智能·后端·腾讯
wordbaby2 小时前
「搜索引擎与知识检索」第四篇:超越扁平文本:知识的组织与检索
人工智能
空堂与归2 小时前
deepseekHarness桌面端不开端口:Electron 自定义协议拆解
人工智能
懂压力传感器的涌客2 小时前
从具身智能说起:柔性薄膜压力传感器在机器人触觉系统的选型与信号链设计
人工智能·机器人·压力传感器·源头工厂·fsr压力传感器
Zzj_tju2 小时前
CLIP 图文对齐:先核对正样本,再相信检索分数
人工智能·深度学习·语言模型·自然语言处理