「图文讲解」Profit:用概率挑选重要 token 解决 SFT 过拟合问题

大语言模型(LLM)在完成预训练后,通常需要通过监督微调(SFT)来适配特定的下游任务。然而,传统SFT存在一个被长期忽视的根本性问题:语言的 "一对多"特性 与训练目标的 "一对一"强制对齐之间的矛盾。

什么是"一对多"特性?简单来说,同一个意图可以用多种不同的方式表达。比如:

  • "请计算3加5的结果"
  • "3+5等于多少?"
  • "把3和5相加得到什么?"

这三句话表达的是完全相同的意图,但传统SFT会强制模型只学习其中一种表达方式。如果训练数据中只有第一种表达,模型就会被"惩罚"为没有生成"请计算"这样的特定词汇------即使它给出了正确答案。

对此,来自清华和港大的研究院提出了 Profit 训练方案,让模型更高效精准地学习


论文标题:ProFit: Utilizing High-Value Signals in SFT via Probability-Guided Token Selection

论文地址https://arxiv.org/pdf/2601.09195

研究团队:清华大学 & 香港大学

项目地址https://github.com/Utaotao/ProFit





之前介绍过 Qwen 团队提出的 《Beyond the 80/20 Rule》论文

https://blog.csdn.net/qq_36671160/article/details/148423501

其结论是:在 RL 训练中,LLM 推理能力的提高仅由少数高熵 token 贡献

"高熵"不就意味着低概率吗?两项工作怎么一个让只学低概率 token,另一个让只学高概率 token?

实际上这两项工作并不矛盾,原因在于:



相关推荐
uesowys15 分钟前
Apache Spark算法开发指导-Factorization machines classifier
人工智能·算法
人工智能AI技术24 分钟前
预训练+微调:大模型的“九年义务教育+专项补课”
人工智能
aircrushin32 分钟前
中国多模态大模型历史性突破:智源Emu3自回归统一范式技术深度解读
人工智能
Lsx_39 分钟前
前端视角下认识 AI Agent 和 LangChain
前端·人工智能·agent
aiguangyuan40 分钟前
使用LSTM进行情感分类:原理与实现剖析
人工智能·python·nlp
Yeats_Liao1 小时前
评估体系构建:基于自动化指标与人工打分的双重验证
运维·人工智能·深度学习·算法·机器学习·自动化
深圳市恒星物联科技有限公司1 小时前
水质流量监测仪:复合指标监测的管网智能感知设备
大数据·网络·人工智能
断眉的派大星1 小时前
均值为0,方差为1:数据的“标准校服”
人工智能·机器学习·均值算法
A尘埃1 小时前
电子厂PCB板焊点缺陷检测(卷积神经网络CNN)
人工智能·神经网络·cnn
Tadas-Gao1 小时前
缸中之脑:大模型架构的智能幻象与演进困局
人工智能·深度学习·机器学习·架构·大模型·llm