技术栈
奖励函数
XLYcmy
2 小时前
深度学习
·
llm
·
sft
·
强化学习
·
多模态
·
grpo
·
奖励函数
小红书 算法一面 四
SFT训练中**训练loss正常下降但测试集表现差**,核心原因是**模型泛化能力不足**——模型学到了训练集的特征(甚至噪声),但无法迁移到分布不同的测试集。结合SFT的任务特性(大模型微调、文本/多模态生成),具体原因可分为四大类,每类对应明确的排查和解决方法:
nju_spy
7 个月前
人工智能
·
强化学习
·
reinforce
·
ppo
·
数据异质性
·
大模型后训练
·
奖励函数
RL4LLM_Survey 强化学习在大语言模型后训练综述
Review of Reinforcement Learning for Large Language Models: Formulations, Algorithms, and Opportunities
山顶夕景
9 个月前
llm
·
强化学习
·
rl
·
奖励函数
·
reward
【RLVR】GRPO中奖励函数的设计逻辑
1、DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 奖励函数:
我是有底线的