后训练

指针常量1 天前
学习·大语言模型·rl·后训练
【RL系列文章】难样本学习等综述:看了很多,总的来说,不利用外部信息的都基本比较扯淡。链接:https://arxiv.org/pdf/2602.01601 本文的核心理论即我们到底选择哪些样本去学习,DAPO的逻辑是把全对全错的去掉,但是这个属于先rollout再评价好坏;本文提出可以事先根据query进行预测答对的概率。本文先证明了一个重要的前提,答对概率越接近50%的题目越具有信息量,优先采样这部分会对训练更有效。 为此,本文设计了一个非常巧妙的纯数学计算的方法,动态的维护题目答对的可能性。已经答过的题的答对概率被更新,未答过
海天一色y11 天前
人工智能·强化学习·deepspeed·后训练
深入解析 DeepSpeedPPOTrainer:基于 PPO 的大规模 RLHF 训练实现在大语言模型(LLM)的后训练阶段,基于人类反馈的强化学习(RLHF) 已成为提升模型对话能力和对齐性的关键步骤。其中,近端策略优化(PPO) 因其稳定性和效率被广泛采用。然而,将 PPO 扩展到百亿甚至千亿参数规模的模型时,显存、通信和训练稳定性都面临巨大挑战。
thesky1234561 个月前
大模型·sft·rlhf·ppo·dpo·面试准备·后训练
27届大模型面试准备(十六):后训练全攻略——SFT、RLHF、DPO、PPO 一次讲透上一篇《高效推理全攻略》讲的是"怎么让模型推理又快又省",属于部署侧。这一篇回到训练侧,把"预训练之后的所有事"——也就是后训练(Post-Training)——一次性讲透。覆盖 SFT、Reward Model、RLHF(PPO)、DPO 四条主线,外加一条工程副线(数据配方、课程学习、拒绝采样)。每节都给:原理 → 数学/算法骨架 → 代码片段 → 面试速答 + 高频追问。配合《LoRA/PEFT》(候选 A18)一起看,刚好串成"对齐怎么做、怎么省显存做"。
NutShell Wang1 个月前
人工智能·ai·架构·agent·后训练·deepseek
DeepSeek-V4-Flash正式版深度拆解:不换架构,后训练如何让Agent能力暴涨7倍2026年7月31日,DeepSeek上线了V4-Flash正式版API。这次更新最反常识的地方在于:模型架构没变、参数量没变、上下文窗口没变,唯一的变化是重新做了后训练(Post-Training)。然而就是这一步操作,让一个"轻量版"模型在9项Agent基准测试中全面反超了自家旗舰V4-Pro预览版,其中DeepSWE得分从7.3飙升至54.4,涨幅超过7倍。
koharu1234 个月前
人工智能·llm·后训练
大模型后训练全解:SFT、RLHF/PPO、DPO 的原理、实践与选择本文覆盖范围:SFT 监督微调、RLHF(PPO)强化学习对齐、DPO 直接偏好优化,以及它们的变体、工具链、实战代码和选择决策。结合 InstructGPT、LLaMA 2/3、Zephyr、DeepSeek-R1、Qwen3 等真实案例说明。
安如衫10 个月前
人工智能·llm·sft·后训练·deepseek
【学习笔记更新中】Deeplearning.AI 大语言模型后训练:微调与强化学习导论在构建LLM Agent应用的征程中,我们都可能遇到过这样的困境:尽管尝试了精妙的提示词工程(Prompt Engineering)、更换了更强大的模型提供商,甚至将复杂任务进行了拆解,但LLM组件就是不“work”。
聚梦小课堂1 年前
人工智能·语言模型·后训练
用于大语言模型后训练阶段的新方法GVPO(Group Variance Policy Optimization)作业帮团队联合香港科技大学(广州)在 NeurIPS 2025 上提出了全新方法:GVPO(Group Variance Policy Optimization)。GVPO 通过避免重要性采样解决了 GRPO 的稳定性难题,并能在理论上提供了唯一最优解保证,并且在实验中表现全面超越现有方法。
镰刀韭菜1 年前
人工智能·自然语言处理·大语言模型·强化学习·ppo·后训练·grpo
【大语言模型】大模型后训练入门指南这些能力有什么共同点呢?答案是:它们都是在后训练阶段(post-training) 中发展出来的。尽管后训练解锁的能力在几年前看起来几乎像魔法一样,但它获得的关注却远少于 Transformer 架构和预训练的基础内容。
西西弗Sisyphus1 年前
微调·llama·llama-factory·后训练
LLaMA-Factory 单卡后训练微调Qwen3完整脚本flyfish将下面代码保存为 train_single_gpu.sh修改脚本中的以下参数: MODEL_PATH:模型路径 DS_CONFIG_PATH:DeepSpeed配置文件路径 OUTPUT_PATH:输出目录路径 --dataset erfen:替换为实际数据集名称 这里是erfen
Nicolas8932 年前
大模型·llama·预训练·合成数据·后训练·模型蒸馏·小模型
【大模型理论篇】关于LLaMA 3.1 405B以及小模型的崛起前不久,Meta开源了LLaMA 3.1 405B【1】,模型扩展了上下文长度至 128K,支持八种语言,效果非常惊艳,是首个在通用知识、可操控性、数学、工具使用和多语言翻译方面能够与最先进闭源 AI 模型媲美的公开可用模型,已经赶上截至目前最好的闭源模型,如GPT 4o和Claude 3.5。这可以算是一个里程碑,我们正在迎来一个以开源为主导的新时代。另一个问题不得不思考,如果作为基座大模型创业者,面对开源的冲击,公司存在的核心竞争力应该是什么?需要好好梳理。说明:本文主要会参考Meta的技术文章【2,
我是有底线的