技术栈

opd

夫唯不争,故无尤也
3 天前
llm·agent·强化学习·rl·opd
On-Policy Distillation(OPD)和reinforcement (RL)结合你这里说的 OPD,在当前 LLM 后训练 / Agent 语境里,通常指 On-Policy Distillation,在线策略蒸馏。
余俊晖
1 个月前
人工智能·深度学习·算法·多模态·opd
多模态大模型细粒度视觉理解:Vision-OPD在线策略自蒸馏技术方案概述MLLM在细粒度视觉理解上仍然吃力:答案往往依赖图中只占极小比例的"决定性细节",而在整图推理时,这些细节被海量视觉 token 淹没。
山顶夕景
3 个月前
大模型·llm·蒸馏·rlvr·opd·opsd
【LLM】On-Policy Distillation Survery链接:https://arxiv.org/pdf/2604.00626f-散度最小化:OPD方法将训练过程重新组织为围绕学生采样的轨迹进行优化,目标是减少复合误差,使其线性化。公式如下: L O P D ( θ ) = E y ∼ π mix [ ∑ t = 1 ∣ y ∣ D f ( p T ( ⋅ ∣ x , y < t ) , p θ ( ⋅ ∣ x , y < t ) ) ] \mathcal{L}_{OPD}(\theta) = E_{y \sim \pi_{\text{mix}}} \left
君为先-bey
3 个月前
强化学习·扩散模型·opd
DiffusionOPD——扩散模型中在线策略蒸馏的统一视角DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
我是有底线的