opd

Together_CZ3 天前
llm·agent·opd·rsi·在线蒸馏·rsl·递归自我学习
在线蒸馏(OPD)、递归自我改进(RSI)与递归自我学习(RSL)整体学习理解认知一:这三者不是并列的三个技术,而是三个不同抽象层级。 OPD 是一个训练目标;RSL 是一类闭环系统架构;RSI 是一个自治度的分级框架。把它们并列讨论会导致大量概念混乱。正确的关系是:OPD 是 RSL 闭环里最锋利的那把工具,而 RSL 是 RSI 在 L3–L4 层级的具体实现形态(详见 §6)。
夫唯不争,故无尤也24 天前
llm·agent·强化学习·rl·opd
On-Policy Distillation(OPD)和reinforcement (RL)结合你这里说的 OPD,在当前 LLM 后训练 / Agent 语境里,通常指 On-Policy Distillation,在线策略蒸馏。
余俊晖2 个月前
人工智能·深度学习·算法·多模态·opd
多模态大模型细粒度视觉理解:Vision-OPD在线策略自蒸馏技术方案概述MLLM在细粒度视觉理解上仍然吃力:答案往往依赖图中只占极小比例的"决定性细节",而在整图推理时,这些细节被海量视觉 token 淹没。
山顶夕景3 个月前
大模型·llm·蒸馏·rlvr·opd·opsd
【LLM】On-Policy Distillation Survery链接:https://arxiv.org/pdf/2604.00626f-散度最小化:OPD方法将训练过程重新组织为围绕学生采样的轨迹进行优化,目标是减少复合误差,使其线性化。公式如下: L O P D ( θ ) = E y ∼ π mix [ ∑ t = 1 ∣ y ∣ D f ( p T ( ⋅ ∣ x , y < t ) , p θ ( ⋅ ∣ x , y < t ) ) ] \mathcal{L}_{OPD}(\theta) = E_{y \sim \pi_{\text{mix}}} \left
君为先-bey3 个月前
强化学习·扩散模型·opd
DiffusionOPD——扩散模型中在线策略蒸馏的统一视角DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
我是有底线的