arxiv 2026

白拾12 天前
机器人操作·视频生成·世界模型·arxiv 2026·abot-physworld 论文分享·物理推理
【arXiv 2026】ABot-PhysWorld 论文解读:物理对齐的交互式世界基础模型|从视频生成物理AI评测视角本文解读 arXiv 2026 论文《ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment》。该论文提出 ABot-PhysWorld 物理对齐交互式世界模型,通过融合物理感知数据管护、解耦判别器 Diffusion-DPO 对齐与零初始化动作注入,让 14B Diffusion Transformer 生成物理可信、动作可控的机器人操纵视频,其特别之处在于用"出
白拾1 个月前
强化学习·大模型推理·arxiv 2026·logos 论文分享·围棋ai·专家知识注入
【arXiv 2026】LoGos:把人类思考带回围棋——通用大模型的专业领域专家之路|从围棋AI与LLM推理交叉视角本文解读 arXiv 2026 论文《Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go》。该论文提出LoGos(Language-Oriented Go System),通过融合启发式规则合成专家数据、长 CoT 混合冷启动与GRPO 自探索强化学习,把通用大模型变成能在自然语言中分析局面、推理并落子的职业级围棋棋手,其特别之处在于全程不依赖稀缺的人类推理标注,仅用可规模化的结构化专家知识。实验表明 LoGos(32B
白拾1 个月前
扩散模型·前馈模型·arxiv 2026·genception 论文分享·视频生成预训练·通用视觉感知
【arXiv 2026】GenCeption:视频生成模型是通用视觉学习者|从生成式视觉预训练范式视角本文解读 arXiv 2026 论文《Video Generation Models are General-Purpose Vision Learners》。该论文提出 GenCeption,把大规模文生视频扩散模型改造为单步前馈的通用视觉感知模型,通过统一 RGB 表示、可学习 token与统一 $L_2$ 损失,让 8 类稠密/稀疏任务共用一个骨干与解码器,其特别之处在于仅用纯合成视频数据训练,即全面超越各任务专用 SOTA。实验表明法向 Hi4D mAE 10.99、深度 Goliath AbsR
白拾1 个月前
大模型·推理加速·扩散语言模型·并行解码·自推测解码·arxiv 2026
【arXiv 2026】Nemotron-Labs-Diffusion:三模式语言模型 统一自回归、扩散与自推测解码|从大模型推理加速视角本文解读 arXiv 2026 论文《Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding》。该论文提出 Nemotron-Labs-Diffusion 三模式语言模型,通过融合自回归(AR)解码、扩散(Diffusion)并行解码与自推测(Self-Speculation)解码,用联合 AR-扩散训练目标把三种解码范式统一进单
我是有底线的