arxiv 2026

白拾10 天前
强化学习·大模型推理·arxiv 2026·logos 论文分享·围棋ai·专家知识注入
【arXiv 2026】LoGos:把人类思考带回围棋——通用大模型的专业领域专家之路|从围棋AI与LLM推理交叉视角本文解读 arXiv 2026 论文《Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go》。该论文提出LoGos(Language-Oriented Go System),通过融合启发式规则合成专家数据、长 CoT 混合冷启动与GRPO 自探索强化学习,把通用大模型变成能在自然语言中分析局面、推理并落子的职业级围棋棋手,其特别之处在于全程不依赖稀缺的人类推理标注,仅用可规模化的结构化专家知识。实验表明 LoGos(32B
白拾16 天前
扩散模型·前馈模型·arxiv 2026·genception 论文分享·视频生成预训练·通用视觉感知
【arXiv 2026】GenCeption:视频生成模型是通用视觉学习者|从生成式视觉预训练范式视角本文解读 arXiv 2026 论文《Video Generation Models are General-Purpose Vision Learners》。该论文提出 GenCeption,把大规模文生视频扩散模型改造为单步前馈的通用视觉感知模型,通过统一 RGB 表示、可学习 token与统一 $L_2$ 损失,让 8 类稠密/稀疏任务共用一个骨干与解码器,其特别之处在于仅用纯合成视频数据训练,即全面超越各任务专用 SOTA。实验表明法向 Hi4D mAE 10.99、深度 Goliath AbsR
白拾21 天前
大模型·推理加速·扩散语言模型·并行解码·自推测解码·arxiv 2026
【arXiv 2026】Nemotron-Labs-Diffusion:三模式语言模型 统一自回归、扩散与自推测解码|从大模型推理加速视角本文解读 arXiv 2026 论文《Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding》。该论文提出 Nemotron-Labs-Diffusion 三模式语言模型,通过融合自回归(AR)解码、扩散(Diffusion)并行解码与自推测(Self-Speculation)解码,用联合 AR-扩散训练目标把三种解码范式统一进单
我是有底线的