Anthropic披露内部模型Model 2、Codex多智能体v2委派多模型、英伟达开源550B推理教师模型 | 8月16日 AI日报

💡 今日趋势速览:Anthropic首披露内部模型Model 2,Codex多智能体v2自动委派子任务,英伟达开源550B推理教师模型,大模型与智能体能力竞赛持续升级。

🎯 今日要点

  1. Anthropic 风险报告首披露内部模型 Model 2
  2. 英伟达开源 550B 推理教师模型,专注长程数学与逻辑
  3. Codex Multi Agents v2:子任务自动委派不同模型

📋 今日内容汇总

🤖 AI动态

  1. Anthropic 风险报告首披露内部模型 Model 2
  2. 英伟达开源 550B 推理教师模型,专注长程数学与逻辑
  3. Codex Multi Agents v2:子任务自动委派不同模型
  4. DeepSeek V4 Pro 与 Harness 上线国家超算互联网
  5. 亚马逊用 Twitch 内容训练 AI,主播可选择退出
  6. Anthropic 发布 Claude Code 官方省 Token 指南
  7. OpenRouter 上线 Web Search Benchmarks 搜索评测
  8. AA 智能指数:V4 Pro 0813 得 53 分价格涨 3.6 倍
  9. 清华 NASP 用 GLM-5.3 攻破 Cursor 高危漏洞

🧪 芯片半导体

  1. 台积电 0.42 纳米 MoS2 晶体管突破硅基微缩极限

🦾 机器人具身智能

  1. RobotEra M7 机器人集群进驻深圳邮政处理中心

📌 模型排行榜

  1. Artificial Analysis AI 模型能力排行榜

🤖 AI动态

1. Anthropic 风险报告首披露内部模型 Model 2

Anthropic 最新风险报告首次披露内部模型 Model 2:整体强于 Mythos 5,已大量用于写代码、生成数据和运行 Agent,但暂无对外发布计划,也未完成发布前全套评测。报告还将模型高风险行为概率评估从极低上调至低。

🔗 https://x.com/0xLogicrw/status/2088440507789946982


2. 英伟达开源 550B 推理教师模型,专注长程数学与逻辑

英伟达在 Hugging Face 发布 550B 参数 MoE 推理教师模型,面向长程数学与逻辑任务微调,用于将最难问题的求解能力蒸馏给更小模型。该模型定位推理教师而非通用助手,延续以大规模教师模型生产训练数据的路线。

🔗 https://x.com/HuggingPapers/status/2088507552371970168


3. Codex Multi Agents v2:子任务自动委派不同模型

Codex 的 Multi Agents v2 更新允许主 Agent 把子任务自动委派给不同模型:GPT-5.6 Sol 负责复杂 Agentic Coding,Terra 处理日常编程,Luna 提供最快最低成本,Daybreak 专攻网络安全,GPT-5.5 覆盖研究与通用任务。

🔗 https://x.com/MaxForAI/status/2088686793487163606


4. DeepSeek V4 Pro 与 Harness 上线国家超算互联网

国家超算互联网 8 月 14 日上线 DeepSeek V4 Pro 正式版与智能体框架 DeepSeek Harness,依托全国首个十万卡级超智融合算力资源池,为大模型训练、微调、评测到部署全生命周期提供国产算力,可一站式完成部署开发。

🔗 https://www.ithome.com/0/990/002.htm


5. 亚马逊用 Twitch 内容训练 AI,主播可选择退出

Wired 报道亚马逊使用 Twitch 平台内容训练其 AI 模型,主播可自行选择退出。消息公布后数千名用户质疑为什么内容一开始就被默认用于训练,凸显平台数据默认授权引发的隐私争议。

🔗 https://www.wired.com/story/amazon-uses-your-twitch-content-to-train-its-ai-how-to-opt-out


6. Anthropic 发布 Claude Code 官方省 Token 指南

Anthropic 发布 Claude Code 官方省 Token 指南,核心是上下文越长后续每轮越贵。指南整理 11 个实用技巧:换任务用 /clear、同任务清旧上下文用 /compact、控制文件与命令输出占用等,帮助降低长会话额度消耗。

🔗 https://x.com/0xLogicrw/status/2088502859407204532


7. OpenRouter 上线 Web Search Benchmarks 搜索评测

OpenRouter 上线 Web Search Benchmarks,首批覆盖 Exa、Parallel、Perplexity 与模型自带搜索,搭配 GPT-5.6 Sol、Claude Opus 5、DeepSeek V4 Flash 在 4 组评测比较准确率、成本与速度;结果显示搜索轮数比换引擎更重要。

🔗 https://x.com/0xLogicrw/status/2088494190699347996


8. AA 智能指数:V4 Pro 0813 得 53 分价格涨 3.6 倍

Artificial Analysis 公布 DeepSeek V4 Pro 0813 智能指数 53 分,比 4 月版 V4 Pro 高 8 分,但价格上涨 3.6 倍,也仅比 V4 Flash 0731 高 1 分,新定价下它仍高于智能价格曲线,性价比争议随之升温。

🔗 https://x.com/ArtificialAnlys/status/2088440350734201149


9. 清华 NASP 用 GLM-5.3 攻破 Cursor 高危漏洞

清华 NASP 实验室利用智谱新发布的 GLM-5.3(7530 亿参数)成功攻破 Cursor 开发工具,在底层权限校验逻辑中发现高危漏洞,攻击者可任意写入文件并完全接管开发环境,凸显大模型自主漏洞挖掘能力快速提升。

🔗 https://hub.baai.ac.cn/view/57143


🧪 芯片半导体

10. 台积电 0.42 纳米 MoS2 晶体管突破硅基微缩极限

台积电研究人员将晶体管工程推向原子尺度:新研究展示超薄二硫化钼 MoS2 顶栅场效应晶体管,工程化界面厚度约 0.42 纳米,沟道厚度约 0.7 纳米接近单原子层,有望推动晶体管微缩超越传统硅基技术。

🔗 https://x.com/SciTechera/status/2088562249468354941


🦾 机器人具身智能

11. RobotEra M7 机器人集群进驻深圳邮政处理中心

RobotEra M7 人形机器人集群部署于深圳华南邮件处理中心,自主完成包裹分拣、翻转与抓取上带,单台机器人稳定吞吐达每小时 1200 件、日均约 1 万件,展示人形机器人在物流分拣场景的规模化落地。以下是官方给出的 demo

🔗 https://x.com/CyberRobooo/status/2088483904697290956


📌 模型排行榜

12. Artificial Analysis AI 模型能力排行榜

最后是今日的 AI 模型能力排行榜单,Claude Opus 5 (max)以63分登顶智力榜,并与Grok 4.6同以59分并列智能体第一,Claude Fable 5、GPT-5.6 Sol以62、61分紧咬,闭源头部缠斗胶着,Gemini 3.7 Flash则以56分落入第二梯队。

🔗 https://artificialanalysis.ai/?intelligence=artificial-analysis-intelligence-index#intelligence-tabs

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。

相关推荐
早安试言4 小时前
全流程搭建并使用codex
codex
ArkAPI2 天前
Claude Code 连发安全修复:AI 编程 Agent 的权限,正在成为新的“安全事故高发区”
人工智能·大模型·api·codex·ai工具·claude code·arkapi
Tisfy2 天前
Codex:通过编辑配置文件添加带Bearer的自定义MCP
数据库·大模型·agent·codex·mcp
花千树-0102 天前
Harness Marketplace 剖析系列 - 之 Codex:Plugin、Marketplace 与通用插件目录
codex·ai agent·skill·mcp·marketplace·ai plugin开发·智能体生态
仙逆GPT2 天前
ChatGPT、Codex实战:从Claude Code / Cursor迁移到Codex怎么做?/import最容易漏掉哪些配置?
cursor·codex·chatgptplus·claudecode·codex教程
寥落半伤感2 天前
codex接入deepseek+VLM视觉语言模型教程
人工智能·语言模型·自然语言处理·codex·deepseek
东姬AI3 天前
Anthropic模型36小时突破46年数学进展,同日三家前沿模型上新:当AI抽象智能逼近极限,“表现力“为什么仍是结构性空白
ai·agent·grok·deepseek·anthropic·黎曼猜想·qwen3.8