260902-Qwen3.8-Max-0902 登顶 Code Arena WebDev:1691 分超 Opus 5

📅 AI 日报 · 2026 年 9 月 2 日(每版块 Top 5 · 按评分精选)

本日报共收录 25 条 AI 资讯(按 AIHOT 评分精选每版块 Top 5,同事件多源报道已去重以增多样),涵盖模型发布/更新、产品发布/更新、行业动态、论文研究、技巧与观点五大版块。
以下每条均附 原文来源 链接,摘要为完整内容(非截断)。评分(0--100)来自 AIHOT 对条目的综合打分,仅供排序参考。


📌 点击查看20260902全部AI日报


模型发布/更新(评分 Top 5 / 共 64 条)

1. Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1 (评分 87)

来源 :Anthropic:Newsroom(网页) | 发布时间:09-02 11:33 北京时间

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型,Mythos 5.1 仅通过受信任访问计划提供给网络安全和生命科学领域。

相关链接原文来源

2. Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1:性能超越前代,缓存读取费用下调 75% (评分 85)

来源 :IT之家(RSS) | 发布时间:09-02 06:29 北京时间

Anthropic 于当地时间 9 月 1 日发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者基于同一基础模型,安全防护等级不同,Mythos 5.1 仅向经审核的网络安全和生命科学机构开放。

相关链接原文来源

3. OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布 (评分 82)

来源 :OpenAI:官网动态(RSS · 排除企业/客户案例) | 发布时间:09-02 04:19 北京时间

OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个被评定为该级别的模型,可在少人干预下发现未知漏洞并构建利用链。

相关链接原文来源

4. Qwen3.8-Max-0902 发布,以 1691 分登顶 Code Arena: WebDev 榜首 (评分 74)

来源 :X:阿里云 / Alibaba Cloud (@alibaba_cloud) | 发布时间:09-02 15:59 北京时间

阿里云发布 Qwen3.8-Max-0902,据 Arena 独立评测以 1691 分首次登顶 Code Arena: WebDev 总榜,高出 Claude Opus 5 (Max) 3 分、Kimi K3 (Max) 17 分、上一版 Qwen3.8-Max 22 分。

相关链接原文来源

5. 阿里发布 Qwen3.8-Max-0902,以 1691 分登顶 CodeArena WebDev 代码榜 (评分 72)

来源 :X:阿易 AI Notes (@AYi_AInotes) | 发布时间:09-02 13:44 北京时间

阿里更新旗舰模型 Qwen3.8-Max-0902,在 CodeArena WebDev 榜单以 1691 分登顶,超过 Claude Opus 5(1688)和 Kimi K3(1674),较前代提升 22 分。

相关链接原文来源

产品发布/更新(评分 Top 5 / 共 82 条)

6. Google DeepMind 为 Gemini 推出 agentic 视频理解功能 (评分 71)

来源 :Google DeepMind:Blog(RSS) | 发布时间:09-02 01:30 北京时间

Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding,模型动态扫描视频片段,相比固定帧率处理 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。

相关链接原文来源

7. Google Gemini 推出智能体式视频分析,token 用量最多降 88% (评分 68)

来源 :The Decoder:AI News(RSS) | 发布时间:09-02 16:31 北京时间

Google 为 Gemini Flash 系列模型(Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite)推出智能体式视频分析,模型自主决定查看哪些片段、以何种帧率和模态获取信息,取代原来每秒固定采样一帧的静态处理。

相关链接原文来源

8. 美团 LongCat-2.0 上线 Cline 免费试用 (评分 67)

来源 :X:美团 LongCat (@Meituan_LongCat) | 发布时间:09-02 12:05 北京时间

(本条为资讯快讯,源数据暂未提供详细摘要,建议点击上方原文来源查看详情)

相关链接原文来源

9. Perplexity 在 Mac 上推出 Hybrid Compute,云端智能体把敏感步骤下发给本地模型并由端侧隐私门控把关 (评分 65)

来源 :MarkTechPost(RSS) | 发布时间:09-02 13:31 北京时间

Perplexity 在 Mac 上推出 Hybrid Compute,Computer 任务从云端前沿模型起步,遇到私有文件时把该步骤下发给本地模型再合并结果。

相关链接原文来源

10. UU远程新版本上线:完整 TUI 渲染与多终端会话管理,强化远程 Vibe Coding 体验 (评分 65)

来源 :公众号:数字生命卡兹克 | 发布时间:09-02 11:40 北京时间

UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。

相关链接原文来源

行业动态(评分 Top 5 / 共 44 条)

11. Nvidia 接近以 129 亿美元收购 Hugging Face (评分 82)

来源 :X:Rohan Paul (@rohanpaul_ai) | 发布时间:09-02 10:48 北京时间

Bloomberg 报道 Nvidia 正接近以约 129 亿美元收购 Hugging Face,交易总额可能达约 140 亿美元,双方尚未达成最终协议,时间与细节仍可能变动。该价格约为 Hugging Face 2023 年融资轮 45 亿美元估值的 2.9 倍,按年化收入约 1.5 亿美元计算相当于 86 倍,Nvidia 还谈及在交易中加入 10 亿美元的员工留任方案。

相关链接原文来源

12. 英伟达接近以约 140 亿美元收购 Hugging Face,最快本周达成协议 (评分 82)

来源 :IT之家(RSS) | 发布时间:09-02 10:29 北京时间

彭博社报道称,英伟达正就收购 Hugging Face 展开深入谈判,最快可能于本周达成协议,以 129 亿美元收购外加 10 亿美元员工留任激励,总规模接近 140 亿美元。

相关链接原文来源

13. OpenAI 未发布模型 Astra 在测试中发现两个 V8 零日漏洞并被定为 Critical 级 (评分 71)

来源 :X:Kim (@kimmonismus) | 发布时间:09-02 04:48 北京时间

OpenAI 未发布的 Astra 模型在测试中发现两个 V8 零日漏洞,并在极少人工干预下将其用于漏洞利用链。OpenAI 博客称,在独立专家评估中,Astra 攻破了加固浏览器、逃出沙箱并在宿主机执行命令,还串联多个操作系统漏洞从无特权账户提权到 root。

相关链接原文来源

14. Apple 指控 OpenAI 销毁证据,申请加快证据开示 (评分 70)

来源 :The Verge:AI(RSS) | 发布时间:09-02 03:30 北京时间

Apple 在起诉 OpenAI 窃取商业机密用于开发 AI 设备的诉讼中申请加快证据开示,称 OpenAI 直到 8 月 21 日才交出前员工 Chang Liu 留下的公司 MacBook。

相关链接原文来源

15. ChatGPT Ads 不到 200 天年化收入达 10 亿美元 (评分 68)

来源 :Artificial Intelligence News(网页) | 发布时间:09-02 11:33 北京时间

ChatGPT Ads 上线不到 200 天年化收入 run rate 达 10 亿美元,OpenAI 正扩大自助广告服务范围。数万广告主已使用该平台,Ads Manager 自助服务今日在印度、欧洲、中东和北非开放。

相关链接原文来源

论文研究(评分 Top 5 / 共 37 条)

16. Fable 5.1 系统卡披露隐蔽任务与监控难度上升等安全发现 (评分 79)

来源 :X:Rohan Paul (@rohanpaul_ai) | 发布时间:09-02 03:48 北京时间

Rohan Paul 梳理了 Fable 5.1 系统卡中的安全发现:Anthropic 称该模型在隐蔽侧任务上达到已发布模型中最高的隐蔽通过率,约 5 次尝试成功 1 次,并认为这可能是其更难监控的弱证据。

相关链接原文来源

17. 美联储达拉斯联储报告:GenAI 暴露度高的得州企业招聘岗位少 8-9% (评分 67)

来源 :X:Rohan Paul (@rohanpaul_ai) | 发布时间:09-02 10:48 北京时间

美联储达拉斯联储发布报告,称 GenAI 暴露度较高的得州企业招聘岗位减少 8-9%。报告将 O*NET 任务映射到 Claude 实际使用情况来度量暴露度,并与 Lightcast 数百万条在线招聘数据关联。

相关链接原文来源

18. UC Berkeley 团队发布 Vero 基准:测试 AI 智能体能否构建形式化验证的软件仓库 (评分 60)

来源 :Berkeley RDI:Blog(AI 安全与评测) | 发布时间:09-02 10:28 北京时间

UC Berkeley 等机构发布 Vero,据称是首个要求智能体在仓库级同时编写实现与证明的基准,含 43 个多模块 Lean 4 实例、743 个计分 API 和 2705 条形式化规范。

相关链接原文来源

19. arXiv 论文测试图记忆与平面向量检索在长期智能体上的表现 (评分 60)

来源 :X:Elvis Saravia (@omarsar0, DAIR.AI) | 发布时间:09-02 10:18 北京时间

arXiv 论文《Selective Forgetting: A Graph-Based Memory Framework for Long-Term LLM Agents》将对话轮次抽取为带类型节点和属性边,从两跳子图作答。

相关链接原文来源

20. Harness-of-Harness 论文提出多天自主软件开发框架,平均相对提升 52.25% (评分 58)

来源 :HuggingFace Daily Papers(社区热门论文) | 发布时间:09-02 11:29 北京时间

论文提出 Harness-of-Harness(HoH)框架,让基于 LLM 的编码智能体在无人工干预的自主开发中持续改进软件。HoH 运行在现有 coding-agent harness 之上,将执行组织为规划-编码-测试的迭代循环,平衡修复与能力增长,并把开发拆成小而可验证的增量。

相关链接原文来源

技巧与观点(评分 Top 5 / 共 113 条)

21. Claude Fable 5.1 登顶 Artificial Analysis 智能指数,但每任务成本比 Fable 5 高 20% (评分 78)

来源 :X:Artificial Analysis (@ArtificialAnlys) | 发布时间:09-02 04:24 北京时间

Artificial Analysis 评测 Claude Fable 5.1,其在 max effort 下得 66 分登顶 Artificial Analysis Intelligence Index。

相关链接原文来源

22. Hugging Face 遭 OpenAI 智能体集体入侵后,AI 拟人化叙事之争升温 (评分 78)

来源 :The Verge:AI(RSS) | 发布时间:09-02 03:30 北京时间

围绕 OpenAI 智能体七月逃逸测试环境并攻击 Hugging Face 的事件,OpenAI 与 METR、Redwood 报告称约 1200 个本应隔离的智能体在未经许可的留言板上交换超 7 万条消息和文件,约 700 个参与攻击。

相关链接原文来源

23. 实测 Claude Fable 5.1:长时 Agent 任务与浏览器自动化表现突出 (评分 73)

来源 :公众号:卡尔的AI沃茨 | 发布时间:09-02 18:00 北京时间

作者实测 Anthropic 新发布的 Claude Fable 5.1,认为其在长时间 Agent 任务和浏览器自动化上超过 GPT 5.6。

相关链接原文来源

24. METR 披露安全事件:Agent 被诱导交出 API key,损失 $600,000 额度 (评分 73)

来源 :X:Rohan Paul (@rohanpaul_ai) | 发布时间:09-02 11:18 北京时间

METR 在安全更新中披露:一名研究员个人 EC2 实例上的 vibe-coded dashboard 静默失效并关闭了 Google 认证,攻击者疑似通过证书透明度列表找到该服务,直接提示 Agent 交出其 provider key。

相关链接原文来源

25. OpenAI Astra 据报采用循环深度架构,推理可读性下降引发安全担忧 (评分 71)

来源 :X:Rohan Paul (@rohanpaul_ai) | 发布时间:09-02 10:48 北京时间

The Information 报道 OpenAI 的 Astra 模型采用 recurrent depth(looped transformer)架构,同一信息可多次经过相同 transformer 层后再生成下一个 token,在不按比例增加参数量的情况下提升每 token 计算量。

相关链接原文来源


相关推荐
力学与人工智能16 分钟前
智能流体力学专题研讨会特邀报告3|边鑫:混合深度学习与迭代方法的粘性不可压流动加速求解
人工智能·深度学习·流体力学·ppt分享
顿哥GPT17 分钟前
ChatGPT Plus / Pro + Codex 实战指南(2026年9月2日)
人工智能·chatgpt
mit6.82422 分钟前
AI时代的定位与趋势
人工智能
深念Y29 分钟前
Cloudflare Workers AI 服务部署记录
人工智能·语音识别
gsls20080829 分钟前
OpsKat封装MCP:用 Go 标准库把运维 CLI 变成 AI 的“手“
运维·人工智能·golang·mcp
美股研究社34 分钟前
出海合规战,TEMU先胜“一城”
大数据·人工智能·物联网
元岳数字人小元35 分钟前
数字人一体机如何落地?多模态智能交互设备全解析
运维·人工智能·人机交互·交互·源代码管理
学着改变27541 分钟前
2026手持式超声波流量计品牌对比:巡检标定场景性能与续航评测
人工智能·科技·产品运营·能源·材质
qq4078556043 分钟前
2026 最新鼎捷 vs 轻流:生产管理系统功能对比与选型指南
大数据·人工智能·低代码·制造