Gemini 4 今日上线?Claude Haiku 5.5发布!Sonnet 缓存半价,Mythos 5.1开放申请 | 10月8日 AI日报

🎬 视频版直达 :https://www.bilibili.com/video/av117405095302847/

💡 今日趋势速览:Google疑似上线Gemini 4 Argon,Anthropic发布Haiku 5.5并开放Mythos 5.1申请,Grok Bot改用Opus 5.5,巨头同日亮剑,模型竞争白热化。

🎯 今日要点

  1. Gemini 4 Argon 疑似今日上线
  2. Anthropic 将 Claude Sonnet 5.5 缓存读取价格减半,并发布Haiku 5.5
  3. Anthropic 发布 Claude Haiku 5.5,智能指数 43 分

📋 今日内容汇总

🤖 AI动态

  1. Gemini 4 Argon 疑似今日上线
  2. Anthropic 将 Claude Sonnet 5.5 缓存读取价格减半,并发布Haiku 5.5
  3. Anthropic 发布 Claude Haiku 5.5,智能指数 43 分
  4. 消息称 Anthropic CVP 渠道可申请 Mythos 5.1 访问
  5. 马斯克宣布 Grok Bot 开放模型路由,将调用竞品 Opus 5.5
  6. Liquid AI 开源 Open d1 决策模型家族两款多模态模型
  7. ChatGPT 全量推出 GPT-6 与 Intelligent UI
  8. 无审查视频模型 Sulphur-2 泄露:基于 LTX 2.3 零拒答
  9. 微软为 Windows 版 Copilot 引入混合智能
  10. Claude Max 与 Team 套餐新增每月 API 额度
  11. 云栖大会泄露:Qwen 5 目标参数 5-10 万亿
  12. 微软开源 Agent Lightning v1.0 轻量级智能体强化学习框架
  13. Interfaze 开源多模型系统 interfaze-1-lite
  14. Vidu 发布下一代旗舰视频模型 Vidu Q4 Preview
  15. Cursor 推出 iOS 应用,可与电脑配对使用

🔌 AI基础设施

  1. 谷歌 Project Suncatcher 首颗 TPU 测试卫星入轨
  2. 英伟达发布 DGX Station for Windows 桌面级超算

📦 开源项目

  1. GitHub Copilot 本地沙箱现已全面推出
  2. 专为泄露密钥检测打造的专用模型

📌 模型排行榜

  1. Artificial Analysis AI 模型能力排行榜

🤖 AI动态

1. Gemini 4 Argon 疑似今日上线

来源:原文 | Mr_Salio (Twitter)

Gemini 4 Argon 疑似今日全面上线,此前该模型率先向 Fairwind 网络防御测试者推出,初步测试显示似乎已超越 GPT-6 Astra。不过截至发稿,官方模型列表尚未正式收录 Gemini 4,多家泄露追踪账号确认了发布状态。

🔗 https://x.com/Priyannkaaaa/status/2107879028896256304


2. Anthropic 将 Claude Sonnet 5.5 缓存读取价格减半,并发布Haiku 5.5

Anthropic将Sonnet 5.5缓存读取价格减半至每百万token 0.10美元。同时官方发布Claude Haiku 5.5小型模型,运行成本比Haiku 4.5低约75%。新模型在编码、计算机使用和知识工作上较4.5版显著提升。此外它还是首个带可调努力程度设置的Haiku模型,可按任务权衡成本与智能。

🔗 https://x.com/claudeai/status/2107894060229034197


3. Anthropic 发布 Claude Haiku 5.5,智能指数 43 分

来源:原文 | Lyraxana (AI Leaks) (Twitter)

Anthropic发布Claude Haiku 5.5,在Artificial Analysis智能指数中得43分,较上一代提升26分。作为小模型,Haiku 5.5在最大努力程度下略领先GLM-5.3 Flash和GPT-6 Luna,但每任务消耗约16.2万token,约为GPT-6 Luna的3倍。整体来看,其相较上一代Claude 4.5 Haiku进步显著。

🔗 https://x.com/ArtificialAnlys/status/2107911905822351609


4. 消息称 Anthropic CVP 渠道可申请 Mythos 5.1 访问

消息称有用户通过 Anthropic 的 CVP 获得 Mythos 5.1 访问权限,符合条件者可用其开展安全研究,限制比 Fable 5 更少,回退拒绝也可能更少;申请需提交安全工作详情并完成验证。

🔗 https://x.com/hqmank/status/2107681563156873351


5. 马斯克宣布 Grok Bot 开放模型路由,将调用竞品 Opus 5.5

马斯克宣布 Grok Bot 将根据任务自动路由至市场最佳模型,包括 Anthropic Claude Opus 5.5、Midjourney、Suno 等竞品,不再绑定 Grok 自研系列。社区解读为 SpaceXAI 转向模型聚合器战略,并引发是否放弃自研 Grok 的讨论。

🔗 https://x.com/notjazii/status/2107797124247400606


6. Liquid AI 开源 Open d1 决策模型家族两款多模态模型

来源:原文 | MarkTechPost

Liquid AI 发布 Open d1,为 d1 决策模型家族新增两款开源权重多模态模型:d1-3B 支持文本加视觉,d1-omni-600M 支持文本加图像或文本加音频,可在从 NVIDIA DGX 数据中心、RTX 工作站到 Jetson 边缘设备的任意场景实时决策。

🔗 https://x.com/liquidai/status/2107878924831379676


7. ChatGPT 全量推出 GPT-6 与 Intelligent UI

来源:原文 | GDB (Google DeepMind) (Twitter)

GPT-6 与 Intelligent UI 现面向所有 ChatGPT 用户推出:Intelligent UI 提供快速、可交互的回答,回答中可包含图表、按钮、表单等图形与交互组件,让日常问题更直观、复杂主题更易理解;付费套餐今起全球推送,免费与 Go 用户随后可用。以下是官方给出的 demo

🔗 https://x.com/OpenAI/status/2107894997538525580


8. 无审查视频模型 Sulphur-2 泄露:基于 LTX 2.3 零拒答

泄露社区出现无审查视频生成模型 Sulphur-2,基于 LTX 2.3 构建,主打零拒答输出。该模型延续了近期社区规避安全限制的潮流,与 Qwen3.8 无审查修改版同属一类产物,模型已在泄露追踪社区流传,尚无官方回应。

🔗 https://x.com/0x0SojalSec/status/2108026675917390190


9. 微软为 Windows 版 Copilot 引入混合智能

来源:原文 | The Verge

微软宣布 Windows 版 Copilot 将引入混合智能:在用户授权下利用电脑本地上下文与支持 Copilot 任务的本地模型,配合智能路由与高性能运行时,让任务在本地或云端合适位置运行,为本地 PC 带来前沿级能力,GitHub 等服务也能在 Windows 上智能路由。以下是官方给出的 demo

🔗 https://x.com/testingcatalog/status/2107939082571559421


10. Claude Max 与 Team 套餐新增每月 API 额度

Anthropic 为 Claude Max 与 Team 套餐推出内置的每月 API 额度,覆盖 Claude API、Managed Agents、Agent SDK 等场景,无需在 Claude Platform 添加付款方式。具体额度上,Max 5x 每月100美元,Max 20x 为200美元,Team 各席位额度合并计算、上限500美元,新订阅满7天即可领取,Free 和 Pro 计划不符合条件。

🔗 https://platform.claude.com/docs/en/about-claude/api-credits-for-subscribers


11. 云栖大会泄露:Qwen 5 目标参数 5-10 万亿

泄露信息显示,CEO 吴泳铭在云栖大会确认 Qwen 4.5 与 Qwen 5 目标参数 5-10 万亿,是现旗舰 Qwen3.8-Max(2.4 万亿参数)的两倍以上;这一跨越依赖新芯片真武 V900,2027 年一季度才量产;同场发布的 Qwen 4 尚未训练、无具体规格。

🔗 https://x.com/Priyannkaaaa/status/2107687359932477769


12. 微软开源 Agent Lightning v1.0 轻量级智能体强化学习框架

微软开源Agent Lightning v1.0,以约3500行代码实现轻量级智能体强化学习框架。区别于传统方案,该框架采用Harnessed Agentic RL范式,无需重构原有智能体框架即可持续改进。在训练示例中,Qwen3.5-9B仅用约6000个样本,SWE-bench Verified的Pass@1从41.8%提升到56.4%。

🔗 https://www.microsoft.com/en-us/research/blog/agent-lightning-v1-0-a-3500-line-lightweight-agentic-rl-framework-for-training-agents-with-real-harnesses/


13. Interfaze 开源多模型系统 interfaze-1-lite

AI 初创公司 Interfaze 开源多模型系统 interfaze-1-lite,把 OCR、语音识别、图像分割与时间序列预测接入同一接口。系统中 Qwen3.8-27B 充当调度核心,负责理解用户请求。官方将这种设计称为架构混合,整个系统可在单张 80GB 的 H100 上运行,每次运行还会返回置信度分数等元数据。以下是官方给出的 demo

🔗 https://x.com/0xLogicrw/status/2107687496054387061


14. Vidu 发布下一代旗舰视频模型 Vidu Q4 Preview

Vidu 上线下一代旗舰 AI 视频模型 Vidu Q4 Preview,主打出众表现力、电影级镜头语言与高冲击力视觉特效,定价每秒 0.014 美元起,新用户可用邀请码 VIDUQ4PV1 立即体验。以下是官方给出的 demo

🔗 https://x.com/ViduAI_official/status/2107856382263505219


15. Cursor 推出 iOS 应用,可与电脑配对使用

Cursor 官方宣布 iOS 应用上线,用户在手机下载后可与自己的电脑配对使用,将移动端接入现有开发环境;企业版用户需先联系管理员开启该功能后方可使用。以下是官方给出的 demo

🔗 https://x.com/cursor_ai/status/2107618677470494728


🔌 AI基础设施

16. 谷歌 Project Suncatcher 首颗 TPU 测试卫星入轨

谷歌登月项目 Project Suncatcher 研究能否将机器学习基础设施部署到太空。为验证 AI 硬件能否在轨道运行、TPU 能否承受发射物理应力与太空辐射、极端温度,谷歌研究人员过去数年持续探索,并于上周将首颗搭载四个 TPU 的测试卫星发射入轨。

🔗 https://x.com/Google/status/2107875278416753052


17. 英伟达发布 DGX Station for Windows 桌面级超算

英伟达在旧金山发布会发布DGX Station for Windows,定位桌面级AI超级计算机。该机搭载GB300 Grace Blackwell超级芯片,配备72核Grace CPU,最高748GB统一内存。算力上,其AI算力最高20 PFLOPS。不过整机最高功耗达1600瓦,需要20A电路,更接近专业级本地AI基础设施。

🔗 https://www.ithome.com/1/010/313.htm


📦 开源项目

18. GitHub Copilot 本地沙箱现已全面推出

GitHub Copilot 的本地沙箱功能正式全面推出,现可在 GitHub Copilot CLI、GitHub Copilot 应用以及使用 Agent Host 的 VS Code 会话中使用,为开发者提供安全隔离的本地执行环境。

🔗 https://github.blog/changelog/2026-10-07-local-sandboxing-for-github-copilot-now-generally-available


19. 专为泄露密钥检测打造的专用模型

GitHub 推出专为泄露密钥检测(Secret Detection)打造的专用模型,具备上下文感知能力;官方称密钥保护应与构建软件的方式同步演进,无论开发者亲自编写代码还是与 AI 智能体协作都能受惠。

🔗 https://github.blog/changelog/2026-10-07-purpose-built-model-for-leaked-secret-detection


📌 模型排行榜

20. Artificial Analysis AI 模型能力排行榜

最后是今日的 AI 模型能力排行榜单,智力榜由Anthropic系领跑:Claude Opus 5.5以58分居首,Claude Sonnet 5.5以56分次之,Claude Fable 5.1以53分列第三。开源/国产方面,MiMo-V2.6-Pro以46分位列第十,成功跻身前十,与国际巨头同台竞技,表现亮眼。

🔗 https://artificialanalysis.ai/

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。

相关推荐
云卷云舒___________1 天前
Mistral Large 4 发布:1T 参数 MoE,欧美开源权重新旗手
ai日报·加急快讯
猛犸象限2 天前
【CJMP Grok Bot实践】从鸿蒙搬到 iOS 和 Android,我们为什么最后选了 CJMP
ai编程·grok
AI日报派送佬3 天前
2026年10月5日AI行业日报|中美模型差距缩至3%,物理AI百亿估值爆发,决策模型国产开源竞速
人工智能·openai·ai智能体·ai日报·物理ai·算力基建·ai商业化
云卷云舒___________3 天前
Astra-lite疑似GPT-6.1 Terra? Haiku 5.5 与 Gemini 4 Argon 灰测? | 10月5日 AI日报
ai·anthropic·ai日报·terra·gemini4·gpt61·haiku55
AI日报派送佬4 天前
2026年10月4日AI行业日报|AI智能体自主能力升级,模型落地与安全规范双向迭代
人工智能·智能体·ai安全·开源ai·ai日报·人工智能前沿·ai科研
AI日报派送佬5 天前
2026年10月2日AI行业日报|AI监管全面加码,算力基建革新,视觉推理技术突破
人工智能·ai智能体·大模型技术·ai日报·算力基建·ai科研·ai产业落地
猛犸象限5 天前
[Grok Bot 仓颉实践] 让 AI 助手替你干活之前,先想清楚谁来拍板——我用 Grok Bot 做游戏的做法
人工智能·grok
AI日报派送佬5 天前
2026年10月3日AI行业日报|系统权限安全全面收紧,AI算力与模型工程化落地提速
人工智能·openai·英伟达·ai日报·智能体技术·ai安全管控·ai开源生态
云卷云舒___________6 天前
Qwen 4首测泄露!DeepSeek V4 mini展示名为flash?蚂蚁Ling-3.1-flash同步炸场 | 10月1日 AI日报
人工智能·开源模型·deepseek·ai日报·qwen4·ling31flash·蚂蚁百灵