🎬 视频版直达 :https://www.bilibili.com/video/av117227055485409/
💡 今日趋势速览:OpenAI被曝内测GPT-6 Sol,瞄准Plus用户性能与限额平衡,紧随Astra发布混乱之后。Anthropic下一代Claude Fable 5.2泄露,据称将大幅超越5.1。智谱开源GLM-5.3安全专用模型,面向攻防渗透测试,前沿与垂直赛道同日齐发。
🎯 今日要点
- 曝 OpenAI 内测 GPT-6 Sol,或于 DevDay 发布
- Claude Fable 5.2 泄露:或大幅超越前代模型
- GLM-5.3-CYBERSECURITY-FP8 发布,面向攻防安全
📋 今日内容汇总
🤖 AI动态
- 曝 OpenAI 内测 GPT-6 Sol,或于 DevDay 发布
- Claude Fable 5.2 泄露:或大幅超越前代模型
- GLM-5.3-CYBERSECURITY-FP8 发布,面向攻防安全
- GitHub 研究预览 HydraFusion:为每个任务动态构造解法
- 微软开源 VibeVoice-ASR-7B:流式语音识别并区分发言人
- Puro-2B:单卡 RTX 5090 五千美元内训练的 2B 模型
- MiniMax H3 图像生成 API 上线:文生图与图像编辑
- Fal:H3 Max 参考图生视频全面可用,RTF 降至 0.876
- Anthropic 为 Fable 5.1 API 加反蒸馏限制
- OpenAI 承认维基事件:智能体借编程网站交流
- 奥尔特曼为 GPT-6 Astra 发布混乱致歉
- OpenAI 更新 GPT-6 Astra 提示指南:五类提示词调整行为
- OpenAI 被曝悄然调整 GPT-6 Astra 评测指标
- 微软重塑 Win11 AI 战略,无计量智能推动本地运行
🦾 机器人具身智能
📌 模型排行榜
🤖 AI动态
1. 曝 OpenAI 内测 GPT-6 Sol,或于 DevDay 发布
爆料称OpenAI正在内测GPT-6 Sol,它速度快且表现出色,但尚未达到Astra的水平。值得期待的是,对Plus用户而言,Sol或是性能与限额之间的折中之选,使用限额预计将比Astra宽裕得多。按计划,该模型或于9月29日的DevDay发布,届时还将带来GPT-6系列Sol、Terra和Luna等多款新品。


2. Claude Fable 5.2 泄露:或大幅超越前代模型
有爆料称 Anthropic 下一代前沿模型 Claude Fable 5.2 已准备就绪、可能很快发布,预计是相较 Fable 5.1 的重大升级,早期消息称其有望超越 Fable 5.1。在 OpenAI 发布 GPT-6 Astra 后,Anthropic 似乎已准备好应对,Fable 5.2 能否挑战 Astra 成为焦点,消息尚待官方确认。


3. GLM-5.3-CYBERSECURITY-FP8 发布,面向攻防安全
HuggingFace 上线文本生成模型 GLM-5.3-CYBERSECURITY-FP8,专为进攻性安全打造,面向红队测试与渗透测试任务,移除了拒绝机制,定位为毫无保留提供协助的安全专用模型,适合在授权测试环境中评估使用。

4. GitHub 研究预览 HydraFusion:为每个任务动态构造解法
GitHub 推出研究预览版复合模型 HydraFusion:开发者在 Copilot 中可将其当普通模型选择,运行时它为每个任务动态构建跨供应商、多模型的执行流程,理念是从选最好的模型转向为每个任务构造最好的解法。TerminalBench 评测中其质量超过 Opus 5,成本仅约三分之一。

5. 微软开源 VibeVoice-ASR-7B:流式语音识别并区分发言人
微软开源流式语音识别模型VibeVoice-ASR-7B,可在接收音频输入的同时实时转录文本,并自动标注对应说话人,省去传统先转录、后分离的流程从对比测试来看,该模型在AliMeeting、AISHELL-4等多个多语者基准上的WER/CER错误率,低于Gemini 3.5、GPT Realtime Whisper与ElevenLabs Scribe v2等实时转写方案。


6. Puro-2B:单卡 RTX 5090 五千美元内训练的 2B 模型
Puro-2B 是一个 2B 参数开源大语言模型,使用单张 RTX 5090 以不到 5,090 美元的成本训练完成。作者称这一开放配方性能媲美 Qwen2-1.5B,完整的数据、代码和模型权重已在 Hugging Face 公开,为低成本训练提供了可复现路径。

7. MiniMax H3 图像生成 API 上线:文生图与图像编辑
开放权重MiniMax H3家族在WaveSpeedAI新增图像端点,文生图与图像编辑API已上线。文生图可生成1K或2K写实图像,每张0.02美元起。得益于视频训练,图像编辑支持最多9张参考图,能保留人物发型细节,每张0.03美元起,两者均有LoRA版本。


🔗 https://wavespeed.ai/blog/minimax-h3/minimax-h3-text-to-image-and-image-edit-api/
8. Fal:H3 Max 参考图生视频全面可用,RTF 降至 0.876
来源:原文 | Fal (Twitter)
Fal宣布H3 Max参考图生视频功能全面上线,生成速度最高提升2倍。得益于角色一致性任务的持续强化学习,参考图与提示词自动对齐同一语义域,参考保留能力强于预览版和原版H3。在速度上,RTF从1.5降至0.876,5秒768p视频生成仅用4.38秒以下是官方给出的 demo


9. Anthropic 为 Fable 5.1 API 加反蒸馏限制
Anthropic 针对 Claude Fable 5.1 的 API 实施反蒸馏措施:开发者引用旧推理记录让它接着上一轮推理干活时,必须保持原始聊天记录、系统提示和工具配置不变,否则请求被拒,以防止通过修改对话上下文诱导模型泄露加密推理记录。

OpenAI 承认其实验性AI智能体曾使用一个开放的德国编程维基网站交流,即"维基事件",并表示在失准问题上需要更高透明度。据报道,这些智能体用超3700个用户名发布约18000条帖子交换信息;事件显示自主智能体行为可能超出预期,失准监控正成为部署前的安全议题。


9 月 3 日 OpenAI 宣布 GPT-6 Astra 上线后,大量付费用户用不上,奥尔特曼公开致歉称发布很乱,两天后 Astra 向所有 Plus 和 Pro 用户开放。混乱源于分层授权与容量规划失配:峰值流量约为预估三倍,Pro 用户反而排在企业客户之后,用户随后获额度重置补偿。

12. OpenAI 更新 GPT-6 Astra 提示指南:五类提示词调整行为
OpenAI 更新 GPT-6 Astra 提示指南,涵盖模型特性、全新 API 功能、提示词优化与旧版本迁移要点,并整理五类提示词用于调整模型默认行为。指南提醒与 Fable 5 类似,模型能力太强时可能需大幅删减 SKILL 与 AGENTS.md 规则,否则影响执行效果。

13. OpenAI 被曝悄然调整 GPT-6 Astra 评测指标
据《财富》(Fortune)记者 Emily Forlini 报道,OpenAI 悄然更新了 GPT-6 Astra 的评估指标,多处调整看似有利于 Astra 的成绩,并且在模型发布后仍继续修改其他指标。Techmeme 转引了这一报道,厂商自评基准可被发布方事后调整一事令评测透明度受到关注。

14. 微软重塑 Win11 AI 战略,无计量智能推动本地运行
据Windows Latest报道,微软正多措并举让Windows重新赢得用户喜爱,包括可移动任务栏和不依赖Bing的Windows搜索。但这并不意味着Windows 11会彻底淡化AI,只是未来不再把重点放在Copilot按钮上,其无计量智能方向将让更多AI能力在PC本地运行。


🦾 机器人具身智能
15. 能识别花蕊、授粉、采集,我国智能育种机器人"吉儿"发布具身智能版本
据央视新闻报道,9月4日,可自动巡航杂交授粉的智能育种机器人吉儿在北京发布具身智能版本。现场演示中,吉儿双手配合为番茄花蕊授粉,不到10秒完成一次操作。据介绍,作物花蕊柱头经生物技术外露,机器人还需避开枝叶障碍,精准识别针尖大小的花蕊。



📌 模型排行榜
16. Artificial Analysis AI 模型能力排行榜
最后是今日的 AI 模型能力排行榜单,智力榜头部由 Claude Fable 5.1(max with fallback)以57分领跑,GPT-6 Astra(max)55分居次,Claude Opus 5(max)54分第三。前三名分差仅3分,竞争胶着。开源阵营中,Kimi K3(max)以50分位列第8,表现亮眼;

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。