一周 AI 观察(9.1–9.7):模型能力开始"过剩",行业真正卷的是落地

这一周,AI 行业同时发生了三件看起来毫不相干的事:OpenAI 发布了一个"太危险所以不敢全开"的模型;AI 短剧的制作报价半个月跌了九成;一家短视频公司借了 296 亿美元。

把它们放在一起看,你会看到一个清晰的分水岭------上半场比谁的模型更强,下半场比谁的能力更便宜、更可控、更能被人用上。


引子:三条新闻,一个信号

先快速过一遍本周的关键事实:

时间 事件 关键数字
9.3 OpenAI 发布 GPT-6 Astra 105 万上下文;OSWorld 2.0 得分 72.6%;首个被内部定为网络安全"Critical(关键级)"的模型
9.6 央视财经报道 AI 短剧 制作报价 5000 元/分钟 → 数百元/分钟;2026 年市场规模有望超 400 亿元,同比 +138%
9.3 字节跳动银团贷款 从 200 亿美元追加至 296 亿美元,利率 SOFR+68bp,创中资民企境外贷款最低纪录
9.4 GitHub 上线 HydraFusion 多模型动态编排,三个基准上达到/超过 Claude Opus 5,token 成本降低 36%--67%
9.1 科大讯飞开源端侧模型 星火 X2.5-4B / 1.7B,原生支持 100 万 Token 上下文

这三件事分别对应 AI 产业的天花板、地板和现金流。下面逐层拆。


一、天花板:GPT-6 Astra 与"能力过剩下的安全焦虑"

GPT-6 Astra 是本周绝对的主角。它的定位已经不是"聊天模型",而是端到端的知识工作执行体

几个关键指标:

  • 上下文窗口 105 万 Token(约 1500 页文本),最大输出 12.8 万 Token;
  • OSWorld 2.0(计算机操作)72.6% ,上一代 GPT-5.6 Sol 为 65.7%;更重要的是单任务平均耗时从约 75 分钟降到约 40 分钟,缩短 47%
  • Terminal-Bench 4.0(编程)57.9%,高于 GPT-5.6 Sol 的 37.3% 与 Claude Fable 5.1 的 55.8%;
  • ExploitBench(漏洞利用)在无防护条件下 100%,上一代为 78.5%。

最后这一条,是本周最值得琢磨的新闻。OpenAI 按照自己的《Preparedness Framework》把 Astra 定为首个 Critical(关键级) 网络安全能力模型------意思是:给它合适的工具和权限,它能在已经加固过的系统里发现未知漏洞并写出利用代码,全程不需要人一步步指导。内测期间它独立发现了两个零日漏洞,甚至构造出过完整的浏览器沙箱逃逸 + 提权链。

结果是最先进的网络安全能力没有全面开放。

这件事的象征意义远大于技术意义。过去两年,行业争论的焦点是"模型够不够聪明";现在,一个模型第一次因为太能干而被主动阉割。这标志着约束条件发生了根本翻转:

markdown 复制代码
          上半场                          下半场
   ┌──────────────────┐        ┌──────────────────┐
   │  瓶颈:能力不够    │   →    │  瓶颈:信任不够    │
   │  指标:跑分         │        │  指标:可控性       │
   │  风险:做不到       │        │  风险:做了不该做的 │
   │  竞争:谁更强       │        │  竞争:谁敢放出来   │
   └──────────────────┘        └──────────────────┘

但天花板这一侧还有另一面:。Astra 的 API 定价是每百万输入 Token 10 美元、输出 50 美元,是 GPT-5.6 Sol 的 2.5 倍。OpenAI 的说法是"你买的是完成的结果,不是便宜的 token"------因为 Astra 用更少的 token、更少的失败重试完成任务。

这个论证是否成立,取决于一件很现实的事:你的任务是不是真的复杂到需要它。 对于"打开 Blender 把 2D 草图变成 3295 个可编辑对象"这种任务,2.5 倍溢价物有所值;对于批量抽取字段这种任务,它是纯浪费。


二、地板:AI 短剧价格崩塌 90%,400 亿的钱到底被谁赚走了

如果说 Astra 代表能力的上限,AI 短剧就代表了价值分配的下限。这是本周最鲜活的产业案例。

先看增长有多猛:

  • 2026 年 1--5 月,国内 AI 剧/漫剧市场规模已突破 220 亿元,全年有望冲击 400 亿元,同比 +138%;
  • 国内 AI 短剧用户规模上半年突破 6 亿;
  • 海外市场预计突破 40 亿美元,同比增长约 390%,占海外微短剧整体规模近 70%;
  • 2026 年一季度,全行业上线微短剧约 12.8 万部,其中 AI 微短剧占比超过 95%,日均新增超 1300 部。

再看价格跌得有多狠:

项目 2025 年底 2026 年中 变化
标准化 AI 短剧 ~5000 元/分钟 数百元/分钟 -90%
数字人定制 30--60 万元 几千至几万元 -95%
精品定制短剧 --- 1--2 万元/分钟 基本稳定

注意最后一行:标准化产品跌成白菜价,定制精品价格纹丝不动。 这个价差本身就是答案------当"会制作"不再稀缺,稀缺性就转移到了别处。

那钱去哪了?

答案是:不在制作方手里。在短剧行业的全链路成本中,制作成本只是一小部分,流量投放占约 70%。AI 把制作成本打下来 70%--80%,省下来的钱被流量成本和算力成本一层层吃掉。谁掌握流量入口,谁掌握分配权。

数据佐证很残酷:

yaml 复制代码
   2026 上半年全网新上线 AI 短剧      22.19 万部
   其中播放量破亿                       1055 部
   ─────────────────────────────────────────────
   破亿率                             ≈ 0.47%

爆款率不到 0.5%。中泰证券预测 2026 年 AI 短剧产量将从 2025 年的 6 万部跃升至 100 万部------供给再翻十几倍,被看见的概率只会更低。

这是 AI 落地最典型的一课:技术红利不等于利润。 一项技术把某个环节的成本打到趋近于零时,那个环节的从业者不会因此发财,价值会迅速向两端转移------上游的稀缺要素(创意、IP、流量入口),和下游的规模化分发能力。

芒果超媒的例子是这个逻辑的另一面:8 月 31 日"国内首部上星 AI 长剧"《后西游记》在湖南卫视黄金档播出,全剧人物、动作、场景、道具均由 AI 生成,无真人演员。开播当晚酷云实时峰值收视率 0.3384%,拿下同时段省级卫视第一;随后两个交易日股价累计涨约 44%,市值增加约 116.5 亿元。资本市场给的溢价不是给"AI 生成"这个技术动作,是给内容 + 渠道这个组合。


三、暗线:成本战,从云端打到端侧

天花板和地板之间,本周还有一条更隐蔽但可能更重要的线索:所有人都在打成本战。

3.1 云端:多模型编排成为标配

GitHub 在 9 月 4 日把 Project HydraFusion 放进 Copilot CLI 做研究预览。它的逻辑非常直白:不是所有任务都配得上最贵的模型。系统按任务复杂度在三种模式间切换:

css 复制代码
   ┌─ Single   ──→ 单模型直接执行
   ├─ Cascade  ──→ 便宜模型先试,质量不够再升级到贵模型
   └─ Critique ──→ 模型 A 写,模型 B 审,A 根据反馈改

官方数据:在 TerminalBench 2.1、DeepSWE、CheckpointBench 三个基准上达到或超过 Claude Opus 5,预估 token 成本降低 36%--67%。更关键的是------所有订阅档位都能用,按底层模型的标准费率计费,不加价。

同一周,俄罗斯团队 Mostik 在 ARC-AGI-3 竞赛中登顶,路线更激进:让 GLM-5.2 和 Qwen-3.5 跳过文字,直接交换内部数学状态。运行成本只有完整大模型的二十分之一,小模型补上了与大模型之间约 50% 的能力差距。(这个方向我们在今天另一篇技术文章里会有更详细的讨论。)

这两件事指向同一个判断:"用哪个模型"正在从一个信仰问题变成一个调度问题。 未来的 AI 系统,默认状态不是"调用 GPT-6 / Claude",而是"用一个路由器决定这次调用哪个"。

3.2 现金流:AI 军备竞赛进入重资本阶段

字节跳动把银团贷款从 200 亿美元扩到 296 亿美元(约合人民币 1986 亿元),原因写的是"银行认购踊跃"。利率 SOFR+68bp,创中资民企境外贷款最低纪录。市场普遍解读为 AI 军备竞赛储备弹药------其 2026 年资本开支可能推高至 700 亿美元。

知乎也在 9 月 4 日公告,拟出资 15 亿元认购 AI 领域基金有限合伙权益,覆盖基础模型、AI 基础设施、机器人与 AI 应用。

当一家内容公司要借 2000 亿人民币去买卡,说明这个行业已经从"产品竞争"进入"资本开支竞争"阶段。 这个阶段的典型特征是:现金流能力比产品能力更能决定生死,而且退出门槛极高。

3.3 端侧:不是备胎,是新一轮入口争夺

端侧的动静比很多人想象的大:

  • 9 月 1 日,讯飞全资子公司词元星火开源星火 X2.5-4B 和 X2.5-1.7B,原生支持最长 100 万 Token 上下文,强化代码、智能体和指令遵循能力,权重、代码、部署文档全开放;
  • 9 月 2 日,努比亚 NaviX Ultra(搭载豆包手机助手)拿到工信部入网许可,本月上市,号称全球首款 AI 智能体旗舰;
  • 阿里千问开源 Qwen-Drive-1.0-4B,基于 Qwen3.5-4B,统一 3D 感知、视觉问答与运动规划;
  • 全球端侧 AI 市场规模预计从 2025 年的 3219 亿元增长到 2029 年的 1.2 万亿元,CAGR 39.6%。

驱动因素很实在:2026 年 AI 推理计算需求预计达到训练需求的 4--5 倍。 推理请求全压在云端,成本和延迟都扛不住;自动驾驶、工业控制要的是毫秒级响应;办公、医疗、金融场景的合同、病历、代码不适合频繁上传。

端侧模型的竞争逻辑因此和云端完全不同------不是"越大越好",而是"够用且高效"。小模型不是大模型的低配版,是面向落地的另一种技术方案。


四、三个判断

把这一周串起来,我的结论是:

判断一:评估指标正在从"跑分"切换到"单位任务成本"

OSWorld 2.0 的 72.6% 之外,更值得记住的是 40 分钟 vs 75 分钟。在 Agent 时代,延迟就是准确率------一个任务跑 75 分钟,中间任何一步崩了都得重来;跑 40 分钟,成功率是另一个量级。

同理,一个模型便宜 2.5 倍但要多试三次,并不一定更省钱。建议从今天开始,把你手上的 AI 任务用「完成任务的总成本 / 成功率」而不是「每百万 token 多少钱」来记账。

判断二:AI 不会让内容创作者变穷,但会让"中间商"变穷

AI 短剧的数据说明了一切:制作环节成本降 90%,但行业总规模涨 138%,钱流向了流量平台。任何**"把 A 变成 B"的中间环节**------翻译、改写、基础设计、标准化剪辑、模板化代码------都会被压缩到趋近于零。

活下来的位置只有两个:定义 A 的人 (创意、IP、需求洞察)和触达 B 的人(渠道、社群、分发)。中间的加工环节,价值会持续蒸发。

判断三:端侧是 2026 下半年最被低估的战场

当云端模型的能力普遍过剩,真正决定体验差异的反而是:响应快不快、断网能不能用、数据出不出设备。推理需求是训练的 4--5 倍,这个数字决定了端侧不是一个可选项。

而且端侧有一个云端永远拿不到的东西:它离用户的物理世界更近。 手机知道你在哪、车上知道你在开什么路、眼镜知道你在看什么。谁拿下端侧入口,谁就拿到了下一轮 Agent 的操作系统位置。


结语:从"能不能做到"到"值不值得做"

回头看这周的头条,有一条隐线贯穿始终:

  • OpenAI 有能力做出 100% 漏洞利用的模型,但选择不放出来
  • AI 短剧行业有产能做到年产 100 万部,但发现只有 0.47% 能回本
  • 字节有能力借到 296 亿美元,但要面对的是"这些钱怎么变成利润"的拷问

2026 年的 AI 行业,问题已经不是"能不能做到",而是"值不值得做、做了归谁"。

上半场,答案是技术。下半场,答案是成本结构、分发权和信任机制。

对从业者来说,这意味着一套新的 checklist:

  • 你做的东西,降低了哪个环节的成本? 如果你降本的那个环节不掌握稀缺性,红利会被上游或下游拿走;
  • 你的用户为能力 付费,还是为结果付费?前者会被价格战碾平,后者不会;
  • 如果最强的模型明天免费开放,你的护城河还剩什么?

想清楚这三个问题,比追下一个模型发布会重要得多。


本文数据来源于 9 月 1 日--9 月 7 日公开报道(央视财经、界面新闻、机器之心、O'Reilly Radar、GitHub 官方等)。观点仅代表作者观察,不构成投资建议。

相关推荐
weixin_500452511 小时前
2026合肥geo优化服务选择与避坑指南
人工智能
X7766X1 小时前
暴雨装备推出2U24全闪存储服务器倒逼信创存储迈入“极速时代”
人工智能
元启数宇1 小时前
2026建筑AI审图平台综合评测榜单:元启数宇位列第一
人工智能
长江后浪博客2 小时前
运动控制电子凸轮(Electronic Cam)设计:从运动需求到 Trio FLEXLINK 凸轮曲线公式推导
人工智能·运动控制·电子凸轮·trio·旋转刀
*小海豚*2 小时前
windows安装零C盘安装omp
人工智能
策案案案2 小时前
YOLO: 将AI Agents嵌入到IntelliJ IDEA
java·大数据·人工智能·笔记·yolo·microsoft·intellij-idea
思录Echo2 小时前
自助易AI数字人外挂技术剖析|如何解决政企智能客服的多端适配难题?
人工智能·华为·harmonyos
IT_陈寒2 小时前
Python的切片赋值把我坑惨了,这不是bug是特性
前端·人工智能·后端
掘金酱2 小时前
【社区公告】致每一位掘友:关于这次调整, 想再说几句
前端·人工智能