这一周,AI 行业同时发生了三件看起来毫不相干的事:OpenAI 发布了一个"太危险所以不敢全开"的模型;AI 短剧的制作报价半个月跌了九成;一家短视频公司借了 296 亿美元。
把它们放在一起看,你会看到一个清晰的分水岭------上半场比谁的模型更强,下半场比谁的能力更便宜、更可控、更能被人用上。
引子:三条新闻,一个信号
先快速过一遍本周的关键事实:
| 时间 | 事件 | 关键数字 |
|---|---|---|
| 9.3 | OpenAI 发布 GPT-6 Astra | 105 万上下文;OSWorld 2.0 得分 72.6%;首个被内部定为网络安全"Critical(关键级)"的模型 |
| 9.6 | 央视财经报道 AI 短剧 | 制作报价 5000 元/分钟 → 数百元/分钟;2026 年市场规模有望超 400 亿元,同比 +138% |
| 9.3 | 字节跳动银团贷款 | 从 200 亿美元追加至 296 亿美元,利率 SOFR+68bp,创中资民企境外贷款最低纪录 |
| 9.4 | GitHub 上线 HydraFusion | 多模型动态编排,三个基准上达到/超过 Claude Opus 5,token 成本降低 36%--67% |
| 9.1 | 科大讯飞开源端侧模型 | 星火 X2.5-4B / 1.7B,原生支持 100 万 Token 上下文 |
这三件事分别对应 AI 产业的天花板、地板和现金流。下面逐层拆。

一、天花板:GPT-6 Astra 与"能力过剩下的安全焦虑"
GPT-6 Astra 是本周绝对的主角。它的定位已经不是"聊天模型",而是端到端的知识工作执行体。
几个关键指标:
- 上下文窗口 105 万 Token(约 1500 页文本),最大输出 12.8 万 Token;
- OSWorld 2.0(计算机操作)72.6% ,上一代 GPT-5.6 Sol 为 65.7%;更重要的是单任务平均耗时从约 75 分钟降到约 40 分钟,缩短 47%;
- Terminal-Bench 4.0(编程)57.9%,高于 GPT-5.6 Sol 的 37.3% 与 Claude Fable 5.1 的 55.8%;
- ExploitBench(漏洞利用)在无防护条件下 100%,上一代为 78.5%。
最后这一条,是本周最值得琢磨的新闻。OpenAI 按照自己的《Preparedness Framework》把 Astra 定为首个 Critical(关键级) 网络安全能力模型------意思是:给它合适的工具和权限,它能在已经加固过的系统里发现未知漏洞并写出利用代码,全程不需要人一步步指导。内测期间它独立发现了两个零日漏洞,甚至构造出过完整的浏览器沙箱逃逸 + 提权链。
结果是最先进的网络安全能力没有全面开放。
这件事的象征意义远大于技术意义。过去两年,行业争论的焦点是"模型够不够聪明";现在,一个模型第一次因为太能干而被主动阉割。这标志着约束条件发生了根本翻转:
markdown
上半场 下半场
┌──────────────────┐ ┌──────────────────┐
│ 瓶颈:能力不够 │ → │ 瓶颈:信任不够 │
│ 指标:跑分 │ │ 指标:可控性 │
│ 风险:做不到 │ │ 风险:做了不该做的 │
│ 竞争:谁更强 │ │ 竞争:谁敢放出来 │
└──────────────────┘ └──────────────────┘
但天花板这一侧还有另一面:贵。Astra 的 API 定价是每百万输入 Token 10 美元、输出 50 美元,是 GPT-5.6 Sol 的 2.5 倍。OpenAI 的说法是"你买的是完成的结果,不是便宜的 token"------因为 Astra 用更少的 token、更少的失败重试完成任务。
这个论证是否成立,取决于一件很现实的事:你的任务是不是真的复杂到需要它。 对于"打开 Blender 把 2D 草图变成 3295 个可编辑对象"这种任务,2.5 倍溢价物有所值;对于批量抽取字段这种任务,它是纯浪费。
二、地板:AI 短剧价格崩塌 90%,400 亿的钱到底被谁赚走了
如果说 Astra 代表能力的上限,AI 短剧就代表了价值分配的下限。这是本周最鲜活的产业案例。
先看增长有多猛:
- 2026 年 1--5 月,国内 AI 剧/漫剧市场规模已突破 220 亿元,全年有望冲击 400 亿元,同比 +138%;
- 国内 AI 短剧用户规模上半年突破 6 亿;
- 海外市场预计突破 40 亿美元,同比增长约 390%,占海外微短剧整体规模近 70%;
- 2026 年一季度,全行业上线微短剧约 12.8 万部,其中 AI 微短剧占比超过 95%,日均新增超 1300 部。
再看价格跌得有多狠:
| 项目 | 2025 年底 | 2026 年中 | 变化 |
|---|---|---|---|
| 标准化 AI 短剧 | ~5000 元/分钟 | 数百元/分钟 | -90% |
| 数字人定制 | 30--60 万元 | 几千至几万元 | -95% |
| 精品定制短剧 | --- | 1--2 万元/分钟 | 基本稳定 |
注意最后一行:标准化产品跌成白菜价,定制精品价格纹丝不动。 这个价差本身就是答案------当"会制作"不再稀缺,稀缺性就转移到了别处。
那钱去哪了?
答案是:不在制作方手里。在短剧行业的全链路成本中,制作成本只是一小部分,流量投放占约 70%。AI 把制作成本打下来 70%--80%,省下来的钱被流量成本和算力成本一层层吃掉。谁掌握流量入口,谁掌握分配权。
数据佐证很残酷:
yaml
2026 上半年全网新上线 AI 短剧 22.19 万部
其中播放量破亿 1055 部
─────────────────────────────────────────────
破亿率 ≈ 0.47%
爆款率不到 0.5%。中泰证券预测 2026 年 AI 短剧产量将从 2025 年的 6 万部跃升至 100 万部------供给再翻十几倍,被看见的概率只会更低。
这是 AI 落地最典型的一课:技术红利不等于利润。 一项技术把某个环节的成本打到趋近于零时,那个环节的从业者不会因此发财,价值会迅速向两端转移------上游的稀缺要素(创意、IP、流量入口),和下游的规模化分发能力。
芒果超媒的例子是这个逻辑的另一面:8 月 31 日"国内首部上星 AI 长剧"《后西游记》在湖南卫视黄金档播出,全剧人物、动作、场景、道具均由 AI 生成,无真人演员。开播当晚酷云实时峰值收视率 0.3384%,拿下同时段省级卫视第一;随后两个交易日股价累计涨约 44%,市值增加约 116.5 亿元。资本市场给的溢价不是给"AI 生成"这个技术动作,是给内容 + 渠道这个组合。
三、暗线:成本战,从云端打到端侧
天花板和地板之间,本周还有一条更隐蔽但可能更重要的线索:所有人都在打成本战。
3.1 云端:多模型编排成为标配
GitHub 在 9 月 4 日把 Project HydraFusion 放进 Copilot CLI 做研究预览。它的逻辑非常直白:不是所有任务都配得上最贵的模型。系统按任务复杂度在三种模式间切换:
css
┌─ Single ──→ 单模型直接执行
├─ Cascade ──→ 便宜模型先试,质量不够再升级到贵模型
└─ Critique ──→ 模型 A 写,模型 B 审,A 根据反馈改
官方数据:在 TerminalBench 2.1、DeepSWE、CheckpointBench 三个基准上达到或超过 Claude Opus 5,预估 token 成本降低 36%--67%。更关键的是------所有订阅档位都能用,按底层模型的标准费率计费,不加价。
同一周,俄罗斯团队 Mostik 在 ARC-AGI-3 竞赛中登顶,路线更激进:让 GLM-5.2 和 Qwen-3.5 跳过文字,直接交换内部数学状态。运行成本只有完整大模型的二十分之一,小模型补上了与大模型之间约 50% 的能力差距。(这个方向我们在今天另一篇技术文章里会有更详细的讨论。)
这两件事指向同一个判断:"用哪个模型"正在从一个信仰问题变成一个调度问题。 未来的 AI 系统,默认状态不是"调用 GPT-6 / Claude",而是"用一个路由器决定这次调用哪个"。
3.2 现金流:AI 军备竞赛进入重资本阶段
字节跳动把银团贷款从 200 亿美元扩到 296 亿美元(约合人民币 1986 亿元),原因写的是"银行认购踊跃"。利率 SOFR+68bp,创中资民企境外贷款最低纪录。市场普遍解读为 AI 军备竞赛储备弹药------其 2026 年资本开支可能推高至 700 亿美元。
知乎也在 9 月 4 日公告,拟出资 15 亿元认购 AI 领域基金有限合伙权益,覆盖基础模型、AI 基础设施、机器人与 AI 应用。
当一家内容公司要借 2000 亿人民币去买卡,说明这个行业已经从"产品竞争"进入"资本开支竞争"阶段。 这个阶段的典型特征是:现金流能力比产品能力更能决定生死,而且退出门槛极高。
3.3 端侧:不是备胎,是新一轮入口争夺
端侧的动静比很多人想象的大:
- 9 月 1 日,讯飞全资子公司词元星火开源星火 X2.5-4B 和 X2.5-1.7B,原生支持最长 100 万 Token 上下文,强化代码、智能体和指令遵循能力,权重、代码、部署文档全开放;
- 9 月 2 日,努比亚 NaviX Ultra(搭载豆包手机助手)拿到工信部入网许可,本月上市,号称全球首款 AI 智能体旗舰;
- 阿里千问开源 Qwen-Drive-1.0-4B,基于 Qwen3.5-4B,统一 3D 感知、视觉问答与运动规划;
- 全球端侧 AI 市场规模预计从 2025 年的 3219 亿元增长到 2029 年的 1.2 万亿元,CAGR 39.6%。
驱动因素很实在:2026 年 AI 推理计算需求预计达到训练需求的 4--5 倍。 推理请求全压在云端,成本和延迟都扛不住;自动驾驶、工业控制要的是毫秒级响应;办公、医疗、金融场景的合同、病历、代码不适合频繁上传。
端侧模型的竞争逻辑因此和云端完全不同------不是"越大越好",而是"够用且高效"。小模型不是大模型的低配版,是面向落地的另一种技术方案。
四、三个判断
把这一周串起来,我的结论是:
判断一:评估指标正在从"跑分"切换到"单位任务成本"
OSWorld 2.0 的 72.6% 之外,更值得记住的是 40 分钟 vs 75 分钟。在 Agent 时代,延迟就是准确率------一个任务跑 75 分钟,中间任何一步崩了都得重来;跑 40 分钟,成功率是另一个量级。
同理,一个模型便宜 2.5 倍但要多试三次,并不一定更省钱。建议从今天开始,把你手上的 AI 任务用「完成任务的总成本 / 成功率」而不是「每百万 token 多少钱」来记账。
判断二:AI 不会让内容创作者变穷,但会让"中间商"变穷
AI 短剧的数据说明了一切:制作环节成本降 90%,但行业总规模涨 138%,钱流向了流量平台。任何**"把 A 变成 B"的中间环节**------翻译、改写、基础设计、标准化剪辑、模板化代码------都会被压缩到趋近于零。
活下来的位置只有两个:定义 A 的人 (创意、IP、需求洞察)和触达 B 的人(渠道、社群、分发)。中间的加工环节,价值会持续蒸发。
判断三:端侧是 2026 下半年最被低估的战场
当云端模型的能力普遍过剩,真正决定体验差异的反而是:响应快不快、断网能不能用、数据出不出设备。推理需求是训练的 4--5 倍,这个数字决定了端侧不是一个可选项。
而且端侧有一个云端永远拿不到的东西:它离用户的物理世界更近。 手机知道你在哪、车上知道你在开什么路、眼镜知道你在看什么。谁拿下端侧入口,谁就拿到了下一轮 Agent 的操作系统位置。
结语:从"能不能做到"到"值不值得做"
回头看这周的头条,有一条隐线贯穿始终:
- OpenAI 有能力做出 100% 漏洞利用的模型,但选择不放出来;
- AI 短剧行业有产能做到年产 100 万部,但发现只有 0.47% 能回本;
- 字节有能力借到 296 亿美元,但要面对的是"这些钱怎么变成利润"的拷问。
2026 年的 AI 行业,问题已经不是"能不能做到",而是"值不值得做、做了归谁"。
上半场,答案是技术。下半场,答案是成本结构、分发权和信任机制。
对从业者来说,这意味着一套新的 checklist:
- 你做的东西,降低了哪个环节的成本? 如果你降本的那个环节不掌握稀缺性,红利会被上游或下游拿走;
- 你的用户为能力 付费,还是为结果付费?前者会被价格战碾平,后者不会;
- 如果最强的模型明天免费开放,你的护城河还剩什么?
想清楚这三个问题,比追下一个模型发布会重要得多。
本文数据来源于 9 月 1 日--9 月 7 日公开报道(央视财经、界面新闻、机器之心、O'Reilly Radar、GitHub 官方等)。观点仅代表作者观察,不构成投资建议。