专栏:AI 热事慢想 | 周五深度轨
署名:专注 AI 工程化实践与出海外贸技术
写在前面
这一周的 AI 圈,出现了一个很少见的景观:话语层面在讨论踩刹车,产品层面却在踩油门。
9 月 15 日,一位 DeepSeek 工程师公开发文,把「该不该放慢 AI 发展」这件事正面吵开了;几乎同一时间,OpenAI 和 Anthropic 各自悄悄放量了新模型,没有任何一方发正式公告,全靠用户实测「抓包」;三天后,OpenAI 官宣了一个月后的退役时间表;而这周更早的时候,两批国产小模型把「Agent 能力」塞进了 4B 参数里。
四件事单独看都是常规动态,串起来看指向同一个词:节奏。这篇文章把这四件事逐条拆开,讲清楚每件事的技术内核,以及它们对做产品、做跨境业务的技术团队意味着什么。
第一件事:开源 vs 闭源,把「降速」这两个字说开了
发生了什么:9 月 15 日,DeepSeek 工程师刘胜宇(参与 V4.1 相关工作)公开发文,直接批评 Anthropic 和 OpenAI 近期频繁呼吁的「放慢 AI 发展节奏」。据南华早报(SCMP)报道,他的核心论点有两个:其一,他不信任这两家公司能把最前沿的 AI 做到「开放且可负担」;其二,如果发展节奏被人为放慢,最大的受益者不是行业,而是已经掌握顶尖闭源模型的公司(来源:南华早报,多家媒体转引)。
这句话火药味很重,用词也用了极具争议的极端类比,把争论进一步推向情绪化。有意思的是,双方阵营其实都说过类似的重话------Anthropic CEO 此前也用过极端类比来形容前沿 AI 集中在「错误的人」手里的风险(来源:AGI Hunt 对双方言论的梳理)。剥掉情绪,争论的内核其实非常清晰:
「降速」到底是安全措施,还是护城河?
从技术视角拆一下这个争论的真实结构:
- 支持降速的一方逻辑是:能力增长快于安全研究,模型发布前应该等评估与对齐手段跟上,这是经典的「capability vs safety」时间差问题。
- 质疑的一方 逻辑是:降速的成本分布不对称。闭源厂商的先发优势在窗口期内是复利的,而开源阵营追平的窗口会被拉长。换句话说,降速呼吁的受益者是可以被精确指认的------这在一向喜欢谈「人类福祉」的安全话语里,是很罕见的具体。
我不打算替任何一方站队,但有一个技术事实值得指出:开源权重模型的可验证性,和闭源 API 的可控性,解决的是两类不同的风险,且当前没有第三种方案能同时提供两者。 你要么放弃审计能力换便利,要么自建基础设施换透明。刘胜宇的表态之所以引发这么大反响,是因为它把「模型选型不再只是技术决策,也是风险立场决策」这件事挑明了------过去大家默认用谁的 API 只是成本问题,现在它是治理问题。
顺带一提,上周我在《一条辞职帖 1.7 亿次浏览:剥掉末日叙事,RSI 之争里剩三个真问题》(https://blog.csdn.net/qq_43274490/article/details/165586321 )里拆过 Amodei 那篇减速文的立场结构。这周的争论等于是那份立场的第一次公开正面回击------RSI 之争从「要不要继续冲」细化到了「谁有权定义快慢」。
第二件事:GPT-6 Sol 与 Opus 5.2,一次没有公告的同步放量
发生了什么:据 HuggingNews 9 月 15 日报道,多家用户实测发现访问 GPT-5.6 Sol 时被路由到了新的 GPT-6-Sol,响应速度明显更快;同一天 Sam Altman 发推确认「本周会有一波发布」。同期,多方消息与用户实测显示 Anthropic 的 Opus 系列跳过 5.1,直接放量到 5.2,在 SVG 动画、静态建模类任务上提升明显(来源:HuggingNews、网易号科技自媒体汇总、站内多家用户实测帖)。
这件事技术上值得说的不是分数,而是发布方式的改变:
- 灰度路由替代发布公告 。模型通过路由层静默切换,用户靠「知识截止日期」来分辨自己用上了哪个版本。注意一个细节:截至 9 月 13 日至 16 日,多个模型追踪站(CellCog、OmniaKey)核对了 OpenAI 的 API 模型目录、定价页和 changelog,都没有找到
gpt-6-sol这个 ID------也就是说,官方文档层面这个模型「不存在」,但实际路由里它已经在服务了。文档与生产行为之间出现了时间差。 - 版本号开始跳代 。Opus 直接从 5.x 跳到 5.2 而非 5.1,说明版本号已经从「工程里程碑」变成了「营销信号」------这个细节对做集成的人很重要:版本号不再可靠地对应能力变化,你不能拿版本号做任何工程假设。
- 两周前的 Astra 已经预演过一次。9 月初 GPT-6 Astra 发布后一度暂停 $200 Pro 新订阅,我当时在《本周 AI 观察:五件事指向同一个转向,模型竞争下移到 Flash 层》(https://blog.csdn.net/qq_43274490/article/details/165006168 )里写过,算力和容量的约束正在把「发布会式发布」挤成「灰度式放量」。
把三件事连起来看:「正式发布公告 → 开发者从容迁移」这个流程正在被行业淘汰。对模型厂来说,灰度可以控制风险、可以随时回滚、可以不做承诺;代价则转嫁给了下游------你的集成测试是在 A 模型上跑的,上线那天路由可能已经指向 B 模型。
第三件事:GPT-5.5 官宣退役------「半年生命周期」成为新常态
发生了什么 :OpenAI 官方发布说明确认,2026 年 10 月 14 日,GPT-5.5 将从 ChatGPT、ChatGPT Work 和 Codex 的所有套餐(含企业版)中退役,API 不受影响 ;使用 ChatGPT 登录 Codex 的用户需要在退役前把 gpt-5.5 切换到 gpt-5.6-sol(来源:OpenAI 官方发布说明、Codex 官方 changelog)。而就在半个多月前的 8 月 31 日,GPT-5.4 和 GPT-5.4 mini 刚从 Codex(ChatGPT 登录)退役,分别由 GPT-5.6 Terra 和 Luna 接替。
把时间线排出来看节奏:
| 模型 | 退役/变动 | 时间 | 依据 |
|---|---|---|---|
| GPT-5.4 / 5.4 mini | Codex(ChatGPT 登录)退役 | 2026-08-31 | OpenAI 官方文档 |
| GPT-6 Astra | 发布,一度暂停 $200 Pro 新订阅 | 2026-09-03 | 官方 + 媒体报道 |
| GPT-5.5 | ChatGPT/Work/Codex 全套餐退役 | 2026-10-14 | OpenAI 官方发布说明 |
有两个细节容易被忽略:
第一,API 和产品面的退役是分开的。 官方明确说这次退役「不适用于 OpenAI API」。这意味着产品面(ChatGPT/Codex)的生命周期由订阅与容量逻辑驱动,而 API 面由兼容性承诺驱动。如果你的工作流是「用 ChatGPT 登录 Codex 干活」,你已经在产品面了这个快节奏里;如果是 API 集成,节奏会慢一拍,但 changelog 里那些「alias 路由变化」同样会找上门。
第二,「明年再迁移」的缓冲期没有了。 从 GPT-5.4 到 GPT-5.5 退役之间只隔了六周出头。对个人用户这无所谓,但对把固定模型 ID 写死在 workspace 默认配置、自定义 agent、定时任务里的团队,这就是一个季度的强制技术债偿还计划。官方文档甚至专门列了迁移清单:workspace 默认值、保存的模型设置、托管配置、自定义 agent、定时任务、脚本------每一项都是当年「写死省事」欠下的账。
第四件事:4B 模型开始「为 Agent 循环而生」
发生了什么 :9 月 7 日,前华为诺亚方舟实验室主任王云鹤参与创立的基元律动(NeoHorse)完整开源了 NeoHorse-1,4B 和 9B 两个尺寸,基于 Qwen3.5 后训练,Apache 2.0 协议可商用,9 月 8 日补上魔搭和 GGUF 量化版。它的训练目标不是「更会聊天」,而是工具调用、读取反馈、纠错和代码任务这类 Agent 工作流环节。9 月 8 日,面壁智能与 OpenBMB 也开源了 MiniCPM5-2B,在 Artificial Analysis 榜单 4B 以下开源基座中排第一,并同步开源了训练配方与数据集(来源:今日头条科技号报道、auspia 分析文;官方评测分数均为厂商自报,尚无独立复现)。
这件事的信号意义大于分数本身。过去小模型的路线是「把大模型压小」,蒸馏一下聊天能力,跑跑摘要分类;而 NeoHorse-1 这批模型是直接为 agent loop 训练的:调用工具 → 读返回 → 发现错误 → 调整路径。这不是同一个物种的缩小版,是按另一种工作形态从头训的。
技术上拆一下为什么「agent-native」和「chat-native」是两回事:
- chat 模型的优化目标是单轮/多轮对话质量,对「我上一条工具调用返回 429 了该怎么办」这种环境反馈-行为修正的模式没有任何专门训练;
- agent loop 的成本大头不在「想」,在「跑」------一个每天几千次工具调用的流水线,每步都要过一遍模型,旗舰 API 的账单是线性叠加的。4B 模型在这一层是数量级的成本差,而且延迟更低、可自托管、数据不出域。
当然要把丑话说在前面:十项评测都是厂商自报,独立复现为零;小模型对模糊指令的容忍度远低于旗舰模型;你的 MCP server 和 SDK 习惯它未必认识。它的正确用法不是替代旗舰,而是当工作流里的一个零件------机械步骤给小模型,判断步骤留给旗舰。上周聊过的《前 ChatGPT 研究员做了个不说话的模型:Jev,把智能塞进 if 语句》(https://blog.csdn.net/qq_43274490/article/details/165756830 )其实是同一条线上的另一个极端:连「模型」本身都在被拆开,按环节重新分配。
横向串联:这周的四件事共同指向什么
把四件事放在一起,我读出三个趋势:
1. 「节奏」本身成了竞争武器。 降速话语是一种节奏武器(影响对手和监管的预期),灰度放量是一种节奏武器(不做承诺、保留回滚),半年退役周期也是一种节奏武器(把生态锁进自己的升级轨道)。三家巨头没有人真的在踩刹车------有人在踩别人的刹车,自己的油门没松过。
2. 竞争的计量单位从「能力」转向「单位成本 × 可预期性」。 GPT-6 Sol 打的是性价比层(上周的观察里我写过 Flash 层下移,这个趋势在本周继续坐实),4B agent 模型打的是极致单位成本层。头部竞争的天花板没变,但真正的增量市场在中部和底部------大多数工程任务不需要最强模型,需要的是便宜、快、不出幺蛾子。
3. 「模型」正在从一个整体变成一层可编排的资源。 别名路由、灰度切换、退役清单、小模型分流------这些词在两年前都不存在于 AI 工程词汇表里,现在它们是日常。
对出海 / 跨境技术团队的具体启示
第一,把「模型 ID」当成会过期的凭证来管理。 不要在任何地方写死模型名------配置文件、agent 定义、定时任务、提示词模板里都不行。正确做法是加一层内部别名路由,像管理数据库连接串一样管理模型引用。
第二,给机械步骤建「小模型前置层」。 跨境业务的典型场景------商品信息抽取、多语言邮件初筛、汇率与库存数据拉取、评论监控------大多是「成功条件明确、可批量验证」的机械步骤,这是 4B 级 agent 模型的主场。旗舰 API 留给客户沟通文案、复杂谈判分析这类判断步骤。
第三,退役监控要自动化,不要靠 changelog 手翻。 官方 changelog 是事后记录,灰度切换连记录都没有。唯一的可靠信号是模型列表本身。
一个可直接改造的别名路由 + 退役哨兵骨架:
python
# model_routes.py ------ 别名路由 + 退役哨兵(骨架,可按需改造)
import time, requests
# 内部别名 -> 候选链:primary 挂了/退役,按序降级
MODEL_ROUTES = {
"writer.fast": ["gpt-5.6-sol", "gpt-5.6-terra", "gpt-6-astra"],
"extract.cheap": ["neo-horse-4b", "gpt-5.6-luna"], # 机械步骤优先小模型
"judge.deep": ["gpt-6-astra", "claude-opus-5-2"],
}
def resolve(alias: str) -> str:
"""按别名取当前可用模型:先查可用列表,再按序回退。"""
candidates = MODEL_ROUTES[alias]
available = set(get_model_list())
for model_id in candidates:
if model_id in available:
return model_id
raise RuntimeError(f"[alias={alias}] 所有候选模型均不可用: {candidates}")
def get_model_list() -> list:
resp = requests.get("https://api.example.com/v1/models", timeout=10)
resp.raise_for_status()
return [m["id"] for m in resp.json()["data"]]
def watch_deprecation(interval: int = 3600):
"""退役哨兵:每小时对比模型列表,候选模型消失立即告警。"""
seen = set(get_model_list())
while True:
time.sleep(interval)
current = set(get_model_list())
vanished = seen - current
if vanished:
hit = {m for ids in MODEL_ROUTES.values() for m in ids if m in vanished}
if hit:
# 接你的告警渠道:IM webhook / 邮件 / 短信
print(f"[ALERT] 候选模型消失,触发路由降级复查: {hit}")
seen = current
if __name__ == "__main__":
print(resolve("writer.fast")) # 输出当前实际可用的模型 ID
这个骨架只有两个设计要点:业务代码只认别名,永不直接引用模型 ID ;哨兵盯的是模型列表的差分,而不是官方公告------公告管不住灰度。
FAQ
Q1:灰度切换会不会影响我的输出质量?
会。同一别名下的两个版本在边界 case 上表现不同(网易报道里提到,测试者一度只能靠知识截止日期分辨版本)。建议对关键链路做金丝雀比对:同一批固定用例,分别在路由前后的版本上跑,diff 输出分布。发现漂移再决定是否锁定具体版本。
Q2:GPT-5.5 退役,我到底需要做什么?
分两种情况:用 ChatGPT 登录 Codex 或在 ChatGPT 产品内使用 → 10 月 14 日前把 gpt-5.5 换成 gpt-5.6-sol,并检查 workspace 默认值、自定义 agent 和定时任务(官方迁移清单里的每一项都要过一遍);纯 API 集成 → 本次不受影响,但仍建议按上面的哨兵方案布好监控,下次不一定有这半年缓冲。
Q3:4B 小模型现在能直接替掉旗舰 API 吗?
不能一概而论,按工作流判断:成功条件明确、可批量验证、高频率调用的机械步骤(抓取、抽取、格式转换、监控告警)值得用两周时间盒做 A/B 试点,记录「每完成一次任务的成本」和人工介入率;开放式推理、面向客户的文案、长程规划继续用旗舰。厂商自报的分数只能参考,你自己的任务成功率才是唯一有效数字。
最后
回顾一下这周的完整脉络:
- 开源 vs 闭源把「降速」说开了------降速是安全议题还是护城河,双方第一次把牌摊在桌面上;
- GPT-6 Sol 与 Opus 5.2 悄悄灰度------发布公告让位于灰度路由,版本号失去工程含义;
- GPT-5.5 官宣退役------半年生命周期成为常态,写死的模型 ID 都是技术债;
- 4B 模型转向 agent-native------竞争下沉到「单位成本」,小模型开始为循环而生。
话语在踩刹车,产品在踩油门。作为开发者,与其预测哪边赢,不如把自己的集成层建设成对节奏免疫的:别名路由、退役哨兵、大小模型分流,这三件事比追任何新闻都有用。
上周的深度观察在这里:《本周 AI 观察:五件事指向同一个转向,模型竞争下移到 Flash 层》(https://blog.csdn.net/qq_43274490/article/details/165006168 );开源许可证那篇是这周开源之争的另一种读法:《开源大模型出海开始收费:许可证里的三条路线与真实影响》(https://blog.csdn.net/qq_43274490/article/details/164871451 )。
这个专栏每周五一篇深度观察,其余六天一篇快评,关注不迷路。
你们团队的配置里现在写死了几个模型 ID?最近一次「被迫半夜换模型」是什么时候?评论区聊聊。
专注 AI 工程化实践与出海外贸技术