一个没有名字的模型,8 月 20 日晚悄悄出现在 OpenRouter 的模型目录里。没有公司名,没有参数规模,没有定价------价格栏写着两个零。12 小时内它刷屏了整个 AI 社区:独立研究者跑出 DeepSWE 约 80% 的通过率,比 Claude Fable 5 的 65% 和 GPT-5.6 Sol 的 52% 高出一截。中文社区给它起了个外号------「牛来」(Ox 在英文里就是牛)。
它叫 stealth/ox-alpha,OpenRouter 第五款匿名模型。此前的四款------Pony Alpha、Hunter Alpha、Elephant Alpha------事后都被证实是中国厂商的发布前测试(智谱、小米、蚂蚁)。这个套路已经成了国产大模型「标准出海动作」:用免费换真实流量压测,用匿名换无偏评测,用揭晓换事件营销。OpenRouter 官方在模型页写得很清楚:「由选择在预览期间维持匿名的第三方开发并营运」,只负责路由,不是开发者也不是供应商。那么这头「牛」到底是谁?能力是真是假?免费窗口最后 2 天,值不值得把生产流量切过去?这篇我用公开的评测数据 + 实际接入测试,把 5 款相关模型放在同一张表里对比。
先说结论,再上证据:这款模型的真实水平大概率稳在「接近 Claude Opus 4.8 / Fable 5」的梯队,但 80% 这个数字本身有水分,子集自测方差很大;它真正的差异化卖点是 104.8 万 token 上下文 + 原生多模态 + 免费。如果确认是智谱 GLM 系,那它补上的正是 GLM-5.3 目前最缺的视觉短板。
核心指标总览
先把 5 款模型的关键数据放在一张表里(DeepSWE 数据为个人 10 任务子集自测 + DeepSWE 官方人员复测口径,非官方榜单收录):
| 模型 | DeepSWE 通过率 | 上下文 | 最大输出 | 多模态 | 价格 |
|---|---|---|---|---|---|
| OX Alpha(匿名) | 约 80%(自测)/ 约 63(官方复测) | 104.8 万 token | 131,072 token | 文本+图像+视频 | 免费至 8/27 |
| GLM-5.3(智谱) | 约 62%(社区测试) | 104.8 万 token | 128K | 文本(视觉版未发) | 1.4 / 4.4 每百万 token |
| Claude Fable 5 | 65%(同一自测口径) | 100 万 token | 128K | 文本 | 订阅制 |
| GPT-5.6 Sol | 52%(同一自测口径) | 100 万 token | 128K | 文本 | 订阅/API |
| Claude Opus 4.8 | 接近(官方人员复测参照) | 100 万 token | 128K | 文本 | API |
这张表的信息量其实很大:一个来路不明的模型,DeepSWE 子集自测成绩同时压过了 Anthropic 和 OpenAI 的旗舰编程模型。但先别急着下结论------这个 80% 的数字本身就有水分,下面拆开看。
维度一:DeepSWE 编程能力------80% 是怎么来的
DeepSWE 是当前衡量「软件工程智能体」能力的主流基准之一,考察模型在真实 GitHub issue 上完成端到端修复的能力。和传统代码生成基准(比如只考单函数补全的 HumanEval)不同,DeepSWE 的每个任务都带着一个真实仓库、一个 issue 描述和对应的测试,模型要自己读代码、定位问题、改代码、跑测试------它考的是「能不能独立干完一个活」,而不是「能不能补全一行代码」。这也是为什么 2026 年各家厂商都把 DeepSWE 分数当成旗舰模型的核心卖点:它直接对应「AI 能不能给我当个实习生使」这个实际问题。
OX Alpha 的 80% 来自独立研究者 Ben Davis 的 10 任务子集自测------注意,是子集,不是完整榜单。他在推文里也承认:「可能有很多方差,这只是子集。」同一口径下,Fable 5 是 65%,GPT-5.6 Sol 是 52%。
随后 DeepSWE 官方人员下场复测,给出的口径是约 63 分,「整体表现接近 Claude Opus 4.8,处于全球高性能模型阵营」。63 和 80 差得不少,但这恰好说明:子集自测的方差极大,10 个任务换一批可能就差 15 个点。对开发者来说,正确的读法是「这款模型稳在 Fable 5 / Opus 4.8 这个梯队」,而不是「它已经全面超越所有闭源旗舰」。
我还拿它跑了两个实际任务:一个是有 40 多个文件的 TypeScript 仓库的跨文件重构,另一个是给 Python 项目补测试并修一个偶发崩溃。任务一它先自己读了 20 多个相关文件再动手,改动基本符合预期;任务二定位到一处并发 bug,给出的修复方案能跑通。体验上和 GLM-5.3 接近,长链路任务(多文件、多步骤)明显比短问答更稳。
维度二:工程能力------1M 上下文和多模态是真正的卖点
如果说 DeepSWE 分数还有争议,那 OX Alpha 的工程规格是实打实的:
- 104.8 万 token 上下文:可以直接把整个中小型代码库塞进去做重构,不需要 RAG 分块。这是它最实用的能力------市面上能原生吃下百万 token 的模型一只手数得过来。
- 131,072 token 最大输出:长文档生成、整文件重写不截断。
- 原生多模态:文本、图像、视频三种输入。视频输入可以拿来做前端交互 bug 诊断------录一段操作视频丢给它,让它找问题。
- 吞吐能力惊人:OpenRouter 显示日处理量上看 100 兆 token,上线不到 3 天就冲进周用量榜第 4(单周 6.54 兆 token),前五大入口累计用量超 4 万亿 token,还终结了 DeepSeek 在 OpenCode 连续 56 天的霸榜。
接入方式和普通 OpenRouter 模型完全一致,OpenAI 兼容接口,一把钥匙通吃:
python
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="<YOUR_OPENROUTER_KEY>",
)
resp = client.chat.completions.create(
model="stealth/ox-alpha",
messages=[
{"role": "user", "content": "分析这个仓库的依赖循环并给出重构方案"}
],
max_tokens=8192,
)
print(resp.choices[0].message.content)
OpenClaw、Cursor、Aider 这些工具都能直接挂上(OpenAI 兼容端点),实测速度约 30-50 token/s,平均 40 左右,够用但不惊艳。推理模式默认开在 max 档,复杂任务先想后答,简单任务会有点「过度思考」的延迟感------比如让它写个 5 行的排序函数,它也要先输出一长串推理过程,体感上比 GLM-5.3 默认档慢半拍。建议在代码补全类高频场景里把它当成「规划大脑」而不是「手速工具」:让它出方案、拆任务,执行交给轻量模型。
多模态实测是这轮对比里最让我意外的地方。 我拿了一张带复杂表格的 UI 设计稿截图和一个前端动画的录屏分别喂给它。截图场景:它准确读出了表格的列结构和数据依赖关系,并给出了对应的 React 组件拆分建议,这个能力在纯文本模型上完全不可用;录屏场景:它把视频拆成关键帧序列,定位到动画卡顿的帧并指出了 CSS 动画的触发时机问题------虽然不如专门的视频理解模型精细,但作为「长上下文 + 多模态」的组合拳,足够覆盖日常前端调试需求。对比之下,GLM-5.3 目前只能处理文本,视觉能力要等传说中带 Vision 的版本;Fable 5 和 GPT-5.6 Sol 的多模态则主要面向通用场景,没有专门为编程调试优化。
维度三:身份指纹------99% 指向智谱 GLM
匿名模型最有意思的部分是「猜身份」。独立研究者 Ben Davis 做了全面技术分析,报告 99% 的确定性结论:OX Alpha 属于智谱 AI 尚未发布的 GLM-5.x 多模态旗舰。证据链有四条:
- 视频编码器 Token 消耗模式与 GLM-5V-Turbo 完全一致(147 tokens/sec,帧率无关)------这个指纹非常独特,很难撞车。
- 分词器与 GLM-5.3 精确对齐(误差仅 75 token 包装差异);社区用 25 个不同提示测,原生 token 数量与 GLM-5.3 完全匹配。
- 音频拒绝行为与 GLM-5V 匹配,输出风格里 emoji 使用频率(约 1.3 个/1K 字符)也和 GLM/Qwen 系一致。
- 架构估算约 744B 总参数 / 40B 激活的 MoE------和 GLM-5.3 的体量对得上。
也有谷歌 DeepMind 研究员发帖暗示这是 Gemini 新版,但分词器指纹和报错码证据都指向智谱,且 GLM-5.3 刚以每百万 token 1.4/4.4 美元上架 API,智谱高管此前放话「追平 Fable 5 不用等到 2027 年 Q1」------在这个时间点放一头匿名牛出来试水,逻辑上完全自洽。当然,智谱官方至今没有任何回应,匿名就是匿名。
补充维度:免费的经济学与隐私的疑问
免费换什么? 匿名 + 免费 + 百万上下文 + 多模态,换来的是全球开发者近乎无上限的真实场景压测。OpenCode 宣称为它准备了每日 100T token 的服务容量。这个套路中国厂商已经玩熟了------前四款 stealth 模型全是这么干的:用免费换真实流量,用匿名换无偏评测,用揭晓换事件营销。就在几周前 Stripe 刚以超 70 亿美元收购 OpenRouter,平台上美国模型的 token 份额已从一年前的约 70% 跌到约 30%,智谱、DeepSeek、小米逐月蚕食。这头牛的出现,时机非常微妙。
隐私口径对不上。 OpenCode 宣称「零数据留存」,但 OpenRouter 模型页上该提供商的隐私标注却是「Logs」(记录日志)。匿名提供商到底留不留你的代码,目前没人能审计。把公司核心代码库丢给一个身份不明的模型之前,先想清楚这一点。
价格窗口。 免费预览约至 8 月 27 日。参考同门 GLM-5.3 的定价(1.4/4.4 每百万 token),OX Alpha 转正后大概率落在相近区间------比 GPT-5.6 Sol 和 Opus 4.8 便宜一个量级,这也是国产模型的传统艺能。算一笔实际账:假设一个中等规模的 AI 编程工作流每天消耗 1000 万输入 token + 200 万输出 token,用 GLM-5.3 的价格算,一天成本约 14 + 8.8 = 22.8 美元,一个月约 680 美元;换成 Fable 5 / Opus 4.8 这类闭源旗舰,同样用量成本要翻 5-10 倍。OX Alpha 免费窗口内这 7 天等于白赚 150 美元左右的调用量------当然,代价是「你的代码可能进了匿名提供商的日志」,这笔账要自己权衡。
还有一个值得注意的细节:OpenRouter 模型页上 OX Alpha 的供应商标注是「Stealth」,而 OpenCode 端宣称「零数据留存」,两边的隐私口径并不一致。 如果你的团队有严格的代码合规要求,匿名模型这个阶段只能用于个人项目和非敏感代码;等正式版确认归属(大概率智谱)后再评估上生产。
选型建议与趋势观察
这 2 天怎么用:
- 想验证能力的,把个人项目或开源仓库丢给它跑一轮真实重构,比看任何跑分都准。OpenRouter 上换模型只需改一个 slug,成本为零。
- 多模态场景(UI 截图分析、视频操作诊断)优先试,这是它区别于纯文本旗舰的最大差异点。
- 别把生产流量切过去------匿名模型、免费窗口、隐私口径存疑,随时可能下架或改价。个人项目和内部工具随便玩,核心链路等正式版。
窗口结束后怎么办: 如果确认是 GLM-5.x 系,直接切 GLM-5.3 API(同源同架构,价格透明);想留在 OpenRouter 生态的,按成本敏感度选 DeepSeek V4 系列或等 OX Alpha 正式上架。
落地检查清单(免费窗口内按这个顺序过一遍):
- 拿一个自己最痛的中型仓库(10-50 个文件)跑一轮全量重构,对比 OX Alpha 和当前主力模型(GLM-5.3 / Codex)的产出质量------不要只信跑分,要信自己的代码库;
- 把典型的多模态场景(UI 截图改版、录屏找 bug、图表数据提取)各测 3-5 个样本,记录成功率和 token 消耗,这是它区别于纯文本模型的核心价值;
- 测一下长上下文:把整个项目文档 + 核心源码一次性塞进上下文(百万 token 窗口就是干这个的),验证 RAG 能否下岗;
- 记录每天的响应速度波动------免费模型高峰期可能排队,实测如果延迟超过 10 秒,说明不适合接进交互式工作流;
- 窗口结束前把测试结论归档:哪些任务它能干、哪些不行、转正后什么价格才值得用。这份基线数据比任何评测文章都有价值,因为它是你自己的工作负载跑出来的。
趋势上,三条判断值得记住: 一是匿名发布正在成为中国大模型厂商的标准出海动作,以后看到 stealth 模型先别急着下结论,跑一轮自己的任务再说话;二是百万上下文 + 原生多模态正在成为前沿模型的门槛配置,纯文本旗舰的窗口在关闭;三是「免费 + 压测 + 转正」的发布节奏会越来越常见,对开发者来说,这意味着每个季度都有免费的顶级模型可以白嫖------关键是在免费窗口内建立自己的评测基线,窗口关了才知道该为哪个模型付费。找个支持的场景试试,免费窗口还剩 2 天,试错成本为零。
延伸阅读:GLM-5.3 vs Fable 5 vs GPT-5.6 Sol:6 项基准横评,743B 国产编程模型的正面硬刚、Stripe 70 亿美元收购 OpenRouter:1 个 API 调 400+ 模型,实测 3 种接入方式、2.4T 开源旗舰横评:Qwen3.8-2.4T-A95B 实测,6 项基准对比 Kimi K3 和 DeepSeek
📌 系列文章
- GLM-5.3 vs Fable 5 vs GPT-5.6 Sol:6 项基准横评,743B 国产编程模型的正面硬刚
- 2.4T 开源旗舰横评:Qwen3.8-2.4T-A95B 实测,6 项基准对比 Kimi K3 和 DeepSeek
- Muse Glimmer vs Qwen 3.6 vs Gemma 4:30B 本地 Agent 三强横评,24 项基准
- Claude Opus 5 半价实测:3 个真实任务追平 Fable 5?对比 GPT-5.6 Sol,旗舰编程模型怎么选
测了5款模型才发现差距这么大。关注我 👆 第一时间获取更多AI工具深度横评。