Anthropic 把 Chat 和 Cowork 并成了一个入口。以后不用判断手上的活该丢给哪个框,问一句可以,丢一份几十页的东西让它自己啃也行。攒下的对话、Skill 和连接器都还在。它能调用文档、表格、演示、视觉这几套东西,也能在后台接着跑,不用你把屏幕亮着。据说未来几周先给 Pro 和 Max 推。
同一周,OpenAI 总裁 Greg Brockman 在一档访谈里说,我们已经进入 AGI 时代。理由跟跑分没关系:GPT-6 Astra 能自己连着干满 24 小时。过去十年大家拿准确率当标尺,现在的标尺换成了能不间断工作多久。
24 小时这个数字单看没什么,脚本也能连跑一天。让它变重的是 Brockman 讲的另一件事。
他那个人站是个没什么流量的静态博客,放着几篇文章。他让 Codex 去查漏洞,15 分钟回来报了 13 条:SPF 记录没配好,别人能伪造他的邮箱发信;站点还在跑 HTTP,没强制跳 HTTPS;诸如此类。每一条单拎出来都不算事。他追问了一句:你能修吗。接下来 45 分钟,模型自己打开云服务的控制面板,一路点过去,配好响应头,把站点迁了个托管方式,还起了 DMARC 流程------那个流程要等 48 小时,它顺手挂了个自动任务,两天后回来收尾。
全程他没写一行代码,说了两句话。
顺带说下 GPT-6 这个编号的来历。Brockman 讲,他们一直希望下一个模型配得上这个号,可模型总是一点一点变好,每次都觉得该叫 5.7、5.8,永远等不到那个时刻。到 Astra 才第一次出现近乎不连续的跳变------他自己也承认能力是锯齿状的,写作头一回读着不那么油腻了,可还算不上好。
同一场访谈里还有个数字我记下来了:OSWorld 2.0 的延迟模拟中,Astra 拿到 72.6%,每项任务约 40 分钟;上一代 GPT-5.6 Sol 是 65.7%,每项约 75 分钟。比的不是答得对不对,是用一台电脑把事办完要多久。Brockman 还顺口提了一句,他们真放出一万个 Agent 去解纳维-斯托克斯,最后拿下的那一组就是这个量级。scaling 的对象从参数换成了并发。
所以 24 小时衡量的不是能运行多久,而是没人在旁边盯着的时候,它能不能把一个要等待、要跨系统操作的多步骤事情办到底。前者是脚本,后者是代理。中间那层,行业现在叫 Harness------模型外围决定怎么拆任务、什么时候问人、什么时候接着干的框架。
入口统一还有个不太显眼的代价:你不清楚它是怎么把活干完的。以前分开几个工具,至少能猜到这份东西走的是哪条链路;现在全在一个框里,出问题时你手里能抓的只有结果。要交付给别人的人得自己留一份能追溯的记录,把关键步骤的产物单独存下来,别全押在对话历史上。
Claude 那条合并新闻讲的是同一件事。过去 Anthropic 把能力摊成几个房间,用户得先判断这活属于哪个房间。真实工作不按产品的分界线切:一份东西可能要查资料、跑数据、写正文、配图、改三遍,最后还得能拿去演示。让人先做分类,等于把机器的内部实现细节丢给用户。现在这层判断被收走了。
少点几下鼠标对我没那么重要,变的是流程里人的位置:一端是提需求的质量,另一端是验收的严谨,中间那段"怎么做"不再需要你。
Brockman 有句话讲得挺直:不该由人一点点从 AI 身上把能力挖出来,应该是 AI 主动告诉你能用哪种新方式帮你。他还报了个数字,ChatGPT 周活大约 11 亿,另有大约 15 亿人用过之后不再来了,是现有周活的 1.4 倍。他把这个归因为产品形态的毛病。要我说,更准确的说法是大多数人还在拿上一代的心智用这一代的工具。
中间那段被掏空之后,你拿什么证明自己不可替代?我给自己的答案是验收。Anthropic 那边 Claude 写掉了公司八成的合并代码,代价是测试规模涨十倍、CI 任务量半年涨二十五倍,内部那套测试选择服务被压垮了三次。产量暴涨之后,堵点一定挪到验证上。独立开发者没有 CI 团队,没有运维,唯一的防线是自己有没有一套能自动收拾烂摊子的机制。我现在的做法是,AI 每交一版改动,先跑固定的回归集,再去看 diff。慢,但问题留在了我看得见的地方。
验证最终落到同一个东西上:机器。跑测试要机器,跑评测要机器,跑一遍完整回归也要机器。你可以去蹭各种免费额度,也可以咬牙买张卡------后者我试过一次,装完驱动搭完环境,一个下午没了,然后它开始吃灰。
这也是我后来把这块交给别人的原因。我现在用算力租赁,账号开下来的时候 不用我去跟 flash-attention 的编译错误较劲。用多少算多少,没有最低消费,POC 阶段跑两三个通宵的实验,账单也就那么回事。深夜训练炸显存的时候还有真人能回句话,这一条比参数表上任何一个数字都实在。