文章目录
- [1. 先甩个炸裂的数据](#1. 先甩个炸裂的数据)
-
- [1.1 这增长曲线,放在整个AI圈都相当罕见](#1.1 这增长曲线,放在整个AI圈都相当罕见)
- [2. 它家有个很特殊的岗位,专门衔接研究和产品](#2. 它家有个很特殊的岗位,专门衔接研究和产品)
-
- [2.1 传统产品经理的经验,在这儿基本没用](#2.1 传统产品经理的经验,在这儿基本没用)
- [2.2 用户一句"不好用",得拆出八百个问题](#2.2 用户一句“不好用”,得拆出八百个问题)
- [3. 用户的吐槽,怎么变成模型的训练目标](#3. 用户的吐槽,怎么变成模型的训练目标)
-
- [3.1 当年80%的投诉,居然都是同一个小问题](#3.1 当年80%的投诉,居然都是同一个小问题)
- [3.2 评测,就是新时代的PRD](#3.2 评测,就是新时代的PRD)
- [4. 编程这条路,是怎么被当成战略重点的](#4. 编程这条路,是怎么被当成战略重点的)
-
- [4.1 没人喊着要编程Agent,但用户用脚投票了](#4.1 没人喊着要编程Agent,但用户用脚投票了)
- [4.2 为啥偏偏是编程?因为它天生适合闭环](#4.2 为啥偏偏是编程?因为它天生适合闭环)
- [4.3 模型能力上去了,产品反而跟不上了](#4.3 模型能力上去了,产品反而跟不上了)
- [5. 爆火的Claude Code,起源居然是个私人小工具](#5. 爆火的Claude Code,起源居然是个私人小工具)
-
- [5.1 工程师随手写的玩具,火到创始人以为是强制使用](#5.1 工程师随手写的玩具,火到创始人以为是强制使用)
- [5.2 核心功能,全是从用户"偏方"里收来的](#5.2 核心功能,全是从用户“偏方”里收来的)
- [5.3 为啥要放出来?自己用不好吗](#5.3 为啥要放出来?自己用不好吗)
- [6. 10天做出Cowork?哪有什么凭空的奇迹](#6. 10天做出Cowork?哪有什么凭空的奇迹)
-
- [6.1 好多人拿编程工具,干着跟代码无关的事](#6.1 好多人拿编程工具,干着跟代码无关的事)
- [6.2 10天做出来的,是攒出来的产品](#6.2 10天做出来的,是攒出来的产品)
- [6.3 更复杂的场景,反而是更好的养料](#6.3 更复杂的场景,反而是更好的养料)
- [7. 下一代模型怎么规划?思路完全不一样](#7. 下一代模型怎么规划?思路完全不一样)
-
- [7.1 不排功能版本,先铺能力轴](#7.1 不排功能版本,先铺能力轴)
- [7.2 模型不是组装出来的,是"培养"出来的](#7.2 模型不是组装出来的,是“培养”出来的)
- [7.3 做的不是模型,是整套系统](#7.3 做的不是模型,是整套系统)
- [8. 真正的底层逻辑:模型和产品一起转的循环](#8. 真正的底层逻辑:模型和产品一起转的循环)
-
- [8.1 原型文化:让千朵花先开着](#8.1 原型文化:让千朵花先开着)
- [8.2 用AI分析AI的反馈,规模化找问题](#8.2 用AI分析AI的反馈,规模化找问题)
- [8.3 行业的下一战,比的是谁的闭环转得快](#8.3 行业的下一战,比的是谁的闭环转得快)

P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/H1727548
1. 先甩个炸裂的数据
截至今年7月底,Anthropic的年化营收已经冲到了650亿美元。
什么概念?去年底这个数字还只有90亿,7个月翻了7倍多。
1.1 这增长曲线,放在整个AI圈都相当罕见
刚过去的二季度,它单季收入超115亿美元,同比涨了14倍,更狠的是营业利润首次转正了。
现在前沿AI公司的普遍生存状态,基本是左手拿融资右手烧算力,财报比谁亏得少就算赢。
结果Anthropic直接交了份盈利答卷,相当于全班都在补考,有人悄咪咪拿了满分奖学金。
很多人说,这不就是模型强吗?但模型强的公司不止它一家,为啥钱都让它赚走了?
2. 它家有个很特殊的岗位,专门衔接研究和产品
要搞懂它的增长,得先从内部一个很少见的岗位说起------技术产品经理。
这个岗的位置很微妙:一头扎进AI研究团队,跟着盯模型最新进展;另一头连着产品实验室,琢磨新能力能长出什么产品。
2.1 传统产品经理的经验,在这儿基本没用
传统互联网做产品,技术地基是稳的,产品经理照着需求排功能就行,顶多改改按钮颜色。
但前沿AI公司不行,地基每隔几个月就可能天翻地覆。
你今天熬三个通宵写的PRD,下个月新模型一出,直接作废,比翻书还快。
这个岗位的核心工作,就是管理这种不确定性。
2.2 用户一句"不好用",得拆出八百个问题
用户吐槽一句"这AI不好使",搁普通公司可能就回个"感谢反馈"。
他们不行,得扒到底:是模型本身笨?还是工具不好用?是界面反人类?还是底层基建拖了后腿?
甚至用户拿AI干了个研发团队都没想到的活儿,他们也得判断:这是偶然玩票,还是新的产品机会?
说白了,就是研究和产品之间的翻译官+侦察兵。
3. 用户的吐槽,怎么变成模型的训练目标
光有岗位不够,得有落地的方法。他们最核心的一招,就是把模糊的用户反馈,变成可重复跑的评测。
3.1 当年80%的投诉,居然都是同一个小问题
早在Claude 2刚上线的时候,用户天天骂它"不听指令"。
这话听着严重,但根本没法直接给研发改。用户不会区分是预训练的锅还是后训练的问题,他们只知道事儿没办成。
团队翻了一堆用户授权的失败记录,顺着往下查,结果发现80%的投诉,根源都特别琐碎:输出的JSON格式不对。
少个括号,多根逗号,API直接拒绝请求。对聊天来说可能不算啥,但对要连续调用工具的Agent,等于第一道门就卡死了。
相当于你点外卖,骑手刚出商家门就摔了,饭根本到不了你手上。
3.2 评测,就是新时代的PRD
找到问题之后,他们没有只修bug。团队收集了三四十个真实失败案例,写清输入、理想输出和通过标准,做成了一组可以反复跑的评测。
之后每一代新模型,都必须过这组测试。到现在,这组评测的通过率已经接近100%,JSON问题再也不是投诉重灾区。
他们内部有句话:Evals are the new PRDs。
传统PRD能描述功能,但说不清楚一个概率系统该怎么表现。评测就不一样了,输入输出标准明明白白。
研发用它比方案,产品用它验问题,发布团队用它防退步。大家终于有了统一的判断标准,不用再扯"我觉得"。
4. 编程这条路,是怎么被当成战略重点的
很多公司都在做AI编程,但Anthropic能跑出来,不是一开始就赌对了,是从用户行为里看出来的。
4.1 没人喊着要编程Agent,但用户用脚投票了
最开始大家用代码模型,都是补一行代码、写个函数,最多解释下逻辑。
慢慢的,团队发现不对了:越来越多用户直接把一整段编码任务甩过去,让AI从头做到尾。
没人跑到官网留言说"快做个编程Agent",但用户身体很诚实,用法已经变了。
就像你本来只卖单个面包,结果发现大家都整箱整箱搬,你就知道该开生产线了。
4.2 为啥偏偏是编程?因为它天生适合闭环
编程这个场景,特别适合做AI的反馈闭环。
代码能不能跑,测试过没过,改完崩没崩,全是硬标准,一眼就能看出来。
不像写文案做方案,你说写得好我说写得烂,吵三天没结果。代码往编译器一扔,行就行不行就不行,非常耿直。
它既能当产品场景,又能当训练方向,还能当评测环境,一举三得。
4.3 模型能力上去了,产品反而跟不上了
确认了方向,他们直接把长代码生成提升成了模型的核心优先级。
Claude 3 Opus发布之后,编程能力慢慢成了它的招牌。到Claude 3.5 Sonnet出来,内部编程评测直接从38%冲到了64%。
这时候模型已经不只是写代码的工具,更像个能搭项目、改bug的编程协作者。
但问题也来了:用户还得自己复制代码、手动跑命令、贴报错信息,来回折腾。
模型的能力已经溢出了,但市场上没有合适的产品把这份能力放出来,有劲没处使。
5. 爆火的Claude Code,起源居然是个私人小工具
填补这个空白的Claude Code,说起来出身特别草根。
5.1 工程师随手写的玩具,火到创始人以为是强制使用
2024年下半年,工程师Boris刚加入实验室,为了熟悉公司API,自己随手写了个极小的终端聊天程序。
先接了个命令行,后来又加了文件编辑功能,天天用新模型测着玩。这就是Claude Code的初代原型。
写好两天他就发给同事试了试,结果第二天发现对面工位的工程师已经用它正经写代码了。
他没搞过正式推广,就发了篇内部帖子,结果全公司工程师口口相传,日活涨得跟坐火箭似的。
后来内部评审会上,创始人看着陡直的增长曲线都懵了,质问团队是不是强迫员工用这工具。
5.2 核心功能,全是从用户"偏方"里收来的
最开始三个月,基本就是Boris一个人在维护这个工具。
很多关键功能,都不是会议室里规划出来的,是用户自己先琢磨出了用法。
比如有人会专门写个Markdown文档,记清楚项目结构、编码规范、测试命令,每次让AI先读这个。
还有人总反复提醒:先别写代码,先给我个思路和计划。
这些本来是用户自己摸索的提示词技巧,用的人多了,团队就直接收拢成了正式功能。前者成了CLAUDE.md,后者就是Plan mode。
主打一个从群众中来,到群众中去。
5.3 为啥要放出来?自己用不好吗
当时内部有个选择:把Claude Code留着当内部生产力工具,相当于自己开外挂。
但Boris坚持要对外开放。理由很简单:实验室里的评测再精准,也模拟不了真实世界里千奇百怪的代码库和bug。
放出去让真实用户用,才能拿到最实在的反馈,相当于免费找了几十万测试工程师。
2025年初,Claude Code以研究预览版上线,它既是产品,也是个收集真实工作流反馈的研究工具。
6. 10天做出Cowork?哪有什么凭空的奇迹
Claude Code火了之后,更有意思的事发生了。
6.1 好多人拿编程工具,干着跟代码无关的事
团队慢慢发现,大量用户根本不用它写代码。
有人用它规划旅行行程,有人用它整理邮件做PPT,还有人靠它从坏了的硬盘里恢复照片,甚至接入智能家居控制家电。
对这些用户来说,代码只是AI完成任务的中间工具,他们要的从来不是代码,是最终结果。
合着你们买个电钻,就是用来开核桃是吧。
甚至不少没编程基础的用户,都愿意硬着头皮学这个有门槛的工具。
信号很明显了:通用的知识工作Agent,需求已经藏不住了。
6.2 10天做出来的,是攒出来的产品
察觉到机会,团队决定做一个普通人也能用的版本,不用懂代码也能让AI干活。
听起来像天方夜谭?他们真就10天把原型做出来了。
但真不是什么魔法。前面一年多,模型能力、Agent框架、各种零散的功能组件,其实早就做好了,散在各个团队里。
这次不用从零搭,直接复用Claude Code的核心框架,把现成的零件拼起来就行。
开发的时候更夸张,每个工程师同时开三八个Agent,有的写界面,有的做后端,有的查方案,还有的专门修刚报的bug。
人只负责分任务、做决策、验收结果,效率直接拉满。
说白了,零件都在仓库堆着,等时机到了组装一下,当然快。
6.3 更复杂的场景,反而是更好的养料
Cowork上线之后,相当于把AI从代码库扔进了更模糊的真实工作里。
不用写代码了,但任务也更模糊了:可能是"整理份数据""做个PPT",要求说不清楚,边界也不明确。
AI得自己判断什么时候该问用户,什么时候该直接干活,最后还要交出能用的结果。
这些更复杂的真实场景踩的坑、暴露的问题,又会反馈回模型和工具的迭代里,让下一轮更强。
7. 下一代模型怎么规划?思路完全不一样
聊了这么多产品,再说说他们怎么做模型规划,思路和传统软件公司完全是两个路数。
7.1 不排功能版本,先铺能力轴
传统软件的路线图,都是下个季度上什么功能,下个版本改什么界面,排得明明白白。
Anthropic不这么干。他们先把版本号扔一边,往远了想:如果AI真能替人干这份工作,它得具备哪些能力?
比如替你整理工作日历,不是加个日历功能就完事了。它得能看懂页面,能理解会议内容,能发现时间冲突,能判断哪些会可以挪,出了新冲突还得会调整。
这不是一个功能,是视觉识别、语言理解、工具调用、错误恢复一堆能力凑出来的结果。
他们讨论的从来不是"这个功能放哪个版本",而是这些底层能力现在到哪一步了,还差多少。
7.2 模型不是组装出来的,是"培养"出来的
他们内部有个很有意思的说法:做模型像"培养",不像做工程。
哪怕定好了训练方案、模型架构,你也只能大概预判方向,没法精准知道最后它擅长啥、不擅长啥。
就像种植物,你浇水施肥,但它最后长什么样,得真长出来才知道。偶尔还能长出点意料之外的特性。
所以产品经理不能等模型训完了再想怎么卖,训练开始前就得参与定义"模型需求"。
一边盯着"想让它长成啥样",一边不断确认"它实际长成了啥样"。
7.3 做的不是模型,是整套系统
很多人觉得,做模型就是把模型本身做好就行。他们不这么看。
同一个底层模型,放在聊天网站、开放API、Claude Code和Cowork里,配上不同的提示词、工具和工作方式,最终表现天差地别。
所以他们打造的从来不是一颗孤立的模型,而是"模型+运行环境"组成的一整套系统。
8. 真正的底层逻辑:模型和产品一起转的循环
说到这儿其实就能看出来,它的增长不是靠某一个爆款产品,也不是单靠模型强,是整套协同的机制跑通了。
8.1 原型文化:让千朵花先开着
AI把做原型的成本打下来了。有个想法不用先申请预算、拉团队、排半年期,一个人花几天就能做个小样出来。
他们内部特别鼓励这个,不光产品工程,研究、销售甚至招聘部门,都有人自己搭工具原型。
用他们的话说,叫"让千朵花绽放"。反正试错便宜,都先做出来,有人用就继续迭代,没人用就拉倒。
原型多了,模型的新能力才能最快被放进真实场景里试,谁也不知道哪个小工具最后能长成大产品。
8.2 用AI分析AI的反馈,规模化找问题
产品放出去之后,用户反馈是海量的,靠人一条条看根本看不过来。
他们现在的做法,是让Claude自己分析关于自己的用户反馈。先让模型把海量反馈聚类分组,找出反复出现的问题,再把零散的吐槽抽象成可复现的失败类型。
有时候几十个案例,就足以证明某个缺陷是稳定存在的。不用全量统计,也能把"感觉不好用"变成"这个问题可以复现、可以测试"。
当然,最后要不要花算力去改、优先级排多少,还是人来拍板。AI只是工具,决策还得人来做。
8.3 行业的下一战,比的是谁的闭环转得快
AI行业最早比理论突破,比谁的技术路线更牛;后来比算力规模,比谁的数据多质量高。
再往下走,胜负大概率就看一件事:产品和模型的齿轮能不能真正咬合,循环能不能转得足够快。
原型出得越快,能力发现得越早;真实用得越深,反馈就越具体;评测越贴真实场景,下一轮训练就越准。
每转一圈,都能给下一圈加速,这才是真正的复利。
光有强模型没用,能把模型能力变成真金白银的产品,还能反过来喂大模型,这才是真的护城河。
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/H1727548