我是程序员出身,在量化这行做了不到十年。这两年因为工作需要,被迫从零啃过两个完全陌生的领域,也看着身边十来个朋友用 AI 换赛道------有人三个月就交出了能拿出手的东西,有人一年过去还停在"跟 AI 聊得很开心"。
这篇不是产品测评,是把我们踩过的坑、试出来的顺序整理成一套可以照着做的方法。信息截止到 2026 年 8 月。
先说结论,赶时间的可以只看这三句:
- AI 压缩的不是"入行",是"入行前的无效摸索"------真正决定成败的那几段,它压不动;
- 只把"你能验证的东西"交出去,让它做执行和陈列,不要让它替你做选择;
- 把学到的东西沉淀成 Skill,而不是沉淀成聊天记录------这是新手和熟手最大的分水岭。
考虑到国内订阅claude确实有点困难,可以参考一下这里:ClaudeMax.shop
下面展开。
一、先泼一盆冷水:被压缩的部分不是均匀分布的
我把"入一个新行"拆成六段,然后拉着身边 11 个转行的人对了一遍各自的实际耗时。结果长这样:

看清楚这张图的形状:前四段被压掉了 4 到 6 倍,后两段几乎没动。
原因很简单。前四段的瓶颈是信息不对称------你不知道该看什么书、不知道行业里在吵什么、不知道那个报错是因为版本不兼容还是你写错了。这类瓶颈,一个能联网、能读文档、能跑代码的模型可以直接碾平。
后两段的瓶颈是反馈延迟。市场不会因为你用了更好的模型就提前一个月告诉你策略是不是过拟合;客户不会因为你方案写得快就提前签字;线上事故也不会因为你代码是 AI 写的就少发生。
所以第一条判断标准,我建议你现在就改掉:
❌ 不要用"我学得多快"衡量进度 ✅ 要用"我拿到第一次真实反馈用了多久"衡量进度
很多人三个月学完了别人两年的量,然后卡在那儿再也动不了------因为他从来没让任何真实世界的东西打过自己的脸。
二、唯一重要的判断标准:可验证性
这两年我只用一张表决定"这活要不要交给 Claude"。两个轴:结果的可验证性 、它能替我省下多少。

新手最典型的翻车方式,是把左上角的活当成右上角来做。
举三个量化里的具体例子,你感受一下差别:
你问的问题
落在哪
该怎么处理
"帮我写一段做行业市值中性化的代码"
右上 · 全速委托
直接给。我能对拍、能跑单测、能看残差,半小时内知道对不对
"这个因子在 A 股还有效吗?"
左上 · 高危
绝对不能直接采信。它给的是语料里的共识,不是你数据上的事实
"这次风控要不要降仓?"
左下 · 不可外包
它可以帮我列清单,但按钮我按,责任我担
于是有了我的第二条硬规则:
在你能独立复核之前,不要让 Claude 替你做任何"选择",只让它做"执行"和"陈列"。
落到具体操作上,就是把提问方式换掉:
scss
❌ "这两个方案哪个更好?"
✅ "把所有可行方案列出来。对每一个:
(1) 它在什么假设下成立
(2) 它最可能以什么方式失败
(3) 我需要拿到什么数据/做什么实验,才能把它和其他方案区分开
最后告诉我,哪一条分辨成本最低,我先做那个。"
第二种问法的产出是一张实验清单 ,判断权还在你手里;第一种问法的产出是一个你无法反驳的结论,你只能选择信或不信------那就不是学习,是算命。
三、2026 年 8 月,这套工具具体该怎么配
Claude 现在已经不是"一个聊天框"了,不同的活对应不同的入口。我按用途给你一张对照表:
你要干的事
用哪个
关键点
摸清行业地形、画知识地图
claude.ai 对话 + 联网搜索 + Research
必须逼它给出处
把环境、数据管道一次跑通
Claude Code(终端 / VS Code / JetBrains)
让它直接动文件,不要复制粘贴
读 200 份 PDF、整理成结构化表格
Cowork(桌面端为主,2026 年 7 月起 web 与移动端 beta)
给它一个文件夹,不用一个个上传
财务模型、数据表里的活
Claude for Excel(侧边栏加载项)
它会标出改了哪些单元格,可回溯
接自己的数据源 / 内部系统
MCP 连接器
别把私有数据贴进对话框,走连接器
沉淀方法论,让它下次自动照做
Agent Skills(SKILL.md)
见 3.3,这节最重要
3.1 地形侦查:第一个 prompt 就该写长
新手最浪费时间的地方,是把第一天当成"随便聊聊"。我的做法是一次性把地形图要全:
markdown
我要在 3 个月内进入 <目标领域>,我目前的背景是 <诚实描述,包括短板>。
请先联网检索 2026 年以来的资料,再回答,不要只用你的记忆。然后输出:
1. 这个领域的 5 条主线(不同流派 / 技术路线),每条的代表机构、代表工作、代表人物
2. 一张黑话表:40 个内行天天说、外行听不懂的词,每个 20 字以内解释
3. 近三年内被证伪或已经过时的 5 个流行说法(我不想学错东西)
4. 以我上面的背景,哪 3 件事是我的现成优势,哪 3 件是硬伤
5. 分歧地图:这个领域现在还在吵什么?各方的核心论据分别是什么?
要求:把"有共识的事实""业内主流观点""你的推测"分开标注。
凡是 2026 年的信息,必须附出处链接。
这里有个必须知道的技术细节: 模型的可靠知识截止日期是有限的(Opus 5 是 2026 年 5 月,Sonnet 5 与 Fable 5 是 2026 年 1 月)。你要入的行如果最近半年刚发生过大事------新规落地、龙头出事、技术路线换代------不逼它联网,它会非常自信地给你一个过时的答案。
第 3、5 两问是我加的,专门用来对冲这一点:先问"什么已经错了",再问"什么是对的"。
3.2 打骨架:把环境和数据管道交给 Claude Code
这是压缩比最高的一段(图 1 里的 ×6)。别在网页里复制粘贴代码,直接上 Claude Code,让它在你的目录里动手:装依赖、跑通、报错、自己修。
一个我常用的收口指令:
scss
不要给我解释,直接干。目标是:<一句话描述可运行的终态>
每完成一步跑一次,失败就自己修,最多重试 3 次。
全部跑通之后,只告诉我三件事:
(1) 你最终选了什么方案、为什么
(2) 哪些地方我以后大概率会踩坑
(3) 给我一条能验证"它确实在正常工作"的命令
第 (3) 条是重点。每一次委托,都要顺手拿回一个验证手段,不然你只是把黑箱换了个地方放。
3.3 沉淀:把学会的东西写成 SKILL.md(本文最重要的一节)
这是我认为熟手和新手真正的分水岭。
大多数人的学习成果留在了聊天记录里------下次开新会话,一切归零,又要从头解释一遍"我们这个行业的数据口径是这样的"。Agent Skills 就是用来解决这件事的。
它的形式非常朴素:一个文件夹,里面放一个 SKILL.md,YAML 头部只要 name 和 description 两个必填字段,剩下是正文,可以再挂脚本、参考文档、模板。加载采用渐进式披露------启动时只读 name 和 description(约 100 tokens),命中了才读正文,需要时才展开引用文件。所以你可以挂几十个 Skill 而不撑爆上下文。
这个格式在 2025 年底已经开放成标准(agentskills.io),Claude 之外的一批客户端也跟进了,写一次能到处用。
给你一个我自己在用的骨架:
yaml
---
name: xx-factor-backtest
description: 用于 XX 市场的因子回测与结果核查。当用户要求做因子检验、
回测、绩效归因,或提到 IC/IR、换手率、分层收益时使用。
---
# XX 因子回测规范
## 数据口径(这一节是血泪)
- 复权方式:后复权;除权除息日的处理见 references/data-dict.md
- 停牌与涨跌停:一律不可成交,收益按 0 计
- 财报数据统一使用「可获得日」而非「报告期」
## 必须执行的检查(缺一不可,缺了就在结论里明说)
1. 未来函数扫描:所有 shift / rolling 的方向核对一遍
2. 幸存者偏差:成分股必须用当期名单,不能用最新名单
3. 样本外切分:训练 / 验证 / 完全不碰的保留集,比例与切分点写死
4. 多重检验:说明本轮一共试了多少组参数
## 输出格式
先给结论表,再给图,最后单列一节「本次结果最可能的伪造方式」
## 参考
- 数据字典:references/data-dict.md
- 泄漏检查脚本:scripts/leakage_check.py
写 description 的时候要特别用心:它是模型在启动阶段唯一能看到的东西,必须同时说清楚"这是什么"和"什么时候该用它"。写成"回测工具",它永远不会被触发。
一旦你开始写 Skill,学习这件事的性质就变了------你不再是在积累聊天记录,而是在积累资产。三个月后你手上有 8 到 10 个 Skill,那就是一份别人看得见的、可交付的能力证明。
3.4 模型怎么选:别一直开着最贵的
场景
建议
备注
日常主力、复杂的智能体编码
Opus 5
官方推荐的默认起点;知识截止 2026 年 5 月,是几个模型里最新的
长时间自主运行、最硬的活
Fable 5
能力最强的广泛发布模型,10 / 50 每百万 tokens
量大、要快、要省
Sonnet 5
3 / 15;推广价 2 / 10 到 2026 年 8 月 31 日
分类、清洗、要跑一万次的小任务
Haiku 4.5
1 / 5,最快
一个小提示:Fable 5 的安全阈值调得比较保守,少数会话里的请求会被转由 Opus 5 回答。碰到了不用慌,不是你的账号出问题。
(模型与价格随时会变,动手前建议去 platform.claude.com/docs 对一眼。)
四、90 天路线图:每一段都必须掉出一个东西来

七段,顺序比速度重要。我逐段说几句实操:
① 地形侦查(0--2 周) ------用 3.1 的 prompt,产出扔进一个 Project 长期存着,后面所有会话都挂在这个上下文上。验收标准:你能对着黑话表自问自答,不看笔记。
② 搭骨架(1--3 周)------用 Claude Code。验收标准:一条从原始数据到最终结果、能一键重跑的链路,中间不许有任何手工步骤。
③ 造原型(2--5 周) ------很丑没关系,能跑就行。这一步唯一的目的是逼出你不知道自己不知道的问题。你会发现之前理解得头头是道的概念,一落到代码上全是洞。
④ 建验证器(4--9 周) ------整篇文章里最重要的一段。 跳过它的人,三个月后会发现自己只是"问得很熟"。
我这两年从 Claude 身上拿到的最大价值,就是下面这个 prompt:
markdown
现在先不要帮我做方案。反过来:
假设我是一个急于自我说服的新手,我最可能用哪 10 种方式,
让一个其实没用的 <因子 / 模型 / 方案> 看起来很有效?
对每一种:
- 它在数据上会呈现什么特征
- 用什么检验能识破它
- 判定阈值定在多少合理,为什么
它对"如何骗自己"这件事的枚举能力,比对"如何做对"的能力更值钱。因为前者是可验证的------你可以一条条去测。
⑤ 沉淀(6--12 周)------把 ④ 的产出写成 SKILL.md。
⑥ 拿反馈(7--13 周) ------开源一个小工具、写一篇讲清楚某个细节的文章、去面一次不打算去的岗、拿很小一笔真钱跑一跑。必须是外部世界给的回执,自己给自己打分不算。
⑦ 立定位(10--13 周)------把做过的东西串成一句话:"我是一个做过 X 的 Y"。串不起来,说明前面做散了。
五、一年后怎么验收自己
这张图是我个人最看重的一张。横轴是入行后的月份,纵轴是你每周投入时间的结构:

Claude 干掉的主要是最上面那层浅灰色------无效摸索,从 40% 掉到 3%。这部分收益是白送的,你只要开始用就有。
但真正决定你有没有入行的,是最下面那条蓝色的线有没有长起来。
它不会自动长。它只在你反复做这几件事的时候才长:自己动手复核 AI 的产出、自己设计验证方法、自己为一个说不清楚的结论较真。
判断自己是在哪条路上,有个特别简单的自测:
随便挑一个你上周让 Claude 做完的东西,关掉它,你能不能独立说清楚:这个结论在什么条件下会翻车?
说得出来 → 蓝色在长。 说不出来 → 你只是在代问,一年后还是新手,只不过是个提问速度很快的新手。
六、我踩过的六个坑
1. 长尾合规细节它会编。 我查过某地区的一条持牌要求,它讲得有鼻子有眼,去监管官网一对------那是三年前的旧规。凡是涉及监管、税务、资质、合同的,一律去一手来源核对,不接受任何转述。
2. 流畅 ≠ 正确。 它解释一个错误答案的流畅度,和解释正确答案完全一样。你的大脑会把"讲得清楚"误判为"讲得对",这个认知偏差非常难克服。唯一的解法还是那句:建验证器。
3. 迭代变快,过拟合也变快。 这条给量化的朋友重点标一下。以前一周试 3 个想法,现在一天试 30 个。你的多重检验校正跟上了吗?AI 时代最危险的不是算力不够,是搜索空间被暴力翻了 50 倍,而你的显著性阈值一点没动。
4. 上下文污染是会自我强化的。 一个错误前提在长会话里会被反复引用,越用越"确凿"。我的做法是:一旦感觉方向不对,直接开新会话,把已经确认无误的事实重新贴一遍,不要在原会话里纠正。 纠正的成本远高于重开。
5. "问得很熟"陷阱。 就是图 4 那条爬不上来的蓝线。这个坑最隐蔽,因为它每天都让你感觉良好。
6. 别让它替你担责。 签字、报备、风控红线、给客户的承诺------这些是你的工作,不是它的。它没有执照,也没有会被吊销的东西。
七、最后
这两年真正的变化,不是"学东西变容易了"。
是入行的门槛从"你知道多少",彻底挪到了"你能判断多少"。
前者,Claude 一周就能帮你补齐大半;后者,它一点忙都帮不上------它甚至会因为太好用,让你误以为自己已经有了。
所以我给所有想换赛道的朋友的建议永远是同一句:
把它当成一个非常博学、非常勤快、但没有责任感的实习生。
你的工作不是问他问题,是学会验他的活。