万字长文|数据分析7大场景实战教程

点击获取文章中提示词。

实战指南|数据分析全流程实战教程

市面上讲 AI 工具的文章大多停在"它能做什么",这篇文章想多走一步,告诉你怎么把需求讲清楚、怎么写出可复用的 Prompt、怎么验证它不出错。这些方法不依赖某个具体功能,换个工具、换个场景照样能用。

无论你是分析师,还是偶尔要处理表格的运营、HR、财务、客服,都用得上;不需要会写代码、不需要懂算法,会提需求、能看懂结果就够了。

怎么读? 全文分三大部分,对应数据工作的三个阶段:把数据拿到手(获取)→ 收拾干净(清理)→ 挖出价值(分析)。七个场景相对独立,你可以挑最头疼的一节直接看,照着步骤就能上手;也可以从头读到尾,建立起对整条流程的完整感觉。

数据分析相关步骤 主要场景 适合情景
第一步: 数据获取 场景 1:网页批量采集数据 你需要的数据还不在手上,而是散布在各类网站的公开页面中(如电商平台、招聘网站、行业门户等)
场景 2:从 PDF / 图片 / 文档中提取信息 你需要的数据还不在手上,而是锁在各种非结构化文件里(如发票扫描件、合同 PDF、报表截图等)
场景 3:用 AI 写 SQL 查询 你需要的数据已经存在于公司数据库中,但你不擅长写 SQL 或表结构复杂难以下手
第二步: 数据清理与标准化 场景 4:数据核对与校验 你手上已有多份来源不同的数据,需要交叉比对、发现差异、确认哪份是对的
场景 5:用 AI 做批量分类标注 你手上已有大量文本数据(如用户反馈、评论、工单),需要按语义批量分类、打标签或归纳主题
第三步: 数据分析 场景 6:周报类敏捷数据分析 你的数据已整理就绪,需要围绕固定指标做高频、轻量的拆解分析(如每周产出一份运营周报)
场景 7:深度数据分析洞察报告 你的数据已整理就绪且数据量大、维度多,需要做一次性的深度归因分析并输出决策建议(如年度复盘、专题研究)

用 TRAE Work 做数据分析的三条心法

在进入具体场景之前,先记住三句话,后面每个场景都会反复用到:

  1. 把它当成一个聪明但需要交代清楚的实习生。 TRAE Work 很能干,但它不知道你脑子里的"潜台词"。你交代得越清楚(要什么字段、什么格式、遇到异常怎么办),结果就越好。

  2. 永远要"验真",尤其是数字。 AI 偶尔会"自信地编"。凡是涉及金额、人数、关键结论的输出,都要让它标注依据,并自己抽查几条。

  3. 复杂任务拆开做。 不要指望一个 Prompt 解决所有问题。"提取 → 清洗 → 核对 → 分析"分步走,每一步结果可检查、可回溯,整体反而更快更稳。

第一步 · 数据获取

数据分析的第一步,永远是"把数据弄到手"。如果你还没有现成的数据,这部分讲三种最常见的获取方式:从网页抓、从文档/文件/图片里抠、从数据库里查。

场景 1:网页批量采集数据

本节你将学到:如何用 TRAE Work 把网页上的数据批量、结构化地"搬"下来,省去一页页手动复制粘贴的痛苦。你还会掌握一套写好"采集 Prompt"的黄金结构,以及把采集变成"每天自动跑"的定时任务。

案例背景

老王是一名投资从业者。他有个雷打不动的晨间习惯:每个交易日开盘前,打开基金收益排行榜网页,把当天排名靠前的基金数据复制下来,粘贴进自己的 Excel 跟踪表,用来观察资金流向和热门赛道的变化。

听起来简单,但实际操作很折磨:网页表格分了好多页,复制过来格式还乱:"近1年收益率"带着百分号、"基金规模"写成"23.45亿"这种文本,每次粘完都要手动清洗一遍。一套流程下来至少 20 分钟,雷打不动地占掉他每个交易日早上的一段时间。

老王想要的其实很朴素:每天自动帮我把排行榜抓下来、清洗好、存成带日期的 Excel,最好我什么都不用管。 这正是 TRAE Work 采集能力的典型用武之地。

实战教程

  1. 先理解:一条好的"数据采集 Prompt"长什么样

网页采集能不能成功、结果干不干净,七成取决于你的 Prompt 写得清不清楚。一条靠谱的采集 Prompt,通常包含五个核心要素(记住这个"黄金五要素",后面所有采集任务都能套):

要素 作用 举例
① 数据源 告诉 AI 从哪儿抓 网址 URL、平台、搜索关键词
② 字段清单 告诉 AI 要提取哪些信息 排名、代码、收益率......
③ 处理规则 告诉 AI 怎么清洗、筛选、排序 去重、排除某类、按某字段排序、格式转换
④ 输出格式 告诉 AI 结果长什么样 Excel/CSV、文件名、表头
⑤ 异常处理 告诉 AI 遇到问题怎么办 抓不到的字段如何标记、失败是否重试

一句话区分好坏 Prompt: 差的 Prompt 让 AI 不停猜(抓哪些字段?几页?怎么排?存成啥?),好的 Prompt 让 AI 读完不用猜任何东西。缺了哪个要素,AI 就会在那里"自由发挥",结果自然不可控。

  1. 直接用自然语言告诉 TRAE Work 你想如何提取数据

打开TRAE Work桌面端,新建任务 --> 在对话框中输入以下Prompt --> 点击发送:

Plain 复制代码
今日日期。
访问 https://fund.eastmoney.com/data/fundranking.html ,提取基金排行榜中的所有基金数据。

需要的字段:排名、基金代码、基金简称、基金类型、最新净值、近1年收益率、近3年收益率、基金规模、基金经理。

处理规则:
1. 排除货币基金和短债基金
2. 按近一年收益率从高到低排序
3. 收益率保留两位小数

输出为 Excel 文件,文件名包含今日日期。
  1. 观察 TRAE Work 的思考与执行

发送后,TRAE Work 会自动打开网页、识别表格、逐页抓取,并自主调用浏览器操作和 Excel 处理能力完成清洗,整个过程你不用看懂任何代码,对话窗口里能看到它的思考和执行步骤,右侧还能同步看到它正在操作的页面,过程透明可追踪。

  1. 点击直接预览最终产物

最终它交付一个整理好的 Excel,点击即可在 TRAE Work 端内直接预览,也可以下载到本地查看。

可以看到几个细节正是它"靠谱"的地方:收益率自动去掉了百分号转成数字、基金规模统一成"亿元"、货币和短债基金被排除掉了、抓不到的"近3年收益率"如实填了"未获取"而不是瞎编。

实用技巧

1. 先判断这个网页"适不适合"采集

不是所有网页都能顺利抓。开工前对照一下:

✅ 适合采集 ⚠️ 不太适合 原因
公开的列表、表格、搜索结果、榜单 需要付费才能看的数据 AI 默认无法模拟你的登录态
可按分类/地区/关键词分页浏览的内容 有严格反爬(验证码等)的网站 AI 过不了验证码
新闻列表、招聘信息、商品搜索结果 秒级实时变动的数据(如股票分时) AI 采集有时间延迟

遇到需要登录的网站,TRAE Work 右侧浏览器会弹出登录页,你手动登录后它就能继续抓(过程中不会记录你的个人信息)详情请见下图。多页数据它能自动翻页/滚动,不用你手动操作。

2. 字段抓不全、格式乱怎么办? 核心还是回到"五要素",把"处理规则"和"注意事项"写细。比如明确"2.3万转成数字 23000""抓不到就填未获取",AI 就会按规矩来,而不是给你一堆带单位的文本。

3. 数据量大、跨很多页怎么办? 直接在 Prompt 里说明"如有分页请翻页抓全"即可,TRAE Work 会自动翻页累积。如果页数特别多,也可以分关键词/分类多跑几次,最后合并。

4. 想每天自动跑、不用手动发起? 这是网页采集最香的玩法。采集任务调通后,直接用大白话告诉 TRAE Work:「把这个任务设成每个交易日早上 9 点自动执行,结果推送给我。」它就会把这条采集变成一个定时自动化任务,每天到点自动抓取、产出、推送到桌面端/手机端/网页端。老王那 20 分钟的晨间手工活,从此彻底交给机器。

任务设置完毕,可在对话流中查看;也可进入"自动化"页面,随时查看并修改任务设置。

场景 2:从不同格式文件中提取数据

本节你将学到:当你手里有一堆格式各异(PDF / 图片 / 文档)、信息散乱的文档(简历、合同、发票、名片......)时,如何用 TRAE Work 一次性把关键字段"抠"出来,整理成一张干净的表格。重点是怎么应对真实文档里的"脏、乱、缺"。

案例背景

小林是一家公司的 HR,每年金三银四的社招旺季,她的邮箱就会被简历淹没,比如她手里攒了 200 多份候选人简历 PDF

过去她的工作流是这样的:一份份点开 PDF,眼睛在屏幕上来回扫,把姓名、电话、学历、薪资期望等信息一个个敲进 Excel。一份简历熟练操作也要 3-5 分钟,200 份就是大半天,眼睛看花、手指敲酸不说,还经常录错电话号码、看漏期望薪资。

她真正想要的,其实只是一张结构化的表格:每行一个候选人,每列一个关键字段,方便后续筛选(比如"挑出 5 年以上经验、期望薪资 25k 以内、在上海的候选人")。简历本身的排版多花哨她并不关心。

这正是 TRAE Work 最擅长的活儿:从非结构化文档里抽取结构化信息

实战教程

  1. 明确要提取哪些字段

动手前先想清楚"我要什么"。小林梳理出 8 个字段:

字段 说明
姓名 候选人姓名
联系方式 手机号优先,没有手机号则取邮箱
最高学历 博士 / 硕士 / 本科 / 大专 等
毕业院校 最高学历对应的院校
工作年限 累计工作年限(年)
当前职位 最近一份工作的职位名称
期望薪资 候选人填写的期望薪资
所在城市 当前所在城市

💡 小技巧:字段定义里把"取值规则"也写清楚(比如"联系方式优先取手机号"),AI 才不会乱猜。这一步花 2 分钟,能省掉后面反复返工。

  1. 看看真实简历长什么样(脏数据预警)

真实简历从来不是整整齐齐的。下面是小林随手抽出的 3 份(已脱敏,仅作演示),注意它们的"不规则"之处------这恰恰是手动录入最容易出错、也最考验 AI 的地方:

Plaintext 复制代码
========== 简历 1 ==========
张伟    男 | 1992.03 | 138-0013-8000 | zhangwei92@email.com

【教育背景】
2014.09-2017.06  复旦大学   计算机科学与技术   硕士
2010.09-2014.06  上海大学   软件工程         本科

【工作经历】
2020.07 至今    某大厂      高级后端工程师
2017.07-2020.06 某创业公司   后端开发工程师

【求职意向】
期望城市:上海
期望薪资:30-40k

========== 简历 2 ==========
姓名:李娜
电话:未填写
邮箱:lina_hr@email.com
学历:本科(北京交通大学,2015 届)
目前在做产品经理,工作 8 年了
现居北京
(简历里没有写期望薪资)

========== 简历 3 ==========
WANG Lei  王磊
Tel: 13600001111
最高学历:大专  ------  广东轻工职业技术学院
经验:3年
最近职位:UI设计师 @ 深圳某公司
期望薪资:10000/月
City: 深圳 / 可接受广州

发现"坑"了吗?

  • 格式五花八门:简历 1 用电话+邮箱并排,简历 2 用"字段:值",简历 3 中英文混排。

  • 缺失字段:李娜没填手机号(要回退到邮箱),也没填期望薪资。

  • 薪资写法不统一:"30-40k"、"10000/月"、还有人干脆不写。

  • 干扰信息:王磊的城市写了"深圳 / 可接受广州",到底填哪个?

  • 多段教育/工作经历:要的是"最高学历"和"当前职位",不能把所有经历都堆上去。

手动录入时,正是这些细节让人崩溃。下面看 TRAE Work 怎么一次搞定。

  1. 直接用自然语言告诉 TRAE Work 你想如何提取数据

把多个简历文件一次上传/直接拖入 TRAE Work 后,用下面这段 Prompt 告诉智能体你想要如何提取数据。

Plaintext 复制代码
附件是一批候选人简历(PDF/文档),请你从每一份简历中提取以下 8 个字段,整理成一张表格。

【需要提取的字段】
1. 姓名
2. 联系方式:优先取手机号;如果没有手机号,则取邮箱;都没有则填"缺失"
3. 最高学历:从博士/硕士/本科/大专/其他中选一个,取学历最高的一项
4. 毕业院校:填"最高学历"对应的那所院校
5. 工作年限:填累计工作年限的数字(单位:年);如果只能推算,填推算值并在备注说明
6. 当前职位:填最近一份工作的职位名称
7. 期望薪资:原样保留简历里的写法(如"30-40k""10000/月");如果未填写,填"未填写"
8. 所在城市:填候选人当前所在城市;如果写了多个,取第一个(当前城市),其余放入备注

【输出要求】
- 用 Excel 表格输出,每行一个候选人,列顺序与上面字段一致,最后加一列"备注"
- 严格基于简历原文提取,不要猜测或编造。简历里确实没有的信息,一律填"未填写"或"缺失",不要替我脑补
- 对于有歧义或需要推算的字段(如工作年限、多城市),在"备注"列简要说明你的判断依据
- 如果某份简历完全无法识别,也单独列一行并在备注里说明原因

💡 这段 Prompt 为什么好用?

  • 把缺失/异常的处理规则提前写死("没有就填未填写,不要脑补"),这是防止 AI 编造的关键。

  • 要求标注判断依据(备注列),让你能一眼看出哪些是 AI 推算的、需要复核。

  • 明确"取最高学历""取当前职位",避免它把多段经历全堆进去。

  1. 观察 TRAE Work 的思考与执行

TRAE Work 智能体会根据任务情况,自主调用内置 或 自定义技能(Skills)来更好地完成任务,这里TRAE Work自主调用了word、pdf 和 xlsx 技能,更高质量地处理各类格式的文件。

TRAE Work 智能体和普通Chatbot不一样的点之一在于,TRAE Work 还会对数据反复进行校验和核对,提高准确度;本案例中 TRAE Work 自动进行了 3 次校验与核对。

  1. 针对上面 4 份简历,TRAE Work 会输出类似这样的结构化表格:

注意几个细节,正是它"靠谱"的体现:

  • 张伟的手机号自动去掉了分隔符(138-0000-000113800000001),方便后续使用。

  • 李娜没手机号,自动回退到邮箱,且期望薪资如实填"未填写"而没有瞎编一个数字

  • 王磊的多城市问题,按规则取了"深圳",并把"可接受广州"放进备注,判断过程透明可查。

实用技巧

实战中你一定会遇到下面这些情况,记住这几招:

问题 技巧
1. 格式不规范、排版混乱怎么办? 不用预处理。直接把原始 PDF 丢给它即可,AI 对"字段:值""表格式""段落式"等各种排版都能理解。你要做的是在 Prompt 里把字段的取值规则讲清楚,而不是去手动调整简历格式。
2. 字段缺失怎么办? 核心是在 Prompt 里规定好缺失时的占位符(如"未填写""缺失"),并明确"不要脑补"。这样导出的表格里,缺失值是统一的、可筛选的,而不是 AI 随机编的假数据。
3. 多页 / 超长简历怎么办? - 如果单份简历很长(多页),直接整份上传,TRAE Work 会通读全文再提取,不用你手动拆页。 - 如果是几百份一起处理 ,建议分批(比如每批 20-30 份),原因有二:一是输出表格太长不便核对,二是分批后哪一批出问题可以单独重跑。可以这样追加指令:「我会分多批发给你,每批你都用同样的规则和表头输出,最后我自己合并。」
4. 想直接得到指定文档类型的文件怎么办? 在 Prompt 末尾加一句:「请同时把结果整理为可下载的 Excel / CSV 文件。」TRAE Work 可以直接帮你生成文件,省去从表格复制/排版的步骤。
5. 提取完发现某列质量不稳怎么办? 针对单个字段做"二次精修"。比如发现"工作年限"推算得不准,就单独发一条:「只重新核对'工作年限'这一列,对每个人列出你推算的起止时间和计算过程。」让它聚焦一个字段,准确率更高。

场景 3:快速生成 SQL 语句

本节你将学到:当你面对一个"逻辑绕、表又多"的复杂查询时,如何用 TRAE Work 快速生成一份高质量的 SQL 初稿,再由你来检查微调------把"从零写"变成"审改稿",效率翻倍。同时学会让 AI 帮你解释逻辑、优化慢查询、排查报错。

案例背景

小陈是一家在线教育平台的数据分析师。这天运营负责人扔给他一个需求:

"帮我拉个数:过去 30 天内,完成了至少 3 门课程学习、并且最近 7 天内有登录行为的活跃学员 ,按城市分组,统计每个城市的人数、平均学习时长、续费率。"

小陈一看就知道这不是个简单查询:

  • 涉及多张表 JOIN:用户、学习记录、登录记录、订单都要关联。

  • 多重过滤条件:30 天内、完成 ≥3 门、7 天内登录过。

  • 要算续费率这种比率指标,得先定义清楚"续费"是什么。

  • 大概率要用到子查询、聚合、甚至窗口函数

小陈本身 SQL 功底不差,能看懂、能 debug、能优化 ,但要从一张白纸开始把这段逻辑捋顺、敲完、调通,没有 20-30 分钟下不来。他想的是:让 TRAE Work 先生成初稿,我来审和改,这样最省力。

这是用 AI 写 SQL 的黄金姿势:你负责把关,AI 负责打草稿。

实战教程

  1. 先把"表结构"喂给 TRAE Work

让智能体写 SQL 最重要的前提是它得知道你的表长什么样。小陈把相关 4 张表的建表语句整理出来,这是写好 SQL 最关键的一步,表结构给得越准,SQL 越能直接用

SQL 复制代码
-- 用户表
CREATE TABLE users (
    user_id        BIGINT       PRIMARY KEY COMMENT '用户ID',
    nickname       VARCHAR(64)  COMMENT '昵称',
    city           VARCHAR(32)  COMMENT '所在城市',
    register_time  DATETIME     COMMENT '注册时间',
    status         TINYINT      DEFAULT 1 COMMENT '账号状态:1=正常,0=注销'
) COMMENT '用户表';

-- 课程学习记录表(一条记录代表一个用户对一门课程的学习情况)
CREATE TABLE course_progress (
    id             BIGINT       PRIMARY KEY AUTO_INCREMENT,
    user_id        BIGINT       COMMENT '用户ID',
    course_id      BIGINT       COMMENT '课程ID',
    status         TINYINT      COMMENT '学习状态:0=未开始,1=学习中,2=已完成',
    study_minutes  INT          DEFAULT 0 COMMENT '该课程累计学习时长(分钟)',
    finish_time    DATETIME     COMMENT '完成时间(status=2时有值)',
    update_time    DATETIME     COMMENT '最近学习更新时间',
    KEY idx_user (user_id),
    KEY idx_finish (finish_time)
) COMMENT '课程学习记录表';

-- 登录记录表(一条记录代表一次登录)
CREATE TABLE login_log (
    id             BIGINT       PRIMARY KEY AUTO_INCREMENT,
    user_id        BIGINT       COMMENT '用户ID',
    login_time     DATETIME     COMMENT '登录时间',
    device         VARCHAR(32)  COMMENT '登录设备:ios/android/web',
    KEY idx_user_time (user_id, login_time)
) COMMENT '登录记录表';

-- 订单/续费表(一条记录代表一笔购买,含首购与续费)
CREATE TABLE orders (
    order_id       BIGINT       PRIMARY KEY COMMENT '订单ID',
    user_id        BIGINT       COMMENT '用户ID',
    amount         DECIMAL(10,2) COMMENT '订单金额(元)',
    order_type     TINYINT      COMMENT '订单类型:1=首购,2=续费',
    pay_status     TINYINT      COMMENT '支付状态:1=已支付,0=未支付',
    pay_time       DATETIME     COMMENT '支付时间',
    KEY idx_user (user_id)
) COMMENT '订单表';

💡 拿不到完整 DDL 怎么办? 如果你手头没有建表语句,至少把表名、关键字段名、字段含义 用大白话列给 AI(比如"orders 表里 order_type=2 表示续费")。AI 最容易翻车的地方就是猜错字段含义,所以业务口径一定要交代清楚,尤其是像"续费率"这种需要定义的指标。

  1. 直接用自然语言告诉 TRAE Work 你想如何提取数据
Plaintext 复制代码
你是一名资深数据工程师,精通 MySQL。请根据我提供的表结构和业务需求,写一段可直接运行的 SQL 查询。

【表结构】
(把上面 4 张表的 CREATE TABLE 语句原样粘贴在这里)

【业务需求】
统计"活跃学员"按城市分组的指标。活跃学员的定义需同时满足:
1. 过去 30 天内(以当前时间为基准)完成学习的课程数 ≥ 3 门(即 course_progress 中 status=2 且 finish_time 在近 30 天内的课程数 ≥ 3)
2. 最近 7 天内有过登录行为(login_log 中存在近 7 天的登录记录)
3. 账号状态正常(users.status = 1)

【需要输出的指标】(按城市 city 分组)
- 活跃学员人数
- 平均学习时长:这些活跃学员"近 30 天完成课程"的人均累计学习时长(分钟)
- 续费率:这些活跃学员中,"近 30 天内有过续费订单(order_type=2 且 pay_status=1)"的人数占比,结果保留 2 位小数、以百分比形式

【输出要求】
- 使用 MySQL 方言
- SQL 要可直接运行,关键步骤加注释说明逻辑
- 时间范围用 NOW() 和 INTERVAL 动态计算,不要写死日期
- 结果按"活跃学员人数"降序排列
- 如果业务定义中有你认为模糊、需要我确认的地方,先在 SQL 上方用注释列出你的假设

💡 这段 Prompt 的精髓在于:指标口径写得像需求文档一样精确 ("续费率 = 有续费订单的活跃学员 / 全部活跃学员"),并且主动要求 AI 把模糊点的假设列出来。这样生成的 SQL 才不会"逻辑对、口径错"。

  1. 查阅 TRAE Work 的SQL产出

仅需二十秒,TRAE Work 就能生成带有完整注释的 SQL 语句,大大省去了手动查表、拼字段、调语法的时间。

拿到 SQL,小陈不会直接跑生产,而是查看 TRAE Work 返回的注释内容、确认模糊口径并逐段审一遍。这正是"AI 写初稿 + 人来把关"的价值:AI 把 80% 的活儿(JOIN、CTE、聚合、语法)干完了,小陈只需聚焦在业务口径**这种 AI 无法独自判断的 20% 上。整个过程不到 10 分钟,比从零写快太多。

💡 检查 SQL 的几个必看点

  1. JOIN 类型对不对 :该用 LEFT JOIN 的地方别用成 JOIN

  2. 时间边界 :是 >= 还是 >?"近30天"含不含今天?跟 AI 确认口径。

  3. 去重COUNT 要不要 DISTINCT?多表 JOIN 后很容易出现行数翻倍。

  4. 业务口径:比率类指标(续费率、转化率)的分子分母定义,永远要自己再确认一遍。

实用技巧

写出 SQL 只是开始,TRAE Work 还能帮你做更多:

1. 让它解释一段看不懂的 SQL 接手别人的祖传 SQL 看不懂?直接丢给它: Plaintext<br>请逐段解释下面这段 SQL 在做什么,每个子查询/CTE 的作用是什么,最后用一句话概括它的业务含义:<br>(粘贴 SQL)<br>
2. 优化慢查询 某个查询跑得特别慢?让它帮你诊断: Plaintext<br>下面这段 SQL 在千万级数据量下跑了 40 秒,请帮我分析慢在哪里,并给出优化建议(包括索引建议、改写思路)。表结构和 SQL 如下:<br>(粘贴 DDL 和 SQL)<br>
3. 帮你看懂报错 SQL 报错不知道错在哪儿?把报错信息原样贴给它: Plaintext<br>这段 SQL 报错:ERROR 1055 (42000): Expression #2 of SELECT list is not in GROUP BY clause...<br>请告诉我原因和怎么改。SQL 如下:<br>(粘贴 SQL)<br>
4. 一键适配其他数据库方言 如果你的库不是 MySQL,加一句:「请把上面这段 SQL 改写成 PostgreSQL(或 Hive / ClickHouse)方言」即可。

第二步 · 数据清理与标准化

数据拿到手了,但往往是"毛坯",有错漏、有重复、格式不统一、没有分类。这部分讲怎么用 TRAE Work 把数据收拾干净,让它"能用、好用"。

场景 4:数据核对与校验

本节你将学到 :当你有两张本该对得上的表(报销单 vs 银行流水、订单 vs 发货、应收 vs 实收......)时,如何用 TRAE Work 自动找出"对不上"的异常记录,并且学会一套防止 AI 编造结论的关键方法。

案例背景

老周是一家消费品公司的财务专员。每到月末,他都要做一件最磨人的事:核对员工报销

他手上有两张 Excel:

  • 报销申请表:员工自己填的,包含姓名、部门、申请金额、费用类型、申请日期。

  • 银行付款流水:财务系统导出的实际打款记录,包含付款日期、收款方姓名、付款金额、备注。

理论上,每一笔报销申请,都应该在银行流水里有一笔对应的打款。但现实总有意外:

  • 有人报了 金额对不上(申请 800,实际打了 600)。

  • 流水里有一笔打款,报销表里却找不到对应申请(可能是补录漏了)。

  • 报销表里有申请,流水里却没打款(可能还没打、或打款失败)。

过去老周得拿两张表左右开弓、用 VLOOKUP 一行行比对,几十上百条对下来,眼睛都直了,还容易漏。现在他想让 TRAE Work 来当这个"火眼金睛"。

实战教程

  1. 用自然语言告诉 TRAE Work 数据核对需求

把两张源数据表都上传给 TRAE Work,然后在对话框内输入以下 Prompt:

Plaintext 复制代码
你是一名严谨的财务稽核助理。我有两张表需要逐条核对:
- 表A【报销申请表】:字段有 员工姓名、部门、申请金额、费用类型、申请日期
- 表B【银行付款流水】:字段有 付款日期、收款方姓名、付款金额、备注

【核对规则】
以"姓名"作为主要匹配键,把表A的每一条申请与表B的流水进行匹配,判断属于以下哪种情况:
1. ✅ 匹配:姓名能对上,且申请金额 = 付款金额
2. ⚠️ 金额不一致:姓名能对上,但申请金额 ≠ 付款金额(请写出差额)
3. 🔵 仅流水有:表B里有这条流水,但表A里找不到对应申请
4. 🔴 仅申请表有:表A里有这条申请,但表B里找不到对应流水

【输出要求】
- 输出一张核对结果表,逐条列出:姓名、申请金额、付款金额、核对状态、依据说明
- 每一条都要给出"依据说明",写清楚你是凭哪条申请、哪条流水做出的判断
- 重要:严格基于我给的数据判断,不要猜测。如果某条因为姓名相近、金额接近等原因你无法确定如何匹配,请标为"❓待确认"并说明疑点,不要强行配对
- 最后给出一个汇总:各类状态分别有几条

数据核对最怕的就是 AI"自信地配错对",或者把不存在的记录说成存在。上面 Prompt 里其实已经藏了三个防幻觉的关键设计,这里专门点出来:

  • 要求逐条标注"依据说明":强迫 AI 把"我凭哪条数据下的结论"写出来。你一眼就能看出它有没有张冠李戴。

  • 允许并鼓励它说"我不确定":明确给出"❓待确认"这个出口。AI 一旦被允许"示弱",就不会硬着头皮瞎配对------这比要求它"必须给答案"安全得多。

  • 明令禁止猜测:"严格基于我给的数据,不要猜测"。这句话能显著降低它脑补数据的概率。

💡 一句话总结防幻觉心法:让 AI 亮出证据、给它说"不知道"的权利、禁止它脑补。 核对、对账、稽核这类"错一个数就出事"的场景,这三条必须写进 Prompt。

  1. 观察 TRAE Work 的思考与执行

和 Chatbot 不一样的是,TRAE Work 智能体会自主将复杂的大任务拆解成更细粒度的小任务,并在对话流中展示思考和执行方式。

在执行过程中,TRAE Work 会自动编写数据处理脚本来完成采集和清洗工作;遇到问题时,它还能自我检查错误并修复。用户不需要看懂或修改任何代码,整个过程由智能体自主完成,最终只交付整理好的结果文件。

  1. 查阅 TRAE Work 产出的数据核对结果

按照需求,TRAE Work 汇总了匹配的数据、需要确认 或 有问题的数据。

场景 5:用 AI 做批量分类标注

本节你将学到:当你面对成千上万条文本(用户反馈、评论、工单、问卷开放题......)需要按一套标签体系归类时,如何用 TRAE Work 又快又准地批量打标,怎么处理"模棱两可"的样本,以及上千条数据该怎么分批跑。

案例背景

小苏在一家电商平台的客服团队做数据运营。团队的工单系统和 App 评价区里,积累了 5000 多条用户反馈文本

老板想知道:用户到底在抱怨什么?是功能不好用,还是嫌贵,还是物流太慢?这些反馈如果能按统一标签体系分类,就能:

  • 产品团队指明迭代方向(哪类问题最多)。

  • 客服质检提供抓手(哪类问题处理得不好)。

但 5000 条纯文本,靠人一条条读、一条条打标签,几个人干一周都未必干得完,而且不同人标准还不一样。小苏决定用 TRAE Work 来批量标注。

实战教程

  1. 定义清楚标签体系(这是成败关键)

分类质量 = 标签体系质量。 标签定义得越清楚、边界划得越明确,AI 标得就越准。小苏先和产品、客服一起,定下了这套两级标签体系,每个标签都配了"边界定义"和"样例"。

💡 划边界的诀窍:最容易混的两个标签,要专门说清楚"谁归谁"。比如"操作复杂"(功能能用但麻烦)vs"功能异常"(功能根本用不了),在定义里点明差异,AI 就不容易标混。这一步也可以直接交给 TRAE Work 来生成标签体系,再进行人工审核。

  1. 用自然语言告诉 TRAE Work 如何进行数据标准化处理
Plaintext 复制代码
请按我给定的标签体系,参考附件 Excel 文档,对每一条用户反馈进行分类。

【标注要求】
1. 给每条反馈打上"一级分类 + 二级标签"
2. 给出置信度(高/中/低):当反馈表意清晰、明确对应某标签时为"高";当措辞模糊、可能落在两个标签之间时为"中"或"低"
3. 给出一句话理由,说明你判断的依据(引用反馈里的关键词)
4. 如果一条反馈同时涉及多个问题,选择用户**最主要、最强烈**抱怨的那个作为主标签,并在理由里注明它还涉及哪个次要标签
5. 严格按标签体系来,不要自创标签。实在无法归类的,标为"其他 / 无法归类"

【输出格式】
按下面的表格逐条输出:序号 | 反馈摘要 | 一级分类 | 二级标签 | 置信度 | 理由

💡 这段 Prompt 的关键设计:把完整标签定义随 Prompt 一起给 (不要假设 AI 记得)、要求输出置信度 (这是后面筛查模糊样本的抓手)、规定多标签时怎么取主标签(避免 AI 自己乱选)。

  1. 检查 TRAE Work 产出的分类标签标注

打完标签,数据就从"一堆文本"变成了"可分析的结构化资产":

  • 问题分布一目了然:统计各标签的数量占比,画成饼图/柱状图------比如发现"配送问题"占 35% 居首,"功能异常"占 20% 紧随其后,产品和供应链的优化优先级立刻清晰。

  • 趋势监控:按周/月统计各类问题的变化,能及时发现"某次发版后功能异常类反馈激增"这种信号。

  • 交叉分析:结合用户分层、地区、机型等维度,定位问题(如"安卓用户的闪退反馈明显高于 iOS")。

  • 客服质检抓手:"客服服务"类反馈可直接推给质检团队复盘。

而这些统计和可视化,正好可以交给下一个场景来做。

实用技巧

  1. 大规模数据(>1000 条)的分批策略

当数据量级非常大的时候,推荐先用少量的样本数据进行测试。 没问题后,可以全量进行分析;不推荐直接把 5000 条塞进一个对话框是不行的(太长、易出错、跑一半断了前功尽弃)。正确做法是分批

  • 固定标准,分批投喂 :把标签体系和要求作为"固定开头",每批投入 50-100 条反馈。每批都用完全一样的标签定义和输出格式,保证标准统一。

  • 善用文件批处理:大文件拆解成批量文件也无需手动操作,可以直接把文件交给 TRAE Work,让它拆解成每个 100 条反馈的文件,比手动复制粘贴高效得多。

  • 第一批当"对齐基准":先认真跑第一批,人工检查标得准不准。确认 AI 理解到位了,后续批次就可以放心跑。

  • 保留序号,方便合并:每条数据带上全局唯一序号(如 0001-5000),AI 输出时保留序号,最后你按序号把各批结果拼起来即可。

  • 失败可重跑:分批的另一个好处是,哪一批结果有问题,单独重跑那一批就行,不用从头来过。

  • 合并文件:所有批次都跑完后,可以再让 TRAE Work 把所有的文件都合并成 1 个大文件。

  • (进阶,可选)沉淀技能 :用自然语言就能在 TRAE Work 里沉淀技能。当以上 1 - 5 步骤跑顺畅之后,可以在对话框内直接输入"把以上批量数据分批处理的工作流整理成一个 TRAE Work 里的Skill"。以后,在反复出现同样使用场景的时候,可以直接 "/" 调用该技能,省去重复沟通以上常用步骤。

  1. 多任务并行,让你的工作更高效

大规模的数据标注处理一般需要较长的时间,那 TRAE Work 智能体在跑大规模任务的时候,你需要等着吗?答案是 No,

  • 你可以关上你的电脑去喝一杯咖啡:TRAE Work 里的云端任务执行时无需电脑处于开机状态,合上电脑也能跑。
  • 你也可以同时开启另一项任务:TRAE Work 支持同时执行多个任务,互不干扰,同时进行。

第三步 · 数据分析

数据获取到了、也清洗干净了,终于到了"挖价值"的环节:做统计、找规律、出洞察,这也是 TRAE Work 最惊艳的功能之一:丰富的技能选择、工具调用、科学的分析、专业的绘表、详实的报告。

场景 6:周报类敏捷数据分析

本节你将学到 :如何把一份(或多份)Excel/CSV/JSON 等数据文件直接交给 TRAE Work,让它替你做透视、合并、分组汇总、口径计算、风险筛查,并且直接给出业务结论。把以前那些"打开三个文件、拼 VLOOKUP、算完成率、敲业务话术"的流程,压缩到一条 Prompt。本节会重点演示多文件合并 + 进度跟踪 + 风险预警的复合场景。

案例背景

小余是某公司数据团队 的成员。每周一早上,他都要做一份让全公司都看的「业务进展周报」,盘点本周三大事业部(电商、内容、广告)下属各渠道的业务进度,把低于预期进度的渠道标出来,让对应的负责人重点跟进。

听起来很常规,但实操起来全是琐碎活:

  • 三个事业部各自维护一张 Excel,每张表 50 行,字段虽然一致但文件是三个

  • 他得先打开三个文件、复制粘贴到一张总表里,**还要手动加一列"所属事业部"**才不会混。

  • 然后写 VLOOKUP 拼数据、算完成率(已完成 / 目标)、做透视表分事业部汇总。

  • 再筛选出"完成率 < 60%"的渠道做风险列表,按完成率从低到高排序。

  • 最后还得自己写一段业务总结:"整体进度怎么样?谁拖后腿了?该重点盯谁?"

整套下来一两个小时是少不了的。更要命的是:周周如此,而且每一步只要手抖一下就可能出错(VLOOKUP 串了、完成率分母用错了、漏算了一行)。

小余想:能不能把三个文件一起丢给 TRAE Work,让它自己合并、自己算、自己筛、自己总结?

实战教程

  1. 用自然语言告诉 TRAE Work 周报分析的需求

把三个业绩数据的 Excel 一起拖入 TRAE Work 对话窗口,然后发送下面这段 Prompt。它把"合并 + 计算 + 筛选 + 总结"四件事一次说清,这正是分析型 Prompt 和采集型 Prompt 的根本区别:分析型 Prompt 不只是"提取数据",而是"得出结论"

Plain 复制代码
附件的 3 个 Excel 文件,分别是电商事业部、内容事业部、广告事业部的数据采集进度,
每个文件字段相同:序号、平台/渠道名称、负责人、目标数据量、已完成数据量、本周新增、截止日期。

请帮我做以下处理:
1. 把 3 个文件合并成一张总表,新增"所属事业部"列以区分来源;
2. 按事业部汇总:渠道数、目标数据量、已完成、缺口、本周新增、整体完成率(已完成/目标),最后加一行全公司合计;
3. 判断标准:完成率 < 60% 的渠道标记为"落后",单独输出一张风险预警列表(按完成率从低到高排),列出缺口和截止日期;
4. 最后用一段话总结整体进度和最需要关注的事。

输出要求:先给分事业部汇总表,再给落后渠道风险预警列表,最后一段话总结业务进展。完成率保留 1 位小数。
  1. 查阅 TRAE Work 的输出

TRAE Work 会自动读三个文件、拼表、加来源列、跑分组汇总、筛选落后渠道、按规则排序,最后根据需求产出核心总结、任务完成度 及 风险预警团队,可以直接应用到周报。

  1. (进阶,可选)数据可视化

想做可视化怎么办?直接追加一句即可:"请对以上数据进行可视化绘图,使用 /chart-visualization 技能。" TRAE Work 会自动调用相关技能生成图表,但我们也可以更直接的指定使用某个技能。

为什么要使用技能?搭配 chart-visualization 技能,图表效果更专业美观。在 TRAE Work 对话框中输入 "/" 或 点击 对话框左下角的 "/" 即可选择已安装的技能。

如何安装技能?除了内置的技能外,TRAE Work 还支持用户在技能市场里一键安装技能自定义上传技能

场景 7:深度数据分析洞察报告

本节你将学到:如何让 TRAE Work 处理上千行的大体量数据,并自主完成多维分析,最终产出包含交互图表的 HTML 报告和可直接分发的 PDF 深度洞察报告。

案例背景

小陆是一家营销公司的增长负责人。季度复盘到了,他拿到了过去三个月全量投放明细 Excel,足足 1500 条数据、19 个维度

以往,小陆需要带一个实习生,花一整天时间在 Excel 里拉透视表、切片、算 ROI,然后再一张张截图贴进 PPT,最后配上文字说明。这种方式不仅效率低,而且很难挖掘出更深层的规律,比如"华东地区的 25-34 岁受众在短视频渠道的视频创意表现,是否显著优于其他组合?"这类多维交叉洞察,在 Excel 里操作极其繁琐。

他希望 TRAE Work 能帮他完成从"原始数据"到"专业报告"的跨越:直接吞下这 1500 行数据,自己找亮点、画图表,最后吐出一份像模像样的 HTML 交互报告和 PDF 总结。

实战教程

  1. 用自然语言告诉 TRAE Work 数据分析报告要求

数据量大(上千行)时,TRAE Work 智能体处理得会比普通 AI 快且稳,他不仅是简单处理数据,作为智能体,他会自主调用工具、写脚本、检查逻辑等等。我们要给 TRAE Work 一个清晰的"任务说明书",让它知道不仅要计算,还要像分析师一样产出洞察。

Plain 复制代码
附件是季度广告投放数据,请帮我进行深度数据洞察分析,并产出专业报告,使用 /consulting-analysis 技能。

【分析目标】
1. 效果复盘:整体评估本季度的投放质量。
2. 寻找亮点:识别出 ROI、转化率表现最突出的维度组合。
3. 识别浪费:找出消耗较高但 ROI 极低(如 ROI < 1.0)的"资金黑洞"。
4. 策略建议:基于数据,为下季度预算分配给出至少 5 条具体建议。

【分析维度】
请在以下维度进行交叉分析:投放渠道、创意类型、目标受众、地区、广告主。

【分析指标】
必须覆盖:总消耗、总转化量、平均 CTR、平均 CPC、平均 CPA、整体 ROI。

【输出要求】
1. 生成一份 HTML 交互式报告,图表需美观且可交互。
2. 同时生成一份 PDF 静态版本,用于存档。
3. 报告必须包含:执行摘要(Executive Summary)、关键发现(Top 5 Findings)、详细维度分析、结论与下步建议。
4. 图表建议:请根据数据特征自主选择最佳图表(如用热力图看地区分布、用散点图看 CPC 与 ROI 的关系、用漏斗图看转化等)。

【注意事项】
- 所有数字必须来自数据本身,严禁编造结论。
- 对每个"关键发现"请标注具体的支撑数据及计算口径。
- 报告中若有显著的异常值(Outliers),请单独指出。
  1. 观察 TRAE Work 的思考与执行

不同于普通Chatbot,TRAE Work 智能体在拿到复杂、大型数据任务后,会自动将其拆解到更细粒度的任务并自主调用技能、工具、写脚本,逐步执行。

  1. 查阅生成的报告并做进一步修改

TRAE Work 生成了一份完整的数据分析报告,并生成了便于交互与展示的 HTML 文件 以及 便于发送的 PDF 文件。洞察报告中,包含了总结数据、执行摘要、5大洞察、各维度关键数据可视化、下一步结论及建议。

但我想要麦肯锡风格的简约、明亮色调的报告,在已生成的文件之上,TRAE Work 可以随时加以修改、编辑。

实用技巧

在处理大体量深度分析时,这几招能让你事半功倍:

  • 大文件处理:如果数据超过 10 万行,建议先让 TRAE Work 写一段 Python 脚本在本地运行进行预汇总。对于 1500-5000 行的"中等规模"数据,直接拖进去即可。

  • 自主权 vs 约束:给 Prompt 时,可以多给"分析目标"(例如:帮我找到最高 ROI 的组合),少给具体的"绘图指令"。让 TRAE Work 利用它的推理能力自主选择分析角度,往往能发现你没想到的视角。

  • 分步提问法:如果报告要求极高,可以先使用 /plan 模式让它出一版分析计划以及"数据洞察大纲",你确认大纲没问题后,再说:"请针对第二章的渠道分析,再深入挖掘一下不同时间段的表现"。

  • 解决中文乱码:在生成 HTML 或图表时,如果发现中文字符显示为方框,可以提醒它一句:"请在绘图脚本中使用支持中文的字体库(如 SimHei 或指定路径字体)"。

让 TRAE Work 成为你的数据搭子

回顾这六个场景,你会发现一条清晰的主线:

  • 数据获取(场景 1/2/3):把散落在网页、文档、数据库里的数据,变成手边可用的结构化表格。

  • 数据清理与标准化(场景 4/5):把"毛坯数据"核对干净、分类打标,变成可信、可分析的资产。

  • 数据分析(场景 6/7):从干净的数据里跑出统计与洞察,支撑决策。

而贯穿始终的,是开头那三条心法:

  1. 交代清楚: 把你脑子里的"潜台词"(要什么、缺了怎么办、有歧义怎么办)写进 Prompt。

  2. 永远验真: 尤其是数字,让 AI 亮出依据,自己再抽查。

  3. 拆开来做: 复杂任务分步走,每步可检查、可回溯。

TRAE Work 不会替代你的专业判断,但它能把那些重复、枯燥、易错的体力活全包了,让你专注在真正需要"人"的地方:定义问题、把关质量、解读洞察。

把这份文档收藏好,下次遇到对应的场景,直接翻到那一节,照着 Prompt 改改就能用。

TRAE Work 官方AI 工作知识库已上线

点击获取文章中提示词:

实战指南|数据分析全流程实战教程

相关推荐
麦哲思科技任甲林8 小时前
Codex+ChatGPT 胜过TRAE+DeepSeek组合的感受
chatgpt·deepseek·trae·工程化ai
wMoqi3 天前
trae cn 中ai开发配置skill mcp 规则参考(yudao-cloud项目-个人用)
ai·skill·yudao·mcp·trae
豆包MarsCode5 天前
只需 5 分钟,TRAE Work 教你免费换“皮肤”
trae
zjun30215 天前
如何搭建TRAE IDE 连接到容器开发环境
docker·容器·ascend·trae
skywalk81635 天前
TRAE AI 创造力大赛 - 趣赢分析器
人工智能·trae
梦想的征途7 天前
Trae:搭建一体化测试智能体
trae
KaneLogger9 天前
防止 AI Agent 误删文件,最简单的办法就是加一个 Hook
llm·agent·trae
anyup9 天前
30 分钟用 Trae Work + 魔珐星云做出会讲故事的 AI 3D 具身交互智能数字人
前端·ai编程·trae
豆包MarsCode11 天前
我用 TRAE Work 做了一个 C盘清理工具
trae