前言
在大模型应用开发中,很多人会直接把数据分析需求丢给大模型,让模型自由写SQL、处理表格、输出结论。但这种方式有明显短板:输出不稳定、格式混乱、容易编造数据、无法复用分析逻辑。
数据分析Skill,本质是一套封装好的、可被大模型调用的标准化数据分析能力:包含业务定义、数据输入规范、分析流程、计算规则、输出模板、异常校验。它不是一段简单的提示词,而是结构化的分析单元。
本文从定位、结构设计、开发步骤、避坑要点、完整示例几个维度,讲解如何从零编写一个合格的数据分析Skill。
一、先搞清楚:数据分析Skill到底是什么
Skill可以理解为给大模型增加的专业分析插件。
- 普通Prompt:告诉模型"帮我分析销售数据",模型自由发挥;
- 数据分析Skill:规定分析目标、可用字段、计算口径、分析步骤、必须产出、禁止行为,模型严格按照既定流程执行分析。
它的核心价值三点:
- 口径统一:指标定义固化,不会每次算出不一样的结果;
- 输出标准化,报表结构固定,方便下游对接;
- 边界可控,限制模型不要随意臆造数据、不要越界做不在范围内的分析。
一句话总结:Skill = 业务需求 + 数据字典 + 分析流水线 + 输出模板 + 校验规则。
二、写Skill前必须完成4项前置准备
在动笔写Skill文本之前,不要直接堆砌指令,先收集清楚基础信息。
1. 明确分析目标与使用场景
先回答3个问题:
1)这个Skill用来解决什么业务问题?(比如月度销售归因、用户流失分析、渠道ROI测算)
2)谁来使用?运营、产品、财务还是数据分析师?
3)输入形式是什么?原始表格、SQL查询结果、JSON数据集还是用户上传文件?
反面案例:目标模糊------"分析用户数据,找出问题"
正面案例:基于每日用户活跃数据表,分析近30日留存下滑原因,定位流失时间段与渠道。
2. 整理完整数据字典
列出所有可用字段,写明字段含义、数据类型、业务口径。
没有数据字典的数据分析Skill基本不可用,模型会误解字段含义。
示例:
- dt:日期,日期格式YYYY‑MM‑DD
- user_id:用户唯一ID
- channel:注册渠道
- register_cnt:当日新增注册人数
- retain_7d:7日留存用户数
同时注明不可使用字段,避免模型调用不存在的数据。
3. 确定指标计算公式与业务口径
所有聚合指标必须写死规则,不能交由模型自行理解。
举例:7日留存率=第N日新增用户中第N+7日仍活跃的用户数 / 第N日新增注册人数
重点:财务、运营类指标口径分歧最多,Skill中必须白纸黑字定义清楚。
4. 划定能力边界
写明本Skill能做什么、不能做什么 。
例如:
✅ 可以:计算留存率、对比不同渠道留存、找出降幅最大日期
❌ 不可以:预测未来用户量、猜测流失外部原因、编造没有的数据
三、数据分析Skill标准结构(直接套用模板)
一套成熟的数据分析Skill分为6大模块,按顺序撰写。
- Skill名称与简介:一句话说明能力
- 业务目标:详细描述解决的问题
- 输入规范与数据字典:接收的数据格式、字段说明
- 分析执行流水线(核心):分步执行逻辑,强制顺序执行
- 输出格式模板:固定结果结构
- 约束规则与禁止项:风险控制、异常处理
结构模板
【Skill名称】
【简介】
【业务目标】
【输入要求&数据字典】
【分析执行步骤(必须按顺序执行)】
步骤1:数据清洗与合法性校验
步骤2:基础指标计算
步骤3:多维度对比分析
步骤4:异常点定位
步骤5:结论归纳,不做无依据猜测
【输出模板,严格遵守格式,禁止自由改写】
【强制约束&禁止行为】
四、实战:完整编写一个数据分析Skill示例
需求:渠道新增与7日留存分析Skill
【Skill名称】渠道新增与7日留存数据分析Skill
【简介】接收每日渠道注册与留存明细,自动完成指标计算、多渠道对比、异常波动识别,输出标准化分析报告
【业务目标】
基于日维度渠道数据,统计各渠道新增量、7日留存率,对比渠道质量,识别留存大幅下跌的渠道与日期,给出客观数据结论,不做主观推测。
【输入要求&数据字典】
输入:多行明细数据,包含以下字段
dt:日期 YYYY-MM-DD
channel:渠道名称
register_cnt:当日新增注册人数
retain_7d:新增用户中7日活跃人数
禁止使用输入以外的字段。
【分析执行步骤(必须依次执行,不能跳过)】
步骤1 数据校验
1.1 检查是否存在空值、负数;注册人数、留存人数不能小于0
1.2 发现异常数据,在报告中标注异常行,不自动剔除,保留原始记录
步骤2 指标计算
7日留存率 = retain_7d / register_cnt,保留2位小数,以百分比展示
步骤3 多维度聚合
3.1 按渠道汇总总新增、平均7日留存率
3.2 按时间顺序列出每日各渠道留存率变化
步骤4 异常检测
筛选留存率相比前一日下降≥10%的记录,标记为异常波动点
步骤5 总结归纳
只基于计算结果描述现象,禁止脑补外部原因(如市场投放、版本更新等没有数据支撑的猜想)
【输出模板,严格按照下面结构输出,不要增加额外小标题】
1.数据概况
总新增用户:xxx条
数据时间范围:xxx ~ xxx
异常数据行数:xxx
2.渠道指标汇总表
渠道|总新增|平均7日留存率
3.留存异常波动清单
日期|渠道|当日留存率|前一日留存率|降幅
4.分析结论
客观描述数据现象,不做无依据推测。
【强制约束&禁止行为】
1.禁止修改计算公式,禁止自定义指标
2.禁止编造输入中不存在的数据
3.禁止输出模板以外的自由段落,不要增加多余营销化文字
4.如果输入数据不足,直接说明数据缺陷,不要强行得出结论
把以上内容交给大模型,模型就会严格按照流水线完成数据分析,输出格式稳定可控。
五、编写Skill的常见坑与优化技巧
坑1:只写需求,缺少执行步骤
很多人只写一句"分析渠道留存",没有分步流程。大模型会随机选择分析角度,每次答案不一样。
优化:强制分步执行,规定先校验、再计算、再对比、最后总结。
坑2:指标没有计算公式,依赖模型理解
"统计留存"是模糊指令,不同人对留存定义完全不同。所有衍生指标必须附带公式。
坑3:输出没有模板,结果杂乱无章
没有模板时,模型有时输出大段文字,有时输出表格,很难对接下游程序。
最佳实践:固定Markdown表格+分段标题模板,强制模型遵守。
坑4:缺少异常处理规则
原始数据经常有空值、负数、缺失日期。如果不定义校验逻辑,模型会忽略脏数据直接计算,结论失真。
建议在第一步统一加入数据合法性检查。
坑5:边界模糊,模型越界发挥
数据分析Skill只负责解读已有数据,不适合做预测、归因猜想。一定要增加约束:禁止猜测未知原因。
六、Skill迭代优化流程
Skill不是写完就定型,需要持续迭代,迭代分为三步:
- 测试用例验证:准备正常数据、脏数据、缺失数据多组输入,多次调用Skill,观察输出是否符合预期;
- 定位漏洞:模型出现口径错误、格式错乱、胡乱猜测时,回到Skill补充约束与步骤;
- 精简冗余文本:不要堆砌大量无关描述,保持指令清晰,避免互相冲突。
小技巧:不要无限加长Skill文本。过长的规则会互相干扰,优先保证流程清晰、口径明确。
七、什么时候适合做数据分析Skill,什么时候直接用Prompt
✅适合封装为Skill
- 需要反复执行的固定报表分析(日报、周报、渠道复盘)
- 指标口径严格统一,不允许自由解读
- 需要结构化输出,供给下游系统采集结果
- 多人共用一套分析标准,避免理解分歧
❌不需要做成Skill
- 一次性临时探索分析,需求灵活多变
- 用户需要自由发散,多角度洞察,无固定报表格式
结语
优秀的数据分析Skill的核心不在于提示词多么华丽,而在于标准化 :标准化输入、标准化计算、标准化流程、标准化输出。
一个好的Skill相当于把分析师固定的分析思路沉淀成可复用的能力,让大模型不再天马行空地分析,稳定产出可信、规整的数据报告。
如果你正在搭建大模型数据分析应用,不妨从一个简单的报表Skill开始,逐步沉淀业务分析逻辑,而不是单纯依赖模型临场发挥。