一、数据仓库介绍
注意,数据都是模拟的假数据,切记不要拿来做文章!!!
「鲸鲜优选」在天猫、京东、线下门店同时售卖标品。每月财务/数仓同学要做销售与库存分析,但业务侧丢过来的原始表往往是:
-
**商品主档多渠道、表头不统一**(天猫叫「商品编码」,京东叫「SKU」,门店叫「货号」);
-
**华东 / 华南销售流水分文件**,字段名还有细微差异;
-
**库存盘点与售后退货混在一张表**,分析前必须拆开;
-
价格带 `¥`、日期格式混乱、门店名前后空格、支付方式叫法不统一。
总共4个xlsx文件,包含下面6张基础表单:
出入库混录表

商品主表-天猫旗舰店

商品主表-京东自营店

商品主表-线下门店

销售流水-华东

销售流水-华南

二、整理流程
我们要干什么,首先我们自己要有一个清晰的认知。下面是这个案例需要的流程:
- 第一步:多渠道商品数据统一与合并。将天猫、京东、线下门店三张商品主表的字段(商品编码/SKU/货号等)统一映射为标准表头,清洗无效数据、规范化格式,最后合并为一张"商品信息"总表。
- 第二步:销售流水整合与清洗。将华东和华南的销售流水合并为"全国销售流水",统一清洗日期格式、支付方式,过滤无效订单和缺失记录。
- 第三步:库存退货混录表拆分。将"库存退货_混录表"按单据类型拆分为"销售出库明细"和"售后退货明细"两张独立表。
- 第四步:业务统计分析。基于入库的四张核心表,完成门店销售汇总(经营日报)、畅销商品TOP10、品类退货率三类业务统计。
- 第五步:报表导出。统计结果导出为可视化报表,供业务方直接使用。
最终统计的3张结果表,效果图:

三、工作流配置实践
一、数据仓库载入工作流
工作流第一步就是需要将处理的表载入到工作流里面。
打开DT-Bot工作流编辑,找到"载入表格"节点。 输入下面提示词:
1. 获取"D:\商品数仓清洗" 下的 "销售流水_华东.xlsx","销售流水_华南.xlsx,商品主档_多渠道.xlsx"。
2. 获取"D:\商品数仓清洗\商品主档_多渠道.xlsx"的"天猫旗舰店"表单的A2:G10。
我们载入了3个文件,但实际是有5个表单的,如图配置:
工作流获取: 宫中&浩气: "老罗软件"。

由于"天猫旗舰店"第一行多了无用的描述。 所以需要对"天猫旗舰店" 指定 单元格范围切片载入。如下图:

通过 "载入表格"后, 数据仓库里面的所有表的表单都进入了工作流,会输出 5 张表格,我们可以先调试运行,预览结果查看,如图:

后续操作都是通过名称来引用到表,从而对表进行操作。
二、表头整理
原始仓库数据表头很乱,我们需要先进行调整统一才能进行后面的SQL分析。我们在"载入表格"节点后面添加"表头整理",输入下面提示词:
"商品主档_多渠道_天猫旗舰店"整理表头:
1. "货品名称"改成"商品名称"。
2. "后台类目"改成"类目"。
3. "上架状态"改成"在售状态"。
4. "商品编码" ,"售价" ,去掉前后空格。
5. 调整顺序:商品编码,商品名称,类目,售价,在售状态,品牌,条码。
"商品主档_多渠道_京东自营"整理表头:
1. SKU → 商品编码 ,商品名 → 商品名称 ,一级类目 → 类目, 价格 → 售价 ,状态 → 在售状态 ,品牌名 → 品牌 ,UPC → 条码。
2. 调整顺序:商品编码,商品名称,类目,售价,在售状态,品牌,条码。
"商品主档_多渠道_线下门店"整理表头:
1. 货号 → 商品编码, 品名 → 商品名称, 品类 → 类目, 零售价 → 售价, 是否在售 → 在售状态。
2. 调整顺序:商品编码,商品名称,类目,售价,在售状态,品牌,条码。
"销售流水_华东"整理表头:
调整顺序:订单号,下单日期,门店名称,商品编码,商品名称,销售数量,实付金额,支付方式,渠道。
"销售流水_华南"整理表头:
单据编号 → 订单号
成交日期 → 下单日期
门店 → 门店名称
SKU → 商品编码
品名 → 商品名称
数量 → 销售数量
成交额 → 实付金额
付款方式 → 支付方式
销售渠道 → 渠道
最终只保留:订单号,下单日期,门店名称,商品编码,商品名称,销售数量,实付金额,支付方式,渠道
配置好的截图图下:

我们将3个门店,2个地区流水 的参差不齐的表头,统一整理成一致的了, 后面方便进行数据SQL统计分析。
我们可以调试运行以下,预览结果:

三、内容清洗器
这个是专门对行,列数据进行任意清洗整理的节点,我们在"表头整理"后面添加这个节点,配置下面提示词:
"商品主档"开头的文件进行清洗:
1. 删除「商品编码」为空的行。
2. 「商品名称」去掉首尾空格,并把连续空格压成单个空格,去掉名称里的全角括号。
3. 「售价」去掉货币符号¥、千分位逗号,转成数值;无法转换的置空。
4. 「在售状态」统一枚举:上架/Y/是 → 在售;下架/N/否 → 停售;其他保持原值。
5. 「类目」若包含"/",只保留最后一级类目名称(例如 粮油调味/冲调 → 冲调)。
6. 同一「商品编码」若重复,保留最后一行。
"销售流水"开头的文件进行清洗:
1. 「门店名称」去首尾空格。
2. 「下单日期」统一成 yyyy-MM-dd;无法解析的日期所在行删除。
3. 「支付方式」归一:微信/微信支付 → 微信;支付宝/支付宝支付 → 支付宝;刷卡 → 银行卡;现金 → 现金。
4. 「销售数量」「实付金额」转数值;数量≤0 或金额<0 的行删除。
5. 「商品编码」「订单号」去首尾空格;任一为空则删除该行。
我们通过模糊匹配拿到了5个文件,然后进行了一堆清洗, 注意:提示词不一定要按照我的,你自己描述明白就行了。
配置好的截图图下:

四、表格合并
我们需要把 华东+华南的合成一张大表,还有三个渠道的商品数据也合成一张大表。

我们在"清洗"后面添加这个合并节点,配置下面提示词:
1. "商品主档"开头的文件上下合并,输出"商品信息"。
2."销售流水"开头的文件上下合并,输出"全国销售流水"
tip: 这个合并还支持字段匹配查找的左右连接,只是案例这里不涉及到.
经过合并,就输出了2个大表了, 我们预览结果如图:

五、入库
经过清洗后,我们就可以入库了,就是将表放到本地数据库里面,后面进行sql统计分析。
在"合并"节点后配置上入库,无需输入任何参数,直接将上一个节点的输出文件导入到本地数据库里面,如图:

由于合并节点,输出了2个文件,所以,就只有2个表生成到数据库里面了。 同样我们可以预览结果:

六、库存退货_混录表拆分,入库
到此,我们数据仓库里面还有一个文件 "库存退货_混录表.xlsx" ,这个是需要进行拆分,然后入库的。
数据载入我就不讲了,直接配置拆分,提示词:
按「单据类型」列拆分文件
配置如图:

注意! 这里是新开辟一条链路, 因为上面的业务已经入库完成了, 不需要上面输出的文件了,这是一条新的业务处理。
拆分完成后,我们可以预览结果:

后面如果你的数据还需要清洗,就接入清洗,清洗完成后,就可以接入 "数据入库" 了, 这里我就不详细展开了。
七、SQL统计
"表SQL统计"非常强大,可以根据你任意的描述生成sql然后执行。
到这里,我们数据库里面应该有4张表(2张合并的大表+2张拆分的表), 我们可以直接查看当前数据库里面的表信息,如图:


然后我们需要进行下面3个统计。
统计① · 门店销售汇总(经营日报)
统计提示词如下:
基于"全国销售流水",按「门店名称」汇总:
- 订单数(去重订单号个数)
- 销售件数(销售数量合计)
- 销售总额(实付金额合计)
- 客单价(销售总额 / 订单数)
按销售总额从高到低排序。
添加SQL统计节点,如图:

统计的结果数据:

还可以回溯 SQL, 也就是能看到 工作流用到的sql是什么,sql查询了什么,点击上图的"查询步骤解析",展示如下:

此时,数据库里面就有5张表了,查看如图:

最后我们直接配置好另外的2个统计。
统计② · 畅销商品 TOP(商品运营)
统计提示词如下:
基于"全国销售流水",按「商品编码」「商品名称」汇总销售数量合计、实付金额合计, 按销售数量降序取前 10 名。
统计③ · 品类退货率(风控 / 供应链)
统计提示词如下:
以"全国销售流水"为主表,根据商品编码从商品主档_全渠道查找类目;
再关联售后退货明细(按商品编码汇总退货金额);
按类目统计:销售总额、退货总额、退货率(退货总额/销售总额)。
按退货率从高到低排序。
八、导出表
"报表导出"是将数据库任意表进行导出成CSV/XLSX/HTML , 其中HTML 是可视化展示,浏览器直接打开,不依赖网络,断网也能打开。
选择要出库的表,还有类型就可以了,如图:

四、总结
本案例将多源异构的原始数据,经过表头统一、内容清洗、合并整合、混录拆分后入库,最终完成门店销售汇总、畅销商品TOP10、品类退货率三项统计并导出报表,实现分析流程自动化,大幅提升效率并确保数据口径一致。
后面我还会带来更多的数据清洗统计的案例,欢迎大家多多关注。