一句话定位:一个数据分析全流程技能,从体检脏表到交付报告,八步标准作业,确保每一个数字都能被追溯和验证。

一个被忽视的真相:AI 算错的时候不会报错
你写代码,错了会抛异常。你做数据分析,错了什么都不会发生。
这是一个非常可怕的事实。一个 +161% 的计算错误,交付出去的时候和正确答案长得完全一样------零报错、零 NaN、零警告。
项目 README 里举了一个真实的例子:同一份销售表,主流做法(pd.read_excel())算出的月度总额是 34,893,234 ,而真值是 13,367,767。误差 +161%。
错在三个地方:
- "合计"行被当成了一家门店
- "华东小计"又被当成了一家门店
- 一行粘贴事故造成的重复数据算了两次
没有任何一处会报错。
Panko (1998) 的研究说 86% 的电子表格含有错误。这不是危言耸听,这是有实证支撑的事实。
huashu-excel 存在的全部理由,就是让那句"这个数你怎么算的?"能被答上来。
Github:

它有多大?核心数据
- GitHub 星星:39(2026 年 8 月 23 日创建,仅一天)
- Fork 数:3
- 主要语言:Python
- 协议:MIT
- 唯一依赖:openpyxl
这个项目非常新,但它的 README 写得极其详细(17,770 字节),方法论引用了 Tukey、Cleveland & McGill、ICAEW 等多个权威来源。这不是一个"先发布再完善"的项目,而是一个"想清楚了再发布"的项目。
核心理念:八步标准作业流程
huashu-excel 定义了一套完整的数据分析流程,每一步都有明确的目标和检查机制:
arduino
1 体检 这张表长什么样 ------ 结构、类型、脏点。先看再算
2 清洗 变成规范分析表,每一步可追溯可回放
3 对齐 摸底 → 查外部基准 → 告诉用户 → 问清他要什么 → 定口径
4 分析 扫陷阱,走配方,每条发现都推到"所以呢"
5 对账 行数守恒、总和守恒、与表内合计交叉验证
6 交付 Excel / 图表 / 报告,口径随数字一起交付
7 验图 渲染出来看画错了没有------手写 SVG 必然会犯那几类错
8 质控 另派一个没参与创作的 agent 从原始数据重算,拆你的台
最后一步"质控"是最容易被省掉的,而它抓到的问题比前面所有闸门加起来还多。

五个和别的工具不一样的地方
一、先看原始单元格,再动 pandas
pd.read_excel() 读进来的那一刻,合并单元格、单元格格式、原始类型就全丢了。现有工具都是在信息已经损毁之后才开始判断。
huashu-excel 的体检脚本先用 openpyxl 读原始格子,在"还没决定用什么工具处理这张表"的时刻就能发现问题。
二、把表里的"合计"行当成免费的校验和
所有工具都把汇总行当噪音过滤掉。但那是原表作者用公式算出来的真值。拿清洗后的明细自己求和去对它------对不上就说明有一方错了。
这对应 ICAEW《Financial Modelling Code》(2024) 的 Include a master check。
三、默认给五数概括,不给均值
业务数据几乎总是右偏的。df.describe() 把 mean/std 放在最前面,而均值在偏态分布下描述的不是任何一个真实对象。
huashu-excel 默认输出 min/Q1/中位数/Q3/max + IQR,这是 Tukey 的抗差统计。
四、机器判事实,人判品味
"行数对不对、总和守不守恒、这个数能不能追回源单元格"------机器验死,自动跑。
"这个分析有没有意义、该不该这么切"------明确交还给人,绝不用一个分数冒充客观。
五、它不是一个分析师,是一个团队
这件事外包给顶级咨询公司,不会只派一个数据分析师。所以它要依次成为领域专家 / 数据分析师 / 战略顾问 / 视觉设计师 / 前端工程师 / 质控------角色之间打架的地方保留下来,那是信息量最大的部分。

独立脚本:脱离 agent 也能用
huashu-excel 的脚本可以脱离 AI 助手单独使用:
bash
python3 scripts/profile_table.py 你的表.xlsx # 算数字之前先看清楚
python3 scripts/verify_numbers.py 你的表.xlsx # 退出码 1 = 有对不上的
python3 scripts/verify_visual.py 报告.html # 退出码 1 = 图画错了
python3 scripts/verify_docx.py 报告.docx # 退出码 1 = Word 走样了
依赖只有 openpyxl(读写 .xlsx 时),CSV 路径和报告生成连它都不用,纯标准库。不用 pandas、不用绘图库、不用 LibreOffice、不联网、不依赖任何 agent 平台特性。
方法论出处
这份技能的判断力不是凭空来的,每条都有出处:
| 来源 | 用在哪 |
|---|---|
| Hadley Wickham, Tidy Data | 清洗的目标形态与五类脏数据分类 |
| John Tukey, Exploratory Data Analysis (1977) | 五数概括、抗差统计、箱线图 |
| ICAEW, Financial Modelling Code (2024) | master check、可追溯引用 |
| Cleveland & McGill (1984) | 视觉编码的感知精度阶梯 |
| Gene Zelazny, Say It With Charts | 先定信息再选图 |
| Barbara Minto, The Pyramid Principle | 结论先行、MECE、SCQA |
| Panko (1998)、EuSpRIG | 电子表格错误的实证规模 |
三届微软 Excel 世界冠军 Andrew Ngai 的判断,是这份技能的立论:
如果你用错误的数据训练 AI,它会给你错误的结果------但它还会装出对这些错误结果非常自信的样子。

这个项目适合谁?
用 AI 做数据分析的人------如果你经常让 AI 帮你分析 Excel 表格,这个技能能帮你避免"AI 自信地算错"的问题。
数据分析师------八步流程本身就是一套完整的数据分析方法论,即使不用 AI 也值得参考。
需要交付数据报告的人------从体检到交付的完整链路,确保每一个数字都能被追溯。
Excel 用户------那些"合并单元格+千分位+汇总行混在一起"的脏表,这个技能专门治它们。
Github:
总结
huashu-excel 不是一个"又一个数据分析工具"。它的核心价值不在于"能分析数据",而在于能证明数据是对的。
在 AI 分析越来越普及的今天,"AI 算出来的数字对不对"正在成为一个新的信任问题。huashu-excel 用八步流程和多重验证机制,为这个问题提供了一个系统性的答案。
39 颗星星说明它还很年轻,但 17,777 字节的 README 和严谨的方法论引用说明:这是一个想清楚了再动手的项目。
我的理解
看完 huashu-excel 的 README,我最欣赏的是它对"对账"的执着。
大多数数据分析工具的流程是:读数据 → 清洗 → 分析 → 出报告。huashu-excel 在中间加了两个关键步骤:对齐 (搞清楚用户到底要什么)和对账(用表里自带的合计行验证自己的计算)。
特别是"对账"这一步------它把表里现成的合计行当成免费的校验和,拿清洗后的明细自己算一遍去对。对不上就报错,通过了才给数字。
这种"先验证再信任"的设计哲学,在 AI 工具中非常稀缺。大多数 AI 工具给你一个看起来很专业的答案,但不告诉你这个答案是怎么来的、能不能被验证。huashu-excel 说:不通过就不给你数字。
这可能是数据分析领域最需要的一件事:不是更快的分析,而是更可信的分析。
关注
如果你觉得这篇文章对你有帮助,欢迎关注我的公众号,获取更多优质开源项目的深度解读。