把 Agent 返回的 XLSX 接进后续读取流程时,除了核对算式,还要知道文件里存的是公式、常量还是计算缓存。EvalDock 对同一道日期滚动求和任务的四份最终交付做了逐格比较:三款产品填满16个公式,WPS 灵犀只补后八格;三份完整公式交付的结果一致,缓存保存方式却不同。
同题输入:哪些是示例,哪些还没有算?
这张表的 A 列是日期,B 列是当天积分,C 列要计算日期窗口内的合计。日期递增,但并不连续,不能简单把前七行相加。
本题约定的窗口是:当前日期减七天,直到当前日期,两端都包含。 例如 3 月 12 日要计入 3 月 5 日的记录。这与"含当天共七个自然日"相差一天,比较公式时必须沿用题目的口径。
输入的目标区分成三段:
| 位置 | 输入文件原有内容 | 本题应交付的结果 |
|---|---|---|
| C4:C6 | 三个文本 n/a |
4、6、12 |
| C7:C11 | 五个示例常量 | 18、26、32、26、14 |
| C12:C19 | 八个空白格 | 4、8、12、18、24、33、33、34 |
这些预期值由输入日期与积分独立计算,并与参考工作簿逐格核对。原题要求用公式计算,验收区域是完整的 16 格,不能只从第一个空白格开始看。
四款产品的修改范围有何不同?
从原工作簿提取的内容类型与修改范围,按单元格区段重排,非软件截图。
| 产品 | C4:C6 | C7:C11 | C12:C19 |
|---|---|---|---|
| 千问办公 | 三个公式 | 五个公式,替换原常量 | 八个公式 |
| WPS 灵犀 | 原文本 n/a |
保留五个原常量 | 八个公式 |
| WorkBuddy | 三个公式 | 五个公式,替换原常量 | 八个公式 |
| 豆包工作 | 三个公式 | 五个公式,替换原常量 | 八个公式 |
千问、WorkBuddy、豆包的 16 格公式按本题输入求值,均与预期一致。灵犀的后八格公式和中间五格常量合计 13 格与预期一致,前三格仍没有得到需要的计算结果。这是对目标区的核对,不是产品总体准确率。
四份文件都只有 Sheet1。在这张表已有内容的范围内,目标区外的值、公式、数据类型及数字格式没有发现变化;目标区的数字格式也与输入一致。这个检查不包含所有版式、图形对象或跨软件兼容性。
同样算出 26,公式也有两种写法
差异不只在"有没有补齐"。以 3 月 12 日所在的 C8 为例,千问写入的是:
excel
=SUMIFS($B$4:$B8,$A$4:$A8,">="&$A8-7)
它把求和范围限制在第一条记录到当前行,再筛选不早于七天前的记录。在本题日期递增的输入中,后面的日期不需要参加当前行计算。
WorkBuddy 的同一格写入:
excel
=SUMIFS($B$4:$B$19,$A$4:$A$19,">="&A8-7,$A$4:$A$19,"<="&A8)
它扫描固定的全部 16 条记录,同时检查日期下限和上限。豆包采用相同的日期条件,只是把两个条件的顺序调换,并给减七天的表达式加了括号。灵犀补入后八格的公式也采用这种固定范围、上下限同时筛选的方式。
在实际输入上,这些公式都能得到对应的正确结果。C8 的独立计算是 4+2+6+6+8=26。不同的公式文本不等于不同的计算质量;应先看它们在题目条件下是否表达同一规则。
同时,这些都是本题范围内的交付。千问的写法利用了记录顺序;其他三款的公式范围固定到第 19 行。若以后改变排序、加入同日多条记录或追加新行,需要按新的数据约定另验,不能从这次结果直接推断。
下游读取:公式存在,但缓存可能为空
XLSX 可以同时保存公式和上次计算的缓存值。本次四份原文件在这一点上也有区别:
| 产品 | 目标区公式格数 | 其中保存了可读取数值缓存的公式格 |
|---|---|---|
| 千问办公 | 16 | 16 |
| WPS 灵犀 | 8 | 8 |
| WorkBuddy | 16 | 0 |
| 豆包工作 | 16 | 0 |
WorkBuddy 和豆包的 16 格公式确实存在,但原文件中没有对应的数值缓存。只读取缓存的程序,在这些格上会得到空值。把这种空值直接判成"Agent 没有填写",就会错过文件里已经存在的公式。
本次对照将三件事分开记录:原公式、原文件缓存、按公式和输入计算的结果。我们逐格复算,并用 LibreOffice 对副本重算交叉核对;两种计算得到的结果一致。历史评分也记录了重算步骤,但那是原评测的操作,不能与原文件自带缓存混为一谈。
这一差异说明,接收文件的方式会影响后续使用。如果下一步是只读缓存的数据流程,就要明确安排计算与保存环节;如果交给能计算公式的表格软件,还应在实际使用的软件里确认显示与更新。本文没有把计算引擎中的一致结果扩大成所有 Excel 版本和导入工具都兼容。
这道题能给交付验收增加什么?
只看文件名和截图,很难分清三种情况:格子仍是占位文本、格子是不会随输入变化的常量、格子已有公式但没有缓存。本题把它们同时放在了四份可比的文件中。
下次接收类似表格,可以在记录里保留"完整目标区、每格内容类型、公式求值依据、下一步读取方式"。这样,修改范围和使用条件都有明确落点,也能把返工写成具体要求:补齐哪几格、保留哪些源数据、是否要求公式,以及是否需要提供已计算并保存的文件。
本题的结果支持这些交付差异,不支持稳定优胜结论。三份文件在原输入上都算对,并不意味着它们在新增行、改排序或重复运行后一定同样表现。
来源与测试条件
案例来自 EvalDock 于北京时间 2026 年 9 月 24 日完成的办公实测,本篇于 2026 年 9 月 30 日复核既有产物。原评测为五套题集各 15 题、四产品共 300 项最终结果;本文仅比较其中一道 SpreadsheetBench Verified 子集任务的四份工作簿,不是完整官方复现。
原测试允许人工辅助、续接和重试,观察最终交付;本题未重复运行。WPS 灵犀记录配置为 DeepSeek V4.1 Flash,WorkBuddy 为 hy4-preview,来自执行记录或评测方确认,未独立核实后端;千问和豆包精确后端模型未知。结果只适用于这次任务、配置和交付。
评测背景见 EvalDock 《四款办公 Agent,75 道任务实测》。本文由 EvalDock 团队撰写。