同一道 Excel 任务,四款 Agent 的公式、修改范围与缓存有何不同?

把 Agent 返回的 XLSX 接进后续读取流程时,除了核对算式,还要知道文件里存的是公式、常量还是计算缓存。EvalDock 对同一道日期滚动求和任务的四份最终交付做了逐格比较:三款产品填满16个公式,WPS 灵犀只补后八格;三份完整公式交付的结果一致,缓存保存方式却不同。

同题输入:哪些是示例,哪些还没有算?

这张表的 A 列是日期,B 列是当天积分,C 列要计算日期窗口内的合计。日期递增,但并不连续,不能简单把前七行相加。

本题约定的窗口是:当前日期减七天,直到当前日期,两端都包含。 例如 3 月 12 日要计入 3 月 5 日的记录。这与"含当天共七个自然日"相差一天,比较公式时必须沿用题目的口径。

输入的目标区分成三段:

位置 输入文件原有内容 本题应交付的结果
C4:C6 三个文本 n/a 4、6、12
C7:C11 五个示例常量 18、26、32、26、14
C12:C19 八个空白格 4、8、12、18、24、33、33、34

这些预期值由输入日期与积分独立计算,并与参考工作簿逐格核对。原题要求用公式计算,验收区域是完整的 16 格,不能只从第一个空白格开始看。

四款产品的修改范围有何不同?

从原工作簿提取的内容类型与修改范围,按单元格区段重排,非软件截图。

产品 C4:C6 C7:C11 C12:C19
千问办公 三个公式 五个公式,替换原常量 八个公式
WPS 灵犀 原文本 n/a 保留五个原常量 八个公式
WorkBuddy 三个公式 五个公式,替换原常量 八个公式
豆包工作 三个公式 五个公式,替换原常量 八个公式

千问、WorkBuddy、豆包的 16 格公式按本题输入求值,均与预期一致。灵犀的后八格公式和中间五格常量合计 13 格与预期一致,前三格仍没有得到需要的计算结果。这是对目标区的核对,不是产品总体准确率。

四份文件都只有 Sheet1。在这张表已有内容的范围内,目标区外的值、公式、数据类型及数字格式没有发现变化;目标区的数字格式也与输入一致。这个检查不包含所有版式、图形对象或跨软件兼容性。

同样算出 26,公式也有两种写法

差异不只在"有没有补齐"。以 3 月 12 日所在的 C8 为例,千问写入的是:

excel 复制代码
=SUMIFS($B$4:$B8,$A$4:$A8,">="&$A8-7)

它把求和范围限制在第一条记录到当前行,再筛选不早于七天前的记录。在本题日期递增的输入中,后面的日期不需要参加当前行计算。

WorkBuddy 的同一格写入:

excel 复制代码
=SUMIFS($B$4:$B$19,$A$4:$A$19,">="&A8-7,$A$4:$A$19,"<="&A8)

它扫描固定的全部 16 条记录,同时检查日期下限和上限。豆包采用相同的日期条件,只是把两个条件的顺序调换,并给减七天的表达式加了括号。灵犀补入后八格的公式也采用这种固定范围、上下限同时筛选的方式。

在实际输入上,这些公式都能得到对应的正确结果。C8 的独立计算是 4+2+6+6+8=26。不同的公式文本不等于不同的计算质量;应先看它们在题目条件下是否表达同一规则。

同时,这些都是本题范围内的交付。千问的写法利用了记录顺序;其他三款的公式范围固定到第 19 行。若以后改变排序、加入同日多条记录或追加新行,需要按新的数据约定另验,不能从这次结果直接推断。

下游读取:公式存在,但缓存可能为空

XLSX 可以同时保存公式和上次计算的缓存值。本次四份原文件在这一点上也有区别:

产品 目标区公式格数 其中保存了可读取数值缓存的公式格
千问办公 16 16
WPS 灵犀 8 8
WorkBuddy 16 0
豆包工作 16 0

WorkBuddy 和豆包的 16 格公式确实存在,但原文件中没有对应的数值缓存。只读取缓存的程序,在这些格上会得到空值。把这种空值直接判成"Agent 没有填写",就会错过文件里已经存在的公式。

本次对照将三件事分开记录:原公式、原文件缓存、按公式和输入计算的结果。我们逐格复算,并用 LibreOffice 对副本重算交叉核对;两种计算得到的结果一致。历史评分也记录了重算步骤,但那是原评测的操作,不能与原文件自带缓存混为一谈。

这一差异说明,接收文件的方式会影响后续使用。如果下一步是只读缓存的数据流程,就要明确安排计算与保存环节;如果交给能计算公式的表格软件,还应在实际使用的软件里确认显示与更新。本文没有把计算引擎中的一致结果扩大成所有 Excel 版本和导入工具都兼容。

这道题能给交付验收增加什么?

只看文件名和截图,很难分清三种情况:格子仍是占位文本、格子是不会随输入变化的常量、格子已有公式但没有缓存。本题把它们同时放在了四份可比的文件中。

下次接收类似表格,可以在记录里保留"完整目标区、每格内容类型、公式求值依据、下一步读取方式"。这样,修改范围和使用条件都有明确落点,也能把返工写成具体要求:补齐哪几格、保留哪些源数据、是否要求公式,以及是否需要提供已计算并保存的文件。

本题的结果支持这些交付差异,不支持稳定优胜结论。三份文件在原输入上都算对,并不意味着它们在新增行、改排序或重复运行后一定同样表现。

来源与测试条件

案例来自 EvalDock 于北京时间 2026 年 9 月 24 日完成的办公实测,本篇于 2026 年 9 月 30 日复核既有产物。原评测为五套题集各 15 题、四产品共 300 项最终结果;本文仅比较其中一道 SpreadsheetBench Verified 子集任务的四份工作簿,不是完整官方复现。

原测试允许人工辅助、续接和重试,观察最终交付;本题未重复运行。WPS 灵犀记录配置为 DeepSeek V4.1 Flash,WorkBuddy 为 hy4-preview,来自执行记录或评测方确认,未独立核实后端;千问和豆包精确后端模型未知。结果只适用于这次任务、配置和交付。

评测背景见 EvalDock 《四款办公 Agent,75 道任务实测》。本文由 EvalDock 团队撰写。

相关推荐
其然乐衣1 小时前
Claude Code 三大配置体系详解:settings.json / CLAUDE.md / memory
人工智能
CHENKONG_CK1 小时前
RFID 赋能汽车零部件涂装产线,构建全流程数字化追溯体系
网络·人工智能·单片机·网络协议·tcp/ip·汽车
桃西西呀1 小时前
用 Laya 把出海 App 的几百条混语评价拆成可统计的判断
人工智能·llm·ai编程
智能RPA1 小时前
能源电力行业智能体自动化平台对比评测(调度与抄表场景)
人工智能·自动化·能源·agent·rpa
ai小陈1 小时前
深度学习CUDA OOM排查:显存占用与碎片问题实战
服务器·人工智能·python·深度学习·ai·gpu算力
奇思妙想聪明勤奋的小羊1 小时前
ai-agent-book第五章:Coding Agent 与通用 Agent 学习笔记
人工智能·笔记·学习
掘金011 小时前
Cursor Agent Prompt 拆解
人工智能·程序员·github
Dawson Zhu1 小时前
大模型推理的三维本质:原理解析与工程实践
人工智能·语言模型·架构·aigc·agi
回眸&啤酒鸭1 小时前
【回眸】低压电工实操考试
人工智能