据少数派9月14日发布的Excel AI辅助工作流横评,AI写Excel公式已相当成熟,但复杂工作流交付仍不稳定;在长流程复杂任务45次实测中,需人工介入比例达51%。测试覆盖OpenAI、Anthropic、DeepSeek、Kimi、GLM、Gemini等模型,以及官方Excel加载项、Pi for Excel侧边栏加载项和Codex独立工作台等载体。

测试者把载体定义为调用模型的方式,并认为载体重要性不亚于模型,Office侧边栏加载项是最好的载体。Office加载项主要基于Office.js API与表格交互,Pi for Excel还支持执行Python代码片段;Codex等独立工作台采用文件和提示词一同提交的端到端形式。测试还观察AI输出的是Excel原生动态公式,还是用Python算完写入静态数据,以及在提示词未要求时是否改动原始数据与版式。

数据清洗任务暴露出AI擅作主张。在按姓名匹配员工信息的A09测试中,姓名存在重名,另有两个找不到。Claude Cowork会主动询问重名如何处理;ChatGPT for Excel、Claude for Excel、DeepSeek(Pi for Excel)提到重名却按XLOOKUP默认匹配第一个值;Kimi-K3(Pi for Excel)在单元格加注释;Claude和Gemini(Pi for Excel)未提重名直接匹配;Workbuddy对找不到的名字凭空填入最像的名字。

在图书销售数据分析任务A11中,提示词要求有歧义就停下来问,但并非所有AI严格执行。能零干预、一次性彻底完成数据清洗的模型很少,问题包括未统一同义词和异构字段、不能准确理解文本型数字。后者常因AI转CSV后用pandas读取,pandas自动类型推断把文本型数字“洗白”,而Excel仍将其视为文本并排除计算,导致Python结果与Excel原生汇总对不上。

数据透视表是明显难点。A10和A11的22个输出文件中,16个即73%创建了数据透视表,14个引用正确数据源区域,但只有6个即27%计算结果正确。给数据透视表排序也难倒不少AI,Kimi K3(Pi for Excel)为按销售额从高到低排序多次触及载体最大限制,最终未实现。

深度思考并非越深越好。A08、A10、A11及Q11等长流程复杂任务的45次实测中,人工干预率为51%,而A01至A07短流程基础题为12%。Kimi K3执行A10时反复纠结Office.js API,超过25分钟后放弃用数据透视表排序;DeepSeek v4 Flash在人工提示分类有误后思考10分钟才意识到数据类型不匹配;Claude Cowork执行A08因LibreOffice文件残留卡住10分钟;Workbuddy用Hy3执行A10跑了40分钟仍无后续输出。Pi for Excel单次推理设置4096个词元思考长度上限,思考过长会被截断。

文章提醒,用AI操作Excel要小心黑箱决策,提示词要严谨,拿到文件后应修改一次原始数据,检查计算单元格能否自动更新。