7 款 AI Work Agent 横评 📋 实测报告 实战 3 个学习目标 2 道自测 ⏱ 约 12 分钟

GLM-5.3-Flash实测:7款AI Agent整理文档对比

#AI Agent#实测#教程

你是不是也遇到过

从网页或微信复制一段文字,粘出来空行连成片、缩进忽左忽右,手动排版十分钟就没了。把这种烂摊子交给AI整理,到底靠不靠谱?我们实测了7款。

我们是怎么测的

同一段乱文档、同一条指令(整理成规范Word:标题居中、正文宋体小四、1.5倍行距),原样发给7款桌面AI Agent,记录耗时、下载文件、解包逐段检查格式。本次七场实测与全部稿件均由ZCode驱动完成,底层模型为GLM-5.3-Flash。GLM-5.3-Flash是智谱8月26日发布的GLM-5系列首个原生多模态模型,公开评测中表现追平Claude Opus 4.8,价格约为其1/40。

七方成绩单

七方成绩单:7款工具整理同一份乱文档的实测数据

说明:格式达标指标题居中、正文宋体小四、1.5倍行距等核心要求全部满足(基于docx解包逐段检查);缩进规范指称呼与各级小标题顶格、仅正文段首行缩进;内容越界指对正文做了整理范围之外的增加或改写。

比较项 工具 核心标签 / 一句话
豆包 118 秒 · 全场最快 安静自动跑完,一步到位
TeleAgent 126 秒 · 亚军 时间线精确到每步耗时,可回看
ZCode 136 秒 交付脚本,过程可审查可复用
千问办公 151 秒 自解压包验格式,自检报告可读
CatPaw 240 秒 内容零改动,编号称呼一字不改
WorkBuddy 307 秒 多 Agent 面板炫,但会补占位内容
百度搭子 450 秒 · 最慢 需授权,慢但每步有交代

三个最反转的发现

发现一:速度差近4倍,提示语风格也完全不同

最快的豆包和最慢的百度搭子差了332秒。看两张”处理过程中”的截图感受一下:

豆包执行中:面板提示"解析需求、读取文档技能、生成文档、验证格式",118秒收工 百度搭子执行中:中途弹出授权确认框,需要用户选择后才能继续,全程450秒

豆包的界面是安静的步骤提示,一路自动跑完;百度搭子则会停下来找你确认授权,多了一道交互、也多了一份掌控感。快和稳,你选哪个?

发现二:WorkBuddy替你写了”你不是说的话”

WorkBuddy完成结果:面板显示已完成,产物为output.docx

原文”三、时间节点”下面是空的,其他6家都保留了空节,只有WorkBuddy自动补了两句:“(具体时间节点待确认)“和文末的”(发文单位/日期待确认)“,条目编号也从”1、“改成了”1.”。听起来贴心,但这类占位句如果没删干净就发出去,是会闹笑话的。

发现三:ZCode交作业,连”草稿”一起交

ZCode的对话界面:脚本编写、终端执行、格式自检全程摊开可见

其余6家交付的都是”最终文档”,只有ZCode把生成脚本也留在了目录里——哪一行负责居中、哪一行设行距,全部可审查、可修改、可复用。代价是它的界面就是一屏对话流,没有炫酷面板,过程要自己滚动看。

该怎么选

根据你的优先级挑:

  • 要快:选豆包(118秒)
  • 要过程可审查/可复用:选 ZCode
  • 要内容零改动:选 CatPaw
  • 要自检报告:选千问办公
  • 要时间线精细:选 TeleAgent
  • 要面板炫:选 WorkBuddy(注意通读删占位句)
  • 要慢但稳:选百度搭子

实话说在前面

以上全部是单次采样,不是统计结论。AI工具有状态波动,数据的横向可比性大于绝对值。我们后续会对每家复跑两次取中位数,更新这份数据。

轮到你了

你平时用什么工具整理文档排版?有没有遇到过AI”好心办坏事”替你补内容的情况?评论区聊聊,下期我们测「表格整理」。

【本文由AI辅助生成初稿,作者已审阅确认后发布,欢迎评论区交流你的实测体验】

🧪本篇实测清单

0/2

先照着正文做一遍,再回来勾选。做完一题点左侧圆圈,卡不准就展开答案对照。

完成全部 2 步,打卡结课 →