GLM-5.3-Flash实测:7款AI Agent整理文档对比
你是不是也遇到过
从网页或微信复制一段文字,粘出来空行连成片、缩进忽左忽右,手动排版十分钟就没了。把这种烂摊子交给AI整理,到底靠不靠谱?我们实测了7款。
我们是怎么测的
同一段乱文档、同一条指令(整理成规范Word:标题居中、正文宋体小四、1.5倍行距),原样发给7款桌面AI Agent,记录耗时、下载文件、解包逐段检查格式。本次七场实测与全部稿件均由ZCode驱动完成,底层模型为GLM-5.3-Flash。GLM-5.3-Flash是智谱8月26日发布的GLM-5系列首个原生多模态模型,公开评测中表现追平Claude Opus 4.8,价格约为其1/40。
七方成绩单
说明:格式达标指标题居中、正文宋体小四、1.5倍行距等核心要求全部满足(基于docx解包逐段检查);缩进规范指称呼与各级小标题顶格、仅正文段首行缩进;内容越界指对正文做了整理范围之外的增加或改写。
| 比较项 | 工具 | 核心标签 / 一句话 |
|---|---|---|
| 豆包 | 118 秒 · 全场最快 | 安静自动跑完,一步到位 |
| TeleAgent | 126 秒 · 亚军 | 时间线精确到每步耗时,可回看 |
| ZCode | 136 秒 | 交付脚本,过程可审查可复用 |
| 千问办公 | 151 秒 | 自解压包验格式,自检报告可读 |
| CatPaw | 240 秒 | 内容零改动,编号称呼一字不改 |
| WorkBuddy | 307 秒 | 多 Agent 面板炫,但会补占位内容 |
| 百度搭子 | 450 秒 · 最慢 | 需授权,慢但每步有交代 |
三个最反转的发现
发现一:速度差近4倍,提示语风格也完全不同
最快的豆包和最慢的百度搭子差了332秒。看两张”处理过程中”的截图感受一下:
豆包的界面是安静的步骤提示,一路自动跑完;百度搭子则会停下来找你确认授权,多了一道交互、也多了一份掌控感。快和稳,你选哪个?
发现二:WorkBuddy替你写了”你不是说的话”
原文”三、时间节点”下面是空的,其他6家都保留了空节,只有WorkBuddy自动补了两句:“(具体时间节点待确认)“和文末的”(发文单位/日期待确认)“,条目编号也从”1、“改成了”1.”。听起来贴心,但这类占位句如果没删干净就发出去,是会闹笑话的。
发现三:ZCode交作业,连”草稿”一起交
其余6家交付的都是”最终文档”,只有ZCode把生成脚本也留在了目录里——哪一行负责居中、哪一行设行距,全部可审查、可修改、可复用。代价是它的界面就是一屏对话流,没有炫酷面板,过程要自己滚动看。
该怎么选
根据你的优先级挑:
- 要快:选豆包(118秒)
- 要过程可审查/可复用:选 ZCode
- 要内容零改动:选 CatPaw
- 要自检报告:选千问办公
- 要时间线精细:选 TeleAgent
- 要面板炫:选 WorkBuddy(注意通读删占位句)
- 要慢但稳:选百度搭子
实话说在前面
以上全部是单次采样,不是统计结论。AI工具有状态波动,数据的横向可比性大于绝对值。我们后续会对每家复跑两次取中位数,更新这份数据。
轮到你了
你平时用什么工具整理文档排版?有没有遇到过AI”好心办坏事”替你补内容的情况?评论区聊聊,下期我们测「表格整理」。
【本文由AI辅助生成初稿,作者已审阅确认后发布,欢迎评论区交流你的实测体验】
🧪本篇实测清单
0/2先照着正文做一遍,再回来勾选。做完一题点左侧圆圈,卡不准就展开答案对照。
完成全部 2 步,打卡结课 →