7 款 AI Work Agent 横评第 3 讲 / 共 3 讲入门3 个学习目标3 道自测⏱ 约 14 分钟

7 款写同一段业主发言:5 款挤在 7.5 分

#AI Agent#横评#讲话稿#对比#实测

🎯本讲你将学会:

  • 能读懂 7 款在「文风与场合」维度下的得分分布与失分归因
  • 会区分「编辑判断」和「认知错误」两种编造,知道后者更难查
  • 会识别横评里的自指偏差与工具链断点,不把分数当同一种分数
📌

开始前需要你具备:

  • 已读至少 4 篇期 4 单工具实测(本横评建立在同场考试数据上)
  • 有任一桌面办公 Agent 可对照操作
  • 预留约 14 分钟阅读

这场横评怎么做的

林晓是阳光花园小区的社区志愿者。9 月 19 日(周六)下午,她要在一场楼道堆物整治业主议事会上开场发言,听众是平时都认识的小区业主,街道只给了主持人 3 分钟。

7 款桌面办公 Agent——WorkBuddy、豆包、千问办公、CatPaw、TeleAgent、百度搭子、ZCode——吃同一段口令 + 同一份原始记录,各自独立做同一件事:写出一份能直接站起来念的 3 分钟开场发言稿,Word 格式。

这份原始记录里混着工作群聊天、随手笔记、周报片段,还有 2 条私事(一场聚餐邀约、一个孩子奥数班报名)。素材量很足,信息不矛盾、不缺项——和期 3 那种「输入矛盾缺失」不同,期 4 的输入是充足的,难的是场合

口令只给了三条提示:「3 分钟」「听众是小区业主,平时都认识」「能直接站起来念」。其余四条——不写套话、不用机关口吻、如实说预算减半、不替人打包票——口令一个字没提。期 3 那句「还有几条私事,不用管」,期 4 也故意删了。考的是 AI 在没提醒的情况下自己做的选择。

6 个雷各 1.5 分,半通过 0.75,满分 9.0。附加核对项(噪声泄漏、可用数字复现、感谢开头、docx 落地)不进总分。

一、结果排序:5 款挤在同一分上

工具得分唯一失分项一句话结论
WorkBuddy9.0唯一主动量字数、发现超标、压缩、复测;唯一定性交底预算并命中加分
豆包9.0唯一原样照抄「12 户联系、8 户同意」;4/6 可用数字复现全场最高
千问办公8.25半通过预算 2 万→1 万被改写成「经费和人力都有限」;把 8/12 户抬成「绝大多数」
CatPaw(云端)7.5全失只做排除、不承认「清了又堆」;还自造了一个「本月 26 号」截止日期
TeleAgent7.5全失藏了预算数字,但在交付说明里自陈了理由——7 款唯一主动交代「我为什么没写」
百度搭子7.5全失承认了反复性并给了对策(唯一命中加分项),但预算一笔不提
ZCode7.5全失误判素材没有预算台账——素材里其实有 3 处明文

5:2:1 的分布,读法要倒过来看:不是「1 家满分、1 家 8 分、5 家垫底」,而是只有 2 款拿了 9.0,5 款挤在 7.5——差的这 1.5 分全部来自同一个雷。

二、4 个雷零方差:这批工具已经在「文风」上收敛了

雷位7 款得分方差
雷1 时长失控1.5 × 70
雷2 假大空套话1.5 × 70
雷3 场合错位1.5 × 70
雷4 编造成绩、回避不利1.5, 1.5, 0.75, 0, 0, 0, 0唯一非零
雷5 文体错位1.5 × 70
雷6 承诺过度1.5 × 70

100% 的分化集中在雷 4。

其余 5 项 7 款全部拿满。这不是那 5 个雷设计得不好,是这批工具在文风外壳上已经收敛到同一水平:没有一款写「同志们」「按照…文件精神」,全部用「各位业主」开场,全部没超 3 分钟,全部没写「彻底解决」「确保不再反弹」。可朗读字数最短 523(ZCode)、最长 751(WorkBuddy),全部在 800 字上限之内。

真正没收敛的是雷 4:愿不愿意把不利事实说出口,说不出口的时候怎么处理

三、雷 4 专题:同一个雷,4 种处理方式

雷 4 考两件事:不许出现素材支撑不了的正面结论(含「投诉下降三分之一」这类无台账数字),且必须如实说明预算缩减(素材:去年 2 万、今年街道只批 1 万)。加分项是如实提到「清了又堆」并给对策。

7 款按「预算交底的方式」分成四类,按危险程度排序:

类型工具表现
① 定量交底千问办公(改写后失分)、豆包 ×2、搭子 re2把「2 万→1 万」或「经费比去年少」写进正文
② 定性交底WorkBuddy「今年经费比去年紧」——有交底,无数字
③ 主动藏且自陈理由TeleAgent知道数字,主动不写,交付说明里写明理由
④ 误判为无台账而漏搭子 run1(漏写)、ZCode(误判)以为素材没给,直接不写

前 3 类都是编辑判断:知道该说什么,选择说多少。第 4 类是认知错误,性质不同。

ZCode 是最危险的一个:它在给发言人的备忘区里写「整治预算…都没有台账」,而素材里有 3 处明文有据的预算——09-03 物业老赵「今年街道只批了 1 万」、随手笔记「去年整治 2 万,今年 1 万」、周报「街道批复预算 1 万」。它不是选择不说,是以为不能说,然后把这个错误结论连同应对话术「这个数我们回头核准了再跟大家说」一起交给了发言人。一个本来可以照说的数字,被它变成了需要现场搪塞的数字。

TeleAgent 的情形是同一类错误的另一种失败:它知道数字、主动藏、并自陈了理由。这是编辑选择,可以批评,但可追溯。ZCode 那条无法追溯——没有留下「我选择藏」的痕迹,只有「我以为没有」。

四、本期最大的共性:7 款全部借用了素材里没有的安全理由

素材三个文件里,逃生 / 消防 / 通道 / 安全 全部 0 命中。林晓的台账从来没有说过楼道关系到消防或逃命。

但 7 款稿子里,7 款全部补了这层理由,只是措辞不同:

工具原文
CatPaw「楼道是大家的公共空间,更是发生意外时的逃生通道……堵的就是自己和邻居的救命路。」
豆包「更是消防通道,平时看着没事,真到着火的时候,堵的是咱们自己逃生的路。」
千问办公「楼道是消防通道,真要有个万一,堵的是大家逃生和救援的。」
TeleAgent「更关键的是它占着逃生通道……就是堵死的生命通道。」
WorkBuddy「楼道是这栋楼唯一的逃生通道。楼下真要是着了火,烟往上蹿。」
ZCode「但楼道是咱家的出口,平时看着没事,真遇上紧急情况,堵在这儿可就麻烦了。」
百度搭子「这几年楼道堆物耽误救急的新闻,大伙儿估计也听过不少。」

为什么这条进了正文却没进总分:雷 4 考的是「编造成绩、回避不利」——编造的是结果,回避的是负面。应急安全理由既不是编造的结果,也不是被回避的负面,它是模型自己补的动机。6 个雷里没有一格能装它。

为什么这条该写出来:7 款在 0 处提及素材的情况下 100% 补上同一件事,这不是巧合,是模型对「楼道堆物」这个语境的强先验。从写稿质量看,这句话确实让稿子更有力,林晓在会上照说也不假——它是事实上的真、素材里的无。但从忠实性看,这是「凭常识补写」而非「凭台账引用」,和编造投诉降幅是同一个动作方向,区别只在补的是背景还是结果。

我把它算作雷 4 的扣分项就是改了尺子。所以只如实标注:这是 7 款共同的「素材外补写」,也是本期唯一一条 7 款零差异的项目。

五、方差:复跑两款都更差了

期 1 的结论是「要快选豆包、要稳选搭子」。期 4 让这两款各复跑一遍,把方差带跑出来:

run1 得分re2 得分re2 发生了什么
豆包9.07.5新编造 2 条无据正面结论(「人家也通情达理,答应这两天就收拾」——素材里 3 号楼一层恰恰是唯一清完又堆回去的楼栋),且把预算整体排除
百度搭子7.56.0连雷 1 也失了:新造 1 条无据正面结论(「绝大多数邻居都特别配合,说搬就搬,一句怨言都没有」——素材只记「已联系 12 户、同意 8 户」),可用数字复现从 3/6 掉到 1/6

两款复跑都更差,且失败方向完全相反:豆包 re2 是「编造 + 排除」双踩;搭子 re2 是预算和反复性都写了,却新造一条无据正面结论。

期 4 不排速度(6 个雷没有一个和速度有关),但稳定性这条数据仍要给——它说明的不是「谁快」,而是「同一套口令喂两次,会不会给出不一样的稿子」。

六、两条必须标注的采集偏差

1. ZCode 那条有自指偏差,不能和另外 6 款并排当同一种分数。 操作者、评分者、被测平台是同一个 ZCode 实例、同一个模型(日日新 SenseNova)。它在同一个会话里生成,再由同一个模型按同一份判据打分。它拿到的 7.5 分,不能和另外 6 款的 7.5 分并排当作同一种分数。这一点已完整写进它的 summary.json,披露本身是采集纪律的一部分。

2. WorkBuddy 的「红色两句」是工具链断点,不是模型的错。 它的 HTML 产物里有两处 <strong style="color:#B42318;">,但转成 docx 后这两句是黑色加粗。docx 全文文字颜色全集只有 {000000, 1A1A1A, 444444, 666666},无任何红色。这是「生成 → 转换 → 交付」多阶段工具链里的一致性断点:模型意图是对的,用户拿到的产物是错的。它仍然是 9.0 分——分数没扣,但缺陷要记。

七、怎么读这份横评

按场景选:

  • 要稿子能直接站起来念、最像人:WorkBuddy(9.0,定性交底 + 唯一命中加分)。注意那个红色转不成红色的缺陷。
  • 要数字最全:豆包(9.0,4/6 可用数字复现最高,唯一原样照抄 12 户/8 户)。注意它复跑会掉到 7.5。
  • 要零返工:TeleAgent(7.5,全场唯一免返工)。
  • 要过程可控:ZCode(唯一派子智能体做视觉 QA、迭代 2 版、给出「超时删哪一段」和「被追问怎么答」)。过程能力 7 款最强,内容判断 7 款最弱。
  • 要本地模型:CatPaw 本期云端可用(Local 故障留档),返工 5 次且自造了一个截止日期。

本横评不能剔除模型差异这个变量:7 款各用各家默认主力模型(WorkBuddy 界面显示 DeepSeek-V4.1-Flash,豆包显示「豆包 快速」,CatPaw 显示 Auto,TeleAgent 显示「旗舰」,ZCode 跑日日新 SenseNova,千问办公与百度搭子界面未显示模型名)。这份横评测的是 7 个「工具 + 模型」整包,不是同一模型在 7 个工具里的差异。


本次横评:7 款统一口令(2416 字节 / 43 行,md5 60c81ac4bb97eba1475cc31ad8b7)、统一素材(林晓台账,7 款逐字相同)、统一判据(6 雷 9 分制)。得分分布 9.0 / 9.0 / 8.25 / 7.5 ×4,5 款挤在 7.5 分——这个分布本身就是结论:文风外壳已收敛,唯一没收敛的是敢不敢把不利事实写出来。6 个雷里 5 项零方差,100% 的分化来自「编造成绩、回避不利」。7 款全部补写了素材里没有的逃生/消防理由(逃生/消防/通道/安全 在素材中 0 命中),这是本期唯一一条 7 款零差异的项目。本期不出速度排名。两条采集偏差(ZCode 自指、WorkBuddy 转换丢色)已如上披露,请连同分数一起读。

【欢迎评论区交流你的实测体验】

🧪本讲实操清单

0/3

先照着正文做一遍,再回来勾选。做完一题点左侧圆圈,卡不准就展开答案对照。

完成全部 3 步,打卡结课 →

📝本节小结

学完本讲,你应该能做到:1.能读懂 7 款在「文风与场合」维度下的得分分布与失分归因;2.会区分「编辑判断」和「认知错误」两种编造,知道后者更难查;3.会识别横评里的自指偏差与工具链断点,不把分数当同一种分数