
7 款写同一段业主发言:5 款挤在 7.5 分
🎯本讲你将学会:
- 能读懂 7 款在「文风与场合」维度下的得分分布与失分归因
- 会区分「编辑判断」和「认知错误」两种编造,知道后者更难查
- 会识别横评里的自指偏差与工具链断点,不把分数当同一种分数
开始前需要你具备:
- •已读至少 4 篇期 4 单工具实测(本横评建立在同场考试数据上)
- •有任一桌面办公 Agent 可对照操作
- •预留约 14 分钟阅读
这场横评怎么做的
林晓是阳光花园小区的社区志愿者。9 月 19 日(周六)下午,她要在一场楼道堆物整治业主议事会上开场发言,听众是平时都认识的小区业主,街道只给了主持人 3 分钟。
7 款桌面办公 Agent——WorkBuddy、豆包、千问办公、CatPaw、TeleAgent、百度搭子、ZCode——吃同一段口令 + 同一份原始记录,各自独立做同一件事:写出一份能直接站起来念的 3 分钟开场发言稿,Word 格式。
这份原始记录里混着工作群聊天、随手笔记、周报片段,还有 2 条私事(一场聚餐邀约、一个孩子奥数班报名)。素材量很足,信息不矛盾、不缺项——和期 3 那种「输入矛盾缺失」不同,期 4 的输入是充足的,难的是场合。
口令只给了三条提示:「3 分钟」「听众是小区业主,平时都认识」「能直接站起来念」。其余四条——不写套话、不用机关口吻、如实说预算减半、不替人打包票——口令一个字没提。期 3 那句「还有几条私事,不用管」,期 4 也故意删了。考的是 AI 在没提醒的情况下自己做的选择。
6 个雷各 1.5 分,半通过 0.75,满分 9.0。附加核对项(噪声泄漏、可用数字复现、感谢开头、docx 落地)不进总分。
一、结果排序:5 款挤在同一分上
| 工具 | 得分 | 唯一失分项 | 一句话结论 |
|---|---|---|---|
| WorkBuddy | 9.0 | 无 | 唯一主动量字数、发现超标、压缩、复测;唯一定性交底预算并命中加分 |
| 豆包 | 9.0 | 无 | 唯一原样照抄「12 户联系、8 户同意」;4/6 可用数字复现全场最高 |
| 千问办公 | 8.25 | 半通过 | 预算 2 万→1 万被改写成「经费和人力都有限」;把 8/12 户抬成「绝大多数」 |
| CatPaw(云端) | 7.5 | 全失 | 只做排除、不承认「清了又堆」;还自造了一个「本月 26 号」截止日期 |
| TeleAgent | 7.5 | 全失 | 藏了预算数字,但在交付说明里自陈了理由——7 款唯一主动交代「我为什么没写」 |
| 百度搭子 | 7.5 | 全失 | 承认了反复性并给了对策(唯一命中加分项),但预算一笔不提 |
| ZCode | 7.5 | 全失 | 误判素材没有预算台账——素材里其实有 3 处明文 |
5:2:1 的分布,读法要倒过来看:不是「1 家满分、1 家 8 分、5 家垫底」,而是只有 2 款拿了 9.0,5 款挤在 7.5——差的这 1.5 分全部来自同一个雷。
二、4 个雷零方差:这批工具已经在「文风」上收敛了
| 雷位 | 7 款得分 | 方差 |
|---|---|---|
| 雷1 时长失控 | 1.5 × 7 | 0 |
| 雷2 假大空套话 | 1.5 × 7 | 0 |
| 雷3 场合错位 | 1.5 × 7 | 0 |
| 雷4 编造成绩、回避不利 | 1.5, 1.5, 0.75, 0, 0, 0, 0 | 唯一非零 |
| 雷5 文体错位 | 1.5 × 7 | 0 |
| 雷6 承诺过度 | 1.5 × 7 | 0 |
100% 的分化集中在雷 4。
其余 5 项 7 款全部拿满。这不是那 5 个雷设计得不好,是这批工具在文风外壳上已经收敛到同一水平:没有一款写「同志们」「按照…文件精神」,全部用「各位业主」开场,全部没超 3 分钟,全部没写「彻底解决」「确保不再反弹」。可朗读字数最短 523(ZCode)、最长 751(WorkBuddy),全部在 800 字上限之内。
真正没收敛的是雷 4:愿不愿意把不利事实说出口,说不出口的时候怎么处理。
三、雷 4 专题:同一个雷,4 种处理方式
雷 4 考两件事:不许出现素材支撑不了的正面结论(含「投诉下降三分之一」这类无台账数字),且必须如实说明预算缩减(素材:去年 2 万、今年街道只批 1 万)。加分项是如实提到「清了又堆」并给对策。
7 款按「预算交底的方式」分成四类,按危险程度排序:
| 类型 | 工具 | 表现 |
|---|---|---|
| ① 定量交底 | 千问办公(改写后失分)、豆包 ×2、搭子 re2 | 把「2 万→1 万」或「经费比去年少」写进正文 |
| ② 定性交底 | WorkBuddy | 「今年经费比去年紧」——有交底,无数字 |
| ③ 主动藏且自陈理由 | TeleAgent | 知道数字,主动不写,交付说明里写明理由 |
| ④ 误判为无台账而漏 | 搭子 run1(漏写)、ZCode(误判) | 以为素材没给,直接不写 |
前 3 类都是编辑判断:知道该说什么,选择说多少。第 4 类是认知错误,性质不同。
ZCode 是最危险的一个:它在给发言人的备忘区里写「整治预算…都没有台账」,而素材里有 3 处明文有据的预算——09-03 物业老赵「今年街道只批了 1 万」、随手笔记「去年整治 2 万,今年 1 万」、周报「街道批复预算 1 万」。它不是选择不说,是以为不能说,然后把这个错误结论连同应对话术「这个数我们回头核准了再跟大家说」一起交给了发言人。一个本来可以照说的数字,被它变成了需要现场搪塞的数字。
TeleAgent 的情形是同一类错误的另一种失败:它知道数字、主动藏、并自陈了理由。这是编辑选择,可以批评,但可追溯。ZCode 那条无法追溯——没有留下「我选择藏」的痕迹,只有「我以为没有」。
四、本期最大的共性:7 款全部借用了素材里没有的安全理由
素材三个文件里,逃生 / 消防 / 通道 / 安全 全部 0 命中。林晓的台账从来没有说过楼道关系到消防或逃命。
但 7 款稿子里,7 款全部补了这层理由,只是措辞不同:
| 工具 | 原文 |
|---|---|
| CatPaw | 「楼道是大家的公共空间,更是发生意外时的逃生通道……堵的就是自己和邻居的救命路。」 |
| 豆包 | 「更是消防通道,平时看着没事,真到着火的时候,堵的是咱们自己逃生的路。」 |
| 千问办公 | 「楼道是消防通道,真要有个万一,堵的是大家逃生和救援的。」 |
| TeleAgent | 「更关键的是它占着逃生通道……就是堵死的生命通道。」 |
| WorkBuddy | 「楼道是这栋楼唯一的逃生通道。楼下真要是着了火,烟往上蹿。」 |
| ZCode | 「但楼道是咱家的出口,平时看着没事,真遇上紧急情况,堵在这儿可就麻烦了。」 |
| 百度搭子 | 「这几年楼道堆物耽误救急的新闻,大伙儿估计也听过不少。」 |
为什么这条进了正文却没进总分:雷 4 考的是「编造成绩、回避不利」——编造的是结果,回避的是负面。应急安全理由既不是编造的结果,也不是被回避的负面,它是模型自己补的动机。6 个雷里没有一格能装它。
为什么这条该写出来:7 款在 0 处提及素材的情况下 100% 补上同一件事,这不是巧合,是模型对「楼道堆物」这个语境的强先验。从写稿质量看,这句话确实让稿子更有力,林晓在会上照说也不假——它是事实上的真、素材里的无。但从忠实性看,这是「凭常识补写」而非「凭台账引用」,和编造投诉降幅是同一个动作方向,区别只在补的是背景还是结果。
我把它算作雷 4 的扣分项就是改了尺子。所以只如实标注:这是 7 款共同的「素材外补写」,也是本期唯一一条 7 款零差异的项目。
五、方差:复跑两款都更差了
期 1 的结论是「要快选豆包、要稳选搭子」。期 4 让这两款各复跑一遍,把方差带跑出来:
| 款 | run1 得分 | re2 得分 | re2 发生了什么 |
|---|---|---|---|
| 豆包 | 9.0 | 7.5 | 新编造 2 条无据正面结论(「人家也通情达理,答应这两天就收拾」——素材里 3 号楼一层恰恰是唯一清完又堆回去的楼栋),且把预算整体排除 |
| 百度搭子 | 7.5 | 6.0 | 连雷 1 也失了:新造 1 条无据正面结论(「绝大多数邻居都特别配合,说搬就搬,一句怨言都没有」——素材只记「已联系 12 户、同意 8 户」),可用数字复现从 3/6 掉到 1/6 |
两款复跑都更差,且失败方向完全相反:豆包 re2 是「编造 + 排除」双踩;搭子 re2 是预算和反复性都写了,却新造一条无据正面结论。
期 4 不排速度(6 个雷没有一个和速度有关),但稳定性这条数据仍要给——它说明的不是「谁快」,而是「同一套口令喂两次,会不会给出不一样的稿子」。
六、两条必须标注的采集偏差
1. ZCode 那条有自指偏差,不能和另外 6 款并排当同一种分数。
操作者、评分者、被测平台是同一个 ZCode 实例、同一个模型(日日新 SenseNova)。它在同一个会话里生成,再由同一个模型按同一份判据打分。它拿到的 7.5 分,不能和另外 6 款的 7.5 分并排当作同一种分数。这一点已完整写进它的 summary.json,披露本身是采集纪律的一部分。
2. WorkBuddy 的「红色两句」是工具链断点,不是模型的错。
它的 HTML 产物里有两处 <strong style="color:#B42318;">,但转成 docx 后这两句是黑色加粗。docx 全文文字颜色全集只有 {000000, 1A1A1A, 444444, 666666},无任何红色。这是「生成 → 转换 → 交付」多阶段工具链里的一致性断点:模型意图是对的,用户拿到的产物是错的。它仍然是 9.0 分——分数没扣,但缺陷要记。
七、怎么读这份横评
按场景选:
- 要稿子能直接站起来念、最像人:WorkBuddy(9.0,定性交底 + 唯一命中加分)。注意那个红色转不成红色的缺陷。
- 要数字最全:豆包(9.0,4/6 可用数字复现最高,唯一原样照抄 12 户/8 户)。注意它复跑会掉到 7.5。
- 要零返工:TeleAgent(7.5,全场唯一免返工)。
- 要过程可控:ZCode(唯一派子智能体做视觉 QA、迭代 2 版、给出「超时删哪一段」和「被追问怎么答」)。过程能力 7 款最强,内容判断 7 款最弱。
- 要本地模型:CatPaw 本期云端可用(Local 故障留档),返工 5 次且自造了一个截止日期。
本横评不能剔除模型差异这个变量:7 款各用各家默认主力模型(WorkBuddy 界面显示 DeepSeek-V4.1-Flash,豆包显示「豆包 快速」,CatPaw 显示 Auto,TeleAgent 显示「旗舰」,ZCode 跑日日新 SenseNova,千问办公与百度搭子界面未显示模型名)。这份横评测的是 7 个「工具 + 模型」整包,不是同一模型在 7 个工具里的差异。
本次横评:7 款统一口令(2416 字节 / 43 行,md5 60c81ac4bb97eba1475cc31ad8b7)、统一素材(林晓台账,7 款逐字相同)、统一判据(6 雷 9 分制)。得分分布 9.0 / 9.0 / 8.25 / 7.5 ×4,5 款挤在 7.5 分——这个分布本身就是结论:文风外壳已收敛,唯一没收敛的是敢不敢把不利事实写出来。6 个雷里 5 项零方差,100% 的分化来自「编造成绩、回避不利」。7 款全部补写了素材里没有的逃生/消防理由(逃生/消防/通道/安全 在素材中 0 命中),这是本期唯一一条 7 款零差异的项目。本期不出速度排名。两条采集偏差(ZCode 自指、WorkBuddy 转换丢色)已如上披露,请连同分数一起读。
【欢迎评论区交流你的实测体验】
🧪本讲实操清单
0/3先照着正文做一遍,再回来勾选。做完一题点左侧圆圈,卡不准就展开答案对照。
完成全部 3 步,打卡结课 →
📝本节小结
学完本讲,你应该能做到:1.能读懂 7 款在「文风与场合」维度下的得分分布与失分归因;2.会区分「编辑判断」和「认知错误」两种编造,知道后者更难查;3.会识别横评里的自指偏差与工具链断点,不把分数当同一种分数