先泼冷水:多智能体不是银弹
官方评测实测——有的档位组队更好,有的档位组队反而更差
上一节的演示很燃,网上吹多智能体的文章更燃:"AI 团队吊打单打独斗"。
但这门课得对你诚实。AO 官方自己做过一轮盲评质量评测——同一个任务,多智能体流水线的产出 vs 你直接写一句提示词问 AI(下面表格里叫"单次 prompt")的产出,让不知情的裁判打分。结论是:多智能体不总是赢,有的档位下它反而更差。
哪个档位赢、哪个档位输、为什么——这一节把数据摊开给你看。看懂它,你会比 90% 吹爆多智能体的人都清醒。
分工像接力赛:队员都够格时,接力比一个人跑全程快;可要是队员会掉棒,交接一次就掉一次,还不如让最强的那个人独跑。多智能体的"交接",就是这个棒——模型档位决定了它是加速器还是掉棒现场。
评测怎么做的(先看方法,再信结论)
- 同一输入,跑「多智能体工作流」和「单次 prompt」各一份产出;
- 盲评:裁判不知道哪份是谁的,正反两个顺序各评一次取平均(抵消位置偏置);
- 每个模板跑 3 次取平均(压住单次运气);
- 生成用待测模型,评审固定用强模型。
这套方法论本身就值得学——它就是主课 P4"看证据不看语气"的落地版。
结果:三个档位,三种命运
(表里的分数是裁判打的 10 分制,越高越好;"模型档位"指驱动专家的那个 AI 有多强——就像同一套岗位手册,交给实习生、熟手、大师三种人执行。)
① 弱模型(llama3 8B 本地小模型):组队反而更差
| 模板 | 多智能体 | 单次 prompt | 胜者 |
|---|---|---|---|
| 短篇小说 | 5.0 | 6.3 | ❌ 单次 |
| 技术博客 | 3.0 | 4.5 | ❌ 单次 |
| 观点文章 | 2.5 | 5.2 | ❌ 单次 |
| 产品评审 | 4.7 | 4.2 | ✅ 多智能体 |
1 胜 3 负,且三个败局都是三连败——不是运气,是规律。
② 中档模型(DeepSeek,AO 的默认):组队明显更好
| 模板 | 多智能体 | 单次 prompt | 胜者 |
|---|---|---|---|
| 短篇小说 | 8.0 | 7.0 | ✅ 多智能体 |
| 技术博客 | 8.2 | 5.7 | ✅ 多智能体(3/3 全胜) |
| 观点文章 | 8.7 | 8.2 | ✅ 多智能体 |
| 产品评审 | 7.5 | 7.7 | ❌ 单次 |
3 胜 1 负。技术博客一项 8.2 对 5.7 决定性胜出——单次写的博客有 bug 和截断,流水线交出的完整可发布。
③ 强模型(Claude):大致打平,偏负
1 胜 3 负——单次已接近上限,再加编排工序,边际收益趋零。
为什么会这样:交接是把双刃剑
- 弱模型:每一步都在产生小错误(跑题、虚构、中英混杂),交接链是误差放大器;
- 中档模型:够格执行每个专精步骤,但单次没到顶——分工带来真实的"先研究、再评审、后成稿"增益;
- 强模型:一次产出已接近上限,组队是给博尔特配四个队友跑接力。
还有一条任务差异:创作、观点、技术写作这类"需要先研究/先设计再产出"的任务,组队增益最明显;偏"汇总打分"的评审类任务,单次往往就够。
一张你该带走的判断表
| 你的情况 | 建议 |
|---|---|
| 用 DeepSeek 这类"够格不到顶"的模型 | ✅ 组队,这是甜区(也是 AO 默认的原因) |
| 手上是 Claude/GPT 顶配 | 简单任务单次就好;组队价值在流程可复现,不在分数 |
| 只有本地小模型(8B 级) | ⚠️ 别组队,会更差;要么升模型,要么单次 |
| 任务是"多步骤、要先研究再产出" | 组队增益最大 |
| 任务是"一句话能说清的小事" | 别组队,杀鸡用牛刀(还慢) |
🔧 动手做:拿你的三件事过一遍判断表(5 分钟)
- 写下你最近想让 AI 干的 3 件事(比如:写一篇深度文章 / 改个错别字 / 做一份竞品分析)。
- 逐件过上面的表:任务够"多步骤"吗?你打算用哪档模型?
- 给每件事标上:「组队」「单兵」或「先别用 AI」。
你会看到:三件事里大概率只有一两件真值得组队——而这正是清醒用户和跟风用户的区别。
为什么:工具的价值不在"用上了",在"用对了地方"。这张表就是这门课送你的第一件防身武器:该组队时组队,不该组队时,一句 prompt 更快更好。
现在你有了照妖镜:凡是宣传多智能体"必然更强"、却不告诉你用什么档位模型、什么类型任务、和什么基线比的,都在讲故事不讲证据。同样,AO 的卖点也要说完整:"便宜但不弱的模型 + 多智能体 = 更好产出"——这句有数据支持;去掉前半句,就不诚实了。
我想让 AI 帮我做:【描述任务】,我用的模型是【DeepSeek/Claude/本地小模型】。请按「任务是否多步骤、模型处于哪个档位、和单次 prompt 相比预期增益」三个维度,帮我判断:这件事该组多智能体团队,还是单次 prompt 更划算?说明理由。
这盆冷水的三句话:弱模型组队更差,中档模型组队真香,强模型组队白搭;创作研究型任务增益最大;AO 默认 DeepSeek 恰好落在甜区——这是设计,不是巧合。
带着这份清醒,下一节把工作台装起来——下载、双击、开工,和装普通软件一样简单。
🔎 来源与核验· 2 条,点开核对
