Felix Wanyan评论了这条帖子
一篇最新的论文通过大量实验来验证什么时候多智能体系统(MAS)比单智能体(SAS)更好。
文章对比了 SAS 基线以及四种 MAS 架构:
- 中心式:由一个中心 agent 进行任务协调;
- 去中心式:agent 之间直接通信;
- 独立式:多个 agent 独立解决任务,最后统一结果;
- 混合式:同时有中心 agent 和 p2p 通信。
并在 6 个 benchmark 上进行实验:
- Finance Agent:金融分析;
- BrowseComp-Plus:网页搜索;
- WorkBench:现实工作场景任务;
- SWE-bench Verified:软件工程任务;
- Terminal-Bench:终端任务;
- PlanCraft:游戏规划。
主要结论如下:
1. MAS 没有普遍优势,在不同 benchmark 上的结果极其分化,在 Finance Agent 上可以达到 80.8% 的提升,而 PlanCraft 上会导致 -70%~-39% 的负收益。
2. SAS 基线的表现是判断是否应该使用 MAS 的最有用的标准,当 SAS 已经足够强时,继续加入 agent 很可能带来零收益甚至负收益,而实验得出的成功率阈值是 45%。
3. 任务的可拆解性和复杂性共同影响 MAS 效率。MAS 在可拆解的任务中可以获得很大收益,但在高复杂度的线性任务中往往会导致退化。
4. MAS 会导致错误信息的传播进而影响表现,不同 MAS 架构对于错误传播的阻断效果不同,中心式架构最能阻断错误传播,而独立式架构最难阻断错误传播。
这篇论文还有很多有意思的结论,我就不一一列举了,感兴趣的小伙伴可以去看原文,原文做了大量的实验和严谨的检验。
原文链接:https://www.nature.com/articles/s42256-026-01268-y
第一次做这种内容感觉很粗糙,后续我会再发布一些多智能体系统以及智能体自进化相关的内容。