结论先行:Multi-Agent 不是 Agent 的自然升级版。它适合可以真正分工、并行或交接的任务,但会增加 token、延迟、协调损失和错误传播。首发架构应先做单 Agent,再用同一 eval 证明多 Agent 的净增益。
三种协作模式
- Parallel specialists:多个角色独立检查事实、反例或不同数据源,再统一汇总
- Orchestrator-workers:协调者根据任务动态拆分子任务,workers 完成后回传
- Handoff:一个 Agent 在明确条件下把控制权和状态交给另一个专业 Agent
“给同一段材料设三个不同人设”不一定形成独立验证。如果三者共享同一错误来源,最后的多数意见只会放大错误确信。
金融案例:事实、反方、核验三角色
事实角色只从一手资料构建事实表;反方角色只寻找与核心结论冲突的证据;核验角色逐条检查 claim 与 citation。协调者只能从三份结构化结果写 memo,不能新增未经证据表支持的数字。
对照组使用一个 Agent 按相同步骤串行完成。两组获得相同工具和总成本上限,再比较事实准确、反例覆盖、引用通过率、时延和成本。若多 Agent 只改善文风,不改善关键指标,就不应上线。
Lab:做一次公平对照
- 准备十个公司研究任务和统一评分表
- 单 Agent 组与三角色组使用相同资料、工具和模型能力等级
- 每题运行多次 trial,记录总 token、时延、工具错误和合并错误
- 比较事实、来源、反例、完整性和成本五项
- 写出多 Agent 的使用条件与回退到单 Agent 的条件
常见失败与排查
- 角色只是换名称:分工必须改变输入、工具、成功标准或权限
- 协调者重新编造:汇总层只能引用 worker 的结构化输出
- 共享同一 Context 污染独立性:反方检查应有独立查询空间
- 不控制总预算:更多调用天然可能更好,但不一定更有效率
本课成果物
保存对照实验报告,至少包含十题、多次 trial、五项得分、总成本与时延。只有多 Agent 在关键指标上稳定提升且预算可接受时,才进入毕业项目。
资料来源
本课实践工作台
在相同资料、工具、模型能力和总预算下比较单 Agent 与事实、反方、核验三角色系统。
通过校准的 eval set 与单 Agent 基线
单 Agent 与多 Agent 对照报告
自动保存到当前浏览器;建议在完成后导出到自己的研究目录。
草稿仅保存在当前浏览器,不会上传。
查看合格示例
合格示例:多 Agent 只有在事实、引用或反例指标稳定改善且合格结果成本可接受时启用。
查看失败示例
失败示例:多 Agent 获得更多 token 和工具,却只比较一次最佳文案并宣布胜出。
实践通过条件:验收清单全部完成,并且本课小测最好成绩达到 4/5。当前最好成绩 尚未作答。
本课检查点
允许重试并保存最好成绩。达到 4/5 且 Lab 自查完成后,实践状态才会通过;它不会替你自动完成阅读。