结论先行:先问任务路径是否可以提前写清,再问需不需要 Agent。Workflow 由代码预定义步骤,适合稳定、可枚举的任务;Agent 由模型根据中间结果动态决定过程,适合开放、步骤不可预知的任务。自治会用延迟、成本和可预测性换取灵活性。
复杂度升级梯
- Single call:一个明确输入和输出
- Chaining:前一步结果进入下一步
- Routing:按任务类型选择不同模型或流程
- Parallel:互不依赖的任务并行执行
- Evaluator-optimizer:生成与评估循环,改进可以测量
- Agent:模型动态规划、调用工具、观察和修正
只有当前一层在真实 eval 上达不到要求,且更高一层的收益超过新增成本时,才升级。
金融案例:每周公司跟踪
下载公司公告、过滤日期、抽取经营指标、计算同比、生成固定摘要和核验引用,这些步骤都可以预定义,适合 workflow。若发现公告披露一个此前未知的重大收购,需要自行决定查哪些监管文件、对手方资料和历史交易,步骤会随中间发现变化,这一支才可能交给 Agent。
把整条流程都做成 Agent 会让稳定步骤也变得随机。更可靠的架构常是“确定性主干 + 小范围自治分支”。
Lab:画出升级决策树
- 写下每周公司跟踪的输入、固定输出和成功标准
- 将每一步标成可预定义、条件分支或开放探索
- 可预定义步骤用代码路径,条件分支用 routing
- 只为开放探索定义 Agent 的工具、预算、停止和人工确认
- 用同一评估集比较纯 workflow 与混合架构的质量、成本和时延
常见失败与排查
- 为了名字先进直接上 Agent:先证明固定流程哪里不够
- 把多次 LLM 调用都叫 Agent:多步骤不等于模型控制路径
- 没有 ground truth:路径越动态,越需要明确结果和过程 grader
- 只比较最终文案:还要比较工具错误、重试、成本与 trace
本课成果物
保存一张复杂度升级决策树和每周公司跟踪流程图。图中必须明确哪一步由代码控制、哪一步由模型选择、哪里调用工具、哪里停止、哪里需要人确认。
资料来源
本课实践工作台
把每周 ResearchCo 跟踪拆成确定性主干、条件分支和开放探索,只为无法预定义的步骤启用 Agent。
任务书、证据管线与失败分类
复杂度升级决策树
自动保存到当前浏览器;建议在完成后导出到自己的研究目录。
草稿仅保存在当前浏览器,不会上传。
查看合格示例
合格示例:下载、抽取、计算和引用核验使用 workflow;发现未知收购后查找相关文件才进入受限 Agent 分支。
查看失败示例
失败示例:因为任务有多次模型调用就称为 Agent,没有说明谁控制下一步。
实践通过条件:验收清单全部完成,并且本课小测最好成绩达到 4/5。当前最好成绩 尚未作答。
本课检查点
允许重试并保存最好成绩。达到 4/5 且 Lab 自查完成后,实践状态才会通过;它不会替你自动完成阅读。