结论先行:可靠 Agent 不是“能自己做很多事”,而是每次行动都受状态、权限、预算、ground truth 和停止条件约束。先把单 Agent 做到可追踪、可暂停、可恢复,再考虑增加角色。
Loop 与状态
Agent 接收目标和当前状态,先选择下一步计划,再调用工具执行,读取结果后更新事实、冲突、待办和预算。如果达到成功条件就结束;如果证据不足但仍有可行动路径则继续;如果权限不足、来源冲突或需要写入则暂停请求人工;如果次数、token、成本或时间耗尽则失败退出。
状态不应只存在对话历史中。把已核验事实、来源、未解决问题、工具错误和剩余预算写入结构化状态,失败后才能从已知位置恢复。
金融案例:公司研究 Agent
输入公司、研究问题和截至日期。Agent 先规划官方来源,检索文件,抽取事实,调用工具计算,再生成结论与最强反例。每个重要 claim 进入证据账本;如果引用不能支持 claim,就回到检索,而不是润色答案。
遇到财报与电话会口径冲突,Agent 暂停并展示两段原文。遇到发布文章、发送邮件或交易动作,必须在执行前请求人确认。研究可以自治,外部影响不能默认自治。
Lab:写一份 Agent spec
- 定义输入、允许来源、输出 Schema 与成功条件
- 列出可用工具、每个工具的只读或写入权限
- 画出 plan、act、observe、revise 和四类停止状态
- 设置最大步骤、token、时间、成本和重试次数
- 用证据缺失、来源冲突、工具超时和写入请求测试暂停与恢复
常见失败与排查
- 只限制最大步骤:还要限制总成本、时间和重复动作
- 状态全在历史里:长任务应把关键状态持久化和压缩
- 工具错误被当成空结果:错误类型必须进入状态并影响下一步
- Agent 自己决定是否合格:关键成功条件应由外部 grader 检查
本课成果物
保存公司研究 Agent 的状态图和 spec,包含目标、状态 Schema、工具权限、成功条件、暂停条件、失败条件、四类预算与恢复策略。用至少四个异常案例验证 Agent 会停下来。
资料来源
本课实践工作台
设计 ResearchCo 研究 Agent 的结构化状态、预算、停止、暂停与恢复规则,并用四类异常验证。
workflow 决策树、工具 Contract 与权限图
单 Agent spec、状态图与异常 trace
自动保存到当前浏览器;建议在完成后导出到自己的研究目录。
草稿仅保存在当前浏览器,不会上传。
查看合格示例
合格示例:发现 OLD-2025Q4 与 REV-2025Q4 冲突后进入 paused_conflict,保留两份证据并请求人工判断。
查看失败示例
失败示例:只设置最大步骤,没有成本、重复动作、来源冲突和外部写入停止条件。
实践通过条件:验收清单全部完成,并且本课小测最好成绩达到 4/5。当前最好成绩 尚未作答。
本课检查点
允许重试并保存最好成绩。达到 4/5 且 Lab 自查完成后,实践状态才会通过;它不会替你自动完成阅读。