结论先行:Agent 是否能上线,不由一次成功 Demo 决定,而由可重复 eval、分层护栏、完整 trace 和可接受成本共同决定。评估既要检查最终 outcome,也要检查过程是否使用正确来源、工具和权限。
Eval 的基本结构
- Task:一个输入、环境和明确成功标准
- Trial:同一 task 的一次运行;随机系统需要多次 trial
- Grader:对事实、结构、来源、行为或成本进行评分的逻辑
- Trace:模型输出、工具调用、错误、状态变化和审批的完整记录
- Outcome:最终交付与环境变化
代码 grader 适合 Schema、数值、字段和允许来源;模型 grader 适合带评分细则的论证与反例;人工 grader 用于校准主观标准和处理高风险边界。三者应组合,不让模型只给自己的答案打分。
金融案例:毕业项目验收
十个黄金样本包含正常财报、缺失数据、口径冲突、过时来源、错误单位、prompt injection、工具超时和写入请求。每题运行多次,分别评分事实、来源、完整性、反例和成本。
Capability eval 测系统能做到什么,regression eval 保证更新模型、Prompt 或工具后没有破坏已有能力。上线后仍要监控真实 trace,因为离线样本无法覆盖全部环境变化。
Guardrails 与 prompt injection
外部文档可能包含“忽略之前指令”之类内容。把检索内容视为不可信数据,不让它升级权限;工具按最小权限开放;输入、工具参数和输出分层检查;发布、发送、交易等动作始终人工确认。Guardrail 是额外检查层,不是免除核心设计责任的万能开关。
Lab:上线前闸门
- 建立十个 task,每个写清输入、成功条件和失败类型
- 为确定性字段写代码 grader,为论证写评分 rubric 并人工校准
- 每题运行多个 trial,区分 capability 与 regression
- 注入恶意文档、错误来源、超时和权限升级请求做红队
- 建立看板:通过率、错误类型、时延、token、单任务成本、工具与审批事件
常见失败与排查
- eval 全是简单正常样本:加入缺失、冲突、攻击与工具故障
- 只评最终文字:trace 能暴露错误来源和危险工具路径
- 模型 grader 没有校准:定期与人工评分比较偏差
- 只看平均成本:同时观察尾部时延、重试和高成本异常任务
本课成果物
提交十例 eval set、grader、trial 结果、失败分类、红队记录和 trace/cost 看板。毕业项目达到:Schema 通过率 100%;重要数字证据覆盖率 100%;计算工具结果一致;冲突显式展示;写入动作全部触发人工确认。
资料来源
本课实践工作台
建立十例黄金样本和分层 grader,覆盖过时来源、错误期间、单位、修订冲突、注入、超时和权限升级。
Agent spec、RAG 评估集与异常 trace
Eval Set、红队记录与成本看板
自动保存到当前浏览器;建议在完成后导出到自己的研究目录。
草稿仅保存在当前浏览器,不会上传。
查看合格示例
合格示例:Schema、公式和来源允许列表由代码 grader 检查;论证与反例使用校准后的 rubric;高风险边界人工复核。
查看失败示例
失败示例:只让模型给自己的最终文案打分,不检查 trace、权限和确定性字段。
实践通过条件:验收清单全部完成,并且本课小测最好成绩达到 4/5。当前最好成绩 尚未作答。
本课检查点
允许重试并保存最好成绩。达到 4/5 且 Lab 自查完成后,实践状态才会通过;它不会替你自动完成阅读。