结论先行:模型选择是一道约束优化题。最强模型不一定是最适合的模型;研究系统应让高价值推理使用高能力模型,让规则化抽取和格式转换走稳定、便宜的模型,并为超时、限额和质量失败设计回退。
六个选型维度
- 质量:你的黄金样本上,事实、引用、结构和反例得分如何
- 速度:首 token 延迟和任务总时长是否满足使用场景
- Context:输入材料、工具结果与历史是否能在预算内组织
- 工具:是否可靠支持 structured output、function calling、文件或浏览器工具
- 隐私:数据是否保留、用于训练、跨区传输,以及谁能访问
- 价格:输入、输出、缓存、工具和重试合计后的单任务成本
模型的公开价格和能力会频繁变化。课程不写死一张很快过期的榜单,而要求你在路由表里保留“核验日期、官方价格页、模型版本、评估集版本”。
金融案例:一份财报的四种任务
同一份财报可以拆成四个模型任务。事实抽取重 Schema 稳定和单位准确;同比计算应交给计算器或代码;核心判断重推理与反例;最终写作重结构和语言。把四者全部交给最贵模型,成本高且计算仍可能出错;全部交给小模型,关键判断又可能不够稳。
合理路由是:低成本模型先做结构化抽取;工具完成计算;高能力模型读取证据表做判断;另一个模型或规则做引用核验。任何一步低于验收线才升级,而不是默认升级。
Lab:建立你的模型路由表
- 选 20 个真实任务,分成抽取、摘要、研究判断和写作四组
- 为每组定义三项可测成功标准和最大可接受时延
- 用候选模型各跑至少三次,记录通过率、总 token、时延和失败类型
- 计算“每个合格结果的成本”,不要只看单 token 价格
- 写出升级、回退和停止规则,并标注隐私准入条件
常见失败与排查
- 用一次漂亮回答做选型:单次成功不能代表稳定通过率
- 只比较输入价格:长输出、工具调用、重试和缓存都会改变总成本
- 没有固定模型版本:供应商更新默认模型后,回归结果失去可比性
- 失败就换最强模型:先判断是 Context、工具、Schema 还是模型能力问题
本课成果物
保存一张模型路由表,至少包含任务、主模型、低成本模型、fallback、质量阈值、最大时延、单任务成本、隐私要求、官方页面和核验日期。下一模块会把任务结果变成可以被 Schema、Context 与证据链校验的接口。
资料来源
本课实践工作台
按任务规格为抽取、计算、判断和写作选择能力档位,并定义升级、回退和停止条件。
ResearchCo 研究任务书 v1
模型路由与回退表
自动保存到当前浏览器;建议在完成后导出到自己的研究目录。
草稿仅保存在当前浏览器,不会上传。
查看合格示例
合格示例:事实抽取先走低成本结构化模型,Schema 或证据覆盖不达标才升级;计算始终交给确定性工具。
查看失败示例
失败示例:所有步骤默认使用最贵模型,没有 eval、成本上限和失败停止条件。
实践通过条件:验收清单全部完成,并且本课小测最好成绩达到 4/5。当前最好成绩 尚未作答。
本课检查点
允许重试并保存最好成绩。达到 4/5 且 Lab 自查完成后,实践状态才会通过;它不会替你自动完成阅读。