结论先行:LLM 是一个在给定 Context 下逐 token 生成内容的模型,不是会自动核验真假的数据库。它擅长压缩、转换、归纳和生成候选答案;当任务涉及最新事实、精确数字、来源归属或外部动作时,必须增加证据、工具和验收规则。
机制图:从输入到回答
输入先被切成 token。Transformer 根据当前 Context 中的指令、示例、材料、对话历史和工具结果计算下一 token 的分布,再重复这个过程直到停止。流畅来自模式学习,事实可靠性则取决于材料是否充分、来源是否可信、检索是否命中和结果是否被校验。
研究中常见的四种失败要分开记录:模型内部知识过时;Context 没有给关键材料;检索返回了错误片段;模型拿到证据后仍然错误解释。四者的修复方法完全不同。
金融案例:同一个收入数字
问题是“公司最近一季收入是多少”。没有附文件时,模型可能使用旧知识、搜索结果摘要或相似数字拼出回答。可靠任务应先定义截至日期,再要求只使用公司公告或监管文件,输出数值、币种、会计期间、来源 URL 和支持该数字的原文。
即使答案数字正确,如果期间写错或来源不能支持结论,仍然算失败。研究系统验收的是“claim + evidence”,不是孤立答案。
Lab:两模型边界对照
- 选一份最新财报,准备三个问题:原文可直接回答、需要计算、材料中不存在
- 把同一份材料和同一问题交给两个模型
- 禁止联网,要求每个答案附原文证据;记录两者是否会在缺证据时明确说不知道
- 再开放搜索或文件工具,观察失败来自模型、Context 还是工具
- 把结论写入边界卡:可以直接做、需要工具、必须人工核验
常见失败与排查
- 把“模型更强”当成“不需要来源”:能力提升会降低错误率,但不会把生成变成数据库查询
- 把“上下文很长”当成“模型都看见了”:材料进入窗口不代表关键片段获得足够注意力
- 把“不知道”视为坏体验:研究系统中,可解释的缺失优于自信补全
- 只测一次:生成具有随机性,重要任务需要多次 trial 才能估计稳定性
本课成果物
保存一张三栏边界卡:模型可直接完成的转换任务;必须调用检索、计算或代码工具的任务;无论模型如何回答都必须人工核验的高风险任务。下一课先把这些边界写进可验收任务书,再据此选择模型。
资料来源
本课实践工作台
用 ResearchCo 的同一组问题区分转换任务、工具任务和必须人工核验的研究任务。
ResearchCo v1 案例包与三个研究问题
模型能力边界卡
自动保存到当前浏览器;建议在完成后导出到自己的研究目录。
草稿仅保存在当前浏览器,不会上传。
查看合格示例
合格示例:收入同比必须先从两期证据取数,再用计算器计算;期间、单位和原文由人工抽查。
查看失败示例
失败示例:把‘更强模型’写成所有任务的统一解决方案,没有说明来源、工具和人工核验边界。
实践通过条件:验收清单全部完成,并且本课小测最好成绩达到 4/5。当前最好成绩 尚未作答。
本课检查点
允许重试并保存最好成绩。达到 4/5 且 Lab 自查完成后,实践状态才会通过;它不会替你自动完成阅读。