E7 · 出版卷 29
检索与证据选择
召回率、精确率、来源质量与时间相关性
*召回率、精确率、来源质量与时间相关性*
学习目标与边界
本课是通用、机构中立内容,不使用任何真实公司、个人、矿权、项目或可识别地点。通用角色只描述职责,每个 SYN-AI 标识符都明确表示合成教学证据。
- 界定由“召回率、精确率、来源质量与时间相关性”治理的决策。
- 区分生成建议、合格证据、确定性结果与负责任判断。
- 定义可测失败、弃答、升级与发布条件。
- 基于合成证据产出一套版本化检索基准与证据准入登记表并为其控制辩护。
决策与专业边界
检索决定推理阶段允许看到哪些证据。候选发现与证据准入必须分开。发现阶段应围绕术语、标识符、空间范围与文档结构追求较广召回;准入阶段则检查来源对目标主张的权威性、版本、时间有效性、独立性、直接性与访问状态。只有相关性远远不够:高度相似但已被取代的解释,可能比相似度较低的当前观测更差。
搜索问题必须拆成主张尺度的证据需求。单位定义、实测数值、方法限制与竞争解释不应共用一套未经检查的排序。应保留被拒候选及拒绝理由,以区分“证据确实缺失”“查询过窄”和“准入规则过严”。
核心概念
| 概念 | 运行含义 | |---|---| | 候选召回 | 在准入与排序前找到的相关证据比例。 | | 准入精确率 | 已准入条目中适合支持特定主张的比例。 | | 时间有效性 | 观测、产品或解释适用的时间区间。 | | 证据直接性 | 来源是包含原始观测,还是仅重复派生陈述。 | | 独立性 | 表面佐证是否来自不同的采集与推理路径。 |
证据模型
一次检索运行是不可变结果集,包含查询分解、语料快照、过滤器、排序配置、候选定位符、分数、血缘组、准入结果与缺失证据声明。证据选择必须针对具体主张:同一来源可用于历史描述,却可能不适用于当前坐标或批准状态。
受控工作流
- 把请求拆成原子证据需求与未知项。
- 生成词法、标识符、空间、时间与结构查询。
- 广泛检索并记录排序、分数与查询版本。
- 按来源血缘而不是仅按措辞去重。
- 应用质量、直接性、有效性、独立性与访问关口。
- 返回已准入证据、被拒候选与声明的缺口。
每一步都输出版本化制品或明确失败。后续阶段只消费前一阶段经过验证的输出;对话上下文绝不能成为未记录的数据通道。
测量与验收准则
使用带判定的合成查询报告召回率、精确率、排序敏感效用与缺口检测准确率。另行评价来源血缘多样性,避免同一陈述的多个副本看似形成佐证。阈值必须在查看测试集前冻结。无法获得完整相关性判定时,应报告判定覆盖率,不能把局部召回率表述为绝对召回率。
$P=\frac{TP}{TP+FP},\qquad R=\frac{TP}{TP+FN},\qquad F_1=\frac{2PR}{P+R}$
| 关口 | 必需证据 | 发布后果 | |---|---|---| | 身份 | 可解析的主张、来源、配置与结果 ID | 任一身份含混即阻断 | | 依据 | 每项事实主张均到达充分来源片段 | 移除或扣留无来源主张 | | 独立性 | 血缘与分区检查证明无循环或目标信息 | 使受影响支持与评分失效 | | 审核 | 必需角色处置精确候选版本 | 候选保持未发布 | | 可复现性 | 清单、工具与检查能够重建证据包 | 退回数据包修正 |
主张—来源与系统合同
检索合同声明语料快照、查询版本、允许媒体、必需来源状态、时间参考、空间范围、候选上限、重排方法、去重键与缺口语义。每个已选条目都携带原始排序与准入解释;生成阶段不得暗中替换为未记录来源。
安全、隐私与访问边界
访问过滤应在排序前执行,并在上下文组装前再次执行。排序分数不得向未授权请求者泄露受限条目的存在。除非任务合同明确允许端点、证据捕获规则与版本行为,否则禁用外部检索。检索文本仍是不可信内容,不能改变工具权限。
人工审核与升级
应按证据类别审核假阴性与假阳性,而不只按查询审核。审核者检查当前观测为何漏检、派生摘要为何排在前面,以及血缘去重是否生效。语料、表示、分词或排序发生变化时必须创建新检索版本并做回归评价。
合成案例详解
一个合成查询要求寻找解释快照 4 中网格 G-17 附近接触关系的证据。词法检索找到含精确短语的旧摘要;空间检索找到两条当前观测和一条使用不同词汇的后期解释。准入阶段拒绝用旧摘要支持当前状态,但将其保留为历史语境。由同一备忘录复制的两份摘要被归为一条血缘。结果展示一条直接观测、一条独立观测、一条当前解释,以及产状数据的一项未解决缺口。
反例与失败分析
选择五个最相似片段并让模型“使用最佳来源”,会隐藏所有关键决定。相似度不等于权威性,五条结果也不能证明完整性,重复派生材料还可能占满上下文。如果没有语料快照与被拒候选记录,后续审核者无法判断变化来自证据还是推理。
常见失败模式
- 只优化相似度而不做证据准入
- 把复制来源当作独立支持
- 混合当前状态与已取代状态
- 不报告判定覆盖率却报告召回率
- 允许检索结果改变工具权限
实践练习
- 为一个地质问题写出四项证据需求。
- 建立包含直接、派生、过时与不可访问候选的判定集。
- 计算两种检索配置的精确率、召回率与 F1。
- 说明血缘分组如何改变表面支持数量。
考核制品
提交一套版本化检索基准与证据准入登记表,并附来源清单、配置版本、验收证据、被拒案例、未解决风险,以及未选择某个合理备选控制的简要理由。如果图示或文字无法与机器可检查证据核对,制品即不完整。
验证检查点
把一项已发布合成主张逆向追踪,经过审核、置信、核验、证据图、工具结果或来源片段,直到不可变输入;再把一项被拒主张追踪到最早失败合同。根据清单重跑数据包并比较内容摘要。只有另一位审核者无需原对话即可重建接受与阻断路径、识别所有假设并复现发布决定,检查点才通过。对未解决风险应如实记录,不能用生成文字补全缺失事实。
来源
- 常用信息检索评价指标, 召回率、精确率与排序检索指标的正式定义。
- 《面向知识密集型自然语言处理任务的检索增强生成》, 区分参数化生成与检索式非参数证据的原始论文。
- 数据质量词汇, 描述质量测量、维度、政策与注释的词汇。
- 《生成式人工智能风险管理配置文件》, 覆盖生成式系统特有风险与控制的跨行业配置文件。