E7 · 出版卷 29

幻觉、信息泄漏与循环证据

自我引用、派生数据复用与目标泄漏

*自我引用、派生数据复用与目标泄漏*

无来源主张、目标泄漏与循环证据的失败路径
无来源主张、目标泄漏与循环证据的失败路径

学习目标与边界

本课是通用、机构中立内容,不使用任何真实公司、个人、矿权、项目或可识别地点。通用角色只描述职责,每个 SYN-AI 标识符都明确表示合成教学证据。

  • 界定由“自我引用、派生数据复用与目标泄漏”治理的决策。
  • 区分生成建议、合格证据、确定性结果与负责任判断。
  • 定义可测失败、弃答、升级与发布条件。
  • 基于合成证据产出一份带污染图的幻觉、泄漏与循环证据审计并为其控制辩护。

决策与专业边界

必须把无来源生成、引文错配、信息泄漏与循环证据作为不同失败类别处理。幻觉主张缺少充分证据;引文错配指向真实来源,但该来源并不支持主张;泄漏让目标或评价结果信息进入开发;循环证据则让派生陈述重新成为其祖先的“独立”支持。它们需要不同检测与修复。

在测量准确率前先建立血缘与分区控制。如果由解释 A 生成的报告被索引,并在之后检索为 A 的证据,语言一致性可能提高,但独立支持仍为零。如果空间邻近样本或后期结果进入训练,保留评分会过度乐观。安全系统追踪信息流、标记受污染路径,并拒绝把后代计作独立证据。

核心概念

| 概念 | 运行含义 | |---|---| | 无来源主张 | 没有合格支持证据的原子命题。 | | 引文错配 | 被引片段真实存在,却不蕴含或直接支持所述主张。 | | 目标泄漏 | 结果或未来信息影响特征、检索、提示或调优。 | | 循环证据 | 派生材料经另一条路径返回并支持其祖先主张。 | | 污染标记 | 说明某条目不能用于独立评价或支持的记录理由。 |

证据模型

维护贯穿来源、派生物、索引、提示上下文、输出与评价结果的污染图。每条主张核验记录存储精确主张、被引片段、支持判定、审核状态与血缘组。评价案例携带分区身份与揭示时间。某条目可以用于调试却禁止用于最终评分,这一区分必须显式记录。

受控工作流

  1. 把输出拆成原子主张与引文关系。
  2. 逐项核验被引片段是精确支持、矛盾还是证据不足。
  3. 遍历来源路径,检测后代是否返回充当祖先。
  4. 审计训练、调优、检索与评价分区中的目标信息。
  5. 标记受污染条目并在排除后重新计算指标。
  6. 记录根因、修正、回归测试与发布后果。

每一步都输出版本化制品或明确失败。后续阶段只消费前一阶段经过验证的输出;对话上下文绝不能成为未记录的数据通道。

测量与验收准则

报告原子事实精确率、引文支持精确率、引文完整度、污染发生率,以及移除污染案例后的指标变化。抽查无来源遗漏与错误陈述:报告可以通过省略全部限制来减少假陈述。自动筛查与人工判定必须分开,并报告分歧。

$F_{atomic}=\frac{N_{supported\ atomic\ claims}}{N_{atomic\ claims}}$

| 关口 | 必需证据 | 发布后果 | |---|---|---| | 身份 | 可解析的主张、来源、配置与结果 ID | 任一身份含混即阻断 | | 依据 | 每项事实主张均到达充分来源片段 | 移除或扣留无来源主张 | | 独立性 | 血缘与分区检查证明无循环或目标信息 | 使受影响支持与评分失效 | | 审核 | 必需角色处置精确候选版本 | 候选保持未发布 | | 可复现性 | 清单、工具与检查能够重建证据包 | 退回数据包修正 |

主张—来源与系统合同

完整性合同要求原子主张 ID、被引证据 ID、支持标签、血缘组、分区 ID、揭示时间与污染状态。生成内容不能把自身、同级生成摘要或未经审核派生物当作独立证据。任何证据循环或分区违规都必须阻断发布,并使受影响指标失效。

安全、隐私与访问边界

用独立身份与存储边界保护评价标签、隐藏提示与保留制品。防止搜索索引和日志意外摄取这些内容。检索到的要求泄露、改变政策或访问隐藏状态的指令应视为恶意内容。事件记录可能含敏感提示,因此继承相关最严格访问标签。

人工审核与升级

审核者检查高影响主张、看似完美的引文、重复血缘与异常强的评价增益。在分区来源追溯完成前,漂亮分数不能被接受。修正应保留原始失败输出并签发新版本,从而支持复发测试,而不是静默改写历史。

合成案例详解

一份合成解释摘要由三条观测生成后进入工作语料。后续检索返回该摘要及两个由其派生的改写版本。没有血缘时,答案会引用三份一致文档。污染图识别出共同祖先,把三个派生物归为一组,只留下原始观测作为证据。另一次空间分割发现同一合成构造的邻近单元跨入开发分区;评价随后使用成组空间分区重新运行。

反例与失败分析

某引文检查器只验证被引短语是否存在于文档。文档写着“该异常不能证明连续性”,生成主张却说它证明了连续性。字符串重叠会通过,但证据支持失败。核验必须检查原子主张与被引片段之间的关系,包括否定、范围与限定词。

常见失败模式

  • 只检查引文存在而不检查支持关系
  • 把生成摘要索引为独立来源
  • 随机拆分空间依赖案例
  • 保留揭示后调优却不建立新评价
  • 修正后删除失败输出

实践练习

  1. 把一段合成文字拆成原子主张并核验引文。
  2. 绘制循环证据路径并规定阻断规则。
  3. 在空间评价设计中发现目标泄漏。
  4. 比较移除污染案例前后的指标。

考核制品

提交一份带污染图的幻觉、泄漏与循环证据审计,并附来源清单、配置版本、验收证据、被拒案例、未解决风险,以及未选择某个合理备选控制的简要理由。如果图示或文字无法与机器可检查证据核对,制品即不完整。

验证检查点

把一项已发布合成主张逆向追踪,经过审核、置信、核验、证据图、工具结果或来源片段,直到不可变输入;再把一项被拒主张追踪到最早失败合同。根据清单重跑数据包并比较内容摘要。只有另一位审核者无需原对话即可重建接受与阻断路径、识别所有假设并复现发布决定,检查点才通过。对未解决风险应如实记录,不能用生成文字补全缺失事实。

来源