E7 · 出版卷 29
竞争假设与结构化推理
预测、支持、矛盾与缺失证据
*预测、支持、矛盾与缺失证据*
学习目标与边界
本课是通用、机构中立内容,不使用任何真实公司、个人、矿权、项目或可识别地点。通用角色只描述职责,每个 SYN-AI 标识符都明确表示合成教学证据。
- 界定由“预测、支持、矛盾与缺失证据”治理的决策。
- 区分生成建议、合格证据、确定性结果与负责任判断。
- 定义可测失败、弃答、升级与发布条件。
- 基于合成证据产出一份带冻结预测与检验计划的竞争假设审核矩阵并为其控制辩护。
决策与专业边界
推理必须先建立备选假设,再评价证据。至少写出两个合理假设、各自范围及其预测观测;随后针对每项预测,把证据分类为支持、矛盾、无判别力或缺失。不能先让模型编出一个单一地质故事,再去搜索确认细节。
目标不是让所有假设看起来同等可能,而是暴露哪些观测能够判别它们、哪些依赖会削弱证据独立性,以及何种结果会触发修订。生成建议可以帮助列举备选方案,但假设、预测与评分规则必须在决定性证据揭示前完成审核并冻结。
核心概念
| 概念 | 运行含义 | |---|---| | 假设 | 能够产生可测试预测的有界解释命题。 | | 预测 | 带位置、尺度、条件与容差的预期观测。 | | 判别证据 | 不同可能结果能显著区分假设的证据。 | | 矛盾 | 在声明范围内与预测不一致的合格观测。 | | 未知项 | 尚未取得或无法解析的必需检验或观测。 |
证据模型
推理包包含假设版本、预测记录、检验设计、合格证据、依赖组、结果分类与修订历史。支持陈述必须指明预测特征与实际观测特征;矛盾必须指明被超出的容差。缺失证据作为节点保留,并带计划采集、责任角色与状态。
受控工作流
- 定义决策及时空与尺度范围。
- 在不查看保留证据的情况下写出多个合理假设。
- 推导可观测预测与明确否证条件。
- 映射证据血缘并降低依赖性重复的权重。
- 把结果分类为支持、矛盾、无判别力或未知。
- 依据预期判别力与后果选择下一项检验。
每一步都输出版本化制品或明确失败。后续阶段只消费前一阶段经过验证的输出;对话上下文绝不能成为未记录的数据通道。
测量与验收准则
测量预测具体性、检验覆盖、经依赖调整的证据覆盖、矛盾处置与修订响应。可用矩阵必须包含能够使每个假设失败的检验;全是普遍支持陈述的矩阵没有判别力。记录已评价决定性预测的比例,以及控制结论的未解决假设数量。
$D(t)=\sum_{i<j} w_{ij}\,\left|P(o_t\mid H_i)-P(o_t\mid H_j)\right|$
| 关口 | 必需证据 | 发布后果 | |---|---|---| | 身份 | 可解析的主张、来源、配置与结果 ID | 任一身份含混即阻断 | | 依据 | 每项事实主张均到达充分来源片段 | 移除或扣留无来源主张 | | 独立性 | 血缘与分区检查证明无循环或目标信息 | 使受影响支持与评分失效 | | 审核 | 必需角色处置精确候选版本 | 候选保持未发布 | | 可复现性 | 清单、工具与检查能够重建证据包 | 退回数据包修正 |
主张—来源与系统合同
每条假设记录声明范围、假设条件、预测观测、否证条件、依赖、编制状态与审核版本。证据评分使用冻结规则并保留原始分类。系统可以总结矩阵,但不能把未知改成中性支持,也不能在缺少观测模型时把证据缺失变成矛盾。
安全、隐私与访问边界
在编写假设与预测时,保留观测与结果标签必须不可访问,并记录谁可在何时揭示。如果敏感证据必须摘要化,应保留受保护完整记录与可见脱敏状态,不能让隐藏证据暗中改变公开评分。
人工审核与升级
领域审核者检查合理性与预测含义;独立角色检查评分是否在证据揭示前冻结。审核重点包括最强矛盾与后果最大的未知项,而不只看首选假设。揭示后作出的修改属于新假设版本,不能伪装成事先规定后重新评分。
合成案例详解
两个合成假设解释同一导电异常:H1 预测与已填图构造一致的陡倾板状体;H2 预测与地形相关的浅部风化特征。现有导电性对两者都有支持,因此无判别力。一幅合成深度切片支持 H1;地表地球化学模式弱支持 H2,但与异常共用同一网格来源。矩阵降低该依赖证据的作用,并把一项独立深部观测确定为下一项判别检验。
反例与失败分析
一段生成解释列出五项符合 H1 的事实并下结论“高置信”,却没有写 H2、预测失败条件或缺失检验。由于其中四项来自同一处理数据集,这个数量毫无意义。结构化推理会显示一组血缘、一条无判别力观测和若干未知项,而不是五项独立确认。
常见失败模式
- 先生成单一故事再考虑备选
- 看见结果后才写预测
- 把依赖派生证据独立计数
- 把证据缺失当作支持
- 在叙事摘要中隐藏矛盾
实践练习
- 为一个合成异常写出两个假设与三项判别预测。
- 对六项证据分类并说明每条关系。
- 识别共享血缘并修正表面支持数量。
- 综合判别力、成本边界与后果选择下一项检验。
考核制品
提交一份带冻结预测与检验计划的竞争假设审核矩阵,并附来源清单、配置版本、验收证据、被拒案例、未解决风险,以及未选择某个合理备选控制的简要理由。如果图示或文字无法与机器可检查证据核对,制品即不完整。
验证检查点
把一项已发布合成主张逆向追踪,经过审核、置信、核验、证据图、工具结果或来源片段,直到不可变输入;再把一项被拒主张追踪到最早失败合同。根据清单重跑数据包并比较内容摘要。只有另一位审核者无需原对话即可重建接受与阻断路径、识别所有假设并复现发布决定,检查点才通过。对未解决风险应如实记录,不能用生成文字补全缺失事实。
来源
- 《强推断》, 在备选解释之间设计判别性检验的原始论述。
- 《人工智能风险管理框架 1.0》, 用于在全生命周期治理、映射、测量与管理情境相关 AI 风险的框架。
- PROV-O 来源追溯本体, 描述实体、活动、责任角色与派生关系的标准模型。
- 《严格适当评分规则、预测与估计》, 评价概率陈述且不奖励策略性置信表达的形式基础。