E7 · 出版卷 29
置信度与校准
主张级置信度、来源置信度与不确定性语言
*主张级置信度、来源置信度与不确定性语言*
学习目标与边界
本课是通用、机构中立内容,不使用任何真实公司、个人、矿权、项目或可识别地点。通用角色只描述职责,每个 SYN-AI 标识符都明确表示合成教学证据。
- 界定由“主张级置信度、来源置信度与不确定性语言”治理的决策。
- 区分生成建议、合格证据、确定性结果与负责任判断。
- 定义可测失败、弃答、升级与发布条件。
- 基于合成证据产出一份含覆盖率、弃答与语言政策的主张级校准报告并为其控制辩护。
决策与专业边界
置信度必须附着于定义明确的主张与评价总体,不能附着于整段文字或模型人格。应区分来源质量、提取可靠性、检索完整度、支持强度、模型分数与最终主张置信度;这些量回答不同问题,除非声明组合模型,否则不能随意平均。自然语言确定性必须映射到经过测试的概率区间或类别准则,单靠形容词不构成校准。
校准是在独立、有代表性的案例上比较所报置信与实际正确率。总体正确率为 80% 的系统,仍可能在稀有构造或低质量扫描件上严重过度自信。应按任务、证据状态与后果等级报告可靠性,并同时报告覆盖率与弃答。
核心概念
| 概念 | 运行含义 | |---|---| | 主张置信度 | 在声明证据与任务条件下,对一项命题的经过测试的估计。 | | 来源置信度 | 对来源身份、方法、质量、时效与直接性的评价。 | | 校准 | 预测置信区间与实际结果频率之间的一致程度。 | | 锐度 | 在校准之后考察预测是否远离无信息的中间区间。 | | 覆盖率 | 符合条件案例中系统形成主张而不是弃答的比例。 |
证据模型
置信记录存储主张 ID、证据快照、原始分数、校准映射版本、校准值或类别、评价总体、阈值、弃答状态与最终结果。来源评价保持为独立关联节点。真实结果尚未知时,记录保持未解决,不能因为另一生成答案同意就标为正确。
受控工作流
- 定义原子主张、结果标签与评价总体。
- 把证据质量特征与模型输出分数分开。
- 保留独立校准分区与评价分区。
- 在不查看最终评价结果的情况下拟合或映射置信度。
- 按任务、子组与证据状态绘制可靠性并评分。
- 依据后果相关准则设置弃答与语言区间。
每一步都输出版本化制品或明确失败。后续阶段只消费前一阶段经过验证的输出;对话上下文绝不能成为未记录的数据通道。
测量与验收准则
使用可靠性图、概率均方评分、校准误差、覆盖率与给定覆盖下的风险。报告分箱样本数与不确定性,因为小样本箱可能显得虚假可靠。置信系统只在声明总体内有效;迁移到另一矿种、语言、文档类型或证据条件时必须重新评价。
$BS=\frac{1}{N}\sum_{i=1}^{N}(p_i-y_i)^2$
| 关口 | 必需证据 | 发布后果 | |---|---|---| | 身份 | 可解析的主张、来源、配置与结果 ID | 任一身份含混即阻断 | | 依据 | 每项事实主张均到达充分来源片段 | 移除或扣留无来源主张 | | 独立性 | 血缘与分区检查证明无循环或目标信息 | 使受影响支持与评分失效 | | 审核 | 必需角色处置精确候选版本 | 候选保持未发布 | | 可复现性 | 清单、工具与检查能够重建证据包 | 退回数据包修正 |
主张—来源与系统合同
置信合同定义主张粒度、结果标签、参考总体、分数来源、校准数据集、映射版本、语言区间、弃答阈值与失效触发条件。禁止把词元概率或语言强调直接转换为地质置信度。每个展示置信值都必须连接到其校准证据。
安全、隐私与访问边界
校准分区与结果标签必须对开发工作流隔离。子组报告应避免暴露受限属性或极小群体。置信展示不得泄露隐藏证据的存在;访问过滤改变证据集时,系统应重新计算或扣留置信值,不能复用特权分数。
人工审核与升级
审核者检查校准最差的分箱、高置信错误、子组覆盖与每个语言映射。批准对象是参考总体与发布阈值,而不是通用置信尺度。观察评价结果后发生的阈值变化必须版本化为新政策,并在新证据上测试。
合成案例详解
一个合成分类器为描述是否支持“连续蚀变”赋置信度。在区间完整的校准案例中,0.8–0.9 分箱的实际正确率约为 0.84;在截断区间中只有约 0.52。因此统一标为“高置信”并不安全。修订合同要么只对经验证完整区间使用单独映射,要么在连续性证据被截断时弃答。
反例与失败分析
模型因为答案流畅且多个检索片段一致,就说“我有 95% 把握”,但没有结果定义、校准总体或独立性检查。这个数字只是表达,不是测量。重复派生材料甚至会在没有增加新证据时提高表面置信。
常见失败模式
- 把语言模型分数当作地质置信度
- 在同一批案例上校准与评价
- 用正确率掩盖覆盖率
- 合并不相容任务总体
- 证据访问变化后复用置信度
实践练习
- 为一种主张定义结果标签。
- 计算一组合成案例的概率均方评分。
- 绘制可靠性表并识别过度自信。
- 编写同时包含证据与总体条件的置信语言区间。
考核制品
提交一份含覆盖率、弃答与语言政策的主张级校准报告,并附来源清单、配置版本、验收证据、被拒案例、未解决风险,以及未选择某个合理备选控制的简要理由。如果图示或文字无法与机器可检查证据核对,制品即不完整。
验证检查点
把一项已发布合成主张逆向追踪,经过审核、置信、核验、证据图、工具结果或来源片段,直到不可变输入;再把一项被拒主张追踪到最早失败合同。根据清单重跑数据包并比较内容摘要。只有另一位审核者无需原对话即可重建接受与阻断路径、识别所有假设并复现发布决定,检查点才通过。对未解决风险应如实记录,不能用生成文字补全缺失事实。
来源
- 《现代神经网络的校准》, 置信校准与可靠性图的原始实证研究。
- 《严格适当评分规则、预测与估计》, 评价概率陈述且不奖励策略性置信表达的形式基础。
- ISO/IEC 25059:2023 人工智能系统质量模型, 用于规定和评价人工智能系统质量特征的词汇体系。
- 《人工智能风险管理框架 1.0》, 用于在全生命周期治理、映射、测量与管理情境相关 AI 风险的框架。