E7 · 出版卷 29
监测与持续评价
漂移、基准集、失败分类与反馈
*漂移、基准集、失败分类与反馈*
学习目标与边界
本课是通用、机构中立内容,不使用任何真实公司、个人、矿权、项目或可识别地点。通用角色只描述职责,每个 SYN-AI 标识符都明确表示合成教学证据。
- 界定由“漂移、基准集、失败分类与反馈”治理的决策。
- 区分生成建议、合格证据、确定性结果与负责任判断。
- 定义可测失败、弃答、升级与发布条件。
- 基于合成证据产出一套持续评价计划、基准套件与版本化失败登记表并为其控制辩护。
决策与专业边界
生产监测要判断已部署证据工作流是否仍在其评价条件内运行。应跟踪输入来源、文档结构、语言、检索语料、工具行为、模型配置、政策、审核负荷与结果分布的变化。端点稳定不代表语义稳定。监测信号触发调查与受控重评,但不能自动替代根因诊断。
维护分层基准集:固定回归案例、轮换近期案例、对抗案例、稀有高后果案例与前瞻结果。把每次事件和用户修正连接到失败分类与可复现证据包。反馈只有在审核、必要脱敏与分区控制之后,才能成为训练或政策输入。
核心概念
| 概念 | 运行含义 | |---|---| | 输入漂移 | 来源总体、结构、质量、语言或访问状态发生变化。 | | 行为漂移 | 在可比输入下,检索、生成、工具使用、置信或弃答发生变化。 | | 基准层 | 服务于回归、时效、对抗或后果目标的受控案例集。 | | 失败分类 | 连接症状、原因、后果与修复的稳定分类。 | | 变更关口 | 在证据与政策变化后控制提升发布的审核决定。 |
证据模型
监测包存储运行条件版本、来源与语料清单、工具与模型配置、政策版本、基准结果、抽样主张核验、审核指标、告警、事件、反馈处置与发布决定。遥测用于识别制品与状态,不记录不必要的来源内容或隐藏推理文本。
受控工作流
- 声明已评价运行条件与监测信号。
- 捕获版本化输入、检索、工具、输出与审核遥测。
- 运行固定、轮换、对抗与高后果基准层。
- 把告警分诊为数据、检索、模型、工具、政策或审核失败。
- 复现事件并在受保护集合上评价候选修正。
- 通过书面变更关口提升、回滚、限制或退役。
每一步都输出版本化制品或明确失败。后续阶段只消费前一阶段经过验证的输出;对话上下文绝不能成为未记录的数据通道。
测量与验收准则
带不确定性与暴露范围跟踪性能:无来源主张率、引文失败、检索缺口率、工具拒绝、校准漂移、弃答、严重错误逸出、审核分歧与事件遏制时间。使用预先声明阈值比较当前窗口与参考窗口。告警数量和用户满意度属于情境指标,不能替代科学正确性。
$PSI=\sum_b (p_b-q_b)\ln\left(\frac{p_b}{q_b}\right)$
| 关口 | 必需证据 | 发布后果 | |---|---|---| | 身份 | 可解析的主张、来源、配置与结果 ID | 任一身份含混即阻断 | | 依据 | 每项事实主张均到达充分来源片段 | 移除或扣留无来源主张 | | 独立性 | 血缘与分区检查证明无循环或目标信息 | 使受影响支持与评分失效 | | 审核 | 必需角色处置精确候选版本 | 候选保持未发布 | | 可复现性 | 清单、工具与检查能够重建证据包 | 退回数据包修正 |
主张—来源与系统合同
监测合同定义运行条件、信号模式、抽样计划、基准版本、阈值、告警责任、调查状态、反馈资格、回滚准则与重评触发条件。即使模型二进制未变,配置、语料、工具或政策变化也不能绕过评价。
安全、隐私与访问边界
最小化遥测,把运行标识与来源内容分开并应用保留期限。保护基准案例与事件细节,防止其进入提示材料或公开示例。反馈属于不可信输入,使用前必须扫描、审核与标记。监测访问不得形成进入受限来源的旁路。
人工审核与升级
定期审核趋势、子组失败、未解决事件、阈值适用性、基准新鲜度与审核能力。变更提案包含预期收益、风险、测试证据、回滚与观察条件。当证据质量、访问或控制无法继续支持安全使用时,退役是可接受结果。
合成案例详解
一项合成月度监测显示答案长度稳定,但引文失败率上升。调查发现新扫描表格格式降低了依据完整度,语言模型与提示均未变化。发布关口限制表格派生主张,把受影响案例送交审核,并将新格式加入受保护回归集。只有提取与引文测试通过后才恢复服务范围。
反例与失败分析
某仪表板只跟踪请求数、延迟与正面反馈,却没有主张核验、检索或审核信号。即使科学证据质量已经崩溃,它仍可能显示服务健康。运行可用性与证据可靠性是不同维度,二者都需要明确测量。
常见失败模式
- 只监测延迟与可用性
- 把任何告警当作根因诊断
- 不做分区控制就让事件进入训练
- 模型不变时忽略语料与政策变化
- 因把退役视为失败而继续运行不安全工作流
实践练习
- 为一个合成工作流定义运行条件与信号。
- 建立四个基准层并说明各自用途。
- 按症状、原因、后果与修复对五个事件分类。
- 编写同时包含提升与回滚证据的变更关口决定。
考核制品
提交一套持续评价计划、基准套件与版本化失败登记表,并附来源清单、配置版本、验收证据、被拒案例、未解决风险,以及未选择某个合理备选控制的简要理由。如果图示或文字无法与机器可检查证据核对,制品即不完整。
验证检查点
把一项已发布合成主张逆向追踪,经过审核、置信、核验、证据图、工具结果或来源片段,直到不可变输入;再把一项被拒主张追踪到最早失败合同。根据清单重跑数据包并比较内容摘要。只有另一位审核者无需原对话即可重建接受与阻断路径、识别所有假设并复现发布决定,检查点才通过。对未解决风险应如实记录,不能用生成文字补全缺失事实。
来源
- 人工智能测试、评价、验证与确认计划, 评价人工智能能力与局限的官方测量科学指南。
- 《人工智能风险管理框架 1.0》, 用于在全生命周期治理、映射、测量与管理情境相关 AI 风险的框架。
- ISO/IEC 42001:2023 人工智能管理体系, 关于责任管理、书面控制与持续改进的要求。
- 数据质量词汇, 描述质量测量、维度、政策与注释的词汇。