C2 · 出版卷 12
Bias、Leakage 与 False Discovery
Confirmation bias、survivorship、target leakage、multiple testing
学习目标
完成本课后,你应能识别勘查中的认知与选择偏差,区分目标泄漏和合法 predictor,设计空间与时间验证,解释反复搜索为何提高假阳性风险,计算简单多重检验案例,并在不把未检验地区当作贫矿的前提下保存负证据。
偏差是观测、分析或决策中的系统性扭曲,并不自动表示不当行为或能力不足。地质工作尤其易受影响,因为露头不完整、已知样例空间聚集、标签会变化,而解释又指导新数据在哪里取得。因此,控制必须进入时间顺序、采样、数据管理和评审流程。
认知与组织偏差
确认偏差偏好与首选模型相容的观测,并为矛盾寻找借口;anchoring 让第一种解释或分数影响过大;availability bias 高估记忆深刻的发现或鲜明异常;沉没成本偏差因过去投入而继续;群体一致性即使无人故意,也可能压制可行替代。
控制方法包括:结果前编写预测矩阵、独立构建替代解释、维护矛盾日志、在现实可行时 blind 或 masked review、轮换批评角色、明确停止规则和保存决策快照。不同观点只有在证据和推理被记录时才有用;权威或资历不是似然比。
组织激励可能奖励生成靶区而不是退出靶区。应同时衡量学习质量:区分了哪些假设、解决了哪些谱系问题、哪些搜索空间经充分检验退出,以及哪些标准以前瞻方式改善。不能把失败靶区换标签后再计算成新成功。
生存者偏差与观测过程偏差
已知矿床和成熟 prospect 是地质、保存、露头、可达性、历史技术和过去搜索偏好的幸存者,并非所有 Mineral Systems 的随机样本。只用幸存者训练,可能让模型识别裸露、易达或历史上受偏爱的环境,而非地质潜力。
“非矿床”标签同样不确定。未检验点不是真阴性;已检验地点也可能只对一种几何、深度或目标矿物为阴性。可使用 positive–unlabelled 思路、有界背景抽样,或为负标签记录置信度,并绘制历史勘查强度和观测机会。
负证据需要可见性。密集露头中的缺失,与深覆盖下的缺失意义不同。保存失败检验时,必须附足迹、探测能力和假设层级。一个阴性钻孔不能把整个区域涂成贫矿,除非其几何与推断支持该尺度。
泄漏与无效验证
目标泄漏指 predictor 含有决策时不可获得的信息,或由目标标签派生。例如:用后续钻探验证钻前排名;计算到后来才发现矿点的距离;使用围绕已知靶区重新解释的图层。模型可能看似准确,却无法前瞻应用。
空间泄漏是同一地质 cluster 的邻近观测同时进入训练和验证。随机拆分只是在已知 district 内检验插值,而不是向新搜索空间迁移。应采用空间块、地质 cluster 或 leave-area-out,并报告距离或地质域隔离程度。
处理泄漏会在拆分前用全数据归一化、选特征或调阈值时发生。所有学习得到的转换都应在每个训练 fold 内拟合。尽可能保留冻结的前瞻集合。若查看验证表现后又修改模型,就需要新的未触碰测试,或诚实地把该结果改称开发证据。
多重检验与假发现
搜索许多元素、转换、阈值、窗口尺寸和靶区单元时,即使零模型成立,也会偶然出现强模式。若 m 个相互独立检验均使用显著性水平 \alpha,且全部零假设为真,至少出现一个假阳性的概率为
$1-(1-\alpha)^m.$
当 m=20、\alpha=0.05 时,概率为 1-0.95^{20}\approx0.642。地学检验很少完全独立,但示例说明:从许多尝试中挑出的一个低值,不等于预先声明检验的结果。
family-wise error 控制一组检验出现任何错误拒绝的概率;False Discovery Rate 在声明假设下控制被拒假设中错误拒绝所占比例的期望。正式方法只适用于定义清楚的统计检验,不能自动套到每项专家条件。更广泛的控制包括预注册、留出证据、透明报告尝试次数、适合依赖结构的校正,以及在独立地质环境中复现。
合成算例
一个虚构定向研究测量 12 个元素,测试两个粒级、三种转换和两个邻域半径,共 12\times2\times3\times2=144 个分析变体。最强变体在声明零模型下未校正 p=0.004。使用按检验数相除的简单 family-wise 阈值,\alpha=0.05 时阈值为 0.05/144=0.000347,所选结果未通过该保守规则。
另有五项预先声明、科学上相互区分的检验,排序 p 值为 0.003、0.009、0.018、0.041、0.20。使用阶梯式 False Discovery Rate 程序并设 q=0.05,阈值依次为 0.01、0.02、0.03、0.04、0.05;前三项通过,第四项略未通过。结论依赖程序假设及结果前对 test family 的定义。
两项计算都不能证明 Mineral Systems。统计异常还必须连接地质过程、采样支持、空间依赖、质量控制和独立验证。144 个变体的完整搜索必须记录,不能把最后挑出的转换冒充先验预测。
解释工作流
- 重建每个决策日期可以获得的信息。
- 绘制露头、准入、历史搜索投入和标签置信度。
- 分开确认阳性、已检验阴性和未标注位置。
- 验证前冻结预测、转换和阈值。
- 按空间或地质独立性拆分,而非只图方便。
- 在训练 partition 内完成预处理和特征选择。
- 记录全部尝试过的变量、窗口和阈值。
- 使用适合问题的误差控制或复现策略。
- 保存矛盾、失败靶区和探测充分性。
- 分别报告前瞻表现与回顾拟合。
练习与复习
- 计算 50 个独立检验在
\alpha=0.01时至少一个假阳性的概率。 - 给出三个把决策后信息泄漏进靶区模型的 predictor。
- 设计 leave-district-out 验证,并声明它支持何种迁移结论。
- 解释不可进入区为何应为未标注,而不是阴性。
- 创建一条矛盾日志,防止充分阴性检验在后续版本中消失。
来源与延伸阅读
- 数据挖掘中的 Leakage:定义、发现与避免,通过 learn–predict 分离界定泄漏。
- 控制 False Discovery Rate,提出多重检验误差标准与程序。
- 监督式矿产勘查靶区与矿床/非矿床选择,讨论远景度模型中的有偏标签。
- 克服矿床靶区中的生存者偏差,在可见性不完整条件下发展零与负检验。