D2 · 出版卷 18

Declustering

Preferential sampling、weights、representativity

学习目标

学完本章,学习者应能识别选择性取样,解释原始样本均值为何未必代表整个空间域,计算并审查去聚类权重,选择维度与单元尺寸敏感性,并说明去聚类能纠正什么、不能纠正什么。

钻孔很少按完全随机方案布置。加密工作常集中在较有吸引力的区域、通行条件较好的走廊或尚不确定的接触带。这类数据可能非常适合局部估算;但若每个样本在全域统计中权重相同,所得分布便可能偏向密集区。

选择性取样与代表性

把样本密度和值放在同一空间图上。若高值区或低值区的间距系统性不同,便需要调查选择性取样。还应按钻探阶段、空间分区和地质域体积比较。数据聚集本身不等于偏差;只有当布点与研究变量或相关地质特征有关时,聚集才会改变总体代表性。

先定义估计对象。全域均值、局部块估值和样本直方图回答的是不同问题。去聚类主要用于获得更具代表性的全局分布或比例;局部估算器已经通过邻域与权重处理位置关系,不能把全局去聚类权重机械地再次施加其上。

单元去聚类原理

把研究域划分为等体积单元。每个有样本的单元获得相同总权重,再由其中样本平分。若单元 jn_j 个样本,且共有 N_o 个被占用单元,则样本的未归一化权重与 1/n_j 成正比;归一化后满足


w_i=\frac{1/n_{j(i)}}{\sum_{k=1}^{n}1/n_{j(k)}} , \qquad \sum_i w_i=1.

去聚类均值为 \bar z_w=\sum_iw_iz_i。结果依赖单元尺寸和网格原点,因此这两个参数都必须公开并接受敏感性检验。

维度、坐标与边界

应在取样发生选择性的维度内去聚类。若钻孔大致垂直穿过板状地质域,二维地质坐标可能比三维直角坐标更合适;厚大或形态不规则的地质体通常需要三维方法。对褶皱或旋转地质域直接使用地图坐标,会把实际相邻关系扭曲。

边界切割出的微小占用单元可能获得过高权重。应测试分域网格、地质坐标和边界敏感性。即使来自不同平稳总体的样本落入同一空间单元,也不应共享去聚类权重。

参数选择与稳定性

从密集间距到稀疏间距测试一系列单元尺寸,并改变多个网格原点。绘制去聚类均值、分位数和有效样本量随单元尺寸的曲线。选择物理上合理的稳定区间,而不是挑选最有利的极小值或极大值;原始结果与敏感性包络应一并报告。

有效样本量可诊断为


n_{\mathrm{eff}}=\frac{1}{\sum_i w_i^2}.

数值很小意味着少数稀疏样本控制了去聚类分布。该结果在数学上可能成立,但用于稳健全局推断仍然过于脆弱。

局限与替代证据

去聚类不能在未取样空间创造观测,不能纠正分析偏差、修复错误地质域或消除地质趋势。它假定所选单元和坐标能合理近似空间代表性。若稀疏区存在系统差异,分层估计、趋势模型或明确的情景分析通常更诚实。

在适用时,将其与多边形或最近面积加权、按钻孔等权以及按体积分层的统计比较。结果一致会提高可信度;结果不一致则表明代表性风险,应传递到分类和不确定性分析。

选择性聚集的合成样本以及权重在占用单元间的重新分配
选择性聚集的合成样本以及权重在占用单元间的重新分配

合成示例

合成中央地质域的原始均值为 1.34。密度图显示,褶皱高值核心附近钻孔密集,边缘稀疏。三维单元从 25150\,\mathrm{m} 的测试得到 1.021.16 的去聚类均值;当单元接近稀疏区间距时,在 1.09 左右出现平台。

采用尺寸下四个网格原点给出 1.061.12 的范围。该结果被记录为代表性分布的敏感性,不用于重标定单个数据。边缘分区只有三个钻孔,即使去聚类赋予它们更高权重,该区仍保留为明确不确定性。

练习与审查清单

  • 按钻探阶段和地质域同时绘制数据间距与数值。
  • 在应用任何去聚类方法前声明估计对象。
  • 当地质形态需要时比较二维和三维坐标。
  • 绘制均值、分位数、有效样本量及原点敏感性随单元尺寸的变化。
  • 把原始、采用和敏感性分布带入后续验证。

决策记录与衔接

去聚类记录应包含总体、坐标、维度、单元尺寸、原点、权重、诊断图、采用区间和局限。权重应作为独立字段保存,并以组合数据版本为键。

所得结果用于全局分布、尾部贡献、模拟输入和验证目标。除非具体估算方法及用途已有充分论证,不应把去聚类权重直接放入局部估算器。

来源