D2 · 出版卷 18

Exploratory Data Analysis

Distributions、outliers、domains、relationships

学习目标

本章结束时,学习者应能建立考虑地质域的探索性分析;解释稳健和常规汇总;区分尾部行为与错误;在不忽略支撑和空间位置的前提下比较分组;把统计观察转化为可检验的地质问题。

探索性分析不是寻找偏好的分布。其目的在于暴露结构、混合、趋势、支撑效应、数据质量问题,以及后续方法必须处理的假设。

分析总体与审计表

绘图之前先定义总体。记录地质域、变量、数据类型、支撑、日期范围、检出限处理、回收筛选、截断状态和转换。只标变量名的直方图不可复现。加入样本数和总支撑,避免把大量短区间误认为更大的物理总体。

建立筛选审计表,显示每步之后的总体。计数、总长度、加权均值或高值贡献的意外变化,常常暴露连接错误或过宽排除规则。

分布视图与稳健汇总

使用互补视图:直方图、累积分布、箱线图、分位数图和排序贡献。报告数量、最小、最大、分位数、均值、中位数、方差、标准差、变异系数和稳健离散度。对正偏数据,均值和方差对物质量核算仍然重要,而中位数和分位数能描述不受尾部支配的典型观测。

直方图形状取决于箱宽和坐标尺度。正值数据应同时在线性和对数轴检查。平滑曲线可能隐藏小总体;噪声直方图可能制造假峰。每个高值应保持可见。

分组比较与地质域检验

比较岩性、蚀变、风化、方向、钻探阶段、样品类型和空间分区。先用并列分布和分位数—分位数比较,再把差异绘制到空间。统计分离可以支持分域问题,但不能独自定义边界。反之,若连续性不同,重叠分布也不能否定有地质意义的边界。

当分组支撑或取样密度不同,应先对齐再解释均值差异。密集钻探的高品位核心可能支配未加权全局直方图。偏好取样可信时,应同时报告原始和去聚类敏感性。

关系、趋势与多变量检查

散点图、秩相关和条件汇总可揭示密度—品位、元素—元素或回收—品位关系。应标出检出限和删失值,而不是把它们当作普通零值。用颜色或分面区分地质域;合并相关可能完全由分组差异造成。

按东、北、高程、深度和地质坐标绘制数值。趋势可能是真实地质、钻探阶段效应或边界混合。后续平稳方法需要可辩护的稳定域或明确趋势处理。

把异常值当作问题

极值可能是错误、正确的稀有观测、支撑异常,或独立地质过程证据。检查来源证书、单位、重复样、回收、邻近值和地质背景。不得因为数值不符合方便的分布模型就删除。

把识别与处理分开。用透明标准标记候选极值,再决定纠正、排除、截断、限制空间影响、单独建模或保留。对含量和局部估算的影响应在后续敏感性研究中量化。

包含直方图、累积曲线、散点图与空间图的分域探索分析面板
包含直方图、累积曲线、散点图与空间图的分域探索分析面板

合成示例

在合成中央域中,63% 样品位于 28% 体积内。原始均值为 1.34,中位数 0.62,变异系数 1.9。对数直方图显示连续尾部,而不是清楚的第二峰。五个高值贡献样品金属累积的 17%。

按钻探阶段着色发现三个高值来自同一批次,但证书和重复样检查通过。空间图显示它们沿狭窄褶皱翼分布。决策是组合时保留,标记构造子区,后续检验截断和限制影响。不会只凭直方图建立新域。

练习与审查清单

  • 编写分析总体声明和筛选审计表。
  • 用至少四种互补分布图查看每个重要变量。
  • 按域比较原始、支撑加权和去聚类汇总。
  • 解释前先绘制每个表面分组差异或趋势。
  • 建立极值调查登记,而不自动删除观测。

决策记录与衔接

探索性记录应说明哪些总体看起来稳定,哪些趋势或混合需要建模,哪些数值需要调查,以及拟议哪些转换。保存图件时附数据版本、筛选和支撑元数据。

输出为组合长度、去聚类方向、变差函数域、各向异性和极值测试提供依据,但并不单独授权任何决策。

来源

  • 探索性数据分析,给出图形调查、假设和互补诊断的官方框架。
  • 直方图,说明分箱、归一化和直方图可揭示的分布特征。
  • 异常值检测,区分异常识别、调查和稳健容纳。
  • 平稳性决策,把地质域和趋势决策与空间估算假设连接起来。