D2 · 出版卷 18
Exploratory Data Analysis
Distributions、outliers、domains、relationships
学习目标
本章结束时,学习者应能建立考虑地质域的探索性分析;解释稳健和常规汇总;区分尾部行为与错误;在不忽略支撑和空间位置的前提下比较分组;把统计观察转化为可检验的地质问题。
探索性分析不是寻找偏好的分布。其目的在于暴露结构、混合、趋势、支撑效应、数据质量问题,以及后续方法必须处理的假设。
分析总体与审计表
绘图之前先定义总体。记录地质域、变量、数据类型、支撑、日期范围、检出限处理、回收筛选、截断状态和转换。只标变量名的直方图不可复现。加入样本数和总支撑,避免把大量短区间误认为更大的物理总体。
建立筛选审计表,显示每步之后的总体。计数、总长度、加权均值或高值贡献的意外变化,常常暴露连接错误或过宽排除规则。
分布视图与稳健汇总
使用互补视图:直方图、累积分布、箱线图、分位数图和排序贡献。报告数量、最小、最大、分位数、均值、中位数、方差、标准差、变异系数和稳健离散度。对正偏数据,均值和方差对物质量核算仍然重要,而中位数和分位数能描述不受尾部支配的典型观测。
直方图形状取决于箱宽和坐标尺度。正值数据应同时在线性和对数轴检查。平滑曲线可能隐藏小总体;噪声直方图可能制造假峰。每个高值应保持可见。
分组比较与地质域检验
比较岩性、蚀变、风化、方向、钻探阶段、样品类型和空间分区。先用并列分布和分位数—分位数比较,再把差异绘制到空间。统计分离可以支持分域问题,但不能独自定义边界。反之,若连续性不同,重叠分布也不能否定有地质意义的边界。
当分组支撑或取样密度不同,应先对齐再解释均值差异。密集钻探的高品位核心可能支配未加权全局直方图。偏好取样可信时,应同时报告原始和去聚类敏感性。
关系、趋势与多变量检查
散点图、秩相关和条件汇总可揭示密度—品位、元素—元素或回收—品位关系。应标出检出限和删失值,而不是把它们当作普通零值。用颜色或分面区分地质域;合并相关可能完全由分组差异造成。
按东、北、高程、深度和地质坐标绘制数值。趋势可能是真实地质、钻探阶段效应或边界混合。后续平稳方法需要可辩护的稳定域或明确趋势处理。
把异常值当作问题
极值可能是错误、正确的稀有观测、支撑异常,或独立地质过程证据。检查来源证书、单位、重复样、回收、邻近值和地质背景。不得因为数值不符合方便的分布模型就删除。
把识别与处理分开。用透明标准标记候选极值,再决定纠正、排除、截断、限制空间影响、单独建模或保留。对含量和局部估算的影响应在后续敏感性研究中量化。
合成示例
在合成中央域中,63% 样品位于 28% 体积内。原始均值为 1.34,中位数 0.62,变异系数 1.9。对数直方图显示连续尾部,而不是清楚的第二峰。五个高值贡献样品金属累积的 17%。
按钻探阶段着色发现三个高值来自同一批次,但证书和重复样检查通过。空间图显示它们沿狭窄褶皱翼分布。决策是组合时保留,标记构造子区,后续检验截断和限制影响。不会只凭直方图建立新域。
练习与审查清单
- 编写分析总体声明和筛选审计表。
- 用至少四种互补分布图查看每个重要变量。
- 按域比较原始、支撑加权和去聚类汇总。
- 解释前先绘制每个表面分组差异或趋势。
- 建立极值调查登记,而不自动删除观测。
决策记录与衔接
探索性记录应说明哪些总体看起来稳定,哪些趋势或混合需要建模,哪些数值需要调查,以及拟议哪些转换。保存图件时附数据版本、筛选和支撑元数据。
输出为组合长度、去聚类方向、变差函数域、各向异性和极值测试提供依据,但并不单独授权任何决策。