D5 · 出版卷 21

与地质模型的数据接口

属性、试验工作血缘与域更新

学习目标

完成本章后,学习者应能设计连接地质观察、样品、试验、模型、块体、物料单元与流程物流的数据契约;区分固有属性、响应和预测;通过合样与制备保存血缘;定义单位、支撑、条件、版本与不确定性;更新域而不抹去历史;验证模型—流程反馈;并建立机构中立的接口登记表。

先定义实体再定义字段

从真实概念实体开始:源区间或标本、样品、制备批次、分样、试验、试验产品、分析结果、地质域、模型块体、采出物料单元、堆场移动、流程给料、物流样和核算期间。为每个实体赋稳定标识并定义父子关系。一个重复样品名的宽表不是数据模型。

身份与描述要分开。解释变化时,样品仍是同一实体;域版本是模型对象,不是永久刻在样品上的物性;试验产品是在条件下由给料产生的派生实体;块体预测由模型版本和输入派生。这些区分允许更正而不重写历史。

属性类别与语义定义

字段分为观察、测量、解释、派生、预测、假设和决定。矿物比例等固有岩石属性仍是由方法定义的观察或估计;回收率等响应属于试验条件;经济属性属于情景。状态要显式存储,使预测回收不能被误认为实测结果。

每个字段定义包括数量、组分或矿相、单位、干湿基准、支撑、方法、条件、有效范围、缺失含义、不确定性表达和聚合规则。避免使用含混的“品位”“回收率”“硬度”。数据字典应让两个独立实现者产生兼容数值。

样品与制备血缘

血缘从源位置开始,记录采集、质量、日期、方向或区间、储存和状态。分样创建有质量核算的子样;合样创建链接所有父样与干质量权重的新样。碎矿、磨矿、干燥和化学制备是事件,记录输入、输出、方法、粒度、污染控制和留样。

试验消耗分样并产生产品,分析又消耗或再分产品。尽可能保存质量链并标记耗尽物料。不能把合样响应附到每个父区间上,假装它们分别被测。试验记录若失去父样或条件,就不适合空间预测。

模型就绪的响应表

响应表要有一种明确观察单元,常为试验或样品—条件对。预测变量只能来自预测时可获得的信息,并包含响应、条件、方法版本、质量标记、删失、不确定性和父组。组分与方法变化时宜用长表;模型视图应由可追溯代码生成。

防止泄漏。待预测试验的产品不能成为预测变量;重复、分样和同一父样的邻近区间要在验证中分组;模型选择前定义训练、验证和测试总体;保留被排记录及理由。模型表是版本化派生物,绝不是唯一观测库。

块体、物料单元与时间接口

块体需要几何、坐标参考、体积、密度、干质量、域概率、估算主属性、预测分布、模型版本和生效日期。物料单元需要源块体比例、采矿状态、贫化、时间、去向和不确定性;堆场增加混合与库存;流程物流增加停留、循环、水和取样期间。

接口必须说明支撑变化和聚合:先相加所含组分质量,再重算品位;非加性响应需要配料或流程模型;观测比较前对齐给料与输出时间。血缘不确定时,用概率表示来源比例,不能为混合堆场虚构精确追踪。

域更新与版本控制

域更新是由证据触发的受控模型变更,记录触发、新数据、假设、算法或规则、验证、受影响体积和决策影响;创建新版本并保存旧几何、代码和预测,不能把 materially 不同的定义复用同一代码。

提供新旧域重叠映射,包括过渡与不确定性;按新版本重算下游预测并识别需复核决定。全局指标改善不足以证明更新有效,若不利域退化仍应拒绝。批准用通用角色表达,不绑定机构或个人。

质量规则与验证

验证标识、父实体、质量守恒、单位、范围、坐标、区间重叠、时间戳、方法适用性和版本兼容。跨字段规则可捕捉不可能状态:回收率超定义区间、无加料时产品质量大于给料、干质量大于湿质量、试验日期早于样品创建。

数据验证不等于科学验证。语法有效的回收率仍可能来自无代表性样品。把结构有效性、测量质量、代表性、模型适用性和决策批准分开。自动检查应产生异常和血缘,不能静默强制改值。

流程观测反馈

实测表现通过协调链返回:物料移动、堆场、给料、流程条件、物流、库存和核算。在共同支撑和版本上比较观测与预测,按物料属性、流程条件、测量变化和时间诊断残差。不能仅为吸收运行问题而修改地质。

使用监控与留出期间。模型用某期间修订后,不能再称该期间为独立验证。记录校准和评价窗口。反馈可更新响应关系、域概率或数据需求,但除非出现新的地质证据,原始地质观察不变。

互操作与受控交换

交换包包括清单、模式、数据表、单位、坐标与时间参考、代码表、方法定义、血缘、质量结果、模型卡和变更日志。尽量使用开放序列化,但语法一致不保证意义相同;应验证往返与标识,并在授权评审范围内保持派生透明。

数据包不能把公司、个人、产品或网站嵌成科学所有者。网站可以承载文件,但不会因此成为出版者或权威;来源机构只进入来源元数据;职责按功能角色表达,使教程可迁移到不同机构。

不确定性与常见失效

常见失效包括重复样品标识、覆盖原始数据、无单位字段、混合干湿基准、把响应复制到父区间、无版本域代码、随机验证泄漏、为混合堆场虚构精确来源,以及不考虑停留就按日历日连接流程反馈。单一“置信”标记也会混淆测量、模型与批准。

把不确定性设计成数据:分布、区间、协方差、类别概率、质量标记和适用距离。缺失不等于零,未知不等于低于检出限。保留源精度但不暗示准确度;迁移和模式变更应在副本上测试,协调记录数与摘要并保留回退路径。

合成算例

合成合样 CMP-017 含六个源区间及干质量权重,生成三个变异分样和一个浮选试验;试验产生分时精矿和尾矿;化验与协调平衡相互链接但分开存储。响应模型以矿物暴露和氧化预测版本 3 块体回收率,流程条件固定为合成情景 S2。

后来矿物学把一个暂定域分成两个,创建版本 4,旧块体和预测仍可查询。映射表标识重叠,只把无支撑过渡块标记为新取样对象。由于教学系统没有真实作业,不使用所谓现场数据。全部标识和值都是合成。

概念图

数据血缘图把源区间、样品、制备、试验、产品、响应模型、块体、物料单元、物流和版本化反馈连接起来。
数据血缘图把源区间、样品、制备、试验、产品、响应模型、块体、物料单元、物流和版本化反馈连接起来。

练习与决策记录

为样品、合样成员、制备事件、试验、产品、结果、模型、预测和域版本设计表,定义键、单位与质量规则;把一项结果追溯到源,再把一项预测前推到物料单元。接口契约应包含目的、实体、模式、血缘、不确定性、验证、访问边界和变更过程。

若模型预测覆盖观察,把合样响应分配给每个父样,域定义无版本变化,把缺失改成零,或把承载网站表示为科学所有者、出版机构或课程对象,则不合格。

来源