E3 · 出版卷 25

区间数据模型

起点、终点、点样与开闭区间约定

学习目标

  • 解释“起点、终点、点样与开闭区间约定”的决定边界与证据边界。
  • 设计并实现相关钻孔数据或算法契约,不使用隐藏约定。
  • 区分硬发布质量门、诊断、解释与获授权审查。
  • 使用合成证据产出一份带边界与点事件夹具的规范区间契约。

只有当学习者能够为数据模型、算法、测试与发布决定同时辩护时,本章才算完成。没有来源证据与可执行不变量的美观轨迹或整洁区间表仍然未经验证。

这是一部通用、机构中立的教程,与任何公司或个人没有关系。本章中的钻孔标识、坐标、深度、方向、区间、数值和审查事件全部为合成教学材料,不得用于实际业务决定。

决定情境

模型必须说明井下记录支撑什么对象。区间观测作用于一个实测深度范围;点事件作用于一个路径坐标;累计深度若无相应语义,则两者都不是。起点与终点需要关联钻孔、深度基准、单位、边界约定、观测类型、来源身份与有效状态。零长度区间不得悄然重解释为点样。

选择转换前先写明预期用途、错误后果、所需证据与发布权限。同一来源可以适合探索显示,却不适合正式派生发布。适用性应针对版本化契约和用途评估,而不能永久贴在文件上。

核心概念

对于分区式区间表,除非领域要求另有规定,使用规范左闭右开约定 [from,to)。相邻区间由此相接而不会重复拥有共享边界。来源约定应保留,并记录转换过程。地质界线、样品、回次与图像段可以共享实测深度坐标,但代表不同观测类型;应保存在不同类型集合中,或携带显式支撑类型。

接收观测、合格证据视图与派生结果应保持为不同对象。这样,更正证据或改变方法可以生成新结果而不改写历史。每个派生坐标或区间都同时回答一个科学问题与一个来源问题。

算法与数据模型

每个区间同时保存不可变来源值与规范数值边界,并附加区间身份、钻孔身份、表或观测类型、来源行身份、深度单位、基准、边界约定、属性、质量状态与来源。点事件使用点支撑模型,而不是把起止值复制为同一数值。未知端点保持未知;孔深可以约束有效性,但不能在缺乏证据时补作缺失终点。

在可行范围内,把转换定义为纯粹、可测试的运算。解析、语义验证、证据选择、数值计算与发布评估是不同阶段;每个阶段输出结构化结果,不依赖界面状态、文件名顺序或无文档默认值。

约束与不变量

| 不变量 | 可执行或审查测试 | | --- | --- | | 每个支撑都声明钻孔、深度基准与单位。 | 拒绝或隔离违反该条件的记录,并记录精确受影响身份。 | | 边界约定显式记录,并在转换中保留。 | 在生成任何轨迹或区间派生结果前评估该条件。 | | 点事件与正长度区间属于不同类型。 | 保留接收证据,并为每次更正创建新版本。 | | 未知边界绝不因方便而补值。 | 在审计输出中包含规则标识、观测值与解决状态。 |

不变量必须在导入、转换、处理、导出与重跑中持续成立。硬不变量失败时,不得生成表面有效的替代结果。诊断检查保留阈值、作用域与证据,只有经审查规则允许时才能触发更正。

定量推理

规范区间长度为 \ell=to-from。普通有效区间要求边界有限且 \ell>0;若契约允许零长度标记区间,必须另设类型。两个左闭右开区间的交集长度为 \ell_{\cap}=\max(0,\min(to_1,to_2)-\max(from_1,from_2))。相等判断仅在分类时使用声明的深度容差;不得只为使边界相接而舍入存储证据。

每项指标都包含单位、适用时的分子与分母、排除项、比较政策与评估版本。若汇总可能掩盖局部失败,应分层报告。定量诊断支持决定,但不能推翻身份缺失、几何无效、冲突未解决或血缘断裂。

证据与不确定性

观测不确定性、插值不确定性、数值近似与元数据不确定性应保持分离。平滑轨迹可以在数值上非常精确,但在测站间距过大时仍缺乏约束;精确区间叠置在来源深度基准未知时仍可能不适用。考核结果应说明哪些不确定性属于现象、测量、算法和解释。

证据包应包含不可变接收记录、语义声明、验证发现、算法输入输出、测试结果、审查决定与指纹。矛盾证据继续保留。必需依赖无法解析时,返回显式未知、冲突或阻止状态,而不是选择最方便的值。

接口与存储

接口在数值旁传递身份、单位、坐标与深度参考、约定、值状态、版本与血缘。轨迹交换包含孔口与基准上下文、合格测站身份、算法身份、数值政策与输出坐标;区间交换包含支撑类型、边界约定与来源链接。结构化错误标识记录、字段、观测值、预期条件与规则。

权威接收证据与可复现派生物、可丢弃视图分开存储。索引、缓存与可视化可以改善访问,但不能成为角度约定、合格测站决定或区间血缘的唯一副本。导出往返应验证标识、精度、顺序与缺失状态在编码变化后仍然保留。

治理与审查

责任分配给角色,而不是具名机构或个人:证据保管角色、规则编写角色、实现维护角色、独立验证角色与发布审查角色。任何角色都不能抹去来源证据。规则与算法变更在影响发布前必须经过审查、版本化,并对固定回归夹具评估。

例外是显式决定,包含作用域、理由、证据、批准角色、受影响版本与复审触发条件。例外不会改写失败规则,也不会自动传播。承载教程的网站在该工作流中没有所有权或科学权威角色,只负责内容交付。

综合检查点

一份带边界与点事件夹具的规范区间契约
一份带边界与点事件夹具的规范区间契约

把本图视为从保留证据,经显式约定、确定性计算与验证,通向发布的推理地图。每条箭头代表声明关系或转换。把一份带边界与点事件夹具的规范区间契约整合到持续演进的合成钻孔数据包,重跑此前全部夹具,并记录任何变化的假设。

合成算例

一个合成编录表在未注明的闭区间约定下包含岩性 [0,10]、[10,25],并在 25 m 处有标记。导入过程保留来源主张,把分区映射为 [0,10) 与 [10,25),并把标记建模为点事件。样品 [24,26) 同时覆盖最后 1 m 岩性区间并经过标记位置,但不会因此成为岩性分区的一部分。

  1. 保留接收记录,在不更正的情况下声明预期决定。
  2. 解析身份、单位、约定与证据资格,并标记每个未解决项。
  3. 运行版本化算法与测试,同时保留中间诊断。
  4. 作出接受、拒绝或隔离决定,并展示独立审查者如何复现。

练习任务

针对一个合成夹具实现本章成果。夹具至少包含一个正常用例、一个边界用例、一个无效用例与一个证据未解决用例。保留接收夹具,并产出规范输入、验证发现、派生输出、处理清单与简短发布决定。

验收条件:

  • 规则所需的每个输入身份、单位与约定均显式声明。
  • 实现在稳定排序与声明数值政策下具有确定性。
  • 任何更正都不覆盖接收证据,也不把未知变成猜测值。
  • 所有硬失败均阻止受影响派生物,并保持机器可读。
  • 第二个实现或审查者可只依靠数据包复现结果。

提交一份带边界与点事件夹具的规范区间契约、黄金与对抗夹具、精确发现项和限制说明。截图不能作为充分证据,因为它不标识输入版本、算法或规则配置。

常见失败模式

  • 没有元数据就混用闭区间与左闭右开区间。
  • 把零长度区间当作有效样品。
  • 使用行顺序作为区间身份。
  • 用孔深填充缺失终点。

这些失败具有共同模式:用隐含便利替代证据。应定位假设最早进入的边界,恢复来源主张,把约定或规则显式化,重跑全部依赖派生物,并以替代方式更新受影响发布,而不是覆盖。

复习问题

  1. 为什么左闭右开区间适合分区?
  2. 点事件与零长度区间有何不同?
  3. 哪些元数据使井下支撑可解释?
  4. 区间交集长度如何计算?

每个答案都要指出支配不变量、评估所需证据、涉及的数值或语义政策,以及条件失败时的正确行为。

来源与延伸阅读