E3 · 出版卷 25
区间质量规则
间隙、重叠、负长度与超出孔深的区间
学习目标
- 解释“间隙、重叠、负长度与超出孔深的区间”的决定边界与证据边界。
- 设计并实现相关钻孔数据或算法契约,不使用隐藏约定。
- 区分硬发布质量门、诊断、解释与获授权审查。
- 使用合成证据产出一个区间质量控制引擎与带精确受影响范围的覆盖报告。
只有当学习者能够为数据模型、算法、测试与发布决定同时辩护时,本章才算完成。没有来源证据与可执行不变量的美观轨迹或整洁区间表仍然未经验证。
这是一部通用、机构中立的教程,与任何公司或个人没有关系。本章中的钻孔标识、坐标、深度、方向、区间、数值和审查事件全部为合成教学材料,不得用于实际业务决定。
决定情境
质量控制决定区间集合是否满足其观测类型与预期用途规则。分区表可能要求连续且不重叠的覆盖;样品表可以合理存在间隙;独立解释表可能按设计重叠。因此,规则集必须声明集合类型、预期深度范围、容差政策,以及每种条件属于无效、警告还是信息。
选择转换前先写明预期用途、错误后果、所需证据与发布权限。同一来源可以适合探索显示,却不适合正式派生发布。适用性应针对版本化契约和用途评估,而不能永久贴在文件上。
核心概念
分析关系前先验证每一行:边界有限、单位正确、长度为正、钻孔可解析且支撑位于允许深度范围内。随后按规范起点、终点与身份稳定排序,并扫描端点以发现间隙、重叠、包含和重复范围。发现项应标明精确范围及全部贡献记录。容差用于分类近似相等边界,但不会抹去原始差异。
接收观测、合格证据视图与派生结果应保持为不同对象。这样,更正证据或改变方法可以生成新结果而不改写历史。每个派生坐标或区间都同时回答一个科学问题与一个来源问题。
算法与数据模型
行级发现与集合级发现应分开。负长度和非有限端点属于单行问题;间隙属于一个集合及其预期覆盖范围;重叠涉及两个或多个记录,并可能存在多个同时有效贡献者。超孔深判断需要版本化孔深观测及其深度基准。若该观测缺失或不确定,应报告依赖问题,而不是编造限制。
在可行范围内,把转换定义为纯粹、可测试的运算。解析、语义验证、证据选择、数值计算与发布评估是不同阶段;每个阶段输出结构化结果,不依赖界面状态、文件名顺序或无文档默认值。
约束与不变量
| 不变量 | 可执行或审查测试 | | --- | --- | | 执行间隙或重叠测试前先声明集合预期。 | 拒绝或隔离违反该条件的记录,并记录精确受影响身份。 | | 覆盖率使用区间并集,而不是行长度求和。 | 在生成任何轨迹或区间派生结果前评估该条件。 | | 每个发现项都记录精确受影响范围。 | 保留接收证据,并为每次更正创建新版本。 | | 超孔深检查引用版本化孔深观测。 | 在审计输出中包含规则标识、观测值与解决状态。 |
不变量必须在导入、转换、处理、导出与重跑中持续成立。硬不变量失败时,不得生成表面有效的替代结果。诊断检查保留阈值、作用域与证据,只有经审查规则允许时才能触发更正。
定量推理
对预期范围 L,应报告并集覆盖率 C=|\cup_i I_i|/L、间隙总长、重叠并集长度以及各范围的重数。不能用区间长度之和估算覆盖率,否则重叠会被重复计算。扫描时,同一深度的事件遵循声明的左闭右开顺序,先处理终点再处理起点。受容差影响的结果同时记录原始差值与分类状态。
每项指标都包含单位、适用时的分子与分母、排除项、比较政策与评估版本。若汇总可能掩盖局部失败,应分层报告。定量诊断支持决定,但不能推翻身份缺失、几何无效、冲突未解决或血缘断裂。
证据与不确定性
观测不确定性、插值不确定性、数值近似与元数据不确定性应保持分离。平滑轨迹可以在数值上非常精确,但在测站间距过大时仍缺乏约束;精确区间叠置在来源深度基准未知时仍可能不适用。考核结果应说明哪些不确定性属于现象、测量、算法和解释。
证据包应包含不可变接收记录、语义声明、验证发现、算法输入输出、测试结果、审查决定与指纹。矛盾证据继续保留。必需依赖无法解析时,返回显式未知、冲突或阻止状态,而不是选择最方便的值。
接口与存储
接口在数值旁传递身份、单位、坐标与深度参考、约定、值状态、版本与血缘。轨迹交换包含孔口与基准上下文、合格测站身份、算法身份、数值政策与输出坐标;区间交换包含支撑类型、边界约定与来源链接。结构化错误标识记录、字段、观测值、预期条件与规则。
权威接收证据与可复现派生物、可丢弃视图分开存储。索引、缓存与可视化可以改善访问,但不能成为角度约定、合格测站决定或区间血缘的唯一副本。导出往返应验证标识、精度、顺序与缺失状态在编码变化后仍然保留。
治理与审查
责任分配给角色,而不是具名机构或个人:证据保管角色、规则编写角色、实现维护角色、独立验证角色与发布审查角色。任何角色都不能抹去来源证据。规则与算法变更在影响发布前必须经过审查、版本化,并对固定回归夹具评估。
例外是显式决定,包含作用域、理由、证据、批准角色、受影响版本与复审触发条件。例外不会改写失败规则,也不会自动传播。承载教程的网站在该工作流中没有所有权或科学权威角色,只负责内容交付。
综合检查点
把本图视为从保留证据,经显式约定、确定性计算与验证,通向发布的推理地图。每条箭头代表声明关系或转换。把一个区间质量控制引擎与带精确受影响范围的覆盖报告整合到持续演进的合成钻孔数据包,重跑此前全部夹具,并记录任何变化的假设。
合成算例
一个应覆盖 [0,100) 的合成分区包含 [0,40)、[39.9998,70)、[72,90)、[90,101)。深度比较容差为 0.001 m 时,第一个边界差异被分类为近似相等,但原值仍保留;精确的 [70,72) 间隙属于分区硬失败;末区间超过已验证的 100 m 孔深 1 m,因而被阻止。覆盖率依据并集计算,而不是依据各行长度之和 101.0002 m。
- 保留接收记录,在不更正的情况下声明预期决定。
- 解析身份、单位、约定与证据资格,并标记每个未解决项。
- 运行版本化算法与测试,同时保留中间诊断。
- 作出接受、拒绝或隔离决定,并展示独立审查者如何复现。
练习任务
针对一个合成夹具实现本章成果。夹具至少包含一个正常用例、一个边界用例、一个无效用例与一个证据未解决用例。保留接收夹具,并产出规范输入、验证发现、派生输出、处理清单与简短发布决定。
验收条件:
- 规则所需的每个输入身份、单位与约定均显式声明。
- 实现在稳定排序与声明数值政策下具有确定性。
- 任何更正都不覆盖接收证据,也不把未知变成猜测值。
- 所有硬失败均阻止受影响派生物,并保持机器可读。
- 第二个实现或审查者可只依靠数据包复现结果。
提交一个区间质量控制引擎与带精确受影响范围的覆盖报告、黄金与对抗夹具、精确发现项和限制说明。截图不能作为充分证据,因为它不标识输入版本、算法或规则配置。
常见失败模式
- 不顾集合类型把所有间隙都称为错误。
- 保留原始差异前就吸附边界。
- 多次累计同一重叠范围。
- 假定最大区间终点就是孔深。
这些失败具有共同模式:用隐含便利替代证据。应定位假设最早进入的边界,恢复来源主张,把约定或规则显式化,重跑全部依赖派生物,并以替代方式更新受影响发布,而不是覆盖。
复习问题
- 为什么区间预期必须按类型设置?
- 扫描线算法如何找出精确重叠范围?
- 为什么行长度之和不等于覆盖范围?
- 判断超孔深需要什么证据?
每个答案都要指出支配不变量、评估所需证据、涉及的数值或语义政策,以及条件失败时的正确行为。
来源与延伸阅读
- OGC GeoSciML 4.1 钻孔要求,涵盖钻孔区间、一维支撑与区间顺序。
- ISO 19157-1:2023 地理信息数据质量,用于描述和评价数据质量的框架。
- IEEE 754-2019 浮点运算标准,规定浮点格式、运算、舍入与异常行为。
- W3C PROV-O,用于表达实体、活动、责任角色与派生关系的模型。