E3 · 出版卷 25

组合样算法

长度加权、余段、域边界与缺失值

学习目标

  • 解释“长度加权、余段、域边界与缺失值”的决定边界与证据边界。
  • 设计并实现相关钻孔数据或算法契约,不使用隐藏约定。
  • 区分硬发布质量门、诊断、解释与获授权审查。
  • 使用合成证据产出一份组合样规范、黄金数据集与支撑守恒报告。

只有当学习者能够为数据模型、算法、测试与发布决定同时辩护时,本章才算完成。没有来源证据与可执行不变量的美观轨迹或整洁区间表仍然未经验证。

这是一部通用、机构中立的教程,与任何公司或个人没有关系。本章中的钻孔标识、坐标、深度、方向、区间、数值和审查事件全部为合成教学材料,不得用于实际业务决定。

决定情境

组合样会改变观测支撑,因此生成派生证据。计算前必须声明目标支撑长度、起点、域边界、余段政策、合格输入状态、缺失值处理、加权依据与最低覆盖率。定长组合样不是简单的行平均,而是对来源区间与目标窗口精确交集进行的受控聚合。

选择转换前先写明预期用途、错误后果、所需证据与发布权限。同一来源可以适合探索显示,却不适合正式派生发布。适用性应针对版本化契约和用途评估,而不能永久贴在文件上。

核心概念

在每个允许域内独立构建目标窗口。将每个窗口与来源区间求交,在全部边界处切分贡献;除非声明了物理上合理的其他权重,否则按交集长度加权。缺失、删失、拒绝与不适用值保持区分。余段可以保留、合并、重新分配或舍弃,但必须依据显式政策并报告影响。

接收观测、合格证据视图与派生结果应保持为不同对象。这样,更正证据或改变方法可以生成新结果而不改写历史。每个派生坐标或区间都同时回答一个科学问题与一个来源问题。

算法与数据模型

组合样记录链接到目标支撑、域身份、贡献来源区间、交集长度、来源值状态、聚合规则与处理运行。目标总长度和合格贡献长度都要保存。不得仅为达到目标长度而跨越域边界。若覆盖低于声明阈值,应返回支撑不足状态,而不是把现有数值缩放成表面完整结果。

在可行范围内,把转换定义为纯粹、可测试的运算。解析、语义验证、证据选择、数值计算与发布评估是不同阶段;每个阶段输出结构化结果,不依赖界面状态、文件名顺序或无文档默认值。

约束与不变量

| 不变量 | 可执行或审查测试 | | --- | --- | | 计算前声明目标支撑与余段政策。 | 拒绝或隔离违反该条件的记录,并记录精确受影响身份。 | | 贡献使用精确区间交集。 | 在生成任何轨迹或区间派生结果前评估该条件。 | | 除非有经审查规则,域边界均为硬边界。 | 保留接收证据,并为每次更正创建新版本。 | | 每个聚合结果报告合格长度与排除项。 | 在审计输出中包含规则标识、观测值与解决状态。 |

不变量必须在导入、转换、处理、导出与重跑中持续成立。硬不变量失败时,不得生成表面有效的替代结果。诊断检查保留阈值、作用域与证据,只有经审查规则允许时才能触发更正。

定量推理

对目标窗口 W、合格来源值 x_i 和交集长度 w_i=|W\cap I_i|,长度加权均值为 \bar{x}_W=\sum_i w_i x_i/\sum_i w_i。仅当合格贡献不重叠时,覆盖率才可写为 q_W=\sum_i w_i/|W|;否则必须先解析重叠或处理重数。通过比较贡献长度之和与合格交集并集验证支撑守恒。每个结果都要同时报告分母、排除项与余段处理。

每项指标都包含单位、适用时的分子与分母、排除项、比较政策与评估版本。若汇总可能掩盖局部失败,应分层报告。定量诊断支持决定,但不能推翻身份缺失、几何无效、冲突未解决或血缘断裂。

证据与不确定性

观测不确定性、插值不确定性、数值近似与元数据不确定性应保持分离。平滑轨迹可以在数值上非常精确,但在测站间距过大时仍缺乏约束;精确区间叠置在来源深度基准未知时仍可能不适用。考核结果应说明哪些不确定性属于现象、测量、算法和解释。

证据包应包含不可变接收记录、语义声明、验证发现、算法输入输出、测试结果、审查决定与指纹。矛盾证据继续保留。必需依赖无法解析时,返回显式未知、冲突或阻止状态,而不是选择最方便的值。

接口与存储

接口在数值旁传递身份、单位、坐标与深度参考、约定、值状态、版本与血缘。轨迹交换包含孔口与基准上下文、合格测站身份、算法身份、数值政策与输出坐标;区间交换包含支撑类型、边界约定与来源链接。结构化错误标识记录、字段、观测值、预期条件与规则。

权威接收证据与可复现派生物、可丢弃视图分开存储。索引、缓存与可视化可以改善访问,但不能成为角度约定、合格测站决定或区间血缘的唯一副本。导出往返应验证标识、精度、顺序与缺失状态在编码变化后仍然保留。

治理与审查

责任分配给角色,而不是具名机构或个人:证据保管角色、规则编写角色、实现维护角色、独立验证角色与发布审查角色。任何角色都不能抹去来源证据。规则与算法变更在影响发布前必须经过审查、版本化,并对固定回归夹具评估。

例外是显式决定,包含作用域、理由、证据、批准角色、受影响版本与复审触发条件。例外不会改写失败规则,也不会自动传播。承载教程的网站在该工作流中没有所有权或科学权威角色,只负责内容交付。

综合检查点

一份组合样规范、黄金数据集与支撑守恒报告
一份组合样规范、黄金数据集与支撑守恒报告

把本图视为从保留证据,经显式约定、确定性计算与验证,通向发布的推理地图。每条箭头代表声明关系或转换。把一份组合样规范、黄金数据集与支撑守恒报告整合到持续演进的合成钻孔数据包,重跑此前全部夹具,并记录任何变化的假设。

合成算例

一个合成域 [0,7) 包含来源区间 [0,1.5) 值 2、[1.5,4) 值 5、[4,7) 值 8。目标长度为 2 m,从零起算并保留余段。第一个组合样为 (1.5\times2+0.5\times5)/2=2.75;第二个使用 2 m 的值 5;第三个由 0.5 m 的值 5 与 1.5 m 的值 8 组成;最后 [6,7) 的余段保留为支撑长度明确的 1 m 组合样。

  1. 保留接收记录,在不更正的情况下声明预期决定。
  2. 解析身份、单位、约定与证据资格,并标记每个未解决项。
  3. 运行版本化算法与测试,同时保留中间诊断。
  4. 作出接受、拒绝或隔离决定,并展示独立审查者如何复现。

练习任务

针对一个合成夹具实现本章成果。夹具至少包含一个正常用例、一个边界用例、一个无效用例与一个证据未解决用例。保留接收夹具,并产出规范输入、验证发现、派生输出、处理清单与简短发布决定。

验收条件:

  • 规则所需的每个输入身份、单位与约定均显式声明。
  • 实现在稳定排序与声明数值政策下具有确定性。
  • 任何更正都不覆盖接收证据,也不把未知变成猜测值。
  • 所有硬失败均阻止受影响派生物,并保持机器可读。
  • 第二个实现或审查者可只依靠数据包复现结果。

提交一份组合样规范、黄金数据集与支撑守恒报告、黄金与对抗夹具、精确发现项和限制说明。截图不能作为充分证据,因为它不标识输入版本、算法或规则配置。

常见失败模式

  • 不按交集长度加权而直接平均各行。
  • 跨越域边界填满目标窗口。
  • 把缺失值当作零。
  • 舍弃余段却不报告损失支撑。

这些失败具有共同模式:用隐含便利替代证据。应定位假设最早进入的边界,恢复来源主张,把约定或规则显式化,重跑全部依赖派生物,并以替代方式更新受影响发布,而不是覆盖。

复习问题

  1. 为什么组合样会生成派生证据?
  2. 部分来源区间如何加权?
  3. 组合样值旁必须报告什么?
  4. 余段组合样何时有效?

每个答案都要指出支配不变量、评估所需证据、涉及的数值或语义政策,以及条件失败时的正确行为。

来源与延伸阅读