F1 · 出版卷 30
最终可复现数据包
数据清单、版本、构建、审计与静态演示
学习目标与边界
- 把“数据清单、版本、构建、审计与静态演示”解释为可审计证据问题。
- 区分来源观测、受控派生物、解释与决策状态。
- 应用身份、空间、语义、血缘、质量与审核检查。
- 产出一套自包含合成证据包、干净构建审计与静态演示。
本课属于通用、机构中立的教程,与任何公司或个人均无关系。案例中的标识、几何与数值均明确为合成数据。本方法不授予专业权限,若要用于真实决策,必须另行满足适当来源、胜任能力、法律与审核要求。
核心方法
最终数据包应是封闭且可检查的证据对象。根清单要列出章程、来源登记表、已准入分发版本、模式、坐标操作、处理图、钻孔版本、视图状态、假设、主张、保留集记录、审核、限制、构建配方与内容摘要。每条路径都应为相对路径或可解析路径;每个生成制品都要标识输入;检查静态演示不应依赖秘密信息或变化中的端点。
可复现性有不同层级。打包资产可以追求位级一致;计算重复需要固定环境与确定性操作;科学复现要求证据与推理支持同一评价,并不一定产生完全相同的像元。应从干净目录验证数据包,并在可行时离线执行。既生成机器可读验证结果,也生成供人阅读的审计记录。静态演示只是数据包上的视图,不能替代数据包。
记录与证据模型
| 字段或对象 | 运行含义 | |---|---| | package_id、version 与 root_digest | 发布身份 | | manifest_entry | 路径、媒体类型、大小、摘要与作用 | | build_environment 与 recipe | 固定工具与有序操作 | | validation_result | 规则、对象、结果与证据 | | release_note 与 limitations | 范围、变化、失败与禁止用途 |
每条记录都携带版本、有效区间、来源或派生链接、质量状态与审核状态。缺失、未知、不适用和失败是不同状态,均不得静默表示为零或空字符串。
受控工作流
- 只组装已准入、许可明确且带版本的对象。
- 生成根清单与内容摘要。
- 固定模式、操作、环境与构建顺序。
- 从干净工作区重建并验证离线路径。
- 比较输出、检查差异并保留失败。
- 在同一版本下发布数据包、审计与静态视图。
每一步都记录为带声明输入、参数、输出与检查的活动。重新运行要么产生相同内容,要么形成有说明的差异;绝不能覆盖解释先前状态所需的证据。
合成案例详解
SYN-WB 1.0 发布包包含 48 个合成来源与派生对象。干净重建复现了全部矢量与表格摘要;一个栅格因重采样环境未固定而不同。发布被扣留,环境得到固定,随后构建 1.0-rc2,差异审计通过。最终静态视图无需网络即可打开,每张目标卡都能解析到包内证据、审核状态与限制。
该案例特意保持为可逐行检查的小规模数据。名称与数值都是虚构教学值,不能用来推断任何真实地点、权利、资源、危险或机构。
质量控制与失败模式
接受本课制品前运行六类关口:身份关口解析精确对象;空间关口确认坐标与范围有效性;语义关口保留单位、词汇与认识论类别;血缘关口暴露全部变换与依赖;质量关口记录通过、失败与未运行检查;审核关口把处置绑定到精确内容摘要。失败关口应作为证据保留,只阻断受影响用途,绝不能被改成有利数值或为简化显示而隐藏。
常见失败模式:
- 交付文件却没有根清单
- 依赖变化中的在线响应
- 把截图称为可复现数据包
- 因差异看起来很小而忽略构建差异
- 发布成功日志却丢弃验证失败
实践练习
在合成数据包的新副本上完成以下任务:
- 设计根清单模式。
- 区分位级、计算与科学可复现性。
- 执行一次干净环境数据包审计。
- 编写保留限制与失败检查的发布说明。
每个答案都要引用数据包对象 ID,同时展示失败与通过的检查,并说明若一项假设反转,哪项结论会变化。
完成制品与验证
交付一套自包含合成证据包、干净构建审计与静态演示。其中包含清单、精确输入身份、变换或推理记录、机器可读验证结果、供人阅读的限制及当前审核状态。第二位读者必须能够把一项接受结论追溯到来源支持,把一条拒绝路径追溯到首个失败关口,并把一个未知项追溯到解决它所需的证据。从干净位置重建制品并比较内容摘要。若必需来源、参数、许可或审核缺失,则保持未完成状态,不得虚构替代数据。
来源
- FAIR 指导原则, 关于数字对象可发现、可访问、可互操作与可复用的原则。
- PROV-O 来源追溯本体, 描述实体、活动、责任角色与派生关系的标准模型。
- DataCite 元数据模式, 用于识别与引用研究产出的现行元数据属性。