F1 · 出版卷 30
来源登记表与可访问性审计
公开、行业与研究来源、许可、版本与访问条件
学习目标与边界
- 把“公开、行业与研究来源、许可、版本与访问条件”解释为可审计证据问题。
- 区分来源观测、受控派生物、解释与决策状态。
- 应用身份、空间、语义、血缘、质量与审核检查。
- 产出一份带版本的来源登记表、可访问性日志与准入决策表。
本课属于通用、机构中立的教程,与任何公司或个人均无关系。案例中的标识、几何与数值均明确为合成数据。本方法不授予专业权限,若要用于真实决策,必须另行满足适当来源、胜任能力、法律与审核要求。
核心方法
来源登记表是证据控制记录,不是书签清单。每个候选来源都要有稳定的本地标识,并记录标题、负责来源的角色、版次或获取时刻、持久定位符、分发格式、时空覆盖、许可或访问条件、校验和,以及与早期版本或派生版本的关系。“公众可访问”并不等于可无限制复用、现行、权威或适合当前问题。
来源发现与证据准入必须分开审计。发现阶段记录可能存在什么,准入阶段决定什么可以支持特定主张。某来源可以作为背景,却因比例尺、血缘或有效性不明而不能用于测量。访问失败本身也是证据:保留尝试过的定位符、响应状态与日期,不要静默换源。只有在条件允许时才缓存,并保留足够元数据以区分不可变快照与持续变化的服务响应。
记录与证据模型
| 字段或对象 | 运行含义 | |---|---| | source_id 与 version_id | 概念来源及精确版次身份 | | locator 与 retrieved_at | 分发版本的获取位置与时间 | | licence 与 access_state | 复用条件和实测可访问性 | | coverage 与 resolution | 有效空间、时间、比例尺与支撑尺度 | | digest 与 lineage | 内容身份与派生家族 |
每条记录都携带版本、有效区间、来源或派生链接、质量状态与审核状态。缺失、未知、不适用和失败是不同状态,均不得静默表示为零或空字符串。
受控工作流
- 把每个章程问题转成来源需求。
- 检索目录与来源页面,同时记录失败检索。
- 解析概念数据集、版次与分发版本的身份。
- 记录许可、访问、覆盖、格式、分辨率与校验和。
- 计算证据数量前按血缘归组镜像与派生物。
- 对每个来源作准入、有条件准入或拒绝处置并说明理由。
每一步都记录为带声明输入、参数、输出与检查的活动。重新运行要么产生相同内容,要么形成有说明的差异;绝不能覆盖解释先前状态所需的证据。
合成案例详解
SYN-WB 登记十二个虚构候选:四个不可变文件、两个变化中的服务响应、两份报告、两个派生栅格和两个不可访问引用。血缘审核发现一份报告和两个栅格均源于同一地图汇编。它们仍是有用对象,但只能计为一个证据家族。一个文件虽然可读,却因比例尺未说明而不能用于测量;另一个不可访问引用继续保留在登记表中,状态为“未核验”。
该案例特意保持为可逐行检查的小规模数据。名称与数值都是虚构教学值,不能用来推断任何真实地点、权利、资源、危险或机构。
质量控制与失败模式
接受本课制品前运行六类关口:身份关口解析精确对象;空间关口确认坐标与范围有效性;语义关口保留单位、词汇与认识论类别;血缘关口暴露全部变换与依赖;质量关口记录通过、失败与未运行检查;审核关口把处置绑定到精确内容摘要。失败关口应作为证据保留,只阻断受影响用途,绝不能被改成有利数值或为简化显示而隐藏。
常见失败模式:
- 把搜索结果直接当作准入证据
- 假定开放访问允许所有复用
- 把镜像算成独立支持
- 省略访问失败记录
- 只引用入口页而不识别精确分发版本
实践练习
在合成数据包的新副本上完成以下任务:
- 建立十二行合成来源登记表。
- 区分数据集、版次与分发标识。
- 分配准入状态与血缘组。
- 说明如何让变化中的端点可复现。
每个答案都要引用数据包对象 ID,同时展示失败与通过的检查,并说明若一项假设反转,哪项结论会变化。
完成制品与验证
交付一份带版本的来源登记表、可访问性日志与准入决策表。其中包含清单、精确输入身份、变换或推理记录、机器可读验证结果、供人阅读的限制及当前审核状态。第二位读者必须能够把一项接受结论追溯到来源支持,把一条拒绝路径追溯到首个失败关口,并把一个未知项追溯到解决它所需的证据。从干净位置重建制品并比较内容摘要。若必需来源、参数、许可或审核缺失,则保持未完成状态,不得虚构替代数据。
来源
- 数据目录词汇第 3 版, 用于互操作目录、数据集、分发版本与数据服务的词汇。
- DataCite 元数据模式, 用于识别与引用研究产出的现行元数据属性。
- FAIR 指导原则, 关于数字对象可发现、可访问、可互操作与可复用的原则。