C3 · 出版卷 13

Detection Limit 与 Censored Data

Below detection、upper limit、substitution risks

学习目标

读者应能区分 detection capability、reporting limit、quantification range 与 upper range;把 laboratory qualifier 与 numeric field 分开保存;识别 left-、right- 和 interval-censored observation;解释用固定比例替换所有 below-limit result 如何扭曲 distribution 与 ratio;并根据问题、censoring fraction 和 data-generating process 选择处理方法。

Censored result 不是等于打印限、零或半限的 measured concentration。“小于 0.5 mg/kg”只表示该 method 与 batch 在规定边界以上没有报告可靠数值,不证明元素不存在,也不表示其他 sample 或 method 使用相同 limit。

Limit、Capability 与 Qualifier

Detection capability 讨论在规定错误概率下能否把 signal 与 blank/noise 区分;reporting limit 是报告系统数值化的边界,可能包含额外性能或政策条件;quantification boundary 关注数值 uncertainty 是否可接受。这些术语不能暗中互换。

Limit 属于 method、matrix、preparation mass、dilution 与 batch。为使某元素降到 upper range 内而稀释,常会提高其他元素的 lower limit;sample-specific interference 也会改变 effective limit。因此每条 result 应保存 limit,而不是一列共用未记录常数。

结构化记录至少包括:若有则保存 numeric result;less-than、greater-than 或 interval qualifier;适用的 lower/upper bound;unit;method;dilution;batch;original text。Display string 应从这些字段生成,把它解析成假数会破坏信息。

Left、Right 与 Interval Censoring

Left-censoring 表示 true value 只知低于边界;right-censoring 表示高于 upper reporting/calibration range;interval-censoring 表示位于两界之间。Procedural missing 不是 censoring;not analysed、insufficient sample、interference 与 lost sample 必须有不同 reason code。

Detection Limit 与 upper range 形成区间,这些区间必须贯穿分析与解释
Detection Limit 与 upper range 形成区间,这些区间必须贯穿分析与解释

Right-censored high value 在勘查中尤其关键。全部以 upper limit 替代会压平 Anomaly amplitude 和 ratio。Validated dilution 可解析区间,但 original result 仍留在 lineage 中;无法 reanalysis 时,ranking 应承认 tie 或 bound,而不能虚构顺序。

多个 limit 会形成阶梯状分布。合并不同 campaign、dilution 或 method 后,同一 true range 受到不同 censoring。统计前要按 element、method、batch、domain 与 time 分析 censoring。高 limit 的空间聚集可伪装成低值区,因为弱信号在那里无法报告。

简单 Substitution 为何失效

用 zero、half-limit、limit 除以常数或 limit 本身替换,只能作为显式的 bounded sensitivity scenario,不能冒充 measurement model。Fixed substitution 会制造堆积,改变 mean 与 variance,在共享 limit 的元素间诱发 correlation,并使 log-ratio 无定义或系统偏移。

Bias 取决于 limit 以下未知分布与 censoring fraction。若只有少量低值 censored,且 decision 关注强 Anomaly,合理 substitution 可能不改变结论,但必须以 sensitivity analysis 证明。若 censoring 严重,替换会支配结果;应考虑更灵敏 method、其他 element、presence grouping 或显式 censoring model。

不能在 mapping 前删除 censored row,否则 partial information 会变成 apparent unsampled。地图应区分 quantified、censored、missing 与 failed。Ratio 只有在 numerator 与 denominator 的 bound 足够时才可推导 interval,否则标为 indeterminate。

可辩护的分析处理

从问题开始。Detection frequency 使用 qualifier count 并处理不同 limit;median 或 quantile 可在目标分位可识别时采用 interval method;distribution modelling 用显式 censoring likelihood 拟合合理的 positive distribution,并分 domain 检查;multivariate work 应使用适合 censored compositional data 的方法,或只解释观测充分的元素。

Bounded analysis 往往比复杂模型清楚。Left-censored value 的 lower scenario 可用 zero 或科学合理 lower bound,upper scenario 用 reporting limit。若两端 action 相同,decision 对精确数值稳健;若 action 改变,censoring 就是 decision-critical,应提高 measurement 或扩大 uncertainty statement。

不能假定 below-limit value 均匀分布,也不能在 geological domain、method 与 limit 混合时直接拟合一个分布。记录 model family、parameter estimation、simulation random seed 和 original qualified data。Derived value 是 model output,不是找回的 observation。

合成计算案例

六个合成 X 结果为 <2<2、3、5、8、12 mg/kg。Exact mean 不可识别。若浓度非负,lower-bound mean 为:

$\bar{x}_{L}=\frac{0+0+3+5+8+12}{6}=4.67\ \mathrm{mg/kg},$

以接近 2 的值作为 upper bound,则:

$\bar{x}_{U}=\frac{2+2+3+5+8+12}{6}=5.33\ \mathrm{mg/kg}.$

若 screening action 只在 mean 超过 6 mg/kg 时改变,则整个可行区间内 action 不变,无需制造一个“最佳”替换 mean;若阈值为 5 mg/kg,结论就是 indeterminate,需更灵敏 test 或可辩护 distribution model。

若 ratio X/YX<2Y=4 mg/kg,则在非负假设下 ratio 位于 [0,0.5)。以 half-limit 得到 0.25 是 false precision。若 X 与 Y 都 left-censored,denominator 可趋近零,ratio 甚至没有有限上界。

Censoring 审计流程

  1. 保留 original text、numeric field、qualifier 与 bound。
  2. 按 method、batch、dilution、matrix、domain 与 time 分析 limit。
  3. 分开 censored observation、procedural missing 与 failure。
  4. 显式绘制 quantified、censored、missing 与 failed location。
  5. 写明需要处理的 statistic 或 decision。
  6. 在拟合模型前测试 lower/upper scenario。
  7. 仅在假设可辩护且可检查时使用 censor-aware model。
  8. 把 substitution/imputation 保存为 versioned model output。
  9. 方法允许时对关键 high/low interval 做 reanalysis。
  10. 报告 censoring 是否改变 interpretation 或 action。

练习与复核

  1. <1、2、4、<5、9 mg/kg 计算 mean bounds,并注意两个 limit 不同。
  2. 解释删除 below-limit sample 的地图为何会被误当成 unsampled ground。
  3. 为位于 possible mean interval 内的 threshold 设计 sensitivity analysis。
  4. 说明 half-limit substitution 如何在共享 batch limit 的元素间制造 false association。
  5. 写出保存 greater-than result 及后续 dilution reanalysis 所需字段。

复核问题:censored value 究竟已知什么?Limit 是否恒定?Missing 是 procedural 还是 analytical?处理方法是否改变 decision?新 measurement 能否解析关键 interval?

来源与延伸阅读