ICH Q2 (R1) 中将准确度、精密度作为两项相互独立的验证指标,二者分开评判。而 Q2 (R2) 新增了准确度‑精密度合并评价模式,允许对照一套综合性能标准开展判定。
现实工作里,有些方法几乎无偏差但重复性波动大,也有些偏差略大但精密度表现优异;在旧版框架下两类方法都容易卡在限度边缘,但二者用于质量决策时,整体可靠性可能相当。
3.3.3 节正是为这类场景提供合规出路。培训模块 2 的 Part C、Part D 分别讲解合并评价实操,以及如何科学设定对应的性能接受标准。
独立评价怎么报
合并路径之前,独立评价仍是默认项。Q2(R2)要求准确度和精密度各自预设接受标准,结果以点估计加100(1-α)%置信区间报告,观察到的区间应与对应的接受标准相容。
判定的对象是区间,不是点估计。这意味着样本量和置信水平在方案阶段就要定下来,它们直接决定区间宽度,也决定验证最后是”通过”还是”不确定”。
点估计(point estimate):用单个数值去估计总体真实参数。
在分析验证(准确度 / 精密度)场景:
- 准确度:平均回收率(均值),就是总体真实回收率的点估计;
- 精密度:样本标准偏差
SD,是总体真实 SD 的点估计
对比:
- ✅点估计:一个单一数字(例如回收率均值 = 98.7 %)
- ✅置信区间:一个数值范围(例如 95% CI:96.2 % ~ 101.2 %),代表总体真实参数有一定概率落在这个区间
按培训材料在模块3中进一步展开的判定逻辑,结果有三种结局:
- 点估计和置信区间都在接受标准内 → 通过;
- 点估计在标准内但区间超出标准 → 不确定,需补充评估后才可能判定相容;
- 点估计本身在标准外 → 失败。
合并评价的依据
合并路径的统计学依据是:系统性偏差的影响部分取决于随机测量误差。精密度高的方法可以容纳更大的偏差,反之亦然,两种组合可以达到相同的整体性能。
实验设计上,用于分开评价的经典DoE通常也适用于合并路径,一套设计同时覆盖准确度和精密度要素,需要时还能从同一数据集算出各自的单独结果。合并评价的结果报告为一个综合值;与证明适用性相关时,单独结果作为补充信息附上。
模块2用一对方法说明了合并视角的必要性。
– 方法A和方法B可能都满足各自的单独接受标准,但把n=9的均值对标准偏差作图,两者的散布形态不同,A的变异和偏差都更大。只看”是否分别达标”会丢掉这个信息,合并评价把它变成判定本身。
多变量方法另有一个现成的合并指标:RMSEP(均方根预测误差)本身就同时包含准确度和精密度的信息,NIR等方法的验证可直接沿用这个惯例。
判定工具
第一种工具是概率陈述
– 例如要求”结果以≥95%的概率落在目标值±允许距离内”。用验证数据的均值和标准偏差定位,落在接受区域内,方法才能作这个宣称。
第二种工具是区间。
– Q2(R2)点名了预测区间、容许区间、置信区间三种。模块2用联合置信区间演示了一个边缘情形:方法C的点估计看似不错,但其90%置信区间未能完全落入接受区域,验证数据不足以90%的置信度支撑”95%的结果落在允许距离内”。有充分先验数据时,经论证还可以用贝叶斯可信区间。
合并标准和独立标准,接受空间不同
模块2用等高线图对比了两种标准的接受空间(培训材料明确注明数值仅为示意)。
独立标准是”偏差±限度、变异≤限度”的矩形;
合并标准是围绕目标的概率等高线。
两者不重合:矩形上角(高变异加极限偏差)处,结果落在±3允差内的概率只有约50%;
合并标准下,偏差±1、变异≤1.2%的组合仍有≥95%的概率达标。
合并标准对偏角更严格,对均衡更宽容。
预测区间的五个情景更贴近日常判定,前提是预测区间整体落在目标±阈值内:
| 情景 | 相对偏差 | 变异性 | 判定 |
|---|---|---|---|
| i | 低 | 低 | 通过 |
| ii | 中 | 低 | 通过(区间不含零偏差无妨) |
| iii | 高 | 低 | 不确定:上限超标,评估风险或改进偏差 |
| iv | 低 | 中 | 通过:低偏差容纳了较宽区间 |
| v | 低 | 高 | 不确定:两端均超标,需改进变异性 |
情景iv能看出合并评价的用处:按分开标准它可能卡在精密度上,按合并标准则整体适用。“不确定”也有后续动作的指引——按企业药品质量体系(PQS)要求评估风险、决定是否接受,或者改进方法后重新确认。踩线不再是一次性的失败,而是可以管理和论证的中间状态。
性能标准怎么定
Q2(R2)刻意不给统一接受标准。模块2 Part D列出了设定标准时的考虑:
- 标准取决于具体的分析物、基质、浓度和技术,并应与质量目标产品概况(QTPP)的期望一致;
- 可基于先验知识和性能期望共同设定;
- 可考虑允许误差的视角,尤其针对拟写入ATP的标准;
- 应考虑质量标准接受标准的要求;
- 针对稳定性研究,方法须足够准确和精密,能在递交时有限的数据中揭示相关变化。
最后一条容易被忽略:稳定性方案的统计功效,实际上由方法的精密度决定。标准定得过松,稳定性数据里真实的变化就可能埋在方法的噪声里。
还有一层申报上的连带关系:写进ATP的性能标准会成为既定条件的候选内容,批准后变更就要按既定条件的规则管理。定标准时不只影响这一次验证,也在给生命周期的变更管理定边界。
参考文献
ICH Q2(R2), Validation of Analytical Procedures, 第3.3节
ICH Q2(R2)/Q14 Training Module 2, Part C(合并评价)与Part D(性能标准设定)





