监管标准解读 · 2026年9月2日

ICH Q2(R2)专题解读 | 验证数据置信区间的计算、判定与案例

验证报告里常见这样的写法:“平均回收率99.5%,RSD 0.43%,符合接受标准。”

数字很漂亮,但它只回答了”这批实验测到了什么”,没有回答”真值大概在什么范围”。审评时真正被追问的往往是后者。

Q2(R2)在准确度(3.3.1.4节)和精密度(3.3.2.4节)的推荐数据要求中专门澄清了置信区间的使用,培训模块3用了近三十页展开这个话题。本文把计算方式、判定标准和两个完整案例整理出来。

R2澄清了什么

R2的要求可以概括成一句话:用区间而不只是点估计来判定准确度和精密度。点估计(均值、标准差)是手头这个样本算出来的一个数,换一批数据它就会变。

> 置信区间给出的是一个范围,并标明置信系数(1−α):α=0.05对应95%置信区间,α=0.1对应90%置信区间。

有一个前提要先交代:模块3的算例都假设数据近似正态分布。非正态的数据通常可以转换,生物测定就常用对数转换,代价是要改用几何均值和几何CV这套口径。更复杂的多因素设计,则用方差组分分析及相应的置信区间。

计算方式

精密度的算法是标准差的单侧置信上限。 对来自正态总体的n个独立观测,单侧100(1−α)%置信上限为:

UCL = s × √[(n−1) / χ²(α, n−1)]

其中s是样本标准差,χ²(α, n−1)是自由度n−1的卡方分布临界值。

> 验证关心的是”精密度最坏会差到哪里”,所以取单侧上限,而不是双侧区间。

相对标准偏差(RSD)的近似做法很直接:把标准差的置信上限除以均值;精确做法要用非中心t分布。如果目标浓度已知,也可以直接除以目标浓度。

准确度的算法是均值的置信区间:

x̄ ± t(α, n−1) × s/√n

这里有一个容易被忽略的细节:两个单侧100(1−α)%置信限,合起来等价于双侧100(1−2α)%置信区间。换句话说,报告一个双侧90%置信区间时,t值应取α=0.05那一档,而不是0.10。

区间宽度由两个因素决定:n和α。 n越大,区间越窄;α越大(置信水平越低),区间也越窄。想要窄区间又不想放低置信水平,唯一的路是增加样本量。这就是为什么模块3把样本量计算放在验证设计里,用公式算出来,而不是凭惯例定一个”做6份”。

贝叶斯可信区间是模块3给出的替代路径。

先选一个先验分布并论证其合理性(无论信息量高低),再用贝叶斯定理把先验与验证数据合并为后验分布,从后验分布算可信区间。

先验可以来自方法开发、确认研究、稳定性数据、临床批放行或平台知识。信息性先验能收窄区间——模块3的示意图里,同一个验证数据集,配相对无信息先验时结论是”不确定”,换成信息性先验后转为”通过”。

可接受标准:三种判定结果

判定逻辑不是”均值过线就算过”,而是看点估计和区间的相对位置:

  • 点估计和置信区间都在接受标准内 → 通过
  • 点估计在标准内,但置信区间超出标准 → 不确定(inconclusive);
  • 点估计已在标准之外 → 不通过

落入”不确定”并不等于判死刑。模块3列出五条出路:

– 纳入尚未使用的先验知识;
– 补做实验数据、用新数据集重新评估(具体做法必须在补数据之前书面论证其适用性和统计有效性);
– 调整重复测定次数以收窄区间;
– 综合考虑准确度与精密度的联合影响;
– 或者论证接受残余风险。

案例一:小分子片剂含量测定

方法用于测定片剂中原料药含量,标示量1000 mg,验证范围900–1100 mg(90%–110%标示量)。接受标准:中间精密度SD不大于1.5%标示量(15 mg),偏倚不大于3.0%标示量(30 mg)。这些标准不是凭空定的,依据的是类似产品和方法的先验知识,以及该产品在预期变异下可接受的OOS率。

样本量是算出来的。精密度验证(对方差建置信区间)的输入为:要求SD 1.5、预期SD 0.7(先验知识)、α=0.05、β=0.2,求满足条件的最小n,得n=8。这里的I类错误是”明明不兼容却判定兼容”,II类错误是”明明兼容却判定不兼容”。

结果

8个可报告结果的SD为0.429%标示量。查卡方分布,χ²(0.05, 7)=2.167,代入公式得95%置信上限 = 0.429 × √(7/2.167) = 0.77%标示量,小于1.5%的标准,精密度通过。准确度方面,9个测定结果(分三组)的平均回收率为99.5%,偏倚估计−0.50%;偏倚的双侧95%置信区间为−1.3%至0.3%,落在−3%至+3%的标准内,通过。

这个例子两项都是”点估计和区间双双在标准内”,属于干脆的通过。假如点估计仍达标、但区间上限顶到标准之外,就落入”不确定”,要回头走那五条出路。

案例二:生物测定,先做对数转换

生物测定的规格往往不对称:相对效价规格为0.75至1.33,上下限互为倒数。取自然对数后变成−0.29至+0.29,关于0对称,统计假设才立得住。接受标准按USP <1033>的口径计算:相对偏倚%RB不大于12%(下限按同样的倒数关系折算为−11%),中间精密度%IP不大于20%。换算到对数尺度,即%RB的90%置信区间须落在(−0.1133, 0.1133)内,%IP的单侧95%置信上限不超过0.1823。

样本量同样由计算得出:假定真实%RB为1%、%IP为10%、检验效能80%,准确度要求每水平n≥9,精密度要求每水平n≥3,取n=9。试验设计为3×3析因(3名分析员×3批培养基),覆盖5个稀释水平(0.5、0.71、1、1.41、2)。

结果

各水平%RB在−1.9%至4.0%之间,90%置信区间全部落在(−11%, 12%)内,准确度通过。中间精密度按跨水平合并计算:合并SD(对数尺度)0.090,单侧95%置信上限0.110,换算回%GCV为9.4%、上限11.7%,小于20%的标准,通过。

个别水平单独的置信区间虽超出标准,但分析中验证了跨水平的一致性,因此以合并区间判定。这个案例顺带说明一件事:区间可以按水平分层计算(如每水平的准确度),也可以跨水平合并(如精密度),前提是方案里预先写清楚。

结语

置信区间改变的是结论的措辞方式。点估计说的是”这次是99.5%“,置信区间说的是”以95%的把握,真值落在这个范围内”。前者是一次实验的运气,后者才是可以拿给审评看的证据。

参考文献

ICH Q2(R2) Validation of Analytical Procedures

ICH Q2(R2)/Q14 Training Module 3

USP <1033> Biological Assay Validation(生物测定案例中相对偏倚与中间精密度的计算口径)