第 8 章 随机化实验中 Fisher 推断与 Neyman 推断的统一

第 3–7 章分别在不同实验里谈过 Fisher 路径与 Neyman 路径。Fisher 关心的是:尖锐(强)原假设——没有任何一个单元有因果效应——下有限样本精确的 \(p\) 值;Neyman 关心的是:平均因果效应的无偏估计,以及保守的大样本置信区间。两者都站在实验设计所保证的物理随机化之上,因此都叫基于随机化的推断,或基于设计的推断。又因为它们谈的是实验里那群有限的单元,也叫有限总体推断。它们相关,却也各有脾气。

1935 年,Neyman 把一篇关于随机化推断的奠基论文提交给皇家统计学会。讨论会上,Fisher 对 Neyman (1935) 发了很重的火。Sabbaghi and Rubin (2014) 回顾过这场著名的 Neyman–Fisher 争论,并为这个老问题补了新结果。本章不去深挖哲学,只试着把两边放在同一张桌子上,慢慢说清楚。

8.1 CRE 中检验强原假设与弱原假设

再回到处理–对照的 CRE。Fisher 路径聚焦于检验强原假设

\[ H_{0\mathrm{f}}:\ Y_i(1)=Y_i(0)\quad\text{对所有单元 }i=1,\ldots,n. \]

FRT 给出 (3.2) 里那个有限样本精确的 \(p_{\mathrm{frt}}\)

由置信区间与假设检验的对偶,Neyman 路径给出弱原假设的检验

\[ H_{0\mathrm{n}}:\ \tau=0 \quad\Longleftrightarrow\quad H_{0\mathrm{n}}:\ \bar Y(1)=\bar Y(0), \]

所用统计量是

\[ t=\frac{\hat\tau}{\sqrt{\hat V}}. \]

\(\hat\tau\) 的 CLT,以及方差估计的保守性,

\[ t = \sqrt{\frac{\operatorname{var}(\hat\tau)}{\hat V}} \times \frac{\hat\tau}{\sqrt{\operatorname{var}(\hat\tau)}} \to C\times\mathcal{N}(0,1) \quad\text{依分布}, \]

其中 \(C\le 1\),且依赖于未知的潜在结果。用 \(\mathcal{N}(0,1)\) 的分位数去卡学生化统计量 \(t\),便得到对 \(H_{0\mathrm{n}}\) 的保守大样本检验。

Ding and Dasgupta (2017) 进一步说明:用学生化统计量 \(t\) 做 FRT,有双重保证:

  1. \(H_{0\mathrm{f}}\) 下,\(p_{\mathrm{frt}}\) 有限样本精确;
  2. \(H_{0\mathrm{n}}\) 下,\(p_{\mathrm{frt}}\) 渐近保守。

这是 \(t\) 这个学生化统计量的特性。他们也指出:换成别的检验统计量,双重保证未必还在。尤其是,用 \(\hat\tau\) 做 FRT,在 \(H_{0\mathrm{n}}\) 下甚至可能渐近反保守。下面用一点直觉,说明学生化为什么要紧。

\(H_{0\mathrm{n}}\) 下,

\[ \hat\tau \ \cdot\sim\ \mathcal{N}\!\left( 0,\ \frac{S^2(1)}{n_1}+\frac{S^2(0)}{n_0}-\frac{S^2(\tau)}{n} \right). \]

FRT 却假装科学表是 \(H_{0\mathrm{f}}\) 诱导的 \((Y_i,Y_i)_{i=1}^n\),于是 \(\hat\tau\) 的随机化分布是

\[ (\hat\tau)^\pi \ \cdot\sim\ \mathcal{N}\!\left( 0,\ \frac{s^2}{n_1}+\frac{s^2}{n_0} \right), \]

其中 \((\cdot)^\pi\) 表示随机化分布,1\(s^2\) 是观测结果的样本方差。由第 3 章的 (3.7),可把 \(H_{0\mathrm{f}}\)\((\hat\tau)^\pi\) 的渐近方差近似为

\[ \frac{s^2}{n_1}+\frac{s^2}{n_0} \approx \frac{\hat S^2(1)}{n_0}+\frac{\hat S^2(0)}{n_1} \approx \frac{S^2(1)}{n_0}+\frac{S^2(0)}{n_1}, \]

它与 \(\hat\tau\) 真正的渐近方差对不上。理想情形下,我们本该按 \(H_{0\mathrm{n}}\)\(\hat\tau\) 的真实分布去算 \(p\) 值——可那分布依赖未知潜在结果。FRT 用的却是置换分布 \((\hat\tau)^\pi\),即便样本量很大,它也配不上 \(H_{0\mathrm{n}}\)\(\hat\tau\) 的真实分布。因此,用 \(\hat\tau\) 做 FRT,即使大样本,也可能控制不住 \(H_{0\mathrm{n}}\) 下的第一类错误。

幸运的是,把检验统计量换成学生化的 \(t\),这件不愉快的事就会散开。在 \(H_{0\mathrm{n}}\) 下,

\[ t\ \cdot\sim\ \mathcal{N}(0,C^2), \]

其中 \(C^2\le 1\),等号当且仅当对所有单元都有 \(Y_i(1)-Y_i(0)=\tau\)。FRT 假装 \(Y_i(1)=Y_i(0)=Y_i\),生成的置换分布是

\[ t^\pi\ \cdot\sim\ \mathcal{N}(0,1); \]

方差为 \(1\),是因为 FRT 所用的科学表里,个体因果效应全是零。在 \(H_{0\mathrm{n}}\) 下,\(t\) 的真实分布比相应的置换分布更散,于是基于 \(t\)\(p_{\mathrm{frt}}\) 渐近保守。

8.2 CRE 中协变量调整的 FRT

把 8.1 节的讨论推广到有协变量的情形,Zhao and Ding (2021a) 建议用学生化的 Lin (2013) 估计量做 FRT:

\[ t_L=\frac{\hat\tau_L}{\sqrt{\hat V_L}}, \]

也就是把 \(Y_i\)\((1,Z_i,X_i,Z_i X_i)\) 做 OLS 时,\(Z_i\) 系数的稳健 \(t\) 统计量。他们证明,用 \(t_L\) 做 FRT 有多重保证:

  1. \(H_{0\mathrm{f}}\) 下,\(p_{\mathrm{frt}}\) 有限样本精确;
  2. \(H_{0\mathrm{n}}\) 下,\(p_{\mathrm{frt}}\) 渐近保守;
  3. \(H_{0\mathrm{n}}\) 不成立、且协变量能预测结果时,\(p_{\mathrm{frt}}\) 渐近上比用 \(t\) 的 FRT 更强大;
  4. 即便线性结果模型设定错误,以上性质仍然成立。

这同样是学生化统计量 \(t_L\) 的特性。Zhao and Ding (2021a) 指出:6.2.1 节回顾的其他协变量调整 FRT,在 \(H_{0\mathrm{n}}\) 下可能反保守,或在 \(H_{0\mathrm{n}}\) 不成立时不如用 \(t_L\) 的 FRT 强大。

8.3 一项模拟研究

现在用模拟看看:弱原假设下,这些 \(p_{\mathrm{frt}}\) 在有限样本里表现如何。我用下面十二个检验统计量。

  1. 前三个来自 Neyman (1923) 的 OLS 实现:处理系数、基于经典标准误的 \(t\)、基于 EHW 标准误的 \(t\)
  2. 接下来三个基于定义 6.2 的伪结果策略(Rosenbaum, 2002a 所倡导):先把 \(Y_i\)\((1,X_i)\) 回归做残差化,再像上面那样构造三个统计量。
  3. 再接下来三个基于 Fisher (1925) 的 OLS 实现(见第 6.2.2 节)。
  4. 最后三个基于 Lin (2013) 的 OLS 实现(亦见第 6.2.2 节)。

考虑 \(n=100\) 的有限总体,CRE 的组大小为 \((n_1,n_0)=(20,80)\)。对每个 \(i\),从 \(\mathrm{Unif}(-1,1)\) 抽一维协变量 \(X_i\),潜在结果为 \(Y_i(1)\sim\mathcal{N}(X_i^3,1)\)\(Y_i(0)\sim\mathcal{N}(-X_i^3,0.5^2)\)。再把 \(Y_i(1)\)\(Y_i(0)\) 中心化,保证 \(\tau=0\)。模拟中固定 \(\{Y_i(1),Y_i(0),X_i\}_{i=1}^n\)。每次随机置换 \(n_1\)\(1\)\(n_0\)\(0\),得到观测结果并做 FRT。重复 500 次;每次复制里,用处理向量的 500 次独立置换来近似 \(p\) 值。

原书图 8.1 展示了弱原假设下的 \(p\) 值。只有最后一行那四个稳健 \(t\) 统计量,保住了正确的第一类错误率——而且偏保守,与理论相符。其余八个统计量的第一类错误率都高于名义水平,因而不适合用来检验弱原假设。

8.4 一般建议

若强、弱原假设都关心,SRE 的建议与 CRE 平行。回想第 5 章与 6.2.4 节的估计量。没有额外协变量时,Zhao and Ding (2021a) 建议用

\[ t_S=\frac{\hat\tau_S}{\sqrt{\hat V_S}} \]

做 FRT;有额外协变量时,建议用

\[ t_{L,S}=\frac{\hat\tau_{L,S}}{\sqrt{\hat V_{L,S}}}. \]

ReM 的分析更绕一些。Zhao and Ding (2021a) 表明:用 \(t\) 做 FRT,没有 8.1 节的双重保证;用 \(t_L\) 做 FRT,却仍有 8.2 节的那些保证。这提醒我们:在 ReM 里,协变量调整与学生化,两样都要紧。

MPE 也有类似结果。没有协变量时,建议用「把 \(\hat\tau_i\)\(1\) 做 OLS」时截距的 \(t\) 统计量做 FRT;有协变量时,建议用「把 \(\hat\tau_i\)\(1\)\(\hat\tau_{X,i}\) 做 OLS」时截距的 \(t\) 统计量。第 7 章图 7.2,依据的就是这些被推荐的 FRT。

总的来说,带学生化统计量的 FRT 是更安全的选择。当学生化统计量的大样本正态近似够准时,\(p_{\mathrm{frt}}\) 几乎就是基于正态近似的 \(p\) 值;当大样本近似不准时,FRT 至少保证:在强原假设下,\(p\) 值仍然有效。这是本书的建议。

8.5 一个案例

回想第 5.4.2 节分析过的 Chong et al. (2016) 的 SRE。我比较「足球运动员」臂与对照臂,以及「医生」臂与对照臂;也比较用不用基线贫血这一协变量。用他们的数据,同时演示 CRE 与 SRE 下的 FRT:同一班级内的十组子组分析,用 CRE 的 \(t\)\(t_L\);对所有班级取平均的两次总体分析,用 SRE 的 \(t_S\)\(t_{L,S}\)

表 8.1 给出点估计、标准误、稳健 \(t\) 的正态近似 \(p\) 值,以及 FRT 的 \(p\) 值。「N」对应 Neyman (1923) 的未调整估计与检验,「L」对应 Lin (2013) 的协变量调整估计与检验。

多数层里,协变量调整会减小标准误——基线贫血能预测结果。也有两处例外:班级 2 比较「足球」与对照、班级 4 比较「医生」与对照时,调整后标准误反而略升。这是因为这些层内人数很少,渐近近似不准。不过两处差别只在小数点后第三位。正态近似与 FRT 的 \(p\) 值大多接近,后者往往稍大一点。按理论,更该信任 FRT 的 \(p\) 值——它额外保证了尖锐原假设下的有限样本精确。这个例子里层内人数很少,这份保证就显得格外珍贵。

原书图 8.2 把稳健 \(t\) 的随机化分布直方图,与渐近近似对照。子组分析里,随机化分布与 \(\mathcal{N}(0,1)\) 看得出偏差;对所有班级取平均后,偏差几乎看不见。整体上,这个应用里两种 \(p\) 值相差不大,结论也一致:医生讲述补铁好处的视频,改善了学业表现,效应在班级 3 最显著;著名足球运动员讲述同样好处的视频,则没有任何显著效应。

表 8.1 再分析 Chong et al. (2016) 的数据。

(a) 足球运动员 vs 对照

估计 标准误 \(p_{\mathrm{Normal}}\) \(p_{\mathrm{frt}}\)
班级 1 N 0.051 0.502 0.919 0.924
L 0.050 0.489 0.919 0.929
班级 2 N \(-0.158\) 0.451 0.726 0.722
L \(-0.176\) 0.452 0.698 0.700
班级 3 N 0.005 0.403 0.990 0.989
L \(-0.096\) 0.385 0.803 0.806
班级 4 N \(-0.492\) 0.447 0.271 0.288
L \(-0.511\) 0.447 0.253 0.283
班级 5 N 0.390 0.369 0.291 0.314
L 0.443 0.318 0.164 0.186
全体 N \(-0.051\) 0.204 0.802 0.800
L \(-0.074\) 0.200 0.712 0.712

(b) 医生 vs 对照

估计 标准误 \(p_{\mathrm{Normal}}\) \(p_{\mathrm{frt}}\)
班级 1 N 0.567 0.426 0.183 0.192
L 0.588 0.418 0.160 0.174
班级 2 N 0.193 0.438 0.659 0.666
L 0.265 0.409 0.517 0.523
班级 3 N 1.305 0.494 0.008 0.012
L 1.501 0.462 0.001 0.003
班级 4 N \(-0.273\) 0.413 0.508 0.515
L \(-0.313\) 0.417 0.454 0.462
班级 5 N \(-0.050\) 0.379 0.895 0.912
L \(-0.067\) 0.279 0.811 0.816
全体 N 0.406 0.202 0.045 0.047
L 0.463 0.190 0.015 0.017

8.6 习题

8.1 再分析 Angrist and Lavy (2009) 的数据
这是习题 7.8 的 Fisher 对应。请报告用学生化统计量做 FRT 得到的 \(p_{\mathrm{frt}}\)

8.2 复现 Zhao and Ding (2021a) 的图 1
他们用模拟评估各种检验统计量下 \(p_{\mathrm{frt}}\) 的有限样本性质,并据此建议用 \(t_{L,S}\) 的 FRT 分析 SRE。请复现他们的图 1。

8.3 推荐阅读
在置换检验里用学生化统计量,并不是新想法;见 Janssen (1997) 与 Chung and Romano (2013)。在基于设计的框架下,Ding and Dasgupta (2017)、Wu and Ding (2021) 把这一建议推广到多臂实验,Zhao and Ding (2021a) 又推广到协变量调整。


  1. \(\pi\) 是随机置换的常用记号。↩︎