第 8 章 随机化实验中 Fisher 推断与 Neyman 推断的统一
第 3–7 章分别在不同实验里谈过 Fisher 路径与 Neyman 路径。Fisher 关心的是:尖锐(强)原假设——没有任何一个单元有因果效应——下有限样本精确的 \(p\) 值;Neyman 关心的是:平均因果效应的无偏估计,以及保守的大样本置信区间。两者都站在实验设计所保证的物理随机化之上,因此都叫基于随机化的推断,或基于设计的推断。又因为它们谈的是实验里那群有限的单元,也叫有限总体推断。它们相关,却也各有脾气。
1935 年,Neyman 把一篇关于随机化推断的奠基论文提交给皇家统计学会。讨论会上,Fisher 对 Neyman (1935) 发了很重的火。Sabbaghi and Rubin (2014) 回顾过这场著名的 Neyman–Fisher 争论,并为这个老问题补了新结果。本章不去深挖哲学,只试着把两边放在同一张桌子上,慢慢说清楚。
8.1 CRE 中检验强原假设与弱原假设
再回到处理–对照的 CRE。Fisher 路径聚焦于检验强原假设
\[ H_{0\mathrm{f}}:\ Y_i(1)=Y_i(0)\quad\text{对所有单元 }i=1,\ldots,n. \]
FRT 给出 (3.2) 里那个有限样本精确的 \(p_{\mathrm{frt}}\)。
由置信区间与假设检验的对偶,Neyman 路径给出弱原假设的检验
\[ H_{0\mathrm{n}}:\ \tau=0 \quad\Longleftrightarrow\quad H_{0\mathrm{n}}:\ \bar Y(1)=\bar Y(0), \]
所用统计量是
\[ t=\frac{\hat\tau}{\sqrt{\hat V}}. \]
由 \(\hat\tau\) 的 CLT,以及方差估计的保守性,
\[ t = \sqrt{\frac{\operatorname{var}(\hat\tau)}{\hat V}} \times \frac{\hat\tau}{\sqrt{\operatorname{var}(\hat\tau)}} \to C\times\mathcal{N}(0,1) \quad\text{依分布}, \]
其中 \(C\le 1\),且依赖于未知的潜在结果。用 \(\mathcal{N}(0,1)\) 的分位数去卡学生化统计量 \(t\),便得到对 \(H_{0\mathrm{n}}\) 的保守大样本检验。
Ding and Dasgupta (2017) 进一步说明:用学生化统计量 \(t\) 做 FRT,有双重保证:
- 在 \(H_{0\mathrm{f}}\) 下,\(p_{\mathrm{frt}}\) 有限样本精确;
- 在 \(H_{0\mathrm{n}}\) 下,\(p_{\mathrm{frt}}\) 渐近保守。
这是 \(t\) 这个学生化统计量的特性。他们也指出:换成别的检验统计量,双重保证未必还在。尤其是,用 \(\hat\tau\) 做 FRT,在 \(H_{0\mathrm{n}}\) 下甚至可能渐近反保守。下面用一点直觉,说明学生化为什么要紧。
在 \(H_{0\mathrm{n}}\) 下,
\[ \hat\tau \ \cdot\sim\ \mathcal{N}\!\left( 0,\ \frac{S^2(1)}{n_1}+\frac{S^2(0)}{n_0}-\frac{S^2(\tau)}{n} \right). \]
FRT 却假装科学表是 \(H_{0\mathrm{f}}\) 诱导的 \((Y_i,Y_i)_{i=1}^n\),于是 \(\hat\tau\) 的随机化分布是
\[ (\hat\tau)^\pi \ \cdot\sim\ \mathcal{N}\!\left( 0,\ \frac{s^2}{n_1}+\frac{s^2}{n_0} \right), \]
其中 \((\cdot)^\pi\) 表示随机化分布,1\(s^2\) 是观测结果的样本方差。由第 3 章的 (3.7),可把 \(H_{0\mathrm{f}}\) 下 \((\hat\tau)^\pi\) 的渐近方差近似为
\[ \frac{s^2}{n_1}+\frac{s^2}{n_0} \approx \frac{\hat S^2(1)}{n_0}+\frac{\hat S^2(0)}{n_1} \approx \frac{S^2(1)}{n_0}+\frac{S^2(0)}{n_1}, \]
它与 \(\hat\tau\) 真正的渐近方差对不上。理想情形下,我们本该按 \(H_{0\mathrm{n}}\) 下 \(\hat\tau\) 的真实分布去算 \(p\) 值——可那分布依赖未知潜在结果。FRT 用的却是置换分布 \((\hat\tau)^\pi\),即便样本量很大,它也配不上 \(H_{0\mathrm{n}}\) 下 \(\hat\tau\) 的真实分布。因此,用 \(\hat\tau\) 做 FRT,即使大样本,也可能控制不住 \(H_{0\mathrm{n}}\) 下的第一类错误。
幸运的是,把检验统计量换成学生化的 \(t\),这件不愉快的事就会散开。在 \(H_{0\mathrm{n}}\) 下,
\[ t\ \cdot\sim\ \mathcal{N}(0,C^2), \]
其中 \(C^2\le 1\),等号当且仅当对所有单元都有 \(Y_i(1)-Y_i(0)=\tau\)。FRT 假装 \(Y_i(1)=Y_i(0)=Y_i\),生成的置换分布是
\[ t^\pi\ \cdot\sim\ \mathcal{N}(0,1); \]
方差为 \(1\),是因为 FRT 所用的科学表里,个体因果效应全是零。在 \(H_{0\mathrm{n}}\) 下,\(t\) 的真实分布比相应的置换分布更散,于是基于 \(t\) 的 \(p_{\mathrm{frt}}\) 渐近保守。
8.2 CRE 中协变量调整的 FRT
把 8.1 节的讨论推广到有协变量的情形,Zhao and Ding (2021a) 建议用学生化的 Lin (2013) 估计量做 FRT:
\[ t_L=\frac{\hat\tau_L}{\sqrt{\hat V_L}}, \]
也就是把 \(Y_i\) 对 \((1,Z_i,X_i,Z_i X_i)\) 做 OLS 时,\(Z_i\) 系数的稳健 \(t\) 统计量。他们证明,用 \(t_L\) 做 FRT 有多重保证:
- 在 \(H_{0\mathrm{f}}\) 下,\(p_{\mathrm{frt}}\) 有限样本精确;
- 在 \(H_{0\mathrm{n}}\) 下,\(p_{\mathrm{frt}}\) 渐近保守;
- 当 \(H_{0\mathrm{n}}\) 不成立、且协变量能预测结果时,\(p_{\mathrm{frt}}\) 渐近上比用 \(t\) 的 FRT 更强大;
- 即便线性结果模型设定错误,以上性质仍然成立。
这同样是学生化统计量 \(t_L\) 的特性。Zhao and Ding (2021a) 指出:6.2.1 节回顾的其他协变量调整 FRT,在 \(H_{0\mathrm{n}}\) 下可能反保守,或在 \(H_{0\mathrm{n}}\) 不成立时不如用 \(t_L\) 的 FRT 强大。
8.3 一项模拟研究
现在用模拟看看:弱原假设下,这些 \(p_{\mathrm{frt}}\) 在有限样本里表现如何。我用下面十二个检验统计量。
- 前三个来自 Neyman (1923) 的 OLS 实现:处理系数、基于经典标准误的 \(t\)、基于 EHW 标准误的 \(t\)。
- 接下来三个基于定义 6.2 的伪结果策略(Rosenbaum, 2002a 所倡导):先把 \(Y_i\) 对 \((1,X_i)\) 回归做残差化,再像上面那样构造三个统计量。
- 再接下来三个基于 Fisher (1925) 的 OLS 实现(见第 6.2.2 节)。
- 最后三个基于 Lin (2013) 的 OLS 实现(亦见第 6.2.2 节)。
考虑 \(n=100\) 的有限总体,CRE 的组大小为 \((n_1,n_0)=(20,80)\)。对每个 \(i\),从 \(\mathrm{Unif}(-1,1)\) 抽一维协变量 \(X_i\),潜在结果为 \(Y_i(1)\sim\mathcal{N}(X_i^3,1)\)、\(Y_i(0)\sim\mathcal{N}(-X_i^3,0.5^2)\)。再把 \(Y_i(1)\) 与 \(Y_i(0)\) 中心化,保证 \(\tau=0\)。模拟中固定 \(\{Y_i(1),Y_i(0),X_i\}_{i=1}^n\)。每次随机置换 \(n_1\) 个 \(1\) 与 \(n_0\) 个 \(0\),得到观测结果并做 FRT。重复 500 次;每次复制里,用处理向量的 500 次独立置换来近似 \(p\) 值。
原书图 8.1 展示了弱原假设下的 \(p\) 值。只有最后一行那四个稳健 \(t\) 统计量,保住了正确的第一类错误率——而且偏保守,与理论相符。其余八个统计量的第一类错误率都高于名义水平,因而不适合用来检验弱原假设。
8.4 一般建议
若强、弱原假设都关心,SRE 的建议与 CRE 平行。回想第 5 章与 6.2.4 节的估计量。没有额外协变量时,Zhao and Ding (2021a) 建议用
\[ t_S=\frac{\hat\tau_S}{\sqrt{\hat V_S}} \]
做 FRT;有额外协变量时,建议用
\[ t_{L,S}=\frac{\hat\tau_{L,S}}{\sqrt{\hat V_{L,S}}}. \]
ReM 的分析更绕一些。Zhao and Ding (2021a) 表明:用 \(t\) 做 FRT,没有 8.1 节的双重保证;用 \(t_L\) 做 FRT,却仍有 8.2 节的那些保证。这提醒我们:在 ReM 里,协变量调整与学生化,两样都要紧。
MPE 也有类似结果。没有协变量时,建议用「把 \(\hat\tau_i\) 对 \(1\) 做 OLS」时截距的 \(t\) 统计量做 FRT;有协变量时,建议用「把 \(\hat\tau_i\) 对 \(1\) 与 \(\hat\tau_{X,i}\) 做 OLS」时截距的 \(t\) 统计量。第 7 章图 7.2,依据的就是这些被推荐的 FRT。
总的来说,带学生化统计量的 FRT 是更安全的选择。当学生化统计量的大样本正态近似够准时,\(p_{\mathrm{frt}}\) 几乎就是基于正态近似的 \(p\) 值;当大样本近似不准时,FRT 至少保证:在强原假设下,\(p\) 值仍然有效。这是本书的建议。
8.5 一个案例
回想第 5.4.2 节分析过的 Chong et al. (2016) 的 SRE。我比较「足球运动员」臂与对照臂,以及「医生」臂与对照臂;也比较用不用基线贫血这一协变量。用他们的数据,同时演示 CRE 与 SRE 下的 FRT:同一班级内的十组子组分析,用 CRE 的 \(t\) 与 \(t_L\);对所有班级取平均的两次总体分析,用 SRE 的 \(t_S\) 与 \(t_{L,S}\)。
表 8.1 给出点估计、标准误、稳健 \(t\) 的正态近似 \(p\) 值,以及 FRT 的 \(p\) 值。「N」对应 Neyman (1923) 的未调整估计与检验,「L」对应 Lin (2013) 的协变量调整估计与检验。
多数层里,协变量调整会减小标准误——基线贫血能预测结果。也有两处例外:班级 2 比较「足球」与对照、班级 4 比较「医生」与对照时,调整后标准误反而略升。这是因为这些层内人数很少,渐近近似不准。不过两处差别只在小数点后第三位。正态近似与 FRT 的 \(p\) 值大多接近,后者往往稍大一点。按理论,更该信任 FRT 的 \(p\) 值——它额外保证了尖锐原假设下的有限样本精确。这个例子里层内人数很少,这份保证就显得格外珍贵。
原书图 8.2 把稳健 \(t\) 的随机化分布直方图,与渐近近似对照。子组分析里,随机化分布与 \(\mathcal{N}(0,1)\) 看得出偏差;对所有班级取平均后,偏差几乎看不见。整体上,这个应用里两种 \(p\) 值相差不大,结论也一致:医生讲述补铁好处的视频,改善了学业表现,效应在班级 3 最显著;著名足球运动员讲述同样好处的视频,则没有任何显著效应。
表 8.1 再分析 Chong et al. (2016) 的数据。
(a) 足球运动员 vs 对照
| 估计 | 标准误 | \(p_{\mathrm{Normal}}\) | \(p_{\mathrm{frt}}\) | ||
|---|---|---|---|---|---|
| 班级 1 | N | 0.051 | 0.502 | 0.919 | 0.924 |
| L | 0.050 | 0.489 | 0.919 | 0.929 | |
| 班级 2 | N | \(-0.158\) | 0.451 | 0.726 | 0.722 |
| L | \(-0.176\) | 0.452 | 0.698 | 0.700 | |
| 班级 3 | N | 0.005 | 0.403 | 0.990 | 0.989 |
| L | \(-0.096\) | 0.385 | 0.803 | 0.806 | |
| 班级 4 | N | \(-0.492\) | 0.447 | 0.271 | 0.288 |
| L | \(-0.511\) | 0.447 | 0.253 | 0.283 | |
| 班级 5 | N | 0.390 | 0.369 | 0.291 | 0.314 |
| L | 0.443 | 0.318 | 0.164 | 0.186 | |
| 全体 | N | \(-0.051\) | 0.204 | 0.802 | 0.800 |
| L | \(-0.074\) | 0.200 | 0.712 | 0.712 |
(b) 医生 vs 对照
| 估计 | 标准误 | \(p_{\mathrm{Normal}}\) | \(p_{\mathrm{frt}}\) | ||
|---|---|---|---|---|---|
| 班级 1 | N | 0.567 | 0.426 | 0.183 | 0.192 |
| L | 0.588 | 0.418 | 0.160 | 0.174 | |
| 班级 2 | N | 0.193 | 0.438 | 0.659 | 0.666 |
| L | 0.265 | 0.409 | 0.517 | 0.523 | |
| 班级 3 | N | 1.305 | 0.494 | 0.008 | 0.012 |
| L | 1.501 | 0.462 | 0.001 | 0.003 | |
| 班级 4 | N | \(-0.273\) | 0.413 | 0.508 | 0.515 |
| L | \(-0.313\) | 0.417 | 0.454 | 0.462 | |
| 班级 5 | N | \(-0.050\) | 0.379 | 0.895 | 0.912 |
| L | \(-0.067\) | 0.279 | 0.811 | 0.816 | |
| 全体 | N | 0.406 | 0.202 | 0.045 | 0.047 |
| L | 0.463 | 0.190 | 0.015 | 0.017 |
8.6 习题
8.1 再分析 Angrist and Lavy (2009) 的数据
这是习题 7.8 的 Fisher 对应。请报告用学生化统计量做 FRT 得到的 \(p_{\mathrm{frt}}\)。
8.2 复现 Zhao and Ding (2021a) 的图 1
他们用模拟评估各种检验统计量下 \(p_{\mathrm{frt}}\) 的有限样本性质,并据此建议用 \(t_{L,S}\) 的 FRT 分析 SRE。请复现他们的图 1。
8.3 推荐阅读
在置换检验里用学生化统计量,并不是新想法;见 Janssen (1997) 与 Chung and Romano (2013)。在基于设计的框架下,Ding and Dasgupta (2017)、Wu and Ding (2021) 把这一建议推广到多臂实验,Zhao and Ding (2021a) 又推广到协变量调整。
\(\pi\) 是随机置换的常用记号。↩︎