第 9 章 沟通有限总体与超总体的因果推断
前面谈随机化实验,一直站在有限总体这一边:把所有潜在结果看作固定的数字。即便潜在结果是随机变量,有限总体视角也可以先条件于它们。这条路有两桩好处:
- 它把注意力放在实验设计上;
- 它对结果如何生成,几乎不做额外假定。
可它也常被批评:往往只有内部效度,未必有外部效度。非正式地说:
定义 9.1(内部效度) 统计分析对眼前这批研究样本成立。
定义 9.2(外部效度) 统计分析对研究样本之外、更广阔的总体也成立。
做实验的人,当然希望两样都要。有限总体视角下,一切统计性质都条件于我们手里这些单元的潜在结果,结论也就只关于这些被观测到的人。于是一个自然的问题来了:有限总体的结果,能推广到更大的总体吗?
这对「条件于潜在结果」的有限总体框架,是公道的批评。可它也可以是个哲学问题。我们看见的,本就是一个有限总体;任何设计与分析,直接告诉我们的,也是关于这个有限总体的事。随机化只保证:给定这些单元的潜在结果,内部效度成立。外部效度则取决于单元是怎么被抽来的。若这个有限总体能代表我们真正关心的更大总体,实验结果当然也有外部效度;否则,基于随机化的推断未必推得出去。要把这件事说严谨,需要一个有两层随机性的框架:一层来自抽样,一层来自处理的随机分配。正式讨论见 Miratrix et al. (2018) 与 Abadie et al. (2020)。1
对一些统计学家来说,这只是技术问题。我们可以换一套框架,假定单元来自一个超总体(superpopulation)。于是所有陈述都关于那个关心的总体。这是个方便的框架——虽说它并没有真正解开上面那个难题。下面引入它,有两个目的:
- 给随机化实验换一个角度看;
- 在本书第二部分与第三部分之间搭一座桥。
后一个目的更要紧:观察性研究里处理并非随机分配,超总体框架能让我们推出更丰饶的结果。
9.1 完全随机化实验(CRE)
假定
\[ \{Z_i,Y_i(1),Y_i(0),X_i\}_{i=1}^{n} \ \stackrel{\mathrm{IID}}{\sim}\ \{Z,Y(1),Y(0),X\} \]
来自一个超总体。于是总体层面的量可以省掉下标 \(i\)。稍稍滥用记号,把总体平均因果效应写成
\[ \tau=\mathrm{E}\{Y(1)-Y(0)\}=\mathrm{E}\{Y(1)\}-\mathrm{E}\{Y(0)\}. \]
超总体框架下,CRE 可以这样说。
定义 9.3(超总体框架下的 CRE)
\[ Z\perp\!\!\!\perp\{Y(1),Y(0),X\}. \]
在定义 9.3 下,平均因果效应可以写成
\[ \begin{align} \tau &= \mathrm{E}\{Y(1)\mid Z=1\}-\mathrm{E}\{Y(0)\mid Z=0\}\\ &= \mathrm{E}(Y\mid Z=1)-\mathrm{E}(Y\mid Z=0), \tag{9.1} \end{align} \]
也就是结果期望之差。(9.1) 的第一行,是随机化真正发力的一步。既然 \(\tau\) 可以写成可观测变量分布的函数,它就是非参数可识别的。2 公式 (9.1) 立刻提示一个矩估计 \(\hat\tau\)——仍是前面的结果均值差。条件于 \(Z\),这便是比较两个独立样本均值的标准两样本问题。我们有
\[ \mathrm{E}(\hat\tau\mid Z)=\tau, \qquad \operatorname{var}(\hat\tau\mid Z) = \frac{\operatorname{var}\{Y(1)\}}{n_1} + \frac{\operatorname{var}\{Y(0)\}}{n_0}. \]
IID 抽样下,样本方差对总体方差无偏,因而 Neyman (1923) 的方差估计对 \(\operatorname{var}(\hat\tau\mid Z)\) 也无偏。超总体框架里,那份「保守」悄悄走开了。
也可以谈协变量调整。基于 OLS 分解(见附录 B)
\[ Y(1)=\gamma_1+\beta_1^\top X+\varepsilon(1), \tag{9.2} \]
\[ Y(0)=\gamma_0+\beta_0^\top X+\varepsilon(0), \tag{9.3} \]
因截距保证残差均值为零,有
\[ \tau=\mathrm{E}\{Y(1)-Y(0)\}=\gamma_1-\gamma_0+(\beta_1-\beta_0)^\top\mathrm{E}(X). \]
分别用处理组与对照组数据做 OLS,得样本系数 \(\hat\gamma_1,\hat\beta_1,\hat\gamma_0,\hat\beta_0\),于是 \(\tau\) 的协变量调整估计为
\[ \hat\tau_{\mathrm{adj}}=\hat\gamma_1-\hat\gamma_0+(\hat\beta_1-\hat\beta_0)^\top\bar X. \]
若把协变量中心化使 \(\bar X=0\),它就回到 Lin (2013) 的估计量
\[ \hat\tau_L=\hat\gamma_1-\hat\gamma_0, \]
等于带处理–协变量交互的合并回归里 \(Z\) 的系数;见命题 6.2。
可惜的是,超总体框架下 \(\bar X\) 还有额外不确定性,EHW 方差估计对 \(\hat\tau_L\) 并不适用。Berk et al. (2013)、Negi and Wooldridge (2021)、Zhao and Ding (2021a) 提议给 EHW 再加一项校正:
\[ (\hat\beta_1-\hat\beta_0)^\top S_X^2(\hat\beta_1-\hat\beta_0)/n, \tag{9.4} \]
其中 \(\hat\beta_1-\hat\beta_0\) 正是求 Lin (2013) 估计时交互项 \(Z_i X_i\) 的系数,\(S_X^2\) 是协变量的有限总体协方差阵。概念上更简单、计算上更费的做法,是用自助法(bootstrap)估方差;见附录 A.6 与习题 9.2。
9.2 CRE 下的模拟:超总体视角
下面的 linestimator 函数可计算 Lin (2013) 估计量、EHW 标准误,以及基于 (9.4) 的超总体校正标准误:
library("car")
linestimator = function(Z, Y, X){
X = scale(X)
n = dim(X)[1]
p = dim(X)[2]
linreg = lm(Y ~ Z*X)
est = coef(linreg)[2]
vehw = hccm(linreg)[2, 2]
inter = coef(linreg)[(p+3):(2*p+2)]
vsuper = vehw + sum(inter*(cov(X)%*%inter))/n
c(est, sqrt(vehw), sqrt(vsuper))
}再用模拟比较 EHW 标准误与校正标准误。样本量 \(n=500\),Monte Carlo 重复 2000 次。潜在结果对协变量非线性,误差也不正态;真实平均因果效应为 \(0\)。
结果与理论相符。第一,Lin (2013) 估计几乎无偏(均值约 \(-0.00012\))。第二,平均 EHW 标准误(约 \(0.139\))小于经验标准差(约 \(0.151\)),95% 区间覆盖率只有 \(0.927\),偏低。第三,平均校正标准误(约 \(0.153\))几乎等于经验标准差,覆盖率 \(0.9525\),更准。
9.3 推广到 SRE
SRE 等价于各层内独立的 CRE,因而 9.1 节的讨论可以推过去。下面的记号与第 5 章会稍有不同。
假定 \(\{Z_i,Y_i(1),Y_i(0),X_i\}\stackrel{\mathrm{IID}}{\sim}\{Z,Y(1),Y(0),X\}\)。对离散协变量 \(X_i\in\{1,\ldots,K\}\),SRE 可以这样说。
定义 9.4(超总体框架下的 SRE)
\[ Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid X. \]
在定义 9.4 下,条件平均因果效应可以写成
\[ \tau_{[k]} = \mathrm{E}\{Y(1)-Y(0)\mid X=k\} = \mathrm{E}(Y\mid Z=1,X=k)-\mathrm{E}(Y\mid Z=0,X=k), \]
因而平均因果效应
\[ \tau = \mathrm{E}\{Y(1)-Y(0)\} = \sum_{k=1}^{K}\operatorname{pr}(X=k)\,\tau_{[k]}. \]
9.1 节的讨论在每一层内都成立,于是可写出 SRE 的超总体对应物。当每一层里处理与对照都至少有两人时,可用 \(\hat V_S\) 作为 \(\operatorname{var}(\hat\tau_S)\) 的方差估计。
定义 9.4 的精确形式,第三部分还会再见。
9.4 习题
9.1 CRE 下观测结果的 OLS 分解
基于 (9.2) 与 (9.3),证明观测结果对处理、协变量及其交互的 OLS 分解为
\[ Y=\alpha_0+\alpha_Z Z+\alpha_X^\top X+\alpha_{ZX}^\top XZ+\varepsilon, \]
其中 \(\alpha_0=\gamma_0\),\(\alpha_Z=\gamma_1-\gamma_0\),\(\alpha_X=\beta_0\),\(\alpha_{ZX}=\beta_1-\beta_0\),且 \(\varepsilon=Z\varepsilon(1)+(1-Z)\varepsilon(0)\)。也就是说,这些系数使均方误差最小。
9.2 超总体框架下 Lin (2013) 估计量的方差估计
在超总体框架下模拟 \(\{X_i,Z_i,Y_i(1),Y_i(0)\}_{i=1}^n\),使 (9.2)(9.3) 中 \(\beta_1\ne\beta_0\)。每次模拟计算 Lin (2013) 估计,比较真实方差与下列估计方差:
- EHW 稳健方差;
- 加上 (9.4) 校正项的 EHW 稳健方差;
- 自助法方差:协变量一开始中心化,每个自助样本不再重新中心化;
- 自助法方差:每个自助样本都重新中心化协变量。
9.3 推荐阅读
Ding et al. (2017a) 对平均因果效应的有限总体推断与超总体推断,给过一次统一的讨论。