第 6 章 再随机化与回归调整
第 5 章里,分层与事后分层是离散协变量在「设计」与「分析」两端的一对对偶。若协变量是多维的、甚至连续的,又该怎么办?可以把连续变量离散化,可协变量一多,这就不再理想。再随机化(rerandomization)与回归调整(regression adjustment),则是一般协变量在设计与分析两端的对偶——正是本章主题。
第 5、6 章可汇总成一张安静的表:
| 设计 | 分析 | |
|---|---|---|
| 离散协变量 | 分层 | 事后分层 |
| 一般协变量 | 再随机化 | 回归调整 |
6.1 再随机化
6.1.1 实验设计
仍考虑 \(n\) 个单元的有限总体,其中 \(n_1\) 个接受处理、\(n_0\) 个接受对照。令 \(Z=(Z_1,\ldots,Z_n)\) 为处理向量。单元 \(i\) 有协变量 \(X_i\in\mathbb{R}^K\),分量可以连续或二值。把它们拼成 \(n\times K\) 矩阵 \(X=(X_1,\ldots,X_n)^\top\),并中心化使 \(\bar X=n^{-1}\sum_{i=1}^{n}X_i=0\),好让叙述更干净。
CRE 平均而言会平衡两组协变量——例如协变量均值差
\[ \hat\tau_X = n_1^{-1}\sum_{i=1}^{n}Z_i X_i - n_0^{-1}\sum_{i=1}^{n}(1-Z_i)X_i \]
在 CRE 下均值为零。可某次实现里,\(\hat\tau_X\) 往往并不为零,仍可能出现不理想的协变量失衡。用习题 4.6 的向量版 Neyman (1923),可知
\[ \operatorname{cov}(\hat\tau_X) = \frac{1}{n_1}S_X^2+\frac{1}{n_0}S_X^2 = \frac{n}{n_1 n_0}S_X^2, \]
其中 \(S_X^2=(n-1)^{-1}\sum_{i=1}^{n}X_i X_i^\top\) 是协变量的有限总体协方差阵。下面的 Mahalanobis 距离度量两组差异:
\[ M = \hat\tau_X^\top\operatorname{cov}(\hat\tau_X)^{-1}\hat\tau_X = \hat\tau_X^\top\Bigl(\frac{n}{n_1 n_0}S_X^2\Bigr)^{-1}\hat\tau_X. \tag{6.1} \]
技术上,(6.1) 要求 \(S_X^2\) 可逆,即 \(X\) 的各列线性无关。若某列可被其他列线性表出,它是冗余的,实验前就该丢掉。\(M\) 有一个温柔的优点:对 \(X\) 的非退化线性变换不变。引理 6.1 总结此事,证明留作习题 6.2。
引理 6.1 若对所有单元把 \(X_i\) 换成 \(b_0+BX_i\),其中 \(b_0\in\mathbb{R}^K\)、\(B\in\mathbb{R}^{K\times K}\) 可逆,则 (6.1) 中的 \(M\) 不变。
有限总体 CLT(Li and Ding, 2017)保证:\(n\) 较大时,CRE 下 \(M\) 近似 \(\chi^2_K\)。于是 \(M\) 常取较大实现值——渐近均值 \(K\)、方差 \(2K\)。再随机化的想法很朴素:把 \(M\) 过大的处理分配丢掉。下面写下用 Mahalanobis 距离的再随机化(ReM)——Cox (1982) 提出,Morgan and Rubin (2012) 进一步研究。
定义 6.1(ReM) 从 CRE 中抽取 \(Z\),当且仅当 \(M\le a\) 时接受它,其中 \(a>0\) 是预先给定的常数。
选 \(a\) 的问题,有点像 SRE 里选层数:实践中并不轻松。一端 \(a=\infty\),就回到 CRE;另一端 \(a=0\),可行分配极少,实验几乎不再随机,基于随机化的推断也失去用武之地。折中是选一个小、却不过分小的 \(a\)——例如 \(0.001\),或 \(\chi^2_K\) 的某个上分位数。
ReM 有许多可亲的性质:对协变量线性变换不变,几何性质好,数学理论也优雅。本章聚焦 ReM。
6.1.2 统计推断
重要问题是:ReM 下如何分析数据?Bruhn and McKenzie (2009)、Morgan and Rubin (2012) 指出:只要在约束 \(M\le a\) 下模拟 \(Z\),就总能做 FRT,并在尖锐原假设下得到有限样本精确的 \(p\) 值。见习题 6.1。
若不假定尖锐原假设,推导 ReM 的有限样本性质则相当困难。Li et al. (2018b) 转而在下面这些正则条件下,给出结果均值差 \(\hat\tau\) 在 ReM 下的渐近分布。
条件 6.1 当 \(n\to\infty\):
- \(n_1/n\) 与 \(n_0/n\) 有正极限;
- \(\{X_i,Y_i(1),Y_i(0),\tau_i\}\) 的有限总体协方差有有限极限;
- \(\max_i\{Y_i(1)-\bar Y(1)\}^2/n\to 0\),对 \(Y(0)\) 类似,且 \(\max_i X_i^\top X_i/n\to 0\)。
下面是 ReM 的主定理,需一点额外记号。令
\[ L_{K,a}\sim D_1\mid D^\top D\le a, \]
其中 \(D=(D_1,\ldots,D_K)\) 服从 \(K\) 维标准正态;令 \(\varepsilon\) 为单变量标准正态,且 \(L_{K,a}\perp\!\!\!\perp\varepsilon\)。
定理 6.1 在 ReM(\(M\le a\))与条件 6.1 下,1
\[ \frac{\hat\tau-\tau}{\sqrt{\operatorname{var}(\hat\tau)}} \ \cdot\sim\ \sqrt{R^2}\,L_{K,a}+\sqrt{1-R^2}\,\varepsilon, \]
其中
\[ \operatorname{var}(\hat\tau) = \frac{S^2(1)}{n_1}+\frac{S^2(0)}{n_0}-\frac{S^2(\tau)}{n} \]
是第 4 章的 Neyman 方差,而
\[ R^2=\operatorname{corr}^2(\hat\tau,\hat\tau_X) \]
是 CRE 下 \(\hat\tau\) 与 \(\hat\tau_X\) 的平方复相关系数(见附录 A.1.1)。
Li et al. (2018b) 的证明偏技术,可定理 6.1 的渐近分布有清晰几何图像(原书图 6.1):\(\hat\tau\) 分解为「\(\hat\tau_X\) 的线性组合」与「与 \(\hat\tau_X\) 正交」两部分;几何上 \(\cos^2\theta=R^2\),\(\theta\) 是 \(\hat\tau\) 与 \(\hat\tau_X\) 的夹角。ReM 影响第一分量,不改变第二分量;截断正态 \(L_{K,a}\) 正来自 ReM 对第一分量的约束。
当 \(a=\infty\),渐近分布回到 CRE:\((\hat\tau-\tau)/\sqrt{\operatorname{var}(\hat\tau)}\ \cdot\sim\ \varepsilon\)。当阈值 \(a\) 接近零,则
\[ \frac{\hat\tau-\tau}{\sqrt{\operatorname{var}(\hat\tau)}} \ \cdot\sim\ \sqrt{1-R^2}\,\varepsilon; \]
严格证明见 Wang and Li (2022)。于是阈值很小时,ReM 的效率增益取决于 \(R^2\),它有如下等价形式。
命题 6.1 在 CRE 下,
\[ R^2 = \frac{n_1^{-1}S^2(1\mid X)+n_0^{-1}S^2(0\mid X)-n^{-1}S^2(\tau\mid X)} {n_1^{-1}S^2(1)+n_0^{-1}S^2(0)-n^{-1}S^2(\tau)}, \]
其中 \(\{S^2(1),S^2(0),S^2(\tau)\}\) 是 \(\{Y_i(1),Y_i(0),\tau_i\}\) 的有限总体方差,\(\{S^2(1\mid X),\ldots\}\) 是它们在 \((1,X_i)\) 上线性投影后的对应方差(见附录 B.2)。若个体效应为常数 \(\tau_i=\tau\),则 \(R^2\) 化简为 \(S^2(0\mid X)/S^2(0)\),即 \(Y_i(0)\) 与 \(X_i\) 的有限总体平方复相关。
证明留作习题 6.4。
当 \(0<a<\infty\) 时,\(\hat\tau\) 的渐近分布更复杂,但更集中于 \(\tau\)——因而 ReM 下均值差比 CRE 更精确。
若忽略 ReM 设计,仍用 Neyman (1923) 方差与正态近似做置信区间,即便个体效应为常数也会过度保守、过度覆盖。Li et al. (2018b) 建议基于定理 6.1 构造区间。细节先按下不表,6.3 节再回来谈推断。
6.2 回归调整
若设计阶段没做再随机化,却想在 CRE 的分析阶段调整协变量失衡,该怎么办?下面谈几种回归调整策略。
6.2.1 协变量调整的 FRT
协变量 \(X\) 固定;在 \(H_{0\mathrm{f}}\) 下观测结果也固定。因此可模拟任意 \(T=T(Z,Y,X)\) 的分布并算 \(p\) 值——有额外协变量时,FRT 的基本想法不变。
构造检验统计量有两种一般策略(习题 3.6 已暗示过)。用 Zhao and Ding (2021a) 的术语,可以这样概括。
定义 6.2(伪结果策略) 基于拟合模型的残差构造统计量:把 \(Y_i\) 对 \(X_i\) 回归得残差 \(\hat\varepsilon_i\),再把 \(\hat\varepsilon_i\) 当作伪结果去构造检验统计量。
定义 6.3(模型输出策略) 用回归系数作检验统计量:把 \(Y_i\) 对 \((Z_i,X_i)\) 回归,取 \(Z_i\) 的系数作为检验统计量。
伪结果策略里,\(Y_i\) 对 \(X_i\) 的回归不应包含处理 \(Z_i\)——好让原结果满足 \(H_{0\mathrm{f}}\) 时,伪结果也满足。模型输出策略里,回归应包含 \(Z_i\)——好用其系数度量对 \(H_{0\mathrm{f}}\) 的偏离。计算上,策略一只跑一次回归;策略二要跑许多次。
这里的「回归」是统称:可以是线性、逻辑斯蒂,甚至机器学习。两种策略下的 FRT 在 \(H_{0\mathrm{f}}\) 下都有限样本精确;备择下表现则不同。这一节剩下的部分,回顾基于 OLS 的一些统计量。
6.2.2 协方差分析及其扩展
现在把目光转向:直接估计平均因果效应 \(\tau\),并调整观测协变量。
历史上,Fisher (1925) 提出用协方差分析(ANCOVA)提高估计效率,至今仍是许多领域的标准做法。他建议把 \(Y_i\) 对 \((1,Z_i,X_i)\) 做 OLS,取 \(Z_i\) 的系数估计 \(\tau\)。记 Fisher 的 ANCOVA 估计量为 \(\hat\tau_F\)。
前伯克利统计教授 David A. Freedman,在 Neyman (1923) 的潜在结果框架下重访了 Fisher 的 ANCOVA。Freedman (2008a,b) 发现几件「不太好听」的事:
- \(\hat\tau_F\) 有偏,而简单均值差 \(\hat\tau\) 无偏;
- 当 \(n_1\ne n_0\) 时,\(\hat\tau_F\) 的渐近方差甚至可能大于 \(\hat\tau\);
- OLS 给出的标准误,在 CRE 下对 \(\hat\tau_F\) 的真实标准误不相合。
前伯克利博士生 Winston Lin 写了论文回应。Lin (2013) 找到几件「好听」的事:
- \(\hat\tau_F\) 的偏倚在大样本下很小,并随样本量趋于零;
- 在 \(Y_i\) 对 \((1,Z_i,X_i,Z_i\times X_i)\) 的 OLS 中取 \(Z_i\) 的系数,可同时改进 \(\hat\tau\) 与 \(\hat\tau_F\) 的渐近效率。记 Lin (2013) 的估计量为 \(\hat\tau_L\);且 EHW 标准误是 CRE 下 \(\hat\tau_L\) 真实标准误的保守估计;
- \(Y_i\) 对 \((1,Z_i,X_i)\) 拟合时,\(\hat\tau_F\) 的 EHW 标准误[^2] 也是 CRE 下真实标准误的保守估计。
6.2.2.1 理解 Lin (2013) 结果的一点直觉
Neyman (1923) 表明:\(\hat\tau\) 的方差依赖潜在结果的方差。直觉上,若能减小潜在结果的方差,就能减小估计量的方差。一族线性调整估计量为
\[ \begin{align} \hat\tau(\beta_1,\beta_0) &= n_1^{-1}\sum_{i=1}^{n}Z_i(Y_i-\beta_1^\top X_i) - n_0^{-1}\sum_{i=1}^{n}(1-Z_i)(Y_i-\beta_0^\top X_i) \tag{6.2}\\ &= \bigl\{\hat{\bar Y}(1)-\beta_1^\top\hat{\bar X}(1)\bigr\} - \bigl\{\hat{\bar Y}(0)-\beta_0^\top\hat{\bar X}(0)\bigr\}. \tag{6.3} \end{align} \]
它通过对潜在结果残差化,试图减小 \(\hat\tau\) 的方差;\(\beta_1=\beta_0=0\) 时回到 \(\hat\tau\)。因 \(\bar X=0\),对任意固定的 \(\beta_1,\beta_0\),它均值为 \(\tau\)。我们想找使 \(\operatorname{var}\{\hat\tau(\beta_1,\beta_0)\}\) 最小的 \((\beta_1,\beta_0)\)。
由 Neyman (1923),
\[ \operatorname{var}\{\hat\tau(\beta_1,\beta_0)\} = \frac{S^2(1;\beta_1)}{n_1} + \frac{S^2(0;\beta_0)}{n_0} - \frac{S^2(\tau;\beta_1,\beta_0)}{n}, \]
保守方差估计为 \(\hat V(\beta_1,\beta_0)=\hat S^2(1;\beta_1)/n_1+\hat S^2(0;\beta_0)/n_0\)。最小化 \(\hat V\),等价于分别在处理组与对照组做两次 OLS:
\[ \min_{\gamma_1,\beta_1}\sum_{i=1}^{n}Z_i(Y_i-\gamma_1-\beta_1^\top X_i)^2, \qquad \min_{\gamma_0,\beta_0}\sum_{i=1}^{n}(1-Z_i)(Y_i-\gamma_0-\beta_0^\top X_i)^2. \]
得 \((\hat\gamma_1,\hat\beta_1)\)、\((\hat\gamma_0,\hat\beta_0)\) 后,最终估计量为 \(\hat\tau(\hat\beta_1,\hat\beta_0)\)。由 OLS 性质(见 (B.5)),\(\hat{\bar Y}(1)=\hat\gamma_1+\hat\beta_1^\top\hat{\bar X}(1)\) 等成立,于是
\[ \hat\tau(\hat\beta_1,\hat\beta_0)=\hat\gamma_1-\hat\gamma_0. \tag{6.4} \]
(6.4) 暗示:一次 OLS 就能得到它。
命题 6.2 (6.4) 中的 \(\hat\tau(\hat\beta_1,\hat\beta_0)\),等于 \(Y_i\) 对 \((1,Z_i,X_i,Z_i\times X_i)\) 做 OLS 时 \(Z_i\) 的系数——即前面的 Lin (2013) 估计量 \(\hat\tau_L\)。
证明留作习题 6.7,纯属线性代数事实。
相应地,\(\hat\tau_L\) 的保守方差估计为 \(\hat V(\hat\beta_1,\hat\beta_0)\)(用各组残差平方和除以 \(n_z(n_z-1)\))。Lin (2013) 进一步证明:命题 6.2 那次 OLS 的 EHW 标准误几乎就是 \(\hat V(\hat\beta_1,\hat\beta_0)\),且对 CRE 下 \(\hat\tau_L\) 的真实标准误保守。直觉是:我们并不假定线性模型正确,而 EHW 对模型设定错误稳健。
有一点细微:\(\operatorname{var}\{\hat\tau(\beta_1,\beta_0)\}\) 对固定系数成立,而 \(\hat\tau(\hat\beta_1,\hat\beta_0)\) 用了估计系数,额外不确定性可能带来有限样本偏倚。Lin (2013) 说明渐近上这不成问题——\(\hat\tau(\hat\beta_1,\hat\beta_0)\) 表现得像 \(\hat\tau(\tilde\beta_1,\tilde\beta_0)\),其中 \(\tilde\beta_z\) 是 \(\hat\beta_z\) 的极限。启发式地,二者之差依赖 \((\hat\beta_z-\tilde\beta_z)^\top\hat{\bar X}(z)\),是两个小阶项之积。作为提醒:渐近理论需要大样本与正则条件;有限样本里,因估计系数的额外不确定性,回归调整甚至可能有害。
6.2.2.2 从「预测潜在结果」理解 Lin (2013)
也可把 Lin (2013) 看作:用处理组数据建 \(Y(1)\) 对 \(X\) 的预测 \(\hat\mu_1(X)=\hat\gamma_1+\hat\beta_1^\top X\),用对照组建 \(\hat\mu_0(X)=\hat\gamma_0+\hat\beta_0^\top X\)(原书表 6.1)。若只补全缺失潜在结果,得预测型估计量
\[ \hat\tau_{\mathrm{pred}} = n^{-1}\Bigl( \sum_{Z_i=1}Y_i+\sum_{Z_i=0}\hat\mu_1(X_i) - \sum_{Z_i=1}\hat\mu_0(X_i)-\sum_{Z_i=0}Y_i \Bigr); \tag{6.7} \]
若连已观测的也用模型值替换,得投影型估计量
\[ \hat\tau_{\mathrm{proj}} = n^{-1}\sum_{i=1}^{n}\{\hat\mu_1(X_i)-\hat\mu_0(X_i)\}. \tag{6.9} \]
在线性预测 (6.5)(6.6) 下,二者都等于 \(\hat\tau_L\):
\[ \hat\tau_{\mathrm{pred}}=\hat\tau_L=\hat\tau_{\mathrm{proj}}. \tag{6.8},\ \text{(6.10)} \]
证明留作习题 6.8。「预测型 / 投影型」用语来自抽样调查文献(Firth and Bennett, 1998; Ding and Li, 2018)。更一般的 (6.7)(6.9) 可用别的预测器——包括复杂机器学习。但构造点估计只是第一步;更重要的是量化不确定性,而这依赖预测器的性质。即便不做额外理论,也总可把 (6.7)(6.9) 当作 FRT 里的检验统计量。
6.2.2.3 从「调整协变量失衡」理解 Lin (2013)
线性调整估计量有等价形式
\[ \hat\tau(\beta_1,\beta_0)=\hat\tau-\gamma^\top\hat\tau_X, \qquad \gamma=\frac{n_0}{n}\beta_1+\frac{n_1}{n}\beta_0, \tag{6.11} \]
Lin (2013) 则为
\[ \hat\tau_L=\hat\tau-\hat\gamma^\top\hat\tau_X, \qquad \hat\gamma=\frac{n_0}{n}\hat\beta_1+\frac{n_1}{n}\hat\beta_0. \tag{6.12} \]
证明留作习题 6.9。这正是「调整协变量失衡」的数学说法:从 \(\hat\tau\) 中减去协变量均值差的某个线性组合。因 CRE 下 \(\hat\tau\) 与 \(\hat\tau_X\) 相关,选好 \(\gamma\) 就能减小方差。有趣的是,最终估计只依赖 \(\gamma\)(或 \(\hat\gamma\)),\(\beta\) 系数的选择并不唯一(Li and Ding, 2020)。因而 Lin (2013) 只是诸多最优估计之一——但它可用标准 OLS 加 EHW 标准误轻松实现,所以本书聚焦它。
6.2.3 关于回归调整的几点补充
6.2.3.1 ReM 与回归调整的对偶
Li et al. (2018b) 指出:ReM 与 Lin (2013) 的回归调整,是在设计与分析两端使用协变量的对偶。具体说,当 \(a\) 很小时,ReM 下 \(\hat\tau\) 的渐近分布,几乎就是 CRE 下 \(\hat\tau_L\) 的渐近分布。一端在设计里用协变量,一端在分析里用,阈值小时渐近效率增益近乎相同。
6.2.3.2 回归调整与事后分层的等价
若有 \(K\) 类离散协变量 \(C_i\),可造 \(K-1\) 个中心化虚拟变量
\[ X_i=\bigl(I(C_i=1)-\pi_{[1]},\ldots,I(C_i=K-1)-\pi_{[K-1]}\bigr). \]
此时 Lin (2013) 回归调整与事后分层数值相同。
命题 6.3 基于上述 \(X_i\) 的 \(\hat\tau_L\),与基于 \(C_i\) 的事后分层估计 \(\hat\tau_{\mathrm{PS}}\)(第 5.4 节)数值恒等。
证明留作习题 6.11。
6.2.3.3 双重差分作为 \(\hat\tau(\beta_1,\beta_0)\) 的特例
许多研究里,重要协变量 \(X\) 是处理前的滞后结果——例如教育里的前测、就业培训前的对数工资。取 \(\beta_1=\beta_0=1\),便得到增益分数或双重差分估计量:
\[ \hat\tau(1,1) = n_1^{-1}\sum_{i=1}^{n}Z_i(Y_i-X_i) - n_0^{-1}\sum_{i=1}^{n}(1-Z_i)(Y_i-X_i) = \bigl\{\hat{\bar Y}(1)-\hat{\bar Y}(0)\bigr\} - \bigl\{\hat{\bar X}(1)-\hat{\bar X}(0)\bigr\}. \]
第一种写法是增益 \(g_i=Y_i-X_i\) 的均值差;第二种是两个均值差之差。它不同于 Lin (2013):系数预先固定为 1,而非估计而得。\(\hat\tau(1,1)\) 无偏,且有保守方差 \(\hat V(1,1)\)(对增益的组内样本方差)。当滞后结果能强预测结果时,增益方差往往远小于结果本身,\(\hat\tau(1,1)\) 常大幅减小简单均值差的方差。细节见习题 6.12。
理论上,大样本下 Lin (2013) 总比 \(\hat\tau(1,1)\) 更有效;但 Lin 有限样本有偏,而 \(\hat\tau(1,1)\) 始终无偏。
6.2.4 推广到 SRE
也可能实验已按离散 \(C\) 分层,又观测到额外协变量 \(X\)。若各层都大,可在层内算 Lin (2013) 估计 \(\hat\tau_{L,[k]}\),再加权:
\[ \hat\tau_{L,S}=\sum_{k=1}^{K}\pi_{[k]}\hat\tau_{L,[k]}, \qquad \hat V_{L,S}=\sum_{k=1}^{K}\pi_{[k]}^2\hat V_{\mathrm{ehw},[k]}, \]
其中 \(\hat V_{\mathrm{ehw},[k]}\) 来自第 \(k\) 层内「结果对截距、处理、协变量及其交互」OLS 的 EHW 方差。重要:协变量须按层内均值中心化。
6.3 统一、组合与比较
Li and Ding (2020) 统一了文献,并表明可把再随机化与回归调整组合起来:设计阶段 ReM,分析阶段用 Lin (2013) 加 EHW——设计里改善平衡,分析里提高效率。
表 6.2 从 Neyman (1923) 到 Li and Ding (2020) 做了汇总:箭头 1 是 CRE 下协变量调整的效率增益(渐近上 \(\hat\tau_L\) 方差小于 \(\hat\tau\));箭头 2 是 ReM 的效率增益(渐近上 \(\hat\tau\) 的分位区间更窄);箭头 3、4 则是二者组合的好处。
| 分析\设计 | CRE | ReM |
|---|---|---|
| \(\hat\tau\) | Neyman (1923) | Li et al. (2018b) |
| \(\hat\tau_L\) | Lin (2013) | Li and Ding (2020) |
6.4 模拟
Angrist et al. (2009) 在一所加拿大大学评估多种提升大一成绩的策略。这里用子集:对照组,以及对「学业支持 + 成绩激励」处理组;结果是第一年末 GPA;缺失结果用观测均值填补(有些任意,见习题 6.14)。两个协变量:性别与基线 GPA。
未调整与 Lin 调整的结果约为:Neyman 估计 \(0.054\)(se \(0.076\),\(p=0.472\));Lin 估计 \(0.075\)(se \(0.072\),\(p=0.300\))。调整后标准误更小,但仍不显著。
作者还用该数据,按表 6.2 的四种设计–分析组合做模拟:分别对处理/对照拟合结果对协变量的二次函数以补全科学表,并把误差缩放 \(0.1\) 与 \(0.25\) 以提高信噪比;「真」模型非线性,估计仍用线性调整——好评估设定错误下的性质。原书图 6.2 的小提琴图显示:各估计近乎无偏;ReM 与回归调整都提高效率;噪声更小时增益更明显。
6.5 结语
ReM 用 Mahalanobis 距离作平衡准则。也可考虑更一般的再随机化,准则是 \(Z\) 与 \(X\) 的函数——例如对各坐标做边际检验,当且仅当
\[ \Biggl|\frac{\hat\tau_{x_k}}{\sqrt{\dfrac{n}{n_1 n_0}S_{x_k}^2}}\Biggr|\le a \quad(k=1,\ldots,K) \tag{6.13} \]
时接受 \(Z\)。理论见 Zhao and Ding (2021b)。
对连续结果,Fisher 的 ANCOVA 多年是标准;Lin (2013) 的改进即便线性模型错误也有更好理论性质。对二值结果,人们常用逻辑回归中处理系数估计因果效应;可 Freedman (2008c) 指出,在潜在结果框架下它并不美好——即便模型正确,系数估的是条件优势比(附录 B.6),未必是关心的参数;模型错误时更难解释。若关心的是平均因果效应,CRE 下仍可用 Lin (2013) 分析二值结果。Guo and Basse (2023) 把 Lin 的理论扩展到用广义线性模型构造 ACE 估计。
其他扩展关注高维协变量:Bloniarz et al. (2016) 在协变量多于样本量时建议用 LASSO;Lei and Ding (2021) 在协变量个数发散、但不假定稀疏时,证明 Lin 估计在一定条件下仍相合且渐近正态;Wager et al. (2016) 提议用机器学习分析高维实验数据。
6.6 习题
6.1 ReM 下的 FRT 描述 ReM 下如何做 FRT。
6.2 Mahalanobis 距离的不变性 证明引理 6.1。
6.3 再随机化下均值差的偏倚 设从 CRE 抽 \(Z\),当且仅当 \(\phi(Z,X)=1\) 时接受。证明:若 \(n_1=n_0\) 且 \(\phi(Z,X)=\phi(1_n-Z,X)\),则 \(\hat\tau\) 对 \(\tau\) 无偏。验证 ReM 在 \(n_1=n_0\) 时满足该对称性;并给反例:两条件不成立时 \(\hat\tau\) 有偏。
6.4 CRE 中 \(R^2\) 的等价形式 证明命题 6.1。
6.5 潜在结果对协变量的线性投影 证明 \(S^2(1\mid X)=S_{Y(1)X}(S_X^2)^{-1}S_{XY(1)}\),并写出 \(S^2(0\mid X)\)、\(S^2(\tau\mid X)\) 的类似公式。
6.6 线性调整族内的真实方差比较 证明 \(\operatorname{var}\{\hat\tau(\beta_1,\beta_0)\}\) 可分解为 \(\operatorname{var}\{\hat\tau(\tilde\beta_1,\tilde\beta_0)\}+\operatorname{var}\{\hat\tau(\beta_1,\beta_0)-\hat\tau(\tilde\beta_1,\tilde\beta_0)\}\),其中 \(\tilde\beta_z\) 是 \(Y_i(z)\) 对 \((1,X_i)\) 的 OLS 投影系数。
6.7 Lin 的协变量调整估计 证明命题 6.2。
6.8 预测型与投影型估计量 证明 (6.8) 与 (6.10)。
6.9 协变量调整估计的等价形式 证明 (6.11) 与 (6.12)。
6.10 ANCOVA 也在调整失衡 证明 \(\hat\tau_F=\hat\tau-\hat\gamma_F^\top\hat\tau_X\),其中 \(\hat\gamma_F\) 是 \(Y_i\) 对 \((1,Z_i,X_i)\) OLS 中 \(X_i\) 的系数。
6.11 CRE 的回归调整 / 事后分层 证明命题 6.3。
6.12 CRE 中的双重差分估计量 证明 \(\hat\tau(1,1)\) 无偏,计算其方差,并证明 \(\hat V(1,1)\) 保守;等号何时成立?再比较 \(\operatorname{var}\{\hat\tau(0,0)\}\) 与 \(\operatorname{var}\{\hat\tau(1,1)\}\)。
6.13 Penn Bonus 实验再分析 在原有区组之外使用其余协变量:层内回归调整再合并,报告点估计、标准误与 95% 区间,并与未调整比较。
6.14 随机化实验中的缺失结果 用处理/对照各自观测均值填补;再用结果对协变量的线性回归分别填补——结果会变吗?你还有别的处理缺失的方式吗?请说明并实现。
6.15 推荐阅读 本章标题与 Li and Ding (2020) 相同;该文分别研究了再随机化与回归调整在实验设计与分析阶段的角色。
记号「\(A\cdot\sim B\)」表示 \(A\) 与 \(B\) 有相同的渐近分布。↩︎