第 7 章 配对实验
配对实验(matched-pairs experiment, MPE)是分层随机化实验最极端的一种:每一层里只有一个处理单元、一个对照单元。这时,层也叫对(pair)。它虽是第 5 章 SRE 的特例,却有自己的估计与推断方式;也有许多新特征,并与第 15 章观察性研究里的「匹配」策略亲密相关。所以我们单独用一章,慢慢把它讲清楚。
7.1 实验设计与潜在结果
考虑有 \(2n\) 个单元的实验。若协变量能预测结果,就可按协变量的相似程度把人配成对。协变量是标量时,可先排序,再把相邻的人配在一起;协变量很多时,可定义两两距离,再按距离配对。配对可用贪心算法,也可用最优非二分图匹配:贪心是每次挑距离最小的两个人,从池子里拿掉,再对剩下的人重复;最优非二分图匹配则把 \(2n\) 人分成 \(n\) 对,使对内距离之和最小。计算细节见 Greevy et al. (2004)。本章假定对已按协变量形成,接下来谈设计与分析。
用 \((i,j)\) 表示第 \(i\) 对里的第 \(j\) 个单元,\(i=1,\ldots,n\),\(j=1,2\)。单元 \((i,j)\) 有潜在结果 \(Y_{ij}(1)\) 与 \(Y_{ij}(0)\)。每一对里,随机让一人接受处理、另一人接受对照。令
\[ Z_i= \begin{cases} 1, & \text{若第一个单元接受处理},\\ 0, & \text{若第二个单元接受处理}. \end{cases} \]
我们可从处理分配机制正式定义 MPE。
定义 7.1(MPE)
\[ (Z_i)_{i=1}^{n}\ \stackrel{\mathrm{IID}}{\sim}\ \mathrm{Bernoulli}(1/2). \tag{7.1} \]
第 \(i\) 对内的观测结果为
\[ Y_{i1}=Z_i Y_{i1}(1)+(1-Z_i)Y_{i1}(0) = \begin{cases} Y_{i1}(1), & Z_i=1,\\ Y_{i1}(0), & Z_i=0; \end{cases} \]
\[ Y_{i2}=Z_i Y_{i2}(0)+(1-Z_i)Y_{i2}(1) = \begin{cases} Y_{i2}(0), & Z_i=1,\\ Y_{i2}(1), & Z_i=0. \end{cases} \]
观测数据便是 \((Z_i,Y_{i1},Y_{i2})_{i=1}^{n}\)。
7.2 FRT
与前面一样,我们总能用 FRT 检验尖锐原假设:
\[ H_{0\mathrm{f}}:\ Y_{ij}(1)=Y_{ij}(0) \quad\text{对所有 }i=1,\ldots,n\text{ 与 }j=1,2. \]
做 FRT 时,需按 (7.1) 模拟 \((Z_1,\ldots,Z_n)\)。下面几种经典检验统计量,都建立在对内「处理结果减对照结果」之上:
\[ \hat\tau_i = \text{对 }i\text{ 内:处理下结果}-\text{对照下结果} = (2Z_i-1)(Y_{i1}-Y_{i2}) = S_i(Y_{i1}-Y_{i2}), \]
其中 \(S_i=2Z_i-1\) 是独立同分布的随机符号,均值 \(0\)、方差 \(1\)。\(\hat\tau_i=0\) 的那些对,对随机化分布没有贡献,讨论 FRT 时可先把它们放下。
例 7.1(配对 \(t\) 统计量) 对内差的平均是
\[ \hat\tau=n^{-1}\sum_{i=1}^{n}\hat\tau_i. \]
在 \(H_{0\mathrm{f}}\) 下,\(\mathrm{E}(\hat\tau)=0\),且
\[ \operatorname{var}(\hat\tau) =n^{-2}\sum_{i=1}^{n}\operatorname{var}(\hat\tau_i) =n^{-2}\sum_{i=1}^{n}\hat\tau_i^2. \]
由独立随机变量之和的 CLT,有正态近似
\[ \frac{\hat\tau}{\sqrt{n^{-2}\sum_{i=1}^{n}\hat\tau_i^2}} \to\mathcal{N}(0,1) \quad\text{依分布}. \]
许多教科书建议在 MPE 里用配对 \(t\) 统计量
\[ t_{\mathrm{pair}} = \frac{\hat\tau} {\sqrt{\{n(n-1)\}^{-1}\sum_{i=1}^{n}(\hat\tau_i-\hat\tau)^2}}, \]
当 \(n\) 较大且 \(H_{0\mathrm{f}}\) 下 \(\hat\tau\) 较小时,它与上面几乎相同。
经典统计里,\(t_{\mathrm{pair}}\) 的动机来自另一框架:若 \(\hat\tau_i\stackrel{\mathrm{IID}}{\sim}\mathcal{N}(0,\sigma^2)\),则 \(t_{\mathrm{pair}}\sim t(n-1)\),大 \(n\) 时接近 \(\mathcal{N}(0,1)\)。R 中 t.test(..., paired=TRUE) 可做此检验。大样本下这些程序结果相近。例 7.1 的讨论,给了经典配对 \(t\) 检验另一条理由——不必假定数据正态。
例 7.2(Wilcoxon 符号秩统计量) 根据 \((|\hat\tau_1|,\ldots,|\hat\tau_n|)\) 的秩 \((R_1,\ldots,R_n)\),可定义
\[ W=\sum_{i=1}^{n}I(\hat\tau_i>0)\,R_i. \]
在 \(H_{0\mathrm{f}}\) 下 \(|\hat\tau_i|\) 固定,因而 \(R_i\) 也固定,于是
\[ \mathrm{E}(W)=\frac{n(n+1)}{4}, \qquad \operatorname{var}(W)=\frac{n(n+1)(2n+1)}{24}. \]
CLT 给出
\[ \frac{W-n(n+1)/4}{\sqrt{n(n+1)(2n+1)/24}} \to\mathcal{N}(0,1) \quad\text{依分布}. \]
R 中 wilcox.test(..., paired=TRUE) 可做精确与渐近两种检验。
例 7.3(Kolmogorov–Smirnov 型统计量) 在 \(H_{0\mathrm{f}}\) 下,绝对值 \((|\hat\tau_1|,\ldots,|\hat\tau_n|)\) 固定,符号随机。于是 \((\hat\tau_1,\ldots,\hat\tau_n)\) 与 \(-(\hat\tau_1,\ldots,\hat\tau_n)\) 应有相同分布。令 \(\hat F(t)\) 为 \(\hat\tau_i\) 的经验分布,\(1-\hat F(-t-)\) 为 \(-\hat\tau_i\) 的经验分布。Kolmogorov–Smirnov 型统计量为
\[ D=\max_t\bigl|\hat F(t)+\hat F(-t-)-1\bigr|. \]
Butler (1969) 提出过它,并给出精确与渐近分布。可惜标准软件包里没有现成实现;我们仍可用 FRT 模拟其精确分布并算 \(p\) 值。1
例 7.4(符号统计量) 符号统计量只用对内差的符号:
\[ \Delta=\sum_{i=1}^{n}I(\hat\tau_i>0). \]
在 \(H_{0\mathrm{f}}\) 下 \(I(\hat\tau_i>0)\stackrel{\mathrm{IID}}{\sim}\mathrm{Bernoulli}(1/2)\),因而 \(\Delta\sim\mathrm{Binomial}(n,1/2)\)。由此有精确二项检验,R 中 binom.test(..., p=1/2) 可做。也可用二项分布的正态近似。
例 7.5(二值结果的 McNemar 统计量) 若结果是二值的,MPE 的观测数据可压成一张更紧凑的表。每一对里,处理结果是 \(1\) 或 \(0\),对照结果也是 \(1\) 或 \(0\),于是有表 7.1:
| 对照结果 \(1\) | 对照结果 \(0\) | |
|---|---|---|
| 处理结果 \(1\) | \(m_{11}\) | \(m_{10}\) |
| 处理结果 \(0\) | \(m_{01}\) | \(m_{00}\) |
在 \(H_{0\mathrm{f}}\) 下,一致对的数目 \(m_{11}\) 与 \(m_{00}\) 固定,\(m_{10}+m_{01}\) 也固定。唯一随机的是 \(m_{10}\),其分布为
\[ m_{10}\sim\mathrm{Binomial}(m_{10}+m_{01},1/2). \]
这给出基于二项分布的精确检验。R 中 mcnemar.test 给出基于正态近似的渐近检验:
\[ \frac{m_{10}-m_{01}}{\sqrt{m_{10}+m_{01}}} \to\mathcal{N}(0,1) \quad\text{依分布}. \]
精确 FRT 与渐近检验都不依赖 \(m_{11}\) 或 \(m_{00}\)。真正起作用的,只是那些「不一致」的对——像故事只发生在意见不合的地方。
7.3 Neyman 推断
第 \(i\) 对内的平均因果效应是
\[ \tau_i=\frac12\bigl\{Y_{i1}(1)+Y_{i2}(1)-Y_{i1}(0)-Y_{i2}(0)\bigr\}, \]
全体单元的平均因果效应是
\[ \tau=n^{-1}\sum_{i=1}^{n}\tau_i =(2n)^{-1}\sum_{i=1}^{n}\sum_{j=1}^{2}\{Y_{ij}(1)-Y_{ij}(0)\}. \]
直觉上 \(\hat\tau_i\) 对 \(\tau_i\) 无偏,因而 \(\hat\tau\) 对 \(\tau\) 无偏。\(\hat\tau\) 的方差也可算;精确公式留作习题 7.1——MPE 本就是 SRE 的特例。
可我们不能照搬 SRE 的策略来估计 MPE 下 \(\hat\tau\) 的方差。对内样本方差定义不好:每一对里只有一个处理、一个对照,数据不允许我们估计第 \(i\) 对内 \(\hat\tau_i\) 的方差。
那还能估计 \(\operatorname{var}(\hat\tau)\) 吗?暂时忘掉 MPE,换到经典 IID 抽样:若 \(\hat\tau_i\) 独立同分布,均值 \(\mu\)、方差 \(\sigma^2\),则 \(\operatorname{var}(\hat\tau)=\sigma^2/n\),\(\sigma^2\) 的无偏估计是样本方差,于是
\[ \hat V=\{n(n-1)\}^{-1}\sum_{i=1}^{n}(\hat\tau_i-\hat\tau)^2 \tag{7.2} \]
是 \(\operatorname{var}(\hat\tau)\) 的无偏估计。这也可推广到独立但不同分布的情形(见附录习题 A.1)。上面的讨论看起来像跑题——MPE 的统计假定完全不同。可它至少动机了一个方差估计 \(\hat V\):用 \(\hat\tau_i\) 的对间方差,去估 \(\hat\tau\) 的方差。它是在别的假定下推出来的。对 MPE 也成立吗?定理 7.1 给了一个温暖的肯定。
定理 7.1 在 MPE 下,(7.2) 中的 \(\hat V\) 是 \(\operatorname{var}(\hat\tau)\) 的保守估计:
\[ \mathrm{E}(\hat V)-\operatorname{var}(\hat\tau) =\{n(n-1)\}^{-1}\sum_{i=1}^{n}(\tau_i-\tau)^2\ge 0. \]
若各对的 \(\tau_i\) 为常数,则 \(\mathrm{E}(\hat V)=\operatorname{var}(\hat\tau)\)。
换句话说:一般情形下 \(\hat V\) 偏保守;仅当各对平均因果效应相同时,它才无偏。这有点让人惊讶——\(\hat V\) 依赖 \(\hat\tau_i\) 的对间方差,而 \(\operatorname{var}(\hat\tau)\) 依赖每一 \(\hat\tau_i\) 的对内方差。下面的证明,或许能把这份惊讶说温柔一点。
定理 7.1 的证明。 用代数事实 \(\sum_i(a_i-\bar a)^2=\sum_i a_i^2-n\bar a^2\)(它平行于 \(\operatorname{var}(W)=\mathrm{E}(W^2)-(\mathrm{E}W)^2\)),有
\[ \begin{aligned} n(n-1)\mathrm{E}(\hat V) &= \mathrm{E}\Bigl(\sum_{i=1}^{n}(\hat\tau_i-\hat\tau)^2\Bigr) = \mathrm{E}\Bigl(\sum_{i=1}^{n}\hat\tau_i^2-n\hat\tau^2\Bigr)\\ &= \sum_{i=1}^{n}\{\operatorname{var}(\hat\tau_i)+\tau_i^2\} -n\{\operatorname{var}(\hat\tau)+\tau^2\}\\ &= n^2\operatorname{var}(\hat\tau)-n\operatorname{var}(\hat\tau) +\sum_{i=1}^{n}(\tau_i-\tau)^2. \end{aligned} \]
因而
\[ \mathrm{E}(\hat V)=\operatorname{var}(\hat\tau)+\{n(n-1)\}^{-1}\sum_{i=1}^{n}(\tau_i-\tau)^2\ge\operatorname{var}(\hat\tau). \]
与其他实验类似,Neyman 路径依赖大样本近似:若 \(n\to\infty\) 且一些正则条件成立,则 \((\hat\tau-\tau)/\sqrt{\operatorname{var}(\hat\tau)}\to\mathcal{N}(0,1)\)。因方差被高估,Wald 型区间 \(\hat\tau\pm z_{1-\alpha/2}\sqrt{\hat V}\) 覆盖 \(\tau\) 的概率至少为 \(1-\alpha\)。
点估计 \(\hat\tau\) 与方差估计 \(\hat V\),都可用 OLS 方便得到。
命题 7.1 \(\hat\tau\) 与 \(\hat V\),分别等于把向量 \((\hat\tau_1,\ldots,\hat\tau_n)^\top\) 只对截距做 OLS 时,截距的系数与方差估计。
证明留作习题 7.3。
7.4 协变量调整
设计阶段虽已按协变量配对,匹配未必完美(\(X_{i1}\ne X_{i2}\));有时还有配对时没用上的额外协变量。这时,可再调整协变量,进一步改善效率。设单元 \((i,j)\) 有协变量 \(X_{ij}\)。与 CRE 类似,MPE 里协变量调整也有两条一般策略。
7.4.1 FRT
先谈协变量调整的 FRT。平行于定义 6.2,可把结果对协变量拟合,用残差构造检验统计量——在尖锐原假设下,残差是固定数字。一种经典做法:把所有观测 \(Y_{ij}\) 对 \(X_{ij}\) 做 OLS,得残差 \(\hat\varepsilon_{ij}\),再假装 \(\hat\varepsilon_{ij}\) 就是观测结果去构造统计量。Rosenbaum (2002a) 尤其倡导把这策略用在 MPE 上。
平行于定义 6.3,也可直接用模型拟合的某些系数作检验统计量。下一小节的讨论,会提示这一策略该选哪个系数。
7.4.2 回归调整
现在聚焦估计 \(\tau\)。可像结果一样,计算协变量的对内差 \(\hat\tau_{X,i}\) 及其平均 \(\hat\tau_X\)。可以证明 \(\mathrm{E}(\hat\tau_{X,i})=0\)、\(\mathrm{E}(\hat\tau_X)=0\),且
\[ \operatorname{cov}(\hat\tau_X)=n^{-2}\sum_{i=1}^{n}\hat\tau_{X,i}\hat\tau_{X,i}^\top. \]
某次实现的 MPE 里,除非所有 \(\hat\tau_{X,i}\) 都为零,\(\operatorname{cov}(\hat\tau_X)\) 不会为零。运气不好时,\(\hat\tau_X\) 可能离零相当远。与第 6.2.2.3 节 CRE 的讨论类似,调整协变量均值的失衡,往往能改善估计效率。
考虑由 \(\gamma\) 指标的一族估计量 \(\hat\tau(\gamma)=\hat\tau-\gamma^\top\hat\tau_X\)。因 \(\mathrm{E}(\hat\tau_X)=0\),对任意固定 \(\gamma\),它的均值仍是 \(\tau\)。其方差是 \(\gamma\) 的二次函数,在
\[ \tilde\gamma=\operatorname{cov}(\hat\tau_X)^{-1}\operatorname{cov}(\hat\tau_X,\hat\tau) \]
处最小。\(\operatorname{cov}(\hat\tau_X)\) 由观测数据完全已知;可 \(\operatorname{cov}(\hat\tau_X,\hat\tau)\) 依赖未知潜在结果。幸运的是,我们能得到它的无偏估计。
定理 7.2 \(\operatorname{cov}(\hat\tau_X,\hat\tau)\) 的一个无偏估计是
\[ \hat\theta=\{n(n-1)\}^{-1}\sum_{i=1}^{n}(\hat\tau_{X,i}-\hat\tau_X)(\hat\tau_i-\hat\tau). \]
证明与定理 7.1 相似,留作习题 7.2。
于是可用
\[ \hat\gamma \approx \Bigl(\sum_{i=1}^{n}(\hat\tau_{X,i}-\hat\tau_X)(\hat\tau_{X,i}-\hat\tau_X)^\top\Bigr)^{-1} \sum_{i=1}^{n}(\hat\tau_{X,i}-\hat\tau_X)(\hat\tau_i-\hat\tau) \]
去估最优系数——它近似于把 \(\hat\tau_i\) 对 \(\hat\tau_{X,i}\)(含截距)做 OLS 时 \(\hat\tau_{X,i}\) 的系数。最终估计量为
\[ \hat\tau_{\mathrm{adj}}=\hat\tau(\hat\gamma)=\hat\tau-\hat\gamma^\top\hat\tau_X, \]
由 OLS 性质,它近似于该回归的截距。保守方差估计为
\[ \hat V_{\mathrm{adj}}=\hat V-\hat\theta^\top\operatorname{cov}(\hat\tau_X)^{-1}\hat\theta. \]
一个细微问题是:\(\hat\tau(\hat\gamma)\) 是否与 \(\hat\tau(\tilde\gamma)\) 同样最优?我们在 Lin (2013) 那里遇见过类似事。大样本下,\(\hat\tau(\hat\gamma)-\hat\tau(\tilde\gamma)=-(\hat\gamma-\tilde\gamma)^\top\hat\tau_X\) 是两个「小」项之积,阶更高。
Fogarty (2018b) 讨论了上述协变量调整的渐近等价回归形式,并给出 CLT 的严格证明。下面概括回归形式,略去正则条件。
命题 7.2 在 MPE 下,协变量调整估计 \(\hat\tau_{\mathrm{adj}}\) 及其方差估计 \(\hat V_{\mathrm{adj}}\),可方便地用「把 \(\hat\tau_i\) 对 \(1\) 与 \(\hat\tau_{X,i}\) 做 OLS」的截距及其方差估计来近似。
证明留作习题 7.3。有趣的是:命题 7.1 与 7.2 都不需要 EHW 校正。更多技术细节见 Fogarty (2018b)。因为我们已把 MPE 数据压成对内差,协变量不必再中心化——这与 CRE 下实现 Lin (2013) 不同。
7.5 例子
7.5.1 达尔文:杂交与自交对玉米株高
这是 Fisher (1935) 的经典例子:15 对玉米,杂交或自交,结果是株高。R 包 HistData 提供原始数据:cross 与 self 分别是杂交与自交下的高度,diff 是二者之差。共 15 对,MPE 有 \(2^{15}=32768\) 种可能分配,在 R 里完全枚举得动。枚举全部处理分配,计算相应的 \(\hat\tau\) 与单侧精确 \(p\) 值,得
\[ p=0.02633667. \]
原书图 7.1 画出了 \(H_{0\mathrm{f}}\) 下 \(\hat\tau\) 的精确随机化分布。
7.5.2 儿童电视工作坊实验
再分析 Ball et al. (1973) 儿童电视工作坊实验的一个子集(Imbens and Rubin, 2015, 第 10 章也分析过)。8 对班级,每对里随机让一个班在常规阅读课上看 The Electric Company。协变量是前测分数,结果是后测分数。对内差的 Neyman 估计为
\[ \hat\tau=13.425,\qquad \sqrt{\hat V}=4.636. \]
由命题 7.1 与 7.2,也可用 OLS。未调整:截距 \(13.425\)(se \(4.636\),\(p=0.023\));对前测差 diffx 调整后:截距 \(8.994\)(se \(1.410\),\(p=0.001\))。
上面把 \(n\) 当作很大。可 \(n=8\) 并不大。一共只有 \(2^8=256\) 种分配,最小可能 \(p\) 值是 \(1/256=0.0039\),比协变量调整估计的正态近似 \(p\) 值大得多。这时更合理的是:用学生化统计量(lm 给出的 \(t\) 值)做 FRT,算精确 \(p\) 值。2 双侧精确 \(p\) 值为:未调整 \(0.03125\),调整后 \(0.0078125\)。
原书图 7.2 展示了两个学生化统计量的精确分布。图提醒我们:随机化分布是离散的,最多 256 个取值;正态近似在尾部尤其不可靠。应当报告基于 FRT 的 \(p\) 值。
7.6 比较 MPE 与 CRE
Imai (2008b) 比较过 MPE 与 CRE。启发式的结论是:若匹配做得好、协变量能预测结果,MPE 给出更精确的估计。可设计阶段还没有结果数据,很难事先知道这是否成立。FRT 里,若协变量能预测结果,MPE 通常比 CRE 更强大;Greevy et al. (2004) 用 Wilcoxon 符号秩做过模拟说明。可有限样本里,事情可以很细。
考虑 \(2n\) 个单元、各一半处理与对照,在 \(0.05\) 水平检验尖锐原假设:MPE 至少需要 \(2\times 5=10\) 个单元(最小 \(p\) 值为 \(1/2^5=1/32<0.05\),而 \(1/2^4=1/16>0.05\));CRE 至少需要 \(2\times 4=8\) 个单元(最小 \(p\) 值为 \(1/\binom{8}{4}=1/70<0.05\),而 \(1/\binom{6}{3}=1/20=0.05\))。于是 8 个单元时,MPE 不可能拒绝尖锐原假设,CRE 却可以。即便协变量是结果的完美预测,仅就 FRT 而言,MPE 也并不总是优于 CRE——像把人配得再齐,若对太少,惊讶仍然不够「极端」。
7.7 推广到一般匹配实验
把 MPE 推广到「对照人数可变」的一般匹配实验,并不困难。设有 \(n\) 个匹配集,第 \(i\) 个有 \(1+M_i\) 个单元,\(M_i\) 可以不同。总人数 \(N=n+\sum_{i=1}^{n}M_i\)。单元 \(ij\)(第 \(i\) 集内第 \(j\) 人)有潜在结果 \(Y_{ij}(1)\)、\(Y_{ij}(0)\)。
在第 \(i\) 个匹配集内,实验者随机选恰好一人接受处理,其余 \(M_i\) 人接受对照。这仍是 SRE 的特例:\(n\) 层,第 \(i\) 层大小为 \(1+M_i\)。观测结果 \(Y_{ij}=Z_{ij}Y_{ij}(1)+(1-Z_{ij})Y_{ij}(0)\)。集内平均因果效应
\[ \tau_i=(M_i+1)^{-1}\sum_{j=1}^{1+M_i}\{Y_{ij}(1)-Y_{ij}(0)\}, \]
无偏估计是集内均值差 \(\hat\tau_i\)。
7.7.1 FRT
照例可用 FRT 检验尖锐原假设。因这是「许多小层」的 SRE,可用例 5.4、5.5、7.2、7.3、7.4 的统计量,以及下面两小节的估计量与相应 \(t\) 统计量。
7.7.2 估计层内效应的平均
先估计层内效应的平均 \(\tau=n^{-1}\sum_{i=1}^{n}\tau_i\),无偏估计为 \(\hat\tau=n^{-1}\sum_{i=1}^{n}\hat\tau_i\)。有趣的是:定理 7.1 对一般匹配实验仍然成立,MPE 的其他结果也类似。尤其是:把 \(\hat\tau_i\) 对截距做 OLS,可得 \(\tau\) 的点估计与方差估计;有协变量时,把 \(\hat\tau_i\) 对截距与 \(\hat\tau_{X,i}\) 做 OLS,其中 \(\hat\tau_{X,i}\) 是匹配集 \(i\) 内协变量的均值差。
7.7.3 更一般的因果估计目标
重要的是:上面的 \(\tau\) 是各 \(\tau_i\) 的平均;当 \(M_i\) 不同时,它不等于实验中 \(N\) 个单元的平均因果效应。后者为
\[ \tau'=N^{-1}\sum_{i=1}^{n}\sum_{j=1}^{1+M_i}\{Y_{ij}(1)-Y_{ij}(0)\} =\sum_{i=1}^{n}\frac{1+M_i}{N}\tau_i. \]
为统一讨论,考虑加权因果效应 \(\tau_w=\sum_{i=1}^{n}w_i\tau_i\)(\(\sum w_i=1\)),\(\tau\) 对应 \(w_i=n^{-1}\),\(\tau'\) 对应 \(w_i=(1+M_i)/N\)。无偏估计 \(\hat\tau_w=\sum_i w_i\hat\tau_i\),方差 \(\operatorname{var}(\hat\tau_w)=\sum_i w_i^2\operatorname{var}(\hat\tau_i)\)。
可估计这个方差相当棘手:\(\hat\tau_i\) 独立,却没有重复。这是理论统计里的著名问题(Hartley et al., 1969; Rao, 1970)。Fogarty (2018a) 也讨论过,但未识别这些先前工作。最终形式是
\[ \hat V_w=\sum_{i=1}^{n}c_i(\hat\tau_i-\hat\tau_w)^2, \qquad c_i=\frac{w_i^2/(1-2w_i)}{1+\sum_{i=1}^{n}w_i^2/(1-2w_i)}. \]
作为健全性检查:MPE 中 \(M_i=1\)、\(w_i=n^{-1}\) 时,\(c_i\) 回到 \(\{n(n-1)\}^{-1}\)。为简单起见,聚焦所有 \(w_i<1/2\) 的情形——没有哪个匹配集占了超过一半的总权重。
定理 7.3 在 \(M_i\) 可变的一般匹配实验中,若对所有 \(i\) 有 \(w_i<1/2\),则
\[ \mathrm{E}(\hat V_w)-\operatorname{var}(\hat\tau_w) =\sum_{i=1}^{n}c_i(\tau_i-\tau_w)^2\ge 0, \]
当 \(\tau_i\) 为常数时等号成立。
\(\hat V_w\) 的理论动机相当绕,直接验证定理 7.3 却并不太难。证明留作习题 7.9。
7.8 习题
7.1 MPE 中 \(\hat\tau\) 的真实方差 用潜在结果的有限总体方差表示 \(\operatorname{var}(\hat\tau)\)。
7.2 一个协方差估计 证明定理 7.2。
7.3 经由 OLS 的方差估计 证明命题 7.1 与 7.2。
7.4 二值结果的点估计与方差估计 把例 7.5 推广到 Neyman 推断:用表 7.1 的计数表示 \(\hat\tau\) 与 \(\hat V\)。
7.5 FRT 的最小样本量 把 7.6 节的讨论推广到水平 \(0.001\):MPE 与 CRE 各自最小的 \(n\) 是多少,才能使最小 \(p\) 值不超过 \(0.001\)?
7.6 再分析达尔文数据 用 Wilcoxon 符号秩做 FRT;再做 Neyman 推断:报告无偏点估计、保守方差估计与 95% 置信区间。
7.7 再分析儿童电视工作坊数据 用不同检验统计量做 FRT;再做带协变量调整的 FRT。
7.8 再分析 Angrist and Lavy (2009) 的数据 请只关注原文表 A1,把学校当作实验单元。去掉第 6 对以及有不依从的对后,剩 14 个完整对(数据见 AL2009.csv)。结果是 2001、2002 年 Bagrut 通过率,1999、2000 年为预处理协变量。请做有/无协变量的 Neyman 推断;尤其是,第 25 对有缺失结果,你打算怎么处理?
7.9 一般匹配实验中的方差估计 先把定理 7.1 推广到一般匹配实验;再证明定理 7.3。
注: 第二部分可先验证 \(\hat\tau_i-\hat\tau_w\) 均值为 \(\tau_i-\tau_w\),方差为 \(\operatorname{var}(\hat\tau_w)+(1-2w_i)\operatorname{var}(\hat\tau_i)\)。
7.10 推荐阅读 Greevy et al. (2004) 给出基于协变量形成配对的算法;Imai (2008b) 讨论无协变量时平均因果效应的估计;Fogarty (2018b) 讨论 MPE 中的协变量调整。