第 13 章 处理组上的平均因果效应及其他估计目标
第 10–12 章,一直围着平均因果效应 \(\tau=\mathrm{E}\{Y(1)-Y(0)\}\) 转,假定可忽略性与重叠。概念上,把它推到处理组与对照组上的平均因果效应,并不远:
\[ \tau_{\mathrm{T}} = \mathrm{E}\{Y(1)-Y(0)\mid Z=1\}, \qquad \tau_{\mathrm{C}} = \mathrm{E}\{Y(1)-Y(0)\mid Z=0\}. \]
若 \(\tau_{\mathrm{T}}\)、\(\tau_{\mathrm{C}}\) 与 \(\tau\) 不同,平均因果效应在处理组与对照组之间就是异质的。该估哪一个,取决于你真正想回答的问题。
因为对称,这一章聚焦 \(\tau_{\mathrm{T}}\)。13.4 节再谈别的估计目标。
13.1 \(\tau_{\mathrm{T}}\) 的非参数识别
处理组上的平均因果效应等于
\[ \tau_{\mathrm{T}} = \mathrm{E}(Y\mid Z=1)-\mathrm{E}\{Y(0)\mid Z=1\}, \]
第一项 \(\mathrm{E}(Y\mid Z=1)\) 能直接从数据识别,第二项 \(\mathrm{E}\{Y(0)\mid Z=1\}\) 却是反事实。识别第二项的关键,是下面这条「单侧」的可忽略性与重叠。
假设 13.1 \(Z\perp\!\!\!\perp Y(0)\mid X\),且 \(e(X)<1\)。
因为关键只是认出 \(\mathrm{E}\{Y(0)\mid Z=1\}\),可忽略性与重叠都只需这一侧。在假设 13.1 下,有如下识别结果。
定理 13.1 在假设 13.1 下,
\[ \mathrm{E}\{Y(0)\mid Z=1\} = \mathrm{E}\bigl\{\mathrm{E}(Y\mid Z=0,X)\mid Z=1\bigr\} = \int \mathrm{E}(Y\mid Z=0,X=x)\,f(x\mid Z=1)\,dx. \]
定理 13.1 说:反事实均值 \(\mathrm{E}\{Y(0)\mid Z=1\}\),等于对照下观测结果的条件均值,再按处理组的协变量分布去平均。于是 \(\tau_{\mathrm{T}}\) 非参数可识别:
\[ \tau_{\mathrm{T}} = \mathrm{E}(Y\mid Z=1) - \mathrm{E}\bigl\{\mathrm{E}(Y\mid Z=0,X)\mid Z=1\bigr\}. \tag{13.1} \]
定理 13.1 的证明 我们有
\[ \begin{aligned} \mathrm{E}\{Y(0)\mid Z=1\} &= \mathrm{E}\bigl[\mathrm{E}\{Y(0)\mid Z=1,X\}\mid Z=1\bigr]\\ &= \mathrm{E}\bigl[\mathrm{E}\{Y(0)\mid Z=0,X\}\mid Z=1\bigr]\\ &= \mathrm{E}\bigl\{\mathrm{E}(Y\mid Z=0,X)\mid Z=1\bigr\}\\ &= \int \mathrm{E}(Y\mid Z=0,X=x)\,f(x\mid Z=1)\,dx. \end{aligned} \]
\(\square\)
\(X\) 离散时,定理 13.1 的识别公式收成
\[ \mathrm{E}\{Y(0)\mid Z=1\} = \sum_{k=1}^{K} \mathrm{E}(Y\mid Z=0,X=k)\,\operatorname{pr}(X=k\mid Z=1), \]
并提示 \(\tau_{\mathrm{T}}\) 的分层估计量
\[ \hat\tau_{\mathrm{T}} = \hat{\bar Y}(1) - \sum_{k=1}^{K} \hat\pi_{[k]\mid 1}\,\hat{\bar Y}_{[k]}(0), \]
其中 \(\hat\pi_{[k]\mid 1}=n_{[k]1}/n_1\) 是处理组里 \(X\) 取第 \(k\) 类的比例。
\(X\) 连续时,要用对照组去拟合 \(\mathrm{E}(Y\mid Z=0,X)\)。若对照潜在结果的拟合值是 \(\hat\mu_0(X_i)\),则结果回归估计量是
\[ \hat\tau_{\mathrm{T}}^{\mathrm{reg}} = \hat{\bar Y}(1) - n_1^{-1}\sum_{i=1}^{n}Z_i\hat\mu_0(X_i) = n_1^{-1}\sum_{i=1}^{n}Z_i\bigl\{Y_i-\hat\mu_0(X_i)\bigr\}. \]
例 13.1 若对所有单元设定线性模型
\[ \mathrm{E}(Y\mid Z,X)=\beta_0+\beta_z Z+\beta_x^\top X, \]
则
\[ \tau_{\mathrm{T}} = \mathrm{E}\bigl\{\mathrm{E}(Y\mid Z=1,X)-\mathrm{E}(Y\mid Z=0,X)\mid Z=1\bigr\} = \beta_z. \]
对全体做 OLS 得到 \((\hat\beta_0,\hat\beta_z,\hat\beta_x)\),就可以用 \(\hat\beta_z\) 去估 \(\tau_{\mathrm{T}}\)。第 10.4.2 节说过 \(\hat\beta_z\) 是 \(\tau\) 的估计;这个例子进一步说,它也是 \(\tau_{\mathrm{T}}\) 的估计。并不奇怪:线性模型假定各单元的因果效应是常数。
例 13.2 识别公式只依赖 \(\mathrm{E}(Y\mid Z=0,X)\),因而只需为对照组设定模型。当这个模型是线性的,
\[ \mathrm{E}(Y\mid Z=0,X)=\beta_{0\mid 0}+\beta_{x\mid 0}^\top X, \]
就有
\[ \begin{aligned} \tau_{\mathrm{T}} &= \mathrm{E}(Y\mid Z=1)-\mathrm{E}(\beta_{0\mid 0}+\beta_{x\mid 0}^\top X\mid Z=1)\\ &= \mathrm{E}(Y\mid Z=1)-\beta_{0\mid 0}-\beta_{x\mid 0}^\top\mathrm{E}(X\mid Z=1). \end{aligned} \]
只用对照组做 OLS,得到 \((\hat\beta_{0\mid 0},\hat\beta_{x\mid 0})\),估计便是
\[ \hat\tau_{\mathrm{T}} = \hat{\bar Y}(1)-\hat\beta_{0\mid 0}-\hat\beta_{x\mid 0}^\top\hat{\bar X}(1). \]
由 OLS 的性质(见附录 B.5),
\[ \hat{\bar Y}(0)=\hat\beta_{0\mid 0}+\hat\beta_{x\mid 0}^\top\hat{\bar X}(0). \]
于是上面的估计收成
\[ \hat\tau_{\mathrm{T}} = \bigl\{\hat{\bar Y}(1)-\hat{\bar Y}(0)\bigr\} - \hat\beta_{x\mid 0}^\top \bigl\{\hat{\bar X}(1)-\hat{\bar X}(0)\bigr\}, \]
形式与第 6 章的协方差调整估计量类似,只是协变量均值差前面的系数不同。
作为线性代数事实:把协变量中心化成 \(X_i-\hat{\bar X}(1)\),这个估计量就等于「结果对处理、协变量及其交互做 OLS」时 \(Z\) 的系数。细节见习题 13.2。
13.2 \(\tau_{\mathrm{T}}\) 的逆倾向得分加权与双重稳健估计
定理 13.2 在假设 13.1 下,
\[ \mathrm{E}\{Y(0)\mid Z=1\} = \mathrm{E}\left\{ \frac{e(X)}{e}\cdot\frac{1-Z}{1-e(X)}\,Y \right\} \tag{13.2} \]
且
\[ \tau_{\mathrm{T}} = \mathrm{E}(Y\mid Z=1) - \mathrm{E}\left\{ \frac{e(X)}{e}\cdot\frac{1-Z}{1-e(X)}\,Y \right\}, \tag{13.3} \]
其中 \(e=\operatorname{pr}(Z=1)\) 是处理的边际概率。
定理 13.2 的证明 (13.2) 的左边等于
\[ \begin{aligned} \mathrm{E}\{Y(0)\mid Z=1\} &= \mathrm{E}\{ZY(0)\}/e\\ &= \mathrm{E}\bigl[\mathrm{E}(Z\mid X)\,\mathrm{E}\{Y(0)\mid X\}\bigr]/e\\ &= \mathrm{E}\bigl[e(X)\,\mathrm{E}\{Y(0)\mid X\}\bigr]/e. \end{aligned} \]
右边等于
\[ \begin{aligned} &\mathrm{E}\left\{\frac{e(X)}{e}\cdot\frac{1-Z}{1-e(X)}\,Y\right\}\\ &= \mathrm{E}\left[ \mathrm{E}\left\{\frac{e(X)}{e}\cdot\frac{1-Z}{1-e(X)}\,Y(0)\Bigm| X\right\} \right]\\ &= \mathrm{E}\left[ \frac{e(X)}{e\{1-e(X)\}}\,\mathrm{E}\bigl\{(1-Z)Y(0)\mid X\bigr\} \right]\\ &= \mathrm{E}\left[ \frac{e(X)}{e\{1-e(X)\}}\,\mathrm{E}(1-Z\mid X)\,\mathrm{E}\{Y(0)\mid X\} \right]\\ &= \mathrm{E}\bigl[e(X)\,\mathrm{E}\{Y(0)\mid X\}\bigr]/e. \end{aligned} \]
于是 (13.2) 成立。\(\square\)
由此有两个 IPW 估计量
\[ \hat\tau_{\mathrm{T}}^{\mathrm{ht}} = \hat{\bar Y}(1) - n_1^{-1}\sum_{i=1}^{n}\hat o(X_i)(1-Z_i)Y_i \]
与
\[ \hat\tau_{\mathrm{T}}^{\mathrm{hajek}} = \hat{\bar Y}(1) - \frac{\displaystyle\sum_{i=1}^{n}\hat o(X_i)(1-Z_i)Y_i} {\displaystyle\sum_{i=1}^{n}\hat o(X_i)(1-Z_i)}, \]
其中 \(\hat o(X_i)=\hat e(X_i)/\{1-\hat e(X_i)\}\) 是给定协变量时处理的拟合优势(odds)。
也可以把倾向得分模型与结果模型合在一起,得到 \(\mathrm{E}\{Y(0)\mid Z=1\}\) 的双重稳健估计。定义
\[ \tilde\mu_{0\mathrm{T}}^{\mathrm{dr}} = \mathrm{E}\bigl[ o(X,\alpha)(1-Z)\bigl\{Y-\mu_0(X,\beta_0)\bigr\} + Z\mu_0(X,\beta_0) \bigr]/e, \tag{13.4} \]
其中 \(o(X,\alpha)=e(X,\alpha)/\{1-e(X,\alpha)\}\)。
定理 13.3 在假设 13.1 下,若 \(e(X,\alpha)=e(X)\) 或 \(\mu_0(X,\beta_0)=\mu_0(X)\),则 \(\tilde\mu_{0\mathrm{T}}^{\mathrm{dr}}=\mathrm{E}\{Y(0)\mid Z=1\}\)。
定理 13.3 的证明 有分解
\[ \begin{aligned} &e\bigl[\tilde\mu_{0\mathrm{T}}^{\mathrm{dr}}-\mathrm{E}\{Y(0)\mid Z=1\}\bigr]\\ &= \mathrm{E}\bigl[o(X,\alpha)(1-Z)\bigl\{Y(0)-\mu_0(X,\beta_0)\bigr\}+Z\mu_0(X,\beta_0)\bigr] - \mathrm{E}\{ZY(0)\}\\ &= \mathrm{E}\bigl[o(X,\alpha)(1-Z)\bigl\{Y(0)-\mu_0(X,\beta_0)\bigr\}-Z\bigl\{Y(0)-\mu_0(X,\beta_0)\bigr\}\bigr]\\ &= \mathrm{E}\bigl[\bigl\{o(X,\alpha)(1-Z)-Z\bigr\}\bigl\{Y(0)-\mu_0(X,\beta_0)\bigr\}\bigr]\\ &= \mathrm{E}\left[ \frac{e(X,\alpha)-Z}{1-e(X,\alpha)}\bigl\{Y(0)-\mu_0(X,\beta_0)\bigr\} \right]\\ &= \mathrm{E}\left[ \mathrm{E}\left\{\frac{e(X,\alpha)-Z}{1-e(X,\alpha)}\Bigm| X\right\} \times \mathrm{E}\bigl\{Y(0)-\mu_0(X,\beta_0)\mid X\bigr\} \right]\\ &= \mathrm{E}\left[ \frac{e(X,\alpha)-e(X)}{1-e(X,\alpha)} \times \bigl\{\mu_0(X)-\mu_0(X,\beta_0)\bigr\} \right]. \end{aligned} \]
因此,只要 \(e(X,\alpha)=e(X)\) 或 \(\mu_0(X,\beta_0)=\mu_0(X)\),就有 \(\tilde\mu_{0\mathrm{T}}^{\mathrm{dr}}-\mathrm{E}\{Y(0)\mid Z=1\}=0\)。\(\square\)
有了 (13.4) 里 \(\tilde\mu_{0\mathrm{T}}^{\mathrm{dr}}\) 的总体版本,就可以用样本版本去构造 \(\tau_{\mathrm{T}}\) 的双重稳健估计。
定义 13.1(\(\tau_{\mathrm{T}}\) 的双重稳健估计量) 基于数据 \((X_i,Z_i,Y_i)_{i=1}^{n}\),可按下面几步得到 \(\tau_{\mathrm{T}}\) 的双重稳健估计:
- 得到倾向得分的拟合值 \(e(X_i,\hat\alpha)\),再得到优势的拟合值 \(o(X_i,\hat\alpha)=e(X_i,\hat\alpha)/(1-e(X_i,\hat\alpha))\);
- 得到对照下结果均值的拟合值 \(\mu_0(X_i,\hat\beta_0)\);
- 构造双重稳健估计量:\(\hat\tau_{\mathrm{T}}^{\mathrm{dr}}=\hat{\bar Y}(1)-\hat\mu_{0\mathrm{T}}^{\mathrm{dr}}\),其中
\[ \hat\mu_{0\mathrm{T}}^{\mathrm{dr}} = \frac{1}{n_1}\sum_{i=1}^{n} \Bigl[ o(X_i,\hat\alpha)(1-Z_i)\bigl\{Y_i-\mu_0(X_i,\hat\beta_0)\bigr\} + Z_i\mu_0(X_i,\hat\beta_0) \Bigr]. \]
由定义 13.1,可以把 \(\hat\tau_{\mathrm{T}}^{\mathrm{dr}}\) 改写成
\[ \hat\tau_{\mathrm{T}}^{\mathrm{dr}} = \hat\tau_{\mathrm{T}}^{\mathrm{reg}} - \frac{1}{n_1}\sum_{i=1}^{n} o(X_i,\hat\alpha)(1-Z_i)\bigl\{Y_i-\mu_0(X_i,\hat\beta_0)\bigr\} \]
或
\[ \hat\tau_{\mathrm{T}}^{\mathrm{dr}} = \hat\tau_{\mathrm{T}}^{\mathrm{ht}} - \frac{1}{n_1}\sum_{i=1}^{n} \bigl\{Z_i-o(X_i,\hat\alpha)(1-Z_i)\bigr\}\mu_0(X_i,\hat\beta_0). \]
与 \(\hat\tau^{\mathrm{dr}}\) 的讨论类似,可以从 \((Z_i,X_i,Y_i)_{i=1}^{n}\) 做自助,去估 \(\hat\tau_{\mathrm{T}}^{\mathrm{dr}}\) 的方差。Hahn (1998)、Mercatanti and Li (2014)、Shinozaki and Matsuyama (2015) 与 Yang and Ding (2018b) 是估 \(\tau_{\mathrm{T}}\) 的参考文献。
13.3 一个例子
下面的 R 函数实现 \(\tau_{\mathrm{T}}\) 的两个结果回归估计、两个 IPW 估计,以及双重稳健估计。为避免估计倾向得分过于极端,也可以只从上方截断。
ATT.est = function(z, y, x, out.family = gaussian, Utruncps = 1)
{
## sample size
nn = length(z)
nn1 = sum(z)
## fitted propensity score
pscore = glm(z ~ x, family = binomial)$fitted.values
pscore = pmin(Utruncps, pscore)
odds = pscore/(1 - pscore)
## fitted potential outcomes
outcome0 = glm(y ~ x, weights = (1 - z),
family = out.family)$fitted.values
## outcome regression estimator
ace.reg0 = lm(y ~ z + x)$coef[2]
ace.reg = mean(y[z==1]) - mean(outcome0[z==1])
## propensity score weighting estimator
ace.ipw0 = mean(y[z==1]) -
mean(odds*(1 - z)*y)*nn/nn1
ace.ipw = mean(y[z==1]) -
mean(odds*(1 - z)*y)/mean(odds*(1 - z))
## doubly robust estimator
res0 = y - outcome0
ace.dr = ace.reg - mean(odds*(1 - z)*res0)*nn/nn1
return(c(ace.reg0, ace.reg, ace.ipw0, ace.ipw, ace.dr))
}下面的函数再实现自助法方差估计。
OS_ATT = function(z, y, x, n.boot = 10^2,
out.family = gaussian, Utruncps = 1)
{
point.est = ATT.est(z, y, x, out.family, Utruncps)
## nonparametric bootstrap
n = length(z)
x = as.matrix(x)
boot.est = replicate(n.boot, {
id.boot = sample(1:n, n, replace = TRUE)
ATT.est(z[id.boot], y[id.boot], x[id.boot, ],
out.family, Utruncps)
})
boot.se = apply(boot.est, 1, sd)
res = rbind(point.est, boot.se)
rownames(res) = c("est", "se")
colnames(res) = c("reg0", "reg", "HT", "Hajek", "DR")
return(res)
}现在回到例 10.3,去估 \(\tau_{\mathrm{T}}\)。不截断估计倾向得分时:
| reg0 | reg | HT | Hajek | DR | |
|---|---|---|---|---|---|
| est | \(0.061\) | \(-0.351\) | \(-1.992\) | \(-0.351\) | \(-0.187\) |
| se | \(0.227\) | \(0.258\) | \(0.705\) | \(0.328\) | \(0.287\) |
把估计倾向得分从上方截断在 \(0.9\) 时:
| reg0 | reg | HT | Hajek | DR | |
|---|---|---|---|---|---|
| est | \(0.061\) | \(-0.351\) | \(-0.597\) | \(-0.192\) | \(-0.230\) |
| se | \(0.223\) | \(0.255\) | \(0.579\) | \(0.302\) | \(0.276\) |
HT 估计量对截断很敏感,这在意料之中。例 13.1 的回归估计与其余估计差得相当远:它多加了一条不必需的假定——处理组与对照组的回归函数,对 \(X\) 共用同一套系数。例 13.2 的回归估计则更靠近 Hajek 与双重稳健。上面这些估计与 12.3.3 节的略有不同,提示 \(\tau_{\mathrm{T}}\) 与 \(\tau\) 之间存在着处理效应异质性。
13.4 其他估计目标
Li et al. (2018a) 对观察性研究里的因果估计目标给过一个统一讨论。从条件平均因果效应 \(\tau(X)\) 出发,他们提出一类一般的估计目标
\[ \tau^h = \frac{\mathrm{E}\{h(X)\tau(X)\}}{\mathrm{E}\{h(X)\}}, \]
由加权函数 \(h(X)\) 标记,并要求 \(\mathrm{E}\{h(X)\}\ne 0\)。分母里的归一化,是为了保证:若因果效应是常数 \(\tau(X)=\tau\),平均之后仍是同一个 \(\tau\)。
在可忽略性下,
\[ \tau^h = \frac{\mathrm{E}\bigl[h(X)\{\mu_1(X)-\mu_0(X)\}\bigr]}{\mathrm{E}\{h(X)\}}, \]
并提示结果回归估计量
\[ \hat\tau^h = \frac{\displaystyle\sum_{i=1}^{n}h(X_i)\bigl\{\hat\mu_1(X_i)-\hat\mu_0(X_i)\bigr\}} {\displaystyle\sum_{i=1}^{n}h(X_i)}. \]
进而,\(\tau^h\) 还有如下加权形式。
定理 13.4 在可忽略性与重叠假定下,
\[ \tau^h = \mathrm{E}\left\{ \frac{ZY\,h(X)}{e(X)} - \frac{(1-Z)Y\,h(X)}{1-e(X)} \right\} \Big/ \mathrm{E}\{h(X)\}. \]
定理 13.4 的证明与定理 11.2、13.2 相近,留给习题 13.9。据此可构造 \(\tau^h\) 相应的 IPW 估计量。
由定理 13.4,每个单元身上有两份权重:一份来自估计目标的定义,一份来自倾向得分的倒数。最终,处理单元的权重是 \(h(X)/e(X)\),对照单元的权重是 \(h(X)/\{1-e(X)\}\)。Li et al. (2018a, 表 1) 汇总了若干估计目标,下面摘一部分:
| 总体 | \(h(X)\) | 估计目标 | 权重(处理 / 对照) |
|---|---|---|---|
| 合并 | \(1\) | \(\tau\) | \(1/e(X)\) 与 \(1/\{1-e(X)\}\) |
| 处理组 | \(e(X)\) | \(\tau_{\mathrm{T}}\) | \(1\) 与 \(e(X)/\{1-e(X)\}\) |
| 对照组 | \(1-e(X)\) | \(\tau_{\mathrm{C}}\) | \(\{1-e(X)\}/e(X)\) 与 \(1\) |
| 重叠 | \(e(X)\{1-e(X)\}\) | \(\tau_{\mathrm{O}}\) | \(1-e(X)\) 与 \(e(X)\) |
重叠总体(overlap population)以及相应的估计目标
\[ \tau_{\mathrm{O}} = \frac{\mathrm{E}\bigl[e(X)\{1-e(X)\}\tau(X)\bigr]} {\mathrm{E}\bigl[e(X)\{1-e(X)\}\bigr]} \]
对我们是新的。这个估计目标把最大的权重给 \(e(X)=1/2\) 附近的单元,并压低倾向得分极端的单元。一个温柔的优点是:它的 IPW 估计量更稳定,分母里不必出现可能极小的 \(e(X)\) 与 \(1-e(X)\)。若 \(e(X)\perp\!\!\!\perp\tau(X)\)——包括 \(\tau(X)=\tau\) 这个特例——则 \(\tau_{\mathrm{O}}\) 收成 \(\tau\)。一般情形里,\(\tau_{\mathrm{O}}\) 却可能引起争议:它换了最初的总体,而且还依赖可能设错的倾向得分。Li et al. (2018a) 与 Li et al. (2019) 给过一些辩护与数值证据。这个估计目标会在第 14 章再出现。
也可以构造 \(\tau^h\) 的双重稳健估计量。细节留给习题 13.10。
13.5 习题
13.1 比较 \(\tau_{\mathrm{T}}\)、\(\tau_{\mathrm{C}}\) 与 \(\tau\)
假定 \(Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid X\)。记 \(e(X)=\operatorname{pr}(Z=1\mid X)\) 为倾向得分,\(e=\operatorname{pr}(Z=1)\) 为处理的边际概率,\(\tau(X)=\mathrm{E}\{Y(1)-Y(0)\mid X\}\) 为 CATE。证明
\[ \tau_{\mathrm{T}}-\tau = \frac{\operatorname{cov}\{e(X),\tau(X)\}}{e}, \qquad \tau_{\mathrm{C}}-\tau = -\frac{\operatorname{cov}\{e(X),\tau(X)\}}{1-e}. \]
注: 上面的结果也蕴含 \(\tau_{\mathrm{T}}-\tau_{\mathrm{C}}=\operatorname{cov}\{e(X),\tau(X)\}/\{e(1-e)\}\)。因此 \(\tau_{\mathrm{T}}\)、\(\tau_{\mathrm{C}}\)、\(\tau\) 之间的差别,取决于倾向得分与 CATE 的协方差。当 \(e(X)\) 与 \(\tau(X)\) 不相关时,这些差别为零。
13.2 关于 \(\tau_{\mathrm{T}}\) 的一个回归估计量的代数事实
这道题给例 13.2 补细节。
证明:若把所有单元的协变量中心化成 \(X_i-\hat{\bar X}(1)\),则 \(\hat\tau_{\mathrm{T}}\) 等于「结果对截距、处理、协变量及其交互做 OLS」时 \(Z\) 的系数。
13.3 处理组上平均因果效应的模拟
第 12 章对 \(\tau\) 做了一些模拟。请对 \(\tau_{\mathrm{T}}\) 做类似模拟:倾向得分模型或结果模型,对或错都可以。你可以换模型参数、加更多设定、加更多自助重复。报告你的发现,至少包括偏倚、方差,以及自助法得到的方差估计。也可以报告估计量的其他性质,例如渐近正态性,以及置信区间的覆盖率。
13.4 \(\tau_{\mathrm{T}}\) 的双重稳健估计量的另一种形式
受 (13.4) 启发,\(\mathrm{E}\{Y(0)\mid Z=1\}\) 还有另一种双重稳健形式:
\[ \tilde\mu_{0\mathrm{T}}^{\mathrm{dr2}} = \frac{ \mathrm{E}\bigl[o(X,\alpha)(1-Z)\bigl\{Y-\mu_0(X,\beta_0)\bigr\}\bigr] }{ \mathrm{E}\bigl[o(X,\alpha)(1-Z)\bigr] } + \mathrm{E}\bigl\{Z\mu_0(X,\beta_0)\bigr\}/e. \]
证明:在假设 13.1 下,若 \(e(X,\alpha)=e(X)\) 或 \(\mu_0(X,\beta_0)=\mu_0(X)\),则 \(\tilde\mu_{0\mathrm{T}}^{\mathrm{dr2}}=\mathrm{E}\{Y(0)\mid Z=1\}\)。再给出 \(\tau_{\mathrm{T}}\) 的双重稳健估计量的样本版本。
13.5 对照组上的平均因果效应
证明 \(\tau_{\mathrm{C}}\) 的识别公式,与 (13.1)、(13.3) 对偶。再给出 \(\tau_{\mathrm{C}}\) 的双重稳健估计量。
13.6 估个体效应与条件平均因果效应
假定 \(\{Z_i,X_i,Y_i(1),Y_i(0)\}_{i=1}^{n}\stackrel{\mathrm{IID}}{\sim}\{Z,X,Y(1),Y(0)\}\)。个体效应是 \(\tau_i=Y_i(1)-Y_i(0)\),条件平均因果效应是 \(\tau(X_i)=\mathrm{E}\{Y_i(1)-Y_i(0)\mid X_i\}\)。因为要谈个体效应,下标 \(i\) 不再省掉——\(\tau\) 已经用来表示平均因果效应,不是 \(Y(1)-Y(0)\) 的总体版本。
- 在随机化 \(Z_i\perp\!\!\!\perp\{Y_i(1),Y_i(0)\}\) 且 \(e=\operatorname{pr}(Z_i=1)\) 下,证明
\[ \delta_i = \frac{Z_i Y_i}{e} - \frac{(1-Z_i)Y_i}{1-e} \]
是个体效应的无偏预测,意思是 \(\mathrm{E}(\delta_i-\tau_i)=0\)(\(i=1,\ldots,n\))。再证明对所有 \(i=1,\ldots,n\),\(\mathrm{E}(\delta_i)=\tau\)。
- 在可忽略性 \(Z_i\perp\!\!\!\perp\{Y_i(1),Y_i(0)\}\mid X_i\) 且 \(e(X_i)=\operatorname{pr}(Z_i=1\mid X_i)\) 下,证明
\[ \delta_i = \frac{Z_i Y_i}{e(X_i)} - \frac{(1-Z_i)Y_i}{1-e(X_i)} \]
是个体效应与条件平均因果效应的无偏预测,意思是
\[ \mathrm{E}(\delta_i-\tau_i)=0, \qquad \mathrm{E}\bigl\{\delta_i-\tau(X_i)\bigr\}=0 \qquad(i=1,\ldots,n). \]
再证明对所有 \(i=1,\ldots,n\),\(\mathrm{E}(\delta_i)=\tau\)。
13.7 一般估计目标与 \((\tau_{\mathrm{T}},\tau_{\mathrm{C}})\)
假定无混杂。证明:若 \(h(X)=e(X)\),则 \(\tau^h=\tau_{\mathrm{T}}\);若 \(h(X)=1-e(X)\),则 \(\tau^h=\tau_{\mathrm{C}}\)。
13.8 关于 \(\tau_{\mathrm{O}}\) 的更多结果
证明
\[ \tau_{\mathrm{O}} = \frac{\mathrm{E}\bigl[\{1-e(X)\}\tau(X)\mid Z=1\bigr]} {\mathrm{E}\{1-e(X)\mid Z=1\}} = \frac{\mathrm{E}\bigl\{e(X)\tau(X)\mid Z=0\bigr\}} {\mathrm{E}\{e(X)\mid Z=0\}}. \]
13.9 一般估计目标的 IPW
证明定理 13.4。
13.10 一般估计目标的双重稳健估计
对给定的 \(h(X)\),可用下面的公式构造 \(\tau^h\) 的双重稳健估计:
\[ \tilde\mu_1^{h,\mathrm{dr}} = \mathrm{E}\left[ \frac{Zh(X)\bigl\{Y-\mu_1(X,\beta_1)\bigr\}}{e(X,\alpha)} + h(X)\mu_1(X,\beta_1) \right], \]
\[ \tilde\mu_0^{h,\mathrm{dr}} = \mathrm{E}\left[ \frac{(1-Z)h(X)\bigl\{Y-\mu_0(X,\beta_0)\bigr\}}{1-e(X,\alpha)} + h(X)\mu_0(X,\beta_0) \right]. \]
证明:在可忽略性与重叠下,
- 若 \(e(X,\alpha)=e(X)\) 或 \(\mu_1(X,\beta_1)=\mu_1(X)\),则 \(\tilde\mu_1^{h,\mathrm{dr}}=\mathrm{E}\{h(X)Y(1)\}\);
- 若 \(e(X,\alpha)=e(X)\) 或 \(\mu_0(X,\beta_0)=\mu_0(X)\),则 \(\tilde\mu_0^{h,\mathrm{dr}}=\mathrm{E}\{h(X)Y(0)\}\);
- 若 \(e(X,\alpha)=e(X)\),或 \(\{\mu_1(X,\beta_1)=\mu_1(X),\,\mu_0(X,\beta_0)=\mu_0(X)\}\),则
\[ \frac{\tilde\mu_1^{h,\mathrm{dr}}-\tilde\mu_0^{h,\mathrm{dr}}}{\mathrm{E}\{h(X)\}} =\tau^h. \]
注: Tao and Fu (2019) 证明了上面这些结果。可它们只对给定的 \(h(X)\) 成立。最有意思的情形——\(\tau_{\mathrm{T}}\)、\(\tau_{\mathrm{C}}\) 与 \(\tau_{\mathrm{O}}\)——权重都依赖倾向得分 \(e(X)\),而 \(e(X)\) 本身必须先估。上面这些公式,并不能用来构造 \(\tau_{\mathrm{T}}\) 与 \(\tau_{\mathrm{C}}\) 的双重稳健估计量;对 \(\tau_{\mathrm{O}}\),双重稳健估计量并不存在。
13.11 分析卡罗林斯卡学院的一套数据
回到习题 12.5。用本章介绍的方法估 \(\tau_{\mathrm{T}}\)。
13.12 推荐阅读
Shinozaki and Matsuyama (2015) 聚焦 \(\tau_{\mathrm{T}}\);Li et al. (2018a) 讨论一般的 \(\tau^h\)。