第 14 章 在回归中使用倾向得分去估因果效应

自 Rosenbaum and Rubin (1983b) 那篇开创性论文以来,倾向得分在文献里生出许多有创意的用法(例如 Bang and Robins, 2005; Robins et al., 2007; Van der Laan and Rose, 2011; Vansteelandt and Daniel, 2014)。这一章只谈两种简单的:

  1. 把倾向得分当作协变量,放进回归;
  2. 用倾向得分的倒数做加权回归。

选它们,有几桩理由:

  1. 容易实现,只需标准回归软件;
  2. 性质并不输许多更复杂的方法;
  3. 容易推广到更灵活的统计模型,包括机器学习算法。

14.1 把倾向得分当作协变量的回归

由定理 11.1:若给定 \(X\) 时可忽略性成立,则给定 \(e(X)\) 时它也成立:

\[ Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid e(X). \]

与 (10.6) 平行,\(\tau\) 也可以由下式非参数识别:

\[ \tau = \mathrm{E}\bigl[ \mathrm{E}\{Y\mid Z=1,e(X)\} - \mathrm{E}\{Y\mid Z=0,e(X)\} \bigr], \]

于是可以考虑 \(Y\)\(Z\)\(e(X)\) 的回归。

最简单的设定,是把 \(Y\)\(\{1,Z,e(X)\}\) 做 OLS,以 \(Z\) 的系数当估计,记作 \(\tau_e\)。为叙述干净,先谈总体 OLS:

\[ \arg\min_{a,b,c}\,\mathrm{E}\{Y-a-bZ-ce(X)\}^2, \]

\(\tau_e\) 就是 \(Z\) 的系数。若倾向得分模型正确,且结果模型对 \(Z\)\(e(X)\) 真是线性的,它就对 \(\tau\) 相合。更有意思的是:只要倾向得分模型正确,即便结果模型完全设错,\(\tau_e\) 估的仍是第 13.4 节的 \(\tau_{\mathrm{O}}\)

定理 14.1 若 \(Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid X\),则 \(Y\)\(\{1,Z,e(X)\}\) 做总体 OLS 时,\(Z\) 的系数等于

\[ \tau_e = \tau_{\mathrm{O}} = \frac{\mathrm{E}\{h_{\mathrm{O}}(X)\tau(X)\}}{\mathrm{E}\{h_{\mathrm{O}}(X)\}}, \]

其中 \(h_{\mathrm{O}}(X)=e(X)\{1-e(X)\}\)\(\tau(X)=\mathrm{E}\{Y(1)-Y(0)\mid X\}\)

定理 14.1 有一个不太寻常的好处:重叠条件不再需要。即便有些单元的倾向得分 \(e(X)\) 恰好是 0 或 1,它们对应的权重 \(e(X)\{1-e(X)\}\) 也是零,因而不给最终参数 \(\tau_{\mathrm{O}}\) 添任何贡献。第 11 章里让 IPW 爆炸的那些人,在这里安静地退场。

定理 14.1 的证明 我用附录 B.3 复习过的 Frisch–Waugh–Lovell(FWL)定理。由 FWL,\(\tau_e\) 可以分两步得到:

  1. \(Z\)\(\{1,e(X)\}\) 做 OLS,得到残差 \(\tilde Z\)
  2. \(Y\)\(\tilde Z\) 做 OLS,得到 \(\tau_e\)

用附录 A.1.5 关于协方差的结果,可以把 \(Z\)\(\{1,e(X)\}\) 做 OLS 时 \(e(X)\) 的系数简化为

\[ \frac{\operatorname{cov}\{Z,e(X)\}}{\operatorname{var}\{e(X)\}} = \frac{ \mathrm{E}\bigl[\operatorname{cov}\{Z,e(X)\mid X\}\bigr] + \operatorname{cov}\{\mathrm{E}(Z\mid X),e(X)\} }{\operatorname{var}\{e(X)\}} = \frac{0+\operatorname{var}\{e(X)\}}{\operatorname{var}\{e(X)\}} =1, \]

于是截距是 \(\mathrm{E}(Z)-\mathrm{E}\{e(X)\}=0\),残差是 \(\tilde Z=Z-e(X)\)。这说得通:\(Z-e(X)\)\(X\) 的任意函数都不相关。

因此,\(\tau_e\) 可以从 \(Y\) 对中心化变量 \(Z-e(X)\) 的一元 OLS 得到:

\[ \tau_e = \frac{\operatorname{cov}\{Z-e(X),Y\}}{\operatorname{var}\{Z-e(X)\}}. \]

分母简化为

\[ \begin{aligned} \operatorname{var}\{Z-e(X)\} &= \mathrm{E}\{Z-e(X)\}^2\\ &= \mathrm{E}\bigl\{Z+e(X)^2-2Ze(X)\bigr\} \quad\text{(因 \(Z^2=Z\))}\\ &= \mathrm{E}\bigl\{e(X)+e(X)^2-2e(X)^2\bigr\}\\ &= \mathrm{E}\{h_{\mathrm{O}}(X)\}. \end{aligned} \]

分子简化为

\[ \begin{aligned} &\operatorname{cov}\{Z-e(X),Y\}\\ &= \mathrm{E}\bigl[\{Z-e(X)\}Y\bigr]\\ &= \mathrm{E}\bigl[\{Z-e(X)\}ZY(1)\bigr] + \mathrm{E}\bigl[\{Z-e(X)\}(1-Z)Y(0)\bigr] \quad\text{(因 \(Y=ZY(1)+(1-Z)Y(0)\))}\\ &= \mathrm{E}\bigl[\{Z-Ze(X)\}Y(1)\bigr] - \mathrm{E}\bigl[e(X)(1-Z)Y(0)\bigr]\\ &= \mathrm{E}\bigl[Z\{1-e(X)\}Y(1)\bigr] - \mathrm{E}\bigl[e(X)(1-Z)Y(0)\bigr]\\ &= \mathrm{E}\bigl[e(X)\{1-e(X)\}\mu_1(X)\bigr] - \mathrm{E}\bigl[e(X)\{1-e(X)\}\mu_0(X)\bigr] \quad\text{(塔性质与可忽略性)}\\ &= \mathrm{E}\{h_{\mathrm{O}}(X)\tau(X)\}. \end{aligned} \]

结论随之而来。\(\square\)

从定理 14.1 的证明可以看到:只需把 \(Y\) 对中心化处理 \(Z-e(X)\) 做 OLS。Lee (2018) 提议过这套手续。也可以在 OLS 里再放入 \(X\),有限样本里或许能换一点效率。可估计目标并不因此改变,仍是 \(\tau_{\mathrm{O}}\)。下面的推论把这两件事收在一起。

推论 14.1 若 \(Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid X\),则

  1. \(Y\)\(Z-e(X)\) 或对 \(\{1,Z-e(X)\}\) 做总体 OLS 时,\(Z-e(X)\) 的系数等于 \(\tau_{\mathrm{O}}\)
  2. \(Y\)\(\{1,Z,e(X),X\}\) 做总体 OLS 时,\(Z\) 的系数等于 \(\tau_{\mathrm{O}}\)

推论 14.1 的证明 (1) 第一条是定理 14.1 证明里的中间步骤。第二条成立,是因为 \(Z-e(X)\) 均值为零:把 \(Y\)\(Z-e(X)\) 回归,或对 \(\{1,Z-e(X)\}\) 回归,并不改变 \(Z-e(X)\) 的系数。

  1. 再一次用 FWL。先把 \(Z\)\(\{1,e(X),X\}\) 做总体 OLS,残差仍是 \(Z-e(X)\):因为

\[ Z-e(X)=Z-0-1\cdot e(X)-0^\top X, \]

\(Z-e(X)\)\(X\) 的任意函数都不相关。于是 \(Y\)\(\{1,Z,e(X),X\}\) 做总体 OLS 时 \(Z\) 的系数,等于 \(Y\)\(Z-e(X)\) 做总体 OLS 时的系数。\(\square\)

定理 14.1 提示 \(\tau_{\mathrm{O}}\) 的两步估计:

  1. 拟合倾向得分模型,得到 \(\hat e(X_i)\)
  2. \(Y_i\)\((1,Z_i,\hat e(X_i))\) 做 OLS,取 \(Z_i\) 的系数。

推论 14.1(1) 提示另一套两步估计:

  1. 拟合倾向得分模型,得到 \(\hat e(X_i)\)
  2. \(Y_i\)\(Z_i-\hat e(X_i)\) 做 OLS,取该回归元的系数。

推论 14.1(2) 再提示一套:

  1. 拟合倾向得分模型,得到 \(\hat e(X_i)\)
  2. \(Y_i\)\((1,Z_i,\hat e(X_i),X_i)\) 做 OLS,取 \(Z_i\) 的系数。

OLS 用来得点估计很方便,可相应的标准误并不正确——第一步估倾向得分时的不确定性,它没有算进去。可以用自助法去近似标准误。

Robins et al. (1992) 讨论过许多基于倾向得分的 OLS 估计量。上面这些结果,看起来像他们一般理论的特例;不过他们没有指出与重叠权重估计目标的联系——那份联系由 Li et al. (2018a) 重新点亮。Lee (2018) 从另一个角度提议把 \(Y\)\(Z-e(X)\) 回归,却没有连到 Robins et al. (1992) 与 Li et al. (2018a) 已有的结果。

Rosenbaum and Rubin (1983b) 提议:把 \(Y\)\(\{1,Z,e(X),Ze(X)\}\) 做 OLS,去估平均因果效应。若这个结果模型正确,他们的估计量对平均因果效应相合。可模型一旦设错,相应估计量的解释就复杂得多。Little and An (2004) 建议把 \(Y\)\(Z\) 以及 \(e(X)\) 的某个灵活函数做 OLS,1 并说明它带有某种双重稳健性。实施起来偏复杂,这里略过。

14.2 用倾向得分的倒数做加权回归

14.2.1 平均因果效应

先回头看 \(\tau\) 的 Hajek 估计量:

\[ \hat\tau^{\mathrm{hajek}} = \frac{\displaystyle\sum_{i=1}^{n}Z_i Y_i/\hat e(X_i)} {\displaystyle\sum_{i=1}^{n}Z_i/\hat e(X_i)} - \frac{\displaystyle\sum_{i=1}^{n}(1-Z_i)Y_i/\bigl(1-\hat e(X_i)\bigr)} {\displaystyle\sum_{i=1}^{n}(1-Z_i)/\bigl(1-\hat e(X_i)\bigr)}, \]

它等于处理组与对照组结果加权均值之差。数值上,它与下面这次加权最小二乘(weighted least squares, WLS)里 \(Z_i\) 的系数相同:把 \(Y_i\)\((1,Z_i)\) 做 WLS。

命题 14.1 \(\hat\tau^{\mathrm{hajek}}\) 等于下面这次 WLS 里的 \(\hat\beta\)

\[ (\hat\alpha,\hat\beta) = \arg\min_{\alpha,\beta} \sum_{i=1}^{n}w_i(Y_i-\alpha-\beta Z_i)^2, \]

权重为

\[ w_i = \frac{Z_i}{\hat e(X_i)} + \frac{1-Z_i}{1-\hat e(X_i)} = \begin{cases} 1/\hat e(X_i), & Z_i=1,\\ 1/\bigl(1-\hat e(X_i)\bigr), & Z_i=0. \end{cases} \tag{14.1} \]

Imbens (2004) 指出过命题 14.1。证明留给习题 14.1。于是,用 WLS 去得 \(\hat\tau^{\mathrm{hajek}}\) 很方便。可因为估计倾向得分还有不确定性,WLS 报出的标准误并不是 \(\hat\tau^{\mathrm{hajek}}\) 的真实标准误。自助法提供了方便的近似。

为什么 WLS 会对 \(\tau\) 相合?回想 CRE:倾向得分是常数,只需把 \(Y_i\)\((1,Z_i)\) 做 OLS,\(Z_i\) 的系数就可以估 \(\tau\)。观察性研究里,各单元接受处理与对照的概率不同。若给处理单元权重 \(1/e(X_i)\)、给对照单元权重 \(1/\{1-e(X_i)\}\),两组就都能代表整个总体。加权之后,我们实际上得到一次伪随机化实验。于是加权均值之差对 \(\tau\) 相合。\(\hat\tau^{\mathrm{hajek}}\) 与 WLS 数值相同,不只是一件好玩的代数事实:它还提示,怎样用协变量调整去做更复杂的估计。下面给一个推广。

回想 CRE 里,可以把 \(Y_i\)\((1,Z_i,X_i,Z_i X_i)\) 做 OLS,取 \(Z_i\) 的系数去估 \(\tau\),协变量已中心化使 \(\bar X=0\)。这就是 Lin (2013) 估计量,用协变量换效率。推到观察性研究,一个自然的做法是:用 (14.1) 的权重,把 \(Y_i\)\((1,Z_i,X_i,Z_i X_i)\) 做 WLS,取 \(Z_i\) 的系数去估 \(\tau\)。Hirano and Imbens (2001) 在一个应用里用过它。完全交互的线性模型,等价于处理组与对照组各自一套线性模型。若线性模型

\[ \mathrm{E}(Y\mid Z=1,X)=\beta_{10}+\beta_{1x}^\top X, \qquad \mathrm{E}(Y\mid Z=0,X)=\beta_{00}+\beta_{0x}^\top X \]

设定正确,则 OLS 与 WLS 都对系数相合,因而 \(Z\) 的系数估计也对 \(\tau\) 相合。更有意思的是:即便结果模型设错,只要倾向得分模型正确,基于 WLS 的 \(Z\) 系数估计仍对 \(\tau\) 相合。也就是说,这个 WLS 估计量是双重稳健的。Robins et al. (2007) 讨论过这份性质,并把它归功于 M. Joffe 一篇未发表的论文。细节如下。

\(e(X_i,\hat\alpha)\) 为拟合倾向得分,\((\mu_1(X_i,\hat\beta_1),\mu_0(X_i,\hat\beta_0))\) 为基于 WLS 的结果均值拟合值。结果回归估计量是

\[ \hat\tau^{\mathrm{reg}}_{\mathrm{wls}} = \frac{1}{n}\sum_{i=1}^{n}\mu_1(X_i,\hat\beta_1) - \frac{1}{n}\sum_{i=1}^{n}\mu_0(X_i,\hat\beta_0), \]

\(\tau\) 的双重稳健估计量是

\[ \hat\tau^{\mathrm{dr}}_{\mathrm{wls}} = \hat\tau^{\mathrm{reg}}_{\mathrm{wls}} + \frac{1}{n}\sum_{i=1}^{n} \frac{Z_i\bigl\{Y_i-\mu_1(X_i,\hat\beta_1)\bigr\}}{e(X_i,\hat\alpha)} - \frac{1}{n}\sum_{i=1}^{n} \frac{(1-Z_i)\bigl\{Y_i-\mu_0(X_i,\hat\beta_0)\bigr\}}{1-e(X_i,\hat\alpha)}. \]

一件有趣的事是:这个双重稳健估计量等于结果回归估计量;若使用 (14.1) 的权重,它又等于 \(Y_i\)\((1,Z_i,X_i,Z_i X_i)\) 做 WLS 时 \(Z_i\) 的系数。

定理 14.2 若 \(\bar X=0\),且 \((\mu_1(X_i,\hat\beta_1),\mu_0(X_i,\hat\beta_0))=(\hat\beta_{10}+\hat\beta_{1x}^\top X_i,\,\hat\beta_{00}+\hat\beta_{0x}^\top X_i)\) 来自用 (14.1) 的权重、把 \(Y_i\)\((1,Z_i,X_i,Z_i X_i)\) 做的 WLS,则

\[ \hat\tau^{\mathrm{dr}}_{\mathrm{wls}} = \hat\tau^{\mathrm{reg}}_{\mathrm{wls}} = \hat\beta_{10}-\hat\beta_{00}, \]

也就是这次 WLS 里 \(Z_i\) 的系数。

定理 14.2 的证明 把 \(Y_i\)\((1,Z_i,X_i,Z_i X_i)\) 做 WLS,等价于分别用处理组与对照组数据做两次 WLS。两次都含截距,因而加权残差均值为零(见 (B.5)):

\[ \sum_{i=1}^{n} \frac{Z_i\bigl(Y_i-\hat\beta_{10}-\hat\beta_{1x}^\top X_i\bigr)}{\hat e(X_i)} =0, \]

\[ \sum_{i=1}^{n} \frac{(1-Z_i)\bigl(Y_i-\hat\beta_{00}-\hat\beta_{0x}^\top X_i\bigr)}{1-\hat e(X_i)} =0. \]

于是 \(\hat\tau^{\mathrm{dr}}_{\mathrm{wls}}\)\(\hat\tau^{\mathrm{reg}}_{\mathrm{wls}}\) 之差恰好为零。两者都收成

\[ \begin{aligned} &\frac{1}{n}\sum_{i=1}^{n}(\hat\beta_{10}+\hat\beta_{1x}^\top X_i) - \frac{1}{n}\sum_{i=1}^{n}(\hat\beta_{00}+\hat\beta_{0x}^\top X_i)\\ &= \hat\beta_{10}-\hat\beta_{00}+(\hat\beta_{1x}-\hat\beta_{0x})^\top\bar X\\ &= \hat\beta_{10}-\hat\beta_{00}, \end{aligned} \]

因为协变量已中心化。所以它们都等于 \(Y_i\)\((1,Z_i,X_i,Z_i X_i)\) 做 WLS 时 \(Z_i\) 的系数。\(\square\)

Freedman and Berk (2008) 用一些模拟,劝人不要用上面这个 WLS 估计量。他们发现:结果模型正确时,WLS 比 OLS 更差——在他们同方差的设定里,WLS 变异很大。一般情形未必如此。若误差方差与倾向得分的倒数成正比,WLS 会比 OLS 更有效。

Freedman and Berk (2008) 还发现:WLS 拟合报出的估计标准误,对真实标准误并不相合,因为它忽略了估计倾向得分时的不确定性。这容易补:用自助法去近似 WLS 估计量的方差即可。

尽管如此,Freedman and Berk (2008) 仍写到:「在某些情形下,加权可能有帮助」——因为结果模型设错时,只要倾向得分模型正确,WLS 估计量仍然相合。

我用表 14.1 结束这一节:它汇总了随机化实验与无混杂观察性研究里,估因果效应的回归估计量。

表 14.1 CRE 与无混杂观察性研究中的回归估计量。权重 \(w_i\) 由 (14.1) 定义。假定协变量已中心化,\(\bar X=0\)

CRE 无混杂观察性研究
不用 \(X\) \(Y_i\sim(1,Z_i)\) 带权重 \(w_i\)\(Y_i\sim(1,Z_i)\)
\(X\) \(Y_i\sim(1,Z_i,X_i,Z_i X_i)\) 带权重 \(w_i\)\(Y_i\sim(1,Z_i,X_i,Z_i X_i)\)

14.2.2 处理组上的平均因果效应

\(\tau_{\mathrm{T}}\) 的结果与 \(\tau\) 平行。第一,\(\tau_{\mathrm{T}}\) 的 Hajek 估计量

\[ \hat\tau_{\mathrm{T}}^{\mathrm{hajek}} = \hat{\bar Y}(1) - \frac{\displaystyle\sum_{i=1}^{n}\hat o(X_i)(1-Z_i)Y_i} {\displaystyle\sum_{i=1}^{n}\hat o(X_i)(1-Z_i)}, \]

其中 \(\hat o(X_i)=\hat e(X_i)/\{1-\hat e(X_i)\}\),数值上等于把 \(Y_i\)\((1,Z_i)\) 做下面这次 WLS 时 \(Z_i\) 的系数。

命题 14.2 \(\hat\tau_{\mathrm{T}}^{\mathrm{hajek}}\) 与下面这次 WLS 里的 \(\hat\beta\) 数值相同:

\[ (\hat\alpha,\hat\beta) = \arg\min_{\alpha,\beta} \sum_{i=1}^{n}w_{\mathrm{T}i}(Y_i-\alpha-\beta Z_i)^2, \]

权重为

\[ w_{\mathrm{T}i} = Z_i+(1-Z_i)\hat o(X_i) = \begin{cases} 1, & Z_i=1,\\ \hat o(X_i), & Z_i=0. \end{cases} \tag{14.2} \]

与命题 14.1 一样,命题 14.2 是纯线性代数事实。证明留给习题 14.1。

第二,若把协变量中心化使 \(\hat{\bar X}(1)=0\),就可以用 (14.2) 的权重,把 \(Y_i\)\((1,Z_i,X_i,Z_i X_i)\) 做 WLS,取 \(Z_i\) 的系数去估 \(\tau_{\mathrm{T}}\)。同样,这个估计量等于结果回归估计量

\[ \hat\tau_{\mathrm{T},\mathrm{wls}}^{\mathrm{reg}} = \hat{\bar Y}(1) - \frac{1}{n_1}\sum_{i=1}^{n}Z_i\mu_0(X_i,\hat\beta_0), \]

也等于双重稳健估计量

\[ \hat\tau_{\mathrm{T},\mathrm{wls}}^{\mathrm{dr}} = \hat\tau_{\mathrm{T},\mathrm{wls}}^{\mathrm{reg}} - \frac{1}{n_1}\sum_{i=1}^{n} \hat o(X_i)(1-Z_i)\bigl\{Y_i-\mu_0(X_i,\hat\beta_0)\bigr\}. \]

定理 14.3 若 \(\hat{\bar X}(1)=0\),且 \(\mu_0(X_i,\hat\beta_0)=\hat\beta_{00}+\hat\beta_{0x}^\top X_i\) 来自用 (14.2) 的权重、把 \(Y_i\)\((1,Z_i,X_i,Z_i X_i)\) 做的 WLS,则

\[ \hat\tau_{\mathrm{T},\mathrm{wls}}^{\mathrm{dr}} = \hat\tau_{\mathrm{T},\mathrm{wls}}^{\mathrm{reg}} = \hat\beta_{10}-\hat\beta_{00}, \]

也就是这次 WLS 里 \(Z_i\) 的系数。

定理 14.3 的证明 分别在处理组与对照组做 WLS,有

\[ \sum_{i=1}^{n}Z_i\bigl(Y_i-\hat\beta_{10}-\hat\beta_{1x}^\top X_i\bigr)=0, \tag{14.3} \]

\[ \sum_{i=1}^{n}\hat o(X_i)(1-Z_i)\bigl(Y_i-\hat\beta_{00}-\hat\beta_{0x}^\top X_i\bigr)=0. \tag{14.4} \]

第二条 (14.4) 保证 \(\hat\tau_{\mathrm{T},\mathrm{wls}}^{\mathrm{dr}}=\hat\tau_{\mathrm{T},\mathrm{wls}}^{\mathrm{reg}}\)。两者都收成

\[ \hat{\bar Y}(1) - \frac{1}{n_1}\sum_{i=1}^{n}Z_i(\hat\beta_{00}+\hat\beta_{0x}^\top X_i) = \frac{1}{n_1}\sum_{i=1}^{n}Z_i\bigl(Y_i-\hat\beta_{00}-\hat\beta_{0x}^\top X_i\bigr). \]

协变量已中心化使 \(\hat{\bar X}(1)=0\) 时,第一条 (14.3) 蕴含 \(\hat{\bar Y}(1)=\hat\beta_{10}\),估计量进一步收成 \(\hat\beta_{10}-\hat\beta_{00}\)\(\square\)

14.3 习题

14.1 作为 WLS 估计量的 Hajek 估计量
证明命题 14.1 与 14.2。

注: 它们是附录习题 B.3 里一元 WLS 的特例。

14.2 预测型估计量与双重稳健估计量
另一种结果回归估计量是预测型估计量

\[ \hat\tau^{\mathrm{pred}} = \hat\mu_1^{\mathrm{pred}}-\hat\mu_0^{\mathrm{pred}}, \]

其中

\[ \hat\mu_1^{\mathrm{pred}} = \frac{1}{n}\sum_{i=1}^{n} \bigl\{Z_i Y_i+(1-Z_i)\mu_1(X_i,\hat\beta_1)\bigr\}, \]

\[ \hat\mu_0^{\mathrm{pred}} = \frac{1}{n}\sum_{i=1}^{n} \bigl\{Z_i\mu_0(X_i,\hat\beta_0)+(1-Z_i)Y_i\bigr\}. \]

它与前面讨论的结果回归估计量不同:它只预测反事实结果,并不替换已经观测到的结果。

证明:若 \((\mu_1(X_i,\hat\beta_1),\mu_0(X_i,\hat\beta_0))=(\hat\beta_{10}+\hat\beta_{1x}^\top X_i,\,\hat\beta_{00}+\hat\beta_{0x}^\top X_i)\) 分别来自处理组与对照组、把 \(Y_i\)\((1,X_i)\) 做的 WLS,权重为

\[ w_i = \frac{Z_i}{\hat o(X_i)}+(1-Z_i)\hat o(X_i) = \begin{cases} 1/\hat o(X_i)=(1-\hat e(X_i))/\hat e(X_i), & Z_i=1,\\ \hat o(X_i)=\hat e(X_i)/(1-\hat e(X_i)), & Z_i=0, \end{cases} \tag{14.5} \]

则双重稳健估计量等于 \(\hat\tau^{\mathrm{pred}}\)

注: Cao et al. (2009) 与 Vermeulen and Vansteelandt (2015) 从别的、更理论的角度,动机过 (14.5) 里的权重。

14.3 二值结果的加权逻辑回归
结果是二值时,可以用逻辑结果模型替换线性结果模型。证明:在逻辑回归里加上权重后,双重稳健估计量等于结果回归估计量。对 \(\tau\)\(\tau_{\mathrm{T}}\) 都成立。

14.4 线性回归设定错误时的因果推断
\(Y\)\((1,Z,X)\) 的总体 OLS 定义为

\[ (\beta_0,\beta_1,\beta_2) = \arg\min_{b_0,b_1,b_2}\mathrm{E}(Y-b_0-b_1 Z-b_2^\top X)^2. \]

\(e(X)=\operatorname{pr}(Z=1\mid X)\) 为倾向得分,并定义 \(\tilde e(X)=\gamma_0+\gamma_1^\top X\)\(Z\)\(X\) 的 OLS 投影,其中

\[ (\gamma_0,\gamma_1) = \arg\min_{c_0,c_1}\mathrm{E}(Z-c_0-c_1^\top X)^2. \]

  1. 证明

\[ \beta_1 = \frac{\mathrm{E}\bigl[\tilde w(X)\{\mu_1(X)-\mu_0(X)\}\bigr]}{\mathrm{E}\{\tilde w(X)\}} + \frac{\mathrm{E}\bigl[\{e(X)-\tilde e(X)\}\mu_0(X)\bigr]}{\mathrm{E}\{\tilde w(X)\}}, \]

其中 \(\tilde w(X)=e(X)\{1-\tilde e(X)\}\)

  1. \(X\) 包含某个离散协变量的哑变量时,证明

\[ \beta_1 = \frac{\mathrm{E}\bigl[w(X)\{\mu_1(X)-\mu_0(X)\}\bigr]}{\mathrm{E}\{w(X)\}}, \]

其中 \(w(X)=e(X)\{1-e(X)\}\) 是第 13.4 节的重叠权重。

注: Vansteelandt and Dukes (2022) 给出了第 1 部分的公式,但没有详细证明。第 2 部分在文献里被推导过多次(例如 Angrist, 1998; Ding, 2021)。

14.5 分析卡罗林斯卡学院的一套数据
回到习题 12.5。用本章介绍的方法估 \(\tau_{\mathrm{O}}\)\(\tau\)

14.6 推荐阅读
Kang and Schafer (2007) 对双重稳健估计量做了批评性综述,并用模拟把它与许多别的估计量比较。Robins et al. (2007) 对 Kang and Schafer (2007) 给过非常有洞察的评论。


  1. 例如在回归里放入 \(e(X)\) 的多项式。Little and An (2004) 建议用样条。↩︎