第 28 章 控制直接效应

第 27 章那套中介分析,靠的是嵌套潜在结果。麻烦在于:有些嵌套潜在结果,任何一场物理实验都看不见。若我们咬住第 27.2.2 节谈过的波普尔科学哲学,因果参数就只该用某些实验里能看见的量来定义。这一章换一条路,谈带中间变量的因果推断。这条路上,我们能定义直接效应,却定义不了间接效应。

28.1 控制直接效应的定义

\(Z\)\(M\) 看成两个都能被操纵的处理因子,对 \(z=0,1\)\(m\in\mathcal{M}\) 定义潜在结果 \(Y(z,m)\)。基于这些潜在结果,可以定义下面的控制直接效应(controlled direct effect, CDE)。

定义 28.1(CDE) 定义

\[ \mathrm{CDE}(m)=\mathrm{E}\{Y(1,m)-Y(0,m)\}. \]

按定义,\(\mathrm{CDE}(m)\) 是把中间变量钉在 \(m\) 时,处理的平均因果效应。它可以抓住「把中介按在 \(m\)」时处理的直接效应。可这套写法抓不住间接效应。特别地,参数 \(\mathrm{E}\{Y(z,1)-Y(z,0)\}\) 只度量把处理按在 \(z\) 时,中介对结果的效应。这不是间接效应的一个有意义的定义。

28.2 控制直接效应的识别与估计

要识别 \(\mathrm{CDE}(m)\),需要下面这条假定:给定 \(X\) 时,\(Z\)\(M\) 联合随机化。

假设 28.1(序贯可忽略性) 要求

\[ Z\perp\!\!\!\perp Y(z,m)\mid X, \qquad M\perp\!\!\!\perp Y(z,m)\mid (Z,X) \]

或者等价地(见习题 27.2),

\[ (Z,M)\perp\!\!\!\perp Y(z,m)\mid X. \]

我盯 \(Z\)\(M\) 都是二值的情形。数学上,可以把这个问题看成有四个处理水平的观察性研究:

\[ (z,m)\in\{(0,0),\ (0,1),\ (1,0),\ (1,1)\}. \]

下面的定理把二值处理观察性研究的结果伸出去,用结果回归、IPW 与双重稳健估计去识别

\[ \mu_{zm}=\mathrm{E}\{Y(z,m)\}. \]

定义

\[ \mu_{zm}(x)=\mathrm{E}(Y\mid Z=z,M=m,X=x) \]

为条件于处理、中介与协变量的结果均值。再定义

\[ \begin{aligned} e_{zm}(x) &= \operatorname{pr}(Z=z,M=m\mid X=x)\\ &= \operatorname{pr}(Z=z\mid X=x)\operatorname{pr}(M=m\mid Z=z,X=x) \end{aligned} \]

为给定协变量时,\(Z\)\(M\) 取这一对联合值的概率。

定理 28.1 在假设 28.1 下,

\[ \mu_{zm} = \mathrm{E}\{\mu_{zm}(X)\} = \mathrm{E}\left\{\frac{I(Z=z,M=m)Y}{e_{zm}(X)}\right\}. \]

再者,分别用工作模型 \(e_{zm}(X,\alpha)\)\(\mu_{zm}(X,\beta)\) 去拟合 \(e_{zm}(X)\)\(\mu_{zm}(X)\),有双重稳健公式

\[ \mu_{zm}^{\mathrm{dr}} = \mathrm{E}\{\mu_{zm}(X,\beta)\} + \mathrm{E}\left[\frac{I(Z=z,M=m)\{Y-\mu_{zm}(X,\beta)\}}{e_{zm}(X,\alpha)}\right], \]

只要 \(e_{zm}(X,\alpha)=e_{zm}(X)\)\(\mu_{zm}(X,\beta)=\mu_{zm}(X)\) 有一条成立,它就等于 \(\mu_{zm}\)

定理 28.1 的证明,跟标准无混杂观察性研究差不多。习题 28.2 给一个更一般的结果。基于结果均值模型,可以得到 \(\mu_{zm}(x)\)\(\hat\mu_{zm}(x)\)。基于处理模型,可以得到 \(\operatorname{pr}(Z=z\mid X=x)\)\(\hat e_z(x)\);基于中间变量模型,可以得到 \(\operatorname{pr}(M=m\mid Z=z,X=x)\)\(\hat e_m(z,x)\)。于是可以用结果回归估 \(\mu_{zm}\)

\[ \hat\mu_{zm}^{\mathrm{reg}} = n^{-1}\sum_{i=1}^{n}\hat\mu_{zm}(X_i), \]

用 IPW:

\[ \begin{aligned} \hat\mu_{zm}^{\mathrm{ht}} &= n^{-1} \sum_{i=1}^{n} \frac{I(Z_i=z,M_i=m)Y_i}{\hat e_z(X_i)\hat e_m(z,X_i)}, \\ \hat\mu_{zm}^{\mathrm{haj}} &= \frac{ \displaystyle\sum_{i=1}^{n} \dfrac{I(Z_i=z,M_i=m)Y_i}{\hat e_z(X_i)\hat e_m(z,X_i)} }{ \displaystyle\sum_{i=1}^{n} \dfrac{I(Z_i=z,M_i=m)}{\hat e_z(X_i)\hat e_m(z,X_i)} }, \end{aligned} \]

或用增广 IPW:

\[ \hat\mu_{zm}^{\mathrm{dr}} = \hat\mu_{zm}^{\mathrm{reg}} + n^{-1} \sum_{i=1}^{n} \frac{I(Z_i=z,M_i=m)\{Y_i-\hat\mu_{zm}(X_i)\}}{\hat e_z(X_i)\hat e_m(z,X_i)}. \]

然后用 \(\hat\mu_{1m}^{\ast}-\hat\mu_{0m}^{\ast}\)\(\ast=\mathrm{reg},\mathrm{ht},\mathrm{haj},\mathrm{dr}\))去估 \(\mathrm{CDE}(m)\),再用自助法去近似标准误。

若愿意假定线性结果模型,控制直接效应就收成处理的系数。细节见例 28.1。

例 28.1 在假设 28.1 与线性结果模型

\[ \mathrm{E}(Y\mid Z,M,X)=\theta_0+\theta_1 Z+\theta_2 M+\theta_4^{\mathrm{T}}X \]

下,可以证明 \(\mathrm{CDE}(m)\) 等于系数 \(\theta_1\),这与 Baron–Kenny 方法里的自然直接效应碰巧是同一个数。证明留给习题 28.3。

28.3 讨论

控制直接效应这套写法,不牵涉嵌套潜在结果,也不牵涉先验反事实;它的识别也不需要跨世界独立。参数 \(\mathrm{CDE}(m)\) 可以抓住「把中介按在 \(m\)」时处理的直接效应。可这套写法抓不住间接效应。我把中间变量的几套因果框架收在表 28.1。

表 28.1 中间变量的因果框架

框架 直接效应 间接效应
26 主分层 \(\tau(1,1),\ \tau(0,0)\) ?
27 中介分析 \(\mathrm{NDE}\) \(\mathrm{NIE}\)
28 控制直接效应 \(\mathrm{CDE}(m)\) ?

中介分析能把总效应拆成自然直接效应与间接效应,可它需要嵌套潜在结果,也需要跨世界独立。主分层与控制直接效应定义不了间接效应,却不牵涉嵌套潜在结果和跨世界独立。再多说一句:主分层并不必然要求 \(M\) 落在从处理到结果的因果路径上。可它的识别与估计,得去拆开混合分布——这在统计学里可不是轻松活。

28.4 习题

28.1 CDE 与 NDE
证明:在跨世界独立 \(Y(z,m)\perp\!\!\!\perp M(z')\mid X\)(对所有 \(z\)\(z'\)\(m\))下,条件控制直接效应 \(\mathrm{CDE}(m\mid x)=\mathrm{E}\{Y(1,m)-Y(0,m)\mid X=x\}\) 与条件自然直接效应

\[ \mathrm{NDE}(x)=\mathrm{E}\{Y(1,M_0)-Y(0,M_0)\mid X=x\} \]

有如下关系:\(M\) 离散时,

\[ \mathrm{NDE}(x) = \sum_{m} \mathrm{CDE}(m\mid x)\operatorname{pr}(M_0=m\mid X=x). \]

没有跨世界独立,这个关系一般还成立吗?

28.2 多值处理的观察性研究
定理 28.1 是下面这条定理的特例:无混杂观察性研究、处理有多个水平(Imai and Van Dyk, 2004; Cattaneo, 2010)。下面陈述一般问题与定理。

考虑一项观察性研究,多值处理 \(Z\in\{1,\ldots,K\}\),协变量 \(X\),结果 \(Y\)。单元 \(i\)\(K\) 个潜在结果 \(Y_i(1),\ldots,Y_i(K)\),对应 \(K\) 个处理水平。一般可以把因果效应定义成潜在结果的对照:

\[ \tau_C=\sum_{k=1}^{K}C_k\mathrm{E}\{Y(k)\}, \]

其中 \(\sum_{k=1}^{K}C_k=0\)。成对比较的典型选择是

\[ \tau_{k,k'}=\mathrm{E}\{Y(k)-Y(k')\}. \]

因此,关键是在下面的可忽略性与重叠假定下,基于 IID 数据 \((Z_i,X_i,Y_i)_{i=1}^{n}\),去识别并估计潜在结果的均值 \(\mu_k=\mathrm{E}\{Y(k)\}\)

假设 28.2 \(Z\perp\!\!\!\perp\{Y(1),\ldots,Y(K)\}\mid X\),且对 \(k=1,\ldots,K\)\(\operatorname{pr}(Z=k\mid X)>0\)

定义广义倾向得分(generalized propensity score)为

\[ e_k(X)=\operatorname{pr}(Z=k\mid X), \]

并定义条件结果均值为

\[ \mu_k(X)=\mathrm{E}(Y\mid Z=k,X) \]

\(k=1,\ldots,K\))。于是有下面的定理。

定理 28.2 在假设 28.2 下,

\[ \mu_k = \mathrm{E}\{\mu_k(X)\} = \mathrm{E}\left\{\frac{I(Z=k)Y}{e_k(X)}\right\}. \]

再者,分别用工作模型 \(e_k(X,\alpha)\)\(\mu_k(X,\beta)\) 去拟合 \(e_k(X)\)\(\mu_k(X)\),有双重稳健公式

\[ \mu_k^{\mathrm{dr}} = \mathrm{E}\{\mu_k(X,\beta)\} + \mathrm{E}\left[\frac{I(Z=k)\{Y-\mu_k(X,\beta)\}}{e_k(X,\alpha)}\right], \]

只要 \(e_k(X,\alpha)=e_k(X)\)\(\mu_k(X,\beta)=\mu_k(X)\) 有一条成立,它就等于 \(\mu_k\)

证明定理 28.2。

注: 若把定理 28.1 里的 \((Z,M)\) 看成四个水平的处理,定理 28.1 就是定理 28.2 的特例。\(\mathrm{CDE}(m)\) 则是 \(\tau_C\) 的特例。

28.3 线性结果模型里的 CDE
证明:在假设 28.1 下,若 \(\mathrm{E}(Y\mid Z,M,X)=\theta_0+\theta_1 Z+\theta_2 M+\theta_4^{\mathrm{T}}X\),则对所有 \(m\)

\[ \mathrm{CDE}(m)=\theta_1; \]

\(\mathrm{E}(Y\mid Z,M,X)=\theta_0+\theta_1 Z+\theta_2 M+\theta_3 ZM+\theta_4^{\mathrm{T}}X\),则

\[ \mathrm{CDE}(m)=\theta_1+\theta_3 m. \]

28.4 逻辑结果模型里的 CDE
证明:结果为二值时,在假设 28.1 下,若

\[ \operatorname{logit}\{\operatorname{pr}(Y=1\mid Z,M,X)\}=\theta_0+\theta_1 Z+\theta_2 M+\theta_4^{\mathrm{T}}X, \]

\[ \mathrm{CDE}(m) = \mathrm{E}\bigl\{\operatorname{expit}(\theta_0+\theta_1+\theta_2 m+\theta_4^{\mathrm{T}}X)-\operatorname{expit}(\theta_0+\theta_2 m+\theta_4^{\mathrm{T}}X)\bigr\}; \]

\[ \operatorname{logit}\{\operatorname{pr}(Y=1\mid Z,M,X)\}=\theta_0+\theta_1 Z+\theta_2 M+\theta_3 ZM+\theta_4^{\mathrm{T}}X, \]

\[ \mathrm{CDE}(m) = \mathrm{E}\bigl\{\operatorname{expit}(\theta_0+\theta_1+\theta_2 m+\theta_3 m+\theta_4^{\mathrm{T}}X)-\operatorname{expit}(\theta_0+\theta_2 m+\theta_4^{\mathrm{T}}X)\bigr\}. \]

28.5 推荐阅读
Nguyen et al. (2021) 对第 27、28 章的题目给过一篇好读的综述。