第 29 章 随时间变化的处理与混杂

随时间变化的处理(time-varying treatments)的研究,在生物医学与社会科学里都很常见。生物统计这边,James Robins 带起了这条线。一个经典例子是:HIV 患者会随时间断断续续地服用齐多夫定(azidothymidine),一种抗逆转录病毒药(Robins et al., 2000; Hernán et al., 2000)。别的领域也有类似问题。教育学里,学生会在不同时间段接受不同类型的教学(Hong and Raudenbush, 2008)。政治学里,候选人会根据随时间变化的民调与对手动作,不断改竞选策略(Blackwell, 2013)。

随时间变化的处理,并不是把「单个时点的处理」简单伸长一截。真正的麻烦是随时间变化的混杂(time-varying confounding)。即便假定所有时变混杂都被观测到了,调整它们时仍会碰上统计上的两难:一方面,该按这些混杂分层,才能把混杂调掉;另一方面,条件于处理后变量又会把估计带偏。两项目标打架,于是需要更精细的方法。这一章就谈这个。

为少写一点记号,我用两个时点的处理把最要紧的想法讲清楚。把想法伸到多个时点,概念上并不远,可有限样本里会冒出技术麻烦。我会点出这些麻烦,一般结果留给习题 29.7–29.10。

29.1 基本设定与序贯可忽略性

从两个时点的处理开始。变量的时间顺序(不是因果图)如下:

\[ X_0\to Z_1\to X_1\to Z_2\to Y \]

其中

  • \(X_0\) 表示基线预处理协变量;
  • \(Z_1\) 表示时点 1 的处理;
  • \(X_1\) 表示两个处理时点之间的时变协变量;
  • \(Z_2\) 表示时点 2 的处理;
  • \(Y\) 表示结果。

处理 \((Z_1,Z_2)\) 为二值时,每个单元有四个潜在结果

\[ Y(z_1,z_2),\qquad z_1,z_2=0,1. \]

观测结果等于

\[ Y=Y(Z_1,Z_2) = \sum_{z_1=0,1}\sum_{z_2=0,1} 1(Z_1=z_1)\,1(Z_2=z_2)\,Y(z_1,z_2). \]

我盯带序贯可忽略性的典范设定:给定观测历史时,处理被序贯随机化。

假设 29.1(序贯可忽略性) (1) 给定 \(X_0\)\(Z_1\) 被随机化:对 \(z_1,z_2=0,1\)

\[ Z_1\perp\!\!\!\perp Y(z_1,z_2)\mid X_0. \]

  1. 给定 \((Z_1,X_1,X_0)\)\(Z_2\) 被随机化:对 \(z_1,z_2=0,1\)

\[ Z_2\perp\!\!\!\perp Y(z_1,z_2)\mid (Z_1,X_1,X_0). \]

图 29.1 是对应假设 29.1 的一张简单因果图,里面没有未测混杂。

    Z₁ → X₁ → Z₂ → Y
     ↘___↗  ↗   ↗
      ↘________↗

原书图 29.1:假设 29.1 成立,且 \(X_1\)\(Y\) 之间没有未测混杂 \(U\)。图已条件于预处理协变量 \(X_0\)。链式箭头是 \(Z_1\to X_1\to Z_2\to Y\);另外三条弯箭头是 \(Z_1\to Z_2\)\(X_1\to Y\)\(Z_1\to Y\)

图 29.2 更复杂一些,可同样对应假设 29.1。序贯可忽略性只排除处理 \((Z_1,Z_2)\) 与结果 \(Y\) 之间的混杂,却允许时变协变量 \(X_1\) 与结果 \(Y\) 之间有未测混杂。即便在序贯可忽略性下,\(U\) 的可能存在仍会引出许多细处。

    Z₁ → X₁ → Z₂ → Y
     ↘___↗  ↗   ↗
         U ──────↗
      ↘________↗

原书图 29.2:假设 29.1 成立,且 \(X_1\)\(Y\) 之间有未测混杂。图已条件于预处理协变量 \(X_0\)\(U\) 同时指向 \(X_1\)\(Y\)

29.2 g-公式与结果建模

回想单个时点处理时,基于结果的识别公式:

\[ \mathrm{E}\{Y(z)\}=\mathrm{E}\{\mathrm{E}(Y\mid Z=z,X)\}. \]

\(X\) 离散时,它收成

\[ \mathrm{E}\{Y(z)\}=\sum_x\mathrm{E}(Y\mid Z=z,X=x)\operatorname{pr}(X=x); \]

\(X\) 连续时,它收成

\[ \mathrm{E}\{Y(z)\}=\int\mathrm{E}(Y\mid Z=z,X=x)f(x)\,\mathrm{d}x. \]

下面的结果把它伸到两个时点的处理。

定理 29.1 在假设 29.1 下,

\[ \mathrm{E}\{Y(z_1,z_2)\} = \mathrm{E}\bigl[\mathrm{E}\{\mathrm{E}(Y\mid z_2,z_1,X_1,X_0)\mid z_1,X_0\}\bigr]. \tag{29.1} \]

定理 29.1 里,我把记号「\(Z_2=z_2\)」简写成「\(z_2\)」。免得这一章公式太长,我用小写字母表示「该随机变量取对应值」这件事。\(X_0\)\(X_1\) 离散时,识别公式 (29.1) 收成

\[ \mathrm{E}\{Y(z_1,z_2)\} = \sum_{x_0}\sum_{x_1} \mathrm{E}(Y\mid z_2,z_1,x_1,x_0) \operatorname{pr}(x_1\mid z_1,x_0) \operatorname{pr}(x_0); \tag{29.2} \]

\(X_0\)\(X_1\) 连续时,识别公式 (29.1) 收成

\[ \mathrm{E}\{Y(z_1,z_2)\} = \iint \mathrm{E}(Y\mid z_2,z_1,x_1,x_0) f(x_1\mid z_1,x_0)f(x_0)\,\mathrm{d}x_1\,\mathrm{d}x_0. \tag{29.3} \]

把 (29.2) 拿去和全概率公式比一比,会清楚许多:

\[\begin{align*} \mathrm{E}(Y) &= \sum_{x_0}\sum_{z_1}\sum_{x_1}\sum_{z_2} \mathrm{E}(Y\mid z_2,z_1,x_1,x_0)\\ &\qquad\cdot \operatorname{pr}(z_2\mid z_1,x_1,x_0) \operatorname{pr}(x_1\mid z_1,x_0) \operatorname{pr}(z_1\mid x_0) \operatorname{pr}(x_0). \tag{29.4} \end{align*}\]

把 (29.4) 里 \(Z_2\)\(Z_1\) 的那些概率擦掉,就得到公式 (29.2)。这很直觉:潜在结果 \(Y(z_1,z_2)\) 的意思,正是把 \(Z_1\)\(Z_2\) 分别钉在 \(z_1\)\(z_2\)

Robins 把 (29.2) 与 (29.3) 叫做 g-公式(g-formulas)。下面证明定理 29.1。

定理 29.1 的证明 由塔性质,

\[ \mathrm{E}\{Y(z_1,z_2)\} = \mathrm{E}\bigl[\mathrm{E}\{Y(z_1,z_2)\mid X_0\}\bigr], \]

于是只需盯 \(\mathrm{E}\{Y(z_1,z_2)\mid X_0\}\)。由假设 29.1(1) 与塔性质,

\[\begin{align*} \mathrm{E}\{Y(z_1,z_2)\mid X_0\} &= \mathrm{E}\{Y(z_1,z_2)\mid z_1,X_0\} \\ &= \mathrm{E}\bigl[\mathrm{E}\{Y(z_1,z_2)\mid z_1,X_1,X_0\}\mid z_1,X_0\bigr]. \end{align*}\]

由假设 29.1(2),

\[\begin{align*} \mathrm{E}\{Y(z_1,z_2)\mid X_0\} &= \mathrm{E}\bigl[\mathrm{E}\{Y(z_1,z_2)\mid z_2,z_1,X_1,X_0\}\mid z_1,X_0\bigr] \\ &= \mathrm{E}\bigl[\mathrm{E}\{Y\mid z_2,z_1,X_1,X_0\}\mid z_1,X_0\bigr]. \end{align*}\]

公式 (29.1) 随之而来。

\(\square\)

29.2.1 基于结果建模的代入估计

g-公式 (29.2) 与 (29.3) 提示:要估潜在结果的均值,需要给 \(\mathrm{E}(Y\mid z_2,z_1,x_1,x_0)\)\(\operatorname{pr}(x_1\mid z_1,x_0)\)\(\operatorname{pr}(x_0)\) 建模。模型拟合好了,再代进 g-公式。

若函数形式比较特别,这件事可以简化。例 29.1 给出线性结果模型下的结果。

例 29.1 假定线性结果模型

\[ \mathrm{E}(Y\mid z_2,z_1,x_1,x_0)=\beta_0+\beta_1 z_2+\beta_2 z_1+\beta_3 x_1+\beta_4 x_0. \]

可以核实

\[\begin{align*} \mathrm{E}\{Y(z_1,z_2)\} &= \sum_{x_0}\sum_{x_1} (\beta_0+\beta_1 z_2+\beta_2 z_1+\beta_3 x_1+\beta_4 x_0) \operatorname{pr}(x_1\mid z_1,x_0)\operatorname{pr}(x_0) \\ &= \beta_0+\beta_1 z_2+\beta_2 z_1 +\beta_3\sum_{x_0}\mathrm{E}(X_1\mid z_1,x_0)\operatorname{pr}(x_0) +\beta_4\mathrm{E}(X_0). \end{align*}\]

定义

\[ \mathrm{E}\{X_1(z_1)\} = \sum_{x_0}\mathrm{E}(X_1\mid z_1,x_0)\operatorname{pr}(x_0) \tag{29.5} \]

把公式收成

\[ \mathrm{E}\{Y(z_1,z_2)\} = \beta_0+\beta_1 z_2+\beta_2 z_1+\beta_3\mathrm{E}\{X_1(z_1)\}+\beta_4\mathrm{E}(X_0). \]

在 (29.5) 里,我引进了时点 1 处理 \(Z_1=z_1\)\(X_1\) 的潜在结果。这说得通:在可忽略性 \(X_1(z_1)\perp\!\!\!\perp Z_1\mid X_0\)\(z_1=0,1\))下,(29.5) 的右边正是 \(\mathrm{E}\{X_1(z_1)\}\) 的识别公式。我们并不真的需要潜在结果 \(X_1(z_1)\) 和这条可忽略性,可这套记号方便,也跟前面的讨论对得上。

定义 \(\tau_{Z_1\to X_1}=\mathrm{E}\{X_1(1)-X_1(0)\}\)。可以核实

\[\begin{align*} \mathrm{E}\{Y(1,0)-Y(0,0)\} &= \beta_2+\beta_3\tau_{Z_1\to X_1}, \\ \mathrm{E}\{Y(0,1)-Y(0,0)\} &= \beta_1, \\ \mathrm{E}\{Y(1,1)-Y(0,0)\} &= \beta_1+\beta_2+\beta_3\tau_{Z_1\to X_1}. \end{align*}\]

于是可以先用标准方法估回归系数 \(\beta\) 以及 \(Z_1\)\(X_1\) 的平均因果效应,再按上面的公式去估 \((Z_1,Z_2)\)\(Y\) 的效应。

若再给 \(X_1\) 假定线性模型

\[ \mathrm{E}(X_1\mid Z_1,X_0)=\gamma_0+\gamma_1 z_1+\gamma_2 x_0, \]

\(\tau_{Z_1\to X_1}=\gamma_1\),并且

\[\begin{align*} \mathrm{E}\{Y(1,0)-Y(0,0)\} &= \beta_2+\beta_3\gamma_1, \tag{29.6} \\ \mathrm{E}\{Y(0,1)-Y(0,0)\} &= \beta_1, \tag{29.7} \\ \mathrm{E}\{Y(1,1)-Y(0,0)\} &= \beta_1+\beta_2+\beta_3\gamma_1. \tag{29.8} \end{align*}\]

对照图 29.3——箭头上标了回归系数——公式 (29.6)–(29.8) 看起来很直觉。在 (29.6) 里,\(Z_1\) 的效应等于路径 \(Z_1\to Y\)\(Z_1\to X_1\to Y\) 上系数之和;在 (29.7) 里,\(Z_2\) 的效应等于路径 \(Z_2\to Y\) 上的系数;在 (29.8) 里,\((Z_1,Z_2)\) 的总效应等于路径 \(Z_1\to Y\)\(Z_1\to X_1\to Y\)\(Z_2\to Y\) 上系数之和。

         ╭──────────── β₂ ────────────╮
    Z₁ ─γ₁→ X₁ ──→ Z₂ ─β₁→ Y
     ╰──────↗      ╰── β₃ ──↗

原书图 29.3:线性因果图,箭头上标了系数;已条件于预处理协变量 \(X_0\)\(Z_1\to X_1\) 的系数是 \(\gamma_1\)\(Z_1\to Y\)\(\beta_2\)\(X_1\to Y\)\(\beta_3\)\(Z_2\to Y\)\(\beta_1\)\(Z_1\to Z_2\)\(X_1\to Z_2\) 没有标系数。

可 Robins and Wasserman (1997) 指出:基于结果建模的代入估计,有一个让人吃惊的毛病。他们证明:这条策略一旦模型设错,分析者可能错误地拒绝「\((Z_1,Z_2)\)\(Y\) 的因果效应为零」这条原假设——即便数据生成过程里真效应就是零。他们称之为 g-零悖论(g-null paradox)。更让人吃惊的是:他们证明,例 29.1 那么简单的线性结果模型,也可能碰上 g-零悖论。McGrath et al. (2021) 又回头看过这件事。细节见习题 29.1。

29.2.2 基于结果建模的递推估计

第 29.2.1 节的代入估计要给时变混杂 \(X_1\) 建模,于是惹上讨厌的 g-零悖论。这不是一套让人喜欢的方法。

回想单个时点处理时,基于 \(\mathrm{E}\{Y(z)\}=\mathrm{E}\{\mathrm{E}(Y\mid Z=z,X)\}\) 的结果回归估计量。我们先用 \(Z=z\) 的那一子数据,把 \(Y\)\(X\) 建模,得到所有单元的拟合值 \(\hat Y_i(z)\)。再得到估计量

\[ \widehat{\mathrm{E}}\{Y(z)\} = n^{-1}\sum_{i=1}^{n}\hat Y_i(z). \]

类似地,(29.1) 里的递推期望,动机了一套更简单的估计。从最里面的条件期望开始,记

\[ \tilde Y_2(z_1,z_2)=\mathrm{E}(Y\mid Z_2=z_2,Z_1=z_1,X_1,X_0). \]

我们可以用 \((Z_2=z_2,Z_1=z_1)\) 的那一子数据,把 \(Y\)\((X_1,X_0)\) 建模,得到所有单元的拟合值 \(\hat Y_{2i}(z_1,z_2)\)。再走到外层条件期望,记

\[ \tilde Y_1(z_1,z_2)=\mathrm{E}\{\tilde Y_2(z_1,z_2)\mid Z_1=z_1,X_0\}. \]

我们可以用 \(Z_1=z_1\) 的那一子数据,把 \(\hat Y_2(z_1,z_2)\)\(X_0\) 建模,得到所有单元的拟合值 \(\hat Y_{1i}(z_1,z_2)\)。于是 \(\mathrm{E}\{Y(z_1,z_2)\}\) 的最终估计是

\[ \widehat{\mathrm{E}}\{Y(z_1,z_2)\} = n^{-1}\sum_{i=1}^{n}\hat Y_{1i}(z_1,z_2). \]

上面这套递推估计不必给 \(X_1\) 建模,也躲开了 g-零悖论。一个特例见习题 29.2。可基于递推回归的估计量并不好做:它要给一些并不对应因果图自然结构的变量建模,例如 \(\tilde Y_2(z_1,z_2)\)

29.3 逆倾向得分加权

回想单个时点处理时的 IPW 识别公式:

\[ \mathrm{E}\{Y(z)\} = \mathrm{E}\left\{\frac{1(Z=z)Y}{\operatorname{pr}(Z=z\mid X)}\right\}. \]

下面的结果把它伸到两个时点的处理。定义

\[ e(z_1,X_0)=\operatorname{pr}(Z_1=z_1\mid X_0) \]

以及

\[ e(z_2,Z_1,X_1,X_0)=\operatorname{pr}(Z_2=z_2\mid Z_1,X_1,X_0) \]

为时点 1 与时点 2 的倾向得分。

定理 29.2 在假设 29.1 下,

\[ \mathrm{E}\{Y(z_1,z_2)\} = \mathrm{E}\left\{\frac{1(Z_1=z_1)1(Z_2=z_2)Y}{e(z_1,X_0)\,e(z_2,Z_1,X_1,X_0)}\right\}. \tag{29.9} \]

定理 29.2 把前面没写明的重叠假定亮了出来:对所有 \(z_1\)\(z_2\)

\[ 0<e(z_1,X_0)<1, \qquad 0<e(z_2,Z_1,X_1,X_0)<1. \]

若某些倾向得分是 0 或 1,识别公式 (29.9) 就会冲向无穷。

定理 29.2 的证明 条件于 \((Z_1,X_1,X_0)\) 并用假设 29.1(2),可以把 (29.9) 的右边化成

\[\begin{align*} & \mathrm{E}\left\{\frac{1(Z_1=z_1)1(Z_2=z_2)Y(z_1,z_2)}{\operatorname{pr}(Z_1=z_1\mid X_0)\operatorname{pr}(Z_2=z_2\mid Z_1,X_1,X_0)}\right\} \\ &= \mathrm{E}\left\{\frac{1(Z_1=z_1)\operatorname{pr}(Z_2=z_2\mid Z_1,X_1,X_0)\,\mathrm{E}\{Y(z_1,z_2)\mid Z_1,X_1,X_0\}}{\operatorname{pr}(Z_1=z_1\mid X_0)\operatorname{pr}(Z_2=z_2\mid Z_1,X_1,X_0)}\right\} \\ &= \mathrm{E}\left\{\frac{1(Z_1=z_1)}{\operatorname{pr}(Z_1=z_1\mid X_0)}\,\mathrm{E}\{Y(z_1,z_2)\mid Z_1,X_1,X_0\}\right\} \\ &= \mathrm{E}\left\{\frac{1(Z_1=z_1)}{\operatorname{pr}(Z_1=z_1\mid X_0)}\,Y(z_1,z_2)\right\}, \tag{29.10} \end{align*}\]

其中 (29.10) 来自塔性质。

再条件于 \(X_0\) 并用假设 29.1(1),可以把 (29.10) 的右边化成

\[\begin{align*} & \mathrm{E}\left\{\frac{\operatorname{pr}(Z_1=z_1\mid X_0)}{\operatorname{pr}(Z_1=z_1\mid X_0)}\,\mathrm{E}\{Y(z_1,z_2)\mid X_0\}\right\} \\ &= \mathrm{E}\bigl[\mathrm{E}\{Y(z_1,z_2)\mid X_0\}\bigr] \\ &= \mathrm{E}\{Y(z_1,z_2)\}, \end{align*}\]

最后一行同样来自塔性质。

\(\square\)

基于 IPW 的估计量简单得多:只需给两个二值处理指示建模。先把 \(Z_1\)\(X_0\) 建模,得到所有单元的拟合值 \(\hat e_1(z_1,X_{0i})\);再把 \(Z_2\)\((Z_1,X_1,X_0)\) 建模,得到所有单元的拟合值 \(\hat e_2(z_2,Z_{1i},X_{1i},X_{0i})\)。然后得到如下 IPW 估计量:

\[ \widehat{\mathrm{E}}^{\mathrm{ht}}\{Y(z_1,z_2)\} = n^{-1} \sum_{i=1}^{n} \frac{1(Z_{1i}=z_1)1(Z_{2i}=z_2)Y_i}{\hat e_1(z_1,X_{0i})\,\hat e_2(z_2,Z_{1i},X_{1i},X_{0i})}. \]

和第 11 章谈过的一样,HT 估计量对结果的平移变换并不不变,有限样本里也不稳定。一个修正过的 Hajek 型估计量是 \(\widehat{\mathrm{E}}^{\mathrm{haj}}\{Y(z_1,z_2)\}=\widehat{\mathrm{E}}^{\mathrm{ht}}\{Y(z_1,z_2)\}/\hat 1^{\mathrm{ht}}(z_1,z_2)\),其中

\[ \hat 1^{\mathrm{ht}}(z_1,z_2) = n^{-1} \sum_{i=1}^{n} \frac{1(Z_{1i}=z_1)1(Z_{2i}=z_2)}{\hat e_1(z_1,X_{0i})\,\hat e_2(z_2,Z_{1i},X_{1i},X_{0i})}. \]

29.4 多个时间点

把第 29.2、29.3 节的估计策略直接伸到多个时点,并不顺手。即便处理是二值的、有 \(K\) 个时点,处理组合的个数仍随 \(K\) 指数增长(例如 \(2^5=32\)\(2^{10}=1024\))。于是第 29.2、29.3 节的结果回归与 IPW 估计量,在有限样本里并不可行:每个处理组合都得有够用的数据。

29.4.1 边际结构模型

一套有力的办法基于边际结构模型(marginal structural model, MSM)(Robins et al., 2000; Hernán et al., 2000)。为少写记号,我只写 \(K=2\) 的 MSM,尽管它真正派上用场的是一般情形。

定义 29.1(MSM) \(Y(z_1,z_2)\) 的边际均值等于

\[ \mathrm{E}\{Y(z_1,z_2)\}=f(z_1,z_2;\beta). \]

定义 29.1 的一个典型例子是 \(\mathrm{E}\{Y(z_1,z_2)\}=\beta_0+\beta_1 z_1+\beta_2 z_2\)。把基线协变量放进模型也很直接。定义 29.2 把定义 29.1 伸出去。

定义 29.2(带基线协变量的 MSM) 给定 \(X_0\)\(Y(z_1,z_2)\) 的均值等于

\[ \mathrm{E}\{Y(z_1,z_2)\mid X_0\}=f(z_1,z_2,X_0;\beta). \]

定义 29.2 的一个典型例子是

\[ \mathrm{E}\{Y(z_1,z_2)\mid X_0\}=\beta_0+\beta_1 z_1+\beta_2 z_2+\beta_3^{\mathrm{T}}X_0. \tag{29.11} \]

若所有潜在结果都能看见,可以从下面的最小化问题解出 \(\beta\)

\[ \beta = \arg\min_{b} \sum_{z_2}\sum_{z_1} \mathrm{E}\bigl\{Y(z_1,z_2)-f(z_1,z_2,X_0;b)\bigr\}^2. \tag{29.12} \]

为简单起见,我盯最小二乘这套写法。也可以伸到更一般的模型;逻辑模型的例子见习题 29.4。

在序贯可忽略性下,可以从只牵涉可观测量的最小化问题解出 \(\beta\)

定理 29.3(MSM 下的 IPW) 在假设 29.1 与定义 29.2 下,(29.12) 里的 \(\beta\) 等于

\[ \beta = \arg\min_{b} \sum_{z_2}\sum_{z_1} \mathrm{E}\left[ \frac{1(Z_1=z_1)1(Z_2=z_2)}{e(z_1,X_0)\,e(z_2,Z_1,X_1,X_0)} \bigl\{Y-f(z_1,z_2,X_0;b)\bigr\}^2 \right]. \]

定理 29.3 的证明与定理 29.2 类似。我把它留给习题 29.3。

定理 29.3 提示一套基于加权回归的简单估计。例如在 (29.11) 下,可以把 \(Y_i\)\((1,Z_{1i},Z_{2i},X_{0i})\) 做 WLS,权重是 \(\hat e_1^{-1}(Z_{1i},X_{0i})\,\hat e_2^{-1}(Z_{2i},Z_{1i},X_{1i},X_{0i})\)

29.4.2 结构嵌套模型

IPW 的一个关键麻烦是:重叠假定一旦失败,它就用不成。为对付这个挑战,Robins 提出了结构嵌套模型(structural nested model)。同样为少写,我只复习两个时点的版本。

定义 29.3(结构嵌套模型) 时点 1 的条件效应是:对所有 \(z_1\)

\[ \mathrm{E}\{Y(z_1,0)-Y(0,0)\mid Z_1=z_1,X_0\}=g_1(z_1,X_0;\beta), \]

时点 2 的条件效应是:对所有 \(z_1,z_2\)

\[ \mathrm{E}\{Y(z_1,z_2)-Y(z_1,0)\mid Z_2=z_2,Z_1=z_1,X_1,X_0\}=g_2(z_2,z_1,X_1,X_0;\beta). \]

定义 29.3 里有两条逻辑限制:

\[ g_1(0,X_0;\beta)=0 \]

以及

\[ g_2(0,z_1,X_1,X_0;\beta)=0\qquad\text{对所有 }z_1. \]

定义 29.3 的两个典型选择如下。

例 29.2 假定

\[ \begin{cases} g_1(z_1,X_0;\beta)=\beta_1 z_1,\\ g_2(z_2,z_1,X_1,X_0;\beta)=(\beta_2+\beta_3 z_1)z_2. \end{cases} \]

例 29.3 假定

\[ \begin{cases} g_1(z_1,X_0;\beta)=(\beta_1+\beta_2^{\mathrm{T}}X_0)z_1,\\ g_2(z_2,z_1,X_1,X_0;\beta)=(\beta_3+\beta_4 z_1+\beta_5^{\mathrm{T}}X_1)z_2. \end{cases} \]

比较定义 29.2 与 29.3。结构嵌套模型允许调整基线协变量,也允许调整时变协变量;边际结构模型只允许调整基线协变量。定义 29.3 下的估计更绕。一套策略是用估计方程去估参数。

先引进两块讨论估计时要用的砖。定义

\[ U_2(\beta)=Y-g_2(Z_2,Z_1,X_1,X_0;\beta) \]

以及

\[ U_1(\beta)=Y-g_2(Z_2,Z_1,X_1,X_0;\beta)-g_1(Z_1,X_0;\beta). \]

它们并不能直接从数据算出来,因为依赖参数 \(\beta\) 的真值。在真值处,它们有下面这些性质。

引理 29.1 在假设 29.1 与定义 29.3 下,

\[\begin{align*} \mathrm{E}\{U_2(\beta)\mid Z_2,Z_1,X_1,X_0\} &= \mathrm{E}\{U_2(\beta)\mid Z_1,X_1,X_0\} \\ &= \mathrm{E}\{Y(Z_1,0)\mid Z_1,X_1,X_0\} \end{align*}\]

以及

\[\begin{align*} \mathrm{E}\{U_1(\beta)\mid Z_1,X_0\} &= \mathrm{E}\{U_1(\beta)\mid X_0\} \\ &= \mathrm{E}\{Y(0,0)\mid X_0\}. \end{align*}\]

引理 29.1 里有一个细的记号 \(Y(Z_1,0)\),因为 \(Z_1\) 是随机的。它应当读成 \(Y(Z_1,0)=Z_1 Y(1,0)+(1-Z_1)Y(0,0)\)。按定义与引理 29.1,\(U_1(\beta)\) 扮演的是尚未接受任何处理时的对照潜在结果,\(U_2(\beta)\) 扮演的是时点 1 已接受处理之后的对照潜在结果。

引理 29.1 的证明 第一部分。 我们有

\[\begin{align*} \mathrm{E}\{U_2(\beta)\mid Z_2=1,Z_1,X_1,X_0\} &= \mathrm{E}\{Y(Z_1,1)-g_2(1,Z_1,X_1,X_0;\beta)\mid Z_2=1,Z_1,X_1,X_0\} \\ &= \mathrm{E}\{Y(Z_1,0)\mid Z_2=1,Z_1,X_1,X_0\} \end{align*}\]

以及

\[\begin{align*} \mathrm{E}\{U_2(\beta)\mid Z_2=0,Z_1,X_1,X_0\} &= \mathrm{E}\{Y(Z_1,0)-g_2(0,Z_1,X_1,X_0;\beta)\mid Z_2=0,Z_1,X_1,X_0\} \\ &= \mathrm{E}\{Y(Z_1,0)\mid Z_2=0,Z_1,X_1,X_0\}, \end{align*}\]

于是

\[\begin{align*} \mathrm{E}\{U_2(\beta)\mid Z_2,Z_1,X_1,X_0\} &= \mathrm{E}\{Y(Z_1,0)\mid Z_2,Z_1,X_1,X_0\} \\ &= \mathrm{E}\{Y(Z_1,0)\mid Z_1,X_1,X_0\}, \end{align*}\]

最后一步来自序贯可忽略性。因为最后一项不依赖 \(Z_2\),我们也有

\[ \mathrm{E}\{U_2(\beta)\mid Z_2,Z_1,X_1,X_0\}=\mathrm{E}\{U_2(\beta)\mid Z_1,X_1,X_0\}. \]

第二部分。 用上面的结果,

\[\begin{align*} \mathrm{E}\{U_1(\beta)\mid Z_1,X_0\} &= \mathrm{E}\{U_2(\beta)-g_1(Z_1,X_0;\beta)\mid Z_1,X_0\} \quad\text{(定义 29.3)} \\ &= \mathrm{E}\bigl[\mathrm{E}\{U_2(\beta)-g_1(Z_1,X_0;\beta)\mid X_1,Z_1,X_0\}\mid Z_1,X_0\bigr] \quad\text{(塔性质)} \\ &= \mathrm{E}\bigl[\mathrm{E}\{Y(Z_1,0)-g_1(Z_1,X_0;\beta)\mid X_1,Z_1,X_0\}\mid Z_1,X_0\bigr] \quad\text{(第一部分)} \\ &= \mathrm{E}\{Y(Z_1,0)-g_1(Z_1,X_0;\beta)\mid Z_1,X_0\} \quad\text{(塔性质)} \\ &= \mathrm{E}\{Y(0,0)\mid Z_1,X_0\} \quad\text{(定义 29.3)} \\ &= \mathrm{E}\{Y(0,0)\mid X_0\} \quad\text{(序贯可忽略性)}. \end{align*}\]

因为最后一项不依赖 \(Z_1\),我们也有

\[ \mathrm{E}\{U_1(\beta)\mid Z_1,X_0\}=\mathrm{E}\{U_1(\beta)\mid X_0\}. \]

\(\square\)

有了引理 29.1,可以证明下面的定理 29.4。

定理 29.4 在假设 29.1 与定义 29.3 下,

\[ \mathrm{E}\bigl[h_2(Z_1,X_1,X_0)\{Z_2-e(1,Z_1,X_1,X_0)\}U_2(\beta)\bigr]=0 \]

以及

\[ \mathrm{E}\bigl[h_1(X_0)\{Z_1-e(1,X_0)\}U_1(\beta)\bigr]=0, \]

对任意函数 \(h_1\)\(h_2\) 成立,只要矩存在。

定理 29.4 的证明 用塔性质,条件于 \((Z_2,Z_1,X_1,X_0)\),并借助引理 29.1,得到

\[\begin{align*} & \mathrm{E}\bigl[h_2(Z_1,X_1,X_0)\{Z_2-e(1,Z_1,X_1,X_0)\}\,\mathrm{E}\{U_2(\beta)\mid Z_2,Z_1,X_1,X_0\}\bigr] \\ &= \mathrm{E}\bigl[h_2(Z_1,X_1,X_0)\{Z_2-e(1,Z_1,X_1,X_0)\}\,\mathrm{E}\{U_2(\beta)\mid Z_1,X_1,X_0\}\bigr]. \end{align*}\]

再用塔性质,条件于 \((Z_1,X_1,X_0)\),可知最后一项等于 0,因为 \(\mathrm{E}\{Z_2-e(1,Z_1,X_1,X_0)\mid Z_1,X_1,X_0\}=0\)

类似地,用塔性质,条件于 \((Z_1,X_0)\),并借助引理 29.1,得到

\[\begin{align*} & \mathrm{E}\bigl[h_1(X_0)\{Z_1-e(1,X_0)\}\,\mathrm{E}\{U_1(\beta)\mid Z_1,X_0\}\bigr] \\ &= \mathrm{E}\bigl[h_1(X_0)\{Z_1-e(1,X_0)\}\,\mathrm{E}\{U_1(\beta)\mid X_0\}\bigr]. \end{align*}\]

再用塔性质,条件于 \(X_0\),可知最后一项等于 0,因为 \(\mathrm{E}\{Z_1-e(1,X_0)\mid X_0\}=0\)

\(\square\)

要用定理 29.4,必须指定 \(h_1\)\(h_2\),好让方程的个数够解 \(\beta\)。例 29.4 回头看例 29.2。

例 29.4 在例 29.2 下,可以取 \(h_1=1\)\(h_2=(1,Z_1)\),得到

\[\begin{align*} \mathrm{E}\bigl[\{Z_2-e(1,Z_1,X_1,X_0)\}\{Y-(\beta_2+\beta_3 Z_1)Z_2\}\bigr] &= 0, \\ \mathrm{E}\bigl[Z_1\{Z_2-e(1,Z_1,X_1,X_0)\}\{Y-(\beta_2+\beta_3 Z_1)Z_2\}\bigr] &= 0, \\ \mathrm{E}\bigl[\{Z_1-e(1,X_0)\}\{Y-(\beta_2+\beta_3 Z_1)Z_2-\beta_1 Z_1\}\bigr] &= 0. \end{align*}\]

然后可以从上面这些线性方程解出 \(\beta\);见习题 29.6。一个自然的问题是:别的 \((h_1,h_2)\) 会不会给出更有效的估计量?答案是会。例如可以选许多对 \((h_1,h_2)\),再用广义矩方法(generalized method of moments, Hansen, 1982)。技术细节超出本书范围。

Naimi et al. (2017) 与 Vansteelandt and Joffe (2014) 给过结构嵌套模型的教程。

29.5 习题

29.1 g-零悖论
考虑图 29.4 那张简单因果图:没有预处理协变量 \(X_0\),也没有从 \((Z_1,Z_2)\)\(Y\) 的箭头。因此 \((Z_1,Z_2)\)\(Y\) 的效应是零。

    Z₁ → X₁ → Z₂      Y
           ↖         ↗
             U

原书图 29.4:\(X_1\)\(Y\) 之间有未测混杂。图忽略了预处理协变量 \(X_0\)

回头看例 29.1。证明:若

\[ \beta_1=\beta_2=0\text{ 且 }\beta_3=0 \]

或者

\[ \beta_1=\beta_2=0\text{ 且 }\mathrm{E}\{X_1(z_1)\}\text{ 不随 }z_1\text{ 变} \]

成立,则期望 \(\mathrm{E}\{Y(z_1,z_2)\}\) 不依赖 \((z_1,z_2)\)

注: 可第一条里的 \(\beta_3=0\) 排除了 \(Y\)\(X_1\) 的依赖,与 \(X_1\)\(Y\) 之间存在未测混杂 \(U\) 相矛盾;\(\mathrm{E}\{X_1(z_1)\}\) 不随 \(z_1\) 变,又排除了 \(X_1\)\(Z_1\) 的依赖,与 \(Z_1\to X_1\) 这条箭头相矛盾。也就是说:若 \(X_1\)\(Y\) 之间有未测混杂 \(U\),并且有箭头 \(Z_1\to X_1\),则例 29.1 里 \(\mathrm{E}\{Y(z_1,z_2)\}\) 的公式必须依赖 \((z_1,z_2)\)——这与「没有从 \((Z_1,Z_2)\)\(Y\) 的箭头」相矛盾。

29.2 原模型下的递推估计
在习题 29.1 的因果图下,考虑第 29.2.2 节的递推估计。证明:基于线性模型,该估计量收敛到 0。

29.3 MSM 下的 IPW
证明定理 29.3。

29.4 定义 29.2 的一个非线性例子
定义 29.2 的另一个典型例子是

\[ \operatorname{logit}\bigl[\operatorname{pr}\{Y(z_1,z_2)=1\mid X_0\}\bigr] = \beta_0+\beta_1 z_1+\beta_2 z_2+\beta_3^{\mathrm{T}}X_0. \tag{29.13} \]

若所有潜在结果都能看见,可以通过最小化负对数似然的期望来解 \(\beta\)(更简单的版本见附录 B.6.2):

\[ \beta = \arg\min_{b} \sum_{z_2}\sum_{z_1} \mathrm{E}\bigl\{\log(1+e^{\ell})-Y(z_1,z_2)\,\ell\bigr\} \tag{29.14} \]

其中 \(\ell=\beta_0+\beta_1 z_1+\beta_2 z_2+\beta_3^{\mathrm{T}}X_0\)。在序贯可忽略性下,可以从只牵涉可观测量的最小化问题解出 \(\beta\)

定理 29.5(MSM 下的 IPW) 在假设 29.1 与定义 29.2 下,(29.14) 里的 \(\beta\) 等于

\[ \beta = \arg\min_{b} \sum_{z_2}\sum_{z_1} \mathrm{E}\left[ \frac{1(Z_1=z_1)1(Z_2=z_2)}{e(z_1,X_0)\,e(z_2,Z_1,X_1,X_0)} \bigl\{\log(1+e^{\ell})-Y(z_1,z_2)\,\ell\bigr\} \right]. \]

证明定理 29.5。

注: 定理 29.5 提示一套基于加权回归的简单估计。例如在 (29.13) 下,可以把 \(Y_i\)\((1,Z_{1i},Z_{2i},X_{0i})\) 做加权逻辑回归,权重是 \(\hat e_1^{-1}(Z_{1i},X_{0i})\,\hat e_2^{-1}(Z_{2i},Z_{1i},X_{1i},X_{0i})\)

29.5 单个时点的结构嵌套模型
回想观察性研究的标准设定:IID 数据抽自 \(\{X,Z,Y(1),Y(0)\}\)。定义倾向得分 \(e(X)=\operatorname{pr}(Z=1\mid X)\)。假定

\[ Z\perp\!\!\!\perp Y(0)\mid X \]

以及下面的结构嵌套模型。

定义 29.4(单个时点的结构嵌套模型) 个体效应的条件均值是

\[ \mathrm{E}\{Y(z)-Y(0)\mid Z=z,X\}=g(z,X;\beta). \]

定义 29.4 里有一条逻辑限制 \(g(0,X;\beta)=0\)。证明下面的结果。

  1. 我们有

\[ \mathrm{E}\{Y-g(Z,X;\beta)\mid X,Z\} = \mathrm{E}\{Y-g(Z,X;\beta)\mid X\} = \mathrm{E}\{Y(0)\mid X\}. \]

  1. 我们有

\[ \mathrm{E}\bigl[h(X)\{Z-e(X)\}\{Y-g(Z,X;\beta)\}\bigr]=0 \tag{29.15} \]

对任意函数 \(h\) 成立,只要矩存在。

注: 方程 (29.15) 是参数估计的基础。考虑定义 29.4 的一个特例 \(g(z,X;\beta)=\beta z\)。取 \(h(X)=1\),得到

\[ \mathrm{E}\{(Z-e(X))(Y-\beta Z)\}=0. \]

解出 \(\beta\)

\[ \beta = \frac{\mathrm{E}\{(Z-e(X))Y\}}{\mathrm{E}\{(Z-e(X))Z\}}. \]

因此,\(\beta\) 等于把 \(Y\)\(Z\) 做 TSLS、并用 \(Z-e(X)\)\(Z\) 的 IV 时,\(Z\) 的系数。再做一点计算,也可以得到

\[ \beta = \frac{\operatorname{cov}\{Z-e(X),Y\}}{\operatorname{cov}\{Z-e(X)\}}. \]

因此,\(\beta\) 等于把 \(Y\)\(Z-e(X)\) 做 OLS 时 \(Z-e(X)\) 的系数,这在第 14.1 节出现过。

再考虑定义 29.4 的另一个特例 \(g(z,X;\beta)=(\beta_0+\beta_1^{\mathrm{T}}X)z\)。取 \(h(X)=(1,X)\),得到

\[ \mathrm{E}\left\{ \begin{pmatrix} Z-e(X)\\ (Z-e(X))X \end{pmatrix} (Y-\beta_0 Z-\beta_1^{\mathrm{T}}XZ) \right\} =0. \]

也就是说,\((\beta_0,\beta_1)\) 等于把 \(Y\)\((Z,XZ)\) 做 TSLS、并用 \(\bigl(Z-e(X),\ (Z-e(X))X\bigr)\)\((Z,XZ)\) 的 IV 时的那套系数。

29.6 例 29.4 下的估计
可以通过解例 29.4 里估计方程的经验版本来估 \(\beta\)。先估两个倾向得分,得到时点 1 的中心化处理

\[ \check Z_{1i}=Z_{1i}-\hat e(1,X_{0i}) \]

以及时点 2 的中心化处理

\[ \check Z_{2i}=Z_{2i}-\hat e(1,Z_{1i},X_{1i},X_{0i}). \]

证明:可以把 \(Y_i\)\((Z_{2i},Z_{1i}Z_{2i})\) 做 TSLS,并用 \((\check Z_{2i},Z_{1i}\check Z_{2i})\)\((Z_{2i},Z_{1i}Z_{2i})\) 的 IV,从而估出 \(\beta_2\)\(\beta_3\);然后把 \(Y_i-(\hat\beta_2+\hat\beta_3 Z_{1i})Z_{2i}\)\(Z_{1i}\) 做 TSLS,并用 \(\check Z_{1i}\)\(Z_{1i}\) 的 IV,从而估出 \(\beta_1\)

29.7 多个时点处理的 g-公式
把讨论伸到 \(K\) 个时点。变量的时间顺序(但不是因果图)是

\[ X_0\to Z_1\to X_1\to Z_2\to\cdots\to X_{K-1}\to Z_K. \]

引进记号 \(\bar Z_k=(Z_1,\ldots,Z_k)\)\(\bar X_k=(X_0,X_1,\ldots,X_k)\),小写 \(\bar z_k\)\(\bar x_k\) 表示对应的实现值。当 \(k=0\) 时,\(\bar X_0=X_0\)\(\bar Z_0\) 是空的。每个单元有 \(2^K\) 个潜在结果:

\[ Y(\bar z_K)\qquad\text{对所有 }z_1,\ldots,z_K=0,1. \]

假定下面的序贯可忽略性。

假设 29.2(多个时点的序贯可忽略性) 对所有 \(k=1,\ldots,K\) 以及所有 \(z_1,\ldots,z_K=0,1\),有

\[ Z_k\perp\!\!\!\perp Y(\bar z_K)\mid (\bar Z_{k-1},\bar X_{k-1}). \]

证明下面的定理 29.6。

定理 29.6(多个时点的 g-公式) 在假设 29.2 下,

\[ \mathrm{E}\{Y(\bar z_K)\} = \mathrm{E}\bigl[\cdots\mathrm{E}\{\mathrm{E}(Y\mid \bar z_K,\bar X_{K-1})\mid \bar z_{K-1},\bar X_{K-2}\}\cdots\mid z_1,X_0\bigr]. \]

注: 定理 29.6 里,我用简化记号「\(\bar z_k\)」表示「\(\bar Z_k=\bar z_k\)」。\(X\) 离散时,定理 29.6 收成

\[\begin{align*} \mathrm{E}\{Y(\bar z_K)\} &= \sum_{x_0}\sum_{x_1}\cdots\sum_{x_{K-1}} \mathrm{E}(Y\mid \bar z_K,\bar x_{K-1})\\ &\qquad\cdot \operatorname{pr}(x_{K-1}\mid \bar z_{K-1},\bar x_{K-2}) \cdots \operatorname{pr}(x_1\mid z_1,x_0) \operatorname{pr}(x_0); \end{align*}\]

\(X\) 连续时,定理 29.6 收成

\[\begin{align*} \mathrm{E}\{Y(\bar z_K)\} &= \int \mathrm{E}(Y\mid \bar z_K,\bar x_{K-1})\\ &\qquad\cdot f(x_{K-1}\mid \bar z_{K-1},\bar x_{K-2}) \cdots f(x_1\mid z_1,x_0)f(x_0)\, \mathrm{d}\bar x_{K-1}. \end{align*}\]

29.8 多个时点处理的 IPW
沿用习题 29.7 的设定。把 \(K\) 个时点的倾向得分定义为

\[\begin{align*} e(z_1,X_0) &= \operatorname{pr}(Z_1=z_1\mid X_0), \\ &\ \vdots \\ e(z_k,\bar Z_{k-1},\bar X_{k-1}) &= \operatorname{pr}(Z_k=z_k\mid \bar Z_{k-1},\bar X_{k-1}), \\ &\ \vdots \\ e(z_K,\bar Z_{K-1},\bar X_{K-1}) &= \operatorname{pr}(Z_K=z_K\mid \bar Z_{K-1},\bar X_{K-1}). \end{align*}\]

在隐含的重叠假定下,证明下面的定理 29.7。

定理 29.7(多个时点的 IPW) 在假设 29.2 下,

\[ \mathrm{E}\{Y(\bar z_K)\} = \mathrm{E}\left\{ \frac{1(Z_1=z_1)\cdots 1(Z_K=z_K)Y}{e(z_1,X_0)\cdots e(z_K,\bar Z_{K-1},\bar X_{K-1})} \right\}. \]

基于定理 29.7,构造 Horvitz–Thompson 与 Hajek 估计量。

29.9 多个时点处理的 MSM
潜在结果的个数随 \(K\) 指数增长。习题 29.7 与 29.8 里的公式,有限样本里并不能直接用。我们可以对潜在结果加上如下结构假定。

定义 29.5(多个时点的 MSM) 假定

\[ \mathrm{E}\{Y(\bar z_K)\mid X_0\}=f(\bar z_K,X_0;\beta). \]

定义 29.5 的两个典型例子是

\[ \mathrm{E}\{Y(\bar z_K)\mid X_0\} = \beta_0+\beta_1\sum_{k=1}^{K}z_k+\beta_2^{\mathrm{T}}X_0 \]

以及

\[ \mathrm{E}\{Y(\bar z_K)\mid X_0\} = \beta_0+\sum_{k=1}^{K}\beta_k z_k+\beta_{K+1}^{\mathrm{T}}X_0. \]

若所有潜在结果都知道,可以从下面的最小化问题解出 \(\beta\)

\[ \beta = \arg\min_{b} \sum_{\bar z_K} \mathrm{E}\bigl\{Y(\bar z_K)-f(\bar z_K,X_0;b)\bigr\}^2. \]

下面的定理 29.8 表明:在假设 29.2 下,可以从只牵涉可观测量的最小化问题解出 \(\beta\)

定理 29.8(多个时点 MSM 的 IPW) 在假设 29.2 下,

\[ \beta = \arg\min_{b} \sum_{\bar z_K} \mathrm{E}\left[ \frac{1(Z_1=z_1)\cdots 1(Z_K=z_K)}{e(z_1,X_0)\cdots e(z_K,\bar Z_{K-1},\bar X_{K-1})} \bigl\{Y-f(\bar z_K,X_0;b)\bigr\}^2 \right]. \]

29.10 多个时点处理的结构嵌套模型
沿用习题 29.7 的设定与习题 29.8 的记号。本题给出一般的结构嵌套模型。

定义 29.6(多个时点的结构嵌套模型) 时点 \(k\) 的条件效应是:对所有 \(\bar z_k\) 以及所有 \(k=1,\ldots,K\)

\[ \mathrm{E}\{Y(\bar z_k,0)-Y(\bar z_{k-1},0)\mid \bar z_k,\bar X_{k-1}\} = g_k(\bar z_k,\bar X_{k-1};\beta). \]

定义 29.6 里有一条逻辑限制:对所有 \(\bar z_{k-1}\) 以及所有 \(k=1,\ldots,K\)

\[ g_k(0,\bar z_{k-1},\bar X_{k-1};\beta)=0. \]

定义

\[ U_k(\beta) = Y-\sum_{s=1}^{k}g_s(\bar Z_s,\bar X_{s-1};\beta) \]

(对所有 \(k=1,\ldots,K\))。下面的定理 29.9 把定理 29.4 伸出去。

定理 29.9 在假设 29.2 与定义 29.6 下,对任意函数 \(h_k\)\(k=1,\ldots,K\)),只要矩存在,就有

\[ \mathrm{E}\bigl[h_k(\bar Z_{k-1},\bar X_{k-1})\{Z_k-e(1,\bar Z_{k-1},\bar X_{k-1})\}U_k(\beta)\bigr]=0. \]

注: 选合适的 \(h_k\),可以通过解定理 29.9 的经验版本来估 \(\beta\)

29.11 推荐阅读
Robins et al. (2000) 综述过 MSM。Naimi et al. (2017) 综述过 g-方法。


第七部分 附录