第 22 章 拆开混合分布与工具变量不等式

第 21 章的 IV 模型立在假设 21.1–21.3 上:

  1. \(Z\perp\!\!\!\perp\{D(1),D(0),Y(1),Y(0)\}\)
  2. \(\operatorname{pr}(U=\mathrm{d})=0\)
  3. \(U=\mathrm{a}\)\(\mathrm{n}\) 时,\(Y(1)=Y(0)\)

表 22.1 在单调性下,把观测到的组与对应的潜在组放在一起。

表 22.1 假设 21.2 下,观测组与潜在组

\(Z\) \(D\) 潜在组
\(Z=1\) \(D=1\) \(D(1)=1\) \(U=\mathrm{c}\)\(\mathrm{a}\)
\(Z=1\) \(D=0\) \(D(1)=0\) \(U=\mathrm{n}\)
\(Z=0\) \(D=1\) \(D(0)=1\) \(U=\mathrm{a}\)
\(Z=0\) \(D=0\) \(D(0)=0\) \(U=\mathrm{c}\)\(\mathrm{n}\)

有意思的是,假设 21.1–21.3 合在一起,居然有一些可检验的推论。Balke and Pearl (1997) 把它们叫做工具变量不等式(instrumental variable inequalities)。这一章会给这些不等式的一个特例,做一份偏直觉的推导。证明其实很直接:把 \(U\) 定义的各潜在组里,潜在结果的均值都认出来就行。

22.1 拆开混合分布

主要结果汇总在定理 22.1。定义

\[ \pi_u=\operatorname{pr}(U=u) \qquad (u=\mathrm{a},\mathrm{n},\mathrm{c}) \]

为类型 \(U=u\) 的比例,并定义

\[ \mu_{zu}=\mathrm{E}\{Y(z)\mid U=u\} \qquad (z=0,1;\ u=\mathrm{a},\mathrm{n},\mathrm{c}) \]

为类型 \(U=u\) 上潜在结果 \(Y(z)\) 的均值。排除限制蕴含 \(\mu_{1\mathrm{n}}=\mu_{0\mathrm{n}}\)\(\mu_{1\mathrm{a}}=\mu_{0\mathrm{a}}\)。分别记作 \(\mu_{\mathrm{n}}\)\(\mu_{\mathrm{a}}\)

定理 22.1 在假设 21.1–21.3 下,潜在类型的比例可由

\[ \begin{aligned} \pi_{\mathrm{n}} &= \operatorname{pr}(D=0\mid Z=1), \\ \pi_{\mathrm{a}} &= \operatorname{pr}(D=1\mid Z=0), \\ \pi_{\mathrm{c}} &= \mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0) \end{aligned} \]

识别;各类型上潜在结果的均值可由

\[ \begin{aligned} \mu_{\mathrm{n}} &= \mathrm{E}(Y\mid Z=1,D=0), \\ \mu_{\mathrm{a}} &= \mathrm{E}(Y\mid Z=0,D=1), \\ \mu_{1\mathrm{c}} &= \pi_{\mathrm{c}}^{-1} \bigl\{\mathrm{E}(DY\mid Z=1)-\mathrm{E}(DY\mid Z=0)\bigr\}, \\ \mu_{0\mathrm{c}} &= \pi_{\mathrm{c}}^{-1} \bigl[ \mathrm{E}\{(1-D)Y\mid Z=0\}-\mathrm{E}\{(1-D)Y\mid Z=1\} \bigr] \end{aligned} \]

识别。

定理 22.1 的证明 第一部分:先认出潜在依从类型的比例。从不接受者的比例可由

\[ \begin{aligned} \operatorname{pr}(D=0\mid Z=1) &= \operatorname{pr}(U=\mathrm{n}\mid Z=1) \\ &= \operatorname{pr}(U=\mathrm{n}) = \pi_{\mathrm{n}} \end{aligned} \]

识别;总是接受者的比例可由

\[ \begin{aligned} \operatorname{pr}(D=1\mid Z=0) &= \operatorname{pr}(U=\mathrm{a}\mid Z=0) \\ &= \operatorname{pr}(U=\mathrm{a})=\pi_{\mathrm{a}} \end{aligned} \]

识别。于是依从者的比例是

\[ \begin{aligned} \pi_{\mathrm{c}} &= \operatorname{pr}(U=\mathrm{c}) \\ &= 1-\pi_{\mathrm{n}}-\pi_{\mathrm{a}} \\ &= 1-\operatorname{pr}(D=0\mid Z=1)-\operatorname{pr}(D=1\mid Z=0) \\ &= \mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0) \\ &= \tau_D, \end{aligned} \]

与前面的讨论一致。虽然我们并不能认出每一个人的潜在依从类型,却可以认出从不接受者、总是接受者与依从者的比例。

第二部分:再认出各潜在依从类型里潜在结果的均值。观测组 \((Z=1,D=0)\) 里只有从不接受者,所以

\[ \mathrm{E}(Y\mid Z=1,D=0) = \mathrm{E}\{Y(1)\mid Z=1,U=\mathrm{n}\} = \mathrm{E}\{Y(1)\mid U=\mathrm{n}\} = \mu_{\mathrm{n}}. \]

观测组 \((Z=0,D=1)\) 里只有总是接受者,所以

\[ \mathrm{E}(Y\mid Z=0,D=1) = \mathrm{E}\{Y(0)\mid Z=0,U=\mathrm{a}\} = \mathrm{E}\{Y(0)\mid U=\mathrm{a}\} = \mu_{\mathrm{a}}. \]

观测组 \((Z=1,D=1)\) 里既有依从者,也有总是接受者,所以

\[\begin{align*} \mathrm{E}(Y\mid Z=1,D=1) &= \mathrm{E}\{Y(1)\mid Z=1,D(1)=1\} \\ &= \mathrm{E}\{Y(1)\mid D(1)=1\} \\ &= \operatorname{pr}\{D(0)=1\mid D(1)=1\}\mathrm{E}\{Y(1)\mid D(1)=1,D(0)=1\} \\ &\quad + \operatorname{pr}\{D(0)=0\mid D(1)=1\}\mathrm{E}\{Y(1)\mid D(1)=1,D(0)=0\} \\ &= \frac{\pi_{\mathrm{c}}}{\pi_{\mathrm{c}}+\pi_{\mathrm{a}}}\mu_{1\mathrm{c}} + \frac{\pi_{\mathrm{a}}}{\pi_{\mathrm{c}}+\pi_{\mathrm{a}}}\mu_{\mathrm{a}}. \end{align*}\]

解上面的线性方程,得到

\[\begin{align*} \mu_{1\mathrm{c}} &= \pi_{\mathrm{c}}^{-1} \bigl\{(\pi_{\mathrm{c}}+\pi_{\mathrm{a}})\mathrm{E}(Y\mid Z=1,D=1)-\pi_{\mathrm{a}}\mathrm{E}(Y\mid Z=0,D=1)\bigr\} \\ &= \pi_{\mathrm{c}}^{-1} \bigl\{ \operatorname{pr}(D=1\mid Z=1)\mathrm{E}(Y\mid Z=1,D=1) \\ &\qquad -\operatorname{pr}(D=1\mid Z=0)\mathrm{E}(Y\mid Z=0,D=1) \bigr\} \\ &= \pi_{\mathrm{c}}^{-1} \bigl\{\mathrm{E}(DY\mid Z=1)-\mathrm{E}(DY\mid Z=0)\bigr\}. \end{align*}\]

观测组 \((Z=0,D=0)\) 里既有依从者,也有从不接受者,所以

\[\begin{align*} \mathrm{E}(Y\mid Z=0,D=0) &= \mathrm{E}\{Y(0)\mid Z=0,D(0)=0\} \\ &= \mathrm{E}\{Y(0)\mid D(0)=0\} \\ &= \operatorname{pr}\{D(1)=1\mid D(0)=0\}\mathrm{E}\{Y(0)\mid D(1)=1,D(0)=0\} \\ &\quad + \operatorname{pr}\{D(1)=0\mid D(0)=0\}\mathrm{E}\{Y(0)\mid D(1)=0,D(0)=0\} \\ &= \frac{\pi_{\mathrm{c}}}{\pi_{\mathrm{c}}+\pi_{\mathrm{n}}}\mu_{0\mathrm{c}} + \frac{\pi_{\mathrm{n}}}{\pi_{\mathrm{c}}+\pi_{\mathrm{n}}}\mu_{\mathrm{n}}. \end{align*}\]

解上面的线性方程,得到

\[\begin{align*} \mu_{0\mathrm{c}} &= \pi_{\mathrm{c}}^{-1} \bigl\{(\pi_{\mathrm{c}}+\pi_{\mathrm{n}})\mathrm{E}(Y\mid Z=0,D=0)-\pi_{\mathrm{n}}\mathrm{E}(Y\mid Z=1,D=0)\bigr\} \\ &= \pi_{\mathrm{c}}^{-1} \bigl\{ \operatorname{pr}(D=0\mid Z=0)\mathrm{E}(Y\mid Z=0,D=0) \\ &\qquad -\operatorname{pr}(D=0\mid Z=1)\mathrm{E}(Y\mid Z=1,D=0) \bigr\} \\ &= \pi_{\mathrm{c}}^{-1} \bigl[ \mathrm{E}\{(1-D)Y\mid Z=0\}-\mathrm{E}\{(1-D)Y\mid Z=1\} \bigr]. \end{align*}\]

证毕。

由定理 22.1 里 \(\mu_{1\mathrm{c}}\)\(\mu_{0\mathrm{c}}\) 的公式,可以把 \(\tau_{\mathrm{c}}=\mu_{1\mathrm{c}}-\mu_{0\mathrm{c}}\) 化简成

\[ \tau_{\mathrm{c}}=\bigl\{\mathrm{E}(Y\mid Z=1)-\mathrm{E}(Y\mid Z=0)\bigr\}/\pi_{\mathrm{c}}, \]

与定理 21.1 的公式相同。

定理 22.1 盯的是潜在结果均值 \(\mu_{zu}\)。Imbens and Rubin (1997) 给出过潜在结果分布的更一般识别公式;细节留给习题 22.3。

22.2 可检验的推论:工具变量不等式

绕路用定理 22.1 再推一遍 \(\tau_{\mathrm{c}}\),还有没有别的收获?有。结果若是二值的,下面的不等式必须成立:

\[ 0\le\mu_{1\mathrm{c}}\le 1, \qquad 0\le\mu_{0\mathrm{c}}\le 1, \]

从而有四条不等式

\[\begin{align*} \mathrm{E}(DY\mid Z=1)-\mathrm{E}(DY\mid Z=0) &\ge 0, \\ \mathrm{E}(DY\mid Z=1)-\mathrm{E}(DY\mid Z=0) &\le \mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0), \\ \mathrm{E}\{(1-D)Y\mid Z=0\}-\mathrm{E}\{(1-D)Y\mid Z=1\} &\ge 0, \\ \mathrm{E}\{(1-D)Y\mid Z=0\}-\mathrm{E}\{(1-D)Y\mid Z=1\} &\le \mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0). \end{align*}\]

整理一下,得到下面这条统一的不等式。

定理 22.2(工具变量不等式) 结果 \(Y\) 为二值时,假设 21.1–21.3 蕴含

\[ \mathrm{E}(Q\mid Z=1)-\mathrm{E}(Q\mid Z=0)\ge 0, \tag{22.1} \]

其中 \(Q=DY,\ D(1-Y),\ (D-1)Y\) 以及 \(D+Y-DY\)

在 IV 假定 21.1–21.3 下,\(Q=DY,\ D(1-Y),\ (D-1)Y\)\(D+Y-DY\) 的均值差都必须非负。重要的是:这些推论只涉及观测变量的分布。拒绝工具变量不等式,就是拒绝 IV 假定。

Balke and Pearl (1997) 推导过更一般的 IV 不等式,有单调性的、也有没有单调性的。上面的证明策略来自 Jiang and Ding (2020),他们处理的设定稍复杂一些。定理 22.2 只写出了二值结果的可检验推论。习题 22.4 给出等价形式,习题 22.5 给出一般结果。

22.3 例子

结果为二值时,可以用下面的矩方法去估所有参数。

IVbinary = function(n111, n110, n101, n100,
                    n011, n010, n001, n000){
  n_tr = n111 + n110 + n101 + n100
  n_co = n011 + n010 + n001 + n000
  n    = n_tr + n_co
  ## proportions of the latent strata
  pi_n = (n101 + n100)/n_tr
  pi_a = (n011 + n010)/n_co
  pi_c = 1 - pi_n - pi_a
  ## four observed means of the outcomes (Z=z, D=d)
  mean_y_11 = n111/(n111 + n110)
  mean_y_10 = n101/(n101 + n100)
  mean_y_01 = n011/(n011 + n010)
  mean_y_00 = n001/(n001 + n000)
  ## means of the outcomes of two strata
  mu_n1 = mean_y_10
  mu_a0 = mean_y_01
  ## ER implies the following two means
  mu_n0 = mu_n1
  mu_a1 = mu_a0
  ## stratum (Z=1, D=1) is a mixture of c and a
  mu_c1 = ((pi_c + pi_a)*mean_y_11 - pi_a*mu_a1)/pi_c
  ## stratum (Z=0, D=0) is a mixture of c and n
  mu_c0 = ((pi_c + pi_n)*mean_y_00 - pi_n*mu_n0)/pi_c
  ## identifiable quantities from the observed data
  list(pi_c = pi_c, pi_n = pi_n, pi_a = pi_a,
       mu_c1 = mu_c1, mu_c0 = mu_c0,
       mu_n1 = mu_n1, mu_n0 = mu_n0,
       mu_a1 = mu_a1, mu_a0 = mu_a0,
       tau_c = mu_c1 - mu_c0)
}

下面回到两个二值数据的典范例子。

例 22.1 Investigators et al. (2014) 评估:对临床诊断为破裂主动脉瘤的患者,紧急腔内修复与开放手术修复两种策略哪个更有效。患者被随机分到腔内策略或开放修复。主要结果是 30 天生存状态。令 \(Z\) 为分配的处理,\(Z=1\) 为腔内策略、\(Z=0\) 为开放修复。令 \(D\) 为接受的处理。令 \(Y\) 为生存状态,\(Y=1\) 为死亡、\(Y=0\) 为存活。表 22.2(a) 汇总观测数据。用上面的 IVbinary 得到:

> investigators_analysis = IVbinary(n111 = 107, n110 = 42,
+                                   n101 = 68,  n100 = 42,
+                                   n011 = 24,  n010 = 8,
+                                   n001 = 131, n000 = 79)
估计
\(\hat\pi_{\mathrm{c}}\) \(0.443\)
\(\hat\pi_{\mathrm{n}}\) \(0.425\)
\(\hat\pi_{\mathrm{a}}\) \(0.132\)
\(\hat\mu_{1\mathrm{c}}\) \(0.709\)
\(\hat\mu_{0\mathrm{c}}\) \(0.629\)
\(\hat\mu_{\mathrm{n}}\) \(0.618\)
\(\hat\mu_{\mathrm{a}}\) \(0.75\)
\(\hat\tau_{\mathrm{c}}\) \(0.079\)

没有违背 IV 假定的迹象。

例 22.2 Hirano et al. (2000) 里,医生被随机抽中,收到一封鼓励信:请给有流感风险的患者接种。处理是真正打了流感疫苗,结果是是否因流感相关原因就诊。可有些患者并不依从分配。令 \(Z_i\) 为是否鼓励接种的指示,\(Z=1\) 表示医生收到鼓励信。令 \(D\) 为接受的处理。令 \(Y\) 为结果:冬季发生流感相关住院则 \(Y=0\),否则 \(Y=1\)。数据细节见习题 21.7。表 22.2(b) 汇总观测数据。用 IVbinary 得到:

> flu_analysis = IVbinary(n111 = 31,  n110 = 422,
+                         n101 = 84,  n100 = 935,
+                         n011 = 30,  n010 = 233,
+                         n001 = 99,  n000 = 1027)
估计
\(\hat\pi_{\mathrm{c}}\) \(0.118\)
\(\hat\pi_{\mathrm{n}}\) \(0.692\)
\(\hat\pi_{\mathrm{a}}\) \(0.189\)
\(\hat\mu_{1\mathrm{c}}\) \(-0.005\)
\(\hat\mu_{0\mathrm{c}}\) \(0.120\)
\(\hat\mu_{\mathrm{n}}\) \(0.082\)
\(\hat\mu_{\mathrm{a}}\) \(0.114\)
\(\hat\tau_{\mathrm{c}}\) \(-0.125\)

因为 \(\hat\mu_{1\mathrm{c}}<0\),有违背 IV 假定的迹象。

表 22.2 二值数据与 IV 不等式

  1. Investigators et al. (2014) 的研究
\(Z=1\), \(D=1\) \(Z=1\), \(D=0\) \(Z=0\), \(D=1\) \(Z=0\), \(D=0\)
\(Y=1\) \(107\) \(68\) \(24\) \(131\)
\(Y=0\) \(42\) \(42\) \(8\) \(79\)
  1. Hirano et al. (2000) 的研究
\(Z=1\), \(D=1\) \(Z=1\), \(D=0\) \(Z=0\), \(D=1\) \(Z=0\), \(D=0\)
\(Y=1\) \(31\) \(85\) \(30\) \(99\)
\(Y=0\) \(424\) \(944\) \(237\) \(1041\)

22.4 习题

22.1 更细的数据分析
例 22.1 与 22.2 没有理会估计里的不确定性。请给出真参数的置信区间。

22.2 依从者的风险比
结果为二值时,可以把依从者的风险比定义为

\[ \mathrm{RR}_{\mathrm{c}} = \frac{\operatorname{pr}\{Y(1)=1\mid U=\mathrm{c}\}}{\operatorname{pr}\{Y(0)=1\mid U=\mathrm{c}\}}. \]

证明:在假设 21.1–21.3 下,它可由

\[ \mathrm{RR}_{\mathrm{c}} = \frac{\mathrm{E}(DY\mid Z=1)-\mathrm{E}(DY\mid Z=0)}{\mathrm{E}\{(D-1)Y\mid Z=1\}-\mathrm{E}\{(D-1)Y\mid Z=0\}} \]

识别。

注: 有了定理 22.1,\(\mathrm{E}\{Y(1)\mid U=\mathrm{c}\}\)\(\mathrm{E}\{Y(0)\mid U=\mathrm{c}\}\) 之间的任何比较都可以识别。

22.3 拆开混合物:分布层面的结果
本题把定理 22.1 伸开。定义

\[ f_{zu}(y)=\operatorname{pr}\{Y(z)=y\mid U=u\}, \qquad (z=0,1;\ u=\mathrm{a},\mathrm{n},\mathrm{c}) \]

为潜在层 \(U=u\)\(Y(z)\) 的密度,并定义

\[ g_{zd}(y)=\operatorname{pr}(Y=y\mid Z=z,D=d) \]

为观测组 \((Z=z,D=d)\) 里结果的密度。排除限制蕴含 \(f_{1\mathrm{n}}(y)=f_{0\mathrm{n}}(y)\)\(f_{1\mathrm{a}}(y)=f_{0\mathrm{a}}(y)\)。分别记作 \(f_{\mathrm{n}}(y)\)\(f_{\mathrm{a}}(y)\)

证明下面的定理 22.3。

定理 22.3 在假设 21.1–21.3 下,各类型上潜在结果的密度可由

\[ \begin{aligned} f_{\mathrm{n}}(y) &= g_{10}(y), \\ f_{\mathrm{a}}(y) &= g_{01}(y), \\ f_{1\mathrm{c}}(y) &= \pi_{\mathrm{c}}^{-1} \bigl\{\operatorname{pr}(D=1\mid Z=1)g_{11}(y)-\operatorname{pr}(D=1\mid Z=0)g_{01}(y)\bigr\}, \\ f_{0\mathrm{c}}(y) &= \pi_{\mathrm{c}}^{-1} \bigl\{\operatorname{pr}(D=0\mid Z=0)g_{00}(y)-\operatorname{pr}(D=0\mid Z=1)g_{10}(y)\bigr\} \end{aligned} \]

识别。

22.4 定理 22.2 的另一种形式
(22.1) 里的不等式可以改写成:对 \(y=0,1\) 都有

\[ \operatorname{pr}(D=1,Y=y\mid Z=1) \ge \operatorname{pr}(D=1,Y=y\mid Z=0), \]

\[ \operatorname{pr}(D=0,Y=y\mid Z=0) \ge \operatorname{pr}(D=0,Y=y\mid Z=1). \]

22.5 一般结果的 IV 不等式
对一般结果 \(Y\),证明假设 21.1–21.3 蕴含:对所有 \(y\)

\[\begin{align*} \operatorname{pr}(D=1,Y\ge y\mid Z=1) &\ge \operatorname{pr}(D=1,Y\ge y\mid Z=0), \\ \operatorname{pr}(D=1,Y< y\mid Z=1) &\ge \operatorname{pr}(D=1,Y< y\mid Z=0), \\ \operatorname{pr}(D=0,Y\ge y\mid Z=0) &\ge \operatorname{pr}(D=0,Y\ge y\mid Z=1), \\ \operatorname{pr}(D=0,Y< y\mid Z=0) &\ge \operatorname{pr}(D=0,Y< y\mid Z=1). \end{align*}\]

注: Imbens and Rubin (1997) 与 Kitagawa (2015) 讨论过相近的结果。第一条不等式可以用 Kolmogorov–Smirnov 统计量的类似物来检验:

\[ \mathrm{KS}_1 = \max_y \left\lvert \frac{\sum_{i=1}^{n}Z_i D_i I(Y_i\le y)}{\sum_{i=1}^{n}Z_i D_i} - \frac{\sum_{i=1}^{n}(1-Z_i)D_i I(Y_i\le y)}{\sum_{i=1}^{n}(1-Z_i)D_i} \right\rvert. \]

22.6 IV 不等式的例子
请给一个所有 IV 不等式都成立的例子,再给一个并非全部成立的例子。需要指定二值变量 \((Z,D,Y)\) 的联合分布。

22.7 关键假定被违背时
定理 21.1 依赖随机化、单调性与排除限制。后两条即便在随机化实验里也不可检验。它们一旦被违背,IV 估计量就不再识别 CACE。本题给出下面两种情形,是 Angrist et al. (1996) 命题 2 与 3 的复述。回想 \(\pi_u=\operatorname{pr}(U=u)\),以及 \(\tau_u=\mathrm{E}\{Y(1)-Y(0)\mid U=u\}\)\(u=\mathrm{a},\mathrm{n},\mathrm{c},\mathrm{d}\))。

定理 22.4 (a) 在假设 21.1 与 21.2 下、没有排除限制时,

\[ \frac{\mathrm{E}(Y\mid Z=1)-\mathrm{E}(Y\mid Z=0)}{\mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0)} -\tau_{\mathrm{c}} = \frac{\pi_{\mathrm{a}}\tau_{\mathrm{a}}+\pi_{\mathrm{n}}\tau_{\mathrm{n}}}{\pi_{\mathrm{c}}}. \]

  1. 在假设 21.1 与 21.3 下、没有单调性时,

\[ \frac{\mathrm{E}(Y\mid Z=1)-\mathrm{E}(Y\mid Z=0)}{\mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0)} -\tau_{\mathrm{c}} = \frac{\pi_{\mathrm{d}}(\tau_{\mathrm{c}}+\tau_{\mathrm{d}})}{\pi_{\mathrm{c}}-\pi_{\mathrm{d}}}. \]

证明定理 22.4。

22.8 其他分析的麻烦
推导第 22.1 节的 IV 不等式时,我们拆开了混合分布:认出潜在层的比例,以及它们潜在结果的条件均值。这些结果也帮助我们看清另一些「看起来合理」的分析为什么有问题。下面复习三个估计量,并假定假设 21.1–21.3 成立。

  1. 按实际接受的处理分析(as-treated analysis)比较接受处理与接受对照的人的结果均值,得到

\[ \tau_{\mathrm{AT}}=\mathrm{E}(Y\mid D=1)-\mathrm{E}(Y\mid D=0). \]

证明

\[ \tau_{\mathrm{AT}} = \frac{\pi_{\mathrm{a}}\mu_{\mathrm{a}}+\operatorname{pr}(Z=1)\pi_{\mathrm{c}}\mu_{1\mathrm{c}}}{\operatorname{pr}(D=1)} - \frac{\pi_{\mathrm{n}}\mu_{\mathrm{n}}+\operatorname{pr}(Z=0)\pi_{\mathrm{c}}\mu_{0\mathrm{c}}}{\operatorname{pr}(D=0)}. \]

  1. 符合方案分析(per-protocol analysis)比较处理组与对照组里依从了分配的人,得到

\[ \tau_{\mathrm{PP}}=\mathrm{E}(Y\mid Z=1,D=1)-\mathrm{E}(Y\mid Z=0,D=0). \]

证明

\[ \tau_{\mathrm{PP}} = \frac{\pi_{\mathrm{a}}\mu_{\mathrm{a}}+\pi_{\mathrm{c}}\mu_{1\mathrm{c}}}{\pi_{\mathrm{a}}+\pi_{\mathrm{c}}} - \frac{\pi_{\mathrm{n}}\mu_{\mathrm{n}}+\pi_{\mathrm{c}}\mu_{0\mathrm{c}}}{\pi_{\mathrm{n}}+\pi_{\mathrm{c}}}. \]

  1. 也可以在给定处理分配后,比较接受处理与接受对照的人的结果,得到

\[ \begin{aligned} \tau_{Z=1} &= \mathrm{E}(Y\mid Z=1,D=1)-\mathrm{E}(Y\mid Z=1,D=0), \\ \tau_{Z=0} &= \mathrm{E}(Y\mid Z=0,D=1)-\mathrm{E}(Y\mid Z=0,D=0). \end{aligned} \]

证明它们化成

\[ \tau_{Z=1} = \frac{\pi_{\mathrm{a}}\mu_{\mathrm{a}}+\pi_{\mathrm{c}}\mu_{1\mathrm{c}}}{\pi_{\mathrm{a}}+\pi_{\mathrm{c}}} -\mu_{\mathrm{n}}, \qquad \tau_{Z=0} = \mu_{\mathrm{a}} - \frac{\pi_{\mathrm{n}}\mu_{\mathrm{n}}+\pi_{\mathrm{c}}\mu_{0\mathrm{c}}}{\pi_{\mathrm{n}}+\pi_{\mathrm{c}}}. \]

22.9 整个人群上平均因果效应的界
把第 22.1 节的讨论伸到第 21.6 节的记号。有了潜在结果 \(Y(d)\),把接受的处理对结果的平均因果效应定义为

\[ \delta=\mathrm{E}\{Y(d=1)-Y(d=0)\}, \]

并把 \(\mu_{zu}\) 的定义改成

\[ m_{du}=\mathrm{E}\{Y(d)\mid U=u\}, \qquad (d=0,1;\ u=\mathrm{a},\mathrm{n},\mathrm{c}), \]

因为记号换了。它们满足

\[ \delta=\sum_{u=\mathrm{a},\mathrm{n},\mathrm{c}}\pi_u(m_{1u}-m_{0u}). \]

第 22.1 节认出了 \(\pi_{\mathrm{a}}\)\(\pi_{\mathrm{n}}\)\(\pi_{\mathrm{c}}\),以及 \(m_{1\mathrm{a}}=\mu_{1\mathrm{a}}\)\(m_{0\mathrm{n}}=\mu_{0\mathrm{n}}\)\(m_{1\mathrm{c}}=\mu_{1\mathrm{c}}\)\(m_{0\mathrm{c}}=\mu_{0\mathrm{c}}\)。可数据对 \(m_{0\mathrm{a}}\)\(m_{1\mathrm{n}}\) 没有任何信息。因此 \(\delta\) 不可识别。结果有界时,可以给 \(\delta\) 划界。

定理 22.5 在假设 21.2–21.4 下,若结果夹在 \([\underline{y},\overline{y}]\) 里,则 \(\underline{\delta}\le\delta\le\overline{\delta}\),其中

\[ \underline{\delta} = \delta'-\overline{y}\,\operatorname{pr}(D=1\mid Z=0)+\underline{y}\,\operatorname{pr}(D=0\mid Z=1) \]

以及

\[ \overline{\delta} = \delta'-\underline{y}\,\operatorname{pr}(D=1\mid Z=0)+\overline{y}\,\operatorname{pr}(D=0\mid Z=1), \]

\(\delta'=\mathrm{E}(DY\mid Z=1)-\mathrm{E}(Y-DY\mid Z=0)\)

证明定理 22.5。

注: 结果为二值时,界化成

\[ \underline{\delta} = \mathrm{E}(DY\mid Z=1)-\mathrm{E}(D+Y-DY\mid Z=0) \]

以及

\[ \overline{\delta} = \mathrm{E}(DY+1-D\mid Z=1)-\mathrm{E}(Y-DY\mid Z=0). \]

22.10 单侧不依从与统计推断
考虑一项随机化鼓励设计:分到对照的人完全接触不到处理。对单元 \(i\),令 \(Z_i\) 为二值的分配处理,\(D_i\) 为二值的接受处理,\(Y_i\) 为关心的结果。单侧不依从发生在

\[ Z_i=0\ \Longrightarrow\ D_i=0 \qquad (i=1,\ldots,n). \]

假定假设 21.1 成立。

  1. 这时单调性假设 21.2 成立吗?由 \(\{D_i(1),D_i(0)\}\) 定义的潜在层有几层?怎样用观测数据分布认出它们的比例?
  2. 写出排除限制。在排除限制下,证明 \(\mathrm{E}\{Y(z)\mid U=u\}\) 可由观测数据分布识别。给出所有可能的 \(z\)\(u\) 的公式。这时怎样识别 CACE?
  3. 若对所有单元都观测到预处理协变量 \(X_i\),怎样用协变量信息改善 CACE 的估计效率?
  4. 在假设 21.1 下,排除限制假设 21.3 有可检验的推论,也就是单侧不依从的 IV 不等式。请写出这些不等式。
  5. Sommer and Zeger (1991) 给出下面这套数据:
\(Z=1\), \(D=1\) \(Z=1\), \(D=0\) \(Z=0\), \(D=1\) \(Z=0\), \(D=0\)
\(Y=1\) \(9663\) \(2385\) \(0\) \(11514\)
\(Y=0\) \(12\) \(34\) \(0\) \(74\)

分配的处理 \(Z\) 是儿童是否被分到维生素 A 补充,接受的处理 \(D\) 是儿童是否真正补充了维生素 A,二值结果 \(Y\) 是生存指示。原始 RCT 在印度尼西亚进行。请重新分析这套数据。

注: Bloom (1984) 最先讨论单侧不依从,并提议估计量 \(\hat\tau_{\mathrm{c}}=\hat\tau_Y/\hat\tau_D\),有时叫做 Bloom 估计量。Bloom (1984) 的记号与本章不同。

22.11 带部分依从的单侧不依从
Sanders and Karim (2021, 表 3) 报告过一项 RCT 的数据,目标是估计有精神障碍的人里,戒烟干预的效力。

分配的组 接受的处理 组人数 阳性结果数
对照 \(151\) \(25\)
处理 \(35\) \(7\)
处理 部分 \(42\) \(17\)
处理 全部 \(70\) \(40\)

接受的处理分三档:「全部」对应参加全部 8 次治疗,「部分」对应参加 5 到 7 次,「无」对应少于 5 次。结果是二值指示:相对于基线,三个月时吸烟量减少 50% 或更多。

本题里分配的处理 \(Z\) 是二值的,接受的处理 \(D\) 取三个值 \(0,0.5,1\),分别对应「无」「部分」「全部」。三水平的 \(D\) 带来麻烦,可在对照分配下它只能是 \(0\)。本题里潜在层 \(U=\{D(1),D(0)\}\) 有几层?它们的比例能识别吗?

排除限制怎样伸到本题?关心的因果效应可以是什么?它们能识别吗?

请根据上面这些问题分析数据。

22.12 推荐阅读
Balke and Pearl (1997) 推导过更一般的 IV 不等式。