第 22 章 拆开混合分布与工具变量不等式
第 21 章的 IV 模型立在假设 21.1–21.3 上:
- \(Z\perp\!\!\!\perp\{D(1),D(0),Y(1),Y(0)\}\);
- \(\operatorname{pr}(U=\mathrm{d})=0\);
- 当 \(U=\mathrm{a}\) 或 \(\mathrm{n}\) 时,\(Y(1)=Y(0)\)。
表 22.1 在单调性下,把观测到的组与对应的潜在组放在一起。
表 22.1 假设 21.2 下,观测组与潜在组
| \(Z\) | \(D\) | 潜在组 | |
|---|---|---|---|
| \(Z=1\) | \(D=1\) | \(D(1)=1\) | \(U=\mathrm{c}\) 或 \(\mathrm{a}\) |
| \(Z=1\) | \(D=0\) | \(D(1)=0\) | \(U=\mathrm{n}\) |
| \(Z=0\) | \(D=1\) | \(D(0)=1\) | \(U=\mathrm{a}\) |
| \(Z=0\) | \(D=0\) | \(D(0)=0\) | \(U=\mathrm{c}\) 或 \(\mathrm{n}\) |
有意思的是,假设 21.1–21.3 合在一起,居然有一些可检验的推论。Balke and Pearl (1997) 把它们叫做工具变量不等式(instrumental variable inequalities)。这一章会给这些不等式的一个特例,做一份偏直觉的推导。证明其实很直接:把 \(U\) 定义的各潜在组里,潜在结果的均值都认出来就行。
22.1 拆开混合分布
主要结果汇总在定理 22.1。定义
\[ \pi_u=\operatorname{pr}(U=u) \qquad (u=\mathrm{a},\mathrm{n},\mathrm{c}) \]
为类型 \(U=u\) 的比例,并定义
\[ \mu_{zu}=\mathrm{E}\{Y(z)\mid U=u\} \qquad (z=0,1;\ u=\mathrm{a},\mathrm{n},\mathrm{c}) \]
为类型 \(U=u\) 上潜在结果 \(Y(z)\) 的均值。排除限制蕴含 \(\mu_{1\mathrm{n}}=\mu_{0\mathrm{n}}\) 与 \(\mu_{1\mathrm{a}}=\mu_{0\mathrm{a}}\)。分别记作 \(\mu_{\mathrm{n}}\) 与 \(\mu_{\mathrm{a}}\)。
定理 22.1 在假设 21.1–21.3 下,潜在类型的比例可由
\[ \begin{aligned} \pi_{\mathrm{n}} &= \operatorname{pr}(D=0\mid Z=1), \\ \pi_{\mathrm{a}} &= \operatorname{pr}(D=1\mid Z=0), \\ \pi_{\mathrm{c}} &= \mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0) \end{aligned} \]
识别;各类型上潜在结果的均值可由
\[ \begin{aligned} \mu_{\mathrm{n}} &= \mathrm{E}(Y\mid Z=1,D=0), \\ \mu_{\mathrm{a}} &= \mathrm{E}(Y\mid Z=0,D=1), \\ \mu_{1\mathrm{c}} &= \pi_{\mathrm{c}}^{-1} \bigl\{\mathrm{E}(DY\mid Z=1)-\mathrm{E}(DY\mid Z=0)\bigr\}, \\ \mu_{0\mathrm{c}} &= \pi_{\mathrm{c}}^{-1} \bigl[ \mathrm{E}\{(1-D)Y\mid Z=0\}-\mathrm{E}\{(1-D)Y\mid Z=1\} \bigr] \end{aligned} \]
识别。
定理 22.1 的证明 第一部分:先认出潜在依从类型的比例。从不接受者的比例可由
\[ \begin{aligned} \operatorname{pr}(D=0\mid Z=1) &= \operatorname{pr}(U=\mathrm{n}\mid Z=1) \\ &= \operatorname{pr}(U=\mathrm{n}) = \pi_{\mathrm{n}} \end{aligned} \]
识别;总是接受者的比例可由
\[ \begin{aligned} \operatorname{pr}(D=1\mid Z=0) &= \operatorname{pr}(U=\mathrm{a}\mid Z=0) \\ &= \operatorname{pr}(U=\mathrm{a})=\pi_{\mathrm{a}} \end{aligned} \]
识别。于是依从者的比例是
\[ \begin{aligned} \pi_{\mathrm{c}} &= \operatorname{pr}(U=\mathrm{c}) \\ &= 1-\pi_{\mathrm{n}}-\pi_{\mathrm{a}} \\ &= 1-\operatorname{pr}(D=0\mid Z=1)-\operatorname{pr}(D=1\mid Z=0) \\ &= \mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0) \\ &= \tau_D, \end{aligned} \]
与前面的讨论一致。虽然我们并不能认出每一个人的潜在依从类型,却可以认出从不接受者、总是接受者与依从者的比例。
第二部分:再认出各潜在依从类型里潜在结果的均值。观测组 \((Z=1,D=0)\) 里只有从不接受者,所以
\[ \mathrm{E}(Y\mid Z=1,D=0) = \mathrm{E}\{Y(1)\mid Z=1,U=\mathrm{n}\} = \mathrm{E}\{Y(1)\mid U=\mathrm{n}\} = \mu_{\mathrm{n}}. \]
观测组 \((Z=0,D=1)\) 里只有总是接受者,所以
\[ \mathrm{E}(Y\mid Z=0,D=1) = \mathrm{E}\{Y(0)\mid Z=0,U=\mathrm{a}\} = \mathrm{E}\{Y(0)\mid U=\mathrm{a}\} = \mu_{\mathrm{a}}. \]
观测组 \((Z=1,D=1)\) 里既有依从者,也有总是接受者,所以
\[\begin{align*} \mathrm{E}(Y\mid Z=1,D=1) &= \mathrm{E}\{Y(1)\mid Z=1,D(1)=1\} \\ &= \mathrm{E}\{Y(1)\mid D(1)=1\} \\ &= \operatorname{pr}\{D(0)=1\mid D(1)=1\}\mathrm{E}\{Y(1)\mid D(1)=1,D(0)=1\} \\ &\quad + \operatorname{pr}\{D(0)=0\mid D(1)=1\}\mathrm{E}\{Y(1)\mid D(1)=1,D(0)=0\} \\ &= \frac{\pi_{\mathrm{c}}}{\pi_{\mathrm{c}}+\pi_{\mathrm{a}}}\mu_{1\mathrm{c}} + \frac{\pi_{\mathrm{a}}}{\pi_{\mathrm{c}}+\pi_{\mathrm{a}}}\mu_{\mathrm{a}}. \end{align*}\]
解上面的线性方程,得到
\[\begin{align*} \mu_{1\mathrm{c}} &= \pi_{\mathrm{c}}^{-1} \bigl\{(\pi_{\mathrm{c}}+\pi_{\mathrm{a}})\mathrm{E}(Y\mid Z=1,D=1)-\pi_{\mathrm{a}}\mathrm{E}(Y\mid Z=0,D=1)\bigr\} \\ &= \pi_{\mathrm{c}}^{-1} \bigl\{ \operatorname{pr}(D=1\mid Z=1)\mathrm{E}(Y\mid Z=1,D=1) \\ &\qquad -\operatorname{pr}(D=1\mid Z=0)\mathrm{E}(Y\mid Z=0,D=1) \bigr\} \\ &= \pi_{\mathrm{c}}^{-1} \bigl\{\mathrm{E}(DY\mid Z=1)-\mathrm{E}(DY\mid Z=0)\bigr\}. \end{align*}\]
观测组 \((Z=0,D=0)\) 里既有依从者,也有从不接受者,所以
\[\begin{align*} \mathrm{E}(Y\mid Z=0,D=0) &= \mathrm{E}\{Y(0)\mid Z=0,D(0)=0\} \\ &= \mathrm{E}\{Y(0)\mid D(0)=0\} \\ &= \operatorname{pr}\{D(1)=1\mid D(0)=0\}\mathrm{E}\{Y(0)\mid D(1)=1,D(0)=0\} \\ &\quad + \operatorname{pr}\{D(1)=0\mid D(0)=0\}\mathrm{E}\{Y(0)\mid D(1)=0,D(0)=0\} \\ &= \frac{\pi_{\mathrm{c}}}{\pi_{\mathrm{c}}+\pi_{\mathrm{n}}}\mu_{0\mathrm{c}} + \frac{\pi_{\mathrm{n}}}{\pi_{\mathrm{c}}+\pi_{\mathrm{n}}}\mu_{\mathrm{n}}. \end{align*}\]
解上面的线性方程,得到
\[\begin{align*} \mu_{0\mathrm{c}} &= \pi_{\mathrm{c}}^{-1} \bigl\{(\pi_{\mathrm{c}}+\pi_{\mathrm{n}})\mathrm{E}(Y\mid Z=0,D=0)-\pi_{\mathrm{n}}\mathrm{E}(Y\mid Z=1,D=0)\bigr\} \\ &= \pi_{\mathrm{c}}^{-1} \bigl\{ \operatorname{pr}(D=0\mid Z=0)\mathrm{E}(Y\mid Z=0,D=0) \\ &\qquad -\operatorname{pr}(D=0\mid Z=1)\mathrm{E}(Y\mid Z=1,D=0) \bigr\} \\ &= \pi_{\mathrm{c}}^{-1} \bigl[ \mathrm{E}\{(1-D)Y\mid Z=0\}-\mathrm{E}\{(1-D)Y\mid Z=1\} \bigr]. \end{align*}\]
证毕。
由定理 22.1 里 \(\mu_{1\mathrm{c}}\) 与 \(\mu_{0\mathrm{c}}\) 的公式,可以把 \(\tau_{\mathrm{c}}=\mu_{1\mathrm{c}}-\mu_{0\mathrm{c}}\) 化简成
\[ \tau_{\mathrm{c}}=\bigl\{\mathrm{E}(Y\mid Z=1)-\mathrm{E}(Y\mid Z=0)\bigr\}/\pi_{\mathrm{c}}, \]
与定理 21.1 的公式相同。
定理 22.1 盯的是潜在结果均值 \(\mu_{zu}\)。Imbens and Rubin (1997) 给出过潜在结果分布的更一般识别公式;细节留给习题 22.3。
22.2 可检验的推论:工具变量不等式
绕路用定理 22.1 再推一遍 \(\tau_{\mathrm{c}}\),还有没有别的收获?有。结果若是二值的,下面的不等式必须成立:
\[ 0\le\mu_{1\mathrm{c}}\le 1, \qquad 0\le\mu_{0\mathrm{c}}\le 1, \]
从而有四条不等式
\[\begin{align*} \mathrm{E}(DY\mid Z=1)-\mathrm{E}(DY\mid Z=0) &\ge 0, \\ \mathrm{E}(DY\mid Z=1)-\mathrm{E}(DY\mid Z=0) &\le \mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0), \\ \mathrm{E}\{(1-D)Y\mid Z=0\}-\mathrm{E}\{(1-D)Y\mid Z=1\} &\ge 0, \\ \mathrm{E}\{(1-D)Y\mid Z=0\}-\mathrm{E}\{(1-D)Y\mid Z=1\} &\le \mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0). \end{align*}\]
整理一下,得到下面这条统一的不等式。
定理 22.2(工具变量不等式) 结果 \(Y\) 为二值时,假设 21.1–21.3 蕴含
\[ \mathrm{E}(Q\mid Z=1)-\mathrm{E}(Q\mid Z=0)\ge 0, \tag{22.1} \]
其中 \(Q=DY,\ D(1-Y),\ (D-1)Y\) 以及 \(D+Y-DY\)。
在 IV 假定 21.1–21.3 下,\(Q=DY,\ D(1-Y),\ (D-1)Y\) 与 \(D+Y-DY\) 的均值差都必须非负。重要的是:这些推论只涉及观测变量的分布。拒绝工具变量不等式,就是拒绝 IV 假定。
Balke and Pearl (1997) 推导过更一般的 IV 不等式,有单调性的、也有没有单调性的。上面的证明策略来自 Jiang and Ding (2020),他们处理的设定稍复杂一些。定理 22.2 只写出了二值结果的可检验推论。习题 22.4 给出等价形式,习题 22.5 给出一般结果。
22.3 例子
结果为二值时,可以用下面的矩方法去估所有参数。
IVbinary = function(n111, n110, n101, n100,
n011, n010, n001, n000){
n_tr = n111 + n110 + n101 + n100
n_co = n011 + n010 + n001 + n000
n = n_tr + n_co
## proportions of the latent strata
pi_n = (n101 + n100)/n_tr
pi_a = (n011 + n010)/n_co
pi_c = 1 - pi_n - pi_a
## four observed means of the outcomes (Z=z, D=d)
mean_y_11 = n111/(n111 + n110)
mean_y_10 = n101/(n101 + n100)
mean_y_01 = n011/(n011 + n010)
mean_y_00 = n001/(n001 + n000)
## means of the outcomes of two strata
mu_n1 = mean_y_10
mu_a0 = mean_y_01
## ER implies the following two means
mu_n0 = mu_n1
mu_a1 = mu_a0
## stratum (Z=1, D=1) is a mixture of c and a
mu_c1 = ((pi_c + pi_a)*mean_y_11 - pi_a*mu_a1)/pi_c
## stratum (Z=0, D=0) is a mixture of c and n
mu_c0 = ((pi_c + pi_n)*mean_y_00 - pi_n*mu_n0)/pi_c
## identifiable quantities from the observed data
list(pi_c = pi_c, pi_n = pi_n, pi_a = pi_a,
mu_c1 = mu_c1, mu_c0 = mu_c0,
mu_n1 = mu_n1, mu_n0 = mu_n0,
mu_a1 = mu_a1, mu_a0 = mu_a0,
tau_c = mu_c1 - mu_c0)
}下面回到两个二值数据的典范例子。
例 22.1 Investigators et al. (2014) 评估:对临床诊断为破裂主动脉瘤的患者,紧急腔内修复与开放手术修复两种策略哪个更有效。患者被随机分到腔内策略或开放修复。主要结果是 30 天生存状态。令 \(Z\) 为分配的处理,\(Z=1\) 为腔内策略、\(Z=0\) 为开放修复。令 \(D\) 为接受的处理。令 \(Y\) 为生存状态,\(Y=1\) 为死亡、\(Y=0\) 为存活。表 22.2(a) 汇总观测数据。用上面的 IVbinary 得到:
> investigators_analysis = IVbinary(n111 = 107, n110 = 42,
+ n101 = 68, n100 = 42,
+ n011 = 24, n010 = 8,
+ n001 = 131, n000 = 79)| 估计 | |
|---|---|
| \(\hat\pi_{\mathrm{c}}\) | \(0.443\) |
| \(\hat\pi_{\mathrm{n}}\) | \(0.425\) |
| \(\hat\pi_{\mathrm{a}}\) | \(0.132\) |
| \(\hat\mu_{1\mathrm{c}}\) | \(0.709\) |
| \(\hat\mu_{0\mathrm{c}}\) | \(0.629\) |
| \(\hat\mu_{\mathrm{n}}\) | \(0.618\) |
| \(\hat\mu_{\mathrm{a}}\) | \(0.75\) |
| \(\hat\tau_{\mathrm{c}}\) | \(0.079\) |
没有违背 IV 假定的迹象。
例 22.2 Hirano et al. (2000) 里,医生被随机抽中,收到一封鼓励信:请给有流感风险的患者接种。处理是真正打了流感疫苗,结果是是否因流感相关原因就诊。可有些患者并不依从分配。令 \(Z_i\) 为是否鼓励接种的指示,\(Z=1\) 表示医生收到鼓励信。令 \(D\) 为接受的处理。令 \(Y\) 为结果:冬季发生流感相关住院则 \(Y=0\),否则 \(Y=1\)。数据细节见习题 21.7。表 22.2(b) 汇总观测数据。用 IVbinary 得到:
> flu_analysis = IVbinary(n111 = 31, n110 = 422,
+ n101 = 84, n100 = 935,
+ n011 = 30, n010 = 233,
+ n001 = 99, n000 = 1027)| 估计 | |
|---|---|
| \(\hat\pi_{\mathrm{c}}\) | \(0.118\) |
| \(\hat\pi_{\mathrm{n}}\) | \(0.692\) |
| \(\hat\pi_{\mathrm{a}}\) | \(0.189\) |
| \(\hat\mu_{1\mathrm{c}}\) | \(-0.005\) |
| \(\hat\mu_{0\mathrm{c}}\) | \(0.120\) |
| \(\hat\mu_{\mathrm{n}}\) | \(0.082\) |
| \(\hat\mu_{\mathrm{a}}\) | \(0.114\) |
| \(\hat\tau_{\mathrm{c}}\) | \(-0.125\) |
因为 \(\hat\mu_{1\mathrm{c}}<0\),有违背 IV 假定的迹象。
表 22.2 二值数据与 IV 不等式
- Investigators et al. (2014) 的研究
| \(Z=1\), \(D=1\) | \(Z=1\), \(D=0\) | \(Z=0\), \(D=1\) | \(Z=0\), \(D=0\) | |
|---|---|---|---|---|
| \(Y=1\) | \(107\) | \(68\) | \(24\) | \(131\) |
| \(Y=0\) | \(42\) | \(42\) | \(8\) | \(79\) |
- Hirano et al. (2000) 的研究
| \(Z=1\), \(D=1\) | \(Z=1\), \(D=0\) | \(Z=0\), \(D=1\) | \(Z=0\), \(D=0\) | |
|---|---|---|---|---|
| \(Y=1\) | \(31\) | \(85\) | \(30\) | \(99\) |
| \(Y=0\) | \(424\) | \(944\) | \(237\) | \(1041\) |
22.4 习题
22.1 更细的数据分析
例 22.1 与 22.2 没有理会估计里的不确定性。请给出真参数的置信区间。
22.2 依从者的风险比
结果为二值时,可以把依从者的风险比定义为
\[ \mathrm{RR}_{\mathrm{c}} = \frac{\operatorname{pr}\{Y(1)=1\mid U=\mathrm{c}\}}{\operatorname{pr}\{Y(0)=1\mid U=\mathrm{c}\}}. \]
证明:在假设 21.1–21.3 下,它可由
\[ \mathrm{RR}_{\mathrm{c}} = \frac{\mathrm{E}(DY\mid Z=1)-\mathrm{E}(DY\mid Z=0)}{\mathrm{E}\{(D-1)Y\mid Z=1\}-\mathrm{E}\{(D-1)Y\mid Z=0\}} \]
识别。
注: 有了定理 22.1,\(\mathrm{E}\{Y(1)\mid U=\mathrm{c}\}\) 与 \(\mathrm{E}\{Y(0)\mid U=\mathrm{c}\}\) 之间的任何比较都可以识别。
22.3 拆开混合物:分布层面的结果
本题把定理 22.1 伸开。定义
\[ f_{zu}(y)=\operatorname{pr}\{Y(z)=y\mid U=u\}, \qquad (z=0,1;\ u=\mathrm{a},\mathrm{n},\mathrm{c}) \]
为潜在层 \(U=u\) 上 \(Y(z)\) 的密度,并定义
\[ g_{zd}(y)=\operatorname{pr}(Y=y\mid Z=z,D=d) \]
为观测组 \((Z=z,D=d)\) 里结果的密度。排除限制蕴含 \(f_{1\mathrm{n}}(y)=f_{0\mathrm{n}}(y)\) 与 \(f_{1\mathrm{a}}(y)=f_{0\mathrm{a}}(y)\)。分别记作 \(f_{\mathrm{n}}(y)\) 与 \(f_{\mathrm{a}}(y)\)。
证明下面的定理 22.3。
定理 22.3 在假设 21.1–21.3 下,各类型上潜在结果的密度可由
\[ \begin{aligned} f_{\mathrm{n}}(y) &= g_{10}(y), \\ f_{\mathrm{a}}(y) &= g_{01}(y), \\ f_{1\mathrm{c}}(y) &= \pi_{\mathrm{c}}^{-1} \bigl\{\operatorname{pr}(D=1\mid Z=1)g_{11}(y)-\operatorname{pr}(D=1\mid Z=0)g_{01}(y)\bigr\}, \\ f_{0\mathrm{c}}(y) &= \pi_{\mathrm{c}}^{-1} \bigl\{\operatorname{pr}(D=0\mid Z=0)g_{00}(y)-\operatorname{pr}(D=0\mid Z=1)g_{10}(y)\bigr\} \end{aligned} \]
识别。
22.4 定理 22.2 的另一种形式
(22.1) 里的不等式可以改写成:对 \(y=0,1\) 都有
\[ \operatorname{pr}(D=1,Y=y\mid Z=1) \ge \operatorname{pr}(D=1,Y=y\mid Z=0), \]
\[ \operatorname{pr}(D=0,Y=y\mid Z=0) \ge \operatorname{pr}(D=0,Y=y\mid Z=1). \]
22.5 一般结果的 IV 不等式
对一般结果 \(Y\),证明假设 21.1–21.3 蕴含:对所有 \(y\),
\[\begin{align*} \operatorname{pr}(D=1,Y\ge y\mid Z=1) &\ge \operatorname{pr}(D=1,Y\ge y\mid Z=0), \\ \operatorname{pr}(D=1,Y< y\mid Z=1) &\ge \operatorname{pr}(D=1,Y< y\mid Z=0), \\ \operatorname{pr}(D=0,Y\ge y\mid Z=0) &\ge \operatorname{pr}(D=0,Y\ge y\mid Z=1), \\ \operatorname{pr}(D=0,Y< y\mid Z=0) &\ge \operatorname{pr}(D=0,Y< y\mid Z=1). \end{align*}\]
注: Imbens and Rubin (1997) 与 Kitagawa (2015) 讨论过相近的结果。第一条不等式可以用 Kolmogorov–Smirnov 统计量的类似物来检验:
\[ \mathrm{KS}_1 = \max_y \left\lvert \frac{\sum_{i=1}^{n}Z_i D_i I(Y_i\le y)}{\sum_{i=1}^{n}Z_i D_i} - \frac{\sum_{i=1}^{n}(1-Z_i)D_i I(Y_i\le y)}{\sum_{i=1}^{n}(1-Z_i)D_i} \right\rvert. \]
22.6 IV 不等式的例子
请给一个所有 IV 不等式都成立的例子,再给一个并非全部成立的例子。需要指定二值变量 \((Z,D,Y)\) 的联合分布。
22.7 关键假定被违背时
定理 21.1 依赖随机化、单调性与排除限制。后两条即便在随机化实验里也不可检验。它们一旦被违背,IV 估计量就不再识别 CACE。本题给出下面两种情形,是 Angrist et al. (1996) 命题 2 与 3 的复述。回想 \(\pi_u=\operatorname{pr}(U=u)\),以及 \(\tau_u=\mathrm{E}\{Y(1)-Y(0)\mid U=u\}\)(\(u=\mathrm{a},\mathrm{n},\mathrm{c},\mathrm{d}\))。
定理 22.4 (a) 在假设 21.1 与 21.2 下、没有排除限制时,
\[ \frac{\mathrm{E}(Y\mid Z=1)-\mathrm{E}(Y\mid Z=0)}{\mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0)} -\tau_{\mathrm{c}} = \frac{\pi_{\mathrm{a}}\tau_{\mathrm{a}}+\pi_{\mathrm{n}}\tau_{\mathrm{n}}}{\pi_{\mathrm{c}}}. \]
- 在假设 21.1 与 21.3 下、没有单调性时,
\[ \frac{\mathrm{E}(Y\mid Z=1)-\mathrm{E}(Y\mid Z=0)}{\mathrm{E}(D\mid Z=1)-\mathrm{E}(D\mid Z=0)} -\tau_{\mathrm{c}} = \frac{\pi_{\mathrm{d}}(\tau_{\mathrm{c}}+\tau_{\mathrm{d}})}{\pi_{\mathrm{c}}-\pi_{\mathrm{d}}}. \]
证明定理 22.4。
22.8 其他分析的麻烦
推导第 22.1 节的 IV 不等式时,我们拆开了混合分布:认出潜在层的比例,以及它们潜在结果的条件均值。这些结果也帮助我们看清另一些「看起来合理」的分析为什么有问题。下面复习三个估计量,并假定假设 21.1–21.3 成立。
- 按实际接受的处理分析(as-treated analysis)比较接受处理与接受对照的人的结果均值,得到
\[ \tau_{\mathrm{AT}}=\mathrm{E}(Y\mid D=1)-\mathrm{E}(Y\mid D=0). \]
证明
\[ \tau_{\mathrm{AT}} = \frac{\pi_{\mathrm{a}}\mu_{\mathrm{a}}+\operatorname{pr}(Z=1)\pi_{\mathrm{c}}\mu_{1\mathrm{c}}}{\operatorname{pr}(D=1)} - \frac{\pi_{\mathrm{n}}\mu_{\mathrm{n}}+\operatorname{pr}(Z=0)\pi_{\mathrm{c}}\mu_{0\mathrm{c}}}{\operatorname{pr}(D=0)}. \]
- 符合方案分析(per-protocol analysis)比较处理组与对照组里依从了分配的人,得到
\[ \tau_{\mathrm{PP}}=\mathrm{E}(Y\mid Z=1,D=1)-\mathrm{E}(Y\mid Z=0,D=0). \]
证明
\[ \tau_{\mathrm{PP}} = \frac{\pi_{\mathrm{a}}\mu_{\mathrm{a}}+\pi_{\mathrm{c}}\mu_{1\mathrm{c}}}{\pi_{\mathrm{a}}+\pi_{\mathrm{c}}} - \frac{\pi_{\mathrm{n}}\mu_{\mathrm{n}}+\pi_{\mathrm{c}}\mu_{0\mathrm{c}}}{\pi_{\mathrm{n}}+\pi_{\mathrm{c}}}. \]
- 也可以在给定处理分配后,比较接受处理与接受对照的人的结果,得到
\[ \begin{aligned} \tau_{Z=1} &= \mathrm{E}(Y\mid Z=1,D=1)-\mathrm{E}(Y\mid Z=1,D=0), \\ \tau_{Z=0} &= \mathrm{E}(Y\mid Z=0,D=1)-\mathrm{E}(Y\mid Z=0,D=0). \end{aligned} \]
证明它们化成
\[ \tau_{Z=1} = \frac{\pi_{\mathrm{a}}\mu_{\mathrm{a}}+\pi_{\mathrm{c}}\mu_{1\mathrm{c}}}{\pi_{\mathrm{a}}+\pi_{\mathrm{c}}} -\mu_{\mathrm{n}}, \qquad \tau_{Z=0} = \mu_{\mathrm{a}} - \frac{\pi_{\mathrm{n}}\mu_{\mathrm{n}}+\pi_{\mathrm{c}}\mu_{0\mathrm{c}}}{\pi_{\mathrm{n}}+\pi_{\mathrm{c}}}. \]
22.9 整个人群上平均因果效应的界
把第 22.1 节的讨论伸到第 21.6 节的记号。有了潜在结果 \(Y(d)\),把接受的处理对结果的平均因果效应定义为
\[ \delta=\mathrm{E}\{Y(d=1)-Y(d=0)\}, \]
并把 \(\mu_{zu}\) 的定义改成
\[ m_{du}=\mathrm{E}\{Y(d)\mid U=u\}, \qquad (d=0,1;\ u=\mathrm{a},\mathrm{n},\mathrm{c}), \]
因为记号换了。它们满足
\[ \delta=\sum_{u=\mathrm{a},\mathrm{n},\mathrm{c}}\pi_u(m_{1u}-m_{0u}). \]
第 22.1 节认出了 \(\pi_{\mathrm{a}}\)、\(\pi_{\mathrm{n}}\)、\(\pi_{\mathrm{c}}\),以及 \(m_{1\mathrm{a}}=\mu_{1\mathrm{a}}\)、\(m_{0\mathrm{n}}=\mu_{0\mathrm{n}}\)、\(m_{1\mathrm{c}}=\mu_{1\mathrm{c}}\) 与 \(m_{0\mathrm{c}}=\mu_{0\mathrm{c}}\)。可数据对 \(m_{0\mathrm{a}}\) 与 \(m_{1\mathrm{n}}\) 没有任何信息。因此 \(\delta\) 不可识别。结果有界时,可以给 \(\delta\) 划界。
定理 22.5 在假设 21.2–21.4 下,若结果夹在 \([\underline{y},\overline{y}]\) 里,则 \(\underline{\delta}\le\delta\le\overline{\delta}\),其中
\[ \underline{\delta} = \delta'-\overline{y}\,\operatorname{pr}(D=1\mid Z=0)+\underline{y}\,\operatorname{pr}(D=0\mid Z=1) \]
以及
\[ \overline{\delta} = \delta'-\underline{y}\,\operatorname{pr}(D=1\mid Z=0)+\overline{y}\,\operatorname{pr}(D=0\mid Z=1), \]
而 \(\delta'=\mathrm{E}(DY\mid Z=1)-\mathrm{E}(Y-DY\mid Z=0)\)。
证明定理 22.5。
注: 结果为二值时,界化成
\[ \underline{\delta} = \mathrm{E}(DY\mid Z=1)-\mathrm{E}(D+Y-DY\mid Z=0) \]
以及
\[ \overline{\delta} = \mathrm{E}(DY+1-D\mid Z=1)-\mathrm{E}(Y-DY\mid Z=0). \]
22.10 单侧不依从与统计推断
考虑一项随机化鼓励设计:分到对照的人完全接触不到处理。对单元 \(i\),令 \(Z_i\) 为二值的分配处理,\(D_i\) 为二值的接受处理,\(Y_i\) 为关心的结果。单侧不依从发生在
\[ Z_i=0\ \Longrightarrow\ D_i=0 \qquad (i=1,\ldots,n). \]
假定假设 21.1 成立。
- 这时单调性假设 21.2 成立吗?由 \(\{D_i(1),D_i(0)\}\) 定义的潜在层有几层?怎样用观测数据分布认出它们的比例?
- 写出排除限制。在排除限制下,证明 \(\mathrm{E}\{Y(z)\mid U=u\}\) 可由观测数据分布识别。给出所有可能的 \(z\) 与 \(u\) 的公式。这时怎样识别 CACE?
- 若对所有单元都观测到预处理协变量 \(X_i\),怎样用协变量信息改善 CACE 的估计效率?
- 在假设 21.1 下,排除限制假设 21.3 有可检验的推论,也就是单侧不依从的 IV 不等式。请写出这些不等式。
- Sommer and Zeger (1991) 给出下面这套数据:
| \(Z=1\), \(D=1\) | \(Z=1\), \(D=0\) | \(Z=0\), \(D=1\) | \(Z=0\), \(D=0\) | |
|---|---|---|---|---|
| \(Y=1\) | \(9663\) | \(2385\) | \(0\) | \(11514\) |
| \(Y=0\) | \(12\) | \(34\) | \(0\) | \(74\) |
分配的处理 \(Z\) 是儿童是否被分到维生素 A 补充,接受的处理 \(D\) 是儿童是否真正补充了维生素 A,二值结果 \(Y\) 是生存指示。原始 RCT 在印度尼西亚进行。请重新分析这套数据。
注: Bloom (1984) 最先讨论单侧不依从,并提议估计量 \(\hat\tau_{\mathrm{c}}=\hat\tau_Y/\hat\tau_D\),有时叫做 Bloom 估计量。Bloom (1984) 的记号与本章不同。
22.11 带部分依从的单侧不依从
Sanders and Karim (2021, 表 3) 报告过一项 RCT 的数据,目标是估计有精神障碍的人里,戒烟干预的效力。
| 分配的组 | 接受的处理 | 组人数 | 阳性结果数 |
|---|---|---|---|
| 对照 | 无 | \(151\) | \(25\) |
| 处理 | 无 | \(35\) | \(7\) |
| 处理 | 部分 | \(42\) | \(17\) |
| 处理 | 全部 | \(70\) | \(40\) |
接受的处理分三档:「全部」对应参加全部 8 次治疗,「部分」对应参加 5 到 7 次,「无」对应少于 5 次。结果是二值指示:相对于基线,三个月时吸烟量减少 50% 或更多。
本题里分配的处理 \(Z\) 是二值的,接受的处理 \(D\) 取三个值 \(0,0.5,1\),分别对应「无」「部分」「全部」。三水平的 \(D\) 带来麻烦,可在对照分配下它只能是 \(0\)。本题里潜在层 \(U=\{D(1),D(0)\}\) 有几层?它们的比例能识别吗?
排除限制怎样伸到本题?关心的因果效应可以是什么?它们能识别吗?
请根据上面这些问题分析数据。
22.12 推荐阅读
Balke and Pearl (1997) 推导过更一般的 IV 不等式。