第 11 章 倾向得分在观察性研究因果效应中的核心角色
Rosenbaum and Rubin (1983b) 提出了倾向得分(propensity score),并讲清它在观察性因果推断里扮演的角色。这是统计学里被引最多的论文之一;Titterington (2013) 把它列为《Biometrika》过去一百年里被引第二多的文章。近几年,引用次数还在很快往上走。
IID 抽样下,每个单元带着四个随机变量:\(\{X,Z,Y(1),Y(0)\}\)。按概率的基本规则,联合分布可以拆开:
\[ \operatorname{pr}\{X,Z,Y(1),Y(0)\} = \operatorname{pr}(X)\times\operatorname{pr}\{Y(1),Y(0)\mid X\}\times\operatorname{pr}\{Z\mid X,Y(1),Y(0)\}, \]
其中
- \(\operatorname{pr}(X)\) 是协变量分布;
- \(\operatorname{pr}\{Y(1),Y(0)\mid X\}\) 是给定协变量后的结果分布;
- \(\operatorname{pr}\{Z\mid X,Y(1),Y(0)\}\) 是给定协变量后的处理分布,也就是处理分配机制。
协变量是处理与结果之前就已发生的背景,通常不必为它们专门建模。若不想只靠结果模型过日子,目光就得落到处理分配机制上——倾向得分,正是从这里长出来的。
定义 11.1(倾向得分) 定义
\[ e\bigl(X,Y(1),Y(0)\bigr) = \operatorname{pr}\bigl\{Z=1\mid X,Y(1),Y(0)\bigr\} \]
为倾向得分。在强可忽略性下,
\[ e\bigl(X,Y(1),Y(0)\bigr) = \operatorname{pr}\bigl\{Z=1\mid X,Y(1),Y(0)\bigr) = \operatorname{pr}(Z=1\mid X), \]
于是倾向得分收成
\[ e(X)=\operatorname{pr}(Z=1\mid X), \]
也就是给定观测协变量时,接受处理的条件概率。
Rosenbaum and Rubin (1983b) 把 \(e(X)=\operatorname{pr}(Z=1\mid X)\) 当作定义,因为他们关心的是强可忽略性下的观察性研究。可有时,即便强可忽略性不成立,把 \(e\bigl(X,Y(1),Y(0)\bigr)=\operatorname{pr}\{Z=1\mid X,Y(1),Y(0)\}\) 当作更一般的定义,也会有用。细节见习题 11.1。
顺着他们,这一章会慢慢看见:在可忽略性下,\(e(X)\) 几乎是观察性因果推断的一把钥匙。
11.1 倾向得分作为降维工具
11.1.1 理论
定理 11.1 若 \(Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid X\),则 \(Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid e(X)\)。
定理 11.1 说的是一件几乎像魔术的事:若给定协变量 \(X\) 时强可忽略性成立,那么只给定那条标量倾向得分 \(e(X)\),它也成立。可忽略性本来要求把许多背景特征都条件进去;定理却说,把它们收成 \(e(X)\) 这一条,\(X\) 带来的混杂就都被拿掉了。原来的 \(X\) 可以很一般、维度很高;\(e(X)\) 却是夹在 0 与 1 之间的一维分数。于是倾向得分把协变量降了维,可忽略性却还在。用统计的话说,它是一件降维工具。下面先证明定理 11.1,再看这个降维性质的一个用法。
定理 11.1 的证明 按条件独立的定义,只需证明
\[ \operatorname{pr}\bigl\{Z=1\mid Y(1),Y(0),e(X)\bigr\} = \operatorname{pr}\bigl\{Z=1\mid e(X)\bigr\}. \tag{11.1} \]
(11.1) 的左边等于
\[ \begin{aligned} &\operatorname{pr}\bigl\{Z=1\mid Y(1),Y(0),e(X)\bigr\}\\ &= \mathrm{E}\bigl\{Z\mid Y(1),Y(0),e(X)\bigr\}\\ &= \mathrm{E}\Bigl[ \mathrm{E}\bigl\{Z\mid Y(1),Y(0),e(X),X\bigr\} \Bigm| Y(1),Y(0),e(X) \Bigr] \quad\text{(塔性质,见附录 A.1.5)}\\ &= \mathrm{E}\Bigl[ \mathrm{E}\bigl\{Z\mid Y(1),Y(0),X\bigr\} \Bigm| Y(1),Y(0),e(X) \Bigr]\\ &= \mathrm{E}\Bigl\{ \mathrm{E}(Z\mid X) \Bigm| Y(1),Y(0),e(X) \Bigr\} \quad\text{(强可忽略性)}\\ &= \mathrm{E}\bigl\{e(X)\mid Y(1),Y(0),e(X)\bigr\}\\ &= e(X). \end{aligned} \]
(11.1) 的右边等于
\[ \begin{aligned} &\operatorname{pr}\bigl\{Z=1\mid e(X)\bigr\}\\ &= \mathrm{E}\bigl\{Z\mid e(X)\bigr\}\\ &= \mathrm{E}\Bigl[ \mathrm{E}\bigl\{Z\mid e(X),X\bigr\} \Bigm| e(X) \Bigr] \quad\text{(塔性质)}\\ &= \mathrm{E}\bigl\{\mathrm{E}(Z\mid X)\mid e(X)\bigr\}\\ &= \mathrm{E}\bigl\{e(X)\mid e(X)\bigr\}\\ &= e(X). \end{aligned} \]
于是 (11.1) 两边相等。\(\square\)
11.1.2 倾向得分分层
定理 11.1 立刻提示一种估因果效应的简单办法:倾向得分分层(propensity score stratification)。先从最干净的情形说起:假定倾向得分已知,并且只取 \(K\) 个可能值 \(\{e_1,\ldots,e_K\}\),\(K\) 远小于样本量 \(n\)。这时定理 11.1 变成
\[ Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid e(X)=e_k \qquad(k=1,\ldots,K). \]
于是我们得到一次 SRE:按倾向得分分层后,各层内是独立的 CRE。观察性数据,就可以按「以 \(e(X)\) 分层的 SRE」来分析。
一般情形里,倾向得分既未知,也不离散。我们常为 \(\operatorname{pr}(Z=1\mid X)\) 拟合一个统计模型(例如二值 \(Z\) 对 \(X\) 的逻辑模型),得到估计倾向得分 \(\hat e(X)\)。它可能取到与样本量一样多的不同值,但可以先离散化,去逼近上面那个简单情形。例如,按 \(\hat e(X)\) 的 \(K\) 个分位数做成 \(\hat e'(X)\):若 \(\hat e(X_i)\) 落在 \(\hat e(X_i)\) 的 \((k-1)/K\) 分位数与 \(k/K\) 分位数之间,就把 \(\hat e'(X_i)\) 记为第 \(k/K\) 分位数 \(e_k\)。于是
\[ Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid \hat e'(X)=e_k \qquad(k=1,\ldots,K) \]
近似成立。观察性数据,就可以按「以 \(\hat e'(X)\) 分层的 SRE」来分析。给定 \(\hat e'(X)\) 时,可忽略性只是近似成立。还可以再对协变量做回归调整,去掉残余偏倚、提高效率。更具体地说:可在每一层内算 Lin (2013) 估计量,再按加权平均拼成最终估计(见第 6.2.4 节)。
倾向得分未知时,必须先拟合模型才能得到 \(\hat e(X)\),最终估计也就依赖模型设定。可倾向得分分层真正需要的,往往只是估计倾向得分的排序对不对,而不必数值分毫不差。比起别的方法,它因此相对稳健。这份稳健在许多数值例子里都出现过,严格的定量理论却仍缺着。
一个要紧的实践问题是:\(K\) 怎么选?\(K\) 太小,即便近似地看,给定 \(\hat e'(X)\) 时的可忽略性也站不住;\(K\) 太大,每一层里的人又不够,许多层会只剩处理或只剩对照。于是必须折中。顺着 Cochran (1968) 的直觉,Rosenbaum and Rubin (1983b, 1984) 建议 \(K=5\):在许多情形里,它已经能去掉很大一块偏倚。第 5 章里那个「魔法数字 5」,指的就是它。可在极大样本下,固定的 \(K\) 仍会让倾向得分分层有偏(Lunceford and Davidian, 2004)。只要每一层里处理与对照都还够,让 \(K\) 随样本长大一些,是合理的。Wang et al. (2020) 建议一种贪心选法:取使分层估计量仍定义良好的最大层数。这套手续的严格理论,也还没有完全立住。
另一个要紧的实践问题是:基于倾向得分分层的估计,标准误怎么算?有人条件于离散化后的 \(\hat e'(X)\),按 SRE 去报标准误。这等于忽略了估计倾向得分时的不确定性。它常常高估真实方差——文献里有一个让人吃惊的结果:用估计的倾向得分,反而会减小估平均因果效应的渐近方差(Su et al., 2023)。也有人把整套手续做自助法,把全部不确定性都算进去。可因为这个估计量带离散化,自助法的理论也还不清楚。
11.1.3 应用
为说明倾向得分分层,我回到例 10.3。
nhanes_bmi = read.csv("nhanes_bmi.csv")[, -1]
z = nhanes_bmi$School_meal
y = nhanes_bmi$BMI
x = as.matrix(nhanes_bmi[, -c(1, 2)])
x = scale(x)例 10.3 介绍过这套数据里的协变量。处理 School_meal 是是否参加学校餐项目的指示,结果 BMI 是身体质量指数。
原书图 11.1 给出估计倾向得分的直方图,分箱数分别为 \(K=5,10,30\):白色是对照组,灰色是处理组。
按倾向得分分层,可对 \(K\in\{5,10,20,50,80\}\) 算点估计与标准误。Neyman_SRE 是第 5 章里分析 SRE 的那个函数。
pscore = glm(z ~ x, family = binomial)$fitted.values
n.strata = c(5, 10, 20, 50, 80)
strat.res = sapply(n.strata, FUN = function(nn){
q.pscore = quantile(pscore, (1:(nn - 1))/nn)
ps.strata = cut(pscore, breaks = c(0, q.pscore, 1),
labels = 1:nn)
Neyman_SRE(z, y, ps.strata)
})
rownames(strat.res) = c("est", "se")
colnames(strat.res) = n.strata
round(strat.res, 3)| 5 | 10 | 20 | 50 | 80 | |
|---|---|---|---|---|---|
| est | \(-0.116\) | \(-0.178\) | \(-0.200\) | \(-0.265\) | \(-0.204\) |
| se | \(0.283\) | \(0.282\) | \(0.279\) | \(0.272\) | NA |
\(K\) 从 5 增到 50,标准误在往下走。可不能走到 \(K=80\) 那么极端:有些层里只有一个处理单元或一个对照单元,标准误就定义不好。上面这些估计显示,学校餐项目对 BMI 有负向效应,但不显著。
也可以把它们与三种简单回归估计对照:不调整任何协变量的均值差,以及 Fisher 估计与 Lin 估计。
DiM = lm(y ~ z)
Fisher = lm(y ~ z + x)
Lin = lm(y ~ z + x + z*x)
res.regression = c(coef(DiM)[2], hccm(DiM)[2, 2]^0.5,
coef(Fisher)[2], hccm(Fisher)[2, 2]^0.5,
coef(Lin)[2], hccm(Lin)[2, 2]^0.5)
res.regression = matrix(res.regression, nrow = 2, ncol = 3)
rownames(res.regression) = c("est", "se")
colnames(res.regression) = c("naive", "fisher", "lin")
round(res.regression, 3)| naive | fisher | lin | |
|---|---|---|---|
| est | \(0.534\) | \(0.061\) | \(-0.017\) |
| se | \(0.225\) | \(0.227\) | \(0.226\) |
朴素均值差与其余方法差得很远,因为协变量失衡很大。Fisher 估计的点估计仍为正,虽不显著。Lin 估计与倾向得分分层给出定性相同的结果。倾向得分分层的估计,在不同的 \(K\) 之间相当稳定。
11.2 倾向得分加权
11.2.1 理论
定理 11.2 若 \(Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid X\) 且 \(0<e(X)<1\),则
\[ \mathrm{E}\{Y(1)\} = \mathrm{E}\left\{\frac{ZY}{e(X)}\right\}, \qquad \mathrm{E}\{Y(0)\} = \mathrm{E}\left\{\frac{(1-Z)Y}{1-e(X)}\right\}, \]
从而
\[ \tau = \mathrm{E}\{Y(1)-Y(0)\} = \mathrm{E}\left\{ \frac{ZY}{e(X)} - \frac{(1-Z)Y}{1-e(X)} \right\}. \]
证明之前,先留意多出来的那条假定 \(0<e(X)<1\)。它叫做重叠(overlap)或正值性(positivity)。若某些 \(X\) 上 \(e(X)=0\) 或 \(1\),定理 11.2 的公式就会变成无穷。这并不只是加权识别公式才有的要求。定理 10.1 虽没把话说死,可 (10.6) 里的条件期望 \(\mathrm{E}(Y\mid Z=1,X)\) 与 \(\mathrm{E}(Y\mid Z=0,X)\),也只有在 \(0<e(X)<1\) 时才定义良好。重叠条件可以看成一条技术条件,好让定理 10.1 与 11.2 的公式站得住。它也会给观察性因果推断带来一些哲学上的麻烦。若单元 \(i\) 有 \(e(X_i)=1\),我们总能看见它在处理下的潜在结果 \(Y_i(1)\),却永远看不见对照下的 \(Y_i(0)\)。这时 \(Y_i(0)\) 甚至可能没有良好定义,单元 \(i\) 的因果效应也就含糊起来。King and Zeng (2006) 把 \(e(X_i)=1\) 时的 \(Y_i(0)\) 叫做极端反事实(extreme counterfactual),并讨论过它们在因果推断里的危险。\(e(X_i)=0\) 时,情形对偶。
总而言之:\(Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid X\) 要求协变量足够丰富,好保证处理与潜在结果条件独立;\(0<e(X)<1\) 则要求:给定协变量之后,处理里仍留有残余的随机性。其实 Rosenbaum and Rubin (1983b) 的强可忽略性定义,把这两条都包进去了。当代文献里,它们常常分开陈述。
定理 11.2 的证明 我只证 \(\mathrm{E}\{Y(1)\}\) 那一侧;\(\mathrm{E}\{Y(0)\}\) 的证明类似。我们有
\[ \begin{aligned} \mathrm{E}\left\{\frac{ZY}{e(X)}\right\} &= \mathrm{E}\left\{\frac{ZY(1)}{e(X)}\right\}\\ &= \mathrm{E}\left[ \mathrm{E}\left\{\frac{ZY(1)}{e(X)}\Bigm| X\right\} \right] \quad\text{(塔性质)}\\ &= \mathrm{E}\left[ \frac{1}{e(X)}\,\mathrm{E}\bigl\{ZY(1)\mid X\bigr\} \right]\\ &= \mathrm{E}\left[ \frac{1}{e(X)}\,\mathrm{E}(Z\mid X)\,\mathrm{E}\bigl\{Y(1)\mid X\bigr\} \right] \quad\text{(强可忽略性)}\\ &= \mathrm{E}\left[ \frac{1}{e(X)}\,e(X)\,\mathrm{E}\bigl\{Y(1)\mid X\bigr\} \right]\\ &= \mathrm{E}\bigl[\mathrm{E}\{Y(1)\mid X\}\bigr]\\ &= \mathrm{E}\{Y(1)\}. \end{aligned} \]
\(\square\)
11.2.2 逆倾向得分加权估计量
定理 11.2 提示平均因果效应的如下矩估计:
\[ \hat\tau^{\mathrm{ht}} = \frac{1}{n}\sum_{i=1}^{n}\frac{Z_i Y_i}{\hat e(X_i)} - \frac{1}{n}\sum_{i=1}^{n}\frac{(1-Z_i)Y_i}{1-\hat e(X_i)}, \]
其中 \(\hat e(X_i)\) 是估计倾向得分。这就是逆倾向得分加权(inverse propensity score weighting, IPW)估计量,也叫 Horvitz–Thompson(HT) 估计量。Horvitz and Thompson (1952) 在抽样调查里提出它;Rosenbaum (1987a) 把它用到观察性因果推断。
可 \(\hat\tau^{\mathrm{ht}}\) 有不少毛病。尤其是:它对结果的平移变换并不不变。命题 11.1 把这件事说精确;证明留给习题 11.3。
命题 11.1(HT 估计量缺乏平移不变性) 若把每个 \(Y_i\) 改成 \(Y_i+c\)(\(c\) 为常数),则 HT 估计量从 \(\hat\tau^{\mathrm{ht}}\) 变成 \(\hat\tau^{\mathrm{ht}}+c(\hat 1_{\mathrm{T}}-\hat 1_{\mathrm{C}})\),其中
\[ \hat 1_{\mathrm{T}} = \frac{1}{n}\sum_{i=1}^{n}\frac{Z_i}{\hat e(X_i)}, \qquad \hat 1_{\mathrm{C}} = \frac{1}{n}\sum_{i=1}^{n}\frac{1-Z_i}{1-\hat e(X_i)} \]
可以看成常数 \(1\) 的两种不同估计。
命题 11.1 里,我用了看起来有点俏皮的记号 \(\hat 1_{\mathrm{T}}\) 与 \(\hat 1_{\mathrm{C}}\):若代入真倾向得分,这两项的期望都是 \(1\);细节见习题 11.3。有限样本里,\(\hat 1_{\mathrm{T}}-\hat 1_{\mathrm{C}}\) 一般并不为零。给每个结果加一个常数,不该改变平均因果效应;HT 估计量却跟着 \(c\) 走,因此不太合理。一个简单修补是:分别用 \(\hat 1_{\mathrm{T}}\) 与 \(\hat 1_{\mathrm{C}}\) 把权重归一化,得到
\[ \hat\tau^{\mathrm{hajek}} = \frac{\displaystyle\sum_{i=1}^{n}Z_i Y_i/\hat e(X_i)} {\displaystyle\sum_{i=1}^{n}Z_i/\hat e(X_i)} - \frac{\displaystyle\sum_{i=1}^{n}(1-Z_i)Y_i/\bigl(1-\hat e(X_i)\bigr)} {\displaystyle\sum_{i=1}^{n}(1-Z_i)/\bigl(1-\hat e(X_i)\bigr)}. \]
这是 Hajek 估计量,来自抽样调查里不等概率抽样的 Hájek (1971)。可以验证:它对平移变换不变。也就是说,把 \(Y_i\) 换成 \(Y_i+c\),\(\hat\tau^{\mathrm{hajek}}\) 仍是原来那个数;见习题 11.3。许多数值研究也发现:有限样本里,\(\hat\tau^{\mathrm{hajek}}\) 比 \(\hat\tau^{\mathrm{ht}}\) 稳定得多。
11.2.3 IPW 的一个问题,以及因果推断的一个根本问题
许多渐近分析需要一条更强的重叠条件
\[ 0<\alpha_L\le e(X)\le\alpha_U<1, \]
也就是真倾向得分与 0 和 1 隔开一段距离。可 D’Amour et al. (2021) 指出:这其实相当强,协变量一多就更强。第 20 章会把这个问题慢慢展开。
即便真倾向得分满足强重叠,估计倾向得分仍可能贴近 0 或 1。一旦发生,加权估计量就会冲向无穷,有限样本里极不稳定。我们可以把估计倾向得分截断(truncate)为
\[ \max\bigl[\alpha_L,\,\min\{\hat e(X_i),\alpha_U\}\bigr], \]
也可以把 \(\hat e(X_i)\) 落在 \([\alpha_L,\alpha_U]\) 之外的单元修剪掉(trim)。Crump et al. (2009) 建议 \(\alpha_L=0.1\)、\(\alpha_U=0.9\);Kurth et al. (2005) 建议 \(\alpha_L=0.05\)、\(\alpha_U=0.95\)。Yang and Ding (2018b) 给修剪建立了一些渐近理论。总体而言,修剪常常能稳住 IPW 估计量,却也给手续添了一份任意性。
11.2.4 应用
下面两个函数计算 IPW 估计量及其自助法标准误。
ipw.est = function(z, y, x, truncps = c(0, 1))
{
## fitted propensity score
pscore = glm(z ~ x, family = binomial)$fitted.values
pscore = pmax(truncps[1], pmin(truncps[2], pscore))
ace.ipw0 = mean(z*y/pscore - (1 - z)*y/(1 - pscore))
ace.ipw = mean(z*y/pscore)/mean(z/pscore) -
mean((1 - z)*y/(1 - pscore))/mean((1 - z)/(1 - pscore))
return(c(ace.ipw0, ace.ipw))
}
ipw.boot = function(z, y, x, n.boot = 500, truncps = c(0, 1))
{
point.est = ipw.est(z, y, x, truncps)
## nonparametric bootstrap
n.sample = length(z)
x = as.matrix(x)
boot.est = replicate(n.boot, {
id.boot = sample(1:n.sample, n.sample, replace = TRUE)
ipw.est(z[id.boot], y[id.boot], x[id.boot, ], truncps)
})
boot.se = apply(boot.est, 1, sd)
res = cbind(point.est, boot.se)
colnames(res) = c("est", "se")
rownames(res) = c("HT", "Hajek")
return(res)
}回到例 10.3,可按不同的截断区间去算 IPW 估计。下面是两种加权估计及其自助法标准误,截断分别取 \((0,1)\)、\((0.01,0.99)\)、\((0.05,0.95)\) 与 \((0.1,0.9)\):
trunc.list = list(trunc0 = c(0, 1),
trunc.01 = c(0.01, 0.99),
trunc.05 = c(0.05, 0.95),
trunc.1 = c(0.1, 0.9))
trunc.est = lapply(trunc.list, function(t){
est = ipw.boot(z, y, x, truncps = t)
round(est, 3)
})
trunc.est| 截断 | est | se | |
|---|---|---|---|
| \((0,1)\) | HT | \(-1.516\) | \(0.496\) |
| Hajek | \(-0.156\) | \(0.258\) | |
| \((0.01,0.99)\) | HT | \(-1.516\) | \(0.501\) |
| Hajek | \(-0.156\) | \(0.254\) | |
| \((0.05,0.95)\) | HT | \(-1.499\) | \(0.501\) |
| Hajek | \(-0.152\) | \(0.255\) | |
| \((0.1,0.9)\) | HT | \(-0.713\) | \(0.425\) |
| Hajek | \(-0.054\) | \(0.246\) |
HT 估计量与到目前为止讨论过的所有其他估计都差得很远。点估计看起来偏大,而且除非把估计倾向得分截断在 \((0.1,0.9)\),它们都显著为负。这是 HT 估计量不稳定的一个例子。
11.3 倾向得分的平衡性质
11.3.1 理论
定理 11.3 倾向得分满足
\[ Z\perp\!\!\!\perp X\mid e(X). \]
进而,对任意函数 \(h(\cdot)\),只要 (11.2) 两边的矩存在,就有
\[ \mathrm{E}\left\{\frac{Zh(X)}{e(X)}\right\} = \mathrm{E}\left\{\frac{(1-Z)h(X)}{1-e(X)}\right\}. \tag{11.2} \]
定理 11.3 不需要可忽略性。它只关于处理 \(Z\) 与协变量 \(X\)。第一部分说:给定倾向得分,处理指示与协变量独立。因此,在同一倾向得分水平上,处理组与对照组的协变量分布是平衡的。第二部分给出协变量平衡的加权等价形式。证明如下。
定理 11.3 的证明 先证 \(Z\perp\!\!\!\perp X\mid e(X)\),即
\[ \operatorname{pr}\bigl\{Z=1\mid X,e(X)\bigr\} = \operatorname{pr}\bigl\{Z=1\mid e(X)\bigr\}. \tag{11.3} \]
步骤与定理 11.1 的证明相近。(11.3) 的左边等于
\[ \operatorname{pr}\bigl\{Z=1\mid X,e(X)\bigr\} = \operatorname{pr}(Z=1\mid X) = e(X), \]
右边等于
\[ \begin{aligned} \operatorname{pr}\bigl\{Z=1\mid e(X)\bigr\} &= \mathrm{E}\bigl\{Z\mid e(X)\bigr\}\\ &= \mathrm{E}\bigl[\mathrm{E}\{Z\mid X,e(X)\}\mid e(X)\bigr]\\ &= \mathrm{E}\bigl[\mathrm{E}\{Z\mid X\}\mid e(X)\bigr]\\ &= \mathrm{E}\bigl[e(X)\mid e(X)\bigr]\\ &= e(X). \end{aligned} \]
于是 (11.3) 成立。
再证 (11.2)。可以用与定理 11.2 类似的步骤。可一旦有了定理 11.2,证明更短:把 \(h(X)\) 看成一个结果,它的两个潜在结果相同,可忽略性成立:\(Z\perp\!\!\!\perp\{h(X),h(X)\}\mid X\)。(11.2) 左右两边之差,正是 \(Z\) 对 \(h(X)\) 的平均因果效应,因而为零。\(\square\)
11.3.2 协变量平衡检查
定理 11.3 的证明简单,对统计分析却很有用。还没看见结果数据之前,我们就可以检查:倾向得分模型是否设定得足够好,好让数据里的协变量平衡起来。Rubin (2007) 把这看作观察性研究的设计阶段;Rubin (2008) 认为,这能让因果推断更客观——因为设计阶段并不动用结果的取值。1
在倾向得分分层里,我们有离散化的估计倾向得分 \(\hat e'(X)\),并且近似地
\[ Z\perp\!\!\!\perp X\mid \hat e'(X)=e_k \qquad(k=1,\ldots,K). \]
于是可以检查:在离散化估计倾向得分的每一层内,处理组与对照组的协变量分布是否相同。
在倾向得分加权里,可以把 \(h(X)\) 看成伪结果,去估 \(Z\) 对 \(h(X)\) 的平均因果效应。真效应是 0,估计就不该显著异于 0。\(h(X)\) 的一个典范选择是 \(X\) 本身。
再看例 10.3。按 \(K=5\) 做倾向得分分层,所有协变量在处理组与对照组之间都平衡得很好。Hajek 估计量也有类似结果。唯一的例外是 Food_Stamp,即原书图 11.2 里的第 7 个协变量。图 11.2 给出平衡检查:各协变量上「平均因果效应」的点估计与 95% 置信区间。
11.4 习题
11.1 定理 11.1 的另一个版本
证明
\[ Z\perp\!\!\!\perp\bigl\{Y(1),Y(0),X\bigr\}\mid e\bigl(X,Y(1),Y(0)\bigr). \tag{11.4} \]
注: 这个结果不需要强可忽略性。它蕴含
\[ Z\perp\!\!\!\perp\bigl\{Y(1),Y(0)\bigr\}\mid \bigl\{X,\,e\bigl(X,Y(1),Y(0)\bigr)\bigr\}. \]
Rosenbaum (2020) 与 Rosenbaum and Rubin (2023) 指出了 (11.4),并把 \(e\bigl(X,Y(1),Y(0)\bigr)\) 叫做主未观测协变量(principal unobserved covariate)。
11.2 定理 11.1 的又一个版本
定理 11.1 是在强可忽略性下说的。可忽略性下也有对偶结果:若给定协变量 \(X\) 时可忽略性成立,则给定标量倾向得分 \(e(X)\) 时它也成立。
定理 11.4 若对 \(z=0,1\) 有 \(Z\perp\!\!\!\perp Y(z)\mid X\),则对 \(z=0,1\) 有 \(Z\perp\!\!\!\perp Y(z)\mid e(X)\)。
请证明定理 11.4。
11.3 关于 IPW 估计量的更多结果
这与 11.2.2 节对 HT 估计量的讨论有关。第一,证明命题 11.1。第二,证明
\[ \mathrm{E}\left(\frac{1}{n}\sum_{i=1}^{n}\frac{Z_i}{e(X_i)}\right)=1, \qquad \mathrm{E}\left(\frac{1}{n}\sum_{i=1}^{n}\frac{1-Z_i}{1-e(X_i)}\right)=1. \]
第三,证明:若给每个观测结果 \(Y_i\) 加上常数 \(c\),Hajek 估计量 \(\hat\tau^{\mathrm{hajek}}\) 保持不变。
11.4 重分析 Rosenbaum and Rubin (1983a)
表 11.1 来自 Rosenbaum and Rubin (1983a)。他们关心:与药物治疗相比,冠状动脉旁路手术对心导管检查六个月后功能改善的因果效应。他们先用 74 个观测协变量估倾向得分,再按离散化的估计倾向得分做成 5 层。处理是二值的,结果也是二值的,数据便收成一张表。请根据表 11.1 估计平均因果效应,并报告 95% 置信区间。
注: 若有兴趣,读完本书第四部分之后,可以去读 Rosenbaum and Rubin (1983a) 全文。那是因果推断里敏感性分析的一篇典范论文。
表 11.1 Rosenbaum and Rubin (1983a) 的表 1
| 按 \(\hat e(X)\) 的层 | 处理 | 患者数 | 改善比例 |
|---|---|---|---|
| 1 | 手术 | 26 | 0.54 |
| 1 | 药物 | 277 | 0.35 |
| 2 | 手术 | 68 | 0.70 |
| 2 | 药物 | 235 | 0.40 |
| 3 | 手术 | 98 | 0.70 |
| 3 | 药物 | 205 | 0.35 |
| 4 | 手术 | 164 | 0.71 |
| 4 | 药物 | 139 | 0.30 |
| 5 | 手术 | 234 | 0.70 |
| 5 | 药物 | 69 | 0.39 |
11.5 平衡得分与倾向得分:更多理论
Rosenbaum and Rubin (1983b) 还引入了平衡得分(balancing score)的概念。
定义 11.2(平衡得分) 若 \(Z\perp\!\!\!\perp X\mid b(X)\),则称 \(b(X)\) 为平衡得分。
定义 11.2 里,\(b(X)\) 可以是标量,也可以是向量。一个显然的平衡得分是 \(b(X)=X\),可它没有对原始协变量做任何简化,因此不大有用。由定理 11.3,倾向得分是一种特殊的平衡得分。更有意思的是,Rosenbaum and Rubin (1983b) 证明:倾向得分是最粗的平衡得分。下面的定理 11.5 把定理 11.3 收成特例。
定理 11.5 \(b(X)\) 是平衡得分,当且仅当 \(b(X)\) 比 \(e(X)\) 更细,意思是:存在某个函数 \(f(\cdot)\),使 \(e(X)=f\bigl(b(X)\bigr)\)。
定理 11.5 与子组分析有关。我们关心的往往不只是平均因果效应 \(\tau\),还有子组效应。例如,可能想分别估男孩与女孩中的平均因果效应。不失一般性,设 \(X\) 的第一个分量是女孩指示,关心
\[ \tau(x_1)=\mathrm{E}\bigl\{Y(1)-Y(0)\mid X_1=x_1\bigr\}, \qquad(x_1=1,0). \]
定理 11.5 蕴含:在可忽略性下,也有
\[ Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid e(X),X_1, \tag{11.5} \]
因为 \(b(X)=\{e(X),X_1\}\) 比 \(e(X)\) 更细,因而是平衡得分。(11.5) 保证:在 \(X_1\) 的每一水平上,给定倾向得分时可忽略性成立。于是可以在 \(X_1\) 的每一水平上,做同样的、基于倾向得分的分析,得到两个子组效应的估计。
带着上面的动机,请证明定理 11.5。
11.6 子组效应的一点基础
这与习题 11.5 有关,但可以独立做。
考虑标准观察性研究,协变量为 \(X=(X_1,X_2)\),其中 \(X_1\) 是二值子组指示(例如是否统计学专业),\(X_2\) 是其余协变量。关心的参数是子组因果效应
\[ \tau(x_1)=\mathrm{E}\bigl\{Y(1)-Y(0)\mid X_1=x_1\bigr\}, \qquad(x_1=1,0). \]
证明
\[ \tau(x_1) = \frac{ \mathrm{E}\left\{ \dfrac{1(X_1=x_1)\,ZY}{e(X)} - \dfrac{1(X_1=x_1)\,(1-Z)Y}{1-e(X)} \right\} }{\operatorname{pr}(X_1=x_1)}, \]
并给出 \(\tau(x_1)\) 相应的 HT 与 Hajek 估计量。
11.7 推荐阅读
本章标题与 Rosenbaum and Rubin (1983b) 那篇经典论文相同。本章多数结果,直接来自他们的原文。
Rubin (2007) 与 Rubin (2008) 强调观察性研究的设计阶段,以便因果推断更客观。
实践上这是有用的建议;怎样把「客观」量化清楚,却并不完全明白。↩︎