第 15 章 观察性研究中的匹配
匹配在经验研究里历史很长。W. Cochran 与 D. Rubin 把它带进了统计因果推断。Cochran and Rubin (1973) 是一篇早期综述;Rubin (2006b) 汇集了 Rubin 在这个题目上的贡献。这一章也会谈到 Abadie and Imbens (2006, 2008, 2011) 的现代工作:他们用渐近分析,把匹配估计量说严谨。第 7 章的配对实验,在观察性研究这边有一个几乎同名的亲戚——下面就从最干净的情形说起。
15.1 一个简单起点:对照远多于处理
原书图 15.1 画出处理–对照观察性研究里匹配的基本想法。先看一个简单情形:对照人数 \(n_0\) 远大于处理人数 \(n_1\)。对处理组里的单元 \(i=1,\ldots,n_1\),在对照组里找一个 \(m(i)\),使 \(X_i=X_{m(i)}\)。理想情形下,匹配是精确的。于是一对之内倾向得分相同:\(e(X_i)=e(X_{m(i)})\)。因而,条件于「一人接受处理、一人接受对照」,以及这对人的协变量,
\[ \operatorname{pr}\bigl(Z_i=1,\,Z_{m(i)}=0\mid Z_i+Z_{m(i)}=1,\,X_i,X_{m(i)}\bigr) = 1/2, \]
由对称性立刻得到。1 也就是说:再条件于协变量、以及每一对里恰有一个处理与一个对照,处理分配与 MPE 相同。精确匹配的观察性研究,就可以当作一次 MPE 来分析——用第 7 章的 FRT,或 Neyman 那一套。得到的,是处理组上因果效应的推断。
也可以给每个处理单元配上多个对照。一般地,处理单元 \(i\) 配 \(M_i\) 个对照。若各 \(M_i\) 可以不同,就叫可变比例匹配(variable-ratio matching; Ming and Rosenbaum, 2000, 2001; Pimentel et al., 2015)。匹配一旦精确,处理分配机制就与第 7.7 节的一般匹配实验相同。那一节的分析,可以直接搬过来。
Rosenbaum (2002b) 倡导过上面这套策略。可多数观察性研究里,并非所有单元都满足 \(X_i=X_{m(i)}\)。上面那套给 FRT 的理由,也就站不住。最近,Guo and Rothenhäusler (2022) 报告了不精确匹配对 FRT 的负面结果。这是一声警告。
15.2 更复杂、也更真实的情形
即便对照组很大,精确匹配也常常做不到。我们能做到的,是 \(X_i\approx X_{m(i)}\),或在某种距离下 \(X_i-X_{m(i)}\) 很小。于是只有近似匹配。例如定义
\[ m(i)=\arg\min_{k:Z_k=0}\,d(X_i,X_k), \]
其中 \(d(X_i,X_k)\) 度量 \(X_i\) 与 \(X_k\) 的距离。典范选择包括欧氏距离
\[ d(X_i,X_k)=(X_i-X_k)^\top(X_i-X_k), \]
以及 Mahalanobis 距离
\[ d(X_i,X_k)=(X_i-X_k)^\top\Omega^{-1}(X_i-X_k), \]
\(\Omega\) 是全体、或只在对照组里,\(X_i\) 的样本协方差阵。
下面复习匹配里几件细而绕的事。综述见 Stuart (2010)。
- 一对一或一对 \(M\)。 上面聚焦一对一;也可以推广到一对 \(M\)。
- 有放回还是无放回。 我聚焦有放回匹配;有些实践者更喜欢无放回。对照池子够大时,两者最终结果往往差不太多。有放回计算更方便,匹配质量通常也更高,可同一个对照会被用多次,从而引入相依。无放回的好处是匹配单元彼此独立,后续分析更简单;代价是计算上要做更重的离散优化。
- 对内仍有残余协变量失衡。 分析时用协变量调整,因此很要紧。这时调整不只是为了换效率,也是为了校正偏倚。
- 若 \(X\)「维度高」。 对处理组里某些 \(i\),可能对对照组里所有人选,\(d(X_i,X_k)\) 都太大。这时也许只能丢掉那些难匹配的人。这样一来,我们实际上换了关心的研究总体。
- 上面这个问题很难躲开。 例如,若 \(X_i\sim\mathcal{N}(0,I_p)\)、\(X_k\sim\mathcal{N}(0,I_p)\) 且 \(X_i\perp\!\!\!\perp X_k\),则
\[ (X_i-X_k)^\top(X_i-X_k)\sim 2\chi^2_p, \]
均值 \(2p\)、方差 \(8p\)(见附录 A.1.3)。理论表明:\(p\) 一大,不完美匹配会给因果效应估计带来很大偏倚。于是 \(p\) 大时,匹配前必须先降维。Rosenbaum and Rubin (1983b) 提议按倾向得分匹配。有了估计倾向得分,就找 \(\lvert\hat e(X_i)-\hat e(X_{m(i)})\rvert\) 或 \(\lvert\operatorname{logit}\{\hat e(X_i)\}-\operatorname{logit}\{\hat e(X_{m(i)})\}\rvert\) 很小的对 \(\{i,m(i)\}\)。2 匹配问题收成了一维。
15.3 平均因果效应的匹配估计量
在一系列论文里,Abadie and Imbens(以下简称 AI)严格刻画了匹配估计量的渐近性质,并为平均因果效应给出了相应的大样本置信区间。他们采用观察性研究的标准设定:
\[ \{X_i,Z_i,Y_i(1),Y_i(0)\}_{i=1}^{n} \ \stackrel{\mathrm{IID}}{\sim}\ \{X,Z,Y(1),Y(0)\}. \]
15.3.1 点估计与偏倚校正
AI 聚焦有放回的一对 \(M\) 匹配。对处理单元 \(i\),处理下的潜在结果直接填成 \(\hat Y_i(1)=Y_i\),对照下则填成
\[ \hat Y_i(0)=M^{-1}\sum_{k\in\mathcal{J}_i}Y_k, \]
其中 \(\mathcal{J}_i\) 是为单元 \(i\) 从对照组配来的集合。例如,对对照组里所有 \(k\) 计算 \(d(X_i,X_k)\),再把距离最小的 \(M\) 个 \(k\) 的下标收进 \(\mathcal{J}_i\)。
对对照单元 \(i\),对照下的潜在结果直接填成 \(\hat Y_i(0)=Y_i\),处理下则填成
\[ \hat Y_i(1)=M^{-1}\sum_{k\in\mathcal{J}_i}Y_k, \]
其中 \(\mathcal{J}_i\) 是为单元 \(i\) 从处理组配来的集合。
匹配估计量是
\[ \hat\tau^{\mathrm{m}} = n^{-1}\sum_{i=1}^{n}\bigl\{\hat Y_i(1)-\hat Y_i(0)\bigr\}. \]
AI 证明:\(\hat\tau^{\mathrm{m}}\) 有不可忽略的偏倚——尤其当 \(X\) 是多维的、且对照人数与处理人数相当时。经过一些技术推导,他们提出如下偏倚估计:
\[ \hat B=n^{-1}\sum_{i=1}^{n}\hat B_i, \]
其中
\[ \hat B_i = (2Z_i-1)\,M^{-1}\sum_{k\in\mathcal{J}_i} \bigl\{\hat\mu_{1-Z_i}(X_i)-\hat\mu_{1-Z_i}(X_k)\bigr\}, \]
\(\{\hat\mu_1(X_i),\hat\mu_0(X_i)\}\) 是预测结果,例如来自 OLS。对处理单元 \(Z_i=1\),估计偏倚是
\[ \hat B_i = M^{-1}\sum_{k\in\mathcal{J}_i}\bigl\{\hat\mu_0(X_i)-\hat\mu_0(X_k)\bigr\}, \]
用来校正因协变量不匹配而造成的、对照潜在结果预测值的差距;对对照单元 \(Z_i=0\),估计偏倚是
\[ \hat B_i = -M^{-1}\sum_{k\in\mathcal{J}_i}\bigl\{\hat\mu_1(X_i)-\hat\mu_1(X_k)\bigr\}, \]
用来校正处理潜在结果预测值的差距。
最终的偏倚校正匹配估计量是
\[ \hat\tau^{\mathrm{mbc}}=\hat\tau^{\mathrm{m}}-\hat B, \]
并有如下线性展开。
命题 15.1 我们有
\[ \hat\tau^{\mathrm{mbc}}=n^{-1}\sum_{i=1}^{n}\hat\psi_i, \tag{15.1} \]
其中
\[ \hat\psi_i = \hat\mu_1(X_i)-\hat\mu_0(X_i) + (2Z_i-1)\bigl(1+K_i/M\bigr)\bigl\{Y_i-\hat\mu_{Z_i}(X_i)\bigr\}, \]
\(K_i\) 是单元 \(i\) 被用作匹配对象的次数。
命题 15.1 的线性展开来自简单却繁琐的代数。证明留给习题 15.1。它立刻提示一个简单方差估计:把 \(\hat\tau^{\mathrm{mbc}}\) 看成 \(\hat\psi_i\) 的样本均值,
\[ \hat V^{\mathrm{mbc}} = \frac{1}{n^2}\sum_{i=1}^{n}\bigl(\hat\psi_i-\hat\tau^{\mathrm{mbc}}\bigr)^2. \]
Abadie and Imbens (2008) 首先证明:对原始数据做简单自助,并不能用来估匹配估计量的方差;可他们提议的方差手续又不太好实施。Otsu and Rai (2017) 提议对线性展开里的 \(\hat\psi_i\) 做自助。不过,Otsu and Rai (2017) 的自助本质上给出的就是 \(\hat V^{\mathrm{mbc}}\),而它计算起来很简单。
15.3.2 与双重稳健估计量的联系
偏倚校正匹配估计量与双重稳健估计量很近。两者都等于结果回归估计量,再按残差做一些修改:
\[ \hat R_i = \begin{cases} Y_i-\hat\mu_1(X_i), & Z_i=1,\\ Y_i-\hat\mu_0(X_i), & Z_i=0. \end{cases} \]
对平均因果效应 \(\tau\),回想结果回归估计量
\[ \hat\tau^{\mathrm{reg}}=n^{-1}\sum_{i=1}^{n}\bigl\{\hat\mu_1(X_i)-\hat\mu_0(X_i)\bigr\} \]
与双重稳健估计量
\[ \hat\tau^{\mathrm{dr}} = \hat\tau^{\mathrm{reg}} + n^{-1}\sum_{i=1}^{n} \left\{ \frac{Z_i\hat R_i}{\hat e(X_i)} - \frac{(1-Z_i)\hat R_i}{1-\hat e(X_i)} \right\}. \]
还可以验证:\(\hat\tau^{\mathrm{mbc}}\) 的形式与 \(\hat\tau^{\mathrm{dr}}\) 相似。
命题 15.2 \(\tau\) 的偏倚校正匹配估计量等于
\[ \hat\tau^{\mathrm{mbc}} = \hat\tau^{\mathrm{reg}} + n^{-1}\sum_{i=1}^{n} \left\{ \left(1+\frac{K_i}{M}\right)Z_i\hat R_i - \left(1+\frac{K_i}{M}\right)(1-Z_i)\hat R_i \right\}. \]
证明留给习题 15.2。由命题 15.2,可以把匹配看成估倾向得分的一种非参数方法,把得到的偏倚校正匹配估计量看成一种双重稳健估计量。例如,\(1+K_i/M\) 应当接近 \(1/\hat e(X_i)\)。处理单元的 \(e(X_i)\) 很小时,基于估计倾向得分的权重 \(1/\hat e(X_i)\) 会很大;与此同时,它会被许多对照单元拿去匹配,于是 \(K_i\) 大,\(1+K_i/M\) 也大。
可这份联系也给匹配提出一个明显的问题。\(M\) 固定时,用 \(1+K_i/M\) 去估 \(1/e(X_i)\),会非常吵。让 \(M\) 随样本量长大,很可能改善这份基于匹配的非参数倾向得分估计,从而改善匹配与偏倚校正匹配估计量的渐近性质。Lin et al. (2023) 给出了正式理论:一旦让 \(M\) 以合适的速率长大,偏倚校正匹配估计量 \(\hat\tau^{\mathrm{mbc}}\) 就能得到与双重稳健估计量相近的性质。
15.4 处理组上平均因果效应的匹配估计量
对处理组上的平均因果效应
\[ \tau_{\mathrm{T}}=\mathrm{E}(Y\mid Z=1)-\mathrm{E}\{Y(0)\mid Z=1\}, \]
只需给所有处理单元填补缺失的对照潜在结果,得到
\[ \hat\tau_{\mathrm{T}}^{\mathrm{m}} = n_1^{-1}\sum_{i=1}^{n}Z_i\bigl\{Y_i-\hat Y_i(0)\bigr\}. \]
\(X\) 多维时,它同样有偏。Otsu and Rai (2017) 提议用
\[ \hat B_{\mathrm{T}} = n_1^{-1}\sum_{i=1}^{n}Z_i\hat B_{\mathrm{T},i} \]
去估它的偏倚,其中
\[ \hat B_{\mathrm{T},i} = M^{-1}\sum_{k\in\mathcal{J}_i}\bigl\{\hat\mu_0(X_i)-\hat\mu_0(X_k)\bigr\} \]
校正处理单元(\(Z_i=1\))因协变量不匹配造成的偏倚。
最终的偏倚校正估计量是
\[ \hat\tau_{\mathrm{T}}^{\mathrm{mbc}}=\hat\tau_{\mathrm{T}}^{\mathrm{m}}-\hat B_{\mathrm{T}}, \]
并有如下线性展开。
命题 15.3 我们有
\[ \hat\tau_{\mathrm{T}}^{\mathrm{mbc}} = n_1^{-1}\sum_{i=1}^{n}\hat\psi_{\mathrm{T},i}, \tag{15.2} \]
其中
\[ \hat\psi_{\mathrm{T},i} = Z_i\bigl\{Y_i-\hat\mu_0(X_i)\bigr\} - (1-Z_i)\frac{K_i}{M}\bigl\{Y_i-\hat\mu_0(X_i)\bigr\}. \]
证明留给习题 15.1。受 Otsu and Rai (2017) 启发,可以把 \(\hat\tau_{\mathrm{T}}^{\mathrm{mbc}}\) 看成 \(n/n_1\) 乘以 \(\hat\psi_{\mathrm{T},i}\) 的样本均值,于是一个直觉的方差估计是
\[ \hat V_{\mathrm{T}}^{\mathrm{mbc}} = \left(\frac{n}{n_1}\right)^2 \frac{1}{n^2} \sum_{i=1}^{n} \bigl(\hat\psi_{\mathrm{T},i}-\hat\tau_{\mathrm{T}}^{\mathrm{mbc}}\,n_1/n\bigr)^2 = \frac{1}{n_1^2} \sum_{i=1}^{n} \bigl(\hat\psi_{\mathrm{T},i}-\hat\tau_{\mathrm{T}}^{\mathrm{mbc}}\,n_1/n\bigr)^2. \]
与 15.3.2 节平行,也可以把双重稳健、偏倚校正匹配与结果回归放在一起看。对 \(\tau_{\mathrm{T}}\),回想结果回归估计量
\[ \hat\tau_{\mathrm{T}}^{\mathrm{reg}} = n_1^{-1}\sum_{i=1}^{n}Z_i\bigl\{Y_i-\hat\mu_0(X_i)\bigr\} \]
与双重稳健估计量
\[ \hat\tau_{\mathrm{T}}^{\mathrm{dr}} = \hat\tau_{\mathrm{T}}^{\mathrm{reg}} - n_1^{-1}\sum_{i=1}^{n} \frac{\hat e(X_i)}{1-\hat e(X_i)}(1-Z_i)\hat R_i. \]
还可以验证:\(\hat\tau_{\mathrm{T}}^{\mathrm{mbc}}\) 的形式与 \(\hat\tau_{\mathrm{T}}^{\mathrm{dr}}\) 相似。
命题 15.4 \(\tau_{\mathrm{T}}\) 的偏倚校正匹配估计量等于
\[ \hat\tau_{\mathrm{T}}^{\mathrm{mbc}} = \hat\tau_{\mathrm{T}}^{\mathrm{reg}} - n_1^{-1}\sum_{i=1}^{n}\frac{K_i}{M}(1-Z_i)\hat R_i. \]
证明留给习题 15.3。命题 15.4 提示:匹配本质上是用 \(K_i/M\) 去估给定协变量时处理的优势。
15.5 一个案例
15.5.1 实验数据
现在用 Sekhon (2011) 的 Matching 包,回到 LaLonde 数据。这个包我们用过多次,为的是数据集 lalonde;现在要用它的关键函数 Match。实验这一侧给出:
library("car")
library("Matching")
## Chapter 15.5.1 experimental data
data("lalonde")
y = lalonde$re78
z = lalonde$treat
x = as.matrix(lalonde[, c("age", "educ", "black",
"hisp", "married", "nodegr",
"re74", "re75")])
## analyze the randomized experiment
neymanols = lm(y ~ z)
fisherols = lm(y ~ z + x)
xc = scale(x)
linols = lm(y ~ z*xc)
resols = c(neymanols$coef[2],
fisherols$coef[2],
linols$coef[2],
sqrt(hccm(neymanols, type = "hc2")[2, 2]),
sqrt(hccm(fisherols, type = "hc2")[2, 2]),
sqrt(hccm(linols, type = "hc2")[2, 2]))
resols = matrix(resols, 3, 2)
rownames(resols) = c("neyman", "fisher", "lin")
colnames(resols) = c("est", "se")
resols| est | se | |
|---|---|---|
| neyman | \(1794.3\) | \(671.0\) |
| fisher | \(1676.3\) | \(677.0\) |
| lin | \(1621.6\) | \(694.7\) |
三种回归估计都显示:就业培训项目有正向显著效应。也可以把实验数据当作观察性研究,做一对一匹配:
matchest.adj = Match(Y = y, Tr = z, X = x, BiasAdjust = TRUE)
summary(matchest.adj)| Estimate | \(2119.7\) |
| AI SE | \(876.4\) |
| \(T\)-stat | \(2.42\) |
| \(p\)-val | \(0.016\) |
| 原始样本量(处理) | \(445\)(\(185\)) |
| 匹配后样本量(不加权) | \(185\)(\(268\)) |
点估计与标准误都变大了,可定性结论不变。
15.5.2 观察性数据
再看这套数据的观察性对应物:
dat <- read.table("cps1re74.csv", header = TRUE)
dat$u74 <- as.numeric(dat$re74 == 0)
dat$u75 <- as.numeric(dat$re75 == 0)
y = dat$re78
z = dat$treat
x = as.matrix(dat[, c("age", "educ", "black",
"hispan", "married", "nodegree",
"re74", "re75", "u74", "u75")])若只用简单 OLS,结果离实验这块「金标准」很远,而且对回归设定很敏感:
| est | se | |
|---|---|---|
| neyman | \(-8506.5\) | \(583.4\) |
| fisher | \(1067.5\) | \(628.4\) |
| lin | \(-4265.8\) | \(3211.8\) |
可若做一对一匹配,结果几乎找回实验那一侧:
matchest = Match(Y = y, Tr = z, X = x, BiasAdjust = TRUE)
summary(matchest)| Estimate | \(1747.8\) |
| AI SE | \(916.6\) |
| \(T\)-stat | \(1.91\) |
| \(p\)-val | \(0.057\) |
| 原始样本量(处理) | \(16177\)(\(185\)) |
| 匹配后样本量(不加权) | \(185\)(\(248\)) |
忽略匹配数据里的结,也可以做配对分析,结果同样靠近实验:
diff = y[matchest$index.treated] - y[matchest$index.control]
round(summary(lm(diff ~ 1))$coef[1, ], 2)
diff.x = x[matchest$index.treated, ] - x[matchest$index.control, ]
round(summary(lm(diff ~ diff.x))$coef[1, ], 2)| Estimate | Std. Error | \(t\) | \(p\) | |
|---|---|---|---|---|
diff ~ 1 |
\(1581.4\) | \(558.6\) | \(2.83\) | \(0.01\) |
diff ~ diff.x |
\(1842.1\) | \(578.4\) | \(3.18\) | \(0.00\) |
15.5.3 协变量平衡检查
还可以用简单 OLS 检查协变量平衡。匹配前,协变量高度失衡——许多系数带着星星:
lm.before = lm(z ~ x)
summary(lm.before)| Estimate | \(t\) | \(p\) | |
|---|---|---|---|
| age | \(-4.0\times 10^{-4}\) | \(-4.75\) | \(<0.001\) |
| educ | \(3.2\times 10^{-4}\) | \(0.79\) | \(0.43\) |
| black | \(0.107\) | \(36.9\) | \(<0.001\) |
| hispan | \(0.0064\) | \(2.06\) | \(0.040\) |
| married | \(-0.015\) | \(-7.54\) | \(<0.001\) |
| nodegree | \(0.013\) | \(5.33\) | \(<0.001\) |
| re74 | \(7.6\times 10^{-7}\) | \(4.21\) | \(<0.001\) |
| re75 | \(-1.2\times 10^{-7}\) | \(-0.67\) | \(0.50\) |
| u74 | \(0.042\) | \(12.9\) | \(<0.001\) |
| u75 | \(0.024\) | \(7.13\) | \(<0.001\) |
匹配之后,协变量平衡得很好——协变量系数上的星星都不见了:
lm.after = lm(z ~ x,
subset = c(matchest$index.treated,
matchest$index.control))
summary(lm.after)| Estimate | \(t\) | \(p\) | |
|---|---|---|---|
| age | \(0.0032\) | \(0.93\) | \(0.35\) |
| educ | \(-0.015\) | \(-0.92\) | \(0.36\) |
| black | \(6.1\times 10^{-5}\) | \(0.00\) | \(1.00\) |
| hispan | \(0.014\) | \(0.12\) | \(0.91\) |
| married | \(-0.013\) | \(-0.20\) | \(0.84\) |
| nodegree | \(-0.030\) | \(-0.42\) | \(0.67\) |
| re74 | \(6.8\times 10^{-6}\) | \(0.69\) | \(0.49\) |
| re75 | \(-9.8\times 10^{-6}\) | \(-0.77\) | \(0.44\) |
| u74 | \(0.022\) | \(0.21\) | \(0.83\) |
| u75 | \(-0.026\) | \(-0.32\) | \(0.75\) |
(匹配后只有截距仍显著;原书完整回归表见原文。)
15.6 讨论
协变量一多,按原始协变量匹配就会撞上维数灾难。Rosenbaum and Rubin (1983b) 建议按估计倾向得分来匹配。Abadie and Imbens (2016) 给这套策略提供了正式理论。
15.7 习题
15.1 偏倚校正估计量的线性展开
证明命题 15.1 与 15.3。
15.2 \(\tau\) 的偏倚校正匹配估计量的双重稳健形式
证明命题 15.2。
15.3 \(\tau_{\mathrm{T}}\) 的偏倚校正匹配估计量的双重稳健形式
证明命题 15.4。
15.4 回到例 10.3
用匹配估计量分析例 10.3 的数据,并与前面的结果比较。请检查匹配前后的协变量平衡。也可以给匹配估计量换不同的匹配个数。甚至可以把各种估计量用到匹配后的数据上。你的结果对选择敏感吗?
15.5 回到第 15.5 节
第 15.5 节用匹配分析了 LaLonde 观察性研究。匹配表现很好:它给出的估计靠近实验这块金标准。请用结果回归、倾向得分分层、两种 IPW,以及双重稳健估计量重新分析,并与匹配估计量、以及实验金标准比较。
请注意你有许多选择。例如分层的层数,以及按估计倾向得分修剪数据的阈值。也可以拟合不同的倾向得分与结果模型,比如在基本协变量上再加一些二次项。甚至可以把这些估计量用到匹配后的数据上。
这是一套经典数据,用过它的论文数以百计。可以读一些参考文献(Dehejia and Wahba, 1999; Hainmueller, 2012),分析时也可以更有创意一点。
15.6 数据再分析
Ho et al. (2007) 是政治学里很有影响的一篇论文,作者据此做了 R 包 MatchIt(Ho et al., 2011)。Ho et al. (2007) 分析了两套数据,都可以从哈佛 Dataverse 拿到。
请用到目前为止讨论过的方法,重新分析这两套数据。也可以试别的方法,只要你能讲清理由。
15.7 推荐阅读
匹配估计量的文献非常庞大。三篇优秀的综述是 Sekhon (2009)、Stuart (2010) 与 Imbens (2015)。
第四部分 观察性研究的困难与挑战
严格写法是 \[ \begin{aligned} &\operatorname{pr}\bigl(Z_i=1,\,Z_{m(i)}=0\mid Z_i+Z_{m(i)}=1,\,X_i,X_{m(i)}\bigr)\\ &= \frac{ \operatorname{pr}(Z_i=1,Z_{m(i)}=0\mid X_i,X_{m(i)}) }{ \operatorname{pr}(Z_i=1,Z_{m(i)}=0\mid X_i,X_{m(i)}) + \operatorname{pr}(Z_i=0,Z_{m(i)}=1\mid X_i,X_{m(i)}) }\\ &= \frac{e(X_i)\{1-e(X_{m(i)})\}} {e(X_i)\{1-e(X_{m(i)})\}+\{1-e(X_i)\}e(X_{m(i)})} = \frac12, \end{aligned} \] 最后一步用了 \(X_i=X_{m(i)}\),从而 \(e(X_i)=e(X_{m(i)})\)。↩︎
\(\operatorname{logit}(w)=\log\{w/(1-w)\}\)。logit 把 \([0,1]\) 映到 \((-\infty,\infty)\)。↩︎