第 17 章 E-value:有未测混杂的观察性研究里,因果的证据
第三部分那些方法,都把可忽略性当成地基。地基稳不稳,数据自己说不清。观察性研究因此常被批评:会不会有没看见的混杂?第 1 章的尤尔–辛普森悖论已经演示过,一个未测的二值混杂可以把观测关联整个翻过来。可要把更大的观测关联翻过来,这个未测混杂必须与处理、与结果都有更强的关联。换句话说,观察性研究并非生而平等:有些给出的因果证据,就是硬一些。
接下来三章,谈各种敏感性分析:有未测混杂时,怎样把观察性研究里的因果证据量化出来。这一章从 E-value 开始,由 VanderWeele and Ding (2017) 引入,理论基础在 Ding and VanderWeele (2016)。它最有用的场合,是观察性研究用逻辑回归去估处理对二值结果的条件风险比。第 18 章谈平均因果效应的敏感性分析,建立在结果回归、IPW 与双重稳健之上。第 19 章谈 Rosenbaum 那一套:匹配观察性研究的敏感性分析。
17.1 Cornfield 型敏感性分析
我们不再假定给定 \(X\) 时可忽略:
\[ Z\not\perp\!\!\!\perp\{Y(1),Y(0)\}\mid X, \]
但仍假定给定 \(X\) 与一个未测混杂 \(U\) 时,有潜在可忽略性(latent ignorability):
\[ Z\perp\!\!\!\perp\{Y(1),Y(0)\}\mid(X,U). \]
这一章的技术对二值结果 \(Y\) 最顺手,虽也可以推到其他非负结果(Ding and VanderWeele, 2016)。下面先盯住二值 \(Y\)。风险比尺度上,真正的条件因果效应定义为
\[ \mathrm{RR}^{\mathrm{true}}_{ZY\mid x} = \frac{\operatorname{pr}\{Y(1)=1\mid X=x\}} {\operatorname{pr}\{Y(0)=1\mid X=x\}}, \]
观测到的条件风险比是
\[ \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x} = \frac{\operatorname{pr}(Y=1\mid Z=1,X=x)} {\operatorname{pr}(Y=1\mid Z=0,X=x)}. \]
一般情形里,有未测混杂 \(U\) 时,两者不同:
\[ \mathrm{RR}^{\mathrm{true}}_{ZY\mid x} \ne \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}, \]
因为
\[ \mathrm{RR}^{\mathrm{true}}_{ZY\mid x} = \frac{ \int\operatorname{pr}(Y=1\mid Z=1,X=x,U=u)\,f(u\mid X=x)\,du }{ \int\operatorname{pr}(Y=1\mid Z=0,X=x,U=u)\,f(u\mid X=x)\,du } \]
与
\[ \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x} = \frac{ \int\operatorname{pr}(Y=1\mid Z=1,X=x,U=u)\,f(u\mid Z=1,X=x)\,du }{ \int\operatorname{pr}(Y=1\mid Z=0,X=x,U=u)\,f(u\mid Z=0,X=x)\,du } \]
是在 \(U\) 的两套不同分布上平均。
历史上,Doll and Hill (1950) 发现:即便调整了许多观测协变量 \(X\),吸烟对肺癌的风险比仍是 9。1 Fisher (1957) 批评这个结果不是因果:可能有一个隐藏的基因同时导致吸烟与肺癌,而吸烟对肺癌的真因果效应其实为零。这就是共同原因假说(common cause hypothesis),Reichenbach (1957) 也讨论过。Cornfield et al. (1959) 采取了更建设性的视角,问:要把吸烟与肺癌的观测关联解释掉,这个未测混杂必须有多强?下面我们用 Ding and VanderWeele (2016) 对这个问题的一般表述。
考虑下面的因果图(已条件于 \(X\)):
U
↙ ↘
Z Y
于是 \(Z\perp\!\!\!\perp Y\mid(X,U)\)。给定 \(X\) 与 \(U\),我们看不见 \(Z\) 与 \(Y\) 的关联;只给定 \(X\),却看得见。Ding and VanderWeele (2016) 允许 \(U\) 很一般,可为了叙述简单,下面假定 \(U\) 是二值的。
定义两个敏感性参数:
\[ \mathrm{RR}_{ZU\mid x} = \frac{\operatorname{pr}(U=1\mid Z=1,X=x)} {\operatorname{pr}(U=1\mid Z=0,X=x)} \]
度量处理–混杂关联;
\[ \mathrm{RR}_{UY\mid x} = \frac{\operatorname{pr}(Y=1\mid U=1,X=x)} {\operatorname{pr}(Y=1\mid U=0,X=x)} \]
度量混杂–结果关联,都条件于协变量 \(X=x\)。主要结果如下。
定理 17.1 在 \(Z\perp\!\!\!\perp Y\mid(X,U)\) 下,假定
\[ \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}>1, \qquad \mathrm{RR}_{ZU\mid x}>1, \qquad \mathrm{RR}_{UY\mid x}>1. \tag{17.1} \]
则
\[ \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x} \le \frac{\mathrm{RR}_{ZU\mid x}\,\mathrm{RR}_{UY\mid x}} {\mathrm{RR}_{ZU\mid x}+\mathrm{RR}_{UY\mid x}-1}. \]
定理 17.1 里,(17.1) 不失一般性。若 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}<1\),可以把处理与对照的标签对调,使它大于 1。若 \(\mathrm{RR}_{ZU\mid x}<1\),可以把未测混杂改成 \(1-U\),使它大于 1。若 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}>1\) 且 \(\mathrm{RR}_{ZU\mid x}>1\),则 \(\mathrm{RR}_{UY\mid x}>1\) 会自动成立。这点细技术留给习题 17.2。
定理 17.1 给出:若条件独立 \(Z\perp\!\!\!\perp Y\mid(X,U)\) 成立,观测风险比的上界。在这条假定下,处理与结果的关联,纯粹来自处理与混杂的关联 \(\mathrm{RR}_{ZU\mid x}\),以及混杂与结果的关联 \(\mathrm{RR}_{UY\mid x}\)。上界等于 \(\mathrm{RR}_{ZU\mid x}\mathrm{RR}_{UY\mid x}/(\mathrm{RR}_{ZU\mid x}+\mathrm{RR}_{UY\mid x}-1)\)。类似的不等式出现在 Lee (2011)。它也与线性模型里的 Cochran 公式、或遗漏变量偏倚公式有关,习题 16.2 复习过。
反过来,要生出某个观测风险比 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\),两个混杂度量就不能任意:它们的函数 \(\mathrm{RR}_{ZU\mid x}\mathrm{RR}_{UY\mid x}/(\mathrm{RR}_{ZU\mid x}+\mathrm{RR}_{UY\mid x}-1)\) 必须至少与 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\) 一样大。
定理 17.1 的证明如下。
定理 17.1 的证明 定义
\[ f_{1,x}=\operatorname{pr}(U=1\mid Z=1,X=x), \qquad f_{0,x}=\operatorname{pr}(U=1\mid Z=0,X=x). \]
可以把 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\) 拆开:
\[ \begin{aligned} \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x} &= \frac{\operatorname{pr}(Y=1\mid Z=1,X=x)} {\operatorname{pr}(Y=1\mid Z=0,X=x)}\\ &= \frac{ \operatorname{pr}(U=1\mid Z=1,X=x)\operatorname{pr}(Y=1\mid Z=1,U=1,X=x) + \operatorname{pr}(U=0\mid Z=1,X=x)\operatorname{pr}(Y=1\mid Z=1,U=0,X=x) }{ \operatorname{pr}(U=1\mid Z=0,X=x)\operatorname{pr}(Y=1\mid Z=0,U=1,X=x) + \operatorname{pr}(U=0\mid Z=0,X=x)\operatorname{pr}(Y=1\mid Z=0,U=0,X=x) }\\ &= \frac{ \operatorname{pr}(U=1\mid Z=1,X=x)\operatorname{pr}(Y=1\mid U=1,X=x) + \operatorname{pr}(U=0\mid Z=1,X=x)\operatorname{pr}(Y=1\mid U=0,X=x) }{ \operatorname{pr}(U=1\mid Z=0,X=x)\operatorname{pr}(Y=1\mid U=1,X=x) + \operatorname{pr}(U=0\mid Z=0,X=x)\operatorname{pr}(Y=1\mid U=0,X=x) }\\ &= \frac{f_{1,x}\,\mathrm{RR}_{UY\mid x}+1-f_{1,x}} {f_{0,x}\,\mathrm{RR}_{UY\mid x}+1-f_{0,x}}\\ &= \frac{(\mathrm{RR}_{UY\mid x}-1)f_{1,x}+1} {\dfrac{\mathrm{RR}_{UY\mid x}-1}{\mathrm{RR}_{ZU\mid x}}f_{1,x}+1}. \end{aligned} \]
用习题 17.1 的结果,可以验证 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\) 对 \(f_{1,x}\) 递增。于是令 \(f_{1,x}=1\),得到
\[ \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x} \le \frac{(\mathrm{RR}_{UY\mid x}-1)+1} {\dfrac{\mathrm{RR}_{UY\mid x}-1}{\mathrm{RR}_{ZU\mid x}}+1} = \frac{\mathrm{RR}_{ZU\mid x}\,\mathrm{RR}_{UY\mid x}} {\mathrm{RR}_{ZU\mid x}+\mathrm{RR}_{UY\mid x}-1}. \]
\(\square\)
定理 17.1 的证明里,我们其实得到一个恒等式
\[ \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x} = \frac{(\mathrm{RR}_{UY\mid x}-1)f_{1,x}+1} {\dfrac{\mathrm{RR}_{UY\mid x}-1}{\mathrm{RR}_{ZU\mid x}}f_{1,x}+1}. \tag{17.2} \]
可这个恒等式牵涉三个参数 \(\{f_{1,x},\mathrm{RR}_{ZU\mid x},\mathrm{RR}_{UY\mid x}\}\);相关公式见习题 17.4。相比之下,定理 17.1 的上界只牵涉两个度量混杂强度的参数 \(\{\mathrm{RR}_{ZU\mid x},\mathrm{RR}_{UY\mid x}\}\)。数学上,恒等式 (17.2) 比定理 17.1 的不等式更强。可 (17.2) 的敏感性参数更多。于是敏感性分析里,精确与方便必须折中。
17.2 E-value
下面的引理 17.1,对从定理 17.1 推出有意思的推论很有用。证明留给习题 17.3。
引理 17.1 对 \(w_1>1\)、\(w_2>1\),定义 \(\beta(w_1,w_2)=w_1 w_2/(w_1+w_2-1)\)。
- \(\beta(w_1,w_2)\) 对 \(w_1\) 与 \(w_2\) 对称;
- \(\beta(w_1,w_2)\) 对 \(w_1\) 与 \(w_2\) 都递增;
- \(\beta(w_1,w_2)\le w_1\) 且 \(\beta(w_1,w_2)\le w_2\);
- \(\beta(w_1,w_2)\le w^2/(2w-1)\),其中 \(w=\max(w_1,w_2)\)。
由定理 17.1 与引理 17.1(3),
\[ \mathrm{RR}_{ZU\mid x}\ge\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}, \qquad \mathrm{RR}_{UY\mid x}\ge\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}, \]
也就是
\[ \min(\mathrm{RR}_{ZU\mid x},\mathrm{RR}_{UY\mid x})\ge\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}. \]
因此,要把观测相对危险解释掉,两个混杂度量都必须至少与 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\) 一样大。Cornfield et al. (1959) 最先得到 \(\mathrm{RR}_{ZU\mid x}\ge\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\),也叫 Cornfield 不等式(Gastwirth et al., 1998)。Schlesselman (1978) 得到 \(\mathrm{RR}_{UY\mid x}\ge\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\)。它们与信息论里的数据处理不等式有关。2
若定义 \(w=\max(\mathrm{RR}_{ZU\mid x},\mathrm{RR}_{UY\mid x})\),则由定理 17.1 与引理 17.1(4),
\[ \frac{w^2}{2w-1} \ge \beta(\mathrm{RR}_{ZU\mid x},\mathrm{RR}_{UY\mid x}) \ge \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}, \]
从而
\[ w^2-2\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\,w+\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\ge 0, \]
这是一个二次不等式。一个根 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}-\sqrt{\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}-1)}\) 总是小于或等于 1,于是
\[ w=\max(\mathrm{RR}_{ZU\mid x},\mathrm{RR}_{UY\mid x}) \ge \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x} + \sqrt{\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}-1)}. \]
因此,要把观测相对危险解释掉,两个混杂度量的最大值必须至少有
\[ \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x} + \sqrt{\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}-1)} \]
这么大。据此,VanderWeele and Ding (2017) 引入 E-value,用来度量观察性研究里的因果证据。
定义 17.1(E-value) 有了观测条件风险比 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\),定义 E-value 为
\[ \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x} + \sqrt{\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}-1)}. \]
E-value 是对参数 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\) 定义的。实践里,\(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\) 带抽样误差。我们可以按估计的 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\) 去算 E-value,也可以按它的置信下限与上限各自再算一遍。
Fisher 的 \(p\) 值,度量的是随机化实验里的因果证据。本书第二部分谈过基于 FRT 的 \(p\) 值。可在大样本观察性研究里,\(p\) 值往往是因果证据的拙劣度量。即便真因果效应是 0,一点点未测混杂就能把估计带偏;抽样不确定性又小,\(p\) 值可以极小。大样本观察性研究里,抽样不确定性通常是次要的;未测混杂带来的不确定性,才是一阶问题——它不会随样本量增大而消失。VanderWeele and Ding (2017) 认为:在观察性研究里,E-value 是更好的因果证据度量。
17.3 一个经典例子
例 17.1 Hammond and Horn (1958) 用美国人口研究吸烟与肺癌。忽略协变量,数据可以收成下面这张 \(2\times 2\) 表:
| 肺癌 | 无肺癌 | |
|---|---|---|
| 吸烟 | 397 | 78557 |
| 不吸烟 | 51 | 108778 |
据此,他们得到风险比估计 \(10.73\),95% 置信区间 \([8.02,14.36]\)(公式见附录 A.3.2)。要把点估计解释掉,E-value 是
\[ 10.73+\sqrt{10.73\times(10.73-1)}=20.95; \]
要把置信下限解释掉,E-value 是
\[ 8.02+\sqrt{8.02\times(8.02-1)}=15.52. \]
原书图 17.1 画出:要把风险比的点估计与置信下限解释掉,两个混杂度量必须落在哪里。尤其是:要解释掉点估计,必须落在实线上方;要解释掉置信下限,必须落在虚线上方。3
下面这段简单 R 代码计算例 17.1 里的数字:
## e-value based on RR
evalue = function(rr) {
rr + sqrt(rr*(rr - 1))
}
p1 = 397/(397 + 78557)
p0 = 51/(51 + 108778)
rr = p1/p0
logrr = log(p1/p0)
se = sqrt(1/397 + 1/51 - 1/(397+78557) - 1/(51+108778))
upper = exp(logrr + 1.96*se)
lower = exp(logrr - 1.96*se)
rr # 10.73
lower # 8.02
evalue(rr) # 20.95
evalue(lower) # 15.5217.4 推广
17.4.1 E-value 与 Bradford Hill 的因果准则
E-value 提供因果的证据。可证据不是证明。E-value 越大,要把观测风险比解释掉,就需要更强的未测混杂,因果证据也就更硬;E-value 越小,较弱的未测混杂就够把观测风险比解释掉,证据也就更软。再配上 17.5.1 节的讨论:观测风险比越大,因果证据越强。这与布拉德福德·希尔爵士的第一条因果准则亲密相关:关联的强度(Bradford Hill, 1965)。定理 17.1 把他那份直觉量化成了数学。
在一篇著名论文里,Bradford Hill (1965) 提出九条准则,为「假定的原因与结局之间存在因果」提供证据。
定义 17.2 Bradford Hill 给出九条因果准则:
- 强度(strength);
- 一致性(consistency);
- 特异性(specificity);
- 时序(temporality);
- 生物学梯度(biological gradient);
- 合理性(plausibility);
- 连贯性(coherence);
- 实验(experiment);
- 类比(analogy)。
E-value 是替他的第一条准则做辩护的一种方式。也就是说:更强的关联往往给出更强的因果证据——因为要把更强的关联解释掉,需要更强的混杂度量。第二部分谈过随机化实验,那正好印证他的第八条。篇幅所限,其余准则的细节从略,鼓励读者去读 Bradford Hill (1965)。近年这篇论文作为 Bradford Hill (2020) 重印,并附有许多因果推断领军研究者有见地的评论。
17.4.2 逻辑回归之后的 E-value
结果是二值时,流行病学家常用逻辑回归,把结果 \(Y_i\) 对处理指示 \(Z_i\) 与协变量 \(X_i\) 建模:
\[ \operatorname{pr}(Y_i=1\mid Z_i,X_i) = \frac{e^{\beta_0+\beta_1 Z_i+\beta_2^\top X_i}} {1+e^{\beta_0+\beta_1 Z_i+\beta_2^\top X_i}}. \]
上面这个逻辑模型里,\(Z_i\) 的系数是给定协变量时、处理与结果的条件优势比的对数:
\[ \beta_1 = \log \frac{\operatorname{pr}(Y_i=1\mid Z_i=1,X_i=x)/\operatorname{pr}(Y_i=0\mid Z_i=1,X_i=x)} {\operatorname{pr}(Y_i=1\mid Z_i=0,X_i=x)/\operatorname{pr}(Y_i=0\mid Z_i=0,X_i=x)}. \]
重要的是:逻辑模型假定,这个优势比对所有协变量取值都相同。再者,若结果罕见,即 \(\operatorname{pr}(Y_i=1\mid Z_i=1,X_i=x)\) 与 \(\operatorname{pr}(Y_i=1\mid Z_i=0,X_i=x)\) 都接近 0,则条件优势比近似条件风险比(见命题 1.1(3)):
\[ \beta_1 \approx \log \frac{\operatorname{pr}(Y_i=1\mid Z_i=1,X_i=x)} {\operatorname{pr}(Y_i=1\mid Z_i=0,X_i=x)} = \log\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}. \]
于是,根据估计的逻辑回归系数及其置信限,可以立刻算出 E-value。这是 E-value 最主要的应用。
例 17.2 NCHS2003.txt 是美国国家卫生统计中心的出生证明数据。对我们有用的二值指示变量包括:
| 变量 | 含义 |
|---|---|
PTbirth |
早产 |
preeclampsia |
先兆子痫 |
ageabove35 |
母亲年龄 \(\ge 35\)(处理) |
somecollege |
是否上过大学 |
mar |
婚姻状况 |
smoking |
吸烟 |
drinking |
饮酒 |
hispanic |
母亲族裔 |
black |
母亲族裔 |
nativeamerican |
母亲族裔 |
asian |
母亲族裔 |
这版数据来自 Valeri and VanderWeele (2014)。本例聚焦结局 PTbirth;习题 17.5 聚焦先兆子痫(妊娠期的一种多系统高血压疾病)。下面的 R 代码在拟合逻辑回归之后计算 E-value。按这些 E-value:要把点估计解释掉,混杂度量的最大值必须大于 \(1.94\);要把置信下限解释掉,必须大于 \(1.91\)。虽不如 17.3 节那么强,在流行病学研究里,它们看起来已经相当大。
NCHS2003 = read.table("NCHS2003.txt", header = TRUE, sep = "\t")
## outcome: PTbirth
y_logit = glm(PTbirth ~ ageabove35 +
mar + smoking + drinking + somecollege +
hispanic + black + nativeamerican + asian,
data = NCHS2003,
family = binomial)
log_or = summary(y_logit)$coef[2, 1:2]
est = exp(log_or[1])
lower.ci = exp(log_or[1] - 1.96*log_or[2])
est # 1.306
evalue(est) # 1.938
lower.ci # 1.295
evalue(lower.ci) # 1.91217.4.3 真因果效应不为零
定理 17.1 假定处理对结果没有真正的因果效应。Ding and VanderWeele (2016) 证明了一条更一般的定理,允许真因果效应不为零。
定理 17.2 把 \(\mathrm{RR}_{UY\mid x}\) 的定义改成
\[ \mathrm{RR}_{UY\mid x} = \max_{z=0,1} \frac{\operatorname{pr}(Y=1\mid Z=z,U=1,X=x)} {\operatorname{pr}(Y=1\mid Z=z,U=0,X=x)}. \]
假定 (17.1)。则
\[ \mathrm{RR}^{\mathrm{true}}_{ZY\mid x} \ge \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x} \Big/ \frac{\mathrm{RR}_{ZU\mid x}\,\mathrm{RR}_{UY\mid x}} {\mathrm{RR}_{ZU\mid x}+\mathrm{RR}_{UY\mid x}-1}. \]
定理 17.1 是定理 17.2 在 \(\mathrm{RR}^{\mathrm{true}}_{ZY\mid x}=1\) 时的特例。证明见 Ding and VanderWeele (2016) 原文。
不加任何额外假定,定理 17.2 给出真风险比 \(\mathrm{RR}^{\mathrm{true}}_{ZY\mid x}\) 的一个下界,它依赖观测风险比 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\) 以及两个敏感性参数 \(\mathrm{RR}_{ZU\mid x}\)、\(\mathrm{RR}_{UY\mid x}\)。
当处理对结果看起来是保护性的,观测风险比小于 1。这时定理 17.1 与 17.2 不能直接用,必须把处理水平重新标记,按 \(1/\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\) 去算 E-value。
17.5 批评与回应
原论文发表之后,E-value 成了许多流行病学研究里会报告的一个标准数字。可它也引来批评(Ioannidis et al., 2019)。下面回顾 E-value 的几处局限。
17.5.1 E-value 不过是风险比的一个单调变换
从原书图 17.2 可以看到:风险比很大时,E-value
\[ \mathrm{RR}^{\mathrm{obs}}_{ZY\mid x} + \sqrt{\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}-1)} \]
几乎就是 \(2\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\),对风险比是线性的。风险比很小时,E-value 对 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}\) 更非线性。批评者常说:E-value 不过是风险比的点估计或置信限的一个单调变换,并不提供额外信息。
这话有一半对。的确,E-value 完全建立在风险比的点估计或置信限上。可它有一个基于定理 17.1 的、说得清的解释:要把观测风险比解释掉,两个混杂度量的最大值必须至少与 E-value 一样大。
17.5.2 E-value 的校准
E-value 等于:要把观测关联完全解释掉,混杂与处理的关联、混杂与结果的关联,两者最大值须达到的那个数。一个明显的问题是:这个混杂从根本上是潜在的。于是,某个 E-value 算大还是算小,并不容易决定。相关的另一个问题是:E-value 依赖我们控制了多少观测协变量 \(X\)——它量化的是给定 \(X\) 之后的残余混杂。因此,不同研究之间的 E-value 不能直接比较。E-value 提供因果证据,可这份证据必须结合所关心问题的背景知识,小心地评估。
下面这种「留一协变量」的做法,是校准 E-value 的一种直觉办法。有了 \(X=(X_1,\ldots,X_p)\),可以假装没看见分量 \(X_j\),再算给定其余观测协变量时 \(Z\)–\(X_j\) 与 \(X_j\)–\(Y\) 的风险比(\(j=1,\ldots,p\))。若我们相信未测的 \(U\) 并不比某些观测协变量更强,这些风险比就给出 \(U\) 带来的混杂度量的一个范围。可我并不知道这套做法有任何正式辩护。
17.5.3 它对二值结果与风险比最顺手
定理 17.1 对二值结果与风险比很顺手。Ding and VanderWeele (2016) 也为别的因果参数提过敏感性分析,包括二值结果的风险差、非负结果的均值比、生存结果的风险比(hazard ratio)。可它们都不如基于风险比、对二值结果的 E-value 那么干净。下一章会提出一种简单的、针对平均因果效应的敏感性分析,并能把第三部分的结果回归、IPW 与双重稳健估计量收成特例。
17.6 习题
17.1 定理 17.1 证明里的一条技术引理
证明:函数
\[ f(x)=\frac{ax+1}{bx+1} \]
在 \(a>b\) 时对 \(x\) 递增,在 \(a<b\) 时对 \(x\) 递减。
17.2 定理 17.1 的技术假定
回到定理 17.1 的证明。假定 \(Z\perp\!\!\!\perp Y\mid(X,U)\)。证明:若 \(\mathrm{RR}_{ZU\mid x}>1\) 但 \(\mathrm{RR}_{UY\mid x}<1\),则 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}<1\)。
注: 这个结果很直觉。条件于 \(X\):若 \(Z\)–\(U\) 关系为正、\(U\)–\(Y\) 关系为负,再给定 \(U\) 时 \(Z\) 与 \(Y\) 条件独立,则 \(Z\)–\(Y\) 关系为负。据此,若假定 \(\mathrm{RR}^{\mathrm{obs}}_{ZY\mid x}>1\) 且 \(\mathrm{RR}_{ZU\mid x}>1\),则 \(\mathrm{RR}_{UY\mid x}>1\) 必须成立。因此 (17.1) 的第三条其实是多余的。
17.3 引理 17.1
证明引理 17.1。
17.4 Schlesselman (1978) 的公式
为简单起见,这道题里把对 \(X\) 的条件隐含掉。考虑二值处理 \(Z\)、结果 \(Y\) 与未测混杂 \(U\)。假定处理对结果的风险比在 \(U=0\) 与 \(U=1\) 内相同:
\[ \mathrm{RR}_{ZY\mid U=0}=\mathrm{RR}_{ZY\mid U=1}, \]
混杂对结果的风险比在 \(Z=0\) 与 \(Z=1\) 内也相同:
\[ \mathrm{RR}_{UY\mid Z=0}=\mathrm{RR}_{UY\mid Z=1}, \]
记作 \(\gamma\)。证明
\[ \frac{\mathrm{RR}^{\mathrm{obs}}_{ZY}}{\mathrm{RR}^{\mathrm{true}}_{ZY}} = \frac{1+(\gamma-1)\operatorname{pr}(U=1\mid Z=1)} {1+(\gamma-1)\operatorname{pr}(U=1\mid Z=0)}. \]
注: 请先验证:若 \(\mathrm{RR}_{ZY\mid U=0}=\mathrm{RR}_{ZY\mid U=1}\),则 \(\mathrm{RR}^{\mathrm{true}}_{ZY}=\mathrm{RR}_{ZY\mid U=0}=\mathrm{RR}_{ZY\mid U=1}\)。这个恒等式说明风险比的可坍缩性(collapsibility)。流行病学里,风险比是可坍缩的关联度量。
Schlesselman (1978) 的公式并不假定 \(Z\perp\!\!\!\perp Y\mid U\),却假定 \(Z\)–\(Y\) 与 \(U\)–\(Y\) 风险比齐性。它是敏感性分析的一条经典公式,是一个恒等式,预先指定 \(\{\gamma,\operatorname{pr}(U=1\mid Z=1),\operatorname{pr}(U=1\mid Z=0)\}\) 之后很容易实施。可它比定理 17.1 牵涉更多敏感性参数。即便定理 17.1 只给出不等式,在更强假定下与 Schlesselman (1978) 的公式相比,它也并不松。有了定理 17.1,Schlesselman (1978) 的公式主要还有历史兴趣。
17.5 逻辑回归之后的 E-value:数据分析
数据与例 17.2 相同。请报告结局 preeclampsia 的 E-value。
17.6 风险差的 Cornfield 型不等式
考虑二值 \(Z,Y,U\),对 \(X\) 的条件隐含掉。假定给定 \(U\) 时有潜在可忽略性。证明:在 \(Z\perp\!\!\!\perp Y\mid U\) 下,
\[ \mathrm{rd}^{\mathrm{obs}}_{ZY}=\mathrm{rd}_{ZU}\times\mathrm{rd}_{UY}, \tag{17.3} \]
其中 \(\mathrm{rd}^{\mathrm{obs}}_{ZY}\) 是 \(Z\) 对 \(Y\) 的观测风险差,\(\mathrm{rd}_{ZU}\) 与 \(\mathrm{rd}_{UY}\) 分别是处理–混杂与混杂–结果的风险差(定义见第 1.2.2 节)。
注: 不失一般性,假定 \(\mathrm{rd}^{\mathrm{obs}}_{ZY}\)、\(\mathrm{rd}_{ZU}\)、\(\mathrm{rd}_{UY}\) 都为正。则 (17.3) 蕴含
\[ \min(\mathrm{rd}_{ZU},\mathrm{rd}_{UY})\ge\mathrm{rd}^{\mathrm{obs}}_{ZY} \]
以及
\[ \max(\mathrm{rd}_{ZU},\mathrm{rd}_{UY})\ge\sqrt{\mathrm{rd}^{\mathrm{obs}}_{ZY}}. \]
这就是二值混杂下、风险差的 Cornfield 不等式。它们说明:要把观测风险差 \(\mathrm{rd}^{\mathrm{obs}}_{ZY}\) 解释掉,处理–混杂与混杂–结果的风险差都必须大于 \(\mathrm{rd}^{\mathrm{obs}}_{ZY}\),且两者的最大值必须大于 \(\sqrt{\mathrm{rd}^{\mathrm{obs}}_{ZY}}\)。
Cornfield et al. (1959) 得到过 (17.3),却没有意识到它的分量。Gastwirth et al. (1998) 与 Poole (2010) 讨论过风险差的第一条 Cornfield 条件;Ding and VanderWeele (2014) 讨论过第二条。
Ding and VanderWeele (2014) 也推导了不假定 \(U\) 为二值的更一般结果。可惜,一般 \(U\) 的结果比上面二值 \(U\) 的更弱——\(U\) 的水平一多,不等式就会变松。这促使 Ding and VanderWeele (2016) 把目光转到风险比的 Cornfield 不等式:它们不会随 \(U\) 的水平增多而变差。
17.7 推荐阅读
Ding and VanderWeele (2016) 推广并统一了 Cornfield 型敏感性分析,是 E-value 这个概念的理论基础。
他们原先的分析基于病例–对照研究,估的是吸烟对肺癌的优势比。可肺癌是罕见结局,风险比与优势比接近;见命题 1.1。↩︎
信息论里,互信息 \[ I(A,B)=\iint p(a,b)\log_2\frac{p(a,b)}{p(a)p(b)}\,da\,db \] 度量两个随机变量 \(A\) 与 \(B\) 的相依,其中 \(p(\cdot)\) 表示 \((A,B)\) 的联合或边际密度。数据处理不等式是一条著名结果:若 \(Z\perp\!\!\!\perp Y\mid U\),则 \(I(Z,Y)\le I(Z,U)\) 且 \(I(Z,Y)\le I(U,Y)\)。Lihua Lei 与 Bin Yu 都向我指出过 Cornfield 不等式与数据处理不等式的联系。↩︎
用一点简单代数可知,实线与虚线都是双曲线。↩︎