第 15 章 观察性研究中的匹配

匹配在经验研究里历史很长。W. Cochran 与 D. Rubin 把它带进了统计因果推断。Cochran and Rubin (1973) 是一篇早期综述;Rubin (2006b) 汇集了 Rubin 在这个题目上的贡献。这一章也会谈到 Abadie and Imbens (2006, 2008, 2011) 的现代工作:他们用渐近分析,把匹配估计量说严谨。第 7 章的配对实验,在观察性研究这边有一个几乎同名的亲戚——下面就从最干净的情形说起。

15.1 一个简单起点:对照远多于处理

原书图 15.1 画出处理–对照观察性研究里匹配的基本想法。先看一个简单情形:对照人数 \(n_0\) 远大于处理人数 \(n_1\)。对处理组里的单元 \(i=1,\ldots,n_1\),在对照组里找一个 \(m(i)\),使 \(X_i=X_{m(i)}\)。理想情形下,匹配是精确的。于是一对之内倾向得分相同:\(e(X_i)=e(X_{m(i)})\)。因而,条件于「一人接受处理、一人接受对照」,以及这对人的协变量,

\[ \operatorname{pr}\bigl(Z_i=1,\,Z_{m(i)}=0\mid Z_i+Z_{m(i)}=1,\,X_i,X_{m(i)}\bigr) = 1/2, \]

由对称性立刻得到。1 也就是说:再条件于协变量、以及每一对里恰有一个处理与一个对照,处理分配与 MPE 相同。精确匹配的观察性研究,就可以当作一次 MPE 来分析——用第 7 章的 FRT,或 Neyman 那一套。得到的,是处理组上因果效应的推断。

也可以给每个处理单元配上多个对照。一般地,处理单元 \(i\)\(M_i\) 个对照。若各 \(M_i\) 可以不同,就叫可变比例匹配(variable-ratio matching; Ming and Rosenbaum, 2000, 2001; Pimentel et al., 2015)。匹配一旦精确,处理分配机制就与第 7.7 节的一般匹配实验相同。那一节的分析,可以直接搬过来。

Rosenbaum (2002b) 倡导过上面这套策略。可多数观察性研究里,并非所有单元都满足 \(X_i=X_{m(i)}\)。上面那套给 FRT 的理由,也就站不住。最近,Guo and Rothenhäusler (2022) 报告了不精确匹配对 FRT 的负面结果。这是一声警告。

15.2 更复杂、也更真实的情形

即便对照组很大,精确匹配也常常做不到。我们能做到的,是 \(X_i\approx X_{m(i)}\),或在某种距离下 \(X_i-X_{m(i)}\) 很小。于是只有近似匹配。例如定义

\[ m(i)=\arg\min_{k:Z_k=0}\,d(X_i,X_k), \]

其中 \(d(X_i,X_k)\) 度量 \(X_i\)\(X_k\) 的距离。典范选择包括欧氏距离

\[ d(X_i,X_k)=(X_i-X_k)^\top(X_i-X_k), \]

以及 Mahalanobis 距离

\[ d(X_i,X_k)=(X_i-X_k)^\top\Omega^{-1}(X_i-X_k), \]

\(\Omega\) 是全体、或只在对照组里,\(X_i\) 的样本协方差阵。

下面复习匹配里几件细而绕的事。综述见 Stuart (2010)。

  1. 一对一或一对 \(M\) 上面聚焦一对一;也可以推广到一对 \(M\)
  2. 有放回还是无放回。 我聚焦有放回匹配;有些实践者更喜欢无放回。对照池子够大时,两者最终结果往往差不太多。有放回计算更方便,匹配质量通常也更高,可同一个对照会被用多次,从而引入相依。无放回的好处是匹配单元彼此独立,后续分析更简单;代价是计算上要做更重的离散优化。
  3. 对内仍有残余协变量失衡。 分析时用协变量调整,因此很要紧。这时调整不只是为了换效率,也是为了校正偏倚。
  4. \(X\)「维度高」。 对处理组里某些 \(i\),可能对对照组里所有人选,\(d(X_i,X_k)\) 都太大。这时也许只能丢掉那些难匹配的人。这样一来,我们实际上换了关心的研究总体。
  5. 上面这个问题很难躲开。 例如,若 \(X_i\sim\mathcal{N}(0,I_p)\)\(X_k\sim\mathcal{N}(0,I_p)\)\(X_i\perp\!\!\!\perp X_k\),则

\[ (X_i-X_k)^\top(X_i-X_k)\sim 2\chi^2_p, \]

均值 \(2p\)、方差 \(8p\)(见附录 A.1.3)。理论表明:\(p\) 一大,不完美匹配会给因果效应估计带来很大偏倚。于是 \(p\) 大时,匹配前必须先降维。Rosenbaum and Rubin (1983b) 提议按倾向得分匹配。有了估计倾向得分,就找 \(\lvert\hat e(X_i)-\hat e(X_{m(i)})\rvert\)\(\lvert\operatorname{logit}\{\hat e(X_i)\}-\operatorname{logit}\{\hat e(X_{m(i)})\}\rvert\) 很小的对 \(\{i,m(i)\}\)2 匹配问题收成了一维。

15.3 平均因果效应的匹配估计量

在一系列论文里,Abadie and Imbens(以下简称 AI)严格刻画了匹配估计量的渐近性质,并为平均因果效应给出了相应的大样本置信区间。他们采用观察性研究的标准设定:

\[ \{X_i,Z_i,Y_i(1),Y_i(0)\}_{i=1}^{n} \ \stackrel{\mathrm{IID}}{\sim}\ \{X,Z,Y(1),Y(0)\}. \]

15.3.1 点估计与偏倚校正

AI 聚焦有放回的一对 \(M\) 匹配。对处理单元 \(i\),处理下的潜在结果直接填成 \(\hat Y_i(1)=Y_i\),对照下则填成

\[ \hat Y_i(0)=M^{-1}\sum_{k\in\mathcal{J}_i}Y_k, \]

其中 \(\mathcal{J}_i\) 是为单元 \(i\) 从对照组配来的集合。例如,对对照组里所有 \(k\) 计算 \(d(X_i,X_k)\),再把距离最小的 \(M\)\(k\) 的下标收进 \(\mathcal{J}_i\)

对对照单元 \(i\),对照下的潜在结果直接填成 \(\hat Y_i(0)=Y_i\),处理下则填成

\[ \hat Y_i(1)=M^{-1}\sum_{k\in\mathcal{J}_i}Y_k, \]

其中 \(\mathcal{J}_i\) 是为单元 \(i\) 从处理组配来的集合。

匹配估计量是

\[ \hat\tau^{\mathrm{m}} = n^{-1}\sum_{i=1}^{n}\bigl\{\hat Y_i(1)-\hat Y_i(0)\bigr\}. \]

AI 证明:\(\hat\tau^{\mathrm{m}}\) 有不可忽略的偏倚——尤其当 \(X\) 是多维的、且对照人数与处理人数相当时。经过一些技术推导,他们提出如下偏倚估计:

\[ \hat B=n^{-1}\sum_{i=1}^{n}\hat B_i, \]

其中

\[ \hat B_i = (2Z_i-1)\,M^{-1}\sum_{k\in\mathcal{J}_i} \bigl\{\hat\mu_{1-Z_i}(X_i)-\hat\mu_{1-Z_i}(X_k)\bigr\}, \]

\(\{\hat\mu_1(X_i),\hat\mu_0(X_i)\}\) 是预测结果,例如来自 OLS。对处理单元 \(Z_i=1\),估计偏倚是

\[ \hat B_i = M^{-1}\sum_{k\in\mathcal{J}_i}\bigl\{\hat\mu_0(X_i)-\hat\mu_0(X_k)\bigr\}, \]

用来校正因协变量不匹配而造成的、对照潜在结果预测值的差距;对对照单元 \(Z_i=0\),估计偏倚是

\[ \hat B_i = -M^{-1}\sum_{k\in\mathcal{J}_i}\bigl\{\hat\mu_1(X_i)-\hat\mu_1(X_k)\bigr\}, \]

用来校正处理潜在结果预测值的差距。

最终的偏倚校正匹配估计量

\[ \hat\tau^{\mathrm{mbc}}=\hat\tau^{\mathrm{m}}-\hat B, \]

并有如下线性展开。

命题 15.1 我们有

\[ \hat\tau^{\mathrm{mbc}}=n^{-1}\sum_{i=1}^{n}\hat\psi_i, \tag{15.1} \]

其中

\[ \hat\psi_i = \hat\mu_1(X_i)-\hat\mu_0(X_i) + (2Z_i-1)\bigl(1+K_i/M\bigr)\bigl\{Y_i-\hat\mu_{Z_i}(X_i)\bigr\}, \]

\(K_i\) 是单元 \(i\) 被用作匹配对象的次数。

命题 15.1 的线性展开来自简单却繁琐的代数。证明留给习题 15.1。它立刻提示一个简单方差估计:把 \(\hat\tau^{\mathrm{mbc}}\) 看成 \(\hat\psi_i\) 的样本均值,

\[ \hat V^{\mathrm{mbc}} = \frac{1}{n^2}\sum_{i=1}^{n}\bigl(\hat\psi_i-\hat\tau^{\mathrm{mbc}}\bigr)^2. \]

Abadie and Imbens (2008) 首先证明:对原始数据做简单自助,并不能用来估匹配估计量的方差;可他们提议的方差手续又不太好实施。Otsu and Rai (2017) 提议对线性展开里的 \(\hat\psi_i\) 做自助。不过,Otsu and Rai (2017) 的自助本质上给出的就是 \(\hat V^{\mathrm{mbc}}\),而它计算起来很简单。

15.3.2 与双重稳健估计量的联系

偏倚校正匹配估计量与双重稳健估计量很近。两者都等于结果回归估计量,再按残差做一些修改:

\[ \hat R_i = \begin{cases} Y_i-\hat\mu_1(X_i), & Z_i=1,\\ Y_i-\hat\mu_0(X_i), & Z_i=0. \end{cases} \]

对平均因果效应 \(\tau\),回想结果回归估计量

\[ \hat\tau^{\mathrm{reg}}=n^{-1}\sum_{i=1}^{n}\bigl\{\hat\mu_1(X_i)-\hat\mu_0(X_i)\bigr\} \]

与双重稳健估计量

\[ \hat\tau^{\mathrm{dr}} = \hat\tau^{\mathrm{reg}} + n^{-1}\sum_{i=1}^{n} \left\{ \frac{Z_i\hat R_i}{\hat e(X_i)} - \frac{(1-Z_i)\hat R_i}{1-\hat e(X_i)} \right\}. \]

还可以验证:\(\hat\tau^{\mathrm{mbc}}\) 的形式与 \(\hat\tau^{\mathrm{dr}}\) 相似。

命题 15.2 \(\tau\) 的偏倚校正匹配估计量等于

\[ \hat\tau^{\mathrm{mbc}} = \hat\tau^{\mathrm{reg}} + n^{-1}\sum_{i=1}^{n} \left\{ \left(1+\frac{K_i}{M}\right)Z_i\hat R_i - \left(1+\frac{K_i}{M}\right)(1-Z_i)\hat R_i \right\}. \]

证明留给习题 15.2。由命题 15.2,可以把匹配看成估倾向得分的一种非参数方法,把得到的偏倚校正匹配估计量看成一种双重稳健估计量。例如,\(1+K_i/M\) 应当接近 \(1/\hat e(X_i)\)。处理单元的 \(e(X_i)\) 很小时,基于估计倾向得分的权重 \(1/\hat e(X_i)\) 会很大;与此同时,它会被许多对照单元拿去匹配,于是 \(K_i\) 大,\(1+K_i/M\) 也大。

可这份联系也给匹配提出一个明显的问题。\(M\) 固定时,用 \(1+K_i/M\) 去估 \(1/e(X_i)\),会非常吵。让 \(M\) 随样本量长大,很可能改善这份基于匹配的非参数倾向得分估计,从而改善匹配与偏倚校正匹配估计量的渐近性质。Lin et al. (2023) 给出了正式理论:一旦让 \(M\) 以合适的速率长大,偏倚校正匹配估计量 \(\hat\tau^{\mathrm{mbc}}\) 就能得到与双重稳健估计量相近的性质。

15.4 处理组上平均因果效应的匹配估计量

对处理组上的平均因果效应

\[ \tau_{\mathrm{T}}=\mathrm{E}(Y\mid Z=1)-\mathrm{E}\{Y(0)\mid Z=1\}, \]

只需给所有处理单元填补缺失的对照潜在结果,得到

\[ \hat\tau_{\mathrm{T}}^{\mathrm{m}} = n_1^{-1}\sum_{i=1}^{n}Z_i\bigl\{Y_i-\hat Y_i(0)\bigr\}. \]

\(X\) 多维时,它同样有偏。Otsu and Rai (2017) 提议用

\[ \hat B_{\mathrm{T}} = n_1^{-1}\sum_{i=1}^{n}Z_i\hat B_{\mathrm{T},i} \]

去估它的偏倚,其中

\[ \hat B_{\mathrm{T},i} = M^{-1}\sum_{k\in\mathcal{J}_i}\bigl\{\hat\mu_0(X_i)-\hat\mu_0(X_k)\bigr\} \]

校正处理单元(\(Z_i=1\))因协变量不匹配造成的偏倚。

最终的偏倚校正估计量是

\[ \hat\tau_{\mathrm{T}}^{\mathrm{mbc}}=\hat\tau_{\mathrm{T}}^{\mathrm{m}}-\hat B_{\mathrm{T}}, \]

并有如下线性展开。

命题 15.3 我们有

\[ \hat\tau_{\mathrm{T}}^{\mathrm{mbc}} = n_1^{-1}\sum_{i=1}^{n}\hat\psi_{\mathrm{T},i}, \tag{15.2} \]

其中

\[ \hat\psi_{\mathrm{T},i} = Z_i\bigl\{Y_i-\hat\mu_0(X_i)\bigr\} - (1-Z_i)\frac{K_i}{M}\bigl\{Y_i-\hat\mu_0(X_i)\bigr\}. \]

证明留给习题 15.1。受 Otsu and Rai (2017) 启发,可以把 \(\hat\tau_{\mathrm{T}}^{\mathrm{mbc}}\) 看成 \(n/n_1\) 乘以 \(\hat\psi_{\mathrm{T},i}\) 的样本均值,于是一个直觉的方差估计是

\[ \hat V_{\mathrm{T}}^{\mathrm{mbc}} = \left(\frac{n}{n_1}\right)^2 \frac{1}{n^2} \sum_{i=1}^{n} \bigl(\hat\psi_{\mathrm{T},i}-\hat\tau_{\mathrm{T}}^{\mathrm{mbc}}\,n_1/n\bigr)^2 = \frac{1}{n_1^2} \sum_{i=1}^{n} \bigl(\hat\psi_{\mathrm{T},i}-\hat\tau_{\mathrm{T}}^{\mathrm{mbc}}\,n_1/n\bigr)^2. \]

与 15.3.2 节平行,也可以把双重稳健、偏倚校正匹配与结果回归放在一起看。对 \(\tau_{\mathrm{T}}\),回想结果回归估计量

\[ \hat\tau_{\mathrm{T}}^{\mathrm{reg}} = n_1^{-1}\sum_{i=1}^{n}Z_i\bigl\{Y_i-\hat\mu_0(X_i)\bigr\} \]

与双重稳健估计量

\[ \hat\tau_{\mathrm{T}}^{\mathrm{dr}} = \hat\tau_{\mathrm{T}}^{\mathrm{reg}} - n_1^{-1}\sum_{i=1}^{n} \frac{\hat e(X_i)}{1-\hat e(X_i)}(1-Z_i)\hat R_i. \]

还可以验证:\(\hat\tau_{\mathrm{T}}^{\mathrm{mbc}}\) 的形式与 \(\hat\tau_{\mathrm{T}}^{\mathrm{dr}}\) 相似。

命题 15.4 \(\tau_{\mathrm{T}}\) 的偏倚校正匹配估计量等于

\[ \hat\tau_{\mathrm{T}}^{\mathrm{mbc}} = \hat\tau_{\mathrm{T}}^{\mathrm{reg}} - n_1^{-1}\sum_{i=1}^{n}\frac{K_i}{M}(1-Z_i)\hat R_i. \]

证明留给习题 15.3。命题 15.4 提示:匹配本质上是用 \(K_i/M\) 去估给定协变量时处理的优势。

15.5 一个案例

15.5.1 实验数据

现在用 Sekhon (2011) 的 Matching 包,回到 LaLonde 数据。这个包我们用过多次,为的是数据集 lalonde;现在要用它的关键函数 Match。实验这一侧给出:

library("car")
library("Matching")

## Chapter 15.5.1 experimental data
data("lalonde")
y = lalonde$re78
z = lalonde$treat
x = as.matrix(lalonde[, c("age", "educ", "black",
                          "hisp", "married", "nodegr",
                          "re74", "re75")])

## analyze the randomized experiment
neymanols = lm(y ~ z)
fisherols = lm(y ~ z + x)
xc = scale(x)
linols = lm(y ~ z*xc)
resols = c(neymanols$coef[2],
           fisherols$coef[2],
           linols$coef[2],
           sqrt(hccm(neymanols, type = "hc2")[2, 2]),
           sqrt(hccm(fisherols, type = "hc2")[2, 2]),
           sqrt(hccm(linols, type = "hc2")[2, 2]))
resols = matrix(resols, 3, 2)
rownames(resols) = c("neyman", "fisher", "lin")
colnames(resols) = c("est", "se")
resols
est se
neyman \(1794.3\) \(671.0\)
fisher \(1676.3\) \(677.0\)
lin \(1621.6\) \(694.7\)

三种回归估计都显示:就业培训项目有正向显著效应。也可以把实验数据当作观察性研究,做一对一匹配:

matchest.adj = Match(Y = y, Tr = z, X = x, BiasAdjust = TRUE)
summary(matchest.adj)
Estimate \(2119.7\)
AI SE \(876.4\)
\(T\)-stat \(2.42\)
\(p\)-val \(0.016\)
原始样本量(处理) \(445\)\(185\)
匹配后样本量(不加权) \(185\)\(268\)

点估计与标准误都变大了,可定性结论不变。

15.5.2 观察性数据

再看这套数据的观察性对应物:

dat <- read.table("cps1re74.csv", header = TRUE)
dat$u74 <- as.numeric(dat$re74 == 0)
dat$u75 <- as.numeric(dat$re75 == 0)
y = dat$re78
z = dat$treat
x = as.matrix(dat[, c("age", "educ", "black",
                      "hispan", "married", "nodegree",
                      "re74", "re75", "u74", "u75")])

若只用简单 OLS,结果离实验这块「金标准」很远,而且对回归设定很敏感:

est se
neyman \(-8506.5\) \(583.4\)
fisher \(1067.5\) \(628.4\)
lin \(-4265.8\) \(3211.8\)

可若做一对一匹配,结果几乎找回实验那一侧:

matchest = Match(Y = y, Tr = z, X = x, BiasAdjust = TRUE)
summary(matchest)
Estimate \(1747.8\)
AI SE \(916.6\)
\(T\)-stat \(1.91\)
\(p\)-val \(0.057\)
原始样本量(处理) \(16177\)\(185\)
匹配后样本量(不加权) \(185\)\(248\)

忽略匹配数据里的结,也可以做配对分析,结果同样靠近实验:

diff = y[matchest$index.treated] - y[matchest$index.control]
round(summary(lm(diff ~ 1))$coef[1, ], 2)

diff.x = x[matchest$index.treated, ] - x[matchest$index.control, ]
round(summary(lm(diff ~ diff.x))$coef[1, ], 2)
Estimate Std. Error \(t\) \(p\)
diff ~ 1 \(1581.4\) \(558.6\) \(2.83\) \(0.01\)
diff ~ diff.x \(1842.1\) \(578.4\) \(3.18\) \(0.00\)

15.5.3 协变量平衡检查

还可以用简单 OLS 检查协变量平衡。匹配前,协变量高度失衡——许多系数带着星星:

lm.before = lm(z ~ x)
summary(lm.before)
Estimate \(t\) \(p\)
age \(-4.0\times 10^{-4}\) \(-4.75\) \(<0.001\)
educ \(3.2\times 10^{-4}\) \(0.79\) \(0.43\)
black \(0.107\) \(36.9\) \(<0.001\)
hispan \(0.0064\) \(2.06\) \(0.040\)
married \(-0.015\) \(-7.54\) \(<0.001\)
nodegree \(0.013\) \(5.33\) \(<0.001\)
re74 \(7.6\times 10^{-7}\) \(4.21\) \(<0.001\)
re75 \(-1.2\times 10^{-7}\) \(-0.67\) \(0.50\)
u74 \(0.042\) \(12.9\) \(<0.001\)
u75 \(0.024\) \(7.13\) \(<0.001\)

匹配之后,协变量平衡得很好——协变量系数上的星星都不见了:

lm.after = lm(z ~ x,
              subset = c(matchest$index.treated,
                         matchest$index.control))
summary(lm.after)
Estimate \(t\) \(p\)
age \(0.0032\) \(0.93\) \(0.35\)
educ \(-0.015\) \(-0.92\) \(0.36\)
black \(6.1\times 10^{-5}\) \(0.00\) \(1.00\)
hispan \(0.014\) \(0.12\) \(0.91\)
married \(-0.013\) \(-0.20\) \(0.84\)
nodegree \(-0.030\) \(-0.42\) \(0.67\)
re74 \(6.8\times 10^{-6}\) \(0.69\) \(0.49\)
re75 \(-9.8\times 10^{-6}\) \(-0.77\) \(0.44\)
u74 \(0.022\) \(0.21\) \(0.83\)
u75 \(-0.026\) \(-0.32\) \(0.75\)

(匹配后只有截距仍显著;原书完整回归表见原文。)

15.6 讨论

协变量一多,按原始协变量匹配就会撞上维数灾难。Rosenbaum and Rubin (1983b) 建议按估计倾向得分来匹配。Abadie and Imbens (2016) 给这套策略提供了正式理论。

15.7 习题

15.1 偏倚校正估计量的线性展开
证明命题 15.1 与 15.3。

15.2 \(\tau\) 的偏倚校正匹配估计量的双重稳健形式
证明命题 15.2。

15.3 \(\tau_{\mathrm{T}}\) 的偏倚校正匹配估计量的双重稳健形式
证明命题 15.4。

15.4 回到例 10.3
用匹配估计量分析例 10.3 的数据,并与前面的结果比较。请检查匹配前后的协变量平衡。也可以给匹配估计量换不同的匹配个数。甚至可以把各种估计量用到匹配后的数据上。你的结果对选择敏感吗?

15.5 回到第 15.5 节
第 15.5 节用匹配分析了 LaLonde 观察性研究。匹配表现很好:它给出的估计靠近实验这块金标准。请用结果回归、倾向得分分层、两种 IPW,以及双重稳健估计量重新分析,并与匹配估计量、以及实验金标准比较。

请注意你有许多选择。例如分层的层数,以及按估计倾向得分修剪数据的阈值。也可以拟合不同的倾向得分与结果模型,比如在基本协变量上再加一些二次项。甚至可以把这些估计量用到匹配后的数据上。

这是一套经典数据,用过它的论文数以百计。可以读一些参考文献(Dehejia and Wahba, 1999; Hainmueller, 2012),分析时也可以更有创意一点。

15.6 数据再分析
Ho et al. (2007) 是政治学里很有影响的一篇论文,作者据此做了 R 包 MatchIt(Ho et al., 2011)。Ho et al. (2007) 分析了两套数据,都可以从哈佛 Dataverse 拿到。

请用到目前为止讨论过的方法,重新分析这两套数据。也可以试别的方法,只要你能讲清理由。

15.7 推荐阅读
匹配估计量的文献非常庞大。三篇优秀的综述是 Sekhon (2009)、Stuart (2010) 与 Imbens (2015)。


第四部分 观察性研究的困难与挑战


  1. 严格写法是 \[ \begin{aligned} &\operatorname{pr}\bigl(Z_i=1,\,Z_{m(i)}=0\mid Z_i+Z_{m(i)}=1,\,X_i,X_{m(i)}\bigr)\\ &= \frac{ \operatorname{pr}(Z_i=1,Z_{m(i)}=0\mid X_i,X_{m(i)}) }{ \operatorname{pr}(Z_i=1,Z_{m(i)}=0\mid X_i,X_{m(i)}) + \operatorname{pr}(Z_i=0,Z_{m(i)}=1\mid X_i,X_{m(i)}) }\\ &= \frac{e(X_i)\{1-e(X_{m(i)})\}} {e(X_i)\{1-e(X_{m(i)})\}+\{1-e(X_i)\}e(X_{m(i)})} = \frac12, \end{aligned} \] 最后一步用了 \(X_i=X_{m(i)}\),从而 \(e(X_i)=e(X_{m(i)})\)↩︎

  2. \(\operatorname{logit}(w)=\log\{w/(1-w)\}\)。logit 把 \([0,1]\) 映到 \((-\infty,\infty)\)↩︎