附录 C 有限总体简单随机抽样的若干引理

C.1 引理

简单随机抽样是标准抽样调查教材里的基本题目(例如 Cochran, 1953)。下面复习几条结果,它们对第 3、4 章 CRE 里基于设计的推断有用。我用入样指示的分布来定义简单随机抽样。

定义 C.1(简单随机抽样) 容量为 \(n_1\)简单随机样本(simple random sample),是从 \(n\) 个单元的有限总体里抽出的一个子集,单元用 \(i=1,\ldots,n\) 编号。令 \(Z=(Z_1,\ldots,Z_n)\) 为这 \(n\) 个单元的入样指示(inclusion indicators):单元 \(i\) 被抽中则 \(Z_i=1\),否则 \(Z_i=0\)。向量 \(Z\) 可以取 \(\binom{n}{n_1}\) 种由 \(n_1\)\(1\)\(n_0\)\(0\) 排成的排列,每种概率相同。

由定义 C.1,简单随机抽样是无放回抽样(sampling without replacement)的一种特例:它不允许把同一个单元抽两次。引理 C.1 汇总入样指示的前两阶矩。

引理 C.1 在简单随机抽样下,

\[ \mathrm{E}(Z_i)=\frac{n_1}{n}, \qquad \operatorname{var}(Z_i)=\frac{n_1 n_0}{n^2}, \qquad \operatorname{cov}(Z_i,Z_j)=-\frac{n_1 n_0}{n^2(n-1)}. \]

写得更紧凑一些:

\[ \mathrm{E}(Z)=\frac{n_1}{n}\mathbf{1}_n, \qquad \operatorname{cov}(Z)=\frac{n_1 n_0}{n(n-1)}\mathbf{P}_n, \]

其中 \(\mathbf{1}_n\)\(n\) 维全 \(1\) 向量,\(\mathbf{P}_n=I_n-n^{-1}\mathbf{1}_n\mathbf{1}_n^{\mathrm{T}}\) 是正交于 \(\mathbf{1}_n\)\(n\times n\) 投影矩阵。

\(\{c_1,\ldots,c_n\}\) 为一个有限总体,均值 \(\bar c=\sum_{i=1}^{n}c_i/n\),方差

\[ S_c^2=(n-1)^{-1}\sum_{i=1}^{n}(c_i-\bar c)^2; \]

再令 \(\{d_1,\ldots,d_n\}\) 为另一个有限总体,均值 \(\bar d=\sum_{i=1}^{n}d_i/n\),方差

\[ S_d^2=(n-1)^{-1}\sum_{i=1}^{n}(d_i-\bar d)^2; \]

它们的协方差是

\[ S_{cd}=(n-1)^{-1}\sum_{i=1}^{n}(c_i-\bar c)(d_i-\bar d). \]

在简单随机抽样下,样本均值是

\[ \hat{\bar c}=n_1^{-1}\sum_{i=1}^{n}Z_ic_i, \qquad \hat{\bar d}=n_1^{-1}\sum_{i=1}^{n}Z_id_i; \]

样本方差是

\[ \hat S_c^2=(n_1-1)^{-1}\sum_{i=1}^{n}Z_i(c_i-\hat{\bar c})^2, \qquad \hat S_d^2=(n_1-1)^{-1}\sum_{i=1}^{n}Z_i(d_i-\hat{\bar d})^2; \]

样本协方差是

\[ \hat S_{cd}=(n_1-1)^{-1}\sum_{i=1}^{n}Z_i(c_i-\hat{\bar c})(d_i-\hat{\bar d}). \]

引理 C.2 给出样本均值 \(\hat{\bar c}\)\(\hat{\bar d}\) 的矩。

引理 C.2 在简单随机抽样下,样本均值对总体均值无偏:

\[ \mathrm{E}(\hat{\bar c})=\bar c, \qquad \mathrm{E}(\hat{\bar d})=\bar d. \]

它们的方差与协方差是

\[ \operatorname{var}(\hat{\bar c})=\frac{n_0}{nn_1}S_c^2, \qquad \operatorname{var}(\hat{\bar d})=\frac{n_0}{nn_1}S_d^2, \qquad \operatorname{cov}(\hat{\bar c},\hat{\bar d})=\frac{n_0}{nn_1}S_{cd}. \]

引理 C.2 的方差公式里,系数 \(n_0/(nn_1)=1/n_1\times(1-n_1/n)\) 与 IID 抽样下的 \(1/n_1\) 不同。多出来的那一项 \(1-n_1/n=n_0/n\),叫做有限总体校正因子(finite population correction factor)。

引理 C.3 给出样本方差与协方差对总体版本的无偏性。

引理 C.3 在简单随机抽样下,样本方差与协方差对它们的总体版本无偏:

\[ \mathrm{E}(\hat S_c^2)=S_c^2, \qquad \mathrm{E}(\hat S_d^2)=S_d^2, \qquad \mathrm{E}(\hat S_{cd})=S_{cd}. \]

一个要紧的实践问题是:基于简单随机样本,怎样推断 \(\bar c\)。这需要对它的无偏估计 \(\hat{\bar c}\) 的分布有更精确的刻画。\(\hat{\bar c}\) 的有限样本精确分布依赖整个有限总体 \(\{c_1,\ldots,c_n\}\),而总体是未知的。下面的有限总体 CLT,用它的前两阶矩来刻画 \(\hat{\bar c}\) 的渐近分布。

引理 C.4(有限总体 CLT) 在简单随机抽样下,当 \(n\to\infty\) 时,若

\[ \frac{\max_{1\le i\le n}(c_i-\bar c)^2}{\min(n_1,n_0)S_c^2}\to 0, \]

\[ \frac{\hat{\bar c}-\bar c}{\sqrt{\dfrac{n_0}{nn_1}S_c^2}} \to\mathrm{N}(0,1) \]

依分布,并且 \(\hat S_c^2/S_c^2\) 依概率收敛到 \(1\)

引理 C.4 给 \(\bar c\) 的 Wald 型 \(1-\alpha\) 置信区间提供了理由:

\[ \hat{\bar c} \pm z_{1-\alpha/2} \sqrt{\frac{n_0}{nn_1}\hat S_c^2}, \]

其中 \(z_{1-\alpha/2}\) 是标准正态随机变量的 \(1-\alpha/2\) 上分位数。

C.2 证明

引理 C.1 的证明 由对称性,各 \(Z_i\) 有相同的均值,于是

\[ n_1=\sum_{i=1}^{n}Z_i=\mathrm{E}\!\left(\sum_{i=1}^{n}Z_i\right)=n\mathrm{E}(Z_i) \implies \mathrm{E}(Z_i)=n_1/n. \]

因为 \(Z_i\) 是 Bernoulli 随机变量,它的方差是

\[ \operatorname{var}(Z_i)=\frac{n_1}{n}\left(1-\frac{n_1}{n}\right)=\frac{n_1 n_0}{n^2}. \]

再由对称性,各 \(Z_i\) 有相同的方差,各对 \((Z_i,Z_j)\) 有相同的协方差,于是

\[ 0=\operatorname{var}\!\left(\sum_{i=1}^{n}Z_i\right)=n\operatorname{var}(Z_i)+n(n-1)\operatorname{cov}(Z_i,Z_j), \]

从而

\[ \operatorname{cov}(Z_i,Z_j)=-\frac{n_1 n_0}{n^2(n-1)}\qquad(i\ne j). \]

\(\square\)

引理 C.2 的证明 样本均值的无偏性来自线性性。例如,

\[ \mathrm{E}(\hat{\bar c}) = \mathrm{E}\!\left(\frac{1}{n_1}\sum_{i=1}^{n}Z_ic_i\right) = \frac{1}{n_1}\sum_{i=1}^{n}\mathrm{E}(Z_i)c_i =\bar c. \]

样本均值的协方差是

\[\begin{align*} \operatorname{cov}(\hat{\bar c},\hat{\bar d}) &= \operatorname{cov}\!\left\{ \frac{1}{n_1}\sum_{i=1}^{n}Z_i(c_i-\bar c),\; \frac{1}{n_1}\sum_{i=1}^{n}Z_i(d_i-\bar d) \right\} \\ &= \frac{1}{n_1^2} \Biggl[ \sum_{i=1}^{n}\operatorname{var}(Z_i)(c_i-\bar c)(d_i-\bar d) + \sum_{i\ne j}\operatorname{cov}(Z_i,Z_j)(c_i-\bar c)(d_j-\bar d) \Biggr] \\ &= \frac{1}{n_1^2} \Biggl[ \frac{n_1 n_0}{n^2}\sum_{i=1}^{n}(c_i-\bar c)(d_i-\bar d) - \frac{n_1 n_0}{n^2(n-1)}\sum_{i\ne j}(c_i-\bar c)(d_j-\bar d) \Biggr]. \end{align*}\]

因为

\[ 0=\sum_{i=1}^{n}(c_i-\bar c)\sum_{i=1}^{n}(d_i-\bar d) =\sum_{i=1}^{n}(c_i-\bar c)(d_i-\bar d) +\sum_{i\ne j}(c_i-\bar c)(d_j-\bar d), \]

样本均值的协方差收成

\[\begin{align*} \operatorname{cov}(\hat{\bar c},\hat{\bar d}) &= \frac{1}{n_1^2} \Biggl[ \frac{n_1 n_0}{n^2}\sum_{i=1}^{n}(c_i-\bar c)(d_i-\bar d) + \frac{n_1 n_0}{n^2(n-1)}\sum_{i=1}^{n}(c_i-\bar c)(d_i-\bar d) \Biggr] \\ &= \frac{n_0}{nn_1}S_{cd}. \end{align*}\]

方差公式只是 \(\hat{\bar c}=\hat{\bar d}\) 的特例。

\(\square\)

引理 C.3 的证明 我们只证明样本协方差那一项,因为样本方差的公式是特例。有下面的分解:

\[\begin{align*} (n_1-1)\hat S_{cd} &= \sum_{i=1}^{n}Z_i(c_i-\hat{\bar c})(d_i-\hat{\bar d}) \\ &= \sum_{i=1}^{n}Z_i\bigl\{(c_i-\bar c)-(\hat{\bar c}-\bar c)\bigr\}\bigl\{(d_i-\bar d)-(\hat{\bar d}-\bar d)\bigr\} \\ &= \sum_{i=1}^{n}Z_i(c_i-\bar c)(d_i-\bar d) - n_1(\hat{\bar c}-\bar c)(\hat{\bar d}-\bar d). \end{align*}\]

两边取期望,

\[\begin{align*} \mathrm{E}\{(n_1-1)\hat S_{cd}\} &= \sum_{i=1}^{n}\mathrm{E}(Z_i)(c_i-\bar c)(d_i-\bar d) - n_1\mathrm{E}\bigl\{(\hat{\bar c}-\bar c)(\hat{\bar d}-\bar d)\bigr\} \\ &= \frac{n_1}{n}\sum_{i=1}^{n}(c_i-\bar c)(d_i-\bar d) - n_1\cdot\frac{n_0}{nn_1}S_{cd} \\ &= S_{cd}\left\{\frac{n_1(n-1)}{n}-\frac{n_0}{n}\right\} \\ &= (n_1-1)S_{cd}, \end{align*}\]

两边再除以 \(n_1-1\),结论随之而来。

\(\square\)

引理 C.4 的证明 Hájek (1960) 给过简单随机抽样的 CLT 证明,Lehmann (1975) 给过一个更好读的版本。Li and Ding (2017) 把 CLT 改成引理 C.4 现在这个样子,并证明了样本方差的相合性。因为技术上比较绕,证明我略过。

\(\square\)

C.3 文献评注

抽样调查与实验设计,从 Neyman (1934, 1935) 那些开创性工作起,就一直深深连在一起。Li and Ding (2017) 与 Mukerjee et al. (2018) 在这两块之间做了许多理论上的牵线。

C.4 习题

C.1 无放回抽样与超几何分布
考虑引理 C.2 的一个特例:\(c_i\) 是二值的。假定 \(1\) 的总数等于 \(T\),于是 \(0\) 的总数等于 \(n-T\)。令 \(t=\sum_{i=1}^{n}Z_ic_i\) 表示容量为 \(n_1\) 的样本里 \(1\) 的个数。

求出 \(t\) 的分布、均值与方差。

注: \(t\) 服从超几何分布。

C.2 引理 C.2 的向量形式
假定 \(c_i\) 是向量,并定义

\[ S_c^2=(n-1)^{-1}\sum_{i=1}^{n}(c_i-\bar c)(c_i-\bar c)^{\mathrm{T}}, \qquad \hat S_c^2=(n_1-1)^{-1}\sum_{i=1}^{n}Z_i(c_i-\hat{\bar c})(c_i-\hat{\bar c})^{\mathrm{T}}. \]

证明

\[ \mathrm{E}(\hat{\bar c})=\bar c, \qquad \operatorname{cov}(\hat{\bar c})=\frac{n_0}{nn_1}S_c^2, \qquad \mathrm{E}(\hat S_c^2)=S_c^2. \]