原来分开记了概率公式和一份统计学提纲,后者只有“均值、直方图、方差”这些关键词。这次把两份放在一起,补上关键词之间的关系,顺便修正二项分布公式里混用的 p、q。

数学基础笔记目录

先分清总体和样本

总体是想研究的全部对象,样本是实际取得的那一部分。总体均值常记作 μ,样本均值记作 x̄:

xˉ=1n∑i=1nxi\bar x=\frac1n\sum_{i=1}^n x_i

样本统计量与总体参数之间会有差异。原笔记把抽样误差写成 μ − x̄,这里把方向统一为 x̄ − μ;无论选哪个方向,都要说明是在比较哪两个量。

随机抽样有助于控制选择偏差,但不代表一次随机抽样必然准确。便利样本只取容易接触的人或对象,推广到总体时尤其要考虑代表性。

原稿还记了单盲和双盲。这是研究设计中减少知情影响的方法,具体哪些参与者不知道分组,需要在研究中明确,而不是只写一个名称。

怎样描述一组数据

频数是某类或某个区间出现的次数,频率是它占全部观测的比例。

  • 柱状图常用来比较类别。
  • 直方图把数值数据分成区间,观察分布形状;区间宽度不同时,还要注意纵轴是否采用密度。
  • 均值利用所有数据,但容易受极端值影响。
  • 中位数是排序后的中间位置。
  • 众数是出现最频繁的值,可能不止一个。

偏斜、均匀、多峰和近似正态,都可以用来描述分布形状,但应当依据数据判断。

四分位距 IQR = Q3 − Q1 描述中间一半数据的跨度。常见箱线图把低于 Q1 − 1.5 IQR 或高于 Q3 + 1.5 IQR 的观测标为潜在异常点;这是筛查规则,不能据此直接认定数据错误。

方差和标准差

总体有 N 个数值时:

σ2=1N∑i=1N(xi−μ)2σ=σ2\begin{gathered} \sigma^2=\frac1N\sum_{i=1}^N(x_i-\mu)^2\\ \sigma=\sqrt{\sigma^2} \end{gathered}

用样本估计总体方差时,常用分母 n − 1:

s2=1n−1∑i=1n(xi−xˉ)2n>1\begin{gathered} s^2=\frac1{n-1}\sum_{i=1}^n(x_i-\bar x)^2\\ n>1 \end{gathered}

这就是原提纲中的贝塞尔校正。在独立同分布且总体方差有限的条件下,这样得到的样本方差是总体方差的无偏估计。分母用 n 还是 n − 1,取决于是在描述眼前这组数据,还是估计背后的总体方差。

离散随机变量

设随机变量 X 可能取 x₁, x₂, …, xₙ,对应概率为 p₁, p₂, …, pₙ,必须满足:

0≤pi≤1∑i=1npi=1\begin{gathered} 0\le p_i\le1\\ \sum_{i=1}^n p_i=1 \end{gathered}

某一区间的概率,是把落在该区间内的取值对应的概率加起来:

P(a≤X≤b)=∑i: a≤xi≤bpiP(a\le X\le b)=\sum_{i:\,a\le x_i\le b}p_i

原稿写成了 P(a ≤ b),漏掉了随机变量 X。

期望和方差分别为:

E(X)=∑i=1nxipiE(X)=\sum_{i=1}^n x_ip_i Var⁡(X)=∑i=1n(xi−E(X))2pi=E(X2)−E(X)2\begin{aligned} \operatorname{Var}(X)&=\sum_{i=1}^n(x_i-E(X))^2p_i\\ &=E(X^2)-E(X)^2 \end{aligned}

方差描述取值围绕期望的离散程度。做线性变换后:

Var⁡(aX+b)=a2Var⁡(X)σaX+b=∣a∣σX\begin{gathered} \operatorname{Var}(aX+b)=a^2\operatorname{Var}(X)\\ \sigma_{aX+b}=|a|\sigma_X \end{gathered}

例如公平六面骰子的点数,期望为 3.5,方差为 35/12。期望不一定是随机变量实际能取到的值。

二项分布

独立重复进行 n 次试验,每次成功概率相同,均为 p。令 X 表示成功次数,则 X ~ B(n, p):

P(X=r)=(nr)pr(1−p)n−rr=0,1,…,n\begin{gathered} P(X=r)=\binom nr p^r(1-p)^{n-r}\\ r=0,1,\ldots,n \end{gathered} E(X)=npVar⁡(X)=np(1−p)σX=np(1−p)\begin{gathered} E(X)=np\\ \operatorname{Var}(X)=np(1-p)\\ \sigma_X=\sqrt{np(1-p)} \end{gathered}

如果另记 q = 1 − p,方差就是 npq。原稿的 np(1 − q) 会把失败概率又取一次补集,不能混用。

比如独立抛三次公平硬币,恰好两次正面的概率为 3/8。二项式展开也解释了为什么这些概率相加等于 1:

(a+b)n=∑r=0n(nr)arbn−r(a+b)^n=\sum_{r=0}^n\binom nr a^rb^{n-r}

这里从 r 等于 0 开始求和,原稿从 1 开始会漏掉第一项。