原来分开记了概率公式和一份统计学提纲,后者只有“均值、直方图、方差”这些关键词。这次把两份放在一起,补上关键词之间的关系,顺便修正二项分布公式里混用的 p、q。
数学基础笔记目录
先分清总体和样本
总体是想研究的全部对象,样本是实际取得的那一部分。总体均值常记作 μ,样本均值记作 x̄:
xˉ=n1i=1∑nxi样本统计量与总体参数之间会有差异。原笔记把抽样误差写成 μ − x̄,这里把方向统一为 x̄ − μ;无论选哪个方向,都要说明是在比较哪两个量。
随机抽样有助于控制选择偏差,但不代表一次随机抽样必然准确。便利样本只取容易接触的人或对象,推广到总体时尤其要考虑代表性。
原稿还记了单盲和双盲。这是研究设计中减少知情影响的方法,具体哪些参与者不知道分组,需要在研究中明确,而不是只写一个名称。
怎样描述一组数据
频数是某类或某个区间出现的次数,频率是它占全部观测的比例。
- 柱状图常用来比较类别。
- 直方图把数值数据分成区间,观察分布形状;区间宽度不同时,还要注意纵轴是否采用密度。
- 均值利用所有数据,但容易受极端值影响。
- 中位数是排序后的中间位置。
- 众数是出现最频繁的值,可能不止一个。
偏斜、均匀、多峰和近似正态,都可以用来描述分布形状,但应当依据数据判断。
四分位距 IQR = Q3 − Q1 描述中间一半数据的跨度。常见箱线图把低于 Q1 − 1.5 IQR 或高于 Q3 + 1.5 IQR 的观测标为潜在异常点;这是筛查规则,不能据此直接认定数据错误。
方差和标准差
总体有 N 个数值时:
σ2=N1i=1∑N(xi−μ)2σ=σ2用样本估计总体方差时,常用分母 n − 1:
s2=n−11i=1∑n(xi−xˉ)2n>1这就是原提纲中的贝塞尔校正。在独立同分布且总体方差有限的条件下,这样得到的样本方差是总体方差的无偏估计。分母用 n 还是 n − 1,取决于是在描述眼前这组数据,还是估计背后的总体方差。
离散随机变量
设随机变量 X 可能取 x₁, x₂, …, xₙ,对应概率为 p₁, p₂, …, pₙ,必须满足:
0≤pi≤1i=1∑npi=1某一区间的概率,是把落在该区间内的取值对应的概率加起来:
P(a≤X≤b)=i:a≤xi≤b∑pi原稿写成了 P(a ≤ b),漏掉了随机变量 X。
期望和方差分别为:
E(X)=i=1∑nxipi Var(X)=i=1∑n(xi−E(X))2pi=E(X2)−E(X)2方差描述取值围绕期望的离散程度。做线性变换后:
Var(aX+b)=a2Var(X)σaX+b=∣a∣σX例如公平六面骰子的点数,期望为 3.5,方差为 35/12。期望不一定是随机变量实际能取到的值。
二项分布
独立重复进行 n 次试验,每次成功概率相同,均为 p。令 X 表示成功次数,则 X ~ B(n, p):
P(X=r)=(rn)pr(1−p)n−rr=0,1,…,n E(X)=npVar(X)=np(1−p)σX=np(1−p)如果另记 q = 1 − p,方差就是 npq。原稿的 np(1 − q) 会把失败概率又取一次补集,不能混用。
比如独立抛三次公平硬币,恰好两次正面的概率为 3/8。二项式展开也解释了为什么这些概率相加等于 1:
(a+b)n=r=0∑n(rn)arbn−r这里从 r 等于 0 开始求和,原稿从 1 开始会漏掉第一项。