图形
度量
- 均值
μ=nΣx , n是个数
μ=ΣfΣfx , f是频数
- 中位数,众数和均值都是一种平均数
- 全距,也叫极差,等于上界减下界,即最大数减最小数
- 四分位数:把一批数据一分为四份的3个数
- 四分位距 = 上四分位数 - 下四分位数
同理,有10分位数和百分位数
假设共n个数,求第k个m分位数的方法:
- 升序排序
- 计算 k(mn)
如果结果是整数,则第k个m分位数为它与下一个数之间的均值如果结果不是整数,则向上取整,结果就是这个位置的数
箱线图,可看出来一组数据分布的稳定性
方差
方差=nΣ(x−μ)2=nΣx2−μ2
标准差
σ=方差
标准分(z分)
z=σx−μ
用来表示某一个新的x,距离均值多少个标准差
概率
有概率树这种东西
全概率公式
P(B)=P(B∩A)+P(B∩A1)=P(A)P(B∣A)+P(A1)P(B∣A1)
如果两个事件独立,则两个事件同时发生的概率就是条件概率的特殊情况
P(A∣B)=P(B)P(A∩B)
因为A和B相互独立,P(A|B)等于P(A),所以
P(A∣B)=P(A)
P(A)P(B)=P(A∩B)
期望
E(x)=Σ(xP(X=x))
期望也是一种平均值,但它是针对有概率的取值的平均值
- 期望的方差
Var(x)=E((x−μ)2)=Σ[(x−μ)2P(X=x)]
其中μ是前面算出来的数学期望
- 期望和方差的线性变换
E(ax+b)=aE(x)+b
Var(ax+b)=a2Var(x)
排列组合
Pnr=(n−r)!n!
Cnr=(kn)=(kn)=r!(n−r)!n!
几何分布
目标:为了取得一次成功,需要进行多少次试验
重试过r次才成功的概率:
P(X=r)=q(r−1)p
其中,p为成功的概率,q为失败的概率
X∼Geo(p)
说明,X服从几何分布,则数学期望(概率分布的均值)为:
E(X)=p1
方差为:
Var(X)=E(x2)−(E(x))2=p2q
在离散概率分布中,众数是指概率质量函数有最大值的数据,也就是最容易取様到的数据。在连续概率分布中,众数是指机率密度函数有最大值的数据,也就是机率密度函数的峰值任何的几何分布,众数一定是1,因为1是概率最大的取值
二项分布
目标:在n次试验中,能成功多少次
- 一系列独立试验
- 每一次试验的成功概率相同
- 试验次数有限
r次试验成功的概率为:
P(X=r)=Cnrprqn−r , 其中 Cnr=r!(n−r)!n!
X服从二项分布,写作:
X∼B(n,p)
其中,n是试验数,p是成功概率数学期望为:
E(X)=np
方差为:
Var(X)=npq
泊松分布
目标:给定区间内,事件发生了多少次或已知给定区间内事件的平均发生次数,目标是特定情况下区间内事件发生的次数,使用泊松分布
X∼Po(λ)
P(X=r)=r!e−λλr
E(X)=λ,Var(X)=λ
二项分布有时候可以近似使用泊松分布来表示,当二项分布的期望和方差很接近时,即np很接近npq时,即n很大且p很少时,可以用泊松分布近似代替,这个时候λ近似等于np
一辆公交车平均每15分钟会停一站,求15分钟之内不出现公交车的概率是多少?
P(X=0)=0!e−110=e−1
泊松分布是二项分布的极限形式
正态分布
- 概率密度:表示一个范围内概率大小
- 概率密度函数:表明某个连续变量在一定范围内的概率分布,它与X轴形成的面积是这个范围的概率
如果一个连续变量X符合正态分布,则:
X∼N(μ,σ2)
其中μ是均值,σ是标准差 , σ越小,说明数据越集中,图形越高瘦,σ越大,说明数据越分散,图形扁平
如果X∼B(n,p), 且np > 5, nq > 5, 则该二项分布可以用正态分布X∼N(np,npq) 近似。但是由于二项分布是离散型的,而正态分布是连续型的,所以计算出来之后还需要做连续性修正才能接近真正的概率
如果X∼Po(λ,λ), 且λ>15, 则该分布可以用正态分布X∼N(λ,λ) 近似。不过,也需要做连续性修正
抽样
- 随机抽样:随机取
- 分层抽样:分成几个组,比如黄色,绿色
- 整群抽样:分成一些群,比如一盒一盒糖果
- 系统抽样:选取一个数字k,每k个对象抽一次
- μ是总体均值,xˉ是样本均值,μ^是总体均值的点估计量
- 中心极限定理(Central Limit Theorem)
中心极限定理指的是给定一个任意分布的总体。我每次从这些总体中随机抽取 n 个抽样,一共抽 m 次。 然后把这 m 组抽样分别求出平均值。 这些平均值的分布接近正态分布。
假设检验
卡方分布