贝叶斯公式:
P(ωi∣x)=P(x)P(ωi,x)=P(x)P(x∣ωi)P(ωi)
先验概率:P(ωi);后验概率:P(ωi∣x)
总体密度:P(x);联合概率密度:P(ωi,x);类条件概率密度:P(x∣ωi)
P(e)=∫P(e∣x)p(x)dx
最小错误率决策:minP(e)=min∫P(e∣x)p(x)dx
风险R(ai∣x)=∑j=1cλ(ai,ωj)P(ωi∣x)
最小风险:minR(α)=min∫R(α(x)∣x)p(x)
p(x∣ωi)=(2π)d/2∣∑i∣1/21exp{−21(x−μi)T∑iT(x−μi)}
判别函数gi(x)=ln[p(x∣ωi)P(ωi)]=
−2dln2π−21ln∣i∑∣−21(x−μi)Ti∑−1(x−μi)+ln[P(ωi)]
决策面方程:gi(x)=gj(x)
−21[(x−μi)Ti∑−1(x−μi)−(x−μj)Tj∑−1(x−μj)]−21ln∣∑j∣∣∑i∣+lnP(ωj)P(ωi)=0
当p(ωi)=p(ωj)时,判别函数:
gi(x)=−2σ2(x−μi)T(x−μi)
即计算欧氏距离的平方并根据其最小值归类
每类样本满足独立同分布,类条件概率存在某种具体确定的函数形式,只是参数未知,根据样本求出该参数
l(θ)=p(χ∣θ)=i=1∏Np(xi∣θ)
H(θ)=lnl(θ)=lnp(X/θ)=i=1∑Nlnp(xi/θ)
i=1∑N∂θ1∂lnp(xi∣θ)
⋮
i=1∑N∂θs∂lnp(xi∣θ)
把样本x的每个分量分为多个等间隔小窗,将样本数目作为概率
确定Kn个数,调整窗口大小直到包含Kn个样本,以每一点为中心进行估计
对已知的密度函数,在观测点上进行平均化,得到光滑估计曲线
线性判别函数的一般表达式:g(x)=wTx+w0
x:样本向量;w:权向量;w:阈值权
对于二分问题,决策规则g(x)=g1(x)−g2(x)
判别函数可以看成是特征空间中某点到决策超平面距离的一种代数度量
原理:将所有样本都投影到一个方向,在一维空间中确定分类阈值2
寻找投影方向w,使得投影后的样本为yi=wTxi
投影前:
Si=∑(xj−mj)(xj−mj)T
mi=Ni1∑xj
Sw=S1+S2
Sb=(m1−m2)(m1−m2)T
投影后:
Si2~=∑(yi−mi~)2
mi~=Ni1∑yj=wTmi
Sw~=S12~+S22~
Sb~=(m1~−m2~)2
Fisher准则函数即为:maxJF(ω)=Sw~Sb~=S12~+S22~(m1~−m2~)2
使得投影后两类尽可能分开,类内尽可能聚集,即类内总离散度小,类间离散度大
齐次化简:g(y)=αTy,存在α使得所有样本被正确分类,则根据g(y)大于小于0判断类别
令增广样本矩阵
yi′=yi,yi∈ω1−yi,yi∈ω2
则解向量α满足αTyi>0
感知器准则函数Jp(α)=min∑αTyk≤0(−αTyk)=0
对待分类样本,把他分到距离最近的子类所属的类
gk(x)=min∣∣x−mil∣∣
maxα:W(α)=i=1∑nαi−21i,j=1∑ny(i)y(j)αiαjK(x(i),x(j))
BP神经网络
定义x为原变量指标,y为变换后的向量
Y=XP
P为负载矩阵,使得方差最大化
对原始数据X0进行标准化:X=(X0−1μT)∑−1
PCA优化目标可表示为:
max tr[PTXTXP/(n−1)],s.t. PTP=I
采用拉格朗日乘子法,转化为特征值分解问题:
(XTX/(n−1)pi)=λipi
根据累计方差贡献率确定k个主成分:
i=1∑kλi/i=1∑mλi>threshold
降维:
Y=XP
P为前k个特征向量组成的矩阵
以距离新样本最近已知样本作为新样本的类别
欧氏距离:∣∣xi−xj∣∣
找出x的k个近邻,看其中多数属于哪一类,则把x分到哪一类
D(x,Mp)>B+rp
则p不可能是x的最近邻
D(x,Mp)>B+D(xi,Mp)
则p不可能是x的最近邻
两类分布重合区的样本可能会误导决策,应当去掉
将样本分为储存集XS与备选集XG,若XG中的样本x能用XS中的样本进行正确分类,则留在XG中,反之移入XS
常用可分性判据:
J1=tr(Sw+Sb)J2=tr(Sw1Sb)J3=ln∣Sw∣∣Sb∣J4=trSwtrSbJ5=∣Sw∣∣Sb−Sw∣
常用的概率距离度量:
JB=−ln∫[p(x∣ω1)p(x∣ω2)]1/2dxJC=−ln∫[ps(x∣ω1)p1−s(x∣ω2)]dxJD=−ln∫[p(x∣ω1)−p(x∣ω2)]lnp(x∣ω2)p(x∣ω1)dx
- 主成分分析
- 估计投影后的概率密度函数P(vj)
- 求极小点,做垂直与投影方向的超平面作为分类超平面
- 若没有极小点,继续用下一个本征值对应的本征向量做投影方向
C均值算法:
Je=i=1∑cy∈Γi∑∣∣y−mi∣∣2=i=1∑cJi
模糊C均值算法:
min Je=min i=1∑cy∈Γi∑∣∣y−mi∣∣2=i=1∑cJi
从各类只有一个样本点开始,逐级合并,每级只合并两类,直到最后所有样本归到一个类,聚类过程中逐级考察类间相似度,依此决定类别数