机器学习数学基础 120 章

伯努利、二项、类别与多项分布

层级:A|必学

1. 分类与计数的基本分布

Bernoulli 描述一次二元结果,Binomial 描述多次独立 Bernoulli 的成功数,Categorical 描述一次多类别结果,Multinomial 描述多次类别抽样的各类计数。逻辑回归与 Softmax 分类的似然正来自它们。

2. Bernoulli 分布

XBernoulli(p),quad0p1,X\sim\operatorname{Bernoulli}(p),quad0\le p\le1,

支持 x{0,1}x\in\{0,1\}

P(X=x)=px(1p)1x.P(X=x)=p^x(1-p)^{1-x}.

x=1x=1ppx=0x=01p1-p

E[X]=p,Var(X)=p(1p).E[X]=p, \qquad Var(X)=p(1-p).

方差在 p=1/2p=1/2 最大,p=0p=0 或 1 时没有随机性。

3. Bernoulli 似然与交叉熵

观测 yi{0,1}y_i\in\{0,1\},预测 pip_i

L=ipiyi(1pi)1yi.L=\prod_ip_i^{y_i}(1-p_i)^{1-y_i}.

负平均对数似然:

1ni[yilogpi+(1yi)log(1pi)],-\frac1n\sum_i[y_i\log p_i+(1-y_i)\log(1-p_i)],

即 binary cross-entropy。它重罚自信但错误预测。

4. Binomial 分布

nn 次独立、同成功率 pp 的 Bernoulli,成功总数

K=i=1nXiBinomial(n,p).K=\sum_{i=1}^{n}X_i \sim\operatorname{Binomial}(n,p).

PMF:

P(K=k)=(nk)pk(1p)nk,k=0,ldots,n.P(K=k)=\binom nkp^k(1-p)^{n-k}, \quad k=0,ldots,n.

组合数计算成功位置的选择数。

E[K]=np,Var(K)=np(1p).E[K]=np, \qquad Var(K)=np(1-p).

样本比例 p^=K/n\hat p=K/n 的方差为 p(1p)/np(1-p)/n

5. Binomial 的假设

  • 固定试验次数 nn
  • 每次只有成功/失败;
  • 成功率相同;
  • 试验独立。

用户行为随时间变化、重复曝光相关或 pip_i 不同时不严格 Binomial。不同 pip_i 独立 Bernoulli 和为 Poisson-binomial 分布。

6. Categorical 分布

一次从 KK 类选择一类,参数

πk0,quadkπk=1.\pi_k\ge0,quad\sum_k\pi_k=1.

若用类别编号 Y{1,ldots,K}Y\in\{1,ldots,K\}

P(Y=k)=πk.P(Y=k)=\pi_k.

用 one-hot yy

p(y)=k=1Kπkyk.p(y)=\prod_{k=1}^{K}\pi_k^{y_k}.

期望向量 E[y]=πE[y]=\pi,协方差

Cov(y)=diag(π)ππT.Cov(y)=\operatorname{diag}(\pi)-\pi\pi^T.

因分量和恒为 1,协方差奇异。

7. Softmax 与 Categorical 似然

πk=ezkjezj.\pi_k=\frac{e^{z_k}}{\sum_je^{z_j}}.

one-hot 负对数似然:

kyklogπk=logπtrue.-\sum_ky_k\log\pi_k=-\log\pi_{true}.

这就是多分类交叉熵。Softmax 适合互斥单标签;多标签应使用多个 Bernoulli/Sigmoid。

8. Multinomial 分布

nn 次独立 Categorical,类别计数 NkN_kkNk=n\sum_kN_k=n

(N1,ldots,NK)Multinomial(n,π).(N_1,ldots,N_K) \sim\operatorname{Multinomial}(n,\pi).

PMF:

P(N1=n1,ldots,NK=nK)=n!knk!kπknk.P(N_1=n_1,ldots,N_K=n_K) =\frac{n!}{\prod_kn_k!}\prod_k\pi_k^{n_k}. E[Nk]=nπk,E[N_k]=n\pi_k, Var(Nk)=nπk(1πk),Var(N_k)=n\pi_k(1-\pi_k), Cov(Nj,Nk)=nπjπk(jk).Cov(N_j,N_k)=-n\pi_j\pi_k\quad(j\ne k).

负协方差来自总数固定:一个类别多,其他类别必须少。

9. 参数的 MLE

Bernoulli/Binomial:

p^=kn.\hat p=\frac{k}{n}.

Categorical/Multinomial:

π^k=nkn.\hat\pi_k=\frac{n_k}{n}.

未见类别得到概率 0,后续 log 概率为 -\infty;文本朴素 Bayes常用 Laplace/Dirichlet 平滑。

10. Beta 与 Dirichlet 共轭

Bernoulli 参数先验 pBeta(α,β)p\sim Beta(\alpha,\beta),观察 kk 成功、nkn-k 失败后:

pDBeta(α+k,β+nk).p|D\sim Beta(\alpha+k,\beta+n-k).

Categorical 的对应先验是 Dirichlet:

πDDirichlet(α1+n1,ldots,αK+nK).\pi|D\sim Dirichlet(\alpha_1+n_1,ldots,\alpha_K+n_K).

伪计数解释帮助理解平滑,但先验强度和均值要区分。

11. 过度离散

若实际计数方差大于 Binomial/Multinomial 假设,可能因为个体 pp 不同、相关、群组或未观测混合。Beta-binomial、Dirichlet-multinomial 和层级模型允许额外变异。

易错点

  1. Bernoulli 是一次试验,Binomial 是成功总数。
  2. Categorical 是一次多类,Multinomial 是多次类别计数。
  3. Softmax 不适合可同时为真的多标签。
  4. Binomial 要求同 pp 且独立。
  5. 未平滑 MLE 对未见类别给零概率。

常见问答

Q1:二分类用 Categorical 还是 Bernoulli?

都可;两类 Categorical 与 Bernoulli 等价参数化,单 logit Bernoulli 更简洁。

Q2:为什么多项计数协方差为负?

总试验数固定,一个类别计数增加会挤占其他类别。

Q3:类别权重改变的是概率模型吗?

加权交叉熵不再是原始抽样分布下普通 log-likelihood,等价于重加权目标/代价敏感决策;概率可能需重新校准。

练习

  1. Bernoulli(pp) 的均值与方差。
  2. 10 次成功率 0.2,恰 3 次成功概率。
  3. 写出三分类 one-hot likelihood。
  4. 为什么 Multinomial 协方差矩阵奇异?
  5. 观察 8 成功 2 失败、Beta(1,1) 先验,后验是什么?

答案与提示

  1. p,p(1p)p,p(1-p)
  2. (103)0.230.87\binom{10}{3}0.2^30.8^7
  3. k=13πkyk\prod_{k=1}^3\pi_k^{y_k}
  4. 计数和固定为 nn,沿全一方向方差为 0。
  5. Beta(9,3)。