机器学习数学基础 120 章

指数族分布与充分统计量

层级:C|建议先修:05-15 至 05-19、06-05、06-06、07-05

高斯、Bernoulli、二项、Poisson、指数、Gamma 等许多常用分布可以写成统一形式——指数族。理解这一结构能把概率分布、最大熵、极大似然、充分统计量和广义线性模型连在一起。

1. 指数族的标准形式

一个分布族若能写为

p(xη)=h(x)exp(ηT(x)A(η)),p(x\mid\boldsymbol\eta) =h(x)\exp\left( \boldsymbol\eta^\top T(x)-A(\boldsymbol\eta) \right),

就称为指数族,其中:

  • h(x)h(x):基准测度或基函数;
  • T(x)T(x):充分统计量向量;
  • η\boldsymbol\eta:自然参数;
  • A(η)A(\boldsymbol\eta):对数配分函数。

对数配分函数由归一化决定:

A(η)=logh(x)eηT(x)dxA(\boldsymbol\eta) =\log\int h(x)e^{\boldsymbol\eta^\top T(x)}dx

或在离散情形把积分换成求和。

2. Bernoulli 分布的例子

x{0,1}x\in\{0,1\}

p(xp)=px(1p)1x.p(x\mid p)=p^x(1-p)^{1-x}.

整理为

p(xη)=exp{xηlog(1+eη)},p(x\mid\eta) =\exp\{x\eta-\log(1+e^\eta)\},

其中

η=logp1p,T(x)=x,qquadA(η)=log(1+eη).\eta=\log\frac{p}{1-p},\qquad T(x)=x,qquad A(\eta)=\log(1+e^\eta).

自然参数正是 logit;反变换 p=1/(1+eη)p=1/(1+e^{-\eta}) 正是 sigmoid。

3. 高斯分布的例子

一元高斯密度为

p(xμ,σ2)=12πσ2exp[(xμ)22σ2].p(x\mid\mu,\sigma^2) =\frac1{\sqrt{2\pi\sigma^2}} \exp\left[-\frac{(x-\mu)^2}{2\sigma^2}\right].

展开平方后可写为

p(x)=h(x)exp{η1x+η2x2A(η)},p(x)=h(x)\exp\{\eta_1x+\eta_2x^2-A(\boldsymbol\eta)\},

其中

T(x)=(x,x2),η1=μσ2,η2=12σ2.T(x)=(x,x^2)^\top, \quad \eta_1=\frac{\mu}{\sigma^2}, \quad \eta_2=-\frac1{2\sigma^2}.

这说明当均值和方差都未知时,样本和与平方和承载了参数信息。

4. 自然参数空间

自然参数不能任意取值。使配分函数有限的集合

H={η:A(η)<}\mathcal H=\{\boldsymbol\eta:A(\boldsymbol\eta)<\infty\}

称为自然参数空间。它通常是凸集。高斯例子中必须有 η2<0\eta_2<0,否则积分不收敛。

5. 对数配分函数的导数

指数族最重要的恒等式是

A(η)=Eη[T(X)],\nabla A(\boldsymbol\eta) =\mathbb E_{\boldsymbol\eta}[T(X)],

以及

2A(η)=Covη[T(X)]0.\nabla^2 A(\boldsymbol\eta) =\operatorname{Cov}_{\boldsymbol\eta}[T(X)]\succeq0.

因此 AA 是凸函数。它的一阶导给出充分统计量的均值参数,二阶导给出协方差,也与 Fisher 信息有关。

6. 什么是充分统计量

统计量 T(X1,,Xn)T(X_1,\ldots,X_n) 若在给定它以后,原始样本对参数 θ\theta 不再提供额外信息,就称为关于 θ\theta 的充分统计量。

Fisher–Neyman 因子分解定理说:若联合密度能写成

p(xθ)=g(T(x),θ)h(x),p(\mathbf x\mid\theta) =g(T(\mathbf x),\theta)h(\mathbf x),

其中 hhθ\theta 无关,则 T(x)T(\mathbf x) 是充分统计量。

对独立同分布的指数族样本,联合似然为

p(xη)=(ih(xi))exp{ηiT(xi)nA(η)}.p(\mathbf x\mid\boldsymbol\eta) =\left(\prod_i h(x_i)\right) \exp\left\{ \boldsymbol\eta^\top\sum_iT(x_i)-nA(\boldsymbol\eta) \right\}.

因此 iT(xi)\sum_iT(x_i) 是充分统计量。

7. 充分不等于无损压缩全部数据

“充分”只针对参数推断目标。在 Bernoulli 样本中,正例个数 ixi\sum_i x_i 对参数 pp 充分,但它无法恢复样本顺序。若任务关心时间结构,顺序仍可能重要。

8. 极大似然中的矩匹配

指数族对数似然为

(η)=ηiT(xi)nA(η)+C.\ell(\boldsymbol\eta) =\boldsymbol\eta^\top\sum_iT(x_i)-nA(\boldsymbol\eta)+C.

令梯度为 0:

1niT(xi)=A(η)=Eη[T(X)].\frac1n\sum_iT(x_i) =\nabla A(\boldsymbol\eta) =\mathbb E_{\boldsymbol\eta}[T(X)].

即极大似然使模型的充分统计量期望匹配经验平均。这与最大熵约束形成对偶关系。

9. 共轭先验

指数族常有形式方便的共轭先验。一般形式可写为

p(ηχ,ν)exp{ηχνA(η)}.p(\boldsymbol\eta\mid\boldsymbol\chi,\nu) \propto \exp\{\boldsymbol\eta^\top\boldsymbol\chi-\nu A(\boldsymbol\eta)\}.

观察样本后,超参数通过累计充分统计量更新:

χ=χ+iT(xi),ν=ν+n.\boldsymbol\chi' =\boldsymbol\chi+\sum_iT(x_i), \qquad \nu'=\nu+n.

典型组合包括 Beta–Bernoulli、Dirichlet–类别分布、Gamma–Poisson、正态相关的共轭族。

10. 广义线性模型

广义线性模型令响应变量来自指数族,并通过链接函数把条件均值与线性预测子 wx\mathbf w^\top\mathbf x 连接:

g(E[YX])=wx.g(\mathbb E[Y\mid X])=\mathbf w^\top\mathbf x.
  • 高斯响应加恒等链接得到线性回归;
  • Bernoulli 响应加 logit 链接得到逻辑回归;
  • Poisson 响应加对数链接得到 Poisson 回归。

11. 极小指数族与可识别性

若充分统计量之间存在非平凡线性关系,不同自然参数可能表示同一分布,称为非极小表示。极小指数族排除了这种冗余,使自然参数与均值参数之间的关系更规整。

12. 易错点

  1. “指数分布”只是一个具体分布,“指数族”是一大类分布。
  2. 不是任意含 ee 的密度都自动构成规则指数族,还要检查参数空间和支持集。
  3. 支持集若随参数变化,许多标准指数族结论可能失效;均匀分布 [0,θ][0,\theta] 是典型提醒。
  4. 充分统计量针对参数,不代表对所有后续任务都充分。

常见问答

Q1:为什么指数族在机器学习中如此常见?
它覆盖许多常用数据类型,并带来凸性、充分统计量、矩匹配、共轭先验和统一的广义线性模型结构。

Q2:自然参数与普通参数有什么区别?
普通参数更符合直觉,如 Bernoulli 的概率 pp;自然参数使对数密度对统计量呈线性,如 η=log[p/(1p)]\eta=\log[p/(1-p)]

Q3:充分统计量越低维越好吗?
对指定参数推断,它能减少存储和计算;但过度压缩会丢掉与其他任务相关的信息,且并非所有模型都有固定维度的充分统计量。

Q4:配分函数为什么重要?
它保证分布归一化,其导数还编码充分统计量的均值和协方差,并决定似然的曲率。

练习

  1. 将 Poisson 分布 p(xλ)=eλλx/x!p(x\mid\lambda)=e^{-\lambda}\lambda^x/x! 写成指数族形式。
  2. 对 Bernoulli 样本说明为什么正例总数是充分统计量。
  3. 推导 A(η)=E[T(X)]\nabla A(\boldsymbol\eta)=\mathbb E[T(X)]
  4. 解释指数族极大似然的“矩匹配”含义。

答案与提示

  1. η=logλ\eta=\log\lambdaT(x)=xT(x)=xh(x)=1/x!h(x)=1/x!A(η)=eηA(\eta)=e^\eta
  2. 联合似然为 pxi(1p)nxip^{\sum x_i}(1-p)^{n-\sum x_i},对 pp 的依赖只通过 xi\sum x_i
  3. 对归一化积分的对数求导,把导数移入积分,所得正是 T(X)T(X) 的期望。
  4. 似然驻点使样本充分统计量的平均值等于模型下的期望值。