似然函数与极大似然估计
层级:A|必学
1. 同一个公式,不同角色
p(x∣θ)
固定 θ、变量为 x 时是数据分布;观测 x 固定、把它看成 θ 的函数时称似然:
L(θ;x)=pθ(x).
似然不是“参数的概率”,不要求对 θ 积分为 1。
2. iid 样本似然
L(θ)=i=1∏np(xi∣θ).
极大似然估计:
θ^MLE=argθmaxL(θ).
乘积分解依赖给定参数后的样本独立。时间/群组依赖需写正确联合似然。
3. 对数似然
ℓ(θ)=logL(θ)=i∑logp(xi∣θ).
因 log 严格递增,最大点不变。优点:乘积变和、便于求导、避免下溢。训练常最小化负对数似然(NLL):
−ℓ(θ).
4. Bernoulli MLE
xi∈{0,1}:
ℓ(p)=i∑[xilogp+(1−xi)log(1−p)].
令成功数 k=∑ixi:
ℓ(p)=klogp+(n−k)log(1−p).
求导:
ℓ′(p)=pk−1−pn−k=0⇒p^=k/n.
二阶导为负(内部),故是最大值;全成功/全失败时最优在边界。
5. 高斯 MLE
iid N(μ,σ2):
ℓ(μ,σ2)=−2nlog(2π)−2nlogσ2−2σ21i∑(xi−μ)2.
μ^=xˉ,
σ^2=n1i∑(xi−xˉ)2.
方差 MLE 有偏但一致。MLE 的目标是最大似然,不是无偏性。
6. Score 与 Fisher 信息
Score:
s(θ)=∇θlogp(X∣θ).
在正则条件下:
Eθ[s(θ)]=0.
Fisher 信息:
I(θ)=E[s(θ)s(θ)T]=−E[∇θ2logp(X∣θ)].
它衡量分布对参数变化的敏感度。iid n 个样本信息相加:In=nI1,估计标准误因此常按 1/n。
7. MLE 的渐近性质
在模型正确、可辨识、参数为内部点、光滑等正则条件下:
n(θ^−θ0)⇒N(0,I(θ0)−1).
MLE 通常一致、渐近正态、渐近有效。但混合模型、边界参数、支持依参数、高维和模型错设会破坏标准结论。
8. 可辨识性
若不同参数给同一分布:
pθ1=pθ2,quadθ1=θ2,
参数不可辨识。GMM 分量标签置换、Softmax logits 共同平移、神经网络隐藏单元置换都是例子。似然可能有多个等价最大点,Hessian 奇异。
9. 不变性
若 θ^ 是 MLE,且 ϕ=g(θ),在适当一一/定义条件下 g(θ^) 是 ϕ 的 MLE。比如方差 MLE 的标准差估计为 σ^2。
但无偏性不在非线性变换下保持:E[g(θ^)]=g(Eθ^)。
10. 似然与交叉熵
真实分布 P、模型 qθ:
EP[−logqθ(X)]=H(P)+DKL(P∥qθ).
H(P) 与 θ 无关,所以总体上最大似然等价于最小化从真实分布到模型的 KL。经验 NLL 是该期望的样本平均。
11. 似然比
比较嵌套模型:
Λ=2[ℓ(θ^full)−ell(θ^restricted)].
在正则条件下,Wilks 定理给其渐近 χ2 分布,自由度为参数数差。边界、混合模型与小样本可能不适用。
12. 数值实现
- 始终用 log-likelihood;
- 使用 logits 与 logsumexp;
- 正参数用 log/softplus 参数化;
- 协方差用 Cholesky;
- 检查梯度、边界和多个初始化;
- 报告优化是否真正收敛;
- 标准误用观测 Hessian、sandwich 或 bootstrap,匹配模型假设。
易错点
- 似然不是参数概率分布。
- iid 连乘必须有条件独立假设。
- MLE 不保证有限样本无偏。
- 局部数值极大不一定全局 MLE。
- 标准渐近理论有正则条件。
常见问答
Q1:似然可以大于 1 吗?
连续模型似然值是密度乘积,可大于 1;它不是事件概率。比较需在同一数据表示与基准测度下。
Q2:训练 NLL 降低为何测试可能变差?
MLE 优化经验分布,灵活模型会拟合抽样噪声;需要验证、正则化和容量控制。
Q3:MLE 与最小二乘何时相同?
条件误差独立同方差高斯、均值由回归模型给出且方差固定/共同估计时,参数均值部分等价。
练习
- 写出 iid 似然与 log-likelihood。
- 推导 Bernoulli MLE。
- 高斯方差 MLE 为什么分母为 n?
- 似然为何不需对参数归一化?
- Fisher 信息随 iid 样本数如何变化?
答案与提示
- 乘积与 log 后求和。
- 对 log-likelihood 求导置零得成功比例。
- 它来自最大化似然的一阶条件;无偏修正是另一目标。
- 数据固定后它只是参数评分函数。
- 线性相加为 nI1。