线性回归的统计解释
层级:B|按需
1. 线性回归不只是解最小二乘
代数层面,最小二乘总能寻找最佳线性拟合;统计层面,要解释无偏、标准误、区间与检验,必须说明数据生成假设。预测、关联解释与因果效应又是不同层次。
2. 经典模型
常见固定设计假设:
- 对参数线性;
- 满列秩;
- (外生性);
- (同方差且不相关);
- 若做有限样本精确 t/F 推断,常再假设条件高斯。
不同结论需要不同子集,不要把“线性回归要求所有变量高斯”当规则。
3. OLS 估计
给定 ,若 :
若同方差不相关:
共线性使 小特征值方向逆很大,系数方差增大。
4. Gauss–Markov 定理
在线性、外生、同方差不相关等条件下,OLS 是所有线性无偏估计量中方差最小者(BLUE)。
它不要求误差高斯;高斯主要给精确分布推断。BLUE 不代表在所有有偏/非线性估计量中 MSE 最好,岭回归可通过偏差换方差。
5. 残差与误差
真实误差
不可观测;残差
其中帽子矩阵
残差并非独立同方差,即使误差是;其协方差为 。不要把残差直方图完全等同误差分布。
6. 杠杆值与影响
是 leverage,衡量样本特征位置对自身拟合值影响。平均 leverage 为 (含截距参数数 )。高杠杆点不一定有大残差,却可能强影响系数。
Cook's distance 等结合杠杆与残差衡量删除样本对拟合的影响。应调查数据来源,不机械删除。
7. 误差方差估计
在经典条件下无偏。自由度 因估计了 个独立参数。
系数标准误:
用于 t 区间/检验。
8. 异方差
若 不同,OLS 在外生性下仍可无偏/一致,但经典标准误错误且不再 BLUE。处理:
- HC sandwich robust SE;
- 加权最小二乘(若方差模型可信);
- 变换响应;
- 直接建模条件方差;
- 使用稳健损失处理极端尾部(与异方差不同问题)。
9. 自相关与群组相关
时间/群内误差相关使经典 SE 过小。使用 cluster-robust、HAC、GLS、混合效应或时间序列模型。聚类层级数太少时普通 cluster SE 也不可靠,需小样本修正或随机化推断。
10. 遗漏变量偏差
真实模型含 :
若省略 且 与 相关, 系数吸收部分 作用,外生性失败。加入更多变量不总修复:控制 collider、中介或测量后处理变量会产生其他偏差。
因果解释需要结构假设与研究设计,不由回归本身提供。
11. 系数解释
线性模型中,在“其他变量保持不变”条件下, 增加一单位,条件均值改变 。但:
- 单位和编码决定数值;
- 有交互时主效应依其他变量值;
- log 变换有百分比解释;
- 共线性使“保持其他变量不变”可能脱离数据支持;
- 非因果数据只能解释条件关联。
12. 置信区间与预测区间
新点 的均值预测方差:
新观测预测还加噪声:
所以预测区间更宽。远离训练特征区域时 leverage 项大,外推不确定性增大。
13. 诊断不是通过/失败清单
检查 residual vs fitted、Q–Q、scale-location、leverage/influence、时间/群组残差、非线性部分残差。诊断目的是定位模型错设并决定变换、非线性、方差模型或数据修复,不是让每张图“看起来完美”。
易错点
- 线性回归不要求特征高斯。
- 残差不等于真实误差。
- robust SE 不修复遗漏变量偏差。
- 系数显著不等于因果。
- 高 不保证模型正确或外推好。
常见问答
Q1:特征相关会让 OLS 有偏吗?
只要不完全共线且外生性成立,不必有偏,但方差大、解释不稳定。遗漏相关混杂才常导致偏差。
Q2:误差不高斯还能预测吗?
OLS 点估计仍可有良好性质;小样本精确 t/F 推断改变。大样本 robust SE 或非参数/稳健方法可用。
Q3:标准化后系数能比较重要性吗?
比原单位更可比,但相关、非线性、测量误差与目标分布仍影响,不能作为唯一特征重要性。
练习
- 写出 OLS 条件方差。
- Gauss–Markov 保证什么,不保证什么?
- 残差自由度为什么是 ?
- 异方差主要破坏什么经典结论?
- 为什么回归系数不自动是因果效应?
答案与提示
- 。
- 线性无偏类中最小方差;不保证所有估计中最小 MSE或因果。
- 拟合消耗 个独立参数/投影维度。
- 经典方差/标准误与 BLUE 效率;外生性仍在时点估计可无偏一致。
- 可能有混杂、反向因果、选择与错误控制变量。