线性回归的似然函数推导

1. 模型假设:线性回归的概率形式

线性回归的标准模型假设: \(y^{(i)} = \theta^T x^{(i)} + \varepsilon^{(i)}\)

  • \(y^{(i)}\):第 i 个样本的真实标签
  • \(x^{(i)}\):第 i 个样本的特征向量
  • \(\theta\):待学习的模型参数向量
  • \(\varepsilon^{(i)}\):噪声项(误差),服从零均值高斯分布

2. 误差项的概率分布

我们假设噪声 \(\varepsilon^{(i)}\) 服从正态分布: \(p(\varepsilon^{(i)}) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(\varepsilon^{(i)})^2}{2\sigma^2}\right)\)

  • 均值为 0,方差为 \(\sigma^2\)
  • 含义:误差以 0 为中心,越靠近 0 概率越高,远离 0 概率指数衰减
  • 这是线性回归最经典的 "高斯噪声假设"

3. 条件概率:给定 \(x^{(i)}\) 下 \(y^{(i)}\) 的分布

将 \(\varepsilon^{(i)} = y^{(i)} - \theta^T x^{(i)}\) 代入上式,可得: \(p(y^{(i)} | x^{(i)}; \theta) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(y^{(i)} - \theta^T x^{(i)})^2}{2\sigma^2}\right)\)

  • 含义:在给定参数 \(\theta\) 和特征 \(x^{(i)}\) 的情况下,观测到标签 \(y^{(i)}\) 的概率
  • 形式上,这表示 \(y^{(i)}\) 也服从正态分布,均值为 \(\theta^T x^{(i)}\),方差为 \(\sigma^2\)

4. 似然函数 \(L(\theta)\)

假设样本独立同分布,那么所有样本的联合概率就是单个概率的乘积,这就是似然函数

\(\begin{align} L(\theta) &= \prod_{i=1}^{m} p(y^{(i)} | x^{(i)}; \theta) \\ &= \prod_{i=1}^{m} \frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(y^{(i)} - \theta^T x^{(i)})^2}{2\sigma^2}\right) \end{align}\)

  • \(L(\theta)\):关于参数 \(\theta\) 的函数,表示在参数 \(\theta\) 下,观测到当前数据集的 "可能性"
  • 我们的目标:找到一组参数 \(\theta\),让 \(L(\theta)\) 最大化(即最大似然估计

补充:对数似然与最小二乘的等价性

为了简化连乘计算,通常取对数得到对数似然:

\(\ell(\theta) = \log L(\theta) = \sum_{i=1}^m \log\left(\frac{1}{\sqrt{2\pi}\sigma}\right) - \frac{1}{2\sigma^2} \sum_{i=1}^m (y^{(i)} - \theta^T x^{(i)})^2\)

  • 最大化 \(\ell(\theta)\),等价于最小化: \(J(\theta) = \sum_{i=1}^m (y^{(i)} - \theta^T x^{(i)})^2\)
  • 这就是我们熟悉的最小二乘损失函数 。因此: 在线性回归中,高斯噪声假设下的最大似然估计 ,与最小二乘估计完全等价。
相关推荐
轮到我狗叫了11 分钟前
Slurm如何使用
人工智能·python·深度学习·机器学习
段一凡-华北理工大学2 小时前
高炉炉况智能诊断与预警实战~系列文章18:预警提前量问题:过程滞后与预测窗口的权衡
服务器·网络·人工智能·机器学习·高炉智能化·炉况预警·工业预警滞后
摆烂老大2 小时前
论文学习 | HESS2025 | 中亚寒区季节水文预报
学习·机器学习·水文
知识分享小能手2 小时前
概理论与数理统计学习教程,从入门到精通,平稳随机过程(27)
学习·数据挖掘·概率论
MartinYeung53 小时前
[论文分析]使大型语言模型智能体与理性和道德偏好对齐:一种监督微调方法
人工智能·机器学习·语言模型
LadiesAndGentlemen4 小时前
GeoX 论文解读:不用人工标注,如何训练会空间推理的遥感大模型
人工智能·深度学习·机器学习
AR-26710-5 小时前
机器学习复习Day8——异常检测
人工智能·python·机器学习·scikit-learn
TAN-90°-5 小时前
Deep Learning for Computer Vision——Attention and Transformers
人工智能·深度学习·神经网络·机器学习·计算机视觉·cnn·机器翻译
2601_962387825 小时前
用Python进行机器学习(4)K-Means算法
机器学习·无监督学习·聚类算法·k-means·数据分组
workflower6 小时前
人形机器人“手”是关键
人工智能·机器学习·机器人·无人机