大模型第一课:手写推导线性回归的“灵魂”
大模型第一课:手写推导线性回归的“灵魂”
在深度学习和人工智能的宏大叙事中,Transformer、大语言模型动辄拥有千亿参数,令人望而生畏。但如果我们剥去这些复杂的外衣,会发现一切神经网络的基石,其实都源于一个最简单的模型——线性回归。
今天这篇博客,我们不谈复杂的框架代码,而是回归数学本质。我们将通过一份手写的学习笔记,彻底搞懂机器是如何通过“试错”来学会预测的。
核心观点:理解线性回归,就是掌握了深度学习的“第一性原理”。
一、模型的诞生:给数据画一条直线
想象一下,你是一名房产中介,手头有一堆历史成交数据(房子的面积和对应的价格)。你的目标是找到一条规律,能最好地“穿过”这些数据点,从而根据新房子的面积来预测它的价格。
这就是线性回归要解决的问题:拟合。
为了实现这个目标,我们需要定义两个核心要素:
- 输入值 (x):喂给模型的特征数据(例如:房子面积)。
- 输出值 (z):模型给出的预测结果(例如:预测房价)。
为了让 x 变成 z,我们需要两个可调节的参数——这也是模型真正要去“学习”的东西:
- 权重 ($w$, Weight):决定输入 x 对结果的影响程度。在几何上,它是直线的斜率。
- 偏置 ($b$, Bias):决定当 x=0 时的基础值。在几何上,它是直线的截距。
于是,我们得到了机器学习界最经典的公式:
💡 笔记划重点:这个简单的线性公式,就是所有神经网络神经元计算的雏形。
二、怎么才算“学得好”?引入 Loss 函数
模型给出了预测值 z,但怎么知道它准不准呢?我们需要一个“裁判”来打分。这个裁判就是损失函数(Loss Function)。
同时,我们需要一个参照标准——目标值 (Y, Ground Truth),也就是真实答案(例如:房子的实际成交价)。
笔记中使用了最直观的均方误差(MSE)思想。为了简化推导,我们只看单个样本的误差平方: