1. 初识OLS:从散点图到最佳拟合线
上周三下午,我正在处理一组销售数据,当我把广告投入和销售额的散点图画出来时,那些随机分布的点让我陷入了沉思——怎样才能找到最能代表它们关系的直线?这就是OLS(普通最小二乘法)要解决的核心问题。作为统计学中最基础的回归分析方法,OLS通过数学优化寻找最佳拟合直线,让这条线与所有数据点的垂直距离之和最小。
想象你手里拿着一根橡皮筋,试图在散点图上找到最合适的松紧程度:太紧会过度拟合某些异常点,太松又会忽略整体趋势。OLS就是帮你找到那个恰到好处的"松紧度"的数学工具。自1805年勒让德和高斯分别独立提出以来,这个方法已经服务了数据分析师两百余年,至今仍是金融、经济、社会科学等领域的标准分析工具。
关键理解:OLS不是魔法,它的本质是通过最小化误差平方和来量化变量间线性关系的强度和方向。就像用尺子量身高,OLS用数学公式"测量"变量间的关联程度。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数学原理深度拆解
2.1 核心公式与几何解释
OLS的核心目标函数简单而优美:
$$
\min \sum_{i=1}^n (y_i - \hat{y_i})^2 = \min \sum_{i=1}^n [y_i - (\beta_0 + \beta_1 x_i)]^2
$$
这个公式在做什么?它正在寻找使所有数据点的预测值(ŷ)与实际值(y)的垂直距离平方和最小的β₀(截距)和β₁(斜率)。就像调整望远镜焦距直到图像最清晰,OLS通过数学计算找到使"模糊度"最小的参数组合。
从几何角度看,OLS在n维空间(n为样本量)中寻找一个超平面,使得所有数据点到该平面的欧式距离最短。在二维情况下,这就是我们熟悉的直线拟合。我曾用Python的NumPy手动实现这个过程:
python复制def ols_fit(X, y):
X_mean, y_mean = np.mean(X), np.mean(y)
beta1 = np.sum((X - X_mean) * (y - y_mean)) / np.sum((X - X_mean)**2)
beta0 = y_mean - beta1 * X_mean
return beta0, beta1
这段代码直接对应OLS的解析解公式,避免了矩阵运算,适合理解本
