拿到一串离散的位置点,怎么把速度算出来?这个问题我太熟了。做物理实验、处理传感器数据、分析运动轨迹的时候基本都会遇到——你以为不就是相邻两点距离除以时间嘛,等你真正把代码跑起来,看到那张抖成心电图的速度曲线,就知道这事没那么简单。今天就把我从“直接diff被噪声教做人”到“一套完整可落地的方案”的实战经验整理出来,覆盖离散数据求速度的数学原理、方法选型、Python实现和避坑技巧,适合正在处理实验数据的学生、做信号处理的工程师,以及任何被离散微分困扰的朋友参考。
1. 离散数据里的“速度”,先把定义掰扯清楚
1.1 连续求导和离散差分,差在哪
先说个根本问题:速度的物理定义是位移对时间的变化率,连续情况下就是求导,v(t) = dx/dt。但工程里几乎没有真正的连续函数,拿到手的永远是一个个离散的采样点——传感器每秒采 10 次、100 次,或者实验测得一组位置-时间对。这时候微积分教材里那套求导规则直接失效了,因为我们根本不知道采样点之间物体是怎么运动的。
离散求速度,本质上不是“求导”,而是“估计导数”。我们假设相邻两个采样点之间近似做匀速直线运动,然后用差分去逼近真实的导数。差分是用函数值的差除以自变量的差,它是导数定义里那个极限还没取的样子。
这里有个核心认知必须建立:离散差分算出来的速度,天然带有误差。误差来自泰勒展开中那些被丢掉的更高阶项。举个直观例子,假设真实运动是匀加速直线运动 x = t²,在 t=1 附近用不同差分方式算速度,结果会明显偏离真实值 v(1)=2。这不是代码写错了,是离散化本身的信息损失,任何算法都绕不开。
1.2 三种基础差分:前向、后向、中心差分
搞清楚这个,再看具体怎么算。假设位置序列是 x₀, x₁, x₂, …, xₙ,对应时间戳是 t₀, t₁, t₂, …, tₙ,时间间隔均匀为 Δt。有三种最基础的差分方式:
前向差分:vᵢ = (xᵢ₊₁ - xᵢ) / Δt
后向差分:vᵢ = (xᵢ - xᵢ₋₁) / Δt
中心差分:vᵢ = (xᵢ₊₁ - xᵢ₋₁) / (2Δt)
用泰勒展开能分别算出它们的截断误差。前向和后向差分只保留了泰勒展开到一阶项,误差是 O(Δt),也就是时间间隔越小误差越小,但只按线性缩小。中心差分把前后两项一减,二阶项抵消掉了,误差直接变成 O(Δt²),同样的采样间隔,精度高一个量级。我把它们的特性整理在下面:
| 差分方式 | 公式 | 截断误差 | 优点 | 缺点 |
|---|---|---|---|---|
| 前向差分 | (xᵢ₊₁ - xᵢ) / Δt | O(Δt) | 只用未来点,适合实时计算 | 精度低,有一阶滞后 |
| 后向差分 | (xᵢ - xᵢ₋₁) / Δt | O(Δt) | 只用过去点,适合实时计算 | 精度低,滞后方向不同 |
| 中心差分 | (xᵢ₊₁ - xᵢ₋₁) / (2Δt) | O(Δt²) | 精度高,无系统滞后 | 需要前后各一个点,无法处理边界 |
实操里,如果数据是离线处理的,且位置数据本身比较干净,中心差分是首选。它在频域上的特性也更好——不会像前向差分那样给整个速度信号引入一个偏移或相位畸变。但如果做的是实时系统,比如机器人控制回路里要当前时刻的速度,那就只能用前向或后向差分,因为中心差分需要等下一个采样点到来才能算,天然有延迟。
1.3 时间间隔不均匀怎么办
很多真实场景里,采样时间戳并不是均匀的。嵌入式系统的中断调度有抖动,GPS 数据的输出时刻也经常漂移,甚至数据预处理时还会丢包。这时候如果直接按下标当等间隔处理,算出来的速度会带进一层额外误差。
正确做法是:差分时必须用真实时间戳。中心差分的通用形式是:
vᵢ = (xᵢ₊₁ - xᵢ₋₁) / (tᵢ₊₁ - tᵢ₋₁)
也就是说,分子上算位置差,分母上用前后两个真实时间戳之差,而不是 2Δt。有人觉得这不就多写个变量吗?实际工程里这个细节非常关键——我用过一个采样率标称 100Hz 的惯导模块,实测相邻时间戳间隔在 8ms 到 13ms 之间波动,如果粗暴按 10ms 算,速度误差最高能到 30%。把这些波动引入分母后,结果稳得多。
不均匀时间戳还有个需要注意的地方:时间戳本身的精度。有的数采系统时间戳精度只有毫秒级,100Hz 采样时相邻间隔就只有 10ms,时间戳量化误差本身就是 1ms,相当于 10% 的不确定度。如果遇到这种情况,单纯靠差分很难救回来,需要考虑对位置-时间序列做拟合平滑后再求导,这个方案的细节在第 3 节展开。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 差分看着简单,噪声会把你坑惨
2.1 为什么差分会放大噪声:数学账算清楚
理论上差分没问题,但真实传感器数据里都有噪声。位置噪声本身可能不大,可一旦做差分,噪声会被剧烈放大。这里面的数学原理值得展开讲讲,理解了它,你就明白为什么不能拿到数据就 diff。
假设每个位置测量值 xᵢ 都叠加了一个随机噪声 εᵢ,噪声均值为零、标准差为 σ。用前向差分算速度时:
vᵢ = (xᵢ₊₁ - xᵢ) / Δt = (真实速度贡献) + (εᵢ₊₁ - εᵢ) / Δt
两个独立噪声项相加,方差翻倍,所以差分后噪声标准差变成 √2 · σ / Δt。看这个分母 Δt——采样率越高,Δt 越小,噪声放大得越厉害。100Hz 采样时,位置噪声标准差 1mm,差分后速度噪声就是 1.414 × 0.001 × 100 ≈ 0.141 m/s。1 毫米的位置抖动,在速度上能放大成 14 厘米每秒的抖动。如果采样率到 1000Hz,那就是 1.4m/s。这就是“高频采样看似数据更多,直接差分反而更糟”的原因。
从频域角度看更清楚:差分算子本质是一个高通滤波器,对高频分量的增益随频率线性增大。真实的速度信号通常集中在低频段,而噪声是宽频带的白噪声,高频部分占比很高。差分之后,高频噪声被大幅抬升,信噪比急剧恶化,速度曲线自然就毛糙得像心电图。中心差分也一样存在这个问题,它的噪声增益略小,但本质上没有改变高通放大的特性。
2.2 先平滑再差分:三种主流做法的取舍
明白了噪声放大的机理,解决方案的思路自然就出来了:要么先压低噪声再差分,要么用一个对噪声更鲁棒的方法直接估计速度。先说最常用的“先平滑再差分”。
移动平均:对位置序列做 N 点滑动平均,再看差分。实现最简单,三五行代码搞定,但代价是平滑会让真实信号边缘变钝、峰谷变矮,引入相位滞后。N 越大,滞后越明显。适合噪声不特别强、对实时性要求不高的场景,不太建议用在需要精确速度峰值的场合。
Savitzky-Golay 滤波:这个我用得最多。它的思路是,在滑动窗口里用一个多项式对局部数据做最小二乘拟合,用拟合多项式在中心点的导数值作为该点的速度。它同时完成了“平滑”和“求导”两步,而且能够较好地保留信号的峰值和宽度,比移动平均再差分的组合效果好很多。Python 里 scipy.signal.savgol_filter 一行代码就能算,窗口大小和多项式阶数决定了平滑程度和保真度之间的平衡。
低通滤波:先对位置信号做数字低通滤波(比如 Butterworth),把高频噪声滤掉,再对滤波后的信号做中心差分。这是频域思路,参数直观好用,截止频率一设,高于该频率的成分直接压掉。但要注意相位失真问题——普通 IIR 低通滤波会让信号整体偏移,离线处理时应该用 filtfilt 做零相位滤波。这个方法对噪声类型和截止频率的选择比较依赖经验,后面我会细说参数怎么定。
2.3 拟合再求导:听起来绕,实际很实用
平滑差分之外,还有一个思路值得掌握:先对位置-时间数据做函数拟合,得到一条连续曲线,再对这条曲线解析求导。这种方法特别适合位置轨迹整体比较平滑、不需要逐点实时输出的场景。
具体做法是用样条拟合。把位置看成时间的函数 x(t),用三次样条插值或者带平滑参数的样条去拟合数据,然后直接对样条函数求导,得到速度函数 v(t),在任何时刻都能取值。scipy.interpolate.UnivariateSpline 提供了内置的 derivative 方法,用起来非常顺手。
我印象最深的一次应用是分析一个弹簧振子的阻尼运动。数据是高速相机拍到的位置轨迹,采样率高但每帧的坐标提取都有亚像素级抖动。直接用中心差分,速度曲线尾部的衰减过程被噪声完全淹没;改用平滑样条拟合后再求导,阻尼比和频率都能稳定算出来。原因在于样条拟合天然做了全局平滑,相当于用整个数据集的信息来约束每一点的速度,而不是只看相邻两三个点。代价是如果原始数据本身有突变或剧烈变速,样条会把这些细节抹掉,所以要先观察数据的运动特征再决定用不用拟合路线。
3. 一套能直接上手的实操方案:从数据到速度曲线
3.1 完整流程:五个环节一个都不能少
说了这么多原理,搭一套能用的流程才是关键。我习惯按下面的顺序来处理:
第一步,数据清洗。先检查位置序列里有没有明显的异常跳变——比如 GPS 突然偏离几十米、编码器计数清零、遮挡导致的目标丢失。这些异常值不处理掉,后面差分会直接炸出几个巨大的尖峰。我的做法是先画出位置-时间曲线,肉眼看一遍,再用 3σ 准则或者中值滤波自动剔除离群点。
第二步,时间戳校准。确认时间戳的单位是秒、毫秒还是微秒,检查时间间隔的均匀性。打印出 dt 序列的均值、标准差、最大最小值,如果波动达到或超过一个数量级,流程就会偏向拟合方法。
第三步,方法选型。数据干净、间隔均匀,直接中心差分;数据有噪声但运动不算过快,Savitzky-Golay;数据轨迹平滑、需要连续速度函数,样条拟合;实时系统,只能用因果的前向或者后向差分配合低延迟滤波。
第四步,参数调优与计算。根据数据的噪声水平和运动带宽定窗口和阶数,跑出速度序列后,把位置和速度画在同一张图里,从物理常识上校验——比如位移单调上升时速度不应该剧烈上下穿零。
第五步,结果验证。如果有参考值(比如光电门测到的某段平均速度、转台上已知的速度波形),一定要对比误差。没有参考值,至少做一次残差分析——用算出来的速度数值积分回去,看和原始位置差多少。
3.2 Python 实现:几种方案的代码对照
下面给出一份完整的 Python 示例,用同一组仿真数据对比不同方法的表现。先模拟一个匀加速带噪声的位置信号:
python复制import numpy as np
import matplotlib.pyplot as plt
from scipy.signal import savgol_filter, butter, filtfilt
from scipy.interpolate import UnivariateSpline
# 生成仿真数据:匀加速运动 + 高斯噪声
fs = 100 # 采样率 100Hz
t = np.arange(0, 10, 1/fs)
a = 0.5 # 加速度 0.5 m/s^2
x_true = 0.5 * a * t**2 # 真实位置
x_meas = x_true + np.random.normal(0, 0.005, size=t.shape) # 叠加5mm噪声
# 方法1:直接中心差分(numpy.gradient 默认中心差分)
v_center = np.gradient(x_meas, t)
# 方法2:Savitzky-Golay 平滑后求导
window = 21 # 窗口长度,必须为奇数
polyorder = 3 # 多项式阶数
v_sg = savgol_filter(x_meas, window, polyorder, deriv=1, delta=t[1]-t[0])
# 方法3:低通滤波 + 中心差分
b, a = butter(4, 5/(fs/2), btype='low', output='ba') # 截止频率5Hz
x_filt = filtfilt(b, a, x_meas) # 零相位滤波
v_butter = np.gradient(x_filt, t)
# 方法4:平滑样条拟合求导
spl = UnivariateSpline(t, x_meas, s=0.0005) # s控制平滑程度
v_spl = spl.derivative()(t)
# 真实速度
v_true = a * t
代码注释里已经标了关键参数。跑完之后可以计算每种方法相对于真实速度的均方根误差,我实测这组数据下,直接中心差分会因为噪声放大导致速度波动很大,均方根误差可能超过 0.15 m/s;Savitzky-Golay 用 21 窗口 3 阶多项式,误差能压到 0.03 m/s 左右;样条方法在合理选择 s 的情况下误差和 SG 相当,但能输出任意时刻的连续速度。把曲线画出来观察,SG 和样条的结果明显更贴近真实速度,而且峰值没有明显削平。
3.3 参数选择心得:窗口、阶数、截止频率怎么定
参数选择是实践中问得最多的问题。直接给结论:Savitzky-Golay 的窗口长度 L 通常取采样频率的 1% 到 5% 对应的点数——100Hz 采样时 10~20 个点就是 0.1~0.2 秒的窗口。窗口越大平滑越强,但对快速变化的运动响应越慢。多项式阶数一般取 2 或 3,高阶能保留更多细节但对噪声也更敏感,我一般先试 3 阶,看速度曲线不够平滑再调大到 5 阶试试,但很少超过 5 阶。
低通滤波的截止频率怎么定?纯经验会翻车,正确做法是看目标信号的频谱。先对位置信号做一次 FFT,观察能量集中在哪个频段,把截止频率设置在信号主要能量频段的 1.5~2 倍处。比如一个慢速移动的机器人,位置变化频率集中在 1Hz 以下,截止频率设 2~3Hz 就够了;如果是高频振动测量,就得设到几十赫兹。盲目设一个低截止频率,会把真实的快速运动“削”成平滑曲线,算出的加速度根本不反映真实物理过程。
样条拟合的平滑参数 s 也是同理。UnivariateSpline 中 s 如果设为 0,就是严格经过每个采样点的插值,噪声完全保留,求导结果和中心差分差不多;s 设太大,曲线过度平滑,真实运动特征会被抹掉。我常用的经验法是:s 取位置噪声方差的 1~2 倍,或者根据残差平方和来决定——不断增加 s,直到拟合曲线与原始数据之间的残差不呈现明显相关性。
4. 踩坑实录:常见问题与排查技巧
4.1 速度曲线毛刺多,抖成“心电图”
这个现象我最早处理 GPS 轨迹数据时遇到过,当时刚入行,拿位置直接一阶差分,出来的速度曲线完全没法看,5m/s 的真实车速抖出了 ±20m/s 的假尖峰。排查步骤很有代表性:
先看原始位置曲线的抖动幅度。把位置-时间图画出来,如果曲线本身就有毛边,说明传感器噪声大,必须走平滑路线。再看有没有异常跳点——GPS 掉线后再重连的瞬间位置可能有几十米突变,这时候先要做异常值剔除,而不是上滤波。剔除异常值可以用中值滤波加阈值判断:计算每个点与前后 5 点中位数的差值,超过 3 倍 MAD(绝对中位差)的标记为异常,用中位数替换或者直接插值。
处理完异常值,再按第 3 章的流程做 SG 滤波或样条拟合。注意顺序不能反:先清洗异常值再滤波平滑,如果先滤波,异常跳点会被“摊开”到附近很多个点,后续怎么处理都带着残余影响。
4.2 计算结果和标定速度对不上
有一类问题更隐蔽:算法没错,但速度值和参考值就是系统性偏差。排查时我会按“时间戳单位 → 时间基准偏移 → 传感器延迟”的顺序往下查。
最常见的就是时间戳单位搞错。数采系统导出的时间列,有的是秒,有的是毫秒,还有的是微妙。100Hz 采样下相邻时间戳如果是 10ms,你按 10s 去当分母,速度直接缩水 1000 倍。代码里把 t 的单位统一成秒,这一条检查完能解决一半的“速度对不上”。
第二个常见原因是时间基准偏移。传感器输出的时间戳不是从 0 开始的,而是从某个绝对时刻开始,计算 Δt 时用相邻时间戳相减,绝对基准会抵消掉,所以单纯求速度不受影响。但如果系统里有两个传感器,一个位置信号和一个参考速度来自不同设备,两者之间存在固定时间延迟——比如视频帧曝光时刻和 GPS 数据时刻差了几十毫秒——这个延迟会在差分后的速度和真实速度之间引入相位差,尤其变速运动时同一时刻速度对比差得非常多。排查方法是做互相关分析,把位置信号的差分结果和参考速度信号做互相关,看峰值偏移量,那就是延迟的时间长度。
4.3 边界点速度异常,首尾总出鬼
中心差分在序列首尾各少一个点,很多初学者直接跳过不管,但边界点偏偏是速度和位置计算里最容易出问题的区域。处理方式有以下几种:
- 首点用前向差分,末点用后向差分,保证点数不丢失;
- 用邻近两个点的平均值补边界:v₀ = v₁;
- 离线处理时直接丢弃首尾各 2~3 个点,大多数情况下这是最省事的选择。
工程实践里我强烈推荐最后一种。边界点的速度本来就受边界效应影响,滤波类的算法(不管是移动平均还是 SG)在边界处的行为也不稳定,与其纠结边界多出来的一个点,不如直接丢掉,保证中间数据最可靠。出来结果描述整体运动规律时,边界点的差异也基本不影响结论。
4.4 常见问题速查表
把实践中频率最高的几类问题整理成一张表,排查时先对着过一遍:
| 现象 | 可能原因 | 排查与解决方案 |
|---|---|---|
| 速度曲线毛刺剧烈 | 位置噪声被差分放大 | 先剔除异常值,再用SG滤波或样条拟合求导 |
| 速度整体偏小 | 时间戳单位是毫秒却被当成了秒 | 统一时间戳单位为秒,打印dt验证 |
| 速度整体偏大 | 时间戳单位是秒却被当成了毫秒 | 同上,检查单位换算 |
| 速度波形有固定相位偏移 | 传感器之间存在时间延迟 | 做互相关分析,对齐信号后再差分 |
| 速度峰值被削平 | 平滑窗口偏大或截止频率偏低 | 减小窗口/阶数,基于频谱重新定截止频率 |
| 首尾速度异常高或异常低 | 中心差分边界问题 | 丢弃首尾若干点或采用单向差分 |
| 速度值在零附近随机跳动 | 静止时传感器自身噪声 | 增加滞回阈值,或先平滑到噪声水平以下 |
4.5 最后一个经验之谈
处理这类问题做了七八年,我最大的体会是:先看数据再选方法,永远比自己写一个漂亮算法更重要。拿到离散位置序列,第一件事不是上代码,而是把位置-时间曲线画出来,用眼睛观察它的抖动程度、有没有跳变、时间戳间隔是否均匀、运动是匀速还是快速变速。这三个观察结果直接决定了你应该走中心差分、SG 滤波、低通滤波还是样条拟合的路线。
另一个重要的习惯是,算完速度必须做一次反向验证。把速度曲线数值积分,看能不能恢复出原始位置轨迹。如果积分回推的位置和原始位置偏差随时间不断累积,那速度计算结果多半有问题;如果回推轨迹与原始数据基本重叠,那这个速度就靠谱。这个验证步骤只要多写三行代码,却能帮你挡住绝大多数低级错误。我自己养成了这个习惯之后,算法返工率降低了不止一半。
