1. Python3 statistics模块入门指南
统计计算是数据分析的基础工作,Python标准库中的statistics模块为开发者提供了便捷的统计计算功能。这个模块从Python 3.4版本开始引入,专门用于处理数值型数据的常见统计运算,避免了依赖第三方库的麻烦。
在实际项目中,我们经常需要对数据集进行快速统计分析。比如计算销售数据的平均值、分析用户年龄的中位数、评估产品评分的离散程度等。statistics模块正是为解决这类基础统计需求而设计,它包含了均值、中位数、方差、标准差等常用统计量的计算方法。
与numpy、pandas等第三方库相比,statistics模块的优势在于:
- 无需额外安装,Python标准库自带
- 接口简单直观,学习成本低
- 对小型数据集处理效率高
- 支持多种数值类型(int、float、Decimal、Fraction)
提示:对于大型数据集或复杂统计分析,建议使用numpy或pandas等专业库。statistics模块更适合快速计算和小型数据集处理。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心功能详解
2.1 集中趋势度量
集中趋势指标反映数据分布的"中心"位置,是最常用的统计量。
均值计算函数:
mean(): 计算算术平均数harmonic_mean(): 计算调和平均数geometric_mean(): 计算几何平均数
python复制from statistics import mean
data = [1, 2, 3, 4, 5]
avg = mean(data) # 返回3.0
中位数计算函数:
median(): 计算中位数(中间值)median_low(): 计算低中位数median_high(): 计算高中位数median_grouped(): 计算分组数据的中位数
python复制from statistics import median
data = [1, 3, 5, 7]
med = median(data) # 返回4.0
众数计算函数:
mode(): 计算众数(出现频率最高的值)multimode(): 返回所有众数的列表(Python 3.8+)
python复制from statistics import mode
data = [1, 2, 2, 3, 3, 3]
m = mode(data) # 返回3
2.2 离散程度度量
离散程度指标反映数据的波动情况。
方差与标准差:
variance(): 计算样本方差stdev(): 计算样本标准差pvariance(): 计算总体方差pstdev(): 计算总体标准差
python复制from statistics import stdev
data = [2, 4, 6, 8, 10]
std_dev = stdev(data) # 返回3.1622776601683795
极差相关:
- 模块本身不提供极差函数,但可以轻松实现:
python复制data = [1, 3, 5, 7]
data_range = max(data) - min(data) # 返回6
2.3 其他实用函数
协方差与相关系数:
covariance(): 计算协方差(Python 3.10+)correlation(): 计算皮尔逊相关系数(Python 3.10+)
python复制from statistics import covariance
x = [1, 2, 3, 4, 5]
y = [2, 4,
