1. 数据分析入门:为什么需要这份资源清单?
刚入行数据分析那会儿,我花了大半年时间在各种零散的教程和视频里打转。直到有天 mentor 扔给我一份他整理的资源清单,才发现原来80%的优质内容都藏在专业社区的角落。这份清单帮我节省了至少300小时的无效学习时间。
数据分析领域有个很特别的现象:优质资源往往分散在技术博客、学术论文和行业报告中,而主流平台推荐的"热门课程"反而容易让人走弯路。真正有价值的学习路径应该包含四个维度:理论基础、工具实操、业务场景和持续更新机制。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 基础理论:构建分析思维的四大支柱
2.1 统计学核心概念精要
《统计学入门》这类教材往往过于理论化。我推荐从以下实战资料入手:
- 可汗学院统计学专题:用医疗检测、电商转化率等案例讲解假设检验
- StatQuest视频系列:用动画演示p值、置信区间的实际意义
- 《Naked Statistics》:通过NBA球员数据拆解回归分析的本质
特别注意:学习贝叶斯统计时,建议用新冠检测准确率的案例来理解先验概率与后验概率的关系,这比抛硬币的例子直观得多。
2.2 业务指标体系构建
不同行业的关键指标差异巨大:
- 电商:购物车放弃率 = 1 - (完成支付人数/加入购物车人数)
- SaaS:NDR(净留存收入) = (当期续费金额 + 增购金额 - 流失金额)/上期收入
- 制造业:OEE(设备综合效率) = 时间开动率 × 性能开动率 × 合格品率
推荐《Lean Analytics》中针对不同创业阶段的指标选择框架,以及Airbnb的数据科学家公开分享的指标分层方法。
3. 工具链实战:从Excel到PySpark的进化路径
3.1 SQL进阶技巧
多数教程只教基础语法,但实际工作中更需要:
- 窗口函数实战:用
ROW_NUMBER()解决去重问题,LAG()计算环比 - 查询优化:EXPLAIN执行计划解读,索引设计原则
- 递归CTE:处理层级数据如组织架构、评论树
推荐Mode Analytics的SQL教程,特别是他们用电商数据设计的22个渐进式案例。
3.2 Python数据分析栈
避开Anaconda全家桶安装,按需构建环境:
bash复制
