学数据结构的人,十有八九第一波接触的不是树,不是图,而是一张“表”。这话听起来像废话,但真正把一大片人卡住的正是这张表:为什么有的版本叫顺序表,有的版本又用指针串成一串?明明课上还分得清,结果一打开《数据结构(C语言版)》,顺序表、链表、哈希表、树表一起涌过来,瞬间就乱了。更别提很多人学完一遍,到复习考研、准备软考,甚至工作中遇到数据库的行锁和索引时,才后知后觉——原来当年背的那些“表”不只是在卷面上写代码用的,它一直在替真实系统扛流量。
这篇文章我想从从业者的角度,把“表”这条线彻底捋一遍。不仅讲清楚顺序表、链表、哈希表、树表各自是什么、怎么实现、怎么选,也会带着你看它们如何在工程里落地:从 ArrayList 的扩容到 MySQL 的索引,从数码管的段码表到写业务时动不动就爆出来的锁表问题。不管你是在校学生、准备考研和软考的老哥,还是已经写了两年代码却始终没把基础补上的朋友,照着这条线读下来,应该都能把脑子里那几块碎知识重新拼起来。
1. 先搞明白:数据结构里的“表”,到底是什么
在聊顺序表还是链表之前,我建议大家先把“表”这个字看透。很多人学结构学到最后懵,不是操作不会写,而是从来没有人告诉你,怎么判断一个东西到底属不属于“表”。
1.1 一张表有两层含义:逻辑关系与物理存储
数据结构里讲“表”,通常绕不开两个词:逻辑结构和存储结构。
逻辑结构描述的是数据之间的抽象关系。比如一个班四十个学生的名单,按学号排成一列,第一个人之后是第二个人,这就是典型的线性关系。线性表就是这样一个抽象概念:一串有先后次序的数据元素。
而物理存储决定这些数据在内存里到底怎么放。你可以把这四十个名字按顺序抄在一个长条本子上,也可以给每个人做一张卡片,再用绳子按顺序穿起来。前者是连续空间,差不多就是顺序表;后者是分散空间但彼此之间用指针关联,对应的就是链表。
所以顺序表、链表都用来表达线性表,但它们是线性表的两种不同存储结构。很多人背了一堆“顺序表优缺点”却没背到这个点,结果题目一变就废。只要能先分清“逻辑 vs 存储”,后面再看到各种变形,大脑就不会先宕机。
1.2 从线性表到散列表、树表:为什么它们都叫“表”
“表”这个字在实际使用中语义很宽。除了严格的线性表,我们还会看到哈希表、树表、跳表。它们在逻辑上并不都是线性的,为什么也带了“表”字?
我的理解是:凡是把一批数据组织起来、并且提供一套增删改查规则的容器,在计算机领域都可以泛称为表。哈希表不强调元素的先后顺序,但它强调“根据键快速找到对应值”,本质上是一种符号表;树表是利用树形结构让数据保持某种有序性,方便排序和范围查询。
理解这个大家族之后,你会发现许多看起来无关的技术其实是表哥表弟。比如为一张表创建索引,底子可能是 B+ 树;写单词频率统计程序,核心可能是哈希表;OD 门驱动数码管时用数组存好段码,那就是典型的表驱动。先建立这个整体感,再往下拆零件,才不会越学越碎。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 顺序表:最朴素的那张“表”,为什么有时又慢又不方便
顺序表是大家接触的第一个具体实现。说白了,它就是一片连续的存储空间,常见实现其实就是一个数组。很多语言里的动态数组,比如 Java 的 ArrayList、C++ 的 vector,本质都是带有扩容机制的顺序表。
2.1 内存里的一段连续空间,决定了它的天生优势
顺序表最大的特征就是“物理连续”。这句话带来一个非常重要的能力:随机访问。只要给定下标 i,编译器就能通过一个非常简单的公式直接定位到目标元素:
地址 = 起始地址 + i × 单个元素大小
因为在连续内存里,基址加偏移就是一次寻址,不管这张表里有一百条数据还是一百万条数据,访问第 i 条的时间都一样。时间复杂度是稳稳的 O(1)。
用 C 语言写一个最简单的顺序表结构,常常是这个样子:
c复制#define INIT_CAPACITY 4
typedef struct {
int *data;
int length; // 当前元素个数
int capacity; // 当前分配容量
} SeqList;
这里的 data 就是一块连续内存。第 0 个元素、第 1 个元素在物理上紧挨着,所以 CPU 在遍历时也能利用缓存预读机制,把后面的数据提前搬进高速缓存。这也是为什么在多数场景下,顺序表的遍历速度会明显快过链表。实际操作中那一点点“数组比链表快”的体感,根子就在连续内存带来的缓存友好性。
2.2 插入删除为什么是 O(n):移动元素的代价绕不开
顺序表看着简单,但它有一个绕不开的短板:在中间插入或删除数据时,必须挪动后续元素。
为什么需要挪?因为数据元素必须保持连续,不能中间空一个洞。比如数组里现在是 [1, 2, 3, 4, 5],我想把 99 插到下标 2 的位置。为了保证 2 后面还是连续的,需要先把 3、4、5 整体往后挪一格,再把 99 放进去。反过来删除也一样,后续元素需要往前补。
插入到不同位置,移动个数差很多。插入尾部的幸运分支是一个元素都不用移动,插入头部则是把整个数组都往后跌一格。如果每个位置插入概率相等,平均移动次数就是 n/2。这个推导不难:插入位置 0、1、2……n 共有 n+1 种可能,分别需要移动 n、n-1……0 个元素,求和后除以 n+1,大约是 n/2。所以顺序表插入的平均时间复杂度是 O(n)。
实际写代码时很多初学者容易忘记判断表满。表满了不处理,要么越界,要么悄悄覆盖了别的内存。我自己的习惯是先把容量检查放到函数入口层,满了就先扩容,再做插入逻辑。
c复制int insertAt(SeqList *list, int pos, int value) {
if (pos < 0 || pos > list->length) return -1;
if (list->length >= list->capacity) {
if (expand(list) != 0) return -1;
}
for (int i = list->length; i > pos; i--) {
list->data[i] = list->data[i - 1];
}
list->data[pos] = value;
list->length++;
return 0;
}
所谓“顺序表适合查询多、增删少”的场景,本质上就是随机访问 O(1) 与中间插入 O(n) 之间的权衡,想清楚了自然就记住了。
2.3 动态扩容:看似简单,却藏着一次性大开销
静态数组容量不够就傻了,所以工程里用的是动态扩容。扩容最直白的操作就是申请一块更大的内存,把原数据搬过去,再释放旧空间。C 语言可以借助 realloc 做到,但 realloc 并不保证一定在原地址向后扩,堆上空间不足时它会重新找一块更大的连续内存并把数据原样搬走。因此扩容这个动作本身是 O(n) 的。
问题来了:如果每次插入都要搬一次,性能会非常拉胯。于是动态数组通常采用倍速扩容,比如容量到 4 插满了,下次直接扩到 8;再满扩到 16;这样一步步把扩容次数降下来。把扩容的总开销摊到整个生命周期里,每次插入的“平均代价”仍然是 O(1)。数据结构里管这种分析叫均摊复杂度。
实际开发中还有一个高频坑:扩容会导致原来持有的内存地址失效。C++ 里面如果一边用一个迭代器,一边往 vector 里 push_back,只要触发扩容,迭代器就指向一块被释放的内存,再用就是未定义行为。Java 的 ArrayList 虽然封装了内存搬家,但从 ArrayList 拿到的 Iterator 在结构性修改后也会抛 ConcurrentModificationException。这些都是“动态顺序表搬动元素”这件事在真实代码里的回声。
3. 链表:把表拆成一个一个节点,再串起来
顺序表的问题并不是慢,而是“挪动数据”这个动作太伤。链表换了一个思路:不要求数据在内存里相邻,而是每个节点存好下一个节点的地址,用指针把它们串成一条链。
3.1 单链表的结构和一个容易被忽略的头结点
单链表最基础的节点设计通常是:
c复制typedef struct Node {
int data;
struct Node *next;
} Node;
这种结构的问题在于:实际操作链表经常要删除第一个节点或从头插入。如果没有头结点,那 head 本身可能变化,函数里就要用二级指针,非常烦。一个常见的解法是加一个不存业务数据的头结点(dummy head),真正的首元节点从 head->next 开始算。头结点让空表和非空表的代码统一起来,插入删除时不需要单独讨论“是不是第一个节点”。
很多考研和软考的代码题都喜欢在这一层做文章。你不需要所有题都用二级指针硬刚,可以在解题前先自问一句:我这里有没有必要造一个哨兵节点?凡是涉及头插、头删的场景,造一个 dummy 头节点基本都能让代码短一半,出错率也会低很多。
3.2 插入、删除、反转:三个必须手写会的基本功
链表最核心的操作就是改指针,而改指针最关键的只有一条:别把还没处理的节点弄丢。
以单链表在第 prev 个节点后面插入一个新节点为例,正确顺序是先把新节点的 next 指向 prev 原来的后继,再让 prev 的 next 指向新节点。写成代码就是:
c复制Node *insertAfter(Node *prev, int value) {
Node *node = (Node *)malloc(sizeof(Node));
node->data = value;
node->next = prev->next;
prev->next = node;
return node;
}
这两条语句顺序是死的。如果先执行 prev->next = node,那原来的后继节点就永远找不回来了,后面再接着写 node->next = prev->next 等于把 node 自己指向了自己。链表操作里翻车最频繁的,十有八九都是这种“改链前没先记录后继”的错误。
删除节点则同理,要删除 prev 后面的节点时,先把目标节点拎出来,再把 prev->next 跨过去指向下一个节点,最后释放内存:
c复制void deleteAfter(Node *prev) {
if (prev == NULL || prev->next == NULL) return;
Node *del = prev->next;
prev->next = del->next;
free(del);
}
链表反转是另一个几乎年年出现的点。不用额外开数组,三指针就地反转即可:cur 指向当前节点,pre 是它的前驱,nxt 先记下 cur 的下一站,防止断链。核心循环就是每次让 cur->next 指回 pre,然后三个指针集体往后挪一步。动手画一遍链表图比背代码可靠得多,指针的走向在纸上是“看得见”的。
3.3 链表的代价:别被“插入删除快”这几个字骗了
教科书里经常写链表插入删除快,数组插入删除慢。单独看这个说法其实有语病。链表只修改相邻节点的指针就能完成插入删除,但如果要在链表中间插入一个值,你首先得从头遍历找到插入位置,这一步本身就是 O(n)。顺序表虽然插入要挪数据 O(n),但查下标是 O(1)。两者综合下来,在不要求数据有序时,纯看单次中间插入,并未体现出明显优势。
那链表真正赢在什么地方?我总结下来主要是这三点:
- 头部反复插入删除时,链表 O(1),顺序表每次都要把整个数组往后挪。
- 元素对象很大,拷贝成本高时,链表只需改指针,不用整体搬移数据。
- 数量级无法预估,又不希望提前申请大片连续内存时,链表内存随用随分配更灵活。
但链表也有硬伤。每个节点都需要额外的指针空间;节点在堆上随机分配,遍历时缓存命中率低;而且因为没有下标,无法直接跳到第 k 个元素,只能一个个走。真实工程里很多地方放弃链表而选择动态数组,一个重要原因就是“缓存不友好”。如果你未来去写高性能组件,会发现有时候理论上的复杂度不重要,CPU 怎么搬数据才更重要。
4. 哈希表与树表:当“表”不再按顺序存
讲到第三章,线性表的基本盘就算搭完了。但前文说过,“表”这个词宽得很,哈希表和树表也属于表家族。它们解决的核心问题不再是如何维护顺序,而是如何更高效地查找。
4.1 哈希表:让查找从“比较”变成“计算”
数组能做到 O(1) 随机访问,凭的是下标。但现实中我们要找的数据通常不叫“下标”,而叫学号、姓名、订单号。哈希表的本质就是通过一个哈希函数,把这些键映射成数组下标。
比如一个班最多一百人,学号是两位数字,理论上可以把学号后两位直接当下标,这样查某个学号的信息只需要一次数组访问。如果键是字符串,就需要设计一个函数把它算成一个整数,再对数组长度取模。哈希函数做得越好,不同 key 得到的下标越分散,哈希表就越接近 O(1)。
写统计单词频率这类程序时,哈希表是显而易见的选择。逐词读入,每遇到一个新词就把它放进表里,再把对应计数加一。如果用顺序表,每来一个词都要遍历一次已有表找它是否出现过,复杂度直接退化成 O(n^2)。换成 Python dict,底子就是一张哈希表,写起来非常干净:
python复制from collections import Counter
with open("text.txt", "r", encoding="utf-8") as f:
words = f.read().split()
freq = Counter(words)
这句话背后做的工作,本质就是“建一张词频表”。当年我拿中文文本做过类似的词频统计,处理几十 MB 文本时哈希表仍然能撑住,换成纯数组线性查找早就卡死了。
4.2 哈希冲突的两种处理思路
哈希函数再努力,也不可能做到给每个 key 分配唯一的桶。两个不同的 key 映射到了同一个数组下标,这就是哈希冲突。工程上处理冲突主要有两条路线:
第一是开放地址法。发生冲突后,就去数组的后一个位置找空位,如果后面还有冲突就继续往后探测,专业叫法叫线性探测。这种方式不需要额外分配节点,但删除数据时不能物理清除,否则会断开后面元素的探测链,只能做一个“已删除”标记。处理不好还会引发一次冲突聚集一片的问题,隐患不小。
第二是链地址法。数组每个桶里不直接存元素,而是存一条链表(或者树)的头指针。冲突了就把新元素挂到同一条链上。绝大多数语言的标准库走的都是这条路:Java 的 HashMap、C++ 的 unordered_map、Python 的 dict 背后都结合了桶数组和冲突链。Java 8 之后,当链表长度超过 8 且数组容量达到 64 时,链表会转成红黑树,目的就是防止一个桶上链太长发生产能退化。
这里有个参数非常关键:负载因子。负载因子 = 元素个数 / 桶数组长度。桶太少会加剧冲突,桶太多又浪费内存。Java HashMap 默认在负载因子到 0.75 时扩容,相当于在“时间和空间”之间取了一个折中。很多人背 0.75 这个数字但不理解为什么,其实它照顾了查找性能,同时又不至于让一大半内存空置。理解了负载因子,你会自己算 Java 初始容量应该设多大。
4.3 树表:从二叉搜索树到 B+ 树
有时我们需要的不是“查某个 key 在不在”,而是按顺序取一段。比如查成绩在 80 到 90 分之间的所有学生,哈希表就帮不上忙了,因为哈希表里的元素没有顺序。这时更合适的是树表。
最基础的树表叫二叉搜索树,规则非常简单:左子树所有节点都比根小,右子树所有节点都比根大。查找时每次比较都能排除一边,平均复杂度 O(log n)。但问题也随之而来:如果按单调递增的顺序依次插入,二叉搜索树会退化成一棵只有右子树的“斜树”,查找效率就变成 O(n),跟一条链表没区别。
为了阻止这种退化,工程师们发明了 AVL 树和红黑树。它们的核心操作都离不开旋转:当树局部不平衡时,通过左旋、右旋调整结构,让树重新恢复到比较均衡的形态。Java 的 TreeMap、C++ 的 std::map 底层都用红黑树,而 C++ 标准库里的 std::unordered_map 则是哈希表。这两者经常被拿来对比,标准答案其实是:如果没有范围查询需求,哈希表更快;如果需要按序遍历、范围查找,树表更合适。
数据库索引里大量使用另一种树表——B+ 树。B+ 树不是二叉树,而是多叉树,一个节点可以有很多孩子,所以同样的数据量下树的高度矮很多。真正的行数据全部存在叶子节点里,内部节点只存索引键;叶子节点用链表串起来,于是范围查询可以直接从一个叶子节点顺着链表往后扫。MySQL InnoDB 的聚簇索引,本质就是一张以主键为顺序、叶子节点持有完整行数据的 B+ 树表。
4.4 几种“表”怎么选:一张对比表说清楚
学完各种表之后,选择困难就开始出现了。我给自己做总结时习惯画一张对比表,把查找和插入删除的代价放在一起看:
| 表类型 | 底层思想 | 查找典型代价 | 插入/删除典型代价 | 最适合的场景 |
|---|---|---|---|---|
| 顺序表 | 连续数组 | 按下标 O(1) | 中间插入删除 O(n) | 下标访问多、数据量可预知 |
| 链表 | 分散节点 + 指针 | 按索引 O(n) | 已知位置后 O(1) | 频繁头插头删、对象拷贝昂贵 |
| 哈希表 | 桶数组 + 哈希函数 | 平均 O(1) | 平均 O(1) | 按 key 快速点查 |
| 树表 | 有序树结构 | O(log n) | O(log n) | 有序遍历、范围查询、索引场景 |
这张表是帮你建立直觉的,不是让你死背的。真到业务里选哪种“表”,往往是多种约束叠加后的平衡,比如内存占用、并发安全、是否需要持久化,这些在一张简化表里体现不出来。
5. 从课本走向工程:表的思想在真实系统里怎么落地
以前我自己学数据结构时有个毛病,觉得课本和工程是两套东西。后来写业务代码多了才意识到,工程里看似独立的组件,其实都在反复使用“表”的思路。下面挑三个最有代表性的场景聊一聊。
5.1 数据库的表、索引与锁:别再当两个知识点割裂看了
MySQL 建表之后,我们常用一条 SQL 去 update 另一张表,表面上是在操作“业务表”,但底层的执行完全没有离开数据结构和算法。InnoDB 引擎中,表数据往往按主键聚簇存储,所以按主键查询几乎可以直接从 B+ 树的根走到叶子,定位非常精准。
但如果连接条件里的字段没有索引,情况就完全不同了。为了找到需要更新的行,存储引擎可能要对整张表的聚簇索引做全量扫描。扫描的数据量大,加锁的范围也随之扩大。实际业务里经常出现的“更新一张大表,结果把整张表锁住”“一条 update 把其他会话全部堵死”,很多都跟索引没走对有关。这不是纯粹的数据结构题,而是把 B+ 树查找、锁粒度这个概念搬到了并发环境里。
排查套路也很固定:先用 EXPLAIN 看执行计划,观察是否出现全表扫描,再看关联字段上有没有可用的索引。很多时候在关联字段上补一个合适的索引,同样一条 SQL 的执行时间能从秒级降为毫秒级,锁的覆盖范围也会从整张表缩到少数几行。那些只在工具书里看的“索引优化建议”,本质上是在优化一次 B+ 树查找。
5.2 表驱动:用一张“表”干掉一长串 if else
工程里还有一种常见的“表”,不一定活在内存或数据库里,而是化身为一段静态数据。如果把一段程序的输入对应关系整理成一张二维表,就能减少大量分支判断,这种写法叫表驱动。
举个最直观的例子:数码管显示数字时,每个数字对应一组 LED 的亮灭状态,翻译成二进制的段码。比起写一大堆 if else 判断“当前数字是几然后再逐个点亮”,更简单的做法是预先定义一张数组,下标直接对应数字:
c复制// 共阴极数码管,0-9 的段码表
unsigned char seg_code[] = {
0x3F, 0x06, 0x5B, 0x4F, 0x66,
0x6D, 0x7D, 0x07, 0x7F, 0x6F
};
// 显示某个数字时直接查表
unsigned char code = seg_code[digit];
这种思想在硬件和嵌入式代码里更常见,比如摄像头模组的增益校准表、LED 亮度曲线表,本质上都是把某个物理量映射关系提前算好放进一个常量表里。而在上层业务里,状态流转、错误码、权限映射也都可以用查表代替 if else。日子久了你会意识到,很多所谓“设计模式”,背后不过是预先组织好的一张或几张表。
5.3 学课本教材时,别只盯着代码背
不管是翻严蔚敏老师的《数据结构(C语言版)》,还是跟着王道的数据结构课程刷考研题,内容量都很大。很多人第一遍会被代码细节和算法步骤淹没,觉得前面提到的顺序表、链表似乎只会出现在卷面上。我的复习建议很简单:读每一章之前,先问自己三个问题。
第一,这个结构的逻辑关系是什么?是一对一、一对多,还是散乱无顺序?第二,它用什么存储方式落地?是连续数组、分散节点、还是桶加冲突链?第三,它最擅长哪个操作,为了这个擅长它付出了什么代价?把这三个问题写在纸面,再去看具体实现,你会发现自己不再是被动接受信息。
关于严蔚敏教材和王道书的关系,我也想说点实际的。严蔚敏教材的实现非常经典,代码风格偏向底层 C,适合用来理解结构到底怎么搭,但它是 1990 年代风格的书,不适合当“现代工程代码”去抠。王道考研资料则更适合应试,把考点压缩得非常集中。如果你是为了考试,重心可以放在后面的刷题上;如果你想真正建立工程直觉,我反而建议抛开一切考试,用你熟悉的语言写一个 ArrayList、写一个 HashMap,遇到内存管理和指针问题后再回去看书,效果会好很多。
6. 高频问题与排查经验实录
最后整理几个自己做项目、带人、刷题时碰到过的典型问题。这些问题看上去不大,但每个我都见过有人卡很久,还是值得单独拿出来说一说。
6.1 数组到底算不算顺序表:一个一句话能说清的问题
这是初学者最爱问的,也很容易在面试时被冷不丁问出来。答法要分两层:从抽象数据结构角度看,顺序表是线性表的一种实现,逻辑上要支持从任意位置插入、删除、查找;而数组是程序设计语言提供的连续内存容器,本身不一定封装这些操作。从实现角度看,顺序表通常借数组来实现,因此可以说“顺序表是带操作的动态数组,数组是顺序表最常用的底层物理形态”。
听懂这句话后再去看 Java 的 ArrayList,你会发现它就是一个典型的动态数组版本的顺序表,接口层面把容量管理、边界检查都封装好了。而你手动写的 C 数组,更接近一块裸内存,要你自己维护长度和容量。两者不是同一个抽象层次的东西,却常常被当作同义词混用。
6.2 链表有环怎么检测:快慢指针真的够用吗
判断单链表有没有环,大部分人都知道快慢指针:一个指针每次走一步,另一个每次走两步,如果相遇就说明有环。这个算法有些基础,但很多人只背结论,不问为什么。
快慢指针能相遇的本质是:两个指针入环后,步长差为 1,每走一次快指针会相对慢指针逼近一个节点,所以它们早晚会重合。如果快指针改成一次走三步,理论上也能追上,但推导更复杂,而且存在两个指针正好跨过对方却始终不相遇的风险。步长 2 是最容易证明也最稳妥的选择。
如果题目再问你环入口在哪,思路也不复杂。快慢指针第一次相遇后,让一个指针从头开始走,另一个从相遇点继续走,每次都只走一步,再次相遇的位置就是环入口。这个结论可以通过数学推导验证,本质上利用了快指针走了慢指针两倍距离这个关系。我遇到很多候选人能答出“有没有环”,却答不出“环入口”,其实也就是差这一步推导。
6.3 哈希表越用越慢,冲突剧烈时怎么办
哈希表理论上平均 O(1),但如果你发现它越来越慢,第一反应应该是检查是不是哈希函数不够分散,或者负载因子已经逼近临界值。比如拿字符串长度直接做哈希,所有相同长度的字符串都会挤到同一个桶,那就是灾难。
应对方法有几条。一是给哈希函数加扰动,让低位也能体现高位的差异。Java 的 HashMap 会用 h = key.hashCode(),再把 h 右移 16 位和 h 自己做异或,就是为了让高位信息也能参与桶下标计算。二是预估数据规模,提前把容量设大,避免频繁扩容和 rehash。三是如果确认 key 分布极不均匀,可以考虑换一个更符合数据特征的哈希算法,比如对短字符串或用无序映射场景,换成更适合的乘法哈希。
踩过一次坑后,我自己的习惯是:只要知道大概数据量,创建 HashMap 时一定会显式指定 initialCapacity,而不是等它默认扩容 8 次。很多看似玄学的“列表一大了就变慢”,其实都是容量不够触发了反复 rehash。
6.4 数据库表更新慢、出现锁表,从哪个方向排查
这个问题的现场描述通常是这样的:某条 update 语句跑一次能更新几万行,执行却慢得离谱,甚至后面所有会话都卡死,数据库里一堆“Waiting for table metadata lock”或者锁等待超时。
从数据结构视角去分析,步骤其实非常清晰。先看 UPDATE 条件的字段有没有索引。如果有索引,引擎会沿着 B+ 树快速定位到符合条件的数据行,加锁范围多半只是相关记录;如果没有索引,为了找到这些行,引擎只能全表扫描,每经过一行都要加锁,锁的范围被无限放大,最终看起来就是“锁了整张表”。而在两条 SQL 并发更新同一批数据时,如果涉及关联字段无索引,还会产生相互等待。
排查时可以依次做三件事:用 EXPLAIN 查看执行计划里有没有全表扫描;查看 SQL 的 WHERE 条件和 JOIN 字段是否都存在可用索引;把大事务拆小,避免一条 SQL 把百万行的更新放在一个事务里。很多时候问题不是 SQL 写错了,而是索引选择和数据量没有一起考虑。能想通这一点,你已经把数据结构真正用在了数据库调优上。
最后,关于“表”,我能分享的一点体会
说真的,我见过很多人把复习资料背得滚瓜烂熟,顺序表和链表优劣倒背如流,可真要他在白板上写个链表反转,落笔还是断。数据结构这个学科最奇妙的地方在于,它的知识不是“看会的”,而是“画会的”。你看十遍插入排序,不如拿十张卡片在桌上手摆一遍。
如果让我给一条最小可行的学习路径,我会说:先拿数组实现一个动态数组,再拿指针写个链表,然后尝试把一批数据放进哈希表统计词频,最后把一个有序数组转成二叉搜索树并实现中序遍历。这四件事做完,“表”这个主题就算真正入门了。像顺序表扩容、链表防丢链、哈希冲突处理这些我前面反复唠叨的细节,也都会在动手时变成你肌肉记忆的一部分,而不是只躺在一个叫“期末复习”的文档里。
