面试这件事,我前前后后也当了几年面试官,又被面了很多轮。数据库这块几乎是逢面必出,而且问法大同小异,翻来覆去就是索引、SQL、事务、锁这些。但有意思的是,能把这些“常见题”真正答到点子上的候选人并不多。很多人是背了概念,一追底层原理就露馅,一问到“你线上是怎么调优的”就直接沉默了。这篇东西我不打算写成那种面经合集式的罗列,而是想换个角度,站在“面试官到底在考你什么”的位置上,把索引优化和SQL优化这两大高频板块彻底拆开揉碎讲一遍。不是为了让你背答案,而是让你理解这背后的逻辑,能接得住追问,也能真正用到项目里去。
1. 先搞懂面试官问索引的底层动机:不是考语法,是考数据结构的直觉
1.1 一条SQL慢,你为什么第一反应是加索引
面试官最爱问的一个开场白就是:“线上有条SQL很慢,你怎么排查?”很多人脱口而出“加索引”,这句话本身没错,但它暴露了一个问题——你为什么会想到加索引?如果答不上来这个“为什么”,说明你对索引的理解停留在“用着有效”的水平,而不是“知道它为什么有效”。
我在面试里其实想听到的思路是这样的:SQL慢的本质是它扫描的数据量太大了,比如一张千万级的表,你要查 where user_id = 123,如果没有索引,数据库只能把一千万行从头到尾读一遍,这个过程叫全表扫描(full table scan)。而索引本质上是给你额外维护了一份排好序的数据结构,让你能够用更少的比较次数定位到你想要的那一行。
打个比方,你有一本一万页的电话簿,但它是按“姓氏笔画”排好的,你要找“王小明”,不会从第一页翻到最后一页,而是直接翻到“王”字所在的区域,再逐步缩小范围。这就是索引干的活。而数据库里最常见、最通用的那种索引结构,用的是一棵B+树,它能保证你从根节点到叶子节点的高度基本控制在两到四层,换句话说,哪怕表里有几千万条数据,查询也只需要沿着这棵树往下走几次磁盘I/O就能找到目标。
1.2 B+树为什么能赢过哈希和二叉树
面试官如果追问“为什么MySQL的InnoDB引擎选B+树而不是哈希索引或二叉树”,这就是在考察你对数据结构和工程取舍的理解了。
哈希索引的查询速度确实是O(1),极致快,但它有两个硬伤:一是它只能做等值比较,=和in能命中,但你要查一个范围比如 age > 18 它就傻眼了,因为你没法对一个哈希表说“请把18岁以上的人枚举出来”;二是它不保序,你拿它做order by或范围查询,依然要把数据全部捞出来重新排序,等于索引白建。
二叉搜索树倒是保序的,但二叉树的层数会随着数据量增大而急剧变深,比如五百万条数据,最坏情况下树高能达到几十层,每一层都对应一次磁盘I/O,那速度一样不可接受。B+树为什么合适?因为它每个节点不是只存一个键值,而是存一批键值和一批指针,让整棵树变得又矮又胖。InnoDB默认的页大小是16KB,一个节点能塞上千个键值,两千万行的表树高通常也就三层左右,前三层大概率还能常驻内存,查询几乎不会产生随机磁盘I/O。
还有一个容易被忽略的点:B+树的所有数据都落在叶子节点上,而叶子节点之间用双向链表串了起来。这意味着你一旦定位到第一条满足条件的记录,整棵树的顺序遍历就非常舒服——沿着链表往后走就行,这对于范围查询、排序、以及InnoDB主键的聚集索引扫描都是巨大的优势。哈希索引做不到这一点,而B+树的叶子链表设计让“范围查询+排序”这件事变成了一个线性的连续I/O过程。
1.3 面试官常埋的坑:主键索引和普通索引的回表问题
顺带告诉你一个我在面试时特别喜欢用的坑:InnoDB的普通索引。假设一张用户表 user,主键是 id,上面还有一个普通索引 idx_age 建立在 age 字段上。如果执行
sql复制select * from user where age = 25;
很多人觉得这条SQL会走 idx_age,没错,确实走了。但走完索引之后它只拿到了一个东西——主键值,也就是那一行数据在主键B+树里的“门牌号”。接下来它还要拿着这批主键值,再去主键索引那棵B+树里重新查一遍完整的数据行,这个过程就叫回表(table lookup)。
回表一次两次无所谓,但如果 age = 25 命中了非常多的行,比如几十万行,那这几十万次回表就会变成一场灾难。所以面试官顺理成章就能抛出下一个问题:“那怎么避免回表?”
答案有两个方向。第一个是覆盖索引,也就是让索引里已经包含你要的所有字段。比如你执行
sql复制select id, age from user where age = 25;
由于 idx_age 这棵树里除了 age 本身,还挂了主键 id,查询所需的两个字段都能在索引树上直接拿到,不需要回表,相当于索引“覆盖”了这次的查询需求,这个索引就成了一个覆盖索引。第二个方向是合理设计你的查询条件,尽量让 select 出来的字段少一点,不要动不动就 select *,因为 * 几乎必然会把不在索引里的字段给捞出来,那就算索引建得再好,也免不了回表灾难。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 为什么你建的索引没生效:最左前缀原则和失效机制的真相
2.1 联合索引的排序规则,你得从“字典”的角度理解
面试必考的第二个点就是联合索引和最左前缀。经常有候选人跟我抱怨:“我都建了 idx_user_id_time 这个索引了,为什么下面这条SQL还是走全表?”
sql复制-- 索引建立在 (user_id, create_time) 上
select * from order_info where create_time >= '2024-01-01';
这就要从联合索引的底层排序规则说起了。联合索引 (a, b, c) 不是把这三个字段分别建索引,而是先按a排,a相同再按b排,b还相同就按c排。这特别像是字典的目录——先按首字母排,首字母一样的再按第二个字母排。换句话说,你的查询条件必须遵循这个“字典”的顺序才能高效地使用索引。
create_time >= '2024-01-01' 这个查询之所以走不了联合索引,是因为它跳过了开头的 user_id 直接去查第二个字段,就好比你拿到一本英文字典,却想直接按第二个字母把所有单词排出来——字典做不到这件事,数据库也做不到。这条SQL只能放弃联合索引,回到全表扫描。所以的最左前缀原则,说的并不是字面理解的“查询里必须包含索引最左边的字段”,更准确的表述应该是:“查询条件里,必须从联合索引的第一个字段开始,连续地命中字段”。一旦你跳过了某个字段,后面的字段再怎么精确,数据库都没法利用索引来做定位了。
2.2 例子拆解:联合索引 (a, b, c) 到底能命中哪些查询
这个部分我建议你看完能默写出来,因为它就是面试题中的高频原题。
假设表上有一个联合索引 idx_a_b_c(a, b, c):
sql复制-- 能命中:a b c 每个字段都用上,完美
select * from t where a = 1 and b = 2 and c = 3;
-- 能命中(中间跳过了b):MySQL优化器会尝试下推索引条件下推,但本质上
-- 这个SQL只能有效利用a来定位,b和c会作为过滤条件,无法完全用索引
select * from t where a = 1 and c = 3;
-- 能命中:a导致最左前缀成立
select * from t where a = 1 and b = 2;
-- 不能命中:从b开始,等于在最左列上断了
select * from t where b = 2 and c = 3;
-- 能命中范围查询之后的排序场景
select * from t where a = 1 order by b;
注意一个写作时的小细节:where a = 1 and b = 2 and c = 3 和 where c = 3 and b = 2 and a = 1 在命中索引这件事上是等效的,因为MySQL的优化器会自动做条件重排(等值比较满足交换律),它会把条件按照联合索引的列序重新整理。你不用刻意调整SQL里条件的书写顺序。
2.3 失效场景大盘点:这个表里有大量重复值的坑
规则搞清楚之后,再把常见的索引失效场景列一遍,排查线上慢SQL的时候你就能按图索骥了。根据我自己的实操经验,下面这五类场景最常踩坑:
- 对索引列使用了函数。比如
where DATE(create_time) = '2024-01-01',MySQL确实可以“用”索引,但没法“走”索引——因为右边那个'2024-01-01'要先映射回一整天的范围,数据库需要对左边的每一行执行函数运算再比较,这个过程索引帮不上忙。正确写法是where create_time >= '2024-01-01' and create_time < '2024-01-02'。 - 对索引列做了隐式类型转换。典型场景是
phone字段建了索引,但表里的 phone 存的是 varchar,查询时却写where phone = 13800138000,MySQL会把字符串列类型转成数字去比较,一样会让索引失效。 - 使用
like且通配符在前,例如where name like '%张'。只要最前面的字符是不确定的,B+树就无法按顺序定位起点;但是'张%'这种前缀匹配是可以走索引的。 - 索引列参与了运算,比如
where id + 1 = 10。记住一条:让索引列独立出现在比较符的一侧,不要给它包任何东西。 - 用
or连接多个条件,且其中一个字段没索引。为了把两部分结果都拿出来再合并,MySQL很可能放弃索引。如果就是要想办法命中,尽量拆成两个SQL用union all合并,或者确保or两端都是索引列。 - 统计信息说“全表扫描更快”,这在上文已经说过,归因在于低区分度字段的
avg_row_length摊下来已经不划算。
2.4 区分度的直觉:为什么性别字段上建索引经常是白建
还有一个面试官特别爱的送命题:“性别列适合建索引吗?”答案是:基本不适合,除非你有特殊的筛选场景。原因特别朴素:索引存在的价值是帮你快速缩小数据范围,但 gender 只有两个值:“男”和“女”。假设全表一百万行,各占五十万,你查 gender = '男',索引帮你从100万缩小到了50万,然后还是得把这50万行的主键全部回表取出来。这个代价跟直接全表扫描五十万行几乎没差别,甚至因为要先读索引再回表,多了一轮磁盘I/O,反而更慢。
所以,判断一个字段该不该建索引,最核心的一项指标就是区分度(selectivity),公式是 distinct值的数量 / 总行数。这个值越接近1越好。像主键ID天然是1,所以主键永远应该走索引;而性别字段的值很低,接近于0,建索引基本就是浪费空间和拖慢写入。换一个更有画面感的例子:你要是建了一张只有100行的配置表,那压根不需要给任何列建索引,因为数据库用优化器一算,发现整张表就两个数据页,全表扫一遍比走索引再去回表更快,这时候你建索引它也不会走。
3. SQL优化的实战轮次:慢日志定位、执行计划阅读、改写手法
3.1 从发现到定位:慢查询日志和explain的正确打开方式
面试进行到“SQL优化实战”这个环节时,我很少直接给候选人一道具体SQL让Ta优化。原因是那不叫优化,那叫背经验。我更喜欢问:“线上突然有一批接口变慢了,你怎么定位是哪条SQL出了问题?”
一个标准且完整的排查链路应该是这样的。首先打开MySQL的慢查询日志,通过参数开启后系统会自动把执行时间超过阈值的SQL全部记录下来:
sql复制set global slow_query_log = on;
set global long_query_time = 1; -- 单位是秒,建议线上设为1秒足够
set global slow_query_log_file = '/var/log/mysql/slow.log';
注意,这个阈值不要设太小,否则日志量会爆炸。1秒比较合理,如果你的业务比较精细,也可以设为200毫秒。拿到慢SQL之后,马上用 EXPLAIN 去看它的执行计划,重点看 type、key、rows、Extra 四列:
type表示访问类型,从好到坏大概是system -> const -> eq_ref -> ref -> range -> index -> ALL。看到ALL就是全表扫描,优先解决;看到index虽然也遍历了索引,但如果数据量大一样不乐观。key显示实际命中的索引名。如果为NULL,表示这条SQL没有用上任何索引。rows是优化器预估需要扫描的行数,这个数字如果巨大且和你预期不一致,就该怀疑统计信息过期或者没走对索引。Extra里出现Using filesort或Using temporary,意味着排序或者去重/分组在内存或磁盘上额外做了临时动作,通常是要重点优化的信号。
3.2 一个非常经典的案例:深分页为什么越翻越慢
经验谈完了,我这里放一个自己踩过、也经常拿来面人的真实案例。某个订单列表页,前端要做分页,最开始的SQL是:
sql复制select * from order_info order by create_time desc limit 100000, 20;
表是一千八百万行。这个接口一开始还很正常,但数据量涨过五百万以后,页码越深接口越慢,最后甚至二十秒都出不来。为什么?因为 limit 100000, 20 实际干的事儿是:把前面十万零二十行全部查出来,然后丢掉前十万行,只把最后二十行返回。也就是说,随着页码变大,MySQL要做的无用功越来越多。
索引 idx_create_time 确实是走上的,order by create_time desc 也能利用索引做反向扫描。但问题出在你需要把这一千八百万行数据里满足 create_time 排序的前十万行挨个读出来,确认它们的最终排序位置,然后才能“跳过”它们。这一步越往后执行成本越大,等于把前面每一页都白白翻了一遍。
解决办法有两种主流方案。第一种是延迟关联(deferred join):先用一条覆盖索引查,只取出主键ID,拿到那一页的ID集合,再通过主键去关联做一次回表查询,取完整行:
sql复制select a.*
from order_info a
inner join (
select id
from order_info
order by create_time desc
limit 100000, 20
) b on a.id = b.id;
子查询里 select id 走覆盖索引,不碰数据行,只扫描一个索引文件,速度会从秒级降到毫秒级。拿到这20个ID后,再回原表按主键查询完整数据。这种做法的核心逻辑是让耗时最重的排序动作在“小而紧凑”的索引结构上完成,避免把大量数据行也拖进排序过程。
第二种方案是书签(seek)法,也就是把 offset 转换成 where 条件。比如记住上一页最后一条记录的 create_time(假设没有重复或额外加一个id做平局判定),下次直接查:
sql复制select * from order_info
where create_time < 上一页最后一条的create_time
order by create_time desc
limit 20;
这样每次都是从一个固定的点位往下取20条,本质上是“下一页”而不是“第N页”,不管翻多深,扫描的行数都恒定在20行左右。缺点是无法支持“直接跳到任意页码”,但绝大多数C端业务根本不需要跳页,只做下拉加载“下一页”的话,这个是首选方案。
3.3 排序分组优化:filesort和临时表的出现与规避
order by 和 group by 是除深分页外另一个高频慢查询来源。比如:
sql复制select user_id, count(*) from order_info where create_time > 某个时间点
group by user_id order by count(*) desc limit 20;
这条SQL在数据量大时要干的事包括:把满足条件的行按 user_id 分组,统计每组数量,再按统计结果倒序排列,取出前20名。分组本来就会诱发临时表,排序又会诱发filesort,如果 user_id 上没有索引,优化器甚至得先全表扫,把结果集放到一张临时表里,然后再对临时表做排序。你会看到 EXPLAIN 的 Extra 列出现两个可怕的词:Using temporary 和 Using filesort。
遇到这种情况,优先想的是:能不能靠索引直接免掉排序或分组?比如 group by user_id 如果有索引在 (user_id) 上,B+树的叶子节点本身就是按 user_id 有序组织的,扫描结果出来天然就是分好组的,根本不需要额外建临时表。但这里统计的是 count(*) 后按数量排序,这个 count(*) 的结果本身没法从索引里直接读出,还是要做一定的中间计算,所以这一步更多是要靠数据拆分和预聚合思路来解决(比如用一张汇总表定期统计每日订单量)。
在面试里遇到这类题,你不需要给出什么完美方案,关键是把“为什么会有filesort和临时表”讲清楚,给出“通过索引消除排序”或“通过冗余汇总表避免实时计算”这两个方向,基本就能拿下一大部分分数。
3.4 实战改写:or条件、in条件和union all的选择
还有一个高频改写点,是我看代码评审时比较常提的。候选人对 or 深恶痛绝,一见到就改成 union all,理由就是“or会失效索引”。其实这个理解不完整。让我给你一个更精确的结论。
MySQL新版本(5.7及以后)的优化器对简单的 or 条件其实已经能做 index_merge 优化,比如:
sql复制select * from user where name = '张三' or phone = '13800138000';
如果 name 和 phone 上各自有索引,优化器会分别扫描两个索引,再把结果集合并去重。这听起来还行,但合并这个动作本身有成本,一旦结果集比较大,就需要额外的临时空间做排序或哈希合并。所以更稳妥的写法还是拆开:
sql复制select * from user where name = '张三'
union all
select * from user where phone = '13800138000';
注意我在这里用了 union all 而不是 union。差一个 all,语义差别很大:union 会自动去重,而 union all 不保证去重,但不会做额外的去重运算,速度更快。所以如果你能保证两个查询的结果在业务上不会重复,就用 union all。
而 in 则不一样。where id in (1, 2, 3, ..., 1000) 是可以正常走索引的,MySQL会把in列表转成多个等值比较再通过索引范围扫描完成。in 的数量比较大时,比如超过几千,优化器可能权衡是否直接全表扫。一般来说,in列表超过几百上千个值时,执行计划的稳定性都会变差。遇到这种极端场景,把in列表拆成几个批次,或者改造为临时表join,才是更稳的办法。
4. 被问“分库分表前你还能做什么”:SQL优化和索引设计能救命的场景
4.1 什么时候该优化SQL,什么时候该动用架构手段
很多候选人看到慢SQL就提分库分表,这是个误区。分库分表是最后的手段,它的成本极其高昂:代码要改、分布式事务要处理、跨库join要做成服务层聚合、ID生成策略要重构、数据迁移的坑多到你无法想象。在动手做这些东西之前,你至少应该把SQL层的优化空间全部榨干。
我自己的经验是,可以按照下面这条决策路径来判断:
- SQL本身是不是写法有问题——该加条件没加,导致扫描了远超必要的数据量?
- 索引设计是否合理——覆盖索引、联合索引的顺序、区分度有没有检查过?
- 是否能用冗余字段或汇总表来解决——比如把多表join的统计结果提前预计算好?
- 是否能用缓存挡住绝大多数重复查询——比如热点数据上Redis?
- 最后才考虑读写分离、分库分表这类大动作。
反过来讲,如果你表里每天写入几百万行、一张表已经破亿,或者单条SQL无论怎么调索引都绕不开一个巨大的“写放大”问题,这时候你还死死抱着“SQL优化万能论”,那就过于教条了。好的工程师应该有清晰的分层思维:SQL优化解决的是单次查询的成本,而分库分表解决的是整体容量和处理能力的边界问题。两者不是对立关系,是前后关系。
4.2 索引下推:MySQL 5.6之后容易被忽略的隐藏性能Buff
我在面试里还特别喜欢追问一个概念,叫“索引下推(Index Condition Pushdown,ICP)”,因为它真的能让联合索引在某些特殊场景下变得香了起来。假设表上有联合索引 (city, age),执行:
sql复制select * from user where city = '上海' and age > 20;
在没有ICP的年代,MySQL的做法是:先用 city = '上海' 定位到一批主键,然后挨个回表,把完整行拉出来后,再在服务层判断 age > 20。也就是说,age 这个条件对索引来说是“后置过滤”,完全没派上用场。
有了ICP之后,MySQL可以把 age > 20 这个条件“下推”到存储引擎层,在遍历索引的过程中直接判断 age 是否满足条件,不满足就直接跳过,不需要回表。这样一来,回表次数会大幅减少,尤其当 city = '上海' 命中很多行、而 age > 20 只占其中一小部分时,效率提升肉眼可见。
这个知识点的高频问法是这样的:“联合索引(a,b)和分别建两个单列索引(a)、(b)有什么区别?”,或者“既然数据库有索引下推,那建联合索引(a,b)还有什么意义?”你要答的点是:ICP是锦上添花,它能让你的联合索引在“前导列定位 + 后置列过滤”这种场景下减少回表量;但如果查询里要对字段 b 做范围查询,那么即便有ICP,它终究还是得在a确定的区域里逐一判断,效率远不如在联合索引里 a = xx and b > xx 来得直接。
4.3 避免索引失效不等于避免使用索引:优化器统计信息与直方图的一个冷知识
关于索引失效,有个很多老开发都会有的误解。比如一张1万行的表,索引建在状态字段上,但状态字段只有“成功”和“失败”两个值,90%的行都是“成功”。如果你查 where status = '失败',把10%的行捞出来,这一步用索引确实有帮助。但等你查 where status = '成功',优化器的代价估算模型会告诉你:全表扫描只扫1万行就够了,而走索引要先读索引树上的1万条记录,再把其中9000条主键一个一个回表,这个成本明显比全表扫描更高。于是MySQL就“倔强”地放弃了这个索引。
这个案例告诉我们,索引失效不一定是你写错了SQL,也可能是优化器觉得你建的索引本身就帮不上忙。所以排查慢SQL时,不要满脑子只想着“我哪儿写错了吗”,也要去看看这张表的数据分布有没有严重倾斜。MySQL 8.0支持了直方图(histogram),你可以在区分度一般但是数据分布很关键的字段上手动建直方图,让优化器拿到更准确的列数据分布统计信息,从而做出更聪明的选择。这个点讲出来,面试官一般会觉得你不是背题选手,而是真读过文档、上过生产的人。
4.4 单一SQL的极致优化做好之后,别忘了系统观
从面试回到底层工程的角度,我建议你建立这样一个意识:SQL优化和索引优化永远不是终点。某条SQL从5秒优化到50毫秒,这是技术能力。但如果你只盯着一条SQL,那明天还有第二条、第三条变慢,你会一直处于救火状态。真正的高手会从“为什么这条SQL会慢”出发,去思考“我的表结构设计是否合理”“我的查询模式是否稳定”“有没有可能引入一层汇总表让统计类SQL根本不用碰大表”“高频查询能不能被缓存挡住”这些更上层的问题。
面试官希望你展示的调优框架其实是这样子的:定位慢SQL(慢日志+explain)→ 分析根因(索引失效?数据量大?大事务锁竞争?)→ 给出针对性方案(加索引/改写SQL/归档冷数据/加汇总表)→ 用数据验证调优效果(对比执行时间、扫描行数、内存排序量)→ 沉淀成规范(code review时的人肉checklist,或者收进SQL规范文档里)。
5. 事务隔离级别和锁:为什么索引优化和并发控制经常被连着问
5.1 一条update没走索引,会锁住多少行
面试进行到中后段,面试官一般会加入“并发”元素来加深考察,因为索引和锁从来不是两个割裂的话题。经典的连环问题是:“执行下面这条update,会锁住多少行?”
sql复制-- 假设age上建了索引
update user set name = 'xxx' where age = 25;
如果 age 走了索引,MySQL(InnoDB)会在扫描过程中给所有匹配到的索引记录以及对应的主键记录加锁,通常只会锁住那几行满足条件的记录。可如果 age 没有索引,那这条SQL就只能做全表扫描,而InnoDB在扫描过程中并不能判断哪些行未来会匹配,所以它会在扫描时给每一行都加上锁,直到事务结束才释放。换句话说,一条“本该只改几行”的SQL,因为没走索引,把整张表的所有行都锁了个遍。
这个案例说明,索引在并发场景下不只是“提高查询速度”的加速器,更关键的是它能限制锁的范围和粒度。一条连索引都没建好的update,在高并发业务里就是一场事故导火索:所有写操作的并发度瞬间被拉低到1,大量会话排队等锁,接口全面超时。所以我在做code review时,会特别警惕不带 where 或者 where 条件没命中索引的 update/delete 语句,这是最容易被忽略的锁问题来源。
5.2 间隙锁和幻读,说出来就能吓住人的考点
关于InnoDB的锁机制,面试官考得比较深的一层是“间隙锁(Gap Lock)”。它跟隔离级别“可重复读(Repeatable Read)”绑定得很紧。MySQL默认的隔离级别就是Repeatable Read,为了解决幻读问题(事务里两次查询同一个范围,结果数量不一致),InnoDB引入了一个机制:当你按某个范围条件加锁时,不仅锁住已存在的记录本身,还会在这个范围内、这些记录之间的“间隙”上加锁,阻止其他事务往里插入新记录。
正因为有间隙锁的存在,线上经常出现一种很奇怪的死锁场景:
事务A执行
delete from order_info where order_no in (1001, 1002, ...),给匹配行和它们之间的间隙加了锁。事务B也执行一条类似的delete,锁定的范围存在交叉。两边都不愿让出已经持有的间隙锁,然后MySQL的检测机制把其中一个事务给回滚掉,死锁日志就在业务日志里刷了屏。
老手看懂这类死锁问题的第一反应往往不是去改业务代码,而是去看那条 where 条件能不能精准命中索引。如果条件不是等值而是范围,间隙锁的范围就不可控。只要能通过联合索引把范围收窄到很小几条记录上,间隙锁的范围也就随之缩小,死锁概率会大幅下降。
5.3 面试题的标准破局思路:从“锁的范围控制”倒推出索引要求
这几年很多候选人被问到“可重复读下如何避免幻读”时,都会背出“用间隙锁解决”这个结论。但再往下追问一句“间隙锁一定会加吗?”很多人就答不上来了。
事实上,如果你的事务隔离级别是Read Committed,InnoDB就只使用记录锁,不启用间隙锁,从而降低死锁概率,代价是你可能出现幻读。如果你设置的是RR,但where条件恰好命中了一个唯一索引的等值查询(比如 where id = 100),这属于唯一键等值查询且记录存在的情况,InnoDB只对这条已存在的记录加记录锁,不需要加间隙锁(因为既然拿的是唯一索引且记录已存在,其他事务不可能再插入一条 id = 100 的记录来造成幻读)。只有当等值查询发现记录不存在时,它才会在当前记录前面的间隙上补一个间隙锁,防止并发下有人把这条记录插进来,然后再引发幻读现象。
你发现没有?锁的范围和“索引的类型+命中方式”强相关。一个候选人对这个链条的掌握程度,基本能代表他后端开发的内功深浅——不是单纯背诵“MySQL默认隔离级别是什么”的八股,而是真的能用自己的话把“索引选择→锁的粒度→并发瓶颈→死锁风险→业务SQL设计”这根链路完整串起来。这也是面试官连问“索引优化”和“SQL优化”的根本动机——他想知道你能不能站在并发控制和资源消耗的高度去看待这些看似底层的细节。
6. 真题拆解局:5道高频SQL优化例题的完整推演
6.1 例题一:用户登录鉴权SQL,怎么从全表扫描到毫秒级
场景:用户表 sys_user,大约一千万行。登录接口的SQL:
sql复制select * from sys_user where username = 'admin' limit 1;
第一步先用 explain 跑一下,看到 type=ALL,那就是全表扫描。这个SQL的逻辑其实特别简单——根据用户名定位到唯一一行。所以索引设计最直接的方式就是给 username 建唯一索引:
sql复制alter table sys_user add unique index uk_username (username);
因为用户名在业务上天然不能重复,直接用唯一索引。这样查询的 type 就变成了 const,理论上最多读一个数据页就能定位。给这个SQL加索引之所以能生效,核心原因就是username的区分度极好,而且查询模式是“等值查询 + 返回唯一行”。
这里要提醒你一句实际开发中的坑:如果你给 username 加的是一个普通索引而非唯一索引,那么在 limit 1 下虽然也能快速返回,但同时有两个完全相同的用户名存在时,MySQL只能返回其中一条,具体是哪一条取决于物理存储顺序。这类业务语义“不该有重复”的场景,建立唯一索引不只是性能问题,还是一种用数据库兜底的数据质量约束。
6.2 例题二:订单列表多条件筛选项完全不受控,怎么设计索引才合理
运营后台的订单列表,筛选项有订单号、用户ID、下单时间、订单状态、商品名称等七八个条件,每个都可能为空。一个新手常犯的错误是:为了“雨露均沾”,给每个筛选项单独建一个普通索引。
问题在于,当一条SQL同时好几个筛选条件存在时,优化器很难把多个单列索引组合使用。你能依赖的只能是某个区分度最高的单列索引把数据粗筛一遍,剩余条件再在回表后逐行过滤。诚然MySQL可以做index merge,但index merge要分别扫多个索引再走集合运算,复杂度很高,而且当一个索引已经能过滤80%数据时,另一个索引的进一步过滤往往要支付很高的集合操作开销。
正确思路是分析真实的业务查询分布。比如几十个筛选条件中,用户ID+下单时间 的组合占了查询量的80%,那我们就为这个高频组合建联合索引 idx_user_id_time(user_id, create_time),并且让列表页只做“下一页”的深分页优化。至于其他低频组合,比如按商品名称搜索,那是低频功能,全表扫描也能接受,或者干脆丢给搜索引擎去解决,不必强求一个索引命中所有查询。面试时碰到这类题,你要展示的重点不是“一次建了一堆索引”,而是“能分析数据分布,按查询频率给索引排优先级”。
6.3 例题三:count(*) 为什么这么慢,怎么优化
一张一亿行的大表,执行 select count(*) from order_info,可能要几百毫秒甚至几秒。因为InnoDB不像MyISAM那样把每个表的行数直接存下来,InnoDB要满足MVCC(多版本并发控制),每一行对于不同事务可见性都不一样,所以它没法用一个静态的计数器来代表“当前表有多少行”,只能实时扫描统计。
面试官通常想问的是:你如何在业务层扛住这个统计需求?我的项目里用的方案一般有两种:一是做一个计数表,在插入和删除数据时通过同一个事务把计数表里的值加一或减一,保证一致性;二是用定时任务加一个汇总表,比如记录“每个用户每天有多少订单”,查询时直接汇总这个汇总表。如果数据允许近似,Redis的计数器也够用,但要注意Redis和数据库的一致性风险。
这里要特别警惕的是 count(字段)、count(主键)、count(*) 的差异。很多人记成“count(1)比count(*)快”,其实在新版本里基本没有性能差别,优化器已经做了等价改写。但 count(某个可为NULL的字段) 和 count(*) 的语义不同:前者不统计NULL值。如果面试官借机问你某张表里 count(*) 比 count(某个字段) 大,说明该字段有NULL值,这个点别答错。
6.4 例题四:多表join的优化,到底该怎么调join顺序
另一个面试常见场景是多表join。假设订单表有2000万行,商家表只有10万行,用户表有500万行。一条join SQL:
sql复制select o.order_no, u.nickname, s.shop_name
from order_info o
join sys_user u on o.user_id = u.id
join shop_info s on o.shop_id = s.id
where o.create_time >= '2024-01-01';
新手优化join时最常犯的错是试图给 order_info 的每个关联字段加索引。实际上,如果驱动表的过滤条件(大表的 create_time)能把范围缩得足够小,驱动表先扫描出一个较小的结果集,再去被驱动表上按关联字段找对应行,你会发现连接效率完全取决于被驱动表的关联字段(如 sys_user.id、shop_info.id)有没有索引。主键天然有索引,所以这两个关联查询本身通常没问题。
真正的性能瓶颈在驱动表的筛选上:如果 order_info.create_time 没有索引,第一步的大表全表扫描就会拖垮整个join。所以核心优化策略是:给大表的过滤条件字段加索引,保证驱动表出来的数据集足够小;然后小表作为被驱动表时,它的连接列往往是主键,已经天然具备索引条件。反过来如果大表是小表的N倍,把join顺序搞反了——用小表做全表扫描当驱动表,大表被驱动后用索引查找——往往会更快,这一点MySQL优化器的代价估算会尽量自动完成,但如果你发现它选错了,可以在join的字段或过滤条件上再做文章,或者在业务允许的情况下,把大表先过滤成很小的临时结果集再join。
6.5 例题五:深挖一个让人绝望的“为什么有索引但还是慢”
这类问题在面试现场杀伤了很多人。我给你复现一个我自己线上遇到过的场景:
sql复制select * from order_info where status = 'UNPAID' order by create_time desc limit 10;
status 上有索引,create_time 也有索引,查询也只拿10条,按理说应该很快。但线上这条SQL经常执行到2秒以上。explain一看:优化器选了 idx_status,结果status = 'UNPAID' 的行有700万条,那它得在这700万条里把所有主键捞出来,再按 create_time 排序,取前10条。排序的代价比我们想象中大得多。
反过来,如果把 idx_status 和 idx_create_time 合成一个联合索引 (status, create_time),那这条SQL就变成了先在 status 上定位到所有UNPAID记录,但这个范围内记录已经是按 create_time 排好序的,可以直接沿B+树倒序取前10条。不用把所有UNPAID记录的主键都先收集起来再排序,直接截断,查询成本瞬间下来了。
这类题在面试里的高分回答,不是把几个索引场景背一遍,而是能点出“排序字段和等值筛选字段能不能放进同一个索引里让B+树天然排序”这个关键思路。你在实际优化工作中也要时刻记住:联合索引不仅是多个单列索引的组合,它还能为“固定前置条件 + 排序/范围后缀”这种查询模式提供额外的排序能力,这是你只看单列索引永远发现不了的优化角度。
7. 索引数量和写入性能的博弈,及数据量大的现实问题
7.1 别把表建成了“索引用” —— 每个索引都是写放大
面试到最后一个环节,面试官经常会问一个偏工程取舍的问题:“既然索引好处这么多,那我是不是把所有字段都建上索引就能一劳永逸?”
这个问题的标准答案是:索引不是免费的午餐,它是以空间换时间,以写入换查询。每一张表新增一个索引,就意味着你每次insert/update/delete都要同步维护一棵额外的B+树。数据从一行变成多行时,所有索引要跟着做节点分裂、页合并这些操作。当一张表上有十几个索引时,写入性能会被严重拖垮,写放大十分明显。
举一个生产上的典型例子:有一张日志表,每天通过批量任务写入几百万行,一开始设计时为了各种查询场景建了9个索引。结果后来发现批量写入的耗时越来越长,从原来20分钟慢慢变成一个多小时。排查后发现瓶颈完全不在数据写入本身,而在于这9棵B+树的同步维护。最后一刀切,把那几个低频查询的索引全部去掉,只保留两个最关键的核心查询索引和一个唯一键索引,批量写入时间直接回到25分钟以内。
这个取舍原则,在面试里可以说成一句话:索引该建在“高频查询且数据筛选度高”的路径上,而不是按字段数量平均分配。低频的报表类查询,宁可让全表扫描或者用离线数仓去承接,也不要在一张高吞吐的在线表上无脑堆索引。
7.2 索引字段长度越长越占空间:前缀索引该怎么取舍
另一个跟索引大小相关的问题是:字段很长,怎么建索引才划算。比如你要在一张内容表上按标题查重,title 是varchar(255),直接建整列索引会让索引体积变得很大,每次比较要走很多字符,cpu和内存开销都不低。
MySQL提供了一个方案叫前缀索引:只对字段的前N个字符做索引。
sql复制alter table article add index idx_title(title(20));
这个设计的目标是降低索引体积和比较成本,但代价是可能引入“两个不同的title前面20个字符相同,命中同一条索引”的情况,导致需要回表之后再做一层精确过滤。实际项目里你可以这样操作:先粗略估算一下数据前缀区分度,比如执行
sql复制select count(distinct left(title, 10)) / count(*) from article;
select count(distinct left(title, 20)) / count(*) from article;
select count(distinct left(title, 30)) / count(*) from article;
分别对比不同前缀长度下的区分度变化,通常选取“区分度接近全列区分度、长度尽量短”的N值,比如20个字符就已经能做到99.9%的不重复,那就没必要对全列建索引。
不过要提醒一点:如果查询条件涉及排序或者范围查询,前缀索引帮不上什么忙,因为它只保存了前缀内容,无法用于完整的排序判断,所以它更适合那些“只用等值过滤”的场景。
7.3 归档冷数据,可能是比任何SQL优化都管用的手段
聊了这么多索引和SQL优化,有件事我必须放在最后提一嘴:有时候你把劲全部使在索引优化和SQL改写上,不如换个思路,把冷数据直接搬走来得更彻底。
线上订单表往往是一个典型的“热尾效应”场景:最近三个月的订单占了绝大多数读写流量,而一年前的历史订单几乎只有运营偶尔来查询。面对这种情况,一种很成熟的做法是定期把一年前的订单物理迁移到一张历史订单表或归档分区中,在线订单表的体积直接砍半。表小了,索引天然变矮,全局扫描成本全面下降,之前怎么调都降不下来的CPU负载一下就稳了。
这也是为什么很多面试官在问完索引优化之后,喜欢再补一句“如果一张表数据量已经很大,你还会先考虑什么?”——他期待的就是你能跳出“加索引”这一个维度,说出“过滤和隔离掉那些大查询真正不需要触碰的数据”这种分层思维。优化SQL的本质是减少无谓的数据扫描和计算,而归档和拆表,其实是一件同样逻辑的事情,只是动作发生得更早,影响范围更大。
8. 给准备面试的你一份可以直接用作自测的复盘清单
8.1 对着这份清单,自问自答一遍,比刷三十道题管用
面试是个输出过程,而输出的前提是把零散的知识点连成网。这里我把上面讲的全部内容浓缩成一份自测清单。建议你不要只看,而是拿白纸边写边画,能把每一条的“为什么”也顺手写明白,那面试基本就稳了。
- 一张千万级表,分页查询越往后越慢,你会怎么改SQL?为什么深分页会慢?延迟关联的核心思路是什么?
- 联合索引 (a,b,c),where条件里出现了哪些情况的组合会失效?最左前缀原则你是怎么理解的?
- 在一个低区分度字段上建索引,什么情况下反而帮倒忙?优化器会怎么决策?
- 一条有慢查询的SQL,你怎么通过explain定位问题?type、rows、Extra分别怎么看?
- 线上并发更新某张表的同一个范围,出现了死锁,你会从哪些维度排查?会不会想到索引锁范围的问题?
- group by造成的filesort和临时表怎么消除?如果无法消除,业务层怎么兜底?
- 一张高吞吐的表,你会怎么规划索引数量?有没有因为索引过多导致写入变慢的真实项目经历?
这些问题如果都能不看资料独立答出七八成,那数据库这关的面试基本稳了。如果你发现有些回答还需要停下来翻文档,那就说明这块还有盲区,先从理解原理开始,而不是硬背答案,理解透了以后再写任何SQL心里都有底。
8.2 我作为一个“被面过也面过人的人”的一点个人经验
数据库的面试题目说到底只有那么几个分类:索引就是为了让你更快地找到数据,SQL优化就是为了让你少干活,锁和事务隔离就是为了让并发场景不崩,分库分表、读写分离这些则是容量和架构层面的兜底。你把这些底层逻辑理顺之后,再去做具体题目,会发现它们都是同一棵树分支出来的叶子而已——根是一样的。
每次遇到候选人在那里背“最左前缀原则是xxxx”的时候,我都会停下来问他一句:“那你项目里有没有哪一次实际的慢SQL排查中,发现是因为违反了这条原则导致索引没走上的?”能答出来的,说明他是真写过真业务;答不上来的,很可能只是临时刷题刷到的。面试官想找的人,不是一本会背数据库教程的“人工索引”,而是一个能真正通过索引和SQL优化解决业务问题的工程师,希望读完这篇文章的你,能成为后者。
