当年接手一个跑了四年的老项目,线上库还是 MySQL 5.6,每天凌晨的报表任务稳定压垮从库,主从延迟一路飙到两万秒。问了一圈DBA,答案出奇一致:“升到5.7看看吧。”说实话一开始我是拒绝的,一个在产环境跑了多年的数据库,版本升级牵一发动全身,谁都不想背这个锅。但等我真的把5.6和5.7放在一起做了压测和对比之后,才发现自己之前守着旧版本不动,纯粹是懒得折腾,而不是5.6真有那么无可替代。
这篇文章我就把这段时间做的测试和线上踩坑经历整理出来,重点聊我这几年实际用下来感受最深的几个差异点:优化器、在线DDL、复制机制、SQL模式兼容性,以及升级过程中那些文档里不会写清楚、但见了就头大的问题。无论你是在纠结“要不要升”,还是已经升级到一半被某个报错卡住,这篇都应该能给你一些参考。
1. 从5.6到5.7:不只是小版本号的跳动,底层逻辑换了一次代
很多人觉得5.6到5.7都是5.x系列,中间无非修修bug、加点功能,没必要当成大事。这种想法在MySQL 5.1到5.5时代确实成立,但在5.7身上完全不适用。如果你仔细翻过5.7的release notes,会发现它几乎重写了执行器、优化器、InnoDB的很多核心路径,连数据字典的存储方式都改了。用“脱胎换骨”来形容5.7并不夸张。
1.1 为什么5.7的默认配置就比5.6快一大截
先说大家最关心的性能。我做了个很粗糙但很直观的测试:同一台机器、同样的硬件配置(4核8G SSD),分别装5.6.50和5.7.32,用sysbench跑oltp_read_write,默认配置下5.7的TPS大概是5.6的1.7到2.1倍。如果你像我一样用的是5.6时代留下来的my.cnf,差别可能没那么夸张,但依然有约40%以上的提升。
这个提升是怎么来的?核心原因在于5.7做了几件关键的事:
- 优化器重构:5.7的优化器对子查询做了更智能的转换,很多在5.6里会物化成临时表的子查询,5.7直接改成了半连接(semi-join)或派生表合并(derived table merging),避免了大临时表的创建和扫描。
- InnoDB改进:5.7的InnoDB对缓冲池、预读、刷脏路径都有调整,尤其是把AHI(自适应哈希索引)的锁粒度拆细了,高并发下锁竞争明显减少。
- 临时表落盘策略:5.6临时表默认是MyISAM,5.7开始默认使用InnoDB临时表,而且临时表是独立表空间,不存在和普通表争抢ibdata1的问题。
你用默认配置去测5.6,会发现buffer pool默认只有128M,而在5.7里虽然也是128M起步,但它的预分配和扩展策略更合理。当然生产环境我们不可能用默认配置,但默认配置就能跑出这个差距,说明底层优化的力度真的很能说明问题了。
1.2 底层存储引擎重构的另一个隐形红利:崩溃恢复更快
除了跑查询更快,5.7的崩溃恢复速度也有明显的质变。这是因为5.7对redo log的刷盘和恢复机制做了大量优化,不再需要像5.6那样从头到尾扫描redo日志。我自己做过一次kill -9模拟,同样40G的实例,5.6恢复要3分多钟,5.7只需要40多秒。对于线上动辄几百G、业务要求RTO(恢复时间目标)很短的团队来说,这个差距是必须重视的。
但这里也要提醒一句:如果你用的是云数据库RDS或类似托管服务,这些底层差异其实已经被云厂商抹平了一部分,你感知到的更多是SQL性能优化和新功能层面的区别。自己部署物理机或自建云主机的话,这个差距就会非常直观。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 优化器和执行计划的差异:为什么同样的SQL,5.7就是更快
我之前在技术群里看到过一个问题:同一个SQL,在5.6和5.7上explain出来的执行计划完全不一样,5.6走了全表扫描,5.7却走了索引,这是为什么?答案就是优化器变了。
2.1 子查询优化:从“逐行执行”到“半连接”
在5.6里,如果你写类似这样的SQL:
sql复制SELECT * FROM orders
WHERE user_id IN (SELECT user_id FROM vip_users WHERE level > 3);
MySQL 5.6的优化器通常会把子查询的结果物化成一张临时表,然后orders表再和这张临时表做关联。如果vip_users表很大,这个物化过程会非常耗时,而且临时表还没法建索引,关联起来就是个大写的灾难。
到了5.7,优化器会把这类IN (subquery)自动转换为semi-join(半连接),也就是说MySQL会像普通join一样去执行,但只取orders表中匹配的行,避免重复扫描子查询结果集。还有更激进的一点是,5.7支持derived table merge(派生表合并)。以前你写:
sql复制SELECT * FROM
(SELECT id, name FROM users WHERE age > 18) AS t
JOIN orders ON orders.user_id = t.id;
这个括号里的子查询在5.6中会被当成一个独立的派生表,先执行、再物化、再参与join。而在5.7中优化器可能会直接把age > 18这个条件下推到外层,跟orders的join直接合并生成最优执行路径,连物化都省了。
我实际测试过一个业务SQL,在5.6上执行要4.8秒,5.7上只用了0.3秒,执行计划从“临时表+全表扫”变成了“索引关联+覆盖索引”。这还只是逻辑层面的优化,没有改一行SQL,升级完直接收益。
2.2 条件过滤和索引选择的智能度提升
5.7的优化器还有一个我很喜欢的改动:对多列索引的选择性估算更准确了。5.6时代经常出现的情况是,明明建了联合索引(a, b),但优化器偏不走,而是全表扫描。原因之一是它的统计数据不够精准,对区分度的估算偏差很大。5.7引入了更精细的索引统计,而且支持在运行时动态更新统计信息,尤其对大表的索引选择帮助特别明显。
当然这也带来一个新的“坑”:5.7生成的执行计划可能和5.6完全不同,所以在升级之前,强烈建议你找一台测试机把所有核心SQL跑一遍explain,对比执行计划差异。不要以为执行计划变了就一定是好的,优化器再聪明也有误判的时候。
2.3 一个容易被忽略的细节:字符集排序规则的默认值变了
在5.6中,默认字符集是latin1,默认排序规则是latin1_swedish_ci;在5.7中,默认字符集变成了utf8mb4,默认排序规则是utf8mb4_general_ci。这个变化看起来很小,但如果你是新建的库表,它会直接影响字符串比较和索引排序的行为。
最典型的问题是:老项目里用latin1存量表存了中文,升级到5.7后虽然数据不会乱码,但你新写的SQL在join时可能出现“Illegal mix of collations”报错。我的建议是,升级前把所有表的collation统一成utf8mb4_general_ci或者utf8mb4_unicode_ci,不然等到线上报错再改,那个改动成本就翻倍了。
3. 在线DDL与秒加字段:从“锁表噩梦”到“几乎无感”
对做业务开发的人来说,5.7最友好的一个变化就是在线DDL能力的提升。5.6之前的版本,ALTER TABLE加字段、加索引基本意味着锁表,业务只能停写或者接受短时间不可用。5.6开始支持了ALGORITHM=INPLACE,但限制很多,很多场景还是会退化成COPY。到5.7这里,情况才有了本质改善。
3.1 ALGORITHM=INSTANT:5.7引入的“秒加列”能力
5.7中InnoDB引入了新的DDL算法ALGORITHM=INSTANT,对于“在表的末尾新增字段”这类操作,可以直接修改数据字典,不需要重建表,也不需要进行数据拷贝。在亿级大表上执行:
sql复制ALTER TABLE big_table ADD COLUMN remark VARCHAR(255) NOT NULL DEFAULT '', ALGORITHM=INSTANT;
这个操作几乎是秒级完成的,对线上DML的影响可以忽略不计。这在5.6时代基本是不敢想象的,那时候哪怕只是加一个默认值字段,都可能需要几分钟到几十分钟,期间表被锁住,读写成片地阻塞。
不过这里要强调一点:INSTANT只能用于在表末尾加列,如果你要在某一列的中间位置插入新列,仍然需要用COPY算法,该锁表还是会锁表。5.7的文档推荐做法是:新加的列尽量追加在表的末尾,不要刻意通过AFTER column去指定位置,不然会白白放弃INSTANT的优化。
3.2 INPLACE和COPY之间的选择逻辑
5.7的在线DDL基本沿用了5.6的框架,但优化了很多细节。现在常见的几个场景:
- 添加二级索引:支持INPLACE,可以在线创建,期间允许读写,但需要额外磁盘空间。
- 修改列类型:如果只是扩大varchar长度且不超过255字节,可以INPLACE;如果改int为bigint等需要重建数据的操作,则必须COPY。
- 添加/删除外键约束:5.7中新增外键约束默认是COPY,但有
ALGORITHM=INPLACE选项可以跳过外键检查,你需要手动指定。 - 修改默认值:5.7中修默认值时,如果有INSTANT支持的类型可以直接秒改,不再需要重建整个表。
我的经验是:每次执行DDL前先看一遍官方文档对应版本的Algorithm参数表,不要凭记忆选。这个表在5.6和5.7之间就有差异,比如5.6里修改默认值不支持INPLACE,5.7支持了。你要是按老经验办事,可能在5.7上反而做了一些更保守、更慢的操作。
3.3 DDL操作带来的额外磁盘占用
说到在线DDL就一定要提磁盘空间。INPLACE算法虽然不阻塞读写,但它需要在原地重建表或创建临时文件,所以在执行期间磁盘使用量会明显增加。对于接近80%使用率的磁盘,执行大表的索引构建很容易直接打满磁盘。我遇到过不止一次,DDL跑到一半提示“Table is full”,最后只能等事务回滚释放空间。
所以我的建议是:线上大表DDL之前,先用df -h确认磁盘剩余空间至少是目标表体积的1.5倍以上,并且预留临时空间。否则你会在凌晨两点收到磁盘告警,然后祈祷这个DDL能顺利跑完。
4. 复制机制的心智升级:并行复制、半同步和GTID终于能打了
说到主从复制,5.6给人的感觉是“能用,但草台感十足”,5.7才算是真正可以放心交给生产环境了。
4.1 并行复制:一把解决主从延迟的钥匙
5.6其实就已经支持了并行复制,但它的并行粒度是基于库的(database-based)。也就是说,只有在不同库之间的事务才能并行回放,同一个库内的多个事务还是串行执行。对于我当年那种单库多表的业务模型来说,并行复制约等于没用,主从延迟照样起飞。
5.7把并行复制改成了基于事务组提交(group commit)的逻辑时钟(logical clock)并行回放。只要这些事务在同一时间窗口内提交,从库就可以并行执行它们,不管它们是同一个库还是不同库。这个改动带来的收益非常直接,官方数据说最高能提升数倍甚至更多的复制吞吐量。
我在压测环境验证过:用sysbench的oltp_write_only压主库,5.6从库的延迟基本追不上,越积越多;5.7开启并行复制后,延迟可以稳定在几秒以内,压力降下来后很快归零。给参数设置参考:
ini复制slave_parallel_type = LOGICAL_CLOCK
slave_parallel_workers = 8
这里要提醒一下,并行线程数不是越大越好。我试过16线程,发现小事务场景下收益不大,反而增加了CPU开销。8个线程在大多数业务场景下已经足够,如果事务特别重,可以再往上调,但务必用压测数据说话,不要拍脑袋。
4.2 半同步复制:从“阉割版”到“能用的版本”
5.5引入了半同步复制(semi-sync replication),但那个版本的实现比较粗糙,主库在等待从库ACK时如果超时,会退化成异步复制,而且切换回半同步的机制也不完善。5.7对半同步做了大幅增强,最核心的变化是支持了“无损复制”(lossless semi-sync):主库在提交事务时必须等待至少一个从库收到并持久化binlog,才能给客户端返回成功。
这意味着即使主库突然宕机,已提交的事务也不会丢失——对数据一致性要求高的支付、订单类业务来说,这非常重要。5.7里还可以通过rpl_semi_sync_master_wait_point = AFTER_SYNC开启无损半同步,默认就是AFTER_SYNC。
不过无损半同步会增加提交延迟,尤其是从库和主库跨机房部署时,网络延迟会被放大到每次提交上。我的建议是:保持同机房部署,或者用专门的一对一从库做同步确认,别为了高可用把所有必须确认的从库都拉进半同步集合里,不然主库性能会下降得很难看。
4.3 GTID从5.6的“半成品”走向成熟
5.6也有GTID,但它是半成品,最大的痛点就是无法在线动态开启,必须设置gtid_mode然后重启实例。另外在5.6里,GTID的复制拓扑切换很麻烦,很多工具和脚本都不兼容。5.7终于支持在线开启GTID了:
sql复制SET GLOBAL ENV_GTID_MODE = OFF_PERMISSIVE;
SET GLOBAL ENV_GTID_MODE = ON_PERMISSIVE;
SET GLOBAL ENV_GTID_MODE = ON;
三步切换法,做一次之后,复制拓扑切换就简单很多了。你不再需要盯着binlog文件和Position,直接CHANGE MASTER TO MASTER_AUTO_POSITION = 1就行,主从切换、故障转移的复杂度降了一个量级。
4.4 双主或一主多从场景下的流式复制坑
最后提一个5.7复制里的隐藏坑:当从库的SQL线程执行大事务时,即使并行复制已经把其他事务并行执行完了,从库依然可能因为大事务阻塞后续所有事务的回放。这个在5.6也一样,只是5.7的并行复制会放大这种表现的感知度。大事务会产生单个二进制日志条目超过max_allowed_packet的风险,所以不管是5.6还是5.7,都建议把业务侧的大事务拆成小批,尤其是定时任务里的UPDATE或DELETE。
5. SQL模式与兼容性问题:升级后最容易被“静默破坏”的东西
很多人升级数据库只关心性能和功能,却忽略了SQL mode的变化。MySQL 5.7把默认的SQL mode从5.6的NO_ENGINE_SUBSTITUTION改成了ONLY_FULL_GROUP_BY, STRICT_TRANS_TABLES, NO_ZERO_IN_DATE, NO_ZERO_DATE, ERROR_FOR_DIVISION_BY_ZERO, NO_AUTO_CREATE_USER, NO_ENGINE_SUBSTITUTION。
这个改动带来的最直接后果就是:一堆在5.6里能跑的SQL,在5.7里直接报错或行为异常。
5.1 ONLY_FULL_GROUP_BY带来的最典型报错
你肯定见过这个报错:Expression #1 of SELECT list is not in GROUP BY clause and contains nonaggregated column ... which is not functionally dependent on columns in GROUP BY clause.
在5.6里,你可以这样写:
sql复制SELECT user_id, username, MAX(score) FROM user_scores GROUP BY user_id;
5.6会取每个user_id分组中的任意一条username返回,这个“任意”到底是谁,由执行计划决定,可能是索引顺序的第一条,也可能是全表扫描遇到的第一条,完全不可控。到了5.7,默认SQL mode直接不允许这种写法,必须保证SELECT中的非聚合列和GROUP BY列有函数依赖关系。
但很多老业务根本没时间改SQL。对这种迁移场景,我的临时建议是:先在测试环境把所有SQL用5.7默认模式跑一遍,把报错SQL收集起来,让开发逐个改。如果实在改不动,暂时可以把ONLY_FULL_GROUP_BY从sql_mode里去掉,但这是一笔技术债,迟早要还的。
5.2 严格模式的影响远比你想象的广
5.7默认开启STRICT_TRANS_TABLES后的行为变化,我在实际迁移中遇到过几个很典型的情况:
- 向varchar字段插入超长字符串:5.6是截断并告警,5.7直接报错。
- 插入NULL到NOT NULL字段且无默认值:5.6会用隐式默认值(空串或0),5.7严格模式下直接报错。
- 更新操作中遇到非法值:5.6可能部分更新后就停了,5.7会在更新第一行时就报错并回滚整个语句。
这些差异在存量数据上尤其危险。如果存量表里已经躺着一堆违反约束的脏数据,升级到5.7后,一次普通的全表UPDATE就可能因为遇到脏数据直接回滚,业务完全无感知地挂掉。所以升级前除了跑explain,也建议跑一遍数据完整性检查脚本,把非法的空日期、超长字符串、NULL冲突都提前清理干净。
5.3 从单线程迁移到双实例并行核对
升级时最常见的问题是:新库数据到底和旧库是否一致?5.7默认的校验工具是mysqlchecksum,但5.6和5.7之间没有内置的在线数据校验工具可以直接跨版本比对。我的做法是用pt-table-checksum在源库算出所有表的checksum,再迁移到新库,再在新库上跑同样的校验,两边比对checksum结果。
这里有一个非常实用的经验:pt-table-checksum在5.7上运行之前,最好先给目标库建好所有账号并授权,因为pt工具连接新库时用的账号权限要求比旧库高,否则会在中途报权限错误,导致整个迁移节奏被打乱。
6. 升级路线与踩坑清单:从5.6迁到5.7,这些坑我先替你趟了
最后这部分,我按实际操作顺序把升级中会踩到的坑和我的应对方案完整列出来。这不是一篇官方文档,而是我反复操作过多次的“实战总结”。
6.1 升级工具选择:逻辑备份还是原地升级?
MySQL 5.7官方支持的升级路径是5.6可以直接原地升级到5.7。但“支持”不代表“推荐”。我的建议是分情况:
- 数据量在50G以下,业务可以接受数小时停机:直接逻辑备份导出,再导入5.7新库,这种方式最干净,不会有奇怪的兼容性问题。
- 数据量大、停机窗口短:使用
mysql_upgrade进行原地升级。但务必先在测试环境完整演练一次。 - 追求最小停机时间:搭建5.7从库,通过binlog追平5.6主库,然后做主从切换,这是我在生产环境用得最稳的方式。
其中“搭建从库再用binlog追平”这个方案里有一个容易忽略的细节:5.6和5.7之间复制时,建议先用--mysql56-compatibility参数或者干脆用5.6实例的mysqldump导出数据,再导入5.7后重建复制链路。直接用5.7实例连接5.6主库做复制,通常可行,但一旦遇到旧版特有的事件类型,还是可能中断。
6.2 mysql_upgrade的隐藏坑:不要忘了执行两次
用mysql_upgrade升级时,5.7版本会有一些特殊的存储过程、事件、视图等元数据需要重建。官方建议升级后执行:
bash复制mysql_upgrade -u root -p
执行完成后重启MySQL服务,然后再执行一次mysql_upgrade --check确认没有残留问题。这个过程看起来简单,但很多人会漏掉的是:如果旧库中存在自定义存储函数或触发器,mysql_upgrade在5.7上可能因为缺少super权限或者函数声明不兼容而报错。所以升级前,把所有自定义函数、存储过程的创建语句导出备份,升级后重新导入一次会更稳妥。
6.3 配置项参数差异:哪些5.6参数在5.7中废了
下面我整理几个我实际遇到的配置差异,新老版本对照非常容易踩雷:
| 参数 | MySQL 5.6 | MySQL 5.7 | 注意 |
|---|---|---|---|
query_cache |
默认开启 | 默认关闭 | 5.7中query cache已deprecated,建议完全关闭 |
innodb_file_format |
需要设置Barracuda | 无需设置 | 5.7默认且只支持Barracuda |
innodb_large_prefix |
需要显式开启 | 默认开启 | 索引前缀限制从767字节提升到3072字节 |
sql_mode |
宽松 | 严格 | 必须显式调整,否则行为差异明显 |
slave_parallel_workers |
默认0 | 默认推荐开启 | 若不设置,从库延迟依然严重 |
expire_logs_days |
可用 | 已被binlog_expire_logs_seconds替代 | 5.7里用秒数控制binlog过期更精准 |
其中query cache这个点我要多说一句。以前5.6环境很多DBA习惯把query_cache_size设得很大来提速,但5.7官方已经将其标记为deprecated,而且在高并发写入场景下query cache的全局锁竞争反而会拖慢性能。如果你是从5.6带着query_cache配置直接升到5.7,我建议启动后先看一眼SHOW VARIABLES LIKE 'query_cache%',该关就关。
6.4 升级后的性能回退问题:别急着怪新版本
升级到5.7后,偶尔会遇到“明明5.6跑得好好的,5.7反而变慢了”的情况。我排查过几次,最后原因基本都出在两类东西上:
- 执行计划变化导致部分SQL走了更差的索引路径,这类问题通过加索引或改SQL可以解决。
- 5.7默认开启
innodb_buffer_pool_dump_at_shutdown和innodb_buffer_pool_load_at_startup,如果缓冲池太大,启动时从磁盘恢复缓冲池会占用大量IO,导致冷启动后一段时间内整体性能偏低。
我当时就是没注意这类参数,升级后发现业务高峰期响应变慢,还一度以为5.7是虚有其表。后来发现是buffer pool load在重启后把磁盘IO几乎跑满了。解决方式是先关闭自动load,等业务稳定后再择机预热,或者把innodb_buffer_pool_load_abort打开以便需要时快速跳过。
6.5 监控和账号体系:最容易忽视的“隐形变更”
5.7的信息架构中新增了很多性能监控表,比如performance_schema的大量新表、sys库等。如果你们公司用的是自研监控平台或者旧版Zabbix模板,很可能监控项在5.7上读取不到数据,因为表结构和统计口径变了。我的做法是升级前先在测试环境跑一遍监控采集脚本,确认所有监控项都能取到值再切入。
账号方面,5.7的mysql.user表移除了Password字段,改成了authentication_string。如果你们内部有脚本或工具直接查mysql.user来管理账号,升级前必须调整。5.7默认开启了密码过期策略(default_password_lifetime),如果客户的程序账号密码超过默认期限没有重置,会出现“账号密码突然失效”的奇怪报错,这个问题在升级后两周内最容易爆发。
7. 基于我实测的选型建议:到底要不要从5.6升到5.7
每次有人问我“我们这破库是不是该升5.7了”,我都会先反问三个问题:你的主从延迟严不严重?你的ALTER TABLE锁表最多忍多久?你手上有没有改SQL的资源和时间?
如果这三条里有一条正中要害,那5.7基本就是你的必选项。特别是那些因为索引操作不敢优化表结构、因为从库延迟不敢上读写分离的业务,5.7在这两个维度的提升,几乎是立竿见影的。我自己在多个项目里的体会是,从5.6升到5.7之后,最明显的感受不是“某个SQL快了”,而是整个团队在做架构调整的时候,终于不用再被数据库层面的限制绑住手脚了。
如果你是那种业务极简、库很小、查询简单、也没有复制需求的小站点,那继续用5.6也没太大问题,毕竟老版本稳定、社区踩坑资料多,不会有太多意外惊喜或惊吓。但只要是稍微有点规模或者增长预期的业务,5.7的优化器改进、在线DDL和复制能力,已经足够构成升级的充分理由。
最后说一个我自己操作了无数次的小技巧:任何版本的大升级,第一步不是改配置,也不是导数据,而是先在测试环境把升级流程完整走一遍,包括备份、升级、校验、回滚演练。别嫌麻烦,这一步看似笨拙,但恰恰是升级过程中最省心的一步。等你真的在凌晨把生产库升级完成,看到所有监控指标正常、业务无感切换的时候,就会明白前面所有的准备工作都是值得的。
