开头
三年前我在凌晨两点半被一条告警叫醒,某服务的GC日志显示老年代在十分钟内被撑满,Full GC在一路上升却不回收任何东西。当时我在搜索栏里输的第一句话是“JVM内存模型”,翻了几篇文章之后才意识到,我连问题出在堆还是方法区都没想清楚。后来见的故障多了,慢慢形成一个判断:Java线上90%的疑难杂症,最后都能归结到内存模型、类加载机制和垃圾回收这三件事上——而它们并不是三个孤立的考点,是一条完整的运行链路。
这篇文章会把三块内容拆开精讲一遍,再用面试高频题和真实报错串起来。适合三类人看:准备面试但还停留在背八股阶段的Java工程师;做后端或大数据方向、已经被OOM或Full GC折磨过的人;以及那些想搞懂自己写的代码在JVM里到底经历了什么的同学。我会尽量把原理讲成人话,也会把踩过的坑直接说清楚。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
1. 三剑客不是三个孤立的考点,是一条完整的运行链路
1.1 从一次夜间故障说起:JVM知识决定你在故障现场的判断力
那次故障的具体场景是这样的:一个常规的Spring Cloud微服务,白天一切正常,深夜一个批处理任务把大量数据一次性load到了内存里,随后接口响应开始变慢,日志里开始出现超时,再然后整台机器就卡住了。我第一时间想看JVM的堆使用情况,但当时连jstat和jmap的基本参数都要翻手册,等我把GC日志捞出来分析完,服务已经被反复重启好几次了——因为每轮Full GC都在做无用功,等于一直在白忙活。
事后复盘时我才意识到,如果我当时能分清“堆里对象太多”和“老年代堆满但无法回收”是两种完全不同的处理方向,整个定位时间可以缩短一大半。这类事情在面试题里有一个经典问法:“如何排查Full GC频繁甚至OOM?” 但真正的价值不在面试,而在你半夜被叫起来的那一刻——对JVM三大机制的理解越深,你在故障现场的判断就越快。这也是我写这篇文章的一个初衷:把内存模型、类加载机制和垃圾回收连在一起讲,而不是让它们互相孤立。
1.2 JDK、JRE、JVM的关系与“JVM到底是什么”
在深挖三大机制之前,先把一个不少人说不清楚的概念理清楚——很多新手压根分不清JDK、JRE和JVM的区别,于是出现“error invoking method. failed to launch jvm”这类报错时,第一时间根本不知道去哪里找原因。
简单说,它们是一层套一层的关系:
- JVM(Java Virtual Machine)是Java程序的运行时容器,负责执行字节码。它不是一台真机器,但要有真机器的行为:分配内存、执行指令、管理生命周期。
- JRE(Java Runtime Environment)在JVM之上又加上了运行Java程序所需的核心类库和资源文件,比如我们常用的
java.lang、java.util这些包。只有JRE的程序,只能跑Java程序,不能编译。 - JDK(Java Development Kit)又在JRE之上叠加了编译器和开发工具,比如
javac、jdb、jstack、jmap这些,是开发者的完整工具箱。
有个很容易误解的点是,我们平时说“我的机器上装了JDK 17”,其实系统真正负责跑程序的还是JVM,JDK只是把开发调试这一层也配齐了。这篇文章后面所有的内存、类加载、垃圾回收内容,讨论的都是在JVM这一层发生的事。
1.3 三块知识如何串成一条链路
我习惯把JVM的运行过程讲成一个“新员工入职到离职”的故事:
- 类加载机制相当于人事部门:拿到一个
.class文件,做背景审查(验证)、分配工位和工牌(准备)、安排上岗培训(初始化),最后让这个类变成JVM里的一个可用的Class对象。 - 内存模型相当于公司大楼的物理空间:哪些区域放什么,谁私有谁共享,房间有多大会导致什么后果。类加载完后的元数据、对象实例、方法调用栈,各归各的楼层。
- 垃圾回收相当于保洁团队:负责清理那些已经没人使用的对象,把占用的空间腾出来。但保洁团队不是随时都在干活,它的清扫策略、清扫时机和清扫代价,会直接影响整栋楼的运转效率。
把这条链路放在一起看,很多模糊的概念就清楚了。比如你写了一个static变量,它在类加载的准备阶段被分配内存,然后这个位置在哪?在堆里,因为JDK 8之后静态变量跟随Class对象一起放进堆;再比如你new了一个对象,它会先跑到堆内存的伊甸园区,活过几轮GC后可能被搬到老年代——这些细节只有把三块知识打通才能看到全貌。
2. 内存模型:Java 8之后,方法区去哪了
2.1 从永久代到元空间:一个很多人没跟上版本的改动
“Java 8的JVM内存模型中是否还有方法区?”这个问题在热搜里居高不下,说明误解的人太多了。我先给结论:不管是JDK 8还是JDK 17,JVM规范里的“方法区”概念一直都在,但JDK 8做了一个关键改动——用“元空间”替代了“永久代”。
永久代(PermGen)是JDK 8之前方法区的实现方式,它有一个坑:大小受限,受-XX:MaxPermSize参数约束,而且经典面试题会告诉你它属于堆的一部分。一旦项目里用了大量动态生成类的框架——比如CGLIB、JSP编译,或者热部署加载了大量类,很容易把永久代撑爆,报出java.lang.OutOfMemoryError: PermGen space。这个报错当年几乎是人人都要遇到一遍的“老朋友”。
JDK 8把这个设计推倒重来了:元空间(Metaspace)不再占用堆内存,而是直接使用本地内存(native memory)。 这意味着只要机器物理内存够大,类元数据默认就不会OOM,-XX:MaxMetaspaceSize变成了兜底上限而不是默认牢笼。同时,字符串常量池在JDK 7时就已经被提前搬到了堆里,JDK 8之后静态变量也跟着Class对象一起待在堆中。所以面试题如果问“JDK 8之后方法区还有没有”,准确回答是:
- 方法区是规范里的概念,它还在;
- 在HotSpot实现里,永久代被移除了,改用元空间实现方法区;
- 元空间不在JVM堆内,占用的是本地内存。
2.2 运行时数据区的地图与分工
JVM的运行时数据区一共分五个区域,我习惯把它们分成“线程私有”和“线程共享”两张地图:
线程私有区域(每个线程各有一份):
- 程序计数器:当前线程正在执行的字节码行号指示器。它是一块很小的内存,也是唯一不会OOM的区域。它的作用不言而喻:线程切换时,CPU要恢复到正确的执行位置,就是靠它。
- 虚拟机栈:每个方法调用对应一个栈帧,栈帧里放着局部变量表、操作数栈、动态链接、方法出口等。栈深度超过
-Xss设置时会抛出StackOverflowError。 - 本地方法栈:为JVM调用Native方法服务,HotSpot里和虚拟机栈合并了。
线程共享区域(所有线程都在里面干活):
- 堆:对象分配的主战场,GC的主要活动区域。里面又分为新生代(Eden区、两块Survivor区)和老年代。
- 元空间:存放类的元数据、方法信息、字段信息等,JDK 8之后不在堆内。
打一个日常生活的比方:栈像一张随手记录的小便签本,方法调用就撕一页,用完即丢,不需要额外打扫;堆像一个长期仓库,东西可以放很久,但堆满了要有人专门来清。 大多数线上故障,问题都出在堆上,而不是栈上。
2.3 对象从new到回收的一生
一个对象从出生到死亡,在JVM内存里大概会经历这样一条完整路径:
- 对象创建时,如果是可逃逸的小对象,可能先尝试在栈上分配,但正常情况走的是堆上的Eden区。JVM为了减少线程竞争,还会给每个线程预留一块TLAB(Thread Local Allocation Buffer),优先在各自的缓冲区里分配。
- Eden区慢慢变满,触发Minor GC(新生代GC)。使用复制算法,把存活对象搬到Survivor区,存活对象年龄加1。
- 每熬过一次Minor GC,年龄就加一,默认到15岁后晋升老年代。如果Survivor区装不下,也会提前晋升。
- 老年代积累到一定程度,触发Major GC/Full GC。
- 如果GC回收不掉越来越多的对象——比如代码里有对象被无意识持有,最终抛出
OutOfMemoryError: Java heap space。
我在实际排查时发现,很多人的误判在第三步:Survivor区的晋升不是“必须活满15次”,对象如果大于Survivor区的空间,会直接进老年代;另外,Eden区和Survivor区默认比例是8:1:1,但这只是默认值,JVM有时会动态调整(开启-XX:+UseAdaptiveSizePolicy时),不要死记硬背。
2.4 常见的“内存不够了”到底是谁不够
JVM里能OOM的地方不止堆,每次OOM的报错不同,定位方向也不同。我把常见的几种形态整理如下:
| 报错信息 | 对应区域 | 常见场景 |
|---|---|---|
java.lang.OutOfMemoryError: Java heap space |
堆 | 对象太多且无法回收,内存泄漏或大对象积压 |
java.lang.OutOfMemoryError: Metaspace |
元空间 | 动态生成类过多,比如大量CGLIB代理 |
java.lang.OutOfMemoryError: GC overhead limit exceeded |
堆 | GC拼命回收但回收不掉多少,超过98%时间在GC |
java.lang.StackOverflowError |
虚拟机栈 | 无出口递归、无限调用 |
这里漏掉了一个容易被忽略的区域:直接内存。NIO里用ByteBuffer.allocateDirect()分配的堆外内存,不受堆大小限制,但受机器物理内存约束。很多做网络编程的人把-Xmx调大了还是出OOM,就是因为没把直接内存算进去。它没有单独的报错标识,容易绕弯子。
关于堆参数,基础配置先记住这几个:-Xms设置堆初始大小,-Xmx设置堆最大值,两者设为相同值可以避免堆扩容时抖动;-Xss设置虚拟机栈大小;-XX:MaxMetaspaceSize设置元空间上限。很多人问“堆是不是越大越好”,答案显然不是,堆过大反而会让GC单次停顿更久,这个在文章后面垃圾回收部分会展开。
3. 类加载机制:谁把.class变成JVM里的活对象
3.1 一个类的“入职流程”:验证、准备、解析、初始化
写Java的人都知道类加载,但是能把加载、验证、准备、解析、初始化这几步讲明白并在实际排障中用上的,比例其实不高。我用一个“新员工入职”的例子帮你把这几步钉在脑子里:
- 加载:人事部去文件系统或网络中拿到一个
.class文件,读入字节流,生成一个代表该类的Class对象。注意,这一步只是把“简历”拿进来,还没验证。 - 验证:背景审查。检查字节码是否符合JVM规范,防止恶意或非法的字节码混进来。这一步如果不通过,会抛出
VerifyError。 - 准备:分配工位和初始拨备。这一步会为类的静态变量分配内存,并设置默认值,不是代码里写的初始化值。比如
static int a = 100,准备阶段结束后a的值是0,不是100。 - 解析:把常量池里的符号引用替换为直接引用。这一步可以理解为“把外号换成真人”——把代码里引用的类名、方法名、字段名解析成实际的内存地址。它不一定非得马上执行完,JVM允许在初始化之后再延迟解析。
- 初始化:正式执行类构造器
<clinit>,把所有静态变量的赋值语句和静态代码块按顺序执行。到这一步,代码里的100才会真正赋上去。
为什么要按这个顺序理解?因为实际排查时会遇到一些奇怪的现象。比如有人问:为什么一个类里的static final常量在别的类里引用时,修改这个常量后老代码不生效?原因就是编译期间常量被直接内联到调用方的字节码里,和类加载的初始化顺序没有关系。
3.2 双亲委派模型:为什么设计成向上委托
双亲委派的工作逻辑一句话就能说清:当一个类加载器收到类加载请求,它不会自己先加载,而是先把请求委派给父加载器,父加载器又向上委派,直到最顶层的Bootstrap ClassLoader。只有父加载器反馈自己无法加载时,子加载器才会尝试自己加载。
HotSpot里的三层类加载器分别是:
- Bootstrap ClassLoader:加载
JAVA_HOME/lib目录下的核心类库,比如rt.jar里的java.lang.String,它由C++实现,在Java代码里拿不到引用。 - Extension ClassLoader:JDK 9之后改名为Platform ClassLoader,加载扩展目录里的类库。
- Application ClassLoader:加载classpath下的应用类,我们平时写的大部分代码都是它加载的。
第2章提到的java.lang.String是一个经典例子:如果你写了一模一样的java.lang.String放进classpath,应用类加载器在双亲委派机制下会先把请求交给父级,Bootstrap发现自己能加载,就直接加载JDK自带的String,你写的那个“山寨货”压根没有出场机会。这就是双亲委派最核心的价值:核心类库全系统唯一,防止被篡改。
3.3 Tomcat、JDBC、SPI:什么时候必须打破规则
面试时如果你能讲出“什么场景必须打破双亲委派”,通常会被高看一眼,因为这说明你不是只背了概念。
第一个典型场景是Tomcat。 Tomcat要部署多个Web应用,每个应用可能依赖不同版本的Spring、Log4j等类库。A应用用Spring 4,B应用用Spring 5,如果都用同一个应用类加载器加载,两个版本的类冲突会立刻爆炸。所以Tomcat为每个Web应用创建独立的WebAppClassLoader,默认优先自己加载WEB-INF/lib和WEB-INF/classes下的类,加载不到再交给父加载器。这种“自底向上”的加载顺序,就是打破双亲委派的表现。
第二个典型场景是JDBC的SPI机制。 java.sql.DriverManager由Bootstrap加载,但具体的MySQL驱动、PostgreSQL驱动却躺在classpath里,按双亲委派逻辑,Bootstrap根本找不到它们。JDK的解决方案是引入线程上下文类加载器(Thread Context ClassLoader):由外部调用方设置上下文加载器,让核心类去委托应用类加载器加载。这也是为什么JDBC驱动的加载问题至今仍是面试常问。
3.4 ClassNotFoundException与NoClassDefFoundError:两个“找不到类”的伪装者
很多人把ClassNotFoundException和NoClassDefFoundError混为一谈,但它们其实是两个层面的问题,排查方向完全相反。
- ClassNotFoundException是一个
Exception,通常在显式加载类时抛出,比如Class.forName()或ClassLoader.loadClass()。它意味着“这个类压根不在当前的类加载路径上”,最常见的原因是jar包没打进去、classpath配置错误。 - NoClassDefFoundError是一个
Error,通常发生在类在编译期存在、运行期加载失败时。比如一个类引用了另一个依赖类,而那个依赖类在运行时缺失;或者依赖类在初始化阶段就抛了异常,被连累。它往往不是真正的“文件不存在”,而是“这个类没能成功初始化”。
我在项目里见过最典型的NoClassDefFoundError,是某个类第一次被触发初始化时,它的静态代码块里抛了NPE但异常被吞了,之后每次想加载这个类都会触底失败,最终以NoClassDefFoundError的形式报出来。所以看到这个错误时,别急着往classpath里加jar包,先回头看那个类自己的静态初始化逻辑有没有问题。
4. 垃圾回收:对象怎么死、怎么被清掉
4.1 判断“已死”:为什么是可达性分析而不是引用计数
垃圾回收第一步是判断对象是否还有用处。早期很多语言用引用计数法:每个对象记录自己被引用的次数,次数为0就回收。这套方案实现简单,但有一个致命伤——循环引用。两个对象互相持有引用,外部已经没人用它们了,但引用计数永远不为0,内存就被白占着。
JVM主流方案用的是可达性分析(Reachability Analysis):从一组称为GC Roots的起点出发,沿着引用链向下搜索,能被搜索到的对象叫“可达”,不可达的对象判定为可回收。GC Roots包括:
- 虚拟机栈帧中的局部变量引用的对象
- 静态变量引用的对象
- 方法区中常量引用的对象
- JNI(Native方法)引用的对象
- 活跃线程(比如Thread对象)
打个比方,GC Roots是大楼的几个主出口,保洁人员从主出口出发,沿着所有能走通的通道巡逻,凡是走不到的房间才贴封条。这就能解释为什么两个对象互相引用但没有人实际持有它们时,也能被正确回收——因为从GC Roots出发根本走不过去。
4.2 分代管理与三种基础清理算法
JVM的堆分代设计来自一个经验规律,叫弱分代假说:绝大部分对象朝生夕灭,活过几次GC的对象往往能存活很久。既然生命周期特征不同,回收策略就不能一套走天下,于是堆被分成新生代和老年代。
三种基础算法各有取舍:
- 标记-清除:先标记可回收对象,再统一清除。实现简单,问题是会产生大量内存碎片,后续大对象分配时会痛苦;而且标记和清除两个阶段都需要停顿。
- 复制:把内存分成两块,只使用其中一块,GC时把存活对象复制到另一块,再整块清理。实现干净、没有碎片,但内存可用率直接打折。
- 标记-整理:先标记,再把存活对象往一端移动,最后清理边界外的内存。解决了碎片问题,但移动对象本身就是一项昂贵的操作。
新生代因为存活对象少,适合用复制算法;老年代存活对象多,适合用标记-整理或标记-清除。这是分代回收的核心逻辑。
4.3 从Serial到ZGC:GC收集器的一路升级
收集器的演进史,本质上是一部“停顿时间越来越短”的历史:
| 收集器 | 核心策略 | 适用范围与特点 |
|---|---|---|
| Serial | 单线程、复制+标记-整理 | Client模式默认,暂停时间长,但简单可靠 |
| Parallel | 多线程并行收集 | 追求高吞吐,适合后台计算任务 |
| CMS | 标记-清除、并发收集 | 追求低停顿,但碎片化严重、并发模式失败风险高 |
| G1 | Region划分、可预测停顿 | JDK 9+默认,服务端主流选择 |
| ZGC | 染色指针、读屏障 | 目标亚毫秒级停顿,适合超大堆 |
热点是G1,我这里多说几句。G1不再遵循“新生代物理连续、老年代物理连续”的老规则,而是把整个堆划分成许多大小相等的Region,每个Region的角色动态变化,新生代和老年代都是一些逻辑上的Region集合。它最大的突破是外部可设定停顿时间目标:通过-XX:MaxGCPauseMillis告诉JVM“每次GC停顿尽量不超过这个值”,G1会去估算并调整各区域回收优先级。
但G1不是万能的。我见过有人把-XX:MaxGCPauseMillis调成10ms,结果GC依然卡顿——因为当老年代被填满、对象晋升速度超过回收速度时,G1会退化到Serial Old级别的Full GC,停顿照样秒级。调参之前,先看业务有没有峰值流量、有没有大对象、有没有内存泄漏,这些比调参数本身更优先。
4.4 读懂GC日志是调优的基本功
很多人在调优时拿着参数一顿试,却连GC日志都不会看。JDK 9之后,GC日志参数从-XX:+PrintGCDetails改成了-Xlog:gc*,格式也变了。一段典型的GC日志长这样:
code复制[0.038s][info][gc,start] GC(0) Pause Young (Normal) (G1 Evacuation Pause) 24M->8M(512M) 3.242ms
[0.117s][info][gc,start] GC(3) Pause Full (Allocation Failure) 512M->398M(512M) 1023.1ms
可以这样拆解:
- 第一行是正常的新生代GC:堆内存从24M降到8M,堆总容量512M,耗时3.2ms——这是一次健康的GC。
- 第二行是Full GC:容量已经满到512M,回收后还有398M,耗时超过了1秒。如果在日志里高频看到这种Full GC,说明老年代已经救不回来了,得马上看堆转储文件找对象来源,而不是继续调GC参数。
看GC日志有三个关注点:频率、停顿、回收量。频率过高说明对象分配太快;停顿过长要关注收集器类型和堆大小;回收后占用率依然高,基本可以锁定为内存泄漏或超大对象集合。
5. 把知识变成判断力:面试高频题与线上排障
5.1 面试官最爱问的JVM细节与答题逻辑
结合最近的热搜词,我把面试里几个高频的JVM问题梳理一下。这些问题不只是为了面试,更像是检验你是否真正理解JVM运行规律的“路标”。
问题一:Java 8之后,JVM内存模型里还有方法区吗?
这个问题的完整回答框架我在第2章讲过:规范里的方法区还在,HotSpot把永久代换成了元空间,元空间在本地内存里。答题时最好再补一句:字符串常量池在JDK 7时已经移入堆,静态变量在JDK 8后也在堆中。 这样能体现你对版本演进的敏感度。
问题二:垃圾回收时,一个对象什么时候进入老年代?
可以分几点答:大对象直接进入老年代,主要通过-XX:PretenureSizeThreshold控制;对象每存活一次Minor GC年龄+1,默认到15进老年代;Survivor空间不够时,年龄没有到15也可能被提前晋升。再深入一点,可以提动态年龄判定:Survivor中相同年龄所有对象大小的总和大于Survivor空间的一半时,大于等于该年龄的对象直接进老年代。这个细节在面试中很容易加分。
问题三:GC Roots有哪些?CMS和G1有什么区别?
GC Roots内容在前面列过,答题时口头背一遍即可。CMS和G1的区别可以从“物理连续 vs Region分区”“是否可设停顿时间”“是否会产生碎片”三个角度展开。G1必须是“更高级的收集器”吗?未必,CMS在响应时间优先且堆不大的场景下依然有它存在的道理。
问题四:JDK 8和JDK 17的默认GC有什么变化?
JDK 8默认是Parallel,JDK 9+默认是G1。如果考生连这个都答不上来,简历上写着“熟悉JVM调优”就比较尴尬了。这个问题的扩展价值在于,它提醒你:越新的JDK,默认的内存管理和GC策略越偏向低停顿,因此做技术选型时不必总是守着老古董参数不放。
5.2 两个真实报错的排查过程
第一个报错是:“error invoking method. failed to launch jvm”。 这个报错常见于基于JVM的桌面应用或IDE插件启动时,很多人看到“failed to launch jvm”就慌,其实根因通常不在JVM本身。排查分三步:
- 检查
JAVA_HOME和环境变量是否配对。我有一次就是切换JDK版本后,某些工具的配置文件里还硬编码着老JDK路径。 - 检查启动参数里的内存设置,特别是
-Xmx是否超过了机器剩余物理内存或32位JVM的地址空间上限。32位JVM最大能申请的内存不到4G,如果配了-Xmx6g,JVM根本起不来。 - 检查是不是自带JRE的路径和系统安装的JDK混用了。
第二个报错是:“java: 无法编译为 jvm 目标 17 配置的模块 'jeecg-boot-base-core': 指定的回退 s”。 这类报错在IDEA里遇到得很多,它是模块化工程中JDK目标版本不一致导致的。排查路径通常是这样:
- 检查Project Structure里的Project SDK和Language level是否都指向17;
- 检查每个子模块的target字节码版本是否统一;
- 重点看Maven编译器插件的
source和target配置,如果配了<release>就更要注意,因为release会同时约束source、target和系统模块,配置冲突时会直接报错。
按我的经验,这类报错八成是某个模块的Language level掉回了老版本,或者Maven compiler插件里的source/target没跟着一起改成17。把整棵模块树的项目设置过一遍,比盲目改pom.xml要快。
5.3 JVM内存模型优化与GC调优的落地姿势
很多人一上来就问“JVM参数怎么调”,但调优必须先有依据,否则只是碰运气。我自己的实践顺序是这样的:
先看业务特征。一个高吞吐的后台批处理服务和一个低延迟的在线接口服务,选择完全不同:批处理适合Parallel + 较大新生代,在线服务更倾向G1或CMS,且要严格控制停顿。
再看现状数据。先跑一轮GC日志,统计Minor GC和Full GC的频率、停顿时间、回收量,再决定方向。如果Full GC一天只有几次每次几十毫秒,就没必要动;如果Full GC频繁且老年代回收率极低,先怀疑泄漏,不要直接加堆。
堆大小怎么定?一个常用的经验是:先用机器物理内存的一半左右作为-Xmx,观察GC日志,再按“老年代在Full GC后占用率不超过50%”的标准去微调。 堆调大多了,GC单次停顿会变长;调小了,GC频率又上升,需要找一个平衡点。推荐把-Xms和-Xmx设成一致,避免运行时扩容。
关于新生代大小,-Xmn或-XX:NewRatio默认会让新生代占堆的三分之一左右。如果业务全是短生命周期对象(比如大量的临时Dto),可以把新生代比例调大一些;如果业务老对象多,反而要缓调。每次只改一个参数、观察一次效果,不要一次性堆上五六个参数,不然出了问题根本分不清是哪一步改坏了。
5.4 跨语言与跨框架视角:Python、Spark与JVM的关系
热搜词里同时出现了“python垃圾回收机制”和“spark内存模型”,我从JVM视角简单对照一下,方便有跨语言背景的读者建立坐标系。
Python的垃圾回收和Java有个明显区别:Python以引用计数为主、以标记清除和分代回收为辅。引用计数实现直观,但循环引用是一个持续要解决的痛点,所以Python必须再用一轮额外的标记清除来处理那些“抱团等死”的对象群。Java直接采用可达性分析,从GC Roots出发判断,规避循环引用问题,代价是每次GC的标记阶段需要付出停顿成本。
Spark的运行模型则是在JVM之上盖了一层楼。Spark的Executor本质上是JVM进程,Spark内存模型又在这个JVM堆内切出了“执行内存”和“存储内存”两个池子,由spark.memory.fraction控制比例。 所以排查Spark的OOM时要分两层看:
- 如果
java.lang.OutOfMemoryError: Java heap space直接出现,说明JVM堆就不够,常规手段是提高Executor的spark.executor.memory或降单实例负载; - 如果Spark内部的执行内存不足导致频繁spill或报
ExecutorLostFailure,那要调的是Spark内存比例和并行度,而不是单纯加JVM堆。
我见过不少大数据同学在Spark OOM后猛调spark.executor.memory,结果运到JVM层时直接顶爆了物理机——因为一个Worker上起了多个Executor,每个的堆大小叠加后超过机器内存。所以跨到大数据场景时,JVM内存模型的基础判断力变得尤其重要,它决定了你在排查时是先看哪一层的参数。
说实话,JVM三剑客的内容本身说不上新颖,网上资料一抓一大把,但真正能落地到解决问题的时刻,靠的还是这些底层概念是否在你脑子里连成了体系。我个人这几年最大的体会是:不要追求把所有参数都背下来,而是在每次遇到OOM、类加载冲突、GC停顿的时候,强迫自己沿着“内存模型定位区域、类加载机制定位来源、垃圾回收定位阈值”这条链路想一遍,久而久之,判断力自然就长出来了。希望这篇长文能帮你把这三块知识焊在一起,下一次你在生产环境遇到它们时,一点都不慌。
