我很早就想写一篇关于“线程和上下文”的文章了。干了这么多年后端,面试过不少人,也带过不少新人,发现大家对这个话题的认知普遍停留在“背八股”的层面:能说出线程和进程的区别,能背出线程池的参数,但真到了线上排查问题、调整线程池配置、定位性能瓶颈的时候,脑子里那点概念根本不够用。
这篇文章我想换个讲法,不按教科书的路子来,而是从“计算机原理到底怎么影响你的代码”这个角度切入,把线程是什么、上下文切换到底在切什么、线程池的参数背后在算计什么、线程安全问题的根源在哪里,一层一层拆开讲清楚。内容会结合我实际调优和踩坑的经历,也会穿插一些跨语言(C#、C++/Qt)的对照,希望对正在学操作系统、准备面试、或者已经在写并发代码的朋友都有点用。
1. 先搞清楚进程和线程——资源的所有权之争
1.1 进程是资源容器,线程是执行单元
很多教材上来就列一张表:进程是资源分配的最小单位,线程是CPU调度的最小单位。这句话背下来容易,但真理解的人不多。我换个说法:进程像一个公司,线程是公司里的员工。公司拥有办公场地、电脑、打印机、财务预算这些资源,但真正干活的是员工。你要裁员,裁的是员工,不是把公司解散;但公司一旦解散,所有员工都得走,所有资源也都得释放。
从操作系统原理的角度看,一个进程的内存空间里装着代码段、数据段、堆、栈,还维护着打开的文件描述符表、信号处理表、环境变量等一大堆资源。而线程是进程内部的一条执行流,它跟同一进程里的其他线程共享这些资源,只有自己的栈、寄存器状态和程序计数器是独立的。这就是为什么线程之间通信特别方便——大家本来就在同一块内存里,直接读共享变量就行了,但这也恰恰是后面线程安全问题的根源。
我实际工作里的感受是,进程和线程的取舍从来不是“谁更好”的问题,而是“你要隔离还是要效率”的问题。多进程天然隔离,一个崩了不影响另一个,但进程间通信用管道、消息队列、共享内存都绕一圈,成本高;多线程写起来直观,共享数据随手就能用,但一个线程把共享数据改坏了,整个进程都跟着遭殃。Chrome开一个标签页一个进程,就是为了隔离;而绝大多数后端服务用多线程,图的是低延迟高吞吐。
1.2 为什么需要线程——并发与并行的本质差异
初学者常把并发(concurrency)和并行(parallelism)混为一谈,这俩在原理层面差别很大。并发是多个任务在同一个CPU核上交替执行,宏观上像是一起跑,微观上CPU在不停切换;并行是多个任务在多个CPU核上同时执行,是真正意义上的“同时”。
单核CPU时代,我们只有并发,线程的意义在于:当一个线程在等磁盘IO、等网络响应的时候,CPU可以切去执行别的线程,而不是傻等着。这就是IO密集型和CPU密集型任务的根本区别——IO密集型的线程大部分时间在等,CPU密集型的线程大部分时间在算。你在数据库查询、HTTP调用这种场景下用多线程,收益主要来自“等待期间让出CPU给别的线程用”;你在图像处理、加解密这种纯计算场景下用多线程,收益才来自多核并行。
我见过有人拿着四核服务器,开了两百个线程去调一个第三方HTTP接口,结果接口本身没压力,反而服务器自己先扛不住了——上下文切换开销巨大,CPU全耗在“换人”上了。这就是没搞清楚并发和并行、没搞明白线程到底在解决什么问题。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 上下文切换——操作系统里最贵的一次“换人”
2.1 上下文到底是什么——寄存器、栈指针与程序计数器
“上下文”这个词在计算机原理里出镜率极高,但很多人没细想过它具体指什么。简单说,上下文就是一个线程“干到一半”时的全部现场信息。CPU在某一时刻只能执行一个线程,当操作系统决定把CPU从线程A切换给线程B时,它必须完整保存A的现场,将来A被重新调度时才能接着原来的位置继续跑,而不是从头再来。
这个现场包括哪些东西?首先是程序计数器(PC),它记录了线程即将执行的下一条指令的内存地址——没有它,线程恢复执行时不知道去哪取指令。其次是一组通用寄存器,包括累加器、基址寄存器、索引寄存器等,它们保存着当前的中间计算结果。然后是栈指针(SP)和栈帧信息,线程的局部变量、函数调用链都在栈上,SP指向栈顶,丢了就全乱了。再往细了说,还有状态寄存器(存条件码、标志位)、浮点寄存器、内存管理相关的页表基址等。
写过汇编或者调试过崩溃栈的朋友,对这套东西应该有直觉。我当年用GDB调试C程序的时候,看到 info registers 打出来那一排寄存器值,才真正意识到“线程执行到哪了”在机器层面到底是什么样——就是这一堆寄存器的值而已。操作系统要做的事情,说白了就是把这一堆值从当前线程的上下文结构体里拷出来存好,再把下一个线程的上下文结构体里的值拷进寄存器。
2.2 一次切换的开销到底花在哪里
很多人以为上下文切换就是保存几个寄存器,能有多贵?实测告诉你,一次直接的开销大概在1到10微秒这个量级,听起来不高对吧?但这里藏着两个更隐蔽的代价。
第一个是内核态与用户态的切换。线程切换不是用户程序自己就能干的,必须通过系统调用陷入内核,由操作系统的调度器来做决策和切换。这意味着每次切换都要从用户态切到内核态,执行完调度逻辑再切回用户态,这个进出过程本身就有不小的开销。你在源码层面调一个 Thread.yield() 或 wait(),底层都会走这么一趟。
第二个更狠的是缓存失效。CPU有L1、L2、L3多级缓存,这些缓存里存着当前线程正在访问的数据和指令。一旦切到另一个线程,新线程的数据大概率不在缓存里,就像你正坐在办公桌前处理文件,突然被叫去另一个工位干活,桌子上什么都没有,得重新去档案室搬资料。这个“冷启动”开销远比寄存器保存那几微秒大得多,尤其是高频率切换时,CPU大部分时间不是在执行代码,而是在喂缓存。
我在实际性能测试里观察过一个现象:一个服务原本单线程跑,每秒处理1万请求,你想着“多核CPU闲着也是闲着”,改成8个线程跑,结果吞吐量反而掉到每秒6000。原因就是线程之间互相抢锁、频繁切换,缓存命中率暴跌,收益远远覆盖不了开销。这不是多线程的错,是线程数量与CPU核心数严重不匹配导致的。
2.3 线程数量不是越多越好——一个实测实验
我建议每个做并发编程的人都亲手做一次这个实验:写一个纯CPU计算的程序,比如算大量数据的MD5,然后在不同线程数下测试吞吐量。我用一台8核16线程的Linux服务器测过,数据大致是这样的:
| 线程数 | 总耗时(秒) | 有效CPU利用率 | 备注 |
|---|---|---|---|
| 1 | 32.0 | 12.5%(单核打满) | 其他核心闲置 |
| 8 | 4.2 | 95%+ | 最优区间 |
| 16 | 4.0 | 98% | 收益趋近于零 |
| 32 | 4.5 | 105%(含切换开销) | 开始出现退化 |
| 64 | 6.8 | 130%(虚高) | 切换开销开始反噬 |
注意看,从16线程加到32线程几乎没有收益,从32加到64反而变慢了。CPU利用率甚至超过100%(top里显示)是因为它统计的是所有核的使用率总和,超过了100%反而说明切换和自旋在空耗CPU。这就是我在前面说的:线程数量和你拥有的物理核数、任务的IO密集程度,这三者必须匹配,否则多开线程就是给自己挖坑。
3. 线程池——把创建和销毁的成本摊薄
3.1 为什么不直接 new Thread——创建线程没那么便宜
初学者写并发代码,最容易上手的方式就是 new Thread(() -> {...}).start(),写起来确实爽快。但线上服务要是这么干,很快就会被现实教育。创建一个线程不只是 new 一个对象那么简单,JVM要分配线程栈内存(默认1MB),操作系统要创建内核线程、初始化调度数据结构,最后还要经历一次完整的调度——这套流程走下来通常要消耗几百微秒到毫秒级的时间。如果请求量一大,每秒来几千个请求,每个请求都现开一个线程,光创建线程就能把CPU吃满。
最可怕的是线程数不受控制。每来一个请求就开一个线程,线程数一路飙升,系统渐渐扛不住,最终OOM或者频繁上下文切换导致服务假死。我在生产环境见过最夸张的一个案例,某服务线程数干到了3000多,CPU全部耗在切换上,真正的业务代码一点没跑,健康检查还时不时超时。
线程池的意义,说白了就是“线程复用”。把创建好的线程放在池子里循环利用,来了新任务就交给空闲线程执行,没有空闲线程就把任务放在队列里等着,实在忙不过来再创建新线程。这样既避免了频繁创建销毁的开销,又能通过参数限制最大线程数,防止资源被耗尽。
3.2 核心参数是如何决定线程池“性格”的
Java的 ThreadPoolExecutor 有七个构造参数,每个都不是摆设。核心线程数(corePoolSize)决定池子平时保底保留多少线程,即使它们处于空闲状态也不会被回收;最大线程数(maximumPoolSize)是池子的天花板,超过这个数的新任务不会再创建线程;空闲存活时间(keepAliveTime)配合时间单位(unit)决定非核心线程空闲多久会被回收;阻塞队列(workQueue)是任务的缓冲区;线程工厂(threadFactory)定义线程的创建方式,通常用来给线程起名字、设置守护状态;拒绝策略(handler)决定线程数达到上限且队列已满时,新任务怎么处理。
我一直觉得,与其死记这些参数,不如理解线程池的工作流程,其实就一句话:有任务来了,先看核心线程有没有空闲,有就执行;没有就把任务丢进队列;队列满了再看能不能创建新线程,能不能看是否达到最大线程数;全满了就执行拒绝策略。
这套流程里最容易出问题的是“队列满没满”和“线程数达没达上限”的判断顺序。很多人想当然以为核心线程满了就去创建新线程,但其实线程池是先把任务塞进队列,塞不进去了才创建新线程。这个顺序决定了:如果你用一个无界队列(比如默认的 LinkedBlockingQueue),那么核心线程数就是实际最大线程数,因为队列永远塞不满,永远不会触发创建新线程。换句话说,你设置的最大线程数直接失效了。
3.3 阻塞队列的选择——LinkedBlockingQueue、ArrayBlockingQueue与SynchronousQueue
线程池的性能调优,很大一部分其实是选队列和调队列大小。
LinkedBlockingQueue 默认是无界的,可以无限往后塞任务。用它的好处是“稳”,任务永远不会因为队列满被拒绝,坏处是如果任务生产速度长期大于消费速度,队列会无限膨胀,内存被吃光,而且最大线程数的配置形同虚设。适合对峰值不敏感、宁可排队也不要丢弃任务的场景,比如后台批处理、异步消息落库。
ArrayBlockingQueue 是有界的,必须指定容量。这是我在生产里最常用的队列,因为它强迫你思考“到底最多允许多少任务排队”。有界队列 + 合理的拒绝策略,才能真正让线程池的参数发挥设计的作用。比如一个电商下单服务,你允许200个任务排队,再来新的就快速失败返回“系统繁忙”,这比让请求一直排队等着更合理——用户宁可收到明确报错,也不愿意转圈半天。
SynchronousQueue 比较特殊,它内部不存储任何任务,来一个任务必须立刻交给线程处理,没有线程空闲就创建新线程。所以用这个队列时,核心线程数形同虚设,线程数会直奔最大线程数而去。适合每个任务都要求迅速执行、不想排队、且任务量大到不建新线程不行的场景。但用它时要格外小心最大线程数的设置,否则瞬间创建的线程数能把服务器压垮。
我在实际项目里通常遵循一个原则:80%的场景用 ArrayBlockingQueue + 自定义拒绝策略,剩下的按业务容忍度决定。宁可对突发流量快速失败,也不能让任务无限堆积拖垮整个应用。
3.4 submit和execute的区别——异常处理和返回值的两重门
很多人只知道 execute 不返回值、submit 返回 Future,却忽略了它们在异常处理上的关键差异。execute 直接执行任务,任务里的未捕获异常会直接抛到当前线程的 UncaughtExceptionHandler,线程被终止;而 submit 会把任务包装成 FutureTask,异常会被捕获并封装在 Future 里,等你调用 future.get() 时才抛出 ExecutionException。
这个差异在线上很容易埋坑。有一次同事写了一段代码,用 submit 提交了一堆任务,里面有个地方会偶发空指针,结果日志里什么都没打出来,任务“看起来”跑完了,但结果全是空的。排查半天才发现,异常被吞在了 Future 里,没人去 get() 也就没人看见异常。而如果用 execute,空指针早就打到日志里了。
我的建议是:如果你不关心任务的返回值,就老老实实用 execute,让异常直接暴露在日志里;如果非要用 submit,记得顺手把 Future 收集起来,统一调用一次 get() 来捕获可能的异常。这两种方式的取舍,本质上是在“主动接收异常”和“被动吞掉异常”之间做选择,别让框架替你做了决定。
4. 线程安全——并发下最容易被背刺的地方
4.1 原子性、可见性、有序性——线程安全问题的三个根源
线程安全问题看着繁多,追根溯源就是三件事:原子性被破坏、可见性失效、有序性被重排。
原子性,说的是一个操作是不可分割的。你写 count++ 这三行代码,在CPU层面其实是三条指令:从内存读count到寄存器、寄存器加1、把结果写回内存。两个线程同时执行这三条指令,互相穿插,结果就是明明加了两次,count只大了1。这就是经典的数据竞争。解决方案是加锁、使用AtomicInteger这类CAS操作、或者把操作包进Synchronized块。
可见性,说的是一个线程对共享变量的修改,另一个线程能不能立刻看到。CPU有缓存,线程A把变量改在了自己的CPU缓存里,还没刷回主内存,线程B读的时候读到的还是旧值。volatile关键字就干这一件事:确保每次读写都直接操作主内存,强制立即可见。但注意,volatile不保证原子性,它解决不了 count++ 的问题。
有序性,说的是编译器和CPU为了优化,可能会改变代码的执行顺序。只要重排不影响单线程的结果,CPU就敢乱排。但在多线程下,A线程“先写标志位再写数据”的顺序被打乱后,B线程可能看到“标志位已经变了但数据还没写好”的中间状态。synchronized 和 volatile 都能通过内存屏障来限制重排。
我在面试里最常问的一道题是:双检锁(Double-Checked Locking)为什么要加 volatile?能答上来的候选人,才算真的理解了可见性和有序性。关键在于,instance = new Singleton() 不是原子操作,它包含三步:分配内存、调用构造器初始化、把引用指向内存。如果不加 volatile,CPU可能把第三步重排到第二步前面,另一个线程就会拿到一个“已分配内存但尚未初始化完成”的对象。
4.2 Java线程安全类怎么选——从同步容器到并发容器
JDK提供了好几代线程安全容器,选型错误也是安全问题的来源之一。老一代的 Hashtable、Vector、Collections.synchronizedList 这些,统一思路是给每个方法加 synchronized 锁,线程安全是安全了,但并发度极低——所有线程串行访问,跟单线程没区别。
新一代的 ConcurrentHashMap、CopyOnWriteArrayList、BlockingQueue 系列,走的则是另一条路:锁分段、CAS、读写分离。ConcurrentHashMap 底层在JDK 8之后改成了CAS + synchronized 锁桶,读操作完全无锁,写操作只锁单个桶,并发度比老容器提升了一个数量级。实测下来,在多线程高频读写的场景下,ConcurrentHashMap 的吞吐量能甩开 Hashtable 一个量级不止。
选型时我的经验很简单:读多写少的场景,用 CopyOnWriteArrayList 或 ConcurrentHashMap;写多读也多的场景,用 ConcurrentHashMap 配合同步策略;需要线程间传递任务或数据的,用各种 BlockingQueue;你如果还在用什么 StringBuffer、Vector,除非是历史代码,否则建议趁早换掉。
4.3 死锁的产生与排查——四个必要条件与jstack实操
死锁是并发编程里最容易让人头疼的问题。它的产生需要同时满足四个条件:互斥(资源一次只能被一个线程占用)、持有并等待(一个线程持有一个资源,同时在等另一个资源)、不可剥夺(资源不能被强行抢走)、循环等待(多个线程互相持有对方需要的资源,形成环)。
我用一个生活化的场景来解释:两个人面对面过独木桥,A先迈左脚踏上了桥,B也迈左脚踩上了桥的另一端,两个人谁也不肯后退,都在等对方退回去给自己让路,这就是死锁。程序里的死锁一模一样:线程1持有锁A等待锁B,线程2持有锁B等待锁A,谁也不让,任务就永远卡住了。
排查死锁有个非常实用的命令级工具——jstack。线上遇到服务卡死、请求全部超时的情况,第一步先 jstack -l <pid> 把线程栈dump出来,然后搜索 Found one Java-level deadlock 这个关键词,能看到死锁的线程和它持有的锁,以及正在等待的锁。我贴一次真实的排查输出(脱敏后):
java复制Found one Java-level deadlock:
=============================
"http-nio-8080-exec-5":
waiting to lock monitor 0x00007fa2c4003a80 (object 0x00000000d5a0f230, a java.lang.String),
which is held by "http-nio-8080-exec-10"
"http-nio-8080-exec-10":
waiting to lock monitor 0x00007fa2c4003a90 (object 0x00000000d5a0f260, a java.lang.String),
which is held by "http-nio-8080-exec-5"
看到这种环形等待,基本就能定位到是哪两把锁形成了死锁,然后去代码里看加锁顺序,统一所有线程加锁的顺序基本就能解决。我在实际项目里还常用一个辅助手段:在代码里给每个 synchronized 块加上注释里的锁编号,代码规范强制大家按固定顺序加锁,能有效从源头防止死锁。
4.4 停止线程的正确姿势——interrupt不是kill
很多从C#或C++转过来的朋友,天然会想找一个“杀死线程”的接口。C#里确实有 Thread.Abort(),但官方早就标注它是危险API,强制终止线程可能导致状态不一致;Windows下可以用 TerminateThread,但用过的都知道,这玩意儿是最后手段,正常情况下没人敢用。Java里更干脆,压根没有暴力杀线程的API,只有 interrupt()。
interrupt() 的设计哲学是“协作式中断”:它不是直接杀掉线程,而是给目标线程发一个“你应该尽快停止”的信号,然后由线程自己决定何时何地检查这个信号、如何优雅地退出。如果线程正在执行 sleep()、wait()、join() 这类可中断方法,收到中断信号后会抛 InterruptedException;如果线程在跑普通代码,就需要自己定期检查 Thread.interrupted() 或 isInterrupted() 来决定是否退出。
我踩过最深的坑是只调用了 interrupt(),但线程里根本没有响应中断的逻辑,结果线程照跑不误。正确写法是在任务循环体里主动检查中断标志并退出:
java复制while (!Thread.currentThread().isInterrupted()) {
try {
// 执行业务逻辑
doWork();
} catch (InterruptedException e) {
// 恢复中断标志,让上层逻辑感知到线程被中断
Thread.currentThread().interrupt();
break;
}
}
注意 catch 到 InterruptedException 之后,一定要重新调用 interrupt() 把自己置回中断状态。这是Java并发编程里一个很经典也容易被忽视的细节——默认情况下,异常被捕获后中断标志会被清除,如果不清回去,上层代码的检查就失效了。
5. 多语言视角与实操排查经验
5.1 C#、C++/Qt与Java的线程模型对照
干这一行,很难一辈子只写一种语言。我写过Java,也折腾过C#和C++/Qt,说实话,线程模型虽然有差异,底层的原理是相通的。C#里的 Thread、Task、async/await 本质还是在操作系统线程之上做封装;C++/Qt里 QThread 通过继承 run() 或者用 moveToThread() 把工作对象挪到子线程执行,做法不同,但“线程是执行流、共享内存有风险”这件事没有变过。
差异主要体现在API设计和使用习惯上。C#的 Task 默认跑在线程池上,配合 async/await 写异步代码非常自然,但你在写 async 方法时如果里面有耗CPU的同步代码,注意它不会自动切线程,该卡的还是会卡。C++这边因为可以直接操作裸指针,共享数据的风险被进一步放大,哪怕加锁了,稍不留神一个 delete 就能让另一个线程崩溃,Qt的信号槽机制在跨线程时虽然是队列连接,但如果传入的是自定义类型而注册失败,会得到“cannot queue arguments”的警告。
我的经验是:不管用什么语言,先想清楚哪个线程在哪些时刻会读写哪些共享数据,把访问路径理清楚再动手写代码,比依赖任何语言的特性都重要。语言会变,这个思维框架不会变。
5.2 Linux下如何查看进程与线程数量
线上排查问题,命令行工具是老本行。查进程和线程数量有一组常用命令,建议直接存在脑子里:
ps -eLf | wc -l 能数出当前系统的线程总数;ps -T -p <pid> 能查看某个进程下所有线程的详情;top -H -p <pid> 能以线程为单位实时查看某个进程内部的CPU占用;cat /proc/<pid>/status 里的 Threads: 字段直接显示线程数量。
我排查线上故障时常用的组合拳是这样:先用 ps -eLf | grep java | wc -l 看Java进程创建了多少线程,再用 top -H -p <pid> 找到哪个线程CPU占用最高,拿到线程号后转成16进制去 jstack 输出里搜,就能定位到是哪个业务代码在疯狂消耗CPU。这套流程在多个紧急故障里救过场,值得每个做后端的同行熟练掌握。
5.3 线程池配置的最佳实践——从公式到实际场景
关于线程池核心线程数,网上流传最多的公式是:CPU密集型任务设 CPU核数+1,IO密集型任务设 CPU核数 * 2。这个公式有一定参考价值,但太粗糙。IO密集型的线程数,理论上应该取决于“任务里IO等待的时间占比”,更合理的是用这个公式:线程数 = 核数 * (1 + 等待时间 / 计算时间)。等得越多,需要的线程就越多。
实际操作中,我从来不会照搬公式,而是按这个思路来:先预估是计算密集还是IO密集,给一个初始值(计算密集2倍核数左右,IO密集10倍核数起步);然后做压测,观察CPU利用率、线程等待时间、队列长度三个指标;最后根据压测结果调整参数,同时给最大线程数设一个保险值,防止突发流量打穿服务。
举一个我调过的实际案例:一个支付回调处理服务,核心逻辑是验签和写库,属于典型的IO密集型。最初配置是core 8、max 32、无界队列。压测发现,并发上来之后队列疯狂积压,响应时间从50ms飙到2秒,但CPU利用率只有20%——说明线程都在等数据库,队列把压力缓冲了,但缓冲太多导致延迟不可控。后来我改成core 16、max 64、有界队列(容量200),拒绝策略选 CallerRunsPolicy,让满负荷时任务直接在调用线程里执行,等于把多余的请求挡在调用方那里,压测结果吞吐量提升3倍,P99延迟反而降到了300ms以内。
CallerRunsPolicy 这个策略值得多说一句:它不丢弃任务,而是让提交任务的线程自己执行任务,相当于一种自然限流——当线程池忙不过来时,调用方线程被占用,自然降低提交速度。我比较推荐把它作为默认拒绝策略,比直接抛异常或丢弃任务都温和得多。
5.4 聊几个真实掉坑现场
最后分享几个我亲手踩过、或者帮同事排查过的真实坑,希望各位引以为戒。
第一个坑是“线程名没有规范”。线上查问题时,jstack 里看到的全是 pool-3-thread-1 这种匿名线程,根本不知道是哪个业务在跑。后来我们强制所有线程池设置自定义线程工厂,命名规范是 业务模块-线程类型-序号,比如 order-db-write-1。这个习惯的回报是,线上排查问题时能直接按线程名定位到业务模块,效率提升不是一点半点。
第二个坑是“全局共享线程池”。两个业务共用同一个线程池,高峰期一个业务的慢任务把另一个业务的快任务全堵死了。后来我坚持一个核心业务一个线程池,互不干扰,每个池子按自己的特性调参。
第三个坑是“线程池里执行业务代码时吞掉异常”。用了 submit 却在 Future.get() 之前业务代码就已经出错了,异常被包在 Future 里,日志什么都看不到。后来我们写了一个统一的 Runnable 包装器,在 run() 方法里包上 try-catch,把异常打到错误日志里再抛出去,确保异常不丢、日志必打。
写在最后的实操体会
我一直觉得,线程和上下文是计算机原理里最值得花时间啃透的两个概念。它们不像某些编译器优化那样离你很远,而是每天写的每一行并发代码背后都站着的那个底层逻辑。你调线程池参数调不好,是因为不理解上下文切换的代价;你写的并发代码有线程安全问题,是因为不理解可见性和原子性;你排查死锁半天没头绪,是因为不理解锁的循环等待关系。这篇文章从原理到实践过了一遍,我不敢说覆盖了所有细节,但如果你能搞清楚我重点拆解的那几个核心逻辑,绝大多数并发问题在你眼里就不再是玄学。
我个人在带新人的时候最喜欢说的一句话是:遇到并发问题,别急着搜代码、改参数,先坐下来画一张图,把线程、共享资源、锁、队列之间的关系画清楚,答案往往自己就浮出来了。线程的世界里,几乎所有的问题都源于“共享”和“竞争”这四个字,只要你把这两个词的边界规划好了,事情就成功了一大半。
