1. 为什么我坚持做bug归档而不是修完就跑
先说个场景。前几天内部在做一轮线上问题复盘,会上有人提了一句:那个故障当时不就修好了吗,怎么今天又拿出来讲?我当场愣了一下,因为我的习惯是每次项目收尾或告警消停后,会把这段时间冒出来的bug统一过一遍,不光是当场修掉,而是把现象、定位链路、根因、后续防范写成一份归档。这种习惯在团队里经常被吐槽“多此一举”,但每次遇到同类型问题能十分钟内翻出旧记录直接照着处理的时候,我就觉得这份工作没白做。
热搜里有个词叫“bug观察员”,说的是那种专门盯线上异常、跑日志、翻issue、看监控的人。说实话,我这些年干的基本就是这件事——不只是自己写的代码出bug,还包括操作系统装不上、框架升级后行为异常、云平台资源卡住、芯片厂商的库不按套路出牌。遇到的问题越多,越觉得很多“新bug”其实是旧问题换了件马甲。真正值钱的经验,全在归档里。
所谓“bug汇总”,不是把错误信息复制粘贴在一张表里就算完。我给每个值得归档的问题定了四个维度:复现路径、排查过程、根因判断、规避与防范。其中排查过程是重中之重,因为多数bug排查半天,最后发现根因特别简单,难的是中间那段“我怎么从一头雾水走到真相”的路。所以这篇文章不打算列一堆issue链接,而是把我近期归档的几个代表性问题的完整复盘链路拆开讲讲。
适合看这篇内容的,主要是后端开发、运维、嵌入式开发者,还有做AI推理服务部署的朋友。就算你当前用不到具体工具,排查思路也可以直接迁移。每个案例我都尽量说清楚“我当时是怎么想的”“为什么先做这一步而不是那一步”,这比最终改掉的那行代码更有参考价值。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 安装器与系统修复工具:流程之外的雷
2.1 thor官方ISO安装程序的已知bug,差点误判成U盘损坏
先说这个比较典型的“官方工具坑”。有次我需要在一台老机器上重装系统,图省事直接用了thor这个U盘ISO安装工具,把官方下载的ISO镜像烧进U盘。第一次启动引导就失败,卡在启动菜单选择之后的黑屏状态,连错误码都没给一个。
我的第一反应是U盘质量问题。毕竟这种USB启动盘对主控和供电都比较敏感,老机器前置USB接口供电不稳,经常导致引导中段。于是换了个后置接口重试,还是一样;重新烧录一次,校验了ISO哈希,没问题,再启动,依旧卡死。到这里基本可以排除镜像损坏和烧录不完整,问题大概率出在引导方式上。
然后我做了个对比测试:用另一款烧录工具把同一个ISO写进同一个U盘,直接就能正常进入安装界面。到这里基本可以锁定thor这个工具本身在部分主板UEFI环境下的兼容性问题。我翻了一下thor的官方发布说明和issue区,果然有一条已知bug记录,描述和我的现象几乎一致:某些版本的安装程序在生成UEFI引导条目时,会错误地引用分区路径,导致bootloader跳转失败。
这个案例给我最大的教训是:工具越“官方”,越不能放松警惕。ISO安装工具的known issues列表,属于那种平时没人看,一出问题第一个该查的地方。我后来养成了习惯,凡是需要下载安装器、烧录工具这类基础软件,先看一眼它的已知问题清单和最近几个版本的release notes,再做高危操作。
注意:制作系统启动盘时,如果卡在引导阶段,不要只怀疑U盘和镜像。对比测试是最有效的定位手段——换工具、换U盘、换写入模式,每次只变一个变量,很快就能圈出问题边界。
2.2 systemsetting的堆栈溢出修复脚本:修复工具自身也要打补丁
另一个典型的“修复工具坑”来自Windows平台。有台工作机一段时间内频繁弹出“检测到基于堆栈的缓冲区溢出”提示,报错模块指向systemsetting相关的系统组件。网上搜出来的主流方案,是运行一个名为“修复.bat”的脚本,清理缓存并重置部分系统状态。
我本来对这种来路不明的修复脚本比较抵触,但在干净的测试环境里跑了一遍,发现脚本内容还算克制:主要做了三件事——结束SystemSettings进程、清除对应缓存目录、重启相关服务。跑完后弹窗确实不再出现。但如果以为这就结束了,就太小看这类问题了。
问题在几天后复现,而且频率更高。我没再急着找“新脚本”,而是按常规排查链路走了一遍:打开事件查看器,找到系统日志里对应的应用程序错误记录,查看出错模块的完整路径和版本号。从日志里看到,出问题的组件和系统更新补丁的时间点高度吻合——换句话说,是某个版本更新引入的兼容性缺陷被systemsetting组件触发,而不是单纯缓存坏了。
那为什么第一个修复脚本能管几天?因为它清掉缓存、重启服务后,系统重新走了一遍初始化流程,暂时绕开了触发路径。等缓存再次积累、或某个状态恢复,问题就又回来了。真正的修复动作,是在补丁层面解决:要么安装官方发布的修复更新,要么在等待补丁期间禁用相关的触发操作。
这类“修复工具打补丁”的案例提醒我:遇到工具提示的“修复完成”,只代表当场症状被压制,不代表根因消失。任何疑似缓冲区溢出类问题,第一时间查事件日志、查错误模块、查最近变更,比到处下载脚本有用得多。
3. 框架与运行时:官方版本里埋的坑
3.1 vllm 0.23.0的chunk_size配置:照着参数调大,吞吐先崩了
做AI推理服务部署的朋友,对vllm应该不陌生。这个框架把请求调度和KV Cache管理做到了比较高程度的自动化,很多参数看起来可以直接不调。但使用chunked prefill功能时,chunk_size这个参数会直接影响长请求的显存占用和调度粒度。
我之前遇到的现象是:线上服务升级到0.23.0版本后,某条业务线反馈并发一高,推理延迟就开始大幅抖动,偶尔还直接报输入长度错误。第一反应是显存不够,毕竟现在开源模型负载上来后,长上下文请求对KV Cache的消耗非常恐怖,显存不足是常见原因。我看了监控,显存占用确实接近上限,但这不能解释为什么服务刚启动、流量还没上来时就出现少量报错。
于是我把问题拆成两部分:先看请求的输入长度分布,再看推理服务的日志。发现报错的请求都是超长输入,而配置文件里chunk_size设了一个比较大的值。当时我的想法比较朴素:chunk_size越大,每个chunk能处理的token越多,调度开销应该越小,性能会更好。实际表现完全相反——特定版本下,当chunk_size超过某个阈值时,和连续批处理调度器配合会出现资源竞争,导致部分请求在prefill阶段被异常截断。
我去vllm的GitHub issue区翻了0.23.0相关的反馈,确认了这是一个已知bug。比较稳妥的规避方案有两个:一是把chunk_size显式设小,避免触发异常分支;二是按官方后续补丁的版本升级框架。我选择了前者,因为生产环境不能为了追新版本而把整个推理栈都动一遍。
这里想多说一句:框架参数不是越大越好。CHUNKED PREFILL的设计初衷,是让长请求分片处理、避免长时间独占GPU。chunk_size太大,本质上是把分片机制架空了一半。做这类参数调优时,一定要先理解参数在调度器里真正控制的资源边界,再结合工具官方文档确认版本行为,不要凭感觉拍脑袋。
提示:碰到推理框架在某个版本上的参数级bug,最快的验证方式是构造最小复现用例,把报错输入切成不同长度,对照框架issue区的已知问题,不要一上来就改显存或加节点。
3.2 mscorlib的递归资源查找:报错信息不认识你,你得主动认识它
再聊一个以前做.NET服务时遇到的运行时问题。业务日志里偶尔出现一条异常,指向mscorlib内部方法,内容大致是“recursive resource lookup”,后台还跟着一条StackOverflow。当时的反馈是系统偶尔卡死,CPU飙高,但完整重启服务后又恢复正常,非常难抓住现场。
最初看到这个异常名,很容易误以为微软的基础类库有bug。但.NET的mscorlib经过十几年大规模生产验证,频繁出内部bug的概率其实很低。真正常见的触发场景,是程序集在解析某个资源时陷入递归:比如找不到对应语言的卫星资源,运行时试图回退到父级区域性或默认资源,而某些代码又反过来触发查找,形成了循环。
我当时的处理思路分三步。第一步,用fuslogvw或进程事件日志查看程序集绑定明细,确认异常发生时正在加载哪个资源文件;第二步,检查项目的资源文件命名,尤其是多语言场景下,确保“默认资源文件”存在且没有把区域子目录配错;第三步,在入口处对CultureInfo做兜底,避免无匹配资源时遍历过程失控。那个问题最终定位到某个卫星程序集的版本号不匹配,导致运行时一直尝试回退解析。
这类运行时异常有个特点:报错指向的都是底层框架方法,堆栈看着很吓人,但真正的问题通常在业务代码和配置的边界上。遇到这类问题,不用急着怀疑官方库,先把程序集绑定日志打开,看它到底在找什么文件、为什么找不到、为什么重复找,答案一般就在这个链条里。
4. 云平台存储与内核日志:表象离根因隔三层
4.1 openstack yoga版本cinder卷分离失败,卡住的不是卷而是状态
云平台的存储问题,是典型的“表象和根因隔着三层”的场景。印象比较深的一次,是openstack的yoga版本环境里,一台云主机执行迁移或卸载卷操作后,cinder侧一直显示卷仍处于in-use状态,实例侧却已经不再引用这块卷。再往后,这个卷想挂载到其他实例就一直失败,平台管理员只能在后台手工处理。
我当时的排查顺序是这样的。先确认实例侧状态——nova show看实例当前挂载的卷列表,发现那块卷已经不在列表里,说明nova认为它已经分离了;再看cinder side——cinder list确认卷仍然显示in-use,并且有attach信息指向那个已经迁移完的计算节点。到这里,问题基本锁定在cinder管理面状态没有跟随底层实际动作收敛。
进一步检查计算节点上的存储连接:从cinder-volume后端日志能看到detach请求已经发出,但底层和存储真正断开连接的动作没有正常完成。我在计算节点查SCSI和multipath会话,确认系统里仍然残留着该卷的设备映射,这就导致连接状态清理不了,进而让cinder的attachment记录一直无法闭合。
处理方式说起来并不复杂:先确认文件系统已经安全卸载,再从cinder侧强制断开对应attachment,在存储后端和执行节点上手动清理残留映射,最后等cinder状态刷新为available。真正的难点在于,这类问题不能上来就无脑跑cinder reset-state,因为状态强行改掉之后,底层残留连接还在,下次挂载时会直接复用脏状态,导致更隐蔽的数据读写异常。
注意:云平台存储类问题的恢复原则是“先底层后上层”。先确保存储和执行节点上没有残留的映射和会话,再调整管理面状态,顺序反了会越修越乱。
4.2 内核日志里的scheduling while atomic:被一堆专业名词吓住之前先看调用栈
再说一个内核级的报错,特征很强,日志开头就是“BUG: scheduling while atomic",后面跟着进程名和CPU编号。初次见到这行日志的人很容易慌,感觉系统内核要崩了,实际上它只是内核主动报警:当前代码执行在原子上下文(比如自旋锁保护区间、中断上下文)里,却调用了可能睡眠的函数。
真实环境里,我遇到过类似“swapper/3"线程打出这个报错的情况。虽然swapper是空闲线程,但日志真正要表达的,往往是有驱动或内核模块在错误的时机触发了调度操作。排查这种问题,不要被那一长串十六进制寄存器值吓住,关键是找到日志里的调用栈。
调用栈会明确指出是从哪个函数进入的。多数情况下,问题出在驱动代码在自旋锁内调用了类似kmalloc(GFP_KERNEL)、mutex_lock或某些可能触发休眠的设备操作。把休眠调用移到锁外,或者把自旋锁换成允许睡眠的互斥锁,问题就解决了。另一种常见来源是内核模块在中断处理函数里做了太多耗时操作,处理办法通常是改用工作队列或线程化irq。
内核日志排错有个通用原则:先看栈,再查代码,最后查模块版本。网上很多资料会直接告诉你“这是内核bug”,但实际生产环境中,绝大多数这类报错来自第三方驱动模块或开发者自己编译的模块,内核主体反而是无辜的。
5. 嵌入式HAL库回调不触发:不要急着说“库有bug”
5.1 py32f003的HAL中断回调,可能连回调函数名字都和你期待的不一样
嵌入式开发里,芯片厂商提供的HAL库一直是又香又烫手的存在。香的是外设初始化、中断管理这些琐碎活被封装好了;烫的是它的行为习惯和ST或者你熟悉的其他平台不一定一样。py32f003这颗料,我在一个低功耗采集项目里用过,就遇到过中断回调完全不触发的诡异情况。
现象很直接:配置好GPIO外部中断,中断标志位在调试器里能看到确实置位了,主逻辑里却死活进不了我写的回调函数。当时团队里有人说“这个库中断回调有bug”,但我第一反应是——先看看这个库的中断处理函数到底跳转到哪里。翻开芯片厂商提供的HAL库源码,找到GPIO中断处理入口,发现它确实会调用一个回调函数,但那函数不是我习惯的命名,而且默认是个弱定义空函数。
也就是说,中断本身触发了,HAL库也按自己的规则去调“回调”了,只是我写的处理函数名字和库期望的名字不是一个,所以相当于写了个寂寞。这个原因在代码逻辑上非常隐蔽,因为编译完全没问题,也不会有任何报错提示。
确认根因后,修改方式很简单,把自定义回调函数改成库期望的命名,并在初始化时检查中断向量和NVIC分组配置是否和预期一致。重启验证,中断正常进入。
这类问题的通用排查路径我总结过:先确认外设中断标志是否置位,确认中断向量是否指向HAL统一入口,再看入口处理函数内部的分发逻辑,最后确认回调函数命名和注册机制。只要前面几步没有排查完,就不要轻易下“库有bug”的结论。
提示:芯片厂商的HAL库虽然长得都类似,但细节差异极大。拿到一颗新芯片的开发板,第一步不是急着看例程,而是看中断跳转链和回调注册机制,这能帮你省下大量排查时间。
5.2 把“怀疑库”转化为“用最小用例证伪”的能力
做嵌入式开发久了,我发现一个规律:越是经验丰富的工程师,越容易在“库行为不符合预期”时,第一反应是怀疑自己的配置。这个习惯很好,因为芯片厂商的库经过大量用户验证,概率上确实是你自己的问题更大。但“怀疑自己”也得有边界,不能无限自责下去。
更高效的做法,是遇到疑似库问题时迅速构造最小用例。把外设初始化代码单独抽出来,放到一个空的工程里,只保留最核心的中断和回调逻辑,用调试器观察寄存器值。如果最小用例能复现问题,说明问题很可能在库层或配置层;如果最小用例一切正常,问题就在你的业务代码和库的交互方式上。
这种“最小用例证伪”能力,不仅是嵌入式领域的必修课,放在任何技术方向都适用。排查bug时,把系统复杂度降到最低、让变量变少,远比在完整系统里反复打印日志更接近真相。
6. 前后端边界判断与工具误诊:先分清问题属于谁
6.1 一图看清:前端报错不等于前端bug
前后端bug的区分,可以说是日常开发里出现频率最高、争论也最多的技术问题。前端说是后端接口回得不对,后端说前端参数传得有问题,两边在聊天工具里拉扯半天,最后才发现双方看的根本不是同一个接口版本。
我自己整理了一套先判断归属的流程,整个顺序几乎是固定的,不需要什么高深工具。
第一,先在浏览器开发者工具里看网络请求。确认点击按钮后到底有没有发出请求、请求URL是什么、参数体长什么样、响应状态码是多少。这一步直接决定了问题在不在前端。请求没发出去,说明是前端逻辑或交互问题;请求发出去了,那就继续往下看。
第二,拿到请求的URL和参数后,用API调试工具直接复现请求,绕开浏览器页面。如果直接请求接口能返回预期结果,说明问题出在页面侧的参数组装或渲染逻辑;如果直接请求也返回异常,问题基本在后端服务。
第三,如果后端服务本身逻辑看起来也没问题,再看基础链路:网关转发、鉴权、缓存、数据库状态。很多所谓的“后端bug”,实际是环境问题和数据问题,不是代码问题。
下面这张表格是我团队内部常用的快速判断参考:
| 现象 | 优先排查方向 | 归属可能 |
|---|---|---|
| 页面无响应/按钮无反应 | 浏览器控制台报错、网络请求是否发出 | 前端 |
| 请求已发出,返回4xx | 请求参数、鉴权、路由 | 前后端边界,先看接口文档 |
| 请求已发出,返回5xx | 后端服务日志、异常堆栈 | 后端 |
| 接口直连返回正常,页面显示异常 | 前端渲染逻辑、数据格式适配 | 前端 |
| 接口直连和页面都不正常 | 服务端逻辑、数据库、基础链路 | 后端 |
这张表看起来简单,但实际使用中能解决大部分责任归属争议。核心思路只有一个:不断地把系统拆成“页面侧”和“服务侧”,用直接请求的方法切断中间环节,问题不会骗人。
6.2 pycharm工具栏异常这类IDE bug,不要和项目代码混为一谈
和前后端bug类似,开发工具自身的问题也经常被误判成业务代码问题。有次用pycharm调一个Python项目,突然发现常用的运行配置按钮不见了,点击工具栏按钮没反应,但项目脚本用命令行直接跑又是正常的。
当时的第一怀疑是项目代码改了什么东西影响了IDE行为,比如解释器路径失效、项目配置文件损坏。实际排查后发现,新建一个空项目一切正常,只有那个项目的IDE视图异常——这说明问题出在IDE的项目级配置或缓存上,和代码逻辑没关系。
处理方式倒是很直接:File菜单里的Invalidate Caches把缓存清掉,重建索引,再通过Toolbar配置把丢失的按钮恢复。如果还不生效,就用idle模式启动IDE,把插件逐个禁用,判断是不是某个插件和当前IDE版本冲突。这套操作做完,问题基本消失。
不管是pycharm还是其他IDE,遇到工具栏失灵、语法提示乱跳、界面布局错乱这类症状,要记住一个原则:先怀疑工具的配置和缓存,再怀疑项目代码。因为IDE的项目配置文件损坏、插件冲突、缓存索引过期,都是比代码更容易出问题的地方。反过来,如果是代码运行结果不对,才需要回到业务逻辑里去定位。
7. bug生命周期的复盘沉淀,给后续排查留一条捷径
7.1 从“发现”到“防范”:把每个bug放回生命周期里看
很多人提到bug生命周期,第一反应是项目管理软件里的状态流转:新建、已修复、已验证、已关闭。但工程实践里的bug生命周期,远不止这些状态,它应该是从“发现”到“定位”再到“根因分析”最后到“防范回归”的完整闭环。
我比较重视的环节,是根因分析和防范回归。只做状态流转的bug管理,本质上是把表格填满,对团队没有增量价值。真正的技术沉淀,发生在你回答“为什么当时会出这个bug”“为什么现有工具和流程没有拦住它”这两个问题的时候。
拿前面提到的vllm例子来说,根因是版本bug,但更值得思考的是为什么配置参数会调成那样。如果我当时在部署前查过框架release notes、确认过chunk_size和各版本调度器的配合情况,大概率能绕开这个问题。所以那次的防范动作不只是改配置,还包括在推理服务的参数基线检查单里增加“关键参数需要对照官方版本说明”这一条。
7.2 我的归档模板和复盘节奏
最早做bug归档时,我用的是很随便的备忘录,时间一长发现根本检索不到,等于没记。后来我固定了一套字段,凡是值得记录的问题都按这套模板写,已经坚持了好几年:
- 问题一句话描述(包括影响范围)
- 复现条件(什么版本、什么配置、什么输入)
- 排查过程(按时间顺序记录每一步尝试和结果)
- 根因(写清楚最终确认的直接原因和间接原因)
- 修复动作(具体改了哪里、升级了什么)
- 防范措施(如何提前发现、如何自动检测)
- 同类问题索引(这个坑还能延展到哪些场景)
复盘节奏上,我会在每次迭代结束或线上问题平稳后集中整理一次,不追求实时更新,但要求每一条都有完整的信息。这个习惯在碰到“史上最贵bug”类的高成本事故时会显得特别有价值——当然,我们平时遇到的bug多半没这么夸张,但归档越完善,下次排查的时间就越短,这就是实打实的收益。
另外,如果你想刻意训练自己排查bug的能力,除了在工作中积累,也可以找一些bug修复赛题来练手。比如某届鸿蒙赛事里的bug修复题目,虽然赛题场景是定制的,但它的设计思路和真实bug很像:目标明确、复现路径相对可控、需要你从现象倒推根因。这种练习可以高效提升你快速阅读代码、定位问题边界的能力,比单纯刷业务系统要省时得多。
最后再分享一个我自己的习惯:平时看到程序员同事工位上贴着“神兽保佑·代码无bug”之类的贴纸,我都会顺着聊一句“求完保佑,别忘了做完归档”。代码有没有bug,很多时候不是态度问题,而是系统的复杂度问题。我们能做的,就是让每一个被揪出来的bug都不白来一趟——把它背后的链路走通、把根记录清楚、把防范动作落地,然后在下次遇到相似问题时,快人一步。
