有一次在一个老项目的机房上线窗口,我盯着屏幕上飞速滚动的日志,旁边同事幽幽说了句:“这坨屎山居然又稳过了一天。”当时我们都笑了,但笑完之后我愣了好几秒——他说的是实话。这套系统代码烂到什么程度呢?全局变量满天飞,函数名和实际功能对不上,注释写的是三年前的计划而不是现状,一个需求改动要拉上五个部门确认。可就是这套系统,稳定跑了六年多,每年只在固定的几个时间点出点小毛病,从来没发生过一场真正的“线上灾难”。
后来我越想越觉得有意思:我们天天骂屎山,可屎山往往是最难被杀死的系统。这件事如果换个角度看,其实是一个特别值得拆解的工程问题——为什么一个在代码评审里根本过不了关的系统,会有这么强的鲁棒性(robustness)?这里说的鲁棒性,指的可不是代码优雅、架构先进,而是它能在各种恶劣条件下继续对外提供服务,甚至比很多设计精良的新系统更“扛揍”。这篇文章,我就想把自己这些年观察到的、亲身经历过的“屎山生存法则”好好整理一遍,聊聊屎山的鲁棒性到底从哪里来,以及我们在面对这些系统时,该怎么安全地和它共存。
1. 先承认吧,屎山确实很能活
很多人提起屎山,第一反应是鄙视和厌恶。但如果你在一个行业里待得够久,接触过足够多的遗留系统,你会慢慢发现一个残酷的事实:很多屎山不是“苟延残喘”,而是活得相当滋润。
1.1 什么是屎山,它凭什么算一个工程实体
先说清楚“屎山”到底指什么。它不是简单的一堆烂代码,而是一个长期演进、多次易手、充满历史包袱,但依然在核心业务线上运行的软件系统。它可能是一个用了十几年、没人敢动的内部ERP,可能是一个写于移动互联网爆发期、后来缝缝补补的电商后台,也可能是一个用了整整一代工程师青春的单体应用。
屎山的典型特征包括:模块边界模糊、依赖关系混乱、缺少自动化测试、大量业务规则散落在各处、文档与实际代码严重脱节。但最核心的一点是:它承载着组织的重要业务,而且短时间内无法被替代。 所以屎山不是“废弃的旧代码”,它是在役的主力系统。你只要意识到这一点,就会明白为什么它那么难处理——它不是技术问题,它是一整套运行中的业务生态。
1.2 鲁棒性在这个语境下是什么意思
鲁棒性,英文是robustness,翻译过来就是“健壮性”“强韧性”。在软件工程里,它通常指系统面对非法输入、异常环境、部分组件失效时,依然能保持关键功能正常的能力。我们平时夸一个系统鲁棒,脑子里浮现的是那种容灾多活、自动降级、优雅重试的先进架构。但屎山能获得“鲁棒”这个评价,靠的完全是另一条路径。
我自己的理解是:屎山的鲁棒性,是一种“怎么折腾都死不了”的生存能力。 它不优雅,不高效,但是它耐操。就像老式诺基亚手机和智能手机的差别——智能手机功能强大,但摔一下可能就碎屏;老诺基亚没什么功能,但你从楼上扔下去还能继续打电话。屎山就是软件世界里的老诺基亚。它慢、破、丑,但你不得不承认,它在“活下去”这件事上有一种执拗的韧性。
1.3 我见过的一坨典型屎山长什么样
拿我之前维护过的一个订单处理系统举例。这个系统是PHP写的,单机部署,所有数据都存在一台MySQL里。整份代码没有一个测试,核心逻辑散落在十几个互相include的文件中,全局变量超过一百个。它的订单状态机没有定义在数据库里,而是“约定俗成”地靠几个整数字段在代码里互相判断。
但就是这么个系统,每天稳定处理几万笔订单。它的QPS不高,远谈不上高并发,但几乎没有因为bug导致订单丢失。为什么?因为它的业务量早就不增长了,系统跑在十年前的规模上,扛现在的流量绰绰有余。做运维的同事最怕的不是它出问题,而是哪天有人心血来潮要“优化”它。只要没人动,它就一直稳着。这件事给了我一个很深的触动:很多时候,系统的稳定,不是因为设计得好,而是因为“没人敢碰”这个事实本身形成了保护。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 为什么会这样:架构层面的反直觉优势
我后来花了不少时间,试图从架构角度解释屎山的鲁棒性来源。研究来研究去,发现一个特别反直觉的结论:很多在我们教科书中被列为“坏味道”的设计,在特定条件下竟然成了它稳如泰山的原因。
2.1 高耦合不等于一无是处,它也是一种骨架
我们接受的教育一直强调低耦合、高内聚。松散耦合让系统容易替换、容易扩展。但屎山普遍是高耦合的,模块之间互相依赖,牵一发动全身。按理说这不是坏事做绝了吗?可恰恰是这种“你中有我、我中有你”的结构,让系统变得极难被任意改动。
往极端里想,它就像一座石拱桥。石拱桥没有钢筋、没有螺栓,每一块石头都靠相互挤压维持整体稳定。你单独抽走任何一块石头,桥可能都会塌。但你不动它,它反而能立几百年。屎山也是这样——它内部模块高度缠绕,功能A依赖模块B的某个副作用,模块B又依赖全局变量C的状态,改任何一处都可能引发连锁反应。所以没人能轻松改它,系统也因此被“冻结”在一种相对稳定的状态里。从这个角度看,高耦合成了它对抗变更的天然屏障。 这不是设计者高明,这纯粹是复杂系统演化的偶然结果。
2.2 重复代码是低配版的冗余备份
代码评审里,重复代码是必被吐槽的点。同一个逻辑抄来抄去,改了这处漏了那处,看着就头疼。但屎山的维护者可能没意识到,这些重复代码在某种意义上是系统的“冗余备份”。
举个例子,之前那个订单系统里,用户等级判断逻辑在三个不同文件里各写了一遍,实现还不完全一致。按道理这是大坑,因为行为不一致会导致各种奇怪问题。但反过来看,正因为它们是三个独立实现,当数据库字段被误改时,通常只有其中某一块逻辑会受影响,另外两块可能还能兜住。线上表现就是:某个报表偶尔数据不对,但核心流程没断。这不是刻意的容灾设计,但效果上却比单一实现多了一层“应变能力”。当然我绝对不是建议大家用重复代码来做高可用,只是想说明,屎山能在恶劣条件下活下来,很多时候是因为它“到处都有备份”。
2.3 隐性协议比显式文档更可靠
屎山通常没什么文档,有文档也早就过时了。但运行中的屎山,真正约束系统行为的,不是文档,而是一套“隐性协议”。这套协议长在每一个知情人的脑子里,长在每一段看起来莫名其妙的代码里。
我见过一段代码,加了一行很诡异的判断:如果订单编号对3取模等于0,就走一种特殊处理。没有任何注释解释为什么。后来我翻历史邮件才知道,几年前某个大客户的下单逻辑有特殊要求,当时为了快速上线,就在主流程里加了这个判断。没人敢删,因为没人敢保证这个客户现在还在不在用这个逻辑。这种“没人知道为什么但没人敢动”的隐性规则,反而成了系统稳定的一部分。 大家都形成了共识:不理解的代码不要碰,碰了就可能出事。所以系统在行为层面保持了超乎寻常的一致性。显式文档可以乱写,但隐性协议是经过无数线上事故洗礼后沉淀下来的,它比文档可靠得多。
2.4 静态数据与硬编码提供了稳定底座
屎山还有一个基建特点,就是大量使用硬编码和静态配置。数据库连接字符串写死在代码里,业务参数用常量定义,外呼接口地址直接拼在字符串里。这在今天看来是不可接受的,但对于运行环境相对固定的内部系统,这种硬编码歪打正着地提供了极高的稳定性。
想想看,一个把所有依赖都写死的系统,它不会因为配置中心数据被误删而崩溃,不会因为环境变量没配好而启动失败,也不会因为服务发现变更而断连。它的依赖关系是固定的、封闭的,所以运行结果高度可预期。这就像一个人永远走同一条路上下班,这条路哪怕再破,他也是熟的。相比之下,微服务体系里配置一个错,可能整个链路都雪崩。屎山没有这种“高级烦恼”,因为它压根没有动态配置的能力。讽刺吧?这种落后反而成了一种保护。
2.5 屎山与“干净系统”的架构特性对比
| 特性 | 典型屎山 | 现代干净系统 |
|---|---|---|
| 模块耦合 | 高度耦合,相互缠绕 | 低耦合,边界清晰 |
| 文档状态 | 缺失或过时,依赖口头传承 | 文档与代码同步维护 |
| 配置方式 | 硬编码,静态化 | 动态配置,服务发现 |
| 冗余程度 | 大量重复逻辑 | 单一职责,复用优先 |
| 故障影响 | 难以定位,但不常发生 | 易于定位,但链路多面广 |
| 面对变更 | 极难修改,风险高 | 支持快速迭代,但要防连锁 |
| 真实鲁棒性来源 | 没人动它 + 隐式约束 | 容灾设计 + 可观测性 |
这张表不是想证明屎山比干净系统好,而是想指出一个常识:鲁棒性有很多种来源,屎山用的是一种我们特别不喜欢、但又不得不承认有效的路径。 理解了这一点,你才能理性地对待这类系统,而不是一上来就喊着要推翻重写。
3. 运行期的真相:线上稳定是“熬”出来的
架构层面的因素只是基础,真正让屎山在运行期保持稳定,还有一套动态的社会学机制。这套机制和“人”的关系,比和“代码”的关系更大。
3.1 没人敢动它,是最强的保护机制
屎山最稳定的时期,往往是团队对它形成“敬畏之心”的时期。这里的敬畏不是褒义,纯粹是怕。大家默认一个潜规则:能不碰就不碰,非碰不可也要最小化改动,多一个人知道这段逻辑就多一分安全。
我参加过好几次遗留系统的变更评审,你会发现评审会上最常出现的结论是“这个改动风险太大,建议先不做”。不是团队不作为,而是所有人都隐约知道,系统的脆弱程度超出代码本身。这种“怕”看起来很消极,但它实实在在减少了变更频率,把系统暴露在意外中的机会降到了最低。从可靠性工程的角度看,降低变更频率本来就是提升稳定性的重要手段。 所以谁也不愿意承认,屎山之所以稳定,有很大一部分功劳要记在“害怕”这件事上。
3.2 故障演化:线上踩雷踩出来的稳定
屎山现在还能稳定运行,不代表它从来没出过事。相反,它大概率是在无数次线上故障里被“打磨”成今天这个样子的。每一次事故之后,责任人会在故障点打补丁、加判断、加限制。补丁叠补丁,规则套规则,系统的行为被一点点约束到“已知安全的通道”里。
这让我想起生物进化:屎山不是设计出来的,是“试错试出来的”。每一次线上故障都是一种自然选择,留下的是那些在特定条件下恰好存活的行为路径。所以它的鲁棒性不是提前设计出来的,而是在生产环境里用事故“熬”出来的。这种鲁棒性的特点是:它只适应当前这套业务和运行环境,一旦条件改变,它可能瞬间从稳定转入崩溃。 这也是为什么给屎山加新功能往往比修老bug更危险——老bug的环境已经被验证过无数遍,新功能等于把这套已经“驯化”的系统重新带回了野外。
3.3 业务量与系统能力刚好匹配
屎山能长期稳定,还有一个特别容易被忽略的原因:它的能力上限和业务需求之间,通常有巨大的缓冲区。很多遗留系统诞生于业务快速扩张期,那时候设计的容量远大于当时的需求。等到业务增速放缓甚至萎缩,系统的负载压力反而逐年降低。
我遇到过一个用传统关系型数据库架构的报表系统,当时是给全公司几万人做周报用的。后来移动化改造,大部分报表转移到新平台,老系统只剩几百个固定用户在用。它的代码没变、架构没变,但负载降了两个数量级,于是原本那些性能问题、锁冲突问题全都消失了。系统没变,变的是它背着的东西。 在这种状态下,哪怕代码再烂,它也很难出故障,因为资源充裕到足以掩盖各种问题。
3.4 周边流程为它“背书”
你还会发现,长期运行的屎山,身边一定长出了一套与之匹配的运维流程和业务习惯。比如每天定时有人手工核对数据,出错时会有人查看某个“经验表格”去修复。这些周边流程不是技术系统的一部分,但它们实质性地承担了容错功能。
我见过最典型的例子,是某老系统每天凌晨同步数据,偶尔会失败。新来的工程师想把它做成自动化重试,结果被老运维拦住了。老运维说:“不用改,我们每天早上九点前会看一眼同步日志,失败就手动跑一下脚本。”这套手工流程被跑了七八年,从来没出过重大问题。人工介入看起来很低效,但对于屎山来说,它可能比自动化更可靠。 因为你永远不会在日志里遗漏一次失败,而一个烂代码里的自动化重试逻辑,反而可能在极端边界条件下把数据搞乱。这不是鼓励大家不做自动化,而是想说,面对屎山,那些土办法往往是最适合它的生存方式。
4. 警惕这些高危场景:屎山是怎么突然崩塌的
说了这么多屎山的好处,千万别误会我是在鼓励大家把系统写得烂一点。屎山能稳,靠的是特定环境和特定约束。一旦这些条件被打破,崩塌只需要一瞬间。下面这几类场景,是我见过最容易让屎山“原形毕露”的高危时刻。
4.1 对屎山做“重构”约等于考古
很多人接手屎山之后,第一反应是重构。这种心情可以理解,但你得明白,对屎山的重构根本不是改代码,而是一场考古。你面对的不只是一堆代码,还有几代工程师的思考残留、无数个没有再出现过的线上事故的痕迹、以及大量已经无人知晓的业务决策。
我在一个老项目里试过做小范围重构,目标很简单:把某个模块里一堆重复的SQL清理成公共方法。我花了两个晚上做完了,自认为改动很安全,结果一上线就出问题了——某个隐藏分支依赖了SQL文本里的一个空格来进行字符串匹配。没错,真的离谱。但这就是屎山的日常:你永远不知道代码的哪个细节和某个不知名依赖绑在一起。 所以如果你非要重构屎山,请一定先把它当考古现场处理:保留现场、建立基线、逐层发掘,而不是上来就大刀阔斧。
4.2 重写的诱惑与代价
屎山面前,还有一个比重构更诱人的选择——重写。很多团队在痛定思痛之后,会拍板说“我们拉一个新团队,从头搞一套干净的”。这个决策听着特别解气,但执行起来,成功率低得吓人。
原因不复杂:屎山经过多年演化,沉淀了无数业务规则和边界case。这些规则没有文档,只存在于旧系统的行为里。重写团队以为自己在重新实现一个订单系统,实际上他们要复刻的是一座“活博物馆”。很多case你在新系统里根本想不到,直到业务方跑过来说“这里不对啊,旧系统是可以这样的”。然后你回头去翻旧代码,才发现又是一段没人理解的暗逻辑。更尴尬的是,重写期间新老系统并行,团队要在有限人力和时间里同时维护两套系统,最后往往陷入“新系统还没做好,老系统又要继续加需求”的双重困境。我在不同公司见过至少四五个重写项目,真正成功落了地的,屈指可数。
4.3 隐性依赖事故现场实录
我前面提到隐性协议,它维护了稳定,也埋着最大的雷。一旦有人不知道这条协议的存在,它就变成了一颗地雷。
有一次,我们给老系统的订单号字段扩容,从11位扩到12位。听起来很简单,数据库改一下字段长度就行。结果事后两天,某条对账数据突然开始对不上。查了很久才发现,老系统里有段第三方接口签名逻辑,写死了“取订单号后四位”参与加密。订单号还在11位时,后四位没有出现过“00”开头的组合;扩到12位后,新订单号后四位完全随机,“00”开头的情况出现了,签名就乱了。那段时间我们每天都在干“从莫名其妙的表象倒推隐藏逻辑”的事,非常痛苦。后来我总结了一句话:屎山系统里没有可预测的局部改动,因为所有局部都是全局的一部分。
4.4 加功能比修bug更危险
很多团队对修bug格外谨慎,但对加功能反而容易放松警惕。这完全搞反了。修bug通常是在既定行为里修修补补,出格的概率小;加功能是要在已经脆弱的系统里引入新的状态和分支,每一个新分支都有可能和旧的隐性逻辑碰撞。
给你们说个典型事故。老系统里有个用户积分功能,一直运行正常。某天产品经理说加一个“积分抵扣现金”的活动,开发小哥评估了一下,觉得只是加一个字段、加一个判断,风险很小。结果上线后,一批用户积分突然清零。最后定位发现,积分清零定时任务判断“是否有积分活动”时,用了位运算里的一个标志位,而新功能恰好复用了同一个标志位表示“是否参与抵扣活动”。两个业务功能共用了一个位,老逻辑根本没想到有人会撞这个位。在屎山里加功能,技术难度不一定高,但你要面对的是整个系统累积下来的“隐性状态空间”。
5. 想让屎山继续稳下去?这些实操办法最管用
既然屎山短期死不了,我们也不可能天天围观它在雷区上跳舞。真正务实的思路是:在承认屎山会长期存在的前提下,想办法给它加护栏,让它的鲁棒性可解释、可观测、可控制。
5.1 先给屎山建立行为基线
动屎山之前,第一步不是重构,也不是优化,而是建立“行为基线”。说白了,就是用测试把当前系统的行为记录下来,哪怕这个行为看起来有bug,也要先固化成预期结果。这有个专门的叫法:特性测试(characterization test)。
你可以写一些针对特定函数和接口的测试,输入一个样本,把当前输出记录下来,作为“黄金文件”。将来任何人改动代码,跑一遍这些测试,如果输出变了,就知道改动影响到了行为。这类测试不评判对错,只记录事实,但它们能拦住“改完不知道自己把什么搞坏了”的灾难。我当年给一个老模块补测试时,测试代码量比业务代码还多,但这些测试后来救过我们无数次。测试不是屎山的装饰,是屎山的护栏。
5.2 用可观测性替代想象
屎山最大的问题之一是看不清内部。很多运行了几年的老系统,连日志都没有几条,出问题时只能靠猜。这种状态下,你所谓的“稳定”其实是建立在“看不见”之上的。所以治理屎山的第一步,不是改代码,而是先把眼睛装上。
加日志、加监控指标、加trace,不要嫌老系统乱就跳过。哪怕只是先记录每个接口的耗时、错误码、调用频率,你就能逐渐摸索出这套系统的真实行为模式。等积累一段时间后,很多原来想都不敢想的优化,都有了数据支撑。我记得有个老服务,一直被认为“很稳定”,结果埋点后发现每周五下午都会CPU飙高,和某个定时任务的异常循环有关。这个bug藏了好几年,不是没人遇到,而是没人看见。可观测性,是屎山治理里性价比最高的一项投入。
5.3 灰度、开关与防腐层
面对屎山,不要走“全量上线”这种极端路线。任何改动,无论你多有把握,都要想办法做成可灰度、可回退的。给老系统外面包一层开关逻辑,让新老行为可以切换,哪怕代码丑一点,也比一次性切换到未知状态安全得多。
我常用的套路是在入口处加一个配置开关:开始时走老逻辑,新逻辑放在一起跑灰度,通过比对结果来验证一致性,确认没问题后再逐步把流量切过来。这个过程中不需要一次改对,随时可以回退。听起来老土,但对付屎山特别管用。把你的安全感建立在“能回退”上,而不是“我很有把握”上。 面对屎山,自信往往是最贵的东西。
5.4 用“绞杀者模式”慢慢换血
比硬重写更稳妥的路径,是在屎山外面慢慢长出一层新系统,让旧系统里的功能被逐个替换、逐步下线。这就是著名的“绞杀者模式”。它不需要一次性推倒所有东西,而是允许新旧系统共存一段时间,每次只替换一个很小的能力。
比如你有一个老报表模块,不要试图把它整体换成新框架。先只把其中一个报表的取数逻辑挪到新服务,确认OK后再迁下一个。这样每一次变更的范围都足够小,风险可控,即使在屎山上动土,也像做微创手术而不是开胸手术。微创是屎山治理的核心思想:每一次都只切一个小口子,做完马上缝合。 我用这个思路帮好几个团队把核心模块从老系统里逐步拆出来,过程不刺激,但成果很扎实。
5.5 团队传承:把口头知识变成系统资产
屎山知识的最大载体是“老员工”。他们脑子里的隐性知识一旦流失,系统就真的没人能懂了。所以不管代码多烂,文档多难写,你都应该想办法把这些知识沉淀下来。
可以做一个“系统怪癖清单”,记录所有没人懂但不能删的代码,以及它们背后的历史故事。遇到看似诡异的逻辑,不要简单注释“不要删”,而是尽量查清楚来源,写清楚原因。我知道这事很难,但哪怕只记录了一部分,也会给后来的维护者省下大量考古时间。做技术的人往往高估代码的作用,低估知识传承的作用。 屎山能活多久,其实取决于愿意了解它的人还有多少。
6. 踩坑记录:一些可以抄作业的避坑指南
文章最后,分享一些实战踩坑的总结。遇到屎山的时候,先对照下面这些坑,能避一个是一个。
6.1 高发问题快速排查表
| 症状 | 常见原因 | 处理思路 |
|---|---|---|
| 改动后线上出现少量脏数据 | 改了隐性依赖,如标志位、状态码 | 先回退,再查字段的唯一引用点 |
| 某个接口偶尔超时 | 硬编码超时时间与真实耗时不匹配 | 加耗时监控,别急着调超时 |
| 定时任务偶发失败 | 依赖了全局变量在不同分支里的状态 | 在任务入口打印关键变量快照 |
| 报表数据不规范 | 多个模块重复逻辑不一致 | 先统一取数入口,别急着改算法 |
| 配置变更后系统行为无变化 | 配置被硬编码覆盖,或者缓存未刷新 | 检查代码和配置中心哪边优先级高 |
| 老接口加了参数后调用方报错 | 上游服务校验了请求字段白名单 | 先看调用链,再改字段,别只改服务端 |
这张表是我这几年和屎山打交道时最常遇到的几类问题,你们可以直接拿去当排查手册用。
6.2 一个经典事故复盘:改一个字段引发的连环事故
有一次,客户反馈某个老系统后台的订单金额显示不对。开发一看,发现数据库里金额字段是DECIMAL(10,2),但其中几条数据存了超过上限的金额,被MySQL自动四舍五入了。开发觉得很好解决,把字段改成DECIMAL(12,2)就行了。
看着人畜无害吧?结果上线后,一连串下游报表全部异常。原来,有个下游同步脚本用存储过程读取金额,里面有个判断:金额字段的长度如果变了,就要走另一套精度转换逻辑。而存储过程里那段精度转换,写死了“除以100”和“乘以100”的两个分支,字段长度一变,判断分支就选错了。这还没有结束。另一个报表系统会拿金额字段做分组,字段变长后,某些原先不存在的分组出现了,又触发了报表系统前端一个古老的“按金额段显示颜色”的逻辑,导致一整片页面渲染异常。
复盘时我们还原了整个链路,发现自己根本不是在改一个字段,而是在改一条“牵一发动全身”的隐藏依赖链。后来我们定了一条死规矩:动屎山里的任何字段,先全局搜索这个字段的所有引用,包括SQL、存储过程、导出文件、前端展示,甚至运维脚本。 就算这样,也不能保证没有遗漏,但至少能把风险降低一半以上。
6.3 几个有效的小技巧
最后分享几个我亲测有效的操作习惯,它们简单,但极其适合屎山环境。
第一,永远在改动前备份当前版本,不是备份代码,是备份线上可回退状态。具体来说,就是把本次改动涉及的函数、表结构、配置项全部快照一遍。出现问题时,不是去想“怎么修”,而是先想“怎么回滚”。
第二,给所有临时修复加上醒目标记。屎山里最多的就是“临时修复”,但一旦不留标记,过三个月就没人记得它是临时的了。我一般会在注释里写:TEMPORARY_FIX_20240115_REASON,方便检索和后续清理。
第三,培养“至少多问一个人”的习惯。动屎山之前,不管你觉得改动多小,都应该找另一个了解系统的人确认一下。很多事故不是开发者能力不足,而是他只看到了自己那一小块领域,不知道旁边的地雷在哪。在屎山面前,多一次确认,永远比少一次好。
我个人的体会是,和屎山相处,心态往往比技术更重要。别总想着一次把它修好,也别整天幻想彻底重写。把它当成一个磨合了很多年的老伙计,尊重它、理解它,然后在它允许的范围里一点点做出改变。等你真正读懂了一坨屎山,你会发现自己对“鲁棒性”的理解,远比看一百篇架构文章要深刻得多。
