前阵子跟朋友复盘一次线上事故,聊到凌晨三点。事故本身不复杂:一个定时任务在流量高峰抢光了数据库连接池,把主链路拖垮了。真正让我难受的是,这套系统从头到尾没有一层“控制”——没有缓冲,没有熔断,没有自动回退,全靠值班同学盯着监控手动调。当时我脑子里反复冒出一个词:Harness Engineering。软件工程做到一定复杂度之后,就不再只是“把功能写对”的事了,它会越来越像一套控制系统设计。
Harness Engineering,翻译过来可以叫“驾驭工程”或“控制工程实践”。它不是某个新框架,也不是某个岗位的名称,而是一整套思维方式的转变:把软件的编写、部署、运行、治理,都当成一个“被控对象”在做系统设计。你不再只关心程序能不能跑通,而是关心系统在受到扰动之后还能不能回到期望状态。这篇文章我想从概念拆解、控制系统视角、落地实操、AI Agent的新挑战、组织流程的控制回路到底走多远、以及常见误区这几个角度,把这套思路完整盘一遍。适合正在做平台工程、SRE、基础设施、AI应用层研发,或者单纯觉得系统越来越难“管”的工程师参考。
1. Harness Engineering 到底在说什么
1.1 从马具、线束到软件里那根“缰绳”
Harness 这个词在英文里最早指马具。骑马的人靠缰绳、马衔、肚带这些装置,把自己的意图传导给马,同时限制马的危险动作。一套好的马具并不是为了绑死马,而是让骑手和马之间形成一种可预期的协作关系。后来工业时代把成捆的电线、信号线也叫做线束(wiring harness),飞机、汽车里成千上万条线必须被规划、固定、分层,否则一个震动就会短路。
软件工程里的“harness”沿用了同样的逻辑。你最早接触到的可能是 test harness——测试夹具。它把被测对象架起来,准备好输入、模拟依赖、收集输出,再判断结果是否符合预期。这套东西的本质就是:给被测组件装上“传感器和执行器”,让外部能够观测它、驱动它、评估它。再往后,持续交付里的 build harness、部署流水线里的 release harness,做的也是同一类事:把不可控的构建和发布过程,包装成一套可以被重复执行、被检查节点拦截、被人工或自动触发的控制通道。
从这个角度理解 Harness Engineering,就是一门“给系统装缰绳”的工程。它关注的不是业务逻辑本身有多聪明,而是系统能不能在复杂环境中被安全地驾驭。
1.2 为什么这个词现在又被翻出来
其实“控制”在工程界从来不新鲜。自动控制理论从上世纪初就开始发展,PID控制器、反馈回路、状态空间模型,都是成熟学科里的老概念。王广雄那本《控制系统设计》是我们这代人入门控制理论时绕不开的参考书,里面反复强调的就是:先建模,再分析稳定性,然后才谈设计控制器。传统软件工程教科书里很少讲这些,因为早期软件系统规模小、逻辑简单、变化少,把功能调通就够了。
但今天不一样了。微服务拆出去几十上百个,每个服务还都有自己的依赖;业务处于流量高峰时,任何一个小服务的抖动都可能被放大成整个系统的雪崩。再加上大模型应用开始进入生产环境,模型的输出天然带有随机性,一层不稳定的逻辑“插入”到了核心链路里。这些系统的共同特点就是:输入不确定、环境不确定、行为也不完全确定。当系统的不确定性大到“写对代码也不能保证线上正确”时,就必须引入反馈和控制机制,这正是控制系统设计的核心场景。
Harness Engineering 在这个时候被重新提起,本质上是在提醒我们:软件工程的传统范式太偏重“构造”,太偏重造一个功能正确的物体;而今天的系统更像是一个需要持续调节的活体,需要的是“控制”。
1.3 它跟你印象里的“架构设计”有什么不一样
很多人会把 Harness Engineering 跟架构设计混淆。架构设计关注的是系统内部的静态结构:这层服务怎么分、数据怎么流、接口怎么定义。它解决的是“系统由哪些部分组成,彼此之间是什么关系”。而 Harness Engineering 关注的是系统在外界扰动下的动态行为:怎么测量、怎么比较、怎么施加控制动作、怎么判断控制效果。
你可以这样理解:架构是骨架,harness 是神经系统和肌肉。骨架决定了这个系统长什么样,神经系统负责感知环境,肌肉负责改变姿态。光有骨架没有神经,系统就是一个“漂亮的静态模型”,一旦遇到扰动只能等人来救。控制层挂在架构之上,但它不是架构的附庸,而是一个与之平行的设计维度。一个系统的架构可以很漂亮,但如果缺少反馈回路,运行品质可以说完全不可控。我在很多团队里看到的恰恰是前者——画了一堆漂亮的架构图,但线上出问题时要靠人肉翻日志才能定位,这就是典型的“有骨架,没神经系统”。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 把软件系统当成一个控制系统来设计
2.1 经典控制系统的四件套怎么映射到软件上
如果翻开控制理论的教材,我们会发现所有控制系统都由几个核心部件组成:被控对象(plant)、传感器(sensor)、控制器(controller)、执行器(actuator),再加上参考输入和外部扰动两个外部信号。这五个概念几乎可以一一映射到现代软件系统上。
被控对象就是你真正要管好的那部分业务服务,比如订单处理流水线、推荐服务、库存系统,或者一个数据同步管道。传感器是系统所有可观测性设施,比如 metrics 采集、日志、链路追踪、用户行为埋点。控制器是决定“该做什么”的决策模块,它可以是一个非常简单的规则引擎,一个基于阈值的告警策略,也可以是更复杂的强化学习决策器。执行器是真正改变系统状态的动作端口,比如扩缩容接口、重启服务、流量切换、限流降级开关。
参考输入对应的是业务目标,比如“下单成功率要高于99.9%”“支付回调的 p99 延迟要小于500毫秒”。外部扰动对应的是流量突刺、上游依赖超时、配置变更失误、模型推理漂移等。任何系统只要你想让它稳定地达到某个目标,本质上都要先回答这三个问题:我用什么测量?我用什么决策?我用什么执行?能想清楚这三点的团队,就算不懂控制理论,也已经无意识地在做 Harness Engineering 了。
2.2 开环与闭环:从“写完就上线”到“持续纠偏”
控制系统里最重要的分水岭是开环和闭环。开环控制是指控制器发出指令后,不再关心结果是否达到预期。最典型的例子是老式洗衣机的定时器,设定15分钟就洗15分钟,不管衣服到底洗干净没有。闭环控制则引入了反馈:恒温器检测到室温低于设定值,就启动加热;高于设定值,就停止加热。它每一次动作都取决于上一次动作后的实际效果。
很多软件系统目前仍然停留在开环状态。我们把代码写好,发布上线,然后就默认“只要逻辑正确,结果就应该正确”。这在确定性系统里勉强成立,但在分布式环境里,网络超时、资源竞争、数据不一致、依赖服务异常这些扰动因素,会不断把系统推离设计时的预期。开环系统一旦偏离正轨,只能靠人介入修正。而人的反应速度是秒级甚至分钟级,系统可能早就从小抖动变成了大事故。
所以 Harness Engineering 向前走的第一步,就是把开环系统改成闭环系统。发布一个服务,不能只看“进程起来了没有”,要持续反馈“这批流量进了新版本之后,请求成功率、延迟、资源占用与上一版本相比如何,是否在可接受范围内”。如果不对,就要自动或半自动地把流量切回老版本。这个过程本质上就是一个闭环控制器:设定期望值、测量当前值、计算偏差、执行调节。
2.3 稳定性、扰动与反馈增益,软件工程新的度量衡
控制系统设计里最核心的概念是稳定性。一个系统不稳定,通常表现为持续震荡:流量一高就限流,限流后流量降了又立刻放开,放开后流量又上去再被限流;或者扩缩容在一分钟之内来回弹。这种震荡在控制论里叫极限环振荡,本质是控制器增益过大、反馈延迟过长产生的。如果你见过某个集群的副本数在5到50之间疯狂抖动,你其实已经见过一个非常典型的不稳定闭环系统了。
反馈增益(gain)也是同样的道理。增益太大,系统对偏差过度敏感,一点小波动就会导致动作幅度很大,反而放大扰动;增益太小,系统反应迟钝,偏差要累积很久才能触发纠正。在实际工程里,这体现在“限流阈值设多少”“熔断需要观察多少秒,达到多大错误率才打开”“扩缩容的冷却时间多长”。这些参数看上去都是调优细节,但它们就是软件系统控制器的 Kp、Ki、Kd。调参能力已经成为现代后端工程师实际上的核心竞争力,只是很少有人把这层窗户纸捅破。
3. 实战:给一套业务系统装上 harness 控制层
3.1 选场景:为什么建议你先拿订单管道或数据处理链路开刀
想上手做 Harness Engineering,不需要一开始就重构整个系统。最合适的试验场是那些链路长、依赖多、故障影响直接可见的业务管道。我比较推荐用订单处理管道或者数据处理链路来练手,因为它们有三个优势:一是链路里每一环都有明确的上游和下游,适合装传感器;二是漏斗形态天然有积压和丢数据的问题,便于你设计执行器;三是业务价值直接,很容易向团队证明这套控制层的必要性。
我们以订单处理管道为例。下单后会经过风控校验、库存扣减、支付请求、异步通知、履约调度等环节。每个环节都可能失败,失败的订单会进入重试队列。传统做法就是写好重试逻辑,配一个死信队列,然后祈祷一切顺利。这种系统一旦在高峰期遇到库存服务慢查询,积压会迅速增加,重试风暴会进一步打垮下游,系统就会进入“越重试越慢了、越慢了越积压”的恶性循环。Harness 控制层要解决的核心问题就是:在积压到达危险线之前,主动把入流量降下来或者把处理能力提上去,而不是等着放大器出现。
3.2 加装传感器:遥测点位与指标设计
给管道装传感器,首要任务不是立刻上全家桶监控,而是定义几个“关键过程变量”。我把它们称作管道控制的三件套:处理速率、积压深度、错误率。处理速率是每秒成功处理的订单数;积压深度是当前等待处理的消息数量;错误率是一段时间内失败请求的比例。这三个量之间有一个基本关系:当积压持续上升且处理速率跟不上,说明管道已经接近能力上限;当错误率突然升高,说明可能是某组件出了故障,也可能是依赖被压垮了。
遥测点要放在哪里?我的建议是在每个跨系统边界上埋点,至少包含入口(收到请求数量)、出口(成功响应数量)、依赖调用(第三方接口的耗时和错误码)、队列(进出条数和当前深度)。不要迷信“全链路追踪只要上了,问题就都能看见”。追踪解决的是单次请求的路径还原,控制回路需要的是聚合指标和时间序列,两者互补但不互相替代。你用 Prometheus 或任何 TSDB 存好这些指标,设置合理的抓取频率和保留周期,然后留出查询接口,供控制器调用。
3.3 定义控制器:从报警阈值到目标状态
有了传感器数据,下一步是定义控制器。控制器的输入是“当前状态”,输出是“要不要调整,怎么调整”。最简单的控制器是一组阈值规则:如果积压深度超过 N 并且持续 M 分钟,则触发限流;如果错误率超过 P 并且持续 T 秒,则熔断下游依赖。但请注意,任何阈值都不能只看瞬时值。瞬时抖动太多了,熔断器如果在错误率瞬间冲高时就立刻打开,会让系统在毛刺里不断抖动。正确做法是加“死区”和“持续时间”两个概念:死区是当前状态距离设定理想状态多少范围内不动作,持续时间是异常必须稳定保持多久才触发动作。
更进阶一点,可以把控制系统看作一个目标状态的调节器。你给系统设定期望的积压深度和期望的处理延迟,控制器每个周期比较期望值和实际值,然后输出一个调节量:加大消费者并发数、降低生产者速率、拒绝一部分非核心流量。这样控制动作就不是离散的“开/关”,而更像一个连续调节的过程,系统会平稳很多。想要更平滑,可以给动作变化加限幅,比如单次扩缩容不超过当前规模的20%,避免一次性动作过大。
3.4 执行器动作:限流、熔断、扩缩容与回滚的落地细节
执行器是整条控制回路的最终落点。很多系统不是没有执行器,而是执行器太粗糙、太一次性。常见的执行器有四个:限流、熔断、降级、扩缩容。每一项实现都有不少坑,我逐个说一下。
限流需要在入口处控制进入系统的请求量,常见的算法有固定窗口、滑动窗口、令牌桶、漏桶。生产环境我更推荐令牌桶或滑动窗口,因为它们能扛住突发流量,而不是死板地拒绝所有超过阈值的请求。限流阈值不能拍脑袋定,最好用压测数据推导:先确定下游依赖能承受的最大 QPS,再来设置入口阈值。熔断要分级,不是一断全断。可以按接口维度、按依赖实例维度分别做熔断,否则一个热点接口异常会导致整个服务的流量全被拒掉。降级要准备可返回值,比如库存服务挂了,优先返回缓存中的库存快照而不是直接报错。扩缩容要设冷却时间,Kubernetes HPA 默认的默认稳定性窗口往往不够,建议调到至少3到5分钟,配合自定义指标做伸缩。回滚要快,但要稳,发布系统要支持按批次回滚和按指标自动回滚,不能期望人半夜爬起来手动切流量。
3.5 闭环验证:用混沌实验和故障注入来检验控制层
控制层装好以后,必须验证它真的有效。光看监控面板觉得一切正常是不够的,你需要在测试环境甚至小范围生产环境里主动制造故障。做法是一次只注入一个故障变量,观察控制回路是否如预期动作。比如,随机杀掉一个订单服务的 Pod,看流量调度和负载均衡是否自动补齐;给数据库访问注入300毫秒延迟,看熔断器是否按设定打开;人为把一个队列的消费者的并发数降到1,看积压报警是否触发扩缩容。每做一次注入,都要记录系统从“出问题”到“恢复平稳”的时长。这个时长就是整套控制回路的恢复时间,它是衡量 harness 质量的核心指标,比任何单个组件的性能数字都重要。
这里要提醒一下:故障注入不是胡来,每一次实验都要有明确假设。写清楚“我预期会看到熔断打开、流量转到备集群、5分钟后指标恢复”,然后去验证。如果没有出现预期动作,其实是好事,说明你找到了系统的盲区。混沌工程本身不是目的,是检验 harness 控制层有效性的手段。
4. AI Agent 时代,harness 变得更重要了
4.1 模型输出不确定,等于系统里引入了一个强扰动源
如果说传统微服务系统只是“环境不确定”,那么加入大模型后,系统自身的行为也开始不确定了。同一个 Prompt,同一个模型,走十次可能给出十个不同的回答,里面还有可能有幻觉、逻辑断裂、格式错乱。传统软件工程的所有流程都建立在“逻辑是确定的”假设之上,而大模型把这个假设打破了。系统的输入、处理、输出都不再完全可控,这对工程实践提出了一个很现实的问题:你没法保证结果必然正确,只能保证“结果在受控范围之内”。
在 AI Agent 应用里,这个问题更明显。Agent 会自己决定调用哪些工具、按什么顺序调用、传什么参数。如果没有任何控制机制,一个“自主智能体”很可能为了完成一个目标,调用了不应该调用的接口,或者进入死循环。所以这两年业界开始提“Agent harness”这个概念:要给 Agent 的规划、工具调用、输出格式、权限边界都装上一套控制装置。它的目标不是让 Agent 变“笨”,而是让它变成一匹“训练良好的马”,既能发挥能力,又不会突然尥蹶子。
4.2 给智能体装缰绳:工具边界、输出校验和人工介入点
构建可控 AI Agent 的 harness,我总结下来有四个关键层次。第一层是工具调用边界:Agent 暴露哪些工具、每个工具的入参 schema 是什么、哪些操作需要审批。工具本身要设置超时和重试上限,避免 Agent 反复调用一个失败接口造成浪费。第二层是输出校验:模型的输出在进入下一步之前必须经过格式化和校验,比如用 JSON Schema 检查输出结构,用关键词过滤器拦截不合规内容,用语义级评估模型判断回答是否偏离用户意图。第三层是上下文窗口控制:Agent 的记忆不能无限增长,需要设计摘要、裁剪和遗忘机制,否则上下文越长越可能出问题。第四层是人工介入点:在资金操作、对外发布、删除数据等高风险动作上,一定保留人机回退的开关。这不是妥协,而是最可靠的兜底执行器。
还有一点需要特别强调:Agent 的每次工具调用都应该有审计日志。谁发起的请求、目标是什么、Agent 自己选了哪些步骤、每个步骤的入参出参是什么,全部要记录下来。表面上看这是合规要求,本质上这是控制系统的传感器数据。如果没有审计日志,你连 Agent 行为发生了偏离都发现不了,就更谈不上控制了。
4.3 RLHF 本质上就是一条人工反馈回路
很多人觉得强化学习是个高深的 AI 概念,但如果从 Harness Engineering 的角度看,RLHF(基于人类反馈的强化学习)就是一个标准的闭环控制系统。被控对象是语言模型,参考输入是“符合人类偏好的回答风格”,传感器是人类对模型输出的打分或者排序,控制器是强化学习算法,执行器是模型参数的微调。整个训练过程就是:模型生成回答,人类反馈评价,算法调整策略,再生成新回答。
理解了这层类比,你会发现很多 AI 应用层的问题都可以用控制论来思考。比如线上的 Agent 效果越来越差,不一定是模型变笨了,可能是上游工具接口变了导致调用失败率上升,这时候要调节的不应该是模型提示词,而是工具层的执行器参数。这个视角能让 AI 应用工程师跳出“调 Prompt”的单一手段,把视野放到整个系统的反馈回路上。
5. harness 不只在代码里:团队与流程的控制回路
5.1 代码评审是变更控制里的“传感器+控制器”
Harness Engineering 的思维不只适用于线上系统,放在研发流程里同样成立。代码评审就是一个典型的控制环节:传感器是评审人阅读 diff,控制器是得出的“合入/打回”决策,执行器是合并门禁和 CI 检查。很多团队把评审当“走流程”,只注重形式刷个 LGTM,这等于控制系统里传感器失灵了。好的评审机制应当明确地定义:什么类型的变更必须强制两人评审,什么重要文件变更需要领域专家参与,什么指标证明变更质量是健康的。
GitHub 上的 branch protection、GitLab 的 merge request approval rules,本质上就是在给代码仓库装执行器。但执行器要设计合理,比如“所有改动都必须评审”会让 trivial change 也排队,反而把评审人的注意力消耗在无价值信息上。更好的做法是分级控制:根据文件的危险系数(核心模块、支付逻辑、基础设施代码)动态调整评审强度。这样既不牺牲控制质量,又不拖垮开发节奏。
5.2 发布流程就是一次参数调节,灰度与回滚是执行器的手柄
发布本身是一个高风险的变更动作,几乎所有稳定性事故都发生在发布窗口。把发布看成控制系统的参数调节过程就很容易理解为什么要灰度、为什么要渐进式放量。你改了系统里的一个“参数”(代码逻辑、配置项、模型版本),而你对这个新参数在真实流量下的表现并不完全了解。灰度发布就是小步调整观察,确认偏差在可接受范围内,再逐步增大调整幅度。
灰度策略本身也在进化。过去只是把流量按百分比切换,现在更推荐按“预算化发布”来设计:给每个新版本设定可以接受的最大错误数和最大影响时长,一旦超出预算立即回滚。这就是把参考输入和控制器都内建到发布系统里。我最喜欢的一个实践是 feature flag 配合自动回滚:新功能上线后,如果核心指标在10分钟内恶化超过阈值,系统自动关闭 flag,用户无感地切回旧逻辑,工程师根本不需要半夜起来做决定。
5.3 事故复盘是系统辨识的关键手段
控制系统设计有一个重要步骤叫系统辨识——通过实验数据建立被控对象的数学模型。在软件工程里,这件事对应的就是事故复盘。每次线上事故都提供了宝贵的“激励-响应”数据:系统受了什么扰动,表现出了什么行为。如果团队只是把事故报告写完就封存,等于浪费了一次绝佳的系统辨识机会。
我参与过的最有效的复盘会,不是追究责任人,而是把事故当一条“控制失败案例”来分析:系统原本的目标状态是什么?传感器在哪个环节没测到?控制器为什么没有及时动作?执行器是否执行到位?四个环节只要有一个脱节,就会变成事故。用这套框架去复盘,很多所谓“运气不好”的事故都能还原成具体的控制回路缺口。这样沉淀下来的改进项,才有资格写进下一个版本的 harness 设计里。
6. 常见误区:Harness Engineering 不是万能胶
6.1 过度控制:给每个函数都加熔断重试,只会让系统更复杂
我见过最走火入魔的案例是,有团队把控制思想用到了极致,每个服务都嵌套了多层熔断、限流、重试、降级,结果一次小故障触发了几十条控制策略同时动作,大家根本分不清系统是在主动调节还是在互相打架。控制系统设计有一个基本要求:控制回路本身必须足够简单、可预测。你甚至应该给控制器也设计熔断机制——当控制策略自身频繁误动作时,自动切回“手动模式”,并发出高优先级告警提醒人类接管。控制层不是越厚越好,它是用来保障核心稳定性的,不是用来给系统增加不确定性的。
6.2 把指标当目标,目标函数设计错了一切都错
Goodhart 定律说:当一个指标变成目标,它就不再是个好指标。这个问题在 harness 里非常致命。如果你把“服务可用性 99.99%”设成唯一目标,那么系统完全可以通过在故障时屏蔽用户请求来“提高可用性”——表面数字好看了,用户体验反而更差了。如果你把“队列积压一定为0”当作目标,系统会疯狂扩并发,结果下游被压垮。正确的做法是设计一个多变量目标,比如“可用性大于99.9%且错误率低于0.1%且平均响应时间低于300毫秒”,任何一个维度越界都要触发控制动作,而不是被某个单指标绑架。
6.3 控制回路互相打架,多个“大脑”抢同一个执行器
微服务架构里,多个控制回路经常共享同一个执行器。举个例子:业务层的熔断器发现下游超时打开了熔断,而基础设施层的重试机制又在同一时刻把请求自动重试到另一个实例。两套逻辑往相反方向发力,最终结果就是熔断器刚打开,重试请求又把下游打满了。要避免这类问题,必须有一个全局的“控制协调层”,清晰定义每个执行器的归属。如果做不到,至少要在设计层面约定:重试和熔断是互斥的,同一个请求路径上只能由一层逻辑做重试决策;限流和扩缩容的触发条件要留有死区,不能同时跳变。
6.4 自动化不等于 harness,核心是闭环反馈
很多团队一听说 Harness Engineering,第一反应是“我们要上一个自动化平台”。结果全部精力都花在了“自动化执行”上,比如自动发布、自动扩缩容、自动提醒,但反馈环节几乎没有。自动执行但缺乏反馈,本质上还是开环控制,只是把手动操作换成了脚本。真正的 harness 必须回答:执行完动作之后,系统状态有没有按预期改善?如果没有,下一步该做什么?自动化程度是越高越好,但前提是反馈回路已经闭环。我建议先手工控制+完整观测,确认控制策略有效,再逐步用自动化替换手工步骤,不要一上来就追求全自动,否则很可能只得到一个“自动炸锅的系统”。
7. 常见问题速查与避坑清单
| 问题表现 | 排查思路 | 推荐做法 |
|---|---|---|
| 系统一遇流量高峰就雪崩 | 检查是否缺少入口限流和依赖熔断 | 先给入口和关键依赖加两层保护,再引入背压机制 |
| 熔断器频繁误动作 | 阈值设置过低,或持续时间过短 | 调整触发阈值,加持续时间窗口,用长时间中位数而不是瞬时值 |
| 扩缩容疯狂抖动 | 控制增益过大,冷却时间过短 | 延长冷却时间,限制单次伸缩幅度,使用多指标加死区 |
| 报警太多没人看 | 传感器太多、控制器没有优先级 | 收敛核心指标,分层告警,关键动作要有电话或IM强提醒 |
| 自动回滚不生效 | 回滚触发条件与故障检测不在同一条链路 | 回滚判断直接使用当前服务健康指标,而不是依赖另一套系统 |
| Agent 自作主张调用工具 | 工具边界没约束,缺人审 | 建立工具白名单,高风险动作强制人工审批,全程审计 |
| 发布后问题发现太晚 | 反馈延迟过长,传感器埋点过少 | 在跨系统边界埋点,发布后10分钟内设置自动质量门禁 |
| 多个控制策略互相干扰 | 执行器归属不清晰 | 设计全局控制协调层,统一管理执行动作的优先级和互斥关系 |
还有一个容易被忽略的心得:控制系统的控制器本身也要做“回归测试”。你改了限流阈值、改了熔断时间窗,这种改动一定要走完整的测试和灰度发布,不能因为它是“配置”就直接改到生产。配置是代码,控制策略更是核心逻辑,它们的变更往往会引发连锁反应,应该用比普通业务代码更严格的标准来对待。
8. 关于 Harness Engineering,我个人的实践体会
这套思维给我最大的改变,不是让我多做了一层监控或者多个自动化脚本,而是让我在画任何系统图之前,先问一个问题:这个系统的反馈回路在哪里?闭环了吗?如果你是靠喊、靠盯、靠人有空了去翻后台才知道系统状态,那不管架构图画得多漂亮,都还处于“放养”阶段。真正的引擎盖下面,应该有仪表盘、有方向盘、有刹车,还要有定速巡航。这些装齐了,才是 Harness Engineering 意义上的“可驾驶系统”。
踩过几次坑之后,我会建议大家从最朴素的三步开始:先用三张图把一个核心链路画清楚,第一张画数据流,第二张画故障模式,第三张画控制动作;然后给这条链路装上“错误率、延迟、积压”三个核心传感器;最后用一个简单规则引擎把这些指标连到一个真实的执行动作上。做完了这三步,你不需要懂复杂的控制理论,也已经走在 Harness Engineering 这条路上了。后面那些拉普拉斯变换、状态空间、PID 参数整定,等你真的遇到了震荡和发散,再回头翻教材也来得及。
