1. 数据服务里的异常为什么不能一概重试
做数仓平台的同学应该都有这种经历:对外开放的API服务明明昨天还好好的,今天突然一堆调用方来报“查询超时”“数据不存在”“请求过于频繁”。你查了半天发现,底层跑批任务延迟了,或者查询引擎出了毛刺。这时候“重试一下”往往是最快的解决办法,但也是最容易埋雷的办法。稍微不注意,重试就会把下游打爆,或者把本来只失败一次的操作重复执行了好几遍。这篇就围绕数据服务异常处理里最核心的两个手段——重试与补偿机制,聊聊我在实际项目中总结出来的设计方法和踩过的坑。
1.1 异常分类:哪些值得重试,哪些重试是火上浇油
先说一个容易被忽略的概念:数据服务,尤其是数仓平台对外开放的API服务,和普通Web服务有个很大的不同,它下游的依赖链路往往又长又脆弱。一次API请求可能要经过网关、鉴权、路由、查询引擎、底层存储,中间还可能触发跑批任务或外部接口回调。这条链路上任何一环出问题,都会表现为调用方看到的“请求失败”。而且数据服务通常承载的是指标查询、报表生成、任务触发这类操作,一旦失败,影响范围往往是一大片业务方。
处理失败最直觉的动作就是“再试一次”。但重试不是无脑重放,第一步要分清异常类型。根据失败原因,异常大体可以分成三类。
第一类是可重试的瞬时异常。网络抖动、连接池获取超时、下游服务短暂不可用、数据库死锁重试等都算这一类。这类异常有一个共同特征:失败的那一瞬间不代表资源或状态被破坏,等一小段时间往往能恢复。比如MySQL的Deadlock found when trying to get lock,或者调用外部接口时偶尔出现的连接重置,这种错误重试基本都能成功。我自己的经验是,这类异常占线上失败的大头,但处理起来也最简单,给它一个合理的退避策略就行。
第二类是不可重试的明确异常。参数错误、鉴权失败、数据不存在、业务校验不通过,这些都属于这一类。比如调用方传了个非法日期格式,你再怎么重试也是400;Token过期了,不重新授权重试一万次也过不去。对这类错误,重试只会浪费时间、占用日志空间,还可能把真实问题掩盖掉。我见过不少团队写一个全局重试拦截器,不管什么异常先重试三次再说,结果把“参数非法”这种错误反复刷了好几遍,日志里全是无意义的堆栈,真正需要排查的线索反而被冲掉了。
第三类是需要谨慎处理的“灰区”异常,典型代表是超时。超时最棘手,因为客户端看到超时,服务端可能其实已经处理成功了,也可能真的没处理。这时候简单重试会造成重复提交;不重试又会丢失请求。灰区异常不能只靠重试次数堆,必须配合幂等性和对账机制来兜底。
这里最容易被忽略的是第二类。很多人的习惯是写一个全局重试拦截器,看到异常就重试,结果把“请求参数非法”这种错误反复重试了几次,既浪费了线程,也把日志刷得没法看。我一般会在异常过滤器里先把异常分类打上标记,只有标记为“RETRYABLE”的异常才允许进入重试流程。具体实现上,可以在自定义异常类上增加一个retryable属性,或者在异常枚举里体现“可重试/不可重试”,这样比在重试代码里写一堆if判断要清晰得多。
1.2 重试的三个副作用:重复、雪崩、乱序
既然重试是双刃剑,那就得认清它带来的副作用,不然设计出来的重试机制就是给自己挖坑。
第一个副作用是重复执行。这是最直接的。如果服务端在处理请求时已经完成了业务操作,但响应在网络传输中丢失,客户端重试就会导致同一操作被执行两次。比如数据服务里常见的“生成对账文件并推送”接口,第一次调用可能已经生成了文件、扣减了配额,只是响应超时没返回。重试后另一个文件又生成,配额又被扣一次。如果没有幂等机制,这就是典型的事故。
第二个副作用是雪崩。当上游服务或调用方集中重试时,会形成“重试风暴”。比如某天凌晨数仓跑批任务延迟,API服务响应变慢,所有调用方都在超时后立即重试,重试请求又把已经过载的服务打得更满,响应更慢,于是更多请求超时,形成正反馈。最后数据库连接池被打满,整个服务雪崩。这种事故我在实际项目里见过不止一次,而且每次都不是单一系统的问题,而是整个调用链路一起“配合”出来的。
第三个副作用是消息乱序。在异步场景下,如果同一个业务实体的多个操作因为重试导致执行顺序变化,会破坏数据一致性。比如先发送“创建任务”消息失败后重试,但“取消任务”消息却先到了,最终状态就对不上。这个问题在消息队列场景里尤其明显,而且比同步调用更难排查,因为消息的投递时间、消费顺序和重试时机都不可控。
所以,重试机制设计的第一步不是配置重试次数,而是系统性地评估“这次失败重试是否安全”。评估标准就三条:失败原因是不是可恢复的、重复执行会不会造成副作用、重试会不会给下游带来额外压力。如果这三条里有任何一条不满足,就不要走重试,直接走失败降级或补偿流程。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 重试参数不是拍脑袋定的:退避策略与超时设计
2.1 固定间隔、指数退避、抖动退避的适用场景
确定异常可重试之后,第二个问题是:怎么重试?是一秒后重试,还是五秒后重试?这里面的参数如果拍脑袋定,线上早晚会出事。
常用的重试间隔策略有三种。
第一种是固定间隔重试。每隔固定时间重试一次,比如每5秒重试一次,共3次。实现最简单,适合本地任务或对下游压力可控的场景。但风险是如果下游故障持续时间较长,固定间隔的重试会在故障窗口内均匀打压力,而且多个调用方同时失败时,会在每个间隔点形成尖峰。
第二种是指数退避重试。重试间隔按照指数增长,比如第一次失败后等1秒,第二次等2秒,第三次等4秒。这种策略适合下游故障持续时间不确定的场景,给故障恢复留出时间窗口。数仓API服务调底层查询引擎时,我比较推荐这种策略,因为跑批任务延迟或引擎毛刺通常需要几十秒甚至几分钟才能恢复,如果重试间隔太短,基本是浪费资源。
第三种是抖动退避重试。在指数退避的基础上增加随机扰动,比如间隔时间取min(最大间隔, base * 2^n + random(0, 1000ms))。目的是避免大量请求在同一时刻重试形成“惊群”。分布式系统中,客户端并发调用同一服务时,如果不加抖动,所有客户端的重试时间点会高度一致,重试请求瞬间涌向下游,效果和DDoS差不多。加了抖动之后,重试时间点被打散,下游压力会平滑很多。
具体到数据服务场景,我有一个比较实用的经验:对内部API之间的调用,一般用指数退避加少量抖动;对外部第三方接口,用抖动退避;对本地线程池内的任务重试,用固定间隔就够了,因为本地重试不会跨网络,压力可控。
2.2 重试上限与超时预算:从调用链视角压住总量
重试参数里还有一个关键约束——不能无限重试。工程上通常用“重试次数+总超时预算”双重限制。
假设一个数据服务API的上游有A、B、C三个依赖,调用方给这个API的总体超时是5秒。那么A、B、C各自的超时和重试预算必须加起来小于等于5秒,否则调用方早就超时放弃了,服务端还在傻傻重试,白白浪费资源。
在实际项目中,我会建议用“超时预算表”来约束。下面是一个简化例子:
| 依赖环节 | 单次超时 | 最大重试次数 | 单环节最大耗时 |
|---|---|---|---|
| 网关鉴权 | 200ms | 0 | 200ms |
| 查询引擎 | 800ms | 2次(指数退避200ms/400ms) | 800+200+400+200+400=2000ms |
| 结果缓存写入 | 300ms | 1次 | 600ms |
| 总计 | - | - | 2800ms |
这个表不是死板的,核心是让整个调用链的超时和重试成本可控。每一次重试都必须“花”掉一部分预算。很多线上事故就是因为重试没有纳入预算,调用方已经超时返回了,服务端还在拼命重试,最终导致线程池耗尽。
另外,重试次数不要设置得太多。数据服务这种后端场景,通常1到3次足够。重试超过3次还不行,基本说明这个故障不是“抖一下”能恢复的,继续重试只会给下游持续补刀。与其盲目重试,不如直接走失败降级或进入死信/补偿流程。记住一个原则:重试是给下游恢复时间,不是表达“我不服”。
2.3 限流与“请求过多”场景下的重试姿态
数据服务经常遇到“请求过于频繁”的报错。这类错误很多是由服务端限流或配额超限引起的。限流场景下最忌讳的就是调用方“不服气”,一收到429或503就立刻重试,而且重试频率比正常请求还猛。这样做的结果就是限流越来越严重,甚至触发拉黑。
正确的做法是:收到明确的限流响应后,先看响应头里的Retry-After字段,按服务端建议的时间延迟后再重试。如果服务端没给这个字段,就采用退避策略,把重试间隔拉长到秒级以上,并且降低重试次数。比如正常重试最多3次,限流场景就只重试1次,而且间隔至少5秒。
这里有个小技巧:可以在客户端侧对同一接口的请求设置一个简单的本地熔断器。比如1分钟内连续失败超过10次,就进入“熔断”状态,直接快速失败,不再发起真实请求,隔一段时间再放行少量请求试探。这样既能保护下游,也能避免调用方被异常拖死。熔断器的实现不复杂,用Guava或Resilience4j都能搞定,但它对数据服务这种依赖重、稳定性要求高的场景特别有用。
3. 幂等:重试的前提,也是补偿的地基
3.1 数据服务API幂等设计:唯一请求ID与去重表
重试机制能不能安全落地,关键在幂等。所谓幂等,就是同一个请求执行一次和执行N次,最终结果一致。对于数据服务来说,写操作、状态变更操作、触发任务操作,都必须考虑幂等,否则重试就是事故源头。
最通用的方案是“唯一请求ID+服务端去重”。调用方在发起请求时生成一个全局唯一的requestId,比如UUID或雪花ID。服务端在处理写操作前先查去重表:
- 如果表里已有这个
requestId且状态是“处理中”,说明这是一个重复请求,可以返回上一次的处理结果或等待处理完成。 - 如果状态是“已完成”,直接返回成功结果,不再重复执行。
- 如果状态是“失败”,则允许重新处理,但要把旧记录标记为“已废弃”,再插入新记录。
这个方案特别适合数仓平台的API服务,因为很多操作最终会落到“执行SQL”“生成文件”“触发任务”上。这些操作一旦重复执行,代价可能是翻倍的计算资源或脏数据。用去重表先把请求挡一道,比什么都有效。
3.2 状态机与分布式锁:防止重复执行的关键
单纯靠去重表还不够,因为数据服务往往是多实例部署的,同一个请求可能同时到达两个实例,两个实例都查去重表发现没有记录,然后同时执行业务。这时就需要分布式锁或数据库唯一约束来兜底。
实践上我会用两步。
第一步,在去重表上对requestId建唯一索引。这样即使两个实例同时插入,也只有一个能成功。这是最硬的一道防线。很多时候大家觉得分布式锁就能解决,但其实数据库唯一索引更可靠,因为锁可能因为网络分区失效,唯一索引不会。
第二步,对于复杂的业务状态,设计状态机。比如“任务状态”只有INIT -> RUNNING -> SUCCESS/FAILED这些合法流转,重复请求只能把状态从“当前状态”推到“允许的下一个状态”,否则就拒绝。状态机的价值在于:即使某个步骤被重复触发,也会因为“当前状态不匹配”而跳过。很多分布式系统的幂等,表面靠ID,底层靠状态机流转约束。
3.3 幂等键生成与透传的细节
幂等设计里最容易被忽略的是幂等键的生成和透传。很多团队只是简单让调用方传一个UUID,但同一个业务请求如果被调用方内部重试了几次,每次生成的UUID都不同,那服务端就完全没法去重。
正确的做法是:幂等键必须和业务语义绑定。比如“对账单生成接口”,可以用业务日期 + 渠道 + 用户ID + 操作类型组合成一个稳定的幂等键。只要业务语义不变,哪怕网络重试或客户端重试,幂等键都保持一致。这样服务端才能识别出这是同一笔操作。
另外,跨服务调用时,幂等键要通过请求头或消息体一路透传。比如A服务调B服务,B服务再调C服务,全程都要携带最原始的幂等键,不要在中途重新生成。我见过不少项目在服务间调用时“自作聪明”地生成了新的请求ID,最后导致重复操作无法被识别。调试这类问题非常痛苦,因为两边日志里的请求ID都对不上。
4. 消息队列场景下的重试与死信:以RabbitMQ为例
4.1 手动确认与重回队列:为什么不能自动重回
数据服务里大量使用消息队列做异步任务解耦,RabbitMQ是常见选择。消息消费失败后的重试处理,和同步API重试是两套逻辑,坑更多。
RabbitMQ默认采用的是自动确认模式:消费者拿到消息,如果处理过程中抛异常,消息会被自动重回队列或直接丢弃。这都很危险——自动重回队列会造成无限循环消费,直接把队列堵死;直接丢弃则可能造成数据丢失。生产环境我是绝对不会用自动确认的。
所以生产环境我会把消费者设置为手动确认模式,即manual ack。在业务代码里显式调用basicAck表示处理成功,basicNack或basicReject表示处理失败。只有这样才能精确控制失败消息的去向。手动确认模式下,如果忘记ack,消费者连接断开后未确认的消息会被重新投递,这本身就是一种“隐式重试”。所以处理逻辑必须设计成幂等的,否则一旦消费者崩溃,消息重投就会造成重复处理。
4.2 重试次数获取与消费端重试策略
RabbitMQ本身没有内置“重试N次后丢弃”的机制,所以我们需要自己在消费端实现。常见做法是在消息头里存放重试次数,或者利用消息的x-death头来获取已重试次数。
利用x-death是RabbitMQ死信机制提供的字段。当消息被basicReject或basicNack并且requeue=false时,消息会进入死信队列,此时可以在死信队列的消费者里读取x-death头,获取消息被拒绝的次数,从而决定是再次投递还是人工处理。
不过在业务代码中,更常见的做法是“计数器+延迟重试”。比如消费失败时,把重试次数加1,如果小于阈值,就将消息发送到一个延迟队列,等待几秒或几分钟后再投递回业务队列;如果超过阈值,就投递到死信队列。这里有个关键点:直接用requeue=true的重试没有时间间隔,失败消息会瞬间被反复消费,不但解决不了问题,还会拖垮消费者。所以只要涉及重试,一定要用延迟机制,而不是简单重回队列。
4.3 死信队列:怎么配置、什么时候用、怎么消费
死信队列,也就是DLQ,是重试机制的安全网。当消息最终处理失败或被判定为“不可重试”时,应该进入死信队列,等待进一步处理。
RabbitMQ中配置死信队列比较简单。先声明一个普通业务队列,通过参数x-dead-letter-exchange指定死信交换机,x-dead-letter-routing-key指定死信路由键。当消息被拒绝或TTL过期或队列达到最大长度时,消息自动路由到DLQ。
死信队列的用途主要有两种。一种是排查故障,把失败消息保留下来,分析失败原因,修完bug后补投。另一种是定时补偿,DLQ的后台消费者可以定期扫描失败消息,对可恢复的失败进行重新投递。
我给一个实用建议:死信队列的消费者不要写得太复杂,核心是记录失败原因、入库、告警。真正的人工补单或自动重放,通过管理后台或脚本操作,而不是让DLQ消费者无脑重试。否则DLQ也会变成新的“重试风暴”源头。
5. 补偿机制:重试解决不了时的最后一道防线
5.1 事务补偿的核心思想:把“失败”变成“可修复”
重试机制处理的是“暂时性故障”,而补偿机制处理的是“最终一致性”问题。跨服务调用的分布式事务中,没有全局事务管理器时,只能通过补偿把已经执行成功的操作“回滚”或“修正”。
最典型的模式是Saga模式。比如一个数据服务调用链:创建任务 -> 扣减配额 -> 提交SQL查询 -> 写入结果表。如果“提交SQL查询”失败,前面已经扣减的配额就需要补偿回滚。补偿操作不是简单的“回滚”,而是业务层面的反向操作。扣减了配额,补偿就是加回配额;创建了任务,补偿就是置任务状态为“已取消”。这些补偿操作本身也要有幂等性,否则补偿重试时会把配额多加一次。
在设计补偿逻辑时,我总结了一个判断标准:每个正向操作,都要有对应的反向操作,并且反向操作要有业务意义。如果某个操作无法补偿,那就要在正向操作前增加预检查或冻结机制。比如扣减配额前先“冻结”配额,等全部成功后把冻结改为实际扣减;失败后直接解冻。这样就不存在“扣了又得退”的问题,状态更干净。
5.2 对账任务与定时补偿:离线兜底方案
有些数据不一致不是靠实时链路能发现的,必须靠离线对账兜底。数据服务里最常见的场景是:API服务调用下游推送任务,下游返回成功,但实际数据没有完全落库。这时候需要定时任务对账,把两边的数据拉出来比对,发现差异后触发补偿。
对账任务设计有几个要点。对账窗口要覆盖业务高峰期和补偿周期,比如每15分钟跑一次最近1小时的数据。对账的比对键必须是业务唯一键,比如订单号、任务ID、对账日期。对账发现差异后,要生成补偿任务,但要控制补偿水位,不能一下子把几十年旧账都补了。
这种方式虽然看起来“慢半拍”,却是很多数据服务最终一致性的底线。我遇到过不少线上问题,最后都是靠对账任务兜底发现的。实时链路做得再好,也架不住消息丢失和程序逻辑bug,对账就是给自己留一条后路。换个角度想,重试和补偿解决的是“能不能自动恢复”,对账解决的是“没恢复的能不能被发现”,两者缺一不可。
5.3 人工介入与告警:什么时候需要人站出来
补偿不是万能的。有些失败场景既不能靠重试解决,也没有合适的自动补偿策略,这时候需要人工介入。关键是,系统要能准确识别并把事件送到人面前,否则人工介入就成了一句空话。
我会把需要人工介入的场景分成两级。预警级:定时对账发现N条数据不一致,但自动补偿成功率较高。此时只发告警,观察后续补偿是否自动收敛。人工级:消息进入死信队列且重试N次失败、某类异常连续出现、补偿任务连续执行失败。此时触发工单、钉钉、电话告警,要求值班人员处理。
人工处理并不意味着让人去数据库里“手工改数据”,而是提供一套管理工具:查看失败详情、查看调用链日志、执行“重放”按钮、执行“置为成功”或“置为失败”的人工修正。让操作可追溯、可审计。日常干活的时候,这种后台页面比一堆脚本好用得多。
6. 实战复盘:数仓API服务的一个完整异常处理设计
6.1 需求场景与异常现状
最后用一个真实项目里的设计来收尾。数仓平台对外开放了一批指标查询API,底层依赖离线数仓表、实时计算引擎和外部标签服务。API服务上线初期,调用方频繁反馈三类问题。
第一类是查询偶尔超时,尤其上午跑批高峰期,底层资源竞争激烈,一个简单查询有时候要好几秒。第二类是部分请求返回“下游服务不可用”,但过几分钟又自动恢复,属于依赖服务不稳定的典型表现。第三类是少数异步任务,比如生成报表、推送数据,出现重复执行,导致数据重复。
第一类问题本质是底层资源抖动,第二类问题是依赖服务不稳定性,第三类问题则是缺少幂等和重试控制。这三类问题恰好覆盖了前面讲的三个核心设计点:重试策略、幂等机制、补偿兜底。
6.2 重试与补偿的落地配置
针对上述问题,我们做了如下设计。
同步查询接口方面。对网络异常、连接超时类异常标记为可重试,采用指数退避加抖动策略,最多重试2次。单次查询超时控制在1秒,整体超时预算包含重试时间不超过3秒。同时增加本地熔断器:单实例1分钟失败率超过30%时,快速失败30秒,保护底层查询引擎。
异步任务接口方面。调用方必须携带业务幂等键,格式为场景 + 日期 + 用户ID + 操作类型。服务端用分布式锁加去重表保证同一幂等键只有一个任务在执行。任务提交到RabbitMQ,消费者手动确认,失败消息通过延迟队列重试,最多重试3次。超过3次失败进入死信队列,死信消费者负责记录日志和告警。
数据对账方面。每天凌晨对前一天的任务执行结果和下游实际数据做对账。发现差异自动生成补偿任务,补偿任务本身也有幂等键,避免重复补偿。这套设计看起来不复杂,但每一条都是从线上事故里逼出来的。
6.3 上线后的效果与踩坑记录
这套机制上线后,用户反馈的“查询超时”类投诉下降了大概70%,重复任务几乎消失。但过程中也踩了好几个坑,值得单独说说。
第一个坑是日志里出现大量“重试已触发”告警。排查后发现是重试条件写得过宽,把一次正常的慢查询当成了超时重试,还重试了两次,导致慢查询雪上加霜。后来我们在重试条件里加了“已耗时”的判断:如果一次请求已经处理了太久,就不再重试,直接返回结果,避免把压力再翻倍。
第二个坑是延迟队列的消息积压。RabbitMQ延迟队列如果消息量大,且消费者处理能力跟不上,会把后续正常消息也拖慢。解决方法是把延迟重试队列单独部署在一个独立vhost中,并将消费线程池隔离,不让失败重试消息占用主业务队列的消费能力。
第三个坑是对账任务的补偿水位没控制好。某次下游故障恢复后,系统一次性把积压了3个小时的几千条差异数据全部补跑,直接把下游打挂了。后来加了一个补跑速控参数:每分钟最多补跑100条,超出部分下一轮继续。这个参数看起来不起眼,但关键时刻能救命。
7. 最后分享的几个经验判断
如果让我总结这个过程,核心就一句话:重试解决“等一下就好”的问题,补偿解决“已经错了怎么改”的问题,幂等则是两者的安全底座。不要把重试次数调到很大,也不要把补偿做得过于激进,先用日志和监控把失败看清楚,再谈自动化处理。
实际项目中,一个简单的“失败详情页+手动补单按钮”,有时候比精妙的自动补偿算法还管用。我见过太多团队花大力气写自动补偿框架,结果线上真的出事时,连失败原因都定位不到。与其这样,不如先把观测基础打牢,确保每一次失败都能完整记录调用链、请求参数、异常堆栈和当时的系统状态。
另外想提醒一点:重试和补偿机制的参数,包括重试次数、退避间隔、熔断阈值、补偿水位,都需要根据线上数据持续调整。没有一套参数是“一次配置终身适用”的。每过一段时间,翻一翻重试日志、死信队列积压情况、对账差异趋势,你会发现自己对系统稳定性的理解会深很多。这比任何框架和中间件都重要。
