国庆前一周,我接手了一个旅游平台的稳定性复盘任务。大促流量一上来,搜索接口的CPU先被打满,紧接着下单超时,支付回调因为数据库连接池耗尽被丢弃,最后运营那边拿着Excel对着订单和供应商确认单逐条核对,整整对了三天。
这个场景,做过旅游平台的人都懂。机票、酒店、门票这种资源型产品,不是电商里那种可以随时补货的标品,高峰期每一个库存的扣减、每一笔订单的状态流转、每一次支付回调的确认,都精准地卡在系统的关键路径上。后来我们花了近一年时间,把单体应用拆成了基于微服务架构的旅游服务平台,整个过程踩了不少坑,也总结了一套可以直接复用的方法论。
这篇文章不是教科书式的架构科普,而是从实际业务出发,讲清楚旅游平台为什么要拆、怎么拆、拆完以后基础设施怎么搭、预订链路的数据一致性怎么做,以及最容易被忽视的落地陷阱。如果你正在做旅游、出行、票务这类资源型交易平台,或者打算把现有单体系统向微服务演进,这篇内容应该能帮你省下不少试错成本。
1. 旅游平台从单体走向微服务的真实驱动
1.1 旅游业务的复杂度,不是普通电商能比的
很多人觉得旅游平台就是“卖货的”,把商品上架、用户下单、支付发货这套电商逻辑搬过来就行。真做过就会发现,旅游业务的复杂度比普通电商高出一个量级。
第一是资源的不可复制性。一个航班的经济舱座位就那么多,一个酒店在某个日期段的房间就那么多,一个景区一天的票就那么多。卖超了就是重大客诉,卖少了就是收益损失,这要求系统在库存控制上必须有非常精确的手段。而普通电商的SKU,理论上库存可以随时补。
第二是产品的动态组合。旅游产品不是单一标品,“机+酒”“机+X”“多目的地连线”这类产品,是在用户查询的瞬间,由不同的资源提供商实时计算价格和可用性得出的。这个计算过程涉及机票舱位价格、酒店房态、优惠策略等多个系统的联动。
第三是供应链层级复杂。直采资源、批发商资源、代理商转售、分销渠道,同一个资源在不同渠道上可能有不同的价格和确认规则。一个订单背后可能关联着多个供应商的确认状态,有的实时确认,有的需要人工二次确认。
这些业务特征叠加在一起,导致系统的逻辑复杂度天然很高。而当业务规模还没起来的时候,把所有逻辑写在一个单体应用里,反而是最高效的选择。这是我们团队早期的状态:一个Spring Boot工程,几个核心模块,数据库三张主表,部署简单,发布方便。
1.2 单体系统扛不住的高峰与团队瓶颈
业务量上来以后,单体架构的问题就开始集中暴露。
最直观的是资源竞争。搜索服务是读多写少的典型场景,大促时搜索QPS翻几十倍,搜索线程把CPU和内存吃满,GC频繁,同一进程里的下单和支付逻辑也被拖慢。更麻烦的是数据库连接池,搜索查询把连接池占满之后,订单写入就拿不到连接,直接导致下单失败。
第二个问题是发布效率。几十个开发者在同一个代码仓库里协作,一个订单模块的改动要等搜索模块的代码一起回归测试。任何一个不起眼的改动都可能影响全局,发布窗口只能安排在凌晨,出问题还要全团队一起回滚。
第三个问题是故障爆炸半径大。一个模块的内存泄漏,可以把整个进程搞挂,所有业务全部瘫痪。真实发生过一次:某个供应商接口的响应超时时间设置不当,HTTP客户端线程被占满,结果整个平台的API全部不可用。
还有一个隐性问题:技术栈被锁死。单体应用里所有模块必须用同一套语言和框架,但实际的团队里,有人擅长Java,有人更熟Go,还有些算法同学想用Python做推荐和价格预测。单体架构下这些都没法落地。
1.3 微服务给旅游平台带来了什么
拆成微服务之后,收益是很直接的。
首先是独立扩容。搜索服务可以单独部署几十个实例扛大促流量,订单服务保持正常水位即可,不需要为了搜索的峰值把整个单体横向扩展。资源型平台的流量峰值往往集中在搜索和详情查询,独立扩容带来的成本节约非常明显。
然后是故障隔离。搜索服务挂了,用户最多是搜不到产品,但已经下单的订单流程、支付回调还能正常走。这个隔离效果,在大促期间救过我们很多次。
更重要的是团队自治。每个服务由一个小团队独立负责,独立发布、独立迭代、独立做技术选型。订单团队可以专注优化状态机逻辑,搜索团队可以引入ES和向量检索,支付团队可以把资金安全放在第一位,互不拖累。
所以微服务架构对旅游平台来说,不只是技术上的“流行做法”,而是业务复杂度、团队规模、流量特征共同逼出来的选择。但它也不是银弹,拆分之后的基础设施建设、数据一致性处理、团队协作模式,每一步都有新的挑战。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 服务拆分的底层逻辑:旅游平台的服务地图怎么画
2.1 先划分业务能力,再谈服务边界
我见过很多团队一上来就按“功能模块”拆服务:用户模块拆一个用户服务,订单模块拆一个订单服务,支付模块拆一个支付服务。这种拆法往往拆完就后悔,因为功能模块和业务域之间并不能直接画等号。
更合理的思路,是用DDD(领域驱动设计)里的限界上下文概念来指导拆分。
简单来说,限界上下文就是“一个业务概念在特定场景下的边界”。同样是“酒店”,在搜索场景里它是一个可被检索的商品;在库存场景里它是一组房型和日期的资源;在财务场景里它是一个应收应付的核算对象。概念相同,但关注的属性和行为完全不同。把这些不同场景的数据和逻辑硬塞进一个服务里,就是耦合的根源。
所以第一步应该是梳理业务能力地图。把旅游平台的核心业务领域画出来,找出每个领域里有独立的生命周期、独立的数据归属、独立的变化频率的业务单元。这些单元,才是服务拆分的候选边界。
还需要识别业务之间的协作方式。搜索域需要商品域的索引数据,但它不应该直接去查商品库,而是通过商品服务提供的接口或者订阅商品变更事件来同步数据。订单域需要锁定库存,但它不应该直接操作库存表,而是调用库存服务的接口。依赖是单向的,数据是私有的,这是服务边界成立的底线。
2.2 一张能落地的旅游平台服务清单
以我们最终沉淀下来的服务地图为例,可以给你一个参考。这张图覆盖了C端用户从搜索到出行后评价的全流程,也覆盖了运营和供应商管理的核心场景。
| 服务 | 核心职责 | 关键数据/能力 |
|---|---|---|
| 用户服务 | 用户注册、登录、实名认证、账户信息 | 用户基本信息、账号体系、登录态 |
| 资源/商品服务 | 维护机酒门票等资源的基础信息与可售状态 | 产品库、资源实例、供应商映射 |
| 库存服务 | 管理资源实例的库存数量、预占与释放 | 库存流水、预占单、余位快照 |
| 定价服务 | 实时计算各渠道价格、优惠、促销价 | 价格策略、优惠券、促销活动 |
| 搜索服务 | 提供产品搜索、筛选、排序、推荐结果 | 检索索引、搜索日志、热词数据 |
| 订单服务 | 创建订单、状态流转、订单查询 | 订单主单、子单、状态机日志 |
| 支付服务 | 收银台、支付请求、退款处理 | 支付单、退款单、第三方支付流水 |
| 履约服务 | 对接供应商确认、出票/发码、取消 | 确认单、出票记录、供应商回调 |
| 通知服务 | 短信、邮件、App Push、站内信 | 消息模板、发送记录、频控配置 |
| 权益服务 | 优惠券、会员等级、积分资产 | 用户权益账户、券包 |
| 对账服务 | 与供应商、支付渠道、财务系统对账 | 对账单、差异记录、差错处理 |
这张表看起来简单,但每个服务的边界都经过了好几轮博弈。比如定价服务最开始是放在商品服务里的,后来发现价格策略迭代的频率远高于商品基础信息,而且大促时价格计算的流量极高,最终拆成了独立服务。订单和履约也纠结过,后来决定分开,因为支付完成后的履约确认链路很重,可能涉及人工介入,而且需要独立扩展容量。
2.3 边界原则:数据私有、依赖单向、粒度看团队
服务边界定了之后,有三条原则需要死守。
第一条:数据私有。每个服务只能访问自己的数据库表,其他服务的数据一律通过接口或事件获取。我们曾经为了“方便”让订单服务直接读用户服务的用户表,结果用户字段一调整,订单模块跟着挂了。这个教训很惨痛。
第二条:依赖单向。核心交易链路的依赖方向应该是:搜索 → 商品 → 库存 → 订单 → 支付,不能反向。订单服务不应该反过来调用搜索服务去获取产品信息,它需要的数据应该在下单时通过快照方式写入订单表。这些快照数据既保证了订单的可追溯性,也避免了服务间的紧耦合。
第三条:粒度看团队,不看代码量。一个服务不是越小越好。经验值是,一个2到9人的小团队,能独立维护2到5个服务的代码、部署、监控、排障,这个粒度是最舒服的。如果把一个订单系统拆成订单基础、订单流程、订单优惠三个服务,改一个需求跨三个服务、动三个仓库、发三次版本,那只会拖慢自己。
3. 预订链路细节:订单状态机、库存并发与分布式事务
3.1 预订流程拆开看
旅游平台的预订链路,比普通电商的下单链路长得多。普通电商下单之后基本就是支付和发货,而旅游平台要走完这样一长串步骤:
搜索选品 → 商品详情确认 → 填写出行人/联系人信息 → 提交订单(此时要预占库存) → 用户支付 → 平台向供应商下单/请求确认 → 供应商确认资源 → 出票或发送电子凭证 → 后续可能的退改。
每一步都有可能导致状态回退或流程终止,比如用户支付超时、供应商确认失败、库存不足、价格变动。这就要求预订链路在架构设计上不能做成一条“直通管道”,而是要把每个环节的职责和状态变化理清楚。
我们的做法是,把预订链路拆成两个阶段:下单阶段和履约阶段。下单阶段由订单服务和支付服务负责,核心目标是产生一笔合法的、已支付的订单,同时锁定对应的库存。履约阶段由履约服务负责,核心目标是完成供应商侧的确认和出票,并把结果同步回订单服务。两个阶段通过消息队列异步衔接,避免用户在支付完成后还长时间卡在HTTP请求上。
3.2 订单状态机的设计要点
订单状态机是预订链路里最核心的领域模型,它决定了整个系统的可靠性和可追溯性。
我们最终设计的订单状态模型包含这些核心状态:待支付、支付中、已支付/确认中、已确认、出票中、已出票、已取消、退款中、已退款。还有一些中间态,比如“支付回调处理中”“供应商确认超时”等。
状态机设计有三个要点值得分享。
第一,状态流转必须显式定义。哪些状态可以流转到哪些状态,必须写清楚,不允许代码里随便setStatus。我们用的是状态机引擎,把所有的流转规则配置化,每次状态变更都会产生一条状态流转记录,方便审计和问题排查。没有状态机的时候,我们还出现过订单从“已取消”变成“已出票”这种离谱问题,后来查出来是某个接口没有做状态校验。
第二,终态不可逆。已取消、已退款这种终态,不允许任何操作把它们改回去。如果要处理“取消后重新确认”这种特殊场景,正确的做法是生成一笔新订单,而不是把旧订单的状态翻转。
第三,状态机的状态要能覆盖业务的所有分支。比如用户支付成功但供应商确认失败,订单应该走“确认失败待退款”,而不是简单地把状态置为“已取消”。旅游平台涉及的钱和资源,任何一个分支处理不当都会产生资损或客诉。
3.3 资源型库存的并发扣减怎么做
旅游库存和普通电商库存最大的区别在于:它往往是“离散资源”,一个航班就那几个舱位的座位,一个酒店就那几个房型的房间。而且同样的资源在不同渠道、不同价格策略下可能被重复售卖。
库存扣减是高并发场景下最容易出事的地方。我们试过几种方案,各有优劣。
数据库乐观锁是目前最稳妥的兜底方案。给库存表加一个version字段,扣减时执行类似这样的SQL:
sql复制UPDATE stock
SET available_count = available_count - 1, version = version + 1
WHERE resource_id = #{resourceId}
AND available_count > 0
AND version = #{oldVersion}
影响行数大于0说明扣减成功,否则说明库存不足或版本冲突,需要重试或提示用户。这个方案强一致,不会超卖,但在极高并发下性能一般,数据库压力大。
Redis预扣方案是性能优先的选择。先把热门资源的库存预热到Redis,用Lua脚本原子扣减:
lua复制-- KEYS[1] = resource stock key
-- ARGV[1] = quantity
local stock = tonumber(redis.call('GET', KEYS[1]))
if not stock or stock < tonumber(ARGV[1]) then
return -1
end
redis.call('DECRBY', KEYS[1], ARGV[1])
return stock - tonumber(ARGV[1])
这个方案的优点是性能极高,能扛住秒杀级的流量。代价是需要处理Redis和数据库之间的一致性,比如Redis扣减成功但数据库扣减失败,或者Redis宕机丢了库存数据。我们的做法是:Redis只做“预占”,真正扣减时以数据库为准,定期用数据库数据校准Redis库存。
还有一个非常关键的实践:库存扣减一定要放在库存服务内完成,绝对不要把库存表开放给订单服务直接操作。我们的库存服务对外提供“预占库存”“确认扣减”“释放库存”三个接口,订单服务只能通过这三个接口来操作库存。这样库存的一致性和并发控制都收敛在同一个服务里,出了问题也能快速定位。
3.4 分布式事务:能不用就不用,要用就用对
微服务拆分之后,一个业务流程往往会跨越多个服务,这就避不开分布式事务的话题。
先说结论:在预订链路里,我们几乎没有用强一致的分布式事务方案。2PC(两阶段提交)在跨服务、跨数据库的场景下性能损耗太大,协调者本身又是单点,一旦协调者宕机整个事务卡死,这在面向C端的高并发系统里是不可接受的。
我们采用的是“本地消息表 + 消息队列 + 事件驱动”的最终一致性方案。
以支付成功后的履约动作为例:支付服务在本地事务里更新支付单状态,同时写入一条“支付成功事件”到本地消息表,然后异步把消息发到RocketMQ。履约服务消费消息后开始向供应商发起确认。如果履约失败,则通过重试和补偿机制处理。
这个过程有几个关键点。
本地消息表必须和业务操作在同一个数据库事务里。支付单状态更新和消息写入要么同时成功,要么同时失败,这是最终一致性的基础。
消息消费端必须实现幂等。履约有可能会因为网络原因收到重复消息,我们给每条消息设计了一个全局唯一的消息ID,消费端在业务表里记录消费过的消息ID,重复消息直接忽略。
对于实在无法用最终一致性解决的场景,比如用户支付和资金结算,我们引入了对账机制兜底。每天凌晨跑批,把订单系统、支付系统、供应商系统的流水进行核对,发现差异自动告警,由财务和运营人工介入处理。
提示:分布式事务没有银弹。真正可靠的做法是:明确哪些数据必须强一致,哪些可以最终一致,然后把最终一致的路径用消息、重试、幂等、对账四件套来保障。
4. 支撑微服务运转的基础设施选型清单
4.1 注册中心与服务发现:Nacos、Consul 怎么选
微服务架构的第一个基础设施,就是服务注册与发现。服务实例的地址会动态变化,消费者不能硬编码IP,必须通过注册中心来获取可用实例列表。
我们团队当时的备选方案是Nacos、Consul、Eureka三选一。
Eureka稳定性没问题,但2.x版本已经停止开发,1.x版本也基本进入维护状态,新项目不太建议选了。
Consul的优势是数据一致性做得扎实,底层用Raft协议,多数据中心场景下有天然优势,但运维成本偏高,对国内开发者来说文档和社区也相对少一些。
Nacos是阿里开源的服务发现与配置管理平台,支持服务注册发现、配置管理、动态DNS,还自带控制台,中文文档丰富,国内团队上手快。对我们这种以Java技术栈为主的团队来说,选择Nacos算是性价比最高的方案。
注册中心在部署上要注意高可用,至少三节点起步,生产环境不要图省事只部署单机。
4.2 网关统一入口:路由、鉴权、限流
服务拆分后,前端不再直接调用某个后端服务,所有请求统一走API网关。网关承担了三个核心职责:路由转发、统一鉴权、限流熔断。
网关选型我们调研过Spring Cloud Gateway和APISIX,最终选了Spring Cloud Gateway,原因是和Spring生态的融合度好,团队学习成本低,扩展起来也方便。如果对性能和跨语言支持要求更高,APISIX基于OpenResty和长亭,性能更好,也是一个不错的选择。
网关层最容易犯的错误是让网关承载业务逻辑。比如有人会在网关层做订单价格的校验、做复杂的参数拼装。这会让网关变成一个“上帝服务”,改动频繁还会影响全局稳定性。正确的做法是网关只做轻量级的跨横切关注点,路由、鉴权、限流、灰度流量标记;业务逻辑一律放回业务服务。
流量控制是大促期间最重要的一环。我们针对每个下游服务配置了限流规则,按QPS或者并发线程数限制,超出的请求直接返回降级提示,而不是让流量把下游服务打垮。同时给网关配置了超时和重试策略,避免下游服务慢响应导致网关线程池被占满。
4.3 配置中心:环境差异与动态刷新
微服务化之后,服务实例数量大幅增加,配置文件的环境差异和动态变更需求被放大。你不可能在每个实例上去手工改配置然后重启服务。
配置中心我们选的是Nacos Config,因为和Nacos注册中心是同一套产品,省一层维护成本。核心配置项包括:数据库连接串、中间件地址、业务开关、限流阈值、促销活动策略。
这里有一个值得关注的实践:配置中心里的业务开关要设计成动态可刷新的,不需要重启服务就能生效。比如大促期间的某个限流阈值、某个渠道的开关、某个供应商的对接状态,这些配置放在配置中心后,运营可以直接在控制台修改并发布,服务端实时感知。
环境隔离也要做扎实。dev、test、staging、prod四套环境的配置必须用不同的命名空间或分组隔离,避免测试环境误连生产数据库这种低级事故。我们当时就发生过一次测试环境的配置漂移,结果测试数据把生产报表污染了,这个坑后来靠配置中心的权限隔离和审计日志才堵住。
4.4 可观测性:Trace ID、日志、监控告警
微服务架构最大的痛点之一,就是问题排查困难。一个请求跨多个服务,查日志要在N个系统里来回跳,没有全局的调用链视图,排障效率极低。
可观测性建设我们有三个抓手。
全链路追踪。通过接入SkyWalking,为每个请求生成一个全局唯一的Trace ID,从上到下透传到各个服务的日志里。这样按Trace ID搜索,就能把所有环节的日志串联起来,快速定位问题出在哪个服务、耗时在哪里。
统一日志采集。服务实例的日志统一采集到ELK(Elasticsearch、Logstash、Kibana)平台,按服务和Trace ID建索引。排查问题时直接在Kibana里搜索Trace ID,不用挨个服务器去翻日志文件。这一步做与不做,故障平均定位时间差一个数量级。
指标监控与告警。用Prometheus采集各服务的JVM指标、QPS、响应时间、错误率,用Grafana配置可视化大盘。每个服务都设置响应时间P99和错误率的告警规则,指标异常时自动推送告警到值班群。
加入全链路追踪之后,有个细节最值得做:在网关层为每个请求生成Trace ID,并把它返回到前端HTTP响应头里。用户反馈问题的时候,我们只需要问他“麻烦把那条请求的Trace ID发我”,就能直接定位问题,不用再反复询问账号、时间、操作步骤。
5. 旅游平台微服务落地最容易踩的四个坑
5.1 拆分粒度失控
微服务改造最常见的失败模式,是拆分过度。
我见过一个团队,把订单系统拆成了订单基础服务、订单流程服务、订单优惠服务、订单发票服务四个子服务。看起来每个服务职责很清晰,但实际开发中一个订单需求经常要同时改四个服务,联调成本翻了几倍,发布窗口从半小时变成了半天。
服务拆分的本质是为了“独立变化”和“独立扩展”。如果两个模块永远是一起修改、一起部署、一起扩容,那它们就不应该拆成两个服务。一定要记住:模块化单体永远是微服务的备选方案,甚至优先方案。在拆分之前,先把模块边界理清楚,很多系统其实只需要模块化单体就够了。
5.2 共享数据库引发的隐性耦合
拆分服务之后,如果两个服务的数据库还是共用的,那么微服务架构就退化成“分布式单体”。表面上服务是独立的,实际上一个服务的慢SQL会拖垮另一个服务的性能,一个服务的变化会影响另一个服务的表结构。
我们在改造初期就犯过这个错误:订单服务和履约服务共用了一个数据库。结果某个大版本迭代,订单表加了一个索引,锁表时间过长,直接把履约服务的写入操作全堵住了,线上故障持续了半小时。后来我们花了两个迭代把两个数据库拆开,一条一条把跨库的查询迁移成服务间调用。
如果你的系统正在演进,数据库拆分可以分步走:先从逻辑上隔离表,禁止跨服务操作数据表;再逐步把物理库拆分,整个过程用双写和迁移任务保证数据一致。
5.3 分布式事务滥用
有些团队被“分布式事务”这个概念带偏了,遇到跨服务的操作就想上Seata、ServiceComb这类分布式事务中间件。结果事务参与方多了,吞吐量直线下降,可用性也大打折扣。
分布式事务中间件的本质是用锁和协调机制换取强一致,而旅游平台的很多链路并不需要强一致。比如下单时锁定库存、支付成功后再确认履约,这两个步骤之间允许存在一个短暂的不一致窗口。系统需要做的是保证最终一致,而不是在每一步都用分布式事务锁死。
分清“必需”和“非必需”很重要。像扣款、加库存这种资金和资源敏感的操作,必须保证精准;像通知、积分、优惠券发放,允许异步和重试机制。我们的原则是:能异步就异步,能最终一致就不要强一致,必须强一致的场景尽量限制在单一服务内部完成。
5.4 团队组织跟不上架构演进
技术人员容易忽略一个定律:系统的架构最终会和团队的沟通结构趋于一致。如果团队还是按照原来的方式协作,一个跨服务的需求要拉上五个团队排期,微服务不仅不会提升效率,反而会因为增加了额外的接口联调和问题排查成本,让整体效率更低。
所以微服务改造一定要和团队结构调整同步。一个服务就应该由一个跨职能小团队负责,团队成员对这个服务拥有完整的决策权——从需求、开发、测试到上线。没有这一层组织保障,技术架构再先进也是空中楼阁。
我们拆了服务之后,把团队也重组成了“订单组”“支付组”“搜索推荐组”“供应链履约组”这种小分队模式。每个小分队独立维护自己的服务,有自己的一套发布流水线和监控告警。这样服务化才真正提升了交付效率。
6. 单体到微服务的演进路线:分阶段操作建议
6.1 第一阶段:单体内部模块化治理
如果你现在还是一个单体系统,不要急着上微服务。第一步先把单体内部的模块边界理清楚,把代码分层和依赖关系治理好,做到模块之间只能通过接口交互,数据不能跨模块直接访问数据库。这个阶段的目标是让“单体”变得结构清晰、可维护。
同时可以把一些通用的中间件基础设施先建起来,比如统一日志框架、统一的配置管理、统一的安全鉴权。这些基础能力后续微服务化之后可以平滑复用。
6.2 第二阶段:高并发无状态服务独立
在单体内部治理成熟之后,优先把那些高并发、无状态、边界清晰的模块拆分出去。旅游平台里最典型的就是搜索服务和用户服务。搜索是典型的读多写少、无状态场景,用户服务不依赖复杂的业务状态。
这两个服务拆分之后,可以顺利跑通注册中心、网关、配置中心、链路追踪这一整套微服务基础设施。这个过程积累了经验,之后拆更多服务的时候就会从容很多。
6.3 第三阶段:交易链路拆分与消息驱动
交易链路是微服务改造的重头戏,涉及订单、库存、支付、履约这几个核心服务。这个阶段建议引入消息队列,把原来单体内部的同步调用改成异步事件驱动,降低核心链路的耦合度。
这里要特别强调演进顺序:先拆分订单服务,再拆支付服务,然后是库存和履约。每拆一个服务,都要确保这个服务独立之后,整条下单链路能够正常跑通、能够回滚到原单体方案,逐步替换才能控制风险。
6.4 第四阶段:中台沉淀与平台化
当核心服务都拆分稳定之后,就可以开始考虑平台化了。把用户、订单、支付这些通用能力沉淀为中台服务,支撑多个前台业务(C端主站、小程序、企业差旅、分销商渠道)。这样新产品线不需要从零搭建交易链路,直接复用中台能力,大幅降低新业务的启动成本。
这一步需要投入额外的抽象和建模成本,单靠一个业务线的力量很难独立完成,最好是在公司有多条业务线共用这些能力的时候才真正启动。如果只有一个C端主站,平台化的收益有限,不必强求。
6.5 用四个指标验证演进效果
微服务改造最怕“为了拆而拆”,拆完了效果如何,一定要用数据说话。我在实践中重点关注四个指标:
一是需求交付周期。从需求提出到上线的平均周期,改造后应该明显缩短。
二是发布频率。服务拆分后,每个服务的独立发布频率会提升,发布时影响的范围应该变小。
三是核心接口的P99延迟。微服务化后每次请求的链路变长,如果P99延迟反而恶化,说明服务划分或者通信方式有问题,需要及时调整。
四是故障恢复时间。从发现故障到恢复的大致时长,服务化后因为故障隔离和可观测性提升,恢复时间应该大幅缩短。
我自己经历了从单体到微服务的完整过程,最大的体会是:微服务不是终点,而是业务成长到一定阶段后的自然选择。如果你现在还没有到那个阶段,就不要提前引入微服务的复杂度;如果你已经到了那个阶段,那就要坚定地把服务边界、数据一致性、可观测性这些基础问题想清楚再动手。最后分享一个小技巧:在拆分任何服务之前,先把你最痛苦的一个线上问题写下来,等拆完再来验证它是否被解决。如果解决了,说明你拆对了;如果没解决,那先别急着拆下一个。
