这几年我接手了不少短剧源码项目,团队背景从几个人到几十人的都有,最后发现大家在技术选型上踩的坑惊人一致:业务方总以为“短剧App加小程序双端”只是把同一套接口同时开放给两端调用,等上线进入晚高峰,才发现问题从CDN回源、微服务调用链到小程序包体积全部挤在一起爆发。更麻烦的是,短剧本身就是一种强运营驱动的业务,爆款剧集上新那几分钟的播放请求量,能把按常规估算配的机器瞬间打满。
这篇文章不聊花哨的概念,把我实际搭建、调优、压测过程中沉淀下来的一整套双端架构设计思路完整拆开。涉及微服务如何划边界、App和小程序如何共用核心服务、CDN加速怎么和播放鉴权配合、高并发播放链路从点击到首帧的每一步怎么优化。适合正在用短剧源码做双端产品、或者打算把单体播放系统重构为微服务架构的技术负责人阅读。
1. 短剧业务对后端架构的真实压迫:为什么通用微服务模板套不进去
很多人误以为短剧无非就是“视频版小说”,后端做几个增删改查接口就行。真做进项目才会发现,短剧的数据模型和用户访问特征,跟传统视频平台差异很大,直接套网上那种通用的微服务电商模板,后期会非常难受。
1.1 短剧数据模型不是“视频列表”那么简单
短剧的核心数据维度至少有五个:版权与分销体系、剧集单元状态、用户解锁进度、多码率文件索引、运营位与推荐权重。
版权与分销这一项就够复杂的。同一部短剧在不同渠道、不同区域、不同时间段,可能对应完全不同的授权范围和价格策略。同一个用户在小程序端看到的付费价格和App端可能不同,分销渠道商的分成比例也可能不同。这些维度如果不在一开始的数据模型里设计好,后期每加一个渠道就要改一次表结构。
剧集单元状态也不是简单的“上架/下架”。一部短剧通常几十集,每一集都有自己的免费/付费状态,还有单集购买、整剧打包、限时免费、会员专享等多种解锁方式。用户的解锁记录既要支持查询,又要支持支付回调后的实时更新,这直接关系到播放接口的返回值。
用户进度体系更是个高频操作点。用户看到第几集、是否看过、看到第几分几秒,这些数据需要快速写入和读取。短剧用户的习惯是“刷完一集马上点下一集”,进度接口的QPS会非常高。
再加上多码率与清晰度,每集通常有流畅、高清、超清等版本,不同码率文件在CDN上的路径不同,播放器需要根据用户网络环境自动选择。
这些维度叠加在一起后,一个单纯的“获取剧集详情”接口,响应体很容易膨胀到几十个字段。单体架构下这些数据还能勉强放在一起查,但高并发场景下,列表查询、缓存重建、支付回调、播放鉴权全部争抢同一个数据库连接池,迟早会出事。
1.2 用户访问的“脉冲式”并发特征
短剧用户的行为模式相当特殊。长视频平台的用户访问相对均匀,晚高峰虽然高一些,但不会出现极端毛刺。短剧则完全不是这样,用户从短视频信息流里看到切片,被钩子吸引后跳转进入小程序或App,整个流程可以在几秒内完成。
这意味着用户进来后的第一屏往往就是播放页,而不是像长视频那样先逛逛首页、看看详情。于是网关、剧集详情、播放鉴权、CDN边缘节点在同一个秒级窗口被集中打到。做压测时经常出现这种情况:平均QPS看着只有两三千,但瞬时峰值能冲到上万,数据库连接池在几秒内被打满。
应对这种脉冲式流量,靠单纯加机器效果很差,因为机器是均匀承载的,而流量是突发的。架构上必须提前做好限流、缓存、异步削峰,还要让播放鉴权这类高QPS服务能独立扩容。
1.3 先分清楚这三个问题,再谈微服务拆分
在动手拆服务之前,我习惯先用三个问题过一遍所有业务模块:
第一,读写比例和并发模型是否差异很大?比如剧集列表是高读低写,订单支付是低读高写,用户进度是极高写。混在一起时,一个高频读接口就把数据库连接池占满了,写请求只能排队。
第二,变更频率能否独立?运营后台的上下架操作每周都在变,播放鉴权核心逻辑可能几个月不变。如果两者在同一个服务里,每次改运营配置都要重新发布播放服务,风险很大。
第三,有没有独立的存储边界?用户数据、订单数据、剧集数据,各自有各自的存储和访问特征,拆开之后才能独立优化,比如订单库用事务,剧集库做读写分离,进度数据直接走缓存加异步落库。
这三个问题过完,哪些模块必须拆、哪些模块可以先留在单体里,基本就清楚了。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 微服务拆分的边界:七个核心服务的划分逻辑与通信方案
短剧源码项目的微服务拆分,我见过两种极端:一种是完全没有拆分,所有逻辑放在一个大单体里,后期改一处崩全站;另一种是过度拆分,一个用户量不大的项目拆了二十多个服务,每次联调光接口对齐就要半天。合理的做法是介于两者之间,把真正有独立伸缩需求的模块拆出来。
2.1 七个核心服务的职责划分
在我实践过且线上跑得比较稳定的短剧后端架构中,核心服务可以拆成以下七个:
| 服务名称 | 核心职责 | 存储选型 | 并发特征 |
|---|---|---|---|
| 用户服务 | 注册登录、会员状态、账号体系 | MySQL + Redis | 中等读写 |
| 内容服务 | 剧集信息、上下架、搜索推荐 | MySQL + Redis + ES | 高读低写 |
| 播放授权服务 | 校验播放资格、签发播放凭证 | Redis + MySQL | 极高读 |
| 订单支付服务 | 下单、支付回调、退款、分销结算 | MySQL(强事务) | 低读高写 |
| 用户进度服务 | 进度上报、断点续播 | Redis + 时序存储 | 极高写 |
| 消息通知服务 | 推送、短信、站内信 | MQ + MySQL | 异步削峰 |
| 管理后台服务 | 运营配置、数据报表 | MySQL | 低频内网 |
这套划分的核心逻辑,是把“读”与“写”彻底分开,让播放鉴权这类极高QPS的服务可以独立扩容,而不会拖累订单这类必须强一致的服务。内容服务和数据缓存独立后,CDN预热、运营上下架也不会互相干扰。
实际落地时,内容服务往往还要再细分出推荐和搜索,但在早期阶段,一个内容服务配合Redis缓存和ES索引完全够用。
2.2 播放授权服务为什么一定要独立
在所有服务里,播放授权服务是最容易被低估、但也是最值得独立的一个。
播放授权服务的核心职责只有两件事:校验当前用户是否有权限观看某一集,以及签发一个带时效的播放凭证。这个凭证会拼接上CDN鉴权参数,生成最终的播放地址。
为什么必须独立?因为它的调用频率是所有服务里最高的。用户每次点击播放都要先请求授权,而短剧用户一晚能刷几十集,相当于一个用户一晚上就会触发几十次授权请求。这个QPS天然比其他服务高一个数量级。
更关键的是,授权服务的逻辑相对稳定,不需要频繁发版。把它独立出来之后,即使订单服务因为支付渠道调整要紧急发布,播放授权服务也完全不受影响,用户播放链路不会中断。这一点在线上出现故障时价值极大。
2.3 服务间通信:同步调用控制在两级以内,其余走异步
服务拆分后,通信方案是第一个坑。我见过不少团队直接用HTTP同步调用串联全部业务,导致一次播放请求要经过网关、用户服务、内容服务、订单服务四层同步调用,链路一长,RT直接飙升。
最终沉淀的方案是两条原则:
同步接口只用在必需实时返回的场景。比如播放授权校验,用户点了播放,必须立刻告诉他能不能看,这种场景必须同步调用。
非实时操作全部走MQ异步削峰。比如订单支付回调后更新解锁状态、播放行为埋点、消息推送,这些操作延迟几秒用户完全感知不到,没必要阻塞主链路。
服务间调用用OpenFeign或gRPC,但链路必须控制在两级以内。超过两级就要考虑合并接口或者异步化。我在项目里给团队定的死规矩是:网关到业务服务到基础服务,最多三层,超过三层的一律重构。
2.4 分布式事务别上重方案,本地消息表足够
短剧项目里最核心的强一致场景就一个:支付回调后给用户解锁剧集。这个场景在微服务架构下跨了订单服务和播放授权服务,但如果因此引入Seata之类的全局分布式事务框架,性价比很低。
我们用本地消息表加MQ重试就解决了。订单服务收到支付回调后,在本地事务里同时更新订单状态并写入一条“解锁事件”消息表,然后通过MQ把事件发出去。内容服务和播放授权服务各自消费消息,更新用户购买记录,刷新权限缓存。
最终一致性的窗口控制在几秒内,用户根本感知不到。而且这种方式对数据库的压力远小于全局事务,不会在高并发下成为瓶颈。
这里要特别提醒一个容易忽略的问题:MQ消息一定要做幂等处理。支付回调、解锁事件都可能因为网络原因被重复投递,消费方要根据业务唯一键做去重,否则用户可能被重复扣费或者重复解锁。
服务拆分后链路变长,链路追踪必须跟上。我们直接上了OpenTelemetry,所有服务统一注入traceId,通过日志平台可以一键查看一次播放请求经过的完整链路。排查慢请求的时候,这个能力能救命的。
3. 双端架构分层:App与小程序共用一套核心服务,差异收在接入层
App和小程序双端共用一套后端,这是常规操作,但很多项目“共用”得过于粗暴,把小程序端的特殊逻辑直接塞进业务代码里,导致服务端到处都是appId判断。合理的做法是让业务服务保持平台无关,把双端差异收在API网关和接入层。
3.1 API网关如何同时服务App与小程序
网关是整个双端架构的第一道入口,也最适合承接平台差异。
客户端请求进来时,在Header里带上平台标识,比如X-Client-Type: app或X-Client-Type: mini_app,以及版本号。网关层统一解析认证信息,把用户身份转换为统一的用户ID后,再透传给下游业务服务。业务服务永远只认用户ID,不关心请求来自哪个端。
这样设计的好处是,App端用token认证,小程序端用wx.login换取session,两套认证逻辑全部收在网关层。业务服务不需要知道微信的session_key是什么,也不需要在代码里集成微信SDK。
同时,网关层可以做双端差异化配置,比如App端允许更长的超时时间,小程序端因为包体积和启动速度的限制,接口返回字段可以裁剪。这些差异都在网关层通过Filter过滤字段,业务服务完全无感。
3.2 小程序登录态与App登录态的生命周期差异
小程序登录态是整个双端项目里最容易出错的地方,原因在于微信的session_key生命周期和App的access_token完全不同。
App的token常用过期时间加刷新机制来控制,客户端可以比较从容地在过期前续期。小程序的session_key则是微信服务端下发的会话密钥,它不会主动通知业务服务过期,但客户端如果长时间未调用wx.login,后台的openid和session_key关联可能已经失效。
实战中的稳妥做法是:小程序端每次冷启动时静默调用wx.login换取code,再把code传给业务服务,业务服务通过微信接口换取openid和新的会话密钥,并刷新本地缓存。这个过程要做到用户无感知,不能让用户看视频看到一半被强制弹登录框。
另外,小程序的支付能力受微信虚拟支付规则限制,短剧这种虚拟内容在小程序端不能直接用微信支付。很多团队的做法是:小程序端只做浏览和免费集播放,付费解锁引导用户跳转App完成。架构上这意味着小程序端的播放鉴权逻辑里要额外判断用户是否具备解锁资格,没有资格就提示跳App,而不是返回支付单。这个逻辑要放在接入层处理,不能污染核心播放链路。
3.3 端上播放器差异与CDN地址生成策略
App端和小程序端的播放能力差异很大,根源在播放器。
App端可以用系统播放器、IJKPlayer或者ExoPlayer,支持预加载、倍速播放、后台音频播放、多音轨切换。小程序端只能用微信自带的video组件,很多能力受限,只能通过封面图、清晰度切换和播放进度管理来贴近体验。
在CDN播放地址生成上,我们需要同时考虑两端的差异。我做项目时常用的策略是:API接口根据用户网络类型返回合适的清晰度地址,App端可以返回一组不同清晰度的HLS地址,播放器根据当前码率自适应切换;小程序端则直接返回对应的MP4地址(如果是iOS)或HLS地址,因为video组件对HLS兼容性更好。
这里要特别注意URL长度。CDN鉴权参数加多个清晰度地址拼接后,URL可能很长,小程序端有些机型对URL长度有限制,出现过播放器解析失败的情况。后来我们把播放地址做了短链映射,授权服务生成的播放地址存在Redis里,返回一个短ID,播放器再通过短ID换取真实地址,问题就解决了。
3.4 双端发布节奏与版本兼容
App审核周期比小程序长得多,这是双端架构绕不开的现实问题。
小程序可能今天提交明天就过审,App可能要等一周甚至更久。这导致运营活动的接口必须兼容新老版本。我的做法是在网关层做版本路由,同一个接口可以同时存在v1和v2,旧版本App继续用v1,小程序和新版App用v2。旧版本下沉一段时间,等旧App活跃度降到阈值以下再下线。
另外,小程序端的缓存和包版本管理也要单独处理。微信小程序的缓存更新策略是启动时异步拉取最新版本,如果用户还在旧版本里,后端接口已经返回了新数据结构,就可能出现渲染异常。所以小程序的接口返回值要严格保持向后兼容,新增字段不能破坏已有字段。
4. CDN加速实践:从源站到边缘节点的内容分发链路
短剧的播放体验,说白了就是CDN体验。后端接口做得再好,播放地址解析慢、边缘节点命中率低、回源带宽被打满,用户侧的感受就是“打开就转圈”。这一节把我在短剧项目里用到的CDN加速策略完整展开。
4.1 短剧播放的核心CDN指标
衡量短剧CDN加速效果,我一般盯四个指标:
首帧时间,从点击播放到画面出现第一帧,正常应该控制在1秒以内。超过2秒用户流失率会显著上升。
卡顿率,播放过程中出现缓冲的次数占总播放次数的比例,短剧目标控制在2%以下。
回源率,边缘节点没有命中缓存、需要回源站拉取数据的请求比例,理想状态是低于5%。
下载速度,尤其是高清码率文件的下载速度,要保证用户带宽能够支撑播放器持续拉流。
短剧视频单体文件通常不大,一集几十MB,但数量多、热度集中。爆款剧集上线首日,同一个文件的请求量可能达到百万级,这对CDN的边缘命中率要求很高。
4.2 视频预热与预调度:让热点集提前到达边缘
CDN的缓存机制是被动的,用户第一次请求某个文件时,边缘节点才会回源拉取。对爆款短剧来说,等用户来触发回源已经晚了,第一波用户全在等待回源,体验必然崩。
解决方法是主动预热。运营后台有一个“剧目上新”的功能,编辑录入新剧信息时,可以选择“立即预热”或者“定时预热”。系统会提前把这部剧所有集数的所有码率文件URL批量提交给CDN服务商的刷新预热接口,让边缘节点提前拉取文件到本地。
预调度这块还要考虑地域差异。短剧的用户集中在哪些省份、哪些运营商,可以从播放日志里统计出来。每天凌晨跑一次数据任务,把次日预计热门的剧集文件按地域分布预热到对应的边缘节点集群,可以大幅降低回源率。
4.3 防盗链与URL鉴权:CDN层如何配合播放授权
CDN加速和播放鉴权必须配合使用,否则会被盗链打到破产。短剧的付费内容如果直接返回可公开访问的MP4地址,被爬虫抓走后就彻底失控了。
我的做法是:播放授权服务校验通过后,生成一个带CDN鉴权参数的播放地址。CDN厂商一般都提供URL鉴权功能,常见的是在URL后面拼接过期时间和签名。签名规则是服务器端用密钥对路径和过期时间做哈希,CDN边缘节点校验签名合法且未过期才返回内容。
这里有个关键细节:CDN鉴权URL的有效期不能太长。我一般设置成20到30分钟,因为短剧用户看完一集后通常马上看下一集,下一集会重新请求授权服务获取新的播放地址。有效期太长的话,链接被分享出去后长时间有效;太短的话,用户播放中间暂停时间长了,重新播放时地址过期,体验很差。
另外,App端和小程序端的鉴权参数生成规则可以共用一个签名算法,但密钥要区分。两套密钥分别配在CDN侧,如果某个端出现泄露,可以单独更换而不影响另一端。
4.4 缓存命中率优化与Range回源控制
CDN命中率上不去,最常见的两个原因:一是URL参数过多导致缓存键过于碎片化,二是文件名没有规范版本化。
URL参数方面,播放地址后面如果带了一堆source=xxx&channel=yyy之类的参数,CDN会认为这是不同的文件,导致同一个视频被缓存多份,命中率下降。解决方案是在网关层做参数归一化,只保留CDN鉴权必需的两个参数,其他参数全部去掉。
Range回源是个容易忽略的细节。播放器拉流通常不是一次请求整个文件,而是按字节范围请求。CDN边缘节点如果缓存了整个文件,Range请求可以直接命中;如果边缘节点没有缓存,回源时会带着Range头回源,源站需要支持Range回源,否则会返回整个文件导致带宽浪费。这个要提前跟源站服务确认,Nginx源站配置里加一句proxy_force_ranges on就能解决大多数问题。
源站带宽的冗余也要规划好。CDN回源带宽是源站的直接压力,即使回源率控制在5%,晚高峰的播放量如果到达百万级,回源带宽也可能打到几个Gbps。源站最好至少保留峰值带宽的1.5倍冗余,同时接入云服务商的免费流量封顶保障,防止异常流量把源站打死。
5. 高并发播放链路优化:从点击到首帧的每一步怎么抠
高并发播放体验是最终验收标准。架构拆得再好、CDN配得再精,如果播放点击到首帧的链路上有一个环节没有优化到位,用户感知就会被无限放大。这一节完整拆解播放请求的调用链,以及我在限流、降级、压测中积累的关键经验。
5.1 播放请求从进入到首帧的完整链路
一次正常的播放请求会经历以下步骤:
用户点击播放后,App或小程序携带用户凭证和剧集ID请求播放授权接口。这个请求到达API网关,网关完成认证和参数校验,转发给播放授权服务。播放授权服务校验用户是否有权限观看该集,然后向CDN服务商发送调度请求,选择最近的边缘节点,并生成带鉴权参数的播放地址。播放器拿到地址后,请求CDN边缘节点,边缘节点校验鉴权,返回视频分片,首帧出现。
这里链路上的每一步都有优化空间。
网关层最容易成为瓶颈,因为所有流量都经过这里。网关线程池大小、连接超时时间、读超时时间都要单独调优。更关键的是,播放授权接口在网关层的超时设置要短,不能让线程卡在等待下游响应上。我一般设置成500毫秒超时,超过就快速失败,返回提示让用户重试。
播放授权服务本身要全部走缓存。用户的权限状态、剧集的解锁规则,这些数据变化频率很低,完全可以做到只查Redis不查数据库。只有当缓存不存在时才回源数据库加载,并回填缓存。这样授权接口的P99延迟可以控制在十毫秒级别。
CDN调度环节也要快。授权服务生成播放地址时,尽量避免在业务代码里远程调用CDN厂商的API获取边缘节点,因为那会增加几十毫秒延迟。更好的做法是在本地记录最近一次调度的边缘节点域名,直接用这个域名去拼接播放地址,如果播放失败再由播放器走容错逻辑切换节点。
5.2 限流与降级:边缘与业务侧的双保险
高并发播放场景,限流和降级方案必须在线上提前演练过,否则出事的时候根本来不及反应。
业务侧我用Sentinel做接口维度的限流。播放授权接口按用户维度做滑动窗口限流,一个用户每分钟最多只能请求120次,超过就直接拒绝。剧集详情接口按服务维度限流,保护后端数据库不被异常流量打爆。网关层再做一层全局限流,每秒超过预估QPS的1.5倍就返回“系统繁忙”提示,让用户稍后重试。
CDN侧也要做防护,带宽封顶和QPS封顶都要配置。云CDN服务商基本都支持,设置一个峰值带宽阈值,超过后边缘节点直接拒绝新增播放请求,保护源站和整体服务。这个阈值要留有余量,否则晚高峰流量抖动时容易误伤正常用户。
降级方案同样重要。播放授权服务依赖Redis时,如果Redis集群故障,不能直接让整个播放链路挂掉。降级策略是:缓存不可用时,暂时允许所有已登录用户播放免费集,付费集则退回数据库校验。这样虽然数据库压力会增大,但至少核心播放体验不会完全中断。
5.3 压测时的真实瓶颈:一次追查数据库连接池的完整过程
分享一次印象很深的压测排查。当时压测场景是模拟晚高峰5000用户同时在线、每秒产生2000次播放授权请求。开始压测后,发现授权接口的P99延迟从20毫秒飙升到2秒,错误率也在不断攀升。
一开始怀疑是Redis的问题,因为授权服务主要依赖Redis。检查Redis监控后,发现CPU和延迟都很正常,内存也足够。随后看日志,发现大量请求在等待获取数据库连接。问题来了,明明授权服务只查Redis不查数据库,为什么会有数据库压力?
后来定位到原因:授权服务内部有一个定时任务,每隔30秒批量刷新一次权限配置到本地缓存。这个定时任务会扫表查询,把数据库连接池瞬间占满。正常情况下这没问题,但压测并发打上来后,定时任务的查询和授权服务的并发请求争抢同一个连接池,导致部分请求阻塞等待。
修复方案很简单:授权服务的数据刷新改走订阅消息,数据库的变更通过消息队列通知授权服务,而不是让授权服务主动扫表。同时把连接池改小,给核心业务预留资源。改动后重新压测,授权接口P99稳定在15毫秒左右。
这个案例说明一个道理:很多时候瓶颈不在核心代码,而在容易忽略的“边角任务”。排查高并发问题,要习惯性检查定时任务、监控采集、日志上报这些隐藏流量来源。
5.4 高并发播放的避坑清单
最后整理一个关键避坑清单,都是我踩过后才总结出来的:
- 播放授权URL一定要短,避免加太多追踪参数,短链映射是可靠的第二层方案。
- 所有关键接口的Redis操作要设置合理的超时时间,不能用默认值,否则Redis慢查询会拖垮整个线程池。
- 播放器拉流失败后要设计重试机制,但重试次数不能过多,否则会成为雪崩放大器。我的做法是最多重试一次,间隔3秒。
- CDN鉴权URL的签名密钥要定期轮换,并提前在CDN控制台配置好新旧密钥同时生效的过渡期。
- 监控告警要覆盖播放授权成功率、首帧时间、回源率、边缘节点带宽这几个黄金指标,任何一个指标异常都要在5分钟内通知到人。
- 限流触发时不要只返回错误码,要返回可读的提示文案,客户端根据文案决定是提示用户还是自动转降级模式。
压测过程中发现,真实用户体验不仅仅取决于后端延迟,很多时候取决于本地网络到边缘节点的质量。所以客户端播放器最好做多CDN容灾,同一个剧集文件在A、B两个CDN服务商都有分发,播放失败时自动切到备用域名。这个能力要在播放器SDK层面支持,后端只负责下发多个播放地址。
测试过程中还有一个容易被忽略的细节,就是小程序的video组件对HLS的支持在安卓和iOS上表现不同,安卓部分机型对HLS分片的预加载特别敏感。最终我们针对小程序端做了码率降级策略,在网络差的时候优先返回低码率MP4地址,而不是高码率的HLS,首帧速度明显改善。
短剧源码双端架构的设计,本质上是一个“识别问题边界再匹配技术方案”的过程。每个团队的业务体量和并发规模不同,不必照搬全部模块,但微服务的边界划分、双端差异的收敛位置、CDN与鉴权的配合机制、高并发链路的压测验证,这四件事在任何一套短剧系统里都是躲不开的。把这些关键决策想清楚,后续扩容和迭代都会顺很多。
