金融行业聊大数据架构,绕不开两件事:风控和实时分析。风控管的是每一笔交易、每一次授信、每一个动作背后到底安不安全;实时分析管的是业务指标是不是健康、用户行为有什么变化、系统链条有没有异常。过去这两件事经常是分开建设的——风控走规则引擎加离线特征库,分析走另一套数仓管道,各干各的。但业务跑久了你会发现,这两个系统吃的其实是同一份数据,依赖的其实是同一套实时计算能力,硬拆成两摊,浪费资源不说,风控缺了分析支撑看不到策略效果,分析缺了风控事件源头也说不清业务风险。
我最近刚帮一家持牌金融公司梳理完他们的大数据架构,核心目标就是把实时风控和实时分析放在同一套体系里去设计。这篇文章把整个架构的拆解思路、技术选型权衡、核心链路实现细节、以及线上踩过的坑完整记录下来。如果你是做大数据平台、实时数仓或者金融风控系统开发的,可以参考这里面的方案直接落地。
1. 内容整体设计与思路拆解:为什么实时风控和实时分析必须放在一起设计
1.1 分开建设带来的三个后遗症
我这些年见过不少金融团队,风控和分析平台是两拨人建的。风控那边搞了一套 Flink 实时特征计算,专门服务决策引擎;分析那边又搞了一套实时数仓,专门给运营和风控看板供数。表面上各司其职,实际跑起来全是问题。
第一是数据口径对不上。风控算的“当日新客交易量”和分析平台算的“当天新客交易笔数”经常不是一个数,因为两套链路对“新客”的定义窗口、去重逻辑、时间字段取法都不同。业务方来问数据为什么对不齐,两边开发互相扯皮,甚至得出“实时数据本来就不准”这种结论。第二是资源重复耗费。两套链路都要从消息队列消费同一份交易事件,都要做清洗和加工,集群算力、存储、运维人力各烧一份,成本直接翻倍。第三是策略迭代看不到效果。风控规则上线了一段时间,策略同学想知道命中率变化、误伤率多少、新规则相比旧规则有没有改善,结果分析平台根本没接风控的原始决策日志,只能临时离线导数据,一搞就是两三天。
最关键的还不是这些工程问题,而是业务机会的错失。风控本质上是一个决策系统,它每天都在生成大量“拒绝”和“放行”的信号;分析系统负责的是洞察,能把“哪些策略导致误拒”“哪些客群风险在抬升”“哪些渠道在集中攻防”这类规律挖出来。这两件事没有闭环,风控就是盲人摸象,分析就是无源之水。
所以现在金融行业做架构,已经很少讲“把风控算力和分析算力分开扩容”了,而是在一个统一的数据底盘上,让实时计算产出的结果既服务决策引擎的毫秒级查询,又落到分析引擎里服务秒级到分钟级的洞察。实时性分等级,数据只有一份。
1.2 用“两条数据出口,一张统一底盘”来破局
架构的第一步永远是分清楚责任边界。我们最终采用的方案,思路可以用一句话讲清:业务事件从接入到存储只走一条链路,计算层按照数据时效和服务类型拆成两个出口——一个出口是毫秒级风控决策服务,另一个出口是秒级实时分析和指标服务。
这样做带来的直接收益是:原始数据只采集一次、只清洗一次、标准化一次。风控要用的特征和分析要用的指标,在实时计算引擎里做统一加工;加工结果里的明细和中间过程写进可服务化的在线存储给风控查,同时写入 OLAP 引擎给分析查。风控决策日志和特征快照回写数仓之后,分析平台能直接基于真实决策事件做质量评估和策略调优,两边不但不打架,还自然形成了一条数据回路。
选型上,我们没有搞复杂的网格架构或者微服务大拆分,第一版就是经典五层:
- 接入层:负责各类业务事件接入、校验、格式统一
- 传输层:以 Kafka 为核心的消息中枢,解耦生产端和消费端
- 计算层:Flink 承担实时清洗、特征加工、规则匹配和指标计算
- 存储层:按访问模式拆成在线 KV、实时分析型 OLAP、离线数仓三个子层
- 服务层:对业务输出决策结果、名单服务、指标服务、标签服务
整体看会有人觉得这不够“AI”或者不够前沿,但金融场景里比追逐新技术更重要的,是每个组件都有明确的位置,每一条数据都能被追踪和回放。体系稳了,后面的复杂策略才有生长的土壤。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 实时风控链路的三个核心设计细节
2.1 事件标准化的坑:字段不统一比数据慢更致命
风控链路里第一个容易翻车的环节,不在计算引擎,而在接入。金融业务的入口太多了:App、小程序、H5、开放接口、线下POS、合作方渠道,每个渠道埋点上报的事件结构千奇百怪。App 里叫 userId 的字段,小程序里叫 uid;下单金额有的是分,有的是元,有的甚至是带两位小数的字符串。如果这些脏数据直接进 Flink 做特征计算,后面每一层都要补救,成本指数级上升。
我们在接入层专门加了一个标准化服务,做四件事:格式解析、单位换算、字段映射、基础校验。这个环节不做太重的加工,只保证输出的事件是“干净的、语义一致的、可追溯的”。字段语义定义放在统一的 Schema Registry 里,事件进入 Kafka 之前就用 Protobuf 序列化,消费端拿到的是强类型对象,而不是一个到处要判断 null 的 JSON。
这个设计解决了一个很实际的问题:风控特征需要汇总用户跨渠道的行为,如果渠道之间的字段语义没有对齐,特征算出来就是错的。举个例子,用户在 App 上下单金额单位是分,在小程序上是元,如果不做换算,直接把两个金额加起来算“当日累计交易金额”,数字会被放大一百倍,风控模型的阈值就会彻底失真。资金类场景对单位的敏感度极高,这类问题我见过不止一次。
2.2 实时特征加工:窗口是财务级别的时间语义,不是随便开个窗
实时风控最核心的工程量集中在特征加工层。我们需要在百毫秒内回答:这个用户过去5分钟的累计交易金额是多少、过去1小时登录设备数有几台、这张卡过去24小时在多少个不同商户消费过、这个设备ID在过去7天关联过多少个账户。这些就是所谓风控特征,它们直接喂给策略引擎和模型评分。
Flink 里做这类聚合最常用的是滑动窗口。这里的一个关键教训是“窗口长度和业务语义必须严格绑定,时间字段必须统一”。金融业务的时间至少分成事件时间、入库时间和业务时间三个,我们要算“过去5分钟交易金额”时,到底以哪个时间为准?如果以服务器收到事件的入库时间为准,网络抖动导致延迟到达的事件会被划进错误窗口,风控特征就被污染了。
我们统一使用业务侧时间戳作为事件时间,在 Flink 里用 Watermark 机制处理乱序问题。具体的 Watermark 延迟策略不是拍脑袋定的,我们统计了线上事件从业务发生到进入 Kafka 的延迟分布,发现绝大多数事件在2秒内能到达,但网络抖动会带来少量超过3秒的迟到数据。最终 Watermark 设置为延迟3秒,同时启动侧输出流把迟到超过3秒的事件单独记录,用于离线补算和监控迟到比例。这么设定的原因是:延迟设太小会误伤正常到达的事件导致聚合结果偏低,设太大会让风控决策等待过久,拖慢整条链路的响应时间。
特征加工还有一个状态管理问题。风控场景里7天、30天这类长窗口聚合很常见,Flink 的 Keyed State 要保留大量用户中间状态,我们用的是 RocksDB 状态后端,配合合理的 TTL 清理,避免状态无限膨胀把磁盘打爆。RocksDB 在金融场景几乎成了标配,核心原因是窗口状态动辄几十个 GB,纯内存堆根本顶不住,而 RocksDB 在磁盘和内存之间做了分层,尽管读写性能不如纯内存,但在可控的吞吐下稳定性更有保障。
2.3 决策与名单服务:快之外还得可控、可回放
特征算出来后,紧接着要过决策引擎。第一版我们尝试直接在 Flink 里把所有策略规则跑完,让 Flink 承担规则计算,这样做的好处是省了一次网络调用,延迟最低。但上线后很快发现维护成本极高:风控策略同学每次调一个规则阈值都要改 Flink 代码重新发布作业,发布期间 job 重启会导致状态恢复、数据堆积,近线指标一路告警。
后来把规则层从计算引擎里抽离了出来,Flink 负责产出标准化的特征向量并发送给决策引擎服务,决策引擎按规则树完成命中判断,把决策结果写回 Kafka。规则引擎支持热更新和灰度发布,策略同学改阈值不需要再惊动实时作业。付出的代价是多了一次 RPC 调用,但换来的是策略更新分钟级生效,再也不用为改参数重启 Flink。
业务方对实时风控还有一个不容易满足的诉求:可回放。为什么这个用户被拒了?决策依据是什么?上游特征在那一刻是多少?为了支持回放,我们要求特征向量在决策完成后连同决策结果一起落盘到分析存储,每一笔被拒绝的交易都能查到“决策明细”。这个能力在实际运营里价值非常大——客诉来了、监管来问、策略复盘,全都靠这个明细而不是靠拍脑袋解释。
3. 实时分析链路与架构落地实战
3.1 实时数仓怎么搭才不抢风控的资源
前面讲的分析链路如果要和风控共享一份数据,实时数仓的资源隔离必须设计好,否则会拖垮在线决策。我们把同一个 Flink 集群按作业组拆成两类 Slot 管理池:在线风控作业独占一部分 TaskManager,实时分析作业跑在另一部分。两类作业之间的资源物理隔离,避免分析作业的反压把风控任务拖死。
物理隔离听起来简单,实施方案里有很多细节。第一,YARN 或 K8s 上要给两类作业配置不同的资源队列,设置硬性上限,分析作业再缺资源也不能抢占风控队列。第二,Flink 作业的并行度不能拍脑瓜定,要按真实吞吐和单并行处理能力来预算。我们统计过,一台8核16G的 TaskManager 跑特征聚合作业,单并行大约能稳定扛住每秒3000条事件处理,如果双11这类流量是平时的10倍,就必须在流量预估的基础上预留1.5倍余量来配置并行度。第三,Kafka Topic 也要按数据用途拆分,秒级实时指标消费的是明细 Topic,风控消费的是同一份原始业务事件 Topic,两者物理分开,但数据可以从一个源头复制,避免消费相互影响。
实时分析链路我们采用的是“实时明细 + 多模态 OLAP”结构。Flink 清洗后的明细数据实时写入 StarRocks(也对比过 Doris),这套 OLAP 引擎同时支持明细查询和聚合查询,可以在秒级响应多维分析的请求。我们没一开始就奔着 ClickHouse 去,核心原因在于金融场景有着大量 Join、去重和点查需求,StarRocks 这类引擎的原生主键模型和 Update 能力更贴近我们的使用方式。
3.2 实时指标服务和链路延迟监控
分析链路建好后,下一步是建指标服务。我们自己封装了一个指标配置平台,业务方可以在上面定义指标:口径说明、聚合维度、时间周期、数据来源。每次指标发布,平台自动生成 Flink SQL 作业并下发到计算集群,指标结果写入 OLAP。这样业务同学做运营看板时不必每个需求都排队等开发,有了配置化生成的能力,一个指标从提出到上线从三天缩短到半小时。
链路延迟监控是我们在实战中被逼出来的模块。实时链路对延迟的要求是“端到端要在秒级”,但分布式环境下很容易出现某个环节悄悄变慢。我们建立了一套端到端延迟追踪:在原始事件里注入一个生产时间戳,Flink 算子接收到后计算当前时间与生产时间的差值,把延迟分布实时上报到监控系统。当 p99 延迟超过告警阈值比如10秒,系统自动标记这条链路“数据可能滞后”,指标服务返回结果时同时带上数据新鲜度标签。这样做的好处是,风控的分析看板永远知道当前看到的数据有多新鲜,不会拿过期数据做判断,这一点在风险波动期间尤其重要。
3.3 一套集群物理部署的容量预估参考
架构定完,实际操作时最容易被挑战的问题是:到底要多少节点?这个问题的回答必须依赖业务量级的估算而不是拍脑袋。下面是一个可供参考的容量推演思路。
我们先盘点峰值业务事件量。这里假设业务峰值每秒产生 50,000 条交易相关事件,每条消息平均大小 1KB,则 Kafka 的峰值写入吞吐是 50MB/s,考虑副本因子3和一定的余量,Kafka 集群的磁盘吞吐不能低于 300MB/s,实际SSD阵列完全可以满足。如果每条消息要保留7天,一天86400秒,7天数据量约 50MB/s * 86400 * 7 ≈ 30TB,Kafka 存储节点需要规划至少40TB可用容量并预留30%缓冲。
Flink 集群的资源取决于计算复杂度。我们以特征聚合作业为例,单并行度稳定处理 3000 events/s,50,000 events/s 的峰值至少需要17个并行度,但风控的特征计算往往不只是简单 count,还有去重、关联、多窗口聚合,CPU 开销会翻倍。按3倍复杂度系数计算,约需50个并行度,对应在8核16G的 TaskManager 上大概需要 6~7 台机器,再叠加分析作业的资源,一个日活千万级的金融应用,实时计算层大约需要15台左右的中高配物理机或同等规格的云主机。即便你的量级不同,这个方法可以直接复用:先统计峰值事件量,再实测单并行处理能力,乘以复杂度系数,最后按峰值流量1.5倍余量扩容。
还有一个容易漏掉的容量项是 OLAP 存储。实时数仓如果要保存30天明细,需要按“日新增明细条数 × 单条数据大小 × 30天”估算,再考虑索引和副本开销通常要乘以2到3倍。我在实际规划时发现很多团队的 OLAP 磁盘预算总是少算,原因就是没算进去主键索引和二级索引的额外开销。
4. 风控与实时分析的闭环实践:从离线回测到策略调优
4.1 为什么说闭环能力才是整套架构的隐藏价值
风控系统上线后,团队很快发现一个瓶颈:策略能不能上、要不要调,不能只靠“感觉”或者线下 Excel 分析,必须有一套高效的“回测—评估—上线—再评估”机制。而这套机制依赖的能力,恰恰是前面统一数据底盘给出来的——既要有历史的完整决策明细,又要有快速的批量计算能力,还要能模拟“如果当时用了新策略,结果会怎样”。
没有闭环,策略同学就只能做“事后诸葛亮”。新规则想上线,最怕的是上线之后误伤了一大片正常用户,交易量掉了,客诉爆了,才慌忙回滚。有了离线回测引擎之后,我们可以在历史数据上直接跑新策略,对比新旧策略的命中率、挽回金额、误伤单量,把风险和收益都量化出来,再决定是否灰度上线。
4.2 策略回测跑批的实现要点
回测引擎的数据基础是我们在第三节末尾专门强调的“决策明细表”,里面存了每笔交易在决策那一刻的全部特征值、规则版本号和最终决策结果。回测的基本思路很简单:用新的策略逻辑,读取历史特征向量,重新做一次判断,然后和旧的决策结果进行比较。
但简单背后也藏着两个麻烦。第一是样本偏差。历史数据中的“通过”单量包含了一些当时没有特征、放行后被证实是欺诈的案例,但这些案例并不会在拿到特征之后自己冒出来,需要外部数据补充标记,比如事后逾期、退款、申诉、黑名单命中记录。我们在决策明细表里专门留了“事后结果”字段,用离线的延时任务把“事后才知道的结果”回填进来,这样回测样本才完整。第二是计算效率。回测要跑过去30天的全部决策数据,往往几亿到几十亿条。我们用 Spark 做批量回测,而不是把这种大计算量丢给 Flink 实时链路。原因很明确:回测是人发起的一次性分析任务,不希望它抢占实时资源,而 Spark 的离线批处理在这种“全量扫描 + 逻辑重放”的场景下吞吐远高于流式计算。调度上每天凌晨自动跑一次全量回测,策略评审需要时也可以手动触发。
4.3 策略上线后的实时评估看板
新策略灰度上线之后,怎么快速判断它到底好不好?这里就用到了实时分析链路提供的秒级指标能力。我们把策略命中、放行、拒绝这些关键事件实时写入分析引擎,在 Grafana 上建了一个策略监控看板,核心指标包括:每分钟规则命中量、拒绝率变化、系统超时率、以及被拒绝用户的后续行为(是否转向其他渠道、是否发起申诉)。
有一次新上线的一条反欺诈规则在10分钟内把某个正常渠道的拒绝率从2%拉到了15%,原因是一个共享设备特征在特定机型上误报很高。因为实时看板观察得足够快,我们在20分钟内就完成了规则调整和重新发布,把这个风险摁在了萌芽期。这种速度在传统的离线分析时代不可想象——没准要等第二天看日报才会发现,那时候用户投诉已经涌进来了。
5. 常见问题与排查技巧实录:线上踩坑笔记
5.1 实时作业常见问题速查表
这几类问题是 Flink 实时链路跑久了最常遇到的,我整理了一张速查表,方便直接对照排查。
| 症状 | 可能原因 | 排查命令/手段 | 解决方案 |
|---|---|---|---|
| 数据延迟持续上涨,Kafka 消费 lag 越来越大 | Source 并行度不足或反压导致消费能力跟不上 | 查看 Flink 的反压监控,确认瓶颈算子 | 增加 Source 和窗口算子并行度,优化单并行处理逻辑 |
| 聚合结果明显偏小 | Watermark 配置过小,大量事件被丢弃 | 查看 Watermark 监控和迟到事件数量 | 调大 Watermark 延迟,核对时间字段语义 |
| 作业频繁进行 Checkpoint 失败 | 状态后端 RocksDB 写入超时或磁盘性能不足 | 看 Checkpoint 失败日志,确认是超时还是磁盘容量 | 扩容磁盘,调大 checkpoint 超时时间,检查是否有大 key 热点 |
| 决策服务超时,导致 Flink 侧等待 | 在线 KV 存储热点 key 集中访问,单分片过载 | 看 Redis/内存 Grid 的热点 key 监测 | 给热点 key 增加本地缓存,设计 key 分片散列策略 |
| OLAP 查询在高峰期变慢 | 实时导入任务和查询任务争抢 IO/CPU | 查看 OLAP 引擎的导入队列和查询耗时 | 导入限流,把大批量导入错峰到业务低峰期 |
| 数据显示金额明显不合理 | 单位未做统一换算就入了数仓 | 检查标准化层日志,做字段值分布监控 | 在接入标准化层做字段强校验,设置单位白名单 |
5.2 案例:某次反压导致风控特征滞后的事件复盘
有一次线上大促,交易流量在10分钟内暴增到平时的8倍,风控特征链路的数据延迟从正常的2秒一路飙升到了30秒。刚开始我们以为是 Flink 作业资源不够,直接扩容了 TaskManager,结果发现流水恢复得并不理想。
排查过程是这样的:先看 Flink UI 的 BackPressure(反压)监控,发现并不是某个算子打满CPU,而是 Kafka Topic 的某个分区数据堆积得非常严重。再用命令行查消费组的 lag,发现所有 lag 都集中在同一个 partition 上,其他 partition 都是空的。这就很说明问题了——上游的生产端在某些逻辑下把同一类事件的 key 全部路由到了同一分区,比如某个热门活动 ID 相关的交易都带同一个 key,在 topic 只有一个活动 ID 维度时会产生典型的热分区问题。
当时的解决办法分两步走:临时方案是把 Flink 消费端的 isolation 逻辑调整,对这类热点 key 做加盐处理,把同一活动的事件打散到多个分区处理,但这里有个小坑——如果按风控特征必须按用户维度聚合,是不能简单加盐的,否则同一个用户的事件会进入不同的并发实例导致聚合结果缺失。所以我们加盐只针对不按用户聚合的分析类作业,风控特征作业则通过并行度上调加动态负载均衡来缓解。长期方案是推动上游在业务事件里增加一个分区键规范,避免单热点 key 压垮某个分区。
5.3 时间语义导致分析口径错乱的经典坑
另一次比较隐蔽的问题是:实时看板和离线看板的“今日交易额”差了3%。两边的 SQL 逻辑里对时间的处理不一样。实时链路用的是业务事件时间,离线链路默认用了数据入库的 etl 时间。凌晨12点到1点之间产生的交易,因为实时链路存在延迟,有一些会被划到“昨天”的窗口里,离线链路则是事件第二天入库后统一算在“今天”导致两边永远有差异。
这个问题的本质不是实时引擎不准,而是时间字段语义没有对齐。我们后来做了统一定义:所有指标层计算默认使用“业务发生时间”,离线链路在 ETL 阶段也统一把 etl 时间替换为业务时间字段作为分区依据。同时在指标平台里给每个指标打了一个“时间口径”标签,分析人员创建报表时必须选择口径,前端展示自动带上口径注释。那次之后,实时离线数据对不齐的投诉几乎清零了。
6. 一些想单独拎出来说的实操心得
架构落地过程中,有几点是我个人特别想对后来者强调的。
第一,实时风控的“快”,不只是集群算得快,更依赖数据从接入、清洗、特征加工到决策服务的全链路编排紧凑。很多团队的第一版都会在无谓的地方浪费时间,比如在 Flink 作业里写一堆正则解析、频繁访问外部数据库做维表关联,这些都会显著拖慢吞吐。我的经验是把一切可以预计算的维表尽量加载到本地缓存,把 JSON 解析这类重活前移到接入层处理完。
第二,监控体系要比业务先跑起来。不要等链路出了大问题再补监控,那是拿生产当实验场。至少要有三张监控面板:数据接入量和延迟面板、Flink 作业健康面板(反压、Checkpoint、状态大小)、最终数据消费和指标新鲜度面板。把这三张面板做到大屏上,实时链路出了任何风吹草动,值班同学都能第一时间定位到大致方向。
第三,架构设计要允许“不那么完美”的中间态。我们最早设计时也纠结要不要一步到位上 K8s 容器化、要不要把 OLAP 扩展到湖仓一体,后来发现很多“高端能力”在小规模场景下根本用不起来,反而增加了运维复杂度。先在物理机或虚机上把小流量跑通,验证计算逻辑和业务价值,再逐步演进部署形态,这个节奏对金融团队来说更稳。
第四,千万别忽略数据权限和审计。金融系统的数据链路是强监管的对象,每一张表的访问、每一次查询、每一笔决策日志的改动都要有审计记录。我们最后的架构里,从 Kafka 到 OLAP 每一层都挂了数据流向记录,哪条数据从哪个业务系统来、经过了哪些加工步骤、被哪些服务消费过,全部可追溯。这个能力平时不显眼,但监管进场或者内部审计时能救命。
第五,冷热数据分离比大多数团队想象得更有价值。实时分析关注最近几小时到几天的数据,历史数据被访问的概率随时间快速衰减。我们把热数据放在 StarRocks 里提供秒级查询,冷数据定期转存到普通对象存储加离线数仓,显著控制了存储成本。金融行业的数据合规保存期限往往很长,半年、一年甚至更久,如果不做冷热分离,存储成本会随着业务增长变成一个越来越沉重的包袱。
7. 最后再分享一个落地时的“小窍门”
在整套架构具体实施时有一个非常容易被低估的动作,却为后续省下了大量麻烦——就是投入人力把每个业务事件的字段字典、指标口径和样例数据整理成文档并做成在线可检索的“数据地图”。相比代码本身,口径混乱才是最隐蔽的架构债。这个数据地图在我们团队内部的使用频率极高,不管是新同学上手、跨团队协作,还是排查数据质疑,都不用找人问东问西,自己打开地图一查便知。做实时数据平台做到后面,你会发现最大的瓶颈往往不是框架性能,而是团队对数据本身理解的统一程度。架构给了大家一套共用的骨架,而数据地图是让所有人在同一套语义里协作的黏合剂,这笔投入无论何时做都值得。
