趁着CPP-Summit-2022的热度,我终于把Curve分布式存储的源码和设计文档又系统过了一遍。上一篇聊了Curve的整体三组件划分——Client、MDS、ChunkServer各自管什么,以及一条IO请求大体怎么走通。当时很多地方是"哦原来如此"的程度,这篇续篇我想专门聊几个"看文档时觉得懂了、实际捋代码才发现理解太粗"的点:复制组到底怎么落地、ChunkServer内部那条IO流水线的真实顺序、快照克隆为什么能秒级完成,以及CurveFS在文件语义下做了哪些和块存储不一样的取舍。这些内容更适合已经听过Curve总体介绍、想往数据面和控制面深挖的人。
1. 复制组不是"挂几个副本"那么简单
1.1 Curve的资源拓扑:Pool、Zone、Server如何决定故障域
先补一个上一篇没展开的背景。CurveBS把底层机器按照"Pool -> Zone -> Server"三层组织。Pool是一组机器的逻辑集合,可以理解成一个存储池;Pool里面再按机架或者机房维度切成Zone;每个Zone下面才是真正的Server节点。这个拓扑不是随便分的,它直接决定了副本放置策略能有多安全。
一个卷会被切成很多个Chunk,每个Chunk的多个副本会被调度到不同的Zone。为什么要这么倔?因为Zone在这里就是故障域。如果一个Zone整体掉电或者网络隔离,只有这个Zone上的副本会一起挂掉,其他Zone的副本还能保证数据不丢、服务不中断。如果副本都在同一个机架,一台交换机挂了就全部完蛋,那分布式存储的高可用就成笑话了。
实际看代码的时候,你会发现在创建卷、扩容、副本重分配这些路径上,到处都在查拓扑信息和Zone的分布。这也是Curve的MDS核心逻辑之一:不是有地方放就行,而是要放到故障域允许的位置。对比一些简单的"一致性哈希+自动迁移"方案,Curve这种带拓扑感知的放置策略更接近生产级存储的要求,代价是MDS的调度逻辑复杂度上了一个台阶。
注意:Curve里的Zone概念和公有云可用区不完全一样,它的粒度更小,一般对应一个机架或一个独立的网络/电源边界。学习源码时别用云厂商的AZ概念去套,容易把自己绕晕。
1.2 每个复制组都是一个独立的Raft状态机
CurveBS的ChunkServer上并不是"挂了三块盘就完事",而是每个Chunk都会和一个复制组绑定。这个复制组本质上是一个独立的Raft状态机,有自己的日志、自己的快照、自己的选举周期。ChunkServer相当于同时管理着几百上千个这样的小状态机。
这里有个很重要的设计意图:把故障爆炸半径缩小到Chunk级别。如果一个Chunk的复制组发生脑裂或者日志落后,受影响的只有这一个复制组的数据,而不是整个节点。很多分布式存储会把复制粒度放在"节点"甚至"整个集群"上,那样一个小故障就得全集群抖动。Curve选择在Chunk级别做Raft,换来了更好的隔离性,但代价是ChunkServer内部的并发管理变得极其复杂——这也是为什么我在读ChunkServer代码时花了大量时间在状态机调度和线程池模型上。
代码层面,ChunkServer用的是基于braft的Raft实现。braft本身是成熟库,真正需要自己操心的是三件事:
- 日志落到本地怎么组织,WAL文件怎么切分和垃圾回收;
- 快照怎么生成、传到新节点后怎么恢复;
- 一个ChunkServer内大量复制组共享线程池时,怎么避免互相饿死。
这三件事在Curve里都有专门模块,建议读源码时先看snapshot和log两个目录,比直接看Raft选举逻辑更直观。
1.3 一致性读与写:Quorum怎么影响可用性
Curve的3副本复制组,写入至少要等2个副本确认才向客户端返回成功,读取走Leader。这是标准的Raft Quorum模型:3副本允许1个副本故障而不丢数据,写操作在2个确认后就算提交。
我在学习时一度困惑:读为什么不能走从副本?明明从副本也有数据。后来想明白了——如果读从副本,就得处理副本间数据同步的时延。用户刚写完马上读,如果读到的是旧数据,这在存储系统里是不可接受的。Curve选择让读都走Leader,换来的是"线性一致性"这个强保证,对应用层特别友好,尤其是数据库这类对一致性敏感的负载。
代价也明显:Leader承担了所有读流量,压力比从节点大得多。所以Curve在MDS调度时会尽量让Leader分散到不同机器上,避免热点集中。这一点看源码时可以在MDS的调度策略里找到相关逻辑。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 一次写请求在ChunkServer里到底做了什么
2.1 从Client到ChunkServer:请求是怎么被路由的
一次写入请求从应用层发出来,先到达Curve Client。Client不是简单地随机找一台机器发请求,它要先查"这个Chunk的Leader在哪里"。这个信息来自MDS,Client会缓存一份元数据在本地,并且监听变更通知。
所以整个路由过程是:
- 应用发IO到Curve Client;
- Client根据文件偏移量算出对应的Chunk ID;
- Client查本地缓存的Chunk -> ChunkServer映射表;
- 拿到Leader的地址后,直接发送写请求到对应的ChunkServer。
这里面最容易出问题的就是缓存失效。比如Chunk发生了迁移或者副本重建,Client的缓存还是旧的,请求就会失败。Curve的处理方式是:请求失败后Client会主动刷新元数据再重试,同时对关键请求做超时控制。这个"缓存加失效重试"的模式在分布式系统中太常见了,Curve用得很克制,没有为了减少MDS压力而牺牲正确性。
看源码时建议先看client目录的IO请求封装,你会发现它把"定位Chunk"和"真正发IO"拆成了两个清晰阶段,这对理解整个IO路径帮助很大。
2.2 ChunkServer内部的执行流水线
写请求到达ChunkServer后,就不是"收到包就往磁盘写"这么简单了。ChunkServer内部大致经历这几个环节:
- 请求解析:从BRPC的协议层把写请求解出来;
- Chunk定位:根据请求里的Chunk ID找到本地对应的Chunk存储实例;
- 写入Raft日志:把写操作追加到Raft日志里,并复制到从节点;
- 应用日志到Chunk文件:在多数派确认后,把写操作真正应用到本地的Chunk文件上;
- 返回响应:把结果返回给Client。
这里最影响性能的地方是Raft日志复制和磁盘刷盘。braft的日志写入会经过本地文件系统,Curve针对这个环节做了不少优化,比如日志的批量写、缓存调度等。
我在捋代码时最大的感受是:Curve的ChunkServer不是"收到一条处理一条",而是尽力把并发的IO请求在状态机层面排队、合并、批量处理。这样做的好处是磁盘IO效率高,但坏处是代码里的异步回调和状态流转特别多,新手容易看迷路。我的建议是跟着一条写请求的返回路径去读,从WriteChunk这个入口进去,把每个回调函数都标出来,跑完一遍就有了整体印象。
2.3 为什么Curve把刷盘时机设计得这么保守
不少存储系统为了性能会用"先写缓存、后台异步刷盘"的策略。Curve在这方面明显偏向可靠性:写请求要等到足够多的副本确认,并且本地落盘后才返回成功。这意味着单次写入的时延里包含了两到三次磁盘IO开销。
有朋友问过我:Curve这样设计是不是性能吃亏?答案是对,但这是存储系统必须做的取舍。异步刷盘在掉电时会丢数据,这在块存储场景是致命的。Curve面向的很多场景都是数据库、虚拟化这类对数据安全要求极高的业务,宁多等几个毫秒,也不能让用户的数据在掉电后凭空消失。
当然,Curve在"保守"的同时做了不少补偿。比如通过批量合并写入来摊薄刷盘成本,比如让Raft日志走独立的快速设备,再比如精细控制Chunk文件的预分配策略。读代码时你会看到,Curve在IO路径上几乎每一步都在做"尽力批量化"的尝试。性能优化不是靠某一个黑魔法,而是把这些小优化叠加起来。
3. 快照与克隆:让我绕了很久的延迟分配逻辑
3.1 快照不是另存一份:COW背后的双层映射
Curve的块存储支持快照,具体机制是COW(写时复制)。当时我看文档上写着"COW"两个字,心想这不就是快照时复制一份数据吗?直到读了代码才发现完全不是。
快照并不是真的立刻把数据复制一份,而是记录一个"时间点的逻辑视图"。Curve用双层映射来实现这个效果:Chunk文件本身有一层地址映射,快照再叠加一层映射。当快照产生后,新的写请求会先拷贝原数据到快照空间,然后再写入新数据。这样原始数据在快照时刻的内容得以保留,而新数据写到新位置。这样做的好处是快照创建几乎瞬间完成,不需要暂停业务,也不需要提前复制大量数据。
和"全量复制"相比,COW的差异在数据量大的场景极其明显。一个1TB的卷做快照,如果是全量复制,得等十几分钟甚至更久;COW模式下,快照动作本身秒级完成,真正的数据复制是随着后续每次写入慢慢发生的。
理解这个机制的关键是要抛弃"快照=备份"的惯性思维。快照更准确的说法是"某个时刻的一致性视图",它在很多场景下承担的是"可回滚的版本节点",而不是"异地灾备"。Curve的文档和源码里也是这个口径。
3.2 克隆卷的"秒级创建"是怎么做到的
克隆卷是我学Curve时觉得最惊艳的模块。传统存储克隆一个1TB的卷,意味着要真正复制1TB数据。Curve的克隆卷用的是延迟分配的思路:创建的时候只是建立了"源卷快照 -> 克隆卷"的映射关系,并没有立刻复制任何数据。
那克隆卷上的数据从哪来?答案是三部分:
- 克隆卷自己新写入的数据,写在自己的Chunk上;
- 没有新写入的数据,读取时从源快照对应位置读取;
- 源快照发生变化时,需要特殊处理,避免影响克隆卷。
这种设计让克隆卷在创建时几乎是瞬间完成,无论源卷多大。数据真正的复制会发生在后台,或者在读路径上触发。这非常契合容器化和云原生场景:一个业务要开100个测试环境,每个环境需要一份数据库盘,用克隆卷几秒钟就能全部创建好,而不需要等待100份数据全部复制完。
注意:克隆卷依赖源快照的可用性。如果源快照被删除了,克隆卷就会出问题。Curve有专门的处理机制来管理克隆卷和源快照的生命周期依赖,实际操作中千万不要随意删源卷快照。
3.3 容错与恢复:克隆链上的数据依赖
克隆卷可以继续做快照、继续克隆,这样就会形成一条"克隆链"。链上的每个节点都依赖前面的节点。这条链在正常运行时是透明的,用户感知不到,但它对系统维护提出了一个要求:任何一个中间节点损坏,都会影响后面所有节点。
Curve在处理这个链条时,不是简单把链扫一遍,而是采用分层修复策略。后台会定期检查克隆依赖,如果发现某一层的副本数不足,会在有冗余的节点上重建副本。同时,如果某个快照已经没有任何克隆依赖,系统可以安全回收,释放存储空间。
我在读这部分代码时最大的收获是理解了"元数据即真相"。克隆链上的数据依赖合不合理,排查问题时不能只看数据块在哪,更要看元数据里的依赖关系。这条链在Curve的元数据里有完整的记录,也是MDS调度恢复任务时的重要依据。
4. CurveFS:当同一套设计理念迁移到文件语义
4.1 Fuse接入与元数据分片
CurveFS是Curve体系里的文件存储产品,和CurveBS的块存储走的是完全不同的协议层,但底层的分布式存储理念是一样的:都有Client、都有元数据集群、都有多副本数据面。
访问方式上,CurveFS通过FUSE挂载成目录,用户像使用本地文件系统一样使用它。这个接入层的好处是兼容性好,不需要改应用代码;代价是FUSE本身有性能开销,读路径上多了一层内核态和用户态的切换。Curve的做法是把FUSE这一层的开销尽量压小,把更多的优化放到后端IO路径上。
元数据这块,CurveFS没有沿用CurveBS那套卷模型,而是引入了目录树和文件系统的元数据语义。它把元数据做了分片,不同目录区间的元数据由不同的元数据节点负责,这样在超大目录场景下元数据压力可以水平扩展。
我当时对照着CurveBS和CurveFS两份源码看,最大的感觉是:CurveFS更像是"面向文件语义重新设计的第二代表储"——它继承了CurveBS里经过验证的底层能力,比如复制组、快照、克隆,但同时在上层重新设计了元数据管理和IO逻辑。
4.2 文件数据在多个ChunkServer上的布局
CurveFS的文件数据和CurveBS的卷数据一样,都会被拆分到多个ChunkServer上。但拆分的依据不同:块存储面对的是固定的卷大小,文件系统面对的是动态增长的文件。
CurveFS把一个文件切成多个"分片"(片段),每个分片有自己的大小和归属关系。随着文件的写入,文件系统会不断向数据层申请新的分片。这种动态分配机制要求Client和元数据集群配合到位,否则就会出现"文件写着写着找不到数据位置"的尴尬。
目录和文件的元数据是分离存储的,这样目录的列举和文件的查找互不干扰。读CurveFS代码时,建议从"文件打开"这个入口入手,一路看到"分片映射"和"数据写入",这条链路走完你就明白文件系统版和块存储版的差异到底在哪了。
4.3 元数据集群的选主与监控
元数据集群是分布式文件系统的核心,CurveFS也选择了Raft来保证元数据的一致性和高可用。元数据节点之间通过选主来提供服务,只有主节点能处理写操作,从节点负责同步和随时顶替。
这里有个容易踩的误区:有人以为元数据集群的写性能也像数据面那样受限于Raft日志复制。但实际上元数据写入量比数据面小得多,重点是保证一致性和低时延。CurveFS在元数据层面做了缓存和批量提交来降低时延,同时用监控机制保障节点状态可见。
我个人的体会是,CurveFS的学习曲线明显比CurveBS陡,因为它涉及文件系统语义和分布式存储两个领域的交叉。如果你是完全零基础,建议先吃透CurveBS的数据面,再来看CurveFS;如果一上来就啃文件系统,很容易被目录树、权限、软链这些概念淹没。
5. 读Curve源码时,值得留意的C++工程细节
5.1 模块边界:一个repo里怎么同时管BS和FS
Curve的源码仓库把CurveBS和CurveFS放在同一个工程里,但模块边界切得非常清楚。common、client、mds、chunkserver这些目录都有明确的职责划分,BS和FS共用一部分底层工具,但在业务逻辑上互不干扰。
这种组织方式对阅读者非常友好,因为你可以只挑其中一个产品线的代码读。我当时是先用chunkserver把数据面主链路读完,再回到mds读调度逻辑,最后才碰CurveFS,顺序对了就省了很多力气。
另外一个值得学习的地方是Curve大量使用了protobuf定义接口。无论Client和Server之间,还是内部模块之间,通信协议都有清晰的proto定义。阅读时优先看proto文件,能快速掌握数据结构和接口边界,比埋头看cpp实现效率高得多。
5.2 日志、监控和调试:真正帮到我的工具链
C++分布式系统调试起来很痛苦,但Curve继承了brpc的成熟机制,所以一些功能直接白嫖。比如bvar监控指标,你在ChunkServer的web页面上能看到各种IO的实时统计;再比如内置的rpcz和bthread调度信息,能帮你定位在哪个线程上卡住了。
我在学习时遇到一个副本同步延迟很高的问题,当时没有直接看业务代码,而是先看bvar里的Raft日志同步指标,确认是网络层抖动还是日志落盘慢,再做针对性排查。这个习惯帮我节省了大量时间。
建议先花半小时学会用brpc自带的监控页面,再开始啃代码。你会惊讶地发现,很多"代码哪里有问题"的疑问,其实在监控指标里已经写好了答案。
5.3 建议的源码阅读路线
如果让我给一个自己摸索出来的阅读顺序,大概是这样的:
- 先读proto文件,搞清楚Client、MDS、ChunkServer之间的接口长什么样;
- 再读chunkserver的IO主链路,从请求入口到Raft日志到落盘;
- 回头读mds的调度逻辑,重点看Chunk分配和副本放置;
- 之后看快照和克隆相关代码,配合文档理解COW和延迟分配;
- 最后才碰CurveFS,因为文件语义会让复杂度上一个台阶。
每一步都要配合写笔记和画简化时序图(自己手画就行),只读代码不画图的话,在三四个模块之后就会迷失方向。这套方法我自己测试下来有效,尤其适合那些"文档看懂了但代码读不下去"的人。
最后再分享一个小技巧:Curve的代码更新比较活跃,读的时候一定要锚定一个release tag,不要跟着master走。跟随master读代码容易发现昨天的理解和今天的实现对不上,白白浪费排查精力。定在一个稳定版本上,把整个版本吃透,再去看后续新增的commit,效果会好很多。
