有一次我接到线上告警,凌晨的数据分析任务大面积失败,报错信息指向一个字段缺失。查下来发现,上游服务在半夜完成了一次发布,把JSON响应里的某个字段名改了,下游的解析代码还是上个月的旧版本。整条链路拉通花了两个小时,期间所有依赖该数据的报表全部停摆。事后复盘,根子不在“谁改了字段名”,而在于整条数据链路从头到尾都没有认真对待一件事:编码的演进策略。
这个问题,DDIA第三章《编码和演进》讲得非常透彻。但很多读者初看这一章时,容易被“编码”这个词带偏——以为在讲UTF-8、GBK之类的字符编码。其实这里说的是数据序列化:把内存中的对象变成可以存储、传输的字节流,再从字节流还原成对象。JSON、XML、Protobuf、Thrift、Avro,这些格式都属于“编码”的范畴。而“演进”则指:代码不断升级,数据却被长期存储、跨系统流转,新老版本如何同时读写同一份数据而不出错。
这篇文章,我会把这本书第三章的核心脉络拆开,讲清楚编码格式的取舍、兼容性的底层逻辑、不同数据流场景下的演进策略,最后用一个完整的事件模型演进案例,把“旧版代码读新数据”这条链路实际走一遍。不管你是后端开发、数据工程师,还是做基础设施的,这一章都值得反复读,值得在动手设计系统之前就想明白。
1. 同一个词,两种含义:DDIA里的编码到底在讲什么
先把这个概念边界划清楚,不然很多细节都会理解偏。
“编码”在日常开发里通常指字符编码,也就是把文本映射成字节序列的规则,常见的如UTF-8、GBK、ISO-8859-1。处理这类问题,无非是文件乱码、HTTP请求头charset设置、数据库连接串编码参数之类。但DDIA第三章讨论的“encoding”,指的是序列化编码(也叫编解码、marshalling/unmarshalling):把编程语言内存中的结构化数据(对象、结构体、字典)转换成一种通用的、可跨语言读写的字节格式,再在另一端还原成对象。
这两个概念天差地别。字符编码解决的是“字符串怎么变成字节”;序列化编码解决的是“整个对象怎么变成字节”。你可以把字符编码想象成单个字的翻译规则,把序列化编码想象成整篇文章的排版协议——它们处在完全不同的抽象层级。
为什么要关心序列化编码?
因为任何一个“数据密集型应用”,本质上都存在这样一条数据闭环:
code复制内存对象 → 编码 → 写入存储 / 网络传输 → 解码 → 内存对象
这段链路看起来平淡无奇,但它几乎是所有分布式系统的命门。一个Java服务要调一个Python服务,两边内存里的对象模型不一样,必须先把对象“编码”成一种双方都能理解的通用格式。数据要落库、要进消息队列、要同步到数据仓库,每一步都绕不开编码。编码格式的好坏,直接决定了两件事:数据能不能被正确解析,以及当系统升级时,数据还能不能被老版本正确读取。
DDIA的作者Martin Kleppmann把“编码”单独拎出来作为一章,放在“存储与检索”“复制与分区”之后,是有他的用意的。前两章讲的是单机/集群怎么存数据、怎么保证一致,但一旦你开始讨论“分布式”“多地多活”“滚动发布”“数据仓库集成”,问题就不再是“怎么存”,而是“数据从一个系统流向另一个系统时,怎么保证语义不丢失、格式不破裂”。编码就是这个环节的第一道关卡。
很多读者反映这一章不好读,一个原因就在开篇这个概念上。我见过有人用字符编码的思维去理解Avro的schema匹配机制,结果怎么都绕不明白“writer schema”和“reader schema”为什么要分开。所以,读完这一节,你先记住一件事:本文所有“编码”,指的都是“对象→字节”的序列化过程,不是字符集转换。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 兼容性双轴:向后兼容与向前兼容为什么缺一不可
2.1 两个容易搞反的方向
DDIA第三章里最重要的概念,不是什么编码格式的语法细节,而是两个定义:
- 向后兼容(backward compatibility):新代码可以读旧数据。
- 向前兼容(forward compatibility):旧代码可以读新数据。
这两个方向的命名,是以“代码的版本新旧”为参照系的。注意,这里非常容易搞混,我每次带新人都要反复强调:
“向后兼容”看的是代码往后退——代码是新的,数据是旧的,新代码能不能读历史数据。比如你升级了线上服务,数据库里还躺着三年前写入的记录,新版本程序能不能正常读取?这要求新代码认识旧格式。
“向前兼容”看的是代码往前跑——代码是旧的,数据是新的。比如公司做滚动发布,你只升级了10台机器中的3台,那7台旧机器仍然在读写数据。某一台新机器写入了一条带新字段的数据,旧机器读这条数据时能不能顺利跳过那个不认识的新字段,而不是直接崩溃?这要求旧代码容忍未知内容。
用一个生活化类比:向后兼容是“新员工完全看得懂老员工留下的工作文档”;向前兼容是“老员工拿到新员工新格式的文档,虽然有几个新名词看不懂,但也不影响他继续把活儿干完”。数据世界里的现实是:数据的寿命往往比代码长得多。代码可能半年迭代一次,但数据会在数据库、数据仓库、冷备份里躺很多年。所以真正决定一个系统能否安全演进的,不是“新代码能不能读旧数据”这种相对好办的事,而是“被历史代码遗留在数据里的新字段,未来任何一代代码都要能安全跳过”。
2.2 四种读写组合的覆盖矩阵
把写入方和读取方的版本排列组合一下,就能看到兼容性问题的全貌:
| 写入方版本 | 读取方版本 | 需要的性质 | 典型场景 |
|---|---|---|---|
| 旧代码 | 旧代码 | 无需兼容 | 升级前正常运行 |
| 旧代码 | 新代码 | 向后兼容 | 服务升级后读历史数据 |
| 新代码 | 旧代码 | 向前兼容 | 滚动发布中未升级节点读新数据 |
| 新代码 | 新代码 | 无需兼容 | 全量升级完成后 |
绝大多数团队在两个方向上只认真做了“向后兼容”。因为看上去很直观:升级程序时,保证新程序能读老数据不就行了吗?但真实系统从来不是所有节点同一秒升级完成的。发布窗口内,新旧节点并存,同一张表、同一个Topic、同一套接口里,数据可能是旧代码写的,也可能是新代码写的。这时候,任何一边读另一边写的数据,都必须成立。所以DDIA强调:凡是支持“滚动发布”的系统,编码方案必须同时保证向后兼容和向前兼容。
2.3 “忽略未知字段”才是兼容性的地基
向前兼容的实现机制,说穿了就一条:读取方必须能够跳过它不认识的字段。
这句话听起来简单,实际影响却很深。比如JSON和XML这种文本格式,天然具备“跳过未知字段”的能力:解析器碰到不认识的key,一般不会报错,只要你的代码写的是“取我认识的字段,忽略不认识的”,就能往前兼容。但如果你用的是强类型绑定,把JSON直接反序列化成一个严格定义好的类对象,遇到未知字段就抛异常,那JSON的自描述优势就被你亲手掐断了。
二进制编码格式中,这个机制需要刻意设计:
- Thrift和Protobuf通过字段编号(field tag)来标识每个字段。解码时按编号取数据,遇到不知道的编号就直接跳过,因此天然支持向前兼容——前提是编码格式里保存了字段编号。
- Avro则更彻底:读取方根本不需要认识writer schema里的所有字段,它只需要拿着自己的reader schema,按字段名去writer schema里取对应值,取不到就用默认值填充。
所以,兼容性问题从来不是“用什么格式”的问题,而是“你的格式和你的代码,是否真的支持未知字段的忽略”。这也是后面所有演进策略的根基。
3. 演进机制的源头:从字段编号到writer/reader schema
3.1 文本格式:宽松但脆弱
先看最常用的JSON、XML、CSV这一类文本格式。
它们的优点是自描述:每个字段名都直接写在数据里,打开文件就能看懂,不需要额外元数据。JSON更是因为浏览器生态的普及,成了互联网API的事实标准。但拿来当长期演进的编码方案,问题也不少:
- 数字精度不够:JSON里的数字统一解析为双精度浮点,而数据库里常见的64位整数、decimal类型,超出2^53精度的部分会直接丢失。金融系统里这就是事故。
- 二进制数据不好处理:JSON没有二进制类型,只能先做Base64编码,一次编码膨胀33%。
- 没有schema强制约束:字段全靠约定。上游说好给你
userName,某天悄悄改成username,下游就不认识了。文本格式本身的“灵活”是把双刃剑——它不会阻止你做不兼容的变更。 - CSV更原始:压根没有类型系统,所有字段都是字符串,靠位置而不是名称定位,中间少一列整个文件就错位了。
文本格式的演进能力,完全取决于写代码的人。你要用严格的类对象反序列化,它就不兼容;你要写一个“只取所需字段,遇到未知key直接跳过”的解析器,它就能演进。这也引出了分布式系统设计里值得刻在墙上的原则——宽松接收、严格发送(Postel's Law):你发出去的数据要严格遵循已定义的schema,你接收的数据要容忍一切未知字段。
3.2 二进制格式:schema不再是可选项
讲完文本格式,再看Thrift、Protobuf、Avro这些二进制格式。它们之所以紧凑、高效,是因为数据本身不再包含字段名,而是用字段编号或schema位置信息来替代。
Thrift是Facebook开源的,有三种编码协议:BinaryProtocol、CompactProtocol、DenseProtocol(仅限C++)。Thrift的IDL里每个字段都规定了唯一的整数编号(tag),编码时只写tag和值,不写字段名。解码时按tag匹配。字段名可以随意改,但tag一旦定下来就不能变——因为二进制流里根本不含字段名,全靠tag定位。
Protobuf是Google的,思路和Thrift很像,但有两个细节值得留意:
- 字段编号的编码空间和payload大小挂钩。1到15号字段编号在tag里只占1个字节,16到2047占2个字节,更大的编号更占空间。所以高频字段尽量分配小编号。
- Protobuf 3引入
reserved关键字,可以在IDL里显式声明“这些编号已经废弃,未来任何字段都不得复用”。
我在实际项目里就踩过字段编号复用的坑。某个内部服务早期定义了一个old_field,编号是5,后来需求变更把它删了。过了半年,新同学在IDL里新增了一个字段,也没细看历史,顺手就占了编号5。结果部署之后,所有还没升级的旧节点,把新字段的数据解析成了老的old_field,逻辑直接错乱。这就是DDIA反复强调“字段编号不可复用”的现实代价。
Avro和前两者有本质区别:它压根不给字段编号,二进制流里连tag都没有,只有拼在一起的值。解码时用什么?schema。Avro的每一个数据文件或消息,写入方带着自己的schema(writer schema)编码,读取方拿着自己掌握的schema(reader schema)解码。两者在运行期通过字段名进行匹配,然后动态解析。
这个机制带来一个其他二进制格式没有的好处:schema本身可以独立演进。写数据的人可以把旧schema更新成新schema,只要字段名还匹配得上,旧reader也能读新数据。后面我会用完整的例子来演示。
3.3 演进规则一览:加字段、删字段、改字段名
把常见格式的演进能力放在一起比较,会更直观:
| 操作 | JSON/XML(宽松解析) | Thrift/Protobuf | Avro |
|---|---|---|---|
| 新增可选字段 | 安全,老代码跳过即可 | 安全,新tag不会破坏旧reader | 安全,但reader schema要有默认值 |
| 新增必填字段 | 不安全,旧代码可能缺字段 | 不安全,旧reader会无法解析 | 不安全,旧reader会解析失败 |
| 删除字段 | 危险,依赖下游容忍度 | 危险,最好保留tag废弃不删 | 危险,要保留默认值或别名 |
| 重命名字段 | 不兼容,字段名是数据本体 | 安全,tag不变就行 | 可用aliases映射旧字段名 |
| 修改字段类型 | 高风险 | 高风险,wire type要兼容 | 支持int→long→float→double等拓宽 |
这里最关键的一条经验是:删除字段永远比增加字段危险得多。增加字段时,只需保证“读取方有默认值可填”;删除字段时,所有还在线上运行、还没升级的旧代码,它们内部还保留着对这个字段的引用,一旦新数据里没了这个字段,轻则读到默认值,重则整个对象解析失败。所以DDIA和行业实践都倾向于:不删字段,只标记废弃。字段可以十年不再被任何代码使用,但它必须留在schema里,作为旧版代码最后的安全绳。
4. 三种数据流场景中的演进约束:数据库、RPC与消息队列
编码格式选型从来不是孤立的,它必须放在“数据怎么流动”的上下文里去考虑。DDIA把数据流概括成三种场景,每种场景对演进的约束完全不同。
4.1 数据库:数据的寿命远超代码
数据库是最典型、也最考验兼容性设计的场景。原因很简单:一行记录写入数据库之后,可能几个月、几年之后才被一段更新过的代码读出来。数据库里的数据,是旧编码的历史沉积。每次发布新版本,新代码都必须面对这些历史数据。
数据库演进最核心的规则是双向兼容缺一不可:
- 向后兼容保证新代码能读历史数据。
- 向前兼容保证未来某一天,今天的数据能被另一代代码读取(虽然这看起来遥远,但想一想数据迁移、数据仓库同步、备份恢复的场景,这一步早晚会发生)。
数据库场景里还有一个被很多人忽略的问题:数据文件格式本身。你用最新版PostgreSQL写出来的数据文件,老版本PostgreSQL能读吗?备份文件跨版本恢复是否可行?很多数据库都要求“升级过程中不能降级”,原因就在数据文件格式的兼容性。所以做长期归档时,尽量用自描述的格式,或者把当时使用的schema一并保存,避免多年后拿着数据找不到解码规则。
4.2 RPC:版本错位是常态
RPC(远程过程调用)是服务间通信的主战场。它的特点是:请求和响应的双方同时在线,但版本未必同步。一个老客户端调用新服务端,或者新客户端调用老服务端,都可能在同一天发生。
RPC接口的演进策略,业内常见的做法有这么几类:
- URL或服务名版本化:REST风格下常见
/api/v1/、/api/v2/。不兼容的变更直接放到新版本,旧版本继续维护,等调用方全部升级后再下线。 - 兼容性变更走默认值:新接口增加一个可选参数,一定给默认值;老客户端不会传这个参数,服务端靠默认值兜底。
- 网关/代理层做协议转换:在内网服务网格或API网关上做新旧协议的翻译,让两端的版本差异在中间层消化。
RPC场景最容易踩的坑,是**“代码生成器掩盖了演进风险”**。Thrift和Protobuf都会根据IDL生成强类型的客户端和服务端代码。升级IDL重新生成代码后,编译器通常能帮你检查出字段缺失之类的编译错误,但运行时兼容还是要靠字段编号和默认值来保证。别以为“我们全链路都是新代码”就能跳过兼容设计——你永远不知道哪个批处理任务还在用三个月前的jar包。
4.3 消息队列:生产与消费在时间上彻底解耦
消息队列(或事件流)是三种数据流里时间跨度最长、兼容性要求最苛刻的一种。生产者发消息的那一刻和消费者处理消息的那一刻可能相隔几天、几周,甚至几个月。这就意味着,队列里很可能同时躺着好几种旧版本schema的消息。
Kafka + Schema Registry(schema注册中心)是工业界对这个问题最成熟的解法。核心思路:Schema本身成为一等公民,每个消息版本都在Registry里注册为一个独立版本;生产者和消费者启动时从Registry拉取schema,并声明“我能接受的schema版本范围”;Registry负责检查新旧schema之间的兼容性等级,不兼容的变更在提交阶段就被拦截掉。
我推荐任何用Kafka + Avro(或Protobuf)做事件流的团队,都认真评估一下Schema Registry。它的价值不只是“存schema”,更是把“兼容性检查”提前到了CI阶段:你提交一个新的schema版本时,系统马上告诉你它对已有版本是否友好,而不是等上线之后让消费者半夜收到解析异常。
三种场景的差异可以这样概括:
| 数据流类型 | 生产者与消费者的时间关系 | 最大的演进风险 |
|---|---|---|
| 数据库 | 写入很久后才读取 | 历史数据格式跨越多个版本 |
| RPC | 同时在线但版本不同 | 发布顺序导致新老版本交叉调用 |
| 消息队列 | 时间上完全解耦 | 队列中混合多个历史版本的消息 |
5. 一次完整的事件模型演进推演与踩坑实录
5.1 场景设定:从CSV迁移到Avro的版本演化
把前面的理论串起来,我设计一个贴近真实工作的事件流演进案例,用一个具体的数据模型从头到尾走一遍。
假设你维护一个“用户注册事件流”,最初团队图省事,直接用CSV写Kafka。某天数据量上来,你决定统一迁移到Avro。迁移本身不是重点,重点是迁移之后,schema怎么演进。
第一版Avro schema长这样:
json复制{
"type": "record",
"name": "User",
"fields": [
{"name": "id", "type": "long"},
{"name": "name", "type": "string"}
]
}
某天产品要求增加用户邮箱,于是发布第二版schema:
json复制{
"type": "record",
"name": "User",
"fields": [
{"name": "id", "type": "long"},
{"name": "name", "type": "string"},
{"name": "email", "type": ["null", "string"], "default": null}
]
}
这个变更安全吗?答案是:安全,前提是每个读取方都把自己的reader schema升级到第二版。为什么?回忆一下Avro的匹配机制:reader schema里声明了email字段,writer schema(老数据,没有email)里匹配不到,就用default: null填充。这就是向前兼容的防线——新代码读旧数据,靠默认值补位。
但反过来呢?一个还没有升级到v2的旧消费者,读到v2 producer写入的新消息(消息里含有email字段),它会用v1的reader schema去匹配:reader schema里没有email,那就忽略它——这也成立。所以添加一个带默认值的可选字段,对Avro来说同时支持了前后双向兼容,这就是为什么“加字段给默认值”被称为最安全的演进操作。
5.2 字段改名/删除的完整链路推演
现在做更危险的操作:把name改成full_name。
如果你直接在新版本里把name字段删掉,把full_name加进来,会发生什么?
- 新代码读旧数据:v3的reader schema里有
full_name,没有name,writer schema(老数据)里只有name没有full_name。按Avro的匹配规则,name字段因为reader不认而被忽略,full_name因为writer里没有而取默认值——如果默认值是null,那你读到的全是null。 - 旧代码读新数据:v1的reader schema里有
name,而v3的writer schema里已经没有name了。reader按名匹配name,发现writer里没有,只能找默认值——可原始的name字段并没有声明default。结果就是解析失败。
这就是“删字段”的杀伤力:它同时破坏了向后兼容和向前兼容。所以实践中,正确做法是用Avro的别名机制,让新字段继承旧字段的语义:
json复制{
"type": "record",
"name": "User",
"fields": [
{"name": "id", "type": "long"},
{"name": "name", "type": "string", "aliases": ["full_name"]},
{"name": "full_name", "type": ["null", "string"], "default": null},
{"name": "email", "type": ["null", "string"], "default": null}
]
}
注意这个schema里name没删,只是加了full_name作为新字段,同时把full_name作为name的别名。这样:
- 新代码想用
full_name,旧数据里的name可以通过别名匹配映射过来。 - 旧代码想读
name,新数据里依然保留了name字段。 - 唯一要注意的是,双字段并存期间数据会冗余,但换来的是所有历史代码的安全运行。
这个案例推演做完,你大概能理解为什么我在实际项目中一直坚持一个原则:schema演进,加法永远优先于减法;减法必须留坡道。 所谓坡道,就是要给旧reader留一个可退的默认值或者别名,让它们不至于在数据面前当场崩溃。
5.3 一次真实的事故复盘:字段编号复用
最后讲一个我在Protobuf项目里亲历的类似案例。
有一个用户服务,早期IDL定义了一个字段user_type,编号7,后来业务下线,这个字段在逻辑上废弃了,但IDL里没人删。一年后,一个新人接手这个服务,看到一个没用的字段很碍眼,就把它物理删除了,然后又新增了user_score,也没注意编号,直接用7。
上线后前两周一切正常,因为生产环境所有节点都已经部署了同一版本。等第三周做滚动发布时,旧节点还在,新节点已经写入了带user_score的数据。旧节点的代码里,编号7对应的还是user_type,于是一个整型分数被硬塞进了一个枚举类型字段,解析直接失败。那一刻我才意识到DDIA里那句“字段编号是留给未来的欠账”是什么意思——你欠下的每一笔编号债,都会在你最不设防的发布窗口期连本带利收回来。
这件事之后,我给团队立了三条规矩:
- 删除字段前,必须把编号用
reserved关键字锁死,新字段禁止复用老编号。 - 所有新增字段默认给默认值,不写默认值的字段不允许提交IDL。
- schema变更必须过兼容性检查,走CI流水线,不靠人肉review。
6. 从实际项目中沉淀的几条编码演进实践体会
DDIA第三章读完之后,我最大的收获不是记住了某一种编码格式的语法,而是形成了一套关于“数据形态变化”的思考方式。这里分享几条我在真实项目中反复验证过的经验,希望能帮你少走弯路。
第一,字段编号是负债,不是资产。Protobuf和Thrift里字段编号一旦分配出去,就会写入历史数据流里,永久有效。所以分配编号时就要想:核心字段尽量占用1到15号这样的短编号,不常用的、可能变化的字段靠后放。删字段时宁可保留IDL声明,也不要图干净直接删除,然后用reserved把编号锁死。
第二,默认值就是生命线。不管是Avro、Protobuf还是普通JSON,新增字段务必带默认值。没有默认值的新增字段,本质上就是一个“必填字段”,它会让所有旧reader在读到新数据时直接崩溃。反过来,只要带默认值,向前兼容的难度就下降一个数量级。
第三,滚动发布不等于安全发布。哪怕你每次都是10台机器分批升级,新旧节点并存的时间窗口内也一定会有跨版本数据流转。所以每一次schema变更,都要同时问两个问题:新代码读旧数据成立吗?旧代码读新数据成立吗?两个都成立,才允许进发布流水线。
第四,让schema随数据一起归档。做数据仓库抽取、冷备份、历史数据回放这些长周期任务时,光有数据不够,还得有当时能解释这组数据的schema。自描述格式(比如Avro的Object Container File,文件头就带schema)在这里优势巨大——你不需要去翻一年前的代码仓库,就能把十年前的备份读出来。
第五,值得为兼容性投入自动化工具。Confluent Schema Registry、Protobuf的buf breaking检查这类工具,能把兼容性检查从“高级工程师的经验”变成“CI流水线的一道门禁”。提交新schema时,系统直接告诉你相对上一个版本是BACKWARD兼容、FORWARD兼容还是FULL兼容,不通过就不允许合并。这套机制落地之后,我们团队因为字段错位引发的事故几乎归零。
如果你正在设计一个会被长期维护的数据系统,我的建议是:不要等到线上出事故了,才回来补编码和演进的功课。 格式选型、兼容性策略、schema管理制度,这些都是在项目第一天就应该想清楚的事。数据比代码活得更久,你今天随手写下的一个字段编号,未来可能被十套系统同时引用。善待编码,就是善待未来要维护这套系统的工程师,也包括几个月后的你自己。
