1. 为什么"客体连续性"是AGI绕不开的基石
"客体连续性"这个词,听起来像是心理学课本里的概念,但它实际上是当前AGI讨论中一个极为关键、却又常常被忽视的基础问题。简单来说,客体连续性指的是:世界上的物体在时间和空间中保持其同一性的能力——一个苹果从桌上滚落到地上,它还是那个苹果;你眼前的人转身走进房间,即使暂时被遮挡,你依然知道他在那里,不会消失。
这在人类看来是再自然不过的事情,甚至觉得自己根本不需要"思考"就能做到。但恰恰是这个"不需要思考"的能力,暴露了当前AI系统最深的短板。
前阵子OpenAI总裁在社交媒体上高调宣布"AGI时代到来",我身边不少朋友兴奋地转发了那篇文章。作为一个长期关注机器学习底层逻辑的人,我的第一反应却有点冷静:我们连客体连续性的问题都没有在模型架构层面真正解决,AGI这个目标恐怕还有一段路要走。你可以让大模型写诗、写代码、做数学题,但你让它连续跟踪一个视频中某个具体物体的运动轨迹,或者让它理解"因为窗帘挡住了,所以猫虽然看不见但并没有消失"这类基本物理直觉,它很容易就乱了套。
这里要澄清一个核心认知:目前主流的大语言模型本质上是"符号统计引擎",而非"世界模拟器"。 它能写出关于物理世界的文章,但不代表它内部建立了对物理世界的连续心智模型。与之相对,人类婴儿在9到12个月左右就发展出了"客体永久性"——这是心理学上非常经典的里程碑概念,皮亚杰用一堆实验证明了这一点。婴儿在最初几个月,玩具被布盖住后就认为玩具"不存在"了;但到了特定发育阶段,他们会主动掀开布去找玩具,因为他们已经在心智中构建了"物体即使看不见也仍然存在"的观念。
这就是客体连续性最原始、最底层的形态。
如果要做好AGI,我们不是在现有模型上加一个模块就能解决"连续性"问题,而是要从表征、记忆、预测三条链路同时下手。这也是这篇文章想系统梳理的核心内容——为什么客体连续性如此重要,它在AGI中对应哪些技术难点,以及目前业内有哪些可能的方向值得深入。
我会把这个问题拆成几个层次来讲:先看你我作为人类的连续性认知是怎么运作的,再对比当前AI在哪一环上缺失了,接着聊聊如果要突破,应该从哪些技术路径下手,最后结合现有的研究聊聊这项工作在实际场景里到底能解决什么真问题。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 人类连续性认知的两条路径:自上而下与自下而上
在搭建AGI的认知架构之前,充分理解人类自己是怎么解决连续性问题的,非常有参考价值。人类的视觉系统不是一台被动的摄像机,它是一台极其活跃的"预期机器"。
先说自下而上的路径。当物体移动、被遮挡、改变光照,我们的视网膜接受到的信号其实是断断续续的。但大脑的视觉皮层会自动完成"填补"(filling-in)工作。最经典的例子是盲点实验:我们视网膜上有生理性盲点,但你平时完全感觉不到视野里有洞。因为大脑会自动用周围的纹理和颜色信息把盲点区域"脑补"完整。这个机制用在客体连续性上,就是当我们看到一块移动的物体被一根柱子挡住一部分时,大脑会自动补全被遮住的轮廓,并把前后两段视觉输入关联成"同一个物体"。
再说自上而下的路径。这是更高层的认知机制:我们事先就知道"物体不会凭空消失,也不会瞬间变成另一个物体"。这个预期不是从当前帧的视觉信号里直接提取的,而是由长期积累的世界模型提供的。2004年有一组非常有名的实验,让受试者观看一个物体在屏幕上从左向右移动,中间经过一个视觉遮挡物。在遮挡期间,如果实验者悄无声息地换掉那个物体(比如把红色方块换成蓝色方块),受试者通常察觉不到变化——因为大脑的预期机制已经默认"穿过遮挡物之后还是同一个物体",除非有特别明显的形状变化,否则视觉系统不会重新评估物体的身份。
这两种路径在神经科学里都有对应的脑区机制。自下而上的路径主要依赖枕叶视觉皮层,尤其是MT区(负责运动感知)和V4区(负责轮廓感知)。自上而下的路径则涉及前额叶皮层、顶叶皮层的跨模态整合。前额叶不断向感觉皮层发送"预测信号",告诉它"接下来你应该看到什么"。当实际输入和预测不一致时,大脑会产生"预测误差",这个误差信号会驱动我们调整注意力和认知模型。
人类从未停止过"虚拟环境建模"——你的大脑总是在实时模拟"接下来会发生什么",然后用现实去校正模拟。这个机制有一个专门的学术名词:预测加工(Predictive Processing)。
如果把这个框架迁移到AGI的架构设计上,可以提炼出两个核心模块:
- 生成模型:根据当前状态预测下一时刻的状态,相当于自上而下的路径
- 误差校正机制:将预测结果与实际观测对比,生成误差信号,用来更新模型,相当于自下而上的路径
当前的大模型架构里,自回归模型其实也在做"预测",但预测的目标是下一个token,而非物理世界中的客体状态。这就是根本性的差异。
3. 机器为何难以理解"物体还在那里":特征绑定与ID追踪困境
搞清楚人类的机制之后,再来看机器的问题,会发现它卡在了两个非常具体的点上。
3.1 特征绑定的困难
人类识别一个物体,同时使用多个维度的特征:形状、颜色、纹理、位置、运动方向、运动速度,甚至还有语义标签。这些特征被整合成一个整体,形成对"这个物体"的稳定表征。这个过程在认知科学里叫"绑定问题"(Binding Problem)。
目前的视觉AI模型(比如YOLO系列目标检测器、SAM分割模型等)虽然在检测和分割上做到了很高的精度,但它们是"按帧处理"的——每一帧图像独立检测,没有跨帧的绑定机制。也就是说,这一帧检测到一个红色杯子,下一帧检测到一个红色杯子,模型并不"知道"这是不是同一个杯子,除非你在后处理阶段做额外的目标追踪。
我做过一些小实验,用同一个视频流喂给当前最先进的多模态大模型,然后连续追问"画面中那个红色杯子现在在哪"。第一帧回答准确率还行,一旦物体运动加快或者出现短暂遮挡,模型就开始胡说八道了:有时候说杯子不存在了,有时候说杯子变成了另一个物体。这个现象的本质就是,模型内部没有建立起跨帧的ID绑定体系。
3.2 时间一致性的缺失
第二个问题是时间建模的深度不够。现在的Transformer架构虽然有位置编码,也能处理序列数据,但它的"注意机制"本质上更擅长捕捉token与token之间的相关性,而非因果连续的物理过程。视频理解模型(如Video Transformer)在时间维度上做了一些扩展,把时空patch一起当作token处理,但计算代价极高,而且依然没有显式的"身份保持"约束。
我打个比方,让一个孩子看动画片,他不需要每帧都指着主角说"这是主角",他在潜意识里就完成了身份的跨帧绑定。而当前的AI模型,就像每隔几帧就要重新认识一次画面里的角色,费劲,还容易认错。
这个问题在实际中的表现也很典型:
- 多目标跟踪场景中,两个相同颜色的物体交叉运动后,模型经常出现ID Switch(两个物体的身份互相交换)
- 视频编辑场景中,你想在整段视频中锁定某一个人的面部进行风格化处理,结果经常出现"换人"的bug
- 自动驾驶场景中,雷达点云和视觉图像的数据融合,也需要稳定的目标ID维持,任何一个环节的ID丢失都可能导致危险决策
这些都是客体连续性问题在实际工程中的直接映射。
4. 从工程路径看突破方向:显式ID表征与自回归世界模型
理论问题说了不少,但做工程的人最关心的是:这玩意儿能不能落地?从当前学术界和工业界的探索来看,有几个方向已经在尝试破局。
4.1 显式ID表征的引入
这个思路的核心是:让模型每一帧不仅要输出物体的类别和位置,还要输出一个表征向量,这个向量在时间维度上保持相对稳定。
具体做法是设计一个可学习的"身份编码器"。在视频序列中,同一个物体在不同帧里的视觉特征会有变化(角度、光照、遮挡等),但身份编码器要强迫网络忽略这些变化,输出一个与物体唯一对应的低维向量——类似给每个运动物体分配一个"身份证号"。
这个思路目前在多目标跟踪领域已经有了初步应用,比如一些基于Transformer的跟踪方法,在特征嵌入层增加了"实例级"的损失函数,强制同一目标在不同帧的特征距离更小、不同目标之间的距离更大。实验效果比传统的基于IoU匹配的追踪方法提升明显,尤其在遮挡场景下,ID Switch减少了约30%到40%。
不过这个方案有一个潜在的问题:如何在训练数据中定义"同一个物体"的标签? 人工标注跨帧ID非常费时费力,而且存在歧义。理想的情况下,应该设计一种自监督的训练方式,让模型自己学会"什么东西经过变化之后仍然保持同一性"。
4.2 自回归世界模型的尝试
另一个更有想象力的方向是自回归世界模型。2024年以来,"世界模型"这个词被频繁提及,但不同人说的意思差别很大。
我的理解是,一个真正的世界模型应该具备这样的能力:输入过去若干帧的视频片段,模型能够在潜在空间中预测未来若干帧的状态,并在预测过程中保持客体的连续性。换句话说,模型不仅学习"下一帧像素长什么样",还要学习"下一帧中哪些物体仍然存在、它们移动到了哪里、哪些物体被遮挡了"。
OpenAI的Sora虽然在视频生成方面展示了不少惊艳的能力,但如果你仔细看不间断长视频,会发现物体在穿越遮挡物或大幅度位移时,身份很容易丢失。生成的物体数量和位置会呈现一种"漂移感"。这正是因为纯粹的像素级自回归预测,没有显式的客体表征约束。
要改进的话,业内比较看好的路径是"潜空间自回归+结构化状态表征"。也就是,不直接在像素空间预测未来帧,而是先把视频压缩成一组结构化的潜在因子(包括场景布局、物体ID、物体运动参数等),然后在潜在空间做预测,最后再解码回像素。这种思路下,客体连续性是被显式建模的,而非寄希望于神经网络隐式学到。
4.3 动态图神经网络与关系归纳偏置
还有一个不能忽略的方向是图神经网络。场景可以很自然地建模成一张图:节点是物体,边是物体之间的空间关系(例如"杯子在桌子上"、"猫在追球")。动态图神经网络可以随时间的推移更新节点状态和边状态。
这样做有一个好处——显式地保留了"物体数量守恒"的原则。当一个物体被完全遮挡时,图的节点并不消失,只是它的置信度分数降低、位置不确定性变大;当物体重新出现时,原有节点被重新激活,而不会错误地新建一个节点。
这在概念上非常接近人类的客体永久性认知。知名AI研究者、MIT教授Joshua Tenenbaum团队在程序化心智理论(Program-Mind)相关研究里就做了类似的尝试:构建物理场景的符号化表示,再用生成模型模拟物体的运动。这种"符号+物理引擎"的混合路线,虽然目前的泛化能力还不够强,但在客体连续性上的表现,确实比端到端纯学习的方法更稳定。
5. 连续性建模在AGI实际应用中的具体落地
理论说了一大堆,落到具体的产品和技术应用上,客体连续性其实能解决很多让人头疼的问题。
5.1 AIGC视频生成与编辑
先说这两年最火的AI视频生成和编辑。
如果你用过视频编辑类的AI工具,一定遇到过这类尴尬:你告诉AI"这段视频里戴帽子的人,把帽子换成红色",结果AI只改了三秒钟,再往后帽子颜色又变回去了。这就是典型的客体连续性问题——模型没有持续跟踪"哪个像素块是那顶帽子"。
我在实际使用中发现,目前市面上大多数视频编辑工具都采用的是"逐帧检测+分割"的方案,帧与帧之间没有绑定关系。偶尔效果看着还行,是因为视频变化慢、场景简单;一旦人物移动幅度大、出现遮挡,立刻露馅。
如果能在底层建立客体连续性的表征,视频编辑工具就可以做到:
- 对一个物体在整个视频序列中持续编辑(改色、换装、替换材质)
- 对物体运动轨迹进行自由操控(拖动某个物体的路径,而不影响背景)
- 支持"删掉某个物体并在整个视频中消失"的操作,而不是一帧一帧地做局部修复
这些都是现有工具梦寐以求的能力,也是商业化价值极大的方向。
5.2 机器人操作与具身智能
如果说视频编辑还只是在"数字世界"里的问题,那具身智能机器人领域就是客体连续性最苛刻的练兵场。
机器人要对现实世界做出反应,必须实时维护一个"环境中物体状态的估计"——每个物体的位置、姿态、速度、可能的运动模式。当物体被另一个物体遮挡,或者离开机器人视野时,机器人必须依靠内部模型进行"推断",而不是认为物体消失了。
想象一个家用机器人帮你整理餐桌:桌上有一个盘子,你顺手用一本书把它挡住了。理想中的机器人应该知道"盘子还在原来的位置,只是被挡住了",它可以伸手把书移开,然后拿起盘子里。但如果机器人没有客体连续性能力,它会认为盘子消失了,然后不知所措。
目前机器人领域常用的是概率机器人学中的"多假设跟踪"(Multi-Hypothesis Tracking),它本质上也是在做连续性问题。但传统的卡尔曼滤波、粒子滤波方法在处理复杂遮挡和物体交互时非常吃力,计算量随着目标数量增长呈指数级膨胀。将深度学习的表征能力和概率跟踪的方法结合起来,是一个很大的突破口。
斯坦福大学的吴佳俊团队在2024年发表过一篇关于机器人操作中的"可交互物体表征"的工作,核心就是把每个物体建模为带ID的神经表征,在操作过程中持续更新。实验结果显示,在物体被遮挡的情况下,机器人的成功率比传统方法提升了超过50%。这种成果放在两年前是难以想象的。
5.3 自动驾驶中的目标级感知
再说到自动驾驶。这项技术对客体连续性的依赖程度绝不亚于机器人。城市道路场景中,车辆、行人、自行车、施工障碍物等在传感器视野中频繁遮挡和交叉。自动驾驶系统需要每帧输出目标的稳定ID,并且跨越时间维护这些ID的生命周期。
现在的多传感器融合方案里,ID管理一般由一个专门的跟踪模块负责。这个模块的鲁棒性直接决定了车辆的决策质量。我接触过的不少工程团队都反馈过同一个问题:在雨天或者夜间场景中,点云稀疏,视觉图像模糊,目标检测模型本身就不稳定,跟踪模块经常会"丢失"目标,然后再错误匹配。这种问题如果能在特征层面、而不是后处理层面解决,系统的整体稳定性会提高好几个量级。
6. 需要清醒认识的问题:跨界融合的系统工程
谈到这里,我相信你已经意识到,客体连续性不是一个独立的模块或一个模型能搞定的问题。它需要以下多个层面的协同:
- 感知层:能稳定地从原始输入(图像、点云、音频)中提取客体候选
- 记忆层:长期保存并更新客体的状态和身份,支撑跨时间的推理
- 推理层:基于世界模型做出关于物体状态的推测(被挡住了?移动了?消失了?)
- 学习范式:不能只靠静态数据集的监督学习,必须引入自监督、在线学习、甚至是类似睡眠回放(Sleep Replay)的离线巩固机制
任何一个环节缺失,整体的连续性都会断掉。
我在和一些做AI产品的朋友交流时,发现大家有一个共同的困惑:大模型的通用能力似乎已经很强了,为什么一到需要"细颗粒度、长时序"的任务上,就总是差点意思?我认为答案恰恰就在这里——大模型的强大来自统计规律的记忆和复现,而连续性要求的是对个体对象的动态建模和身份保持。这两者在架构上有根本差异,不能指望着靠"暴力堆参数"去弥补。
这项系统性工作中,学术界和工业界的分工也非常重要。学术界应该继续探索新的表征形式和记忆机制,比如神经辐射场(NeRF)与客体ID的结合、条件计算在动态图上的扩展等。工业界则可以把已经相对成熟的技术(比如多目标跟踪、视频分割)组合成可用的产品,在实际场景中积累问题、清洗数据、优化工程链路。两边需要更频繁的对话,而不是各说各话。
7. 对"AGI时代"的冷静观察
再回到开头提到的那个热搜——"OpenAI总裁宣布AGI到来"。如果AGI的定义是"能够在大多数有价值的工作上与人类水平相当",那我觉得目前的系统确实在某些窄领域接近了。但如果AGI的定义是"具备人类一样的世界理解能力和自适应能力",那我认为,绕不开的客体连续性问题会是一个关键的门槛。
我记得十年前刚接触深度学习时,研究者们普遍认为只要数据量够大、模型够复杂,一切智能问题都能迎刃而解。十年过去了,数据量翻了几百倍,模型参数从百万级涨到了万亿级,但一些最基础的认知能力仍然没有被"暴力美学"征服。这本身就说明了,智能问题不仅仅是拟合问题,它涉及的是结构、因果和时间的本质。
客体连续性给我们的启示恰恰是:智能体必须建立起对"世界如何运转"的抽象理解,而不仅仅是"世界看起来什么样"的统计记忆。 这个转变意味着架构上的更新,也可能意味着我们对"智能"的定义要做出修正。
好在,现在有一批研究者已经在这个方向上持续努力,也陆续有一些令人振奋的成果出现。用不了太长时间,我们或许就能看到"具备客体永久性"的AI出现在实验室里,那将是一个真正意义上的、比大模型刷榜更值得关注的里程碑。而到那个时候,再谈"AGI时代",才真正算得上名副其实。
