这项由谷歌DeepMind、多伦多大学、伦敦大学学院、牛津大学、麻省理工学院及隆德大学联合开展的研究以预印本形式于2026年7月10日发布论文编号为arXiv:2607.09024。有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。**计算机视觉的专科医院困境**医疗体系里有一种现象让很多人感到困惑同一个病人量血压要去心内科看眼睛要去眼科检查骨骼要去骨科每个科室的医生都只认识自己负责的那一块。这当然有其道理但如果有一位全科医生能一次性完成所有评估岂不更好当前的计算机视觉领域正深陷一种类似的专科医院困境。人工智能要识别图中的人在哪里需要用一个叫做Segment Anything的专门模型要估算照片里物体离镜头有多远需要另一个叫做Depth Anything的专门模型要理解人的姿势、分析相机角度又需要各自不同的专门模型。每一个专科医生在自己的领域都非常厉害但他们彼此互不相通整个视觉AI系统像一座分科极细的专科医院缺少那位能统揽全局的全科大夫。与此形成鲜明对比的是自然语言处理领域——也就是让机器理解和生成人类语言的技术领域。那里已经出现了ChatGPT这样的全科大夫同一个模型既能翻译法语又能写诗还能解数学题做代码审查。语言AI之所以能实现这种大统一核心秘诀是一种叫做下一个词预测的训练方式让模型不断猜测下一个词是什么通过海量文本的反复练习模型自然而然地理解了语言的方方面面。那么视觉AI能否也找到这样一种万能训练秘方谷歌DeepMind领导的研究团队给出了他们的答案那个秘方藏在**视频生成**里。他们提出了一个名为**GenCeption**的系统并通过大量实验证明先让AI学会生成逼真视频再让它转型做视觉感知效果比从零开始专门训练的感知模型更好有时甚至超过那些在特定任务上磨砺多年的专业模型。---**一、为什么视频生成是视觉AI的九阳神功**要理解这个想法的独到之处先从一个问题入手要生成一段逼真的视频一个AI系统需要真正懂得什么以生成一个人走进咖啡馆这段视频为例。系统必须明白推门而入的人身体各部分之间的比例和运动规律光线从窗户射进来打在脸上、桌面上应该形成怎样的阴影从一帧到下一帧人的位置怎么移动、背景怎么保持不动桌子在远处时看起来比在近处小这是透视规律……这一切并没有人明确告诉AIAI是通过不断尝试生成视频、让结果尽可能真实自己悟出来的。换句话说**一个足够强大的视频生成模型实际上已经在内部建立了一套对物理世界的深刻理解**三维几何结构、物体的运动规律、光照与阴影、物体随时间的持久存在。这些恰恰都是视觉感知任务所需要的底层知识。研究团队认为一个好的视觉预训练范式应该满足三个核心条件。第一它要让模型真正理解时空演化——世界是四维的三维空间加上时间模型必须学会时间上的因果关系和物理规律。第二它要实现视觉与语言的原生对齐——因为现代视频生成模型本来就是根据文字描述来生成视频的视觉特征和语言含义天然地绑定在一起。第三它必须能够大规模扩展——视频生成模型因为商业价值巨大各大公司已经投入了海量数据和计算资源来训练它这种规模效应可以直接继承。以前流行的视觉预训练方式比如遮住图片的一部分让AI猜掩码自编码器或者让AI分辨哪两张图更相似对比学习都在某一方面有所欠缺前者缺少语言对齐后者缺少时序理解而且两者的规模都无法与视频生成相提并论。视频生成则三条都满足了。---**二、GenCeption的转型之路从画家到侦探**GenCeption的核心思路可以用一个职业转型的故事来理解。设想有一位极其优秀的写实画家经过多年训练他能把任何场景画得惟妙惟肖人物的皮肤纹理、远山的层次感、光线在水面的反射……为了画好这一切他不得不深入理解人体结构、透视规律、光影物理。某一天这位画家转行做了法医侦探需要看一张照片判断凶案现场里物体之间的距离、人的姿势、光线来向。你会发现他此前在绘画中积累的所有知识此刻都成了破案的利器。GenCeption就是这么干的。研究团队选用了一个已经训练好的开源视频生成模型——WAN 2.1这个模型有1.3B13亿参数和14B140亿参数两个版本。这个模型的内部结构是一种叫做扩散变换器DiT可以理解为视频生成的核心引擎的架构辅以负责压缩和还原图像的编码解码器以及理解文字指令的文本编码器。**把迭代画家变成一步侦探**视频生成模型原本的工作方式类似于一位画家反复修改草稿从一张随机噪点图开始经过50次迭代修改逐渐去掉噪点显现出清晰画面。这个过程很慢而且每次修改都有随机性不适合需要精确、快速的感知任务。GenCeption做了一个关键改造让这位画家跳过所有草稿阶段直接给出答案。具体做法是把输入视频直接送进模型而不是送入随机噪点并把时间步长固定为零告诉模型你已经完成了这是最终状态然后只做一次前向计算直接得到输出。这样原本需要50步的慢速生成变成了1步的快速感知。这里有一个技术细节值得用通俗方式解释一下。这个模型是用一种叫整流流Rectified Flow的方式训练的它的输出实际上是速度从噪点到清晰图像的变化方向而不是直接的图像。研究团队发现把这个速度取反就能得到最接近目标输出的结果而且这样做能让训练更快收敛、性能更好。可以把它类比为模型本来告诉你往东走能到达目的地的反方向你把它翻转一下就知道了正确的方向。**用文字遥控感知任务**GenCeption的另一大亮点是用文字指令来切换输出模式。输入同一段视频配上输出深度图模型就给出深度估计换成输出法线图就给出表面法线估计换成输出分割蒙版就给出前景分割……整个过程就像用遥控器切换电视频道同一台电视机不同频道不同内容。这与以前的做法形成了鲜明对比。以前的多任务模型通常需要为每个任务设计专门的模块、专门的损失函数系统越来越复杂任务之间的协调也越来越困难。GenCeption则把所有任务的差异从架构设计层面转移到了数据格式设计层面——只要能把任务的输出用合适的方式表示成图像就能加入这个统一系统。这个思路和大语言模型统一处理各种语言任务的方式如出一辙。---**三、万能输出格式把什么都塞进三个颜色通道**电脑屏幕上的所有图像本质上都是由红、绿、蓝三个颜色通道RGB组成的。GenCeption的一个巧妙设计是把各种感知任务的输出统统转换成RGB格式来处理。深度图表示远近距离本来只有一个数值就把这个数值复制三份填入红绿蓝三个通道。表面法线图表示物体表面朝向本来有三个维度的数值恰好对应红绿蓝三个通道。密集姿态估计表示人体各部位的位置同样是三维的也直接映射进去。更有意思的是相机姿态估计的处理方式。相机的姿态通常用矩阵来表示维度远超三个通道。研究团队发明了一种叫做Rothko射线图Rothko Raymap的表示方式——名字来源于美国抽象画家罗斯科的色块风格。做法是把画面空间分成几个区域中间区域存放相机的平移信息射线起点周边区域存放相机的旋转信息射线方向就像把一幅建筑平面图和立面图拼贴在同一张纸上从而用一张三通道图像表达了原本需要六个通道的信息。这种把高维信息折叠进图像格的思路被研究团队称为视觉版的把非文字信息转成文字字符串——正如大语言模型把一切信息都转成文本来处理GenCeption把一切信息都转成图像来处理。**应对需要坐标输出的任务额外的感知探针**不是所有任务都能优雅地表示成图像。比如估计人体关键点的三维坐标手腕在哪里、膝盖在哪里需要输出的是一串数字而不是一张图。对此研究团队设计了一种轻量级扩展在视频的每一帧对应位置额外插入一个可以学习的探针标记模型处理完整段视频后这些探针会携带该帧的语义信息再经过一个简单的多层感知机MLP可以理解为一个小型转换器解码出坐标数值。这些探针的位置编码经过特别设计与原有模型兼容不破坏模型原有的注意力机制。---**四、合成厨房用虚拟数据喂出真实能力**现实世界的视频数据有一个大麻烦真实视频很难同时配备深度、法线、分割蒙版、三维关键点等所有标注。收集这样的多模态标注数据既费钱又费时。GenCeption的解决方案是**自己用电脑动画软件合成训练数据**。研究团队使用了800个来自RenderPeople数据库的三维人体模型用200段来自卡内基梅隆大学动作捕捉数据库的真实运动数据为这些模型做动画配以各种三维场景和HDRI高动态范围背景以及不同的焦距、相机位置和运动轨迹最终用Blender这款开源三维软件渲染生成了7500段视频。这些视频在渲染时可以同时输出深度图、法线图、分割蒙版等所有需要的标注相当于一次拍摄所有角度同时拍清楚。这批合成数据还混入了若干公开的合成数据集TartanAir、Virtual KITTI、MVS Synth来补充深度和相机轨迹数据的多样性。对于表达引导分割任务由于现成真实数据容易获取则直接使用了MeViS、Ref-COCO和YouTube-VOS等真实数据集。**统一损失函数告别多科室会诊的混乱**传统多任务学习还有一个工程上的大麻烦不同任务需要不同的损失函数衡量预测结果与真实结果差距的数学公式深度估计要用尺度不变损失法线估计要用角度损失分割要用交叉熵损失……每次加入新任务就要重新调整各个损失函数的权重反复试错耗费大量人力。GenCeption采用了一个更简洁的方案所有任务统一使用最普通的L2损失就是预测值与真实值差的平方。但问题来了深度估计这种任务有尺度歧义——同一张图深度值可以是1米到10米也可以是10米到100米预测出来的结果难以统一比较。解决方案不是改损失函数而是在数据层面做处理把每段视频的深度图用该场景的中位深度做归一化再用一个非线性函数映射到0到1的范围。这样所有任务的输出都在相同量级用同一个L2损失就能一起训练。任务间的权衡只需调整数据混合比例就像调整一道菜里各种食材的比例一样直观。**训练细节稳定是第一要务**训练在256块谷歌v6e TPU一种专为AI训练设计的芯片上进行批量大小64学习率5×10??共训练15000步前250步做线性预热。为了保持训练稳定研究团队使用了两种保险机制梯度裁剪当梯度太大时自动压缩和梯度丢弃当某批数据的梯度异常时直接跳过这两个措施被描述为对稳定训练和高质量性能至关重要。---**五、考试成绩单在多个科目同时拿高分**研究团队在一系列标准测试数据集上把GenCeption与各领域的顶尖专业模型进行了对比涵盖表面法线估计、深度估计、相机姿态估计、前景分割、表达引导分割和三维人体关键点估计六大类任务。在表面法线估计方面GenCeption的大型版本14B参数在Sintel数据集上的平均角误差为29.3度超过了专门做法线估计的NormalCrafter30.7度和Lotus-230.3度在Hi4D数据集上的误差11.47也好于Sapiens12.14和David15.37。在深度估计方面这套方法在KITTI数据集上的相对误差达到0.048与专门做深度估计的顶尖模型D4RT0.055和VGGT-Ω0.041处于同一量级而且训练数据量比它们少7到500倍。更具体地说D4RT使用了约86M8600万帧训练数据VGGT-Ω使用了约600M6亿帧而GenCeption只用了1.23M123万帧却能达到接近的水平。在相机姿态估计判断拍摄时相机在哪里、朝哪里方面GenCeption的平均位移误差为0.156优于MapAnything0.306、VGGT0.247和DepthAnything30.201与D4RT0.148和VGGT-Ω0.145的差距很小。在前景分割把画面中的主体从背景中分离出来方面GenCeption在VideoMatte数据集上的均方误差为0.0018在PhotoMatte上为0.0008与专门做视频抠图的RVM模型0.0010接近还好于MODNet0.0054。在表达引导分割根据黄色毛衣从左边开来的白色面包车这样的语言描述找到并分割对应物体方面GenCeption的JF分数在MeViS数据集上达到69.0超过了SAM341.3和SAM3加Gemini的组合64.5与专门为此设计的ReferEverything60.3和VoCap51.9相比也有明显优势。在三维人体关键点估计方面GenCeption的大型版本在EMDB数据集上的MPJPE每关节平均位置误差单位毫米越小越好为71.8毫米优于GVHMR72.6、Genmo73.0和TRAM74.4。**与其他预训练方式的正面较量**一个关键的对照实验是在完全相同的训练数据下比较不同预训练方式的效果。研究团队分别用V-JEPA一种视频特征预测方法、VideoMAE V2视频掩码自编码器和WAN 2.1视频扩散生成模型即GenCeption所用的预训练骨干在同样的7500段合成视频上微调测试深度估计性能。结果显示V-JEPA在Sintel上的相对误差高达0.422VideoMAE V2最大版本为0.260而WAN 2.1的1.3B版本已经降至0.20114B版本进一步降至0.181。生成式扩散预训练对感知任务的帮助远超现有的判别式预训练方法。研究团队还做了一个从多少层开始预训练有意义的实验分别把DiT的0层、8层、16层、24层、32层和全部40层的预训练权重迁移过来从头训练其余层。结果非常清晰完全从零开始训练0层预训练权重训练损失曲线几乎是一条水平线几乎学不到东西随着迁移的预训练层数增多收敛速度越来越快最终性能越来越好。这有力地证明了预训练权重对下游任务的核心价值。**推理速度已经足够实用**由于去掉了原本的50步迭代GenCeption的推理速度相当实用。在单块v6e TPU上处理一段81帧、480×832分辨率的视频1.3B版本需要5.92秒帧率约13.6帧/秒其中核心DiT网络只需0.96秒占用约15.3GB显存14B版本需要10.03秒帧率约8.0帧/秒核心DiT需5.11秒占用约42.8GB显存。两个版本共享的文本编码器需要10GBVAE编码解码器需要0.25GB都可以卸载到系统内存以节省显存。---**六、超出预期的意外收获三种让人惊喜的泛化能力**GenCeption最令研究者兴奋的地方或许不是那些量化指标而是一系列完全出乎意料的泛化现象。**从合成跳到真实**整套系统几乎完全在电脑合成的虚拟视频上训练却能直接用于真实世界的视频而且效果出色。更有意思的是模型输出的细节质量有时甚至超过了用于训练的合成数据本身的质量——比如对于真实视频中猫的胡须模型能给出相当精细的法线估计对于人的头发能做出柔和自然的分割而这种细腻程度在合成训练数据里根本没有出现过。这意味着模型从视频生成预训练中学到的那些世界知识为它提供了超越训练数据的感知能力。**从一个人跳到多个人**训练数据里每段视频只有一个人物。但在测试时面对多个人同时出现的真实视频模型能够同时对所有人进行正确的深度估计、姿态估计和分割没有出现混淆或崩溃。这种泛化能力完全是自发涌现的研究者并没有专门设计任何机制来实现它。**从人类跳到动物和机器人**训练数据清一色都是人类的视频但模型对猫、狗、熊、狮子这些动物以及机器人这类非人类铰接式物体同样能给出合理的姿态估计和分割结果。换句话说模型似乎学到了铰接式可运动物体这个更抽象的概念而不仅仅是人类这个具体类别。在表达引导分割的实验中即便查询词是火箭完全不在训练数据中模型也能根据视觉和语言理解正确地把火箭分割出来。研究团队认为这些涌现行为的根源正是视频生成预训练赋予模型的那些丰富表征它们远比感知任务本身所需的知识更加宽泛和深厚。---**七、联合训练的副作用多面手的代价**诚实地面对局限性是好研究的标志之一。当把所有任务放在一起联合训练时形成通才模型相比各任务单独训练专才模型结果呈现出不均匀的变化。前景分割任务在联合训练下反而受益性能小幅提升。深度估计在部分测试集上性能基本持平在另一些测试集上略有下降。表面法线估计的表现在不同数据集上有涨有跌。最显著的副作用出现在三维关键点估计上联合训练会使这个任务的性能明显下降同时拖累其他密集预测任务。研究团队分析认为这源于两个根本矛盾一方面坐标数值预测是离散的、结构化的与模型在预训练阶段所擅长的连续像素空间表示格格不入另一方面为稀疏任务额外引入的探针标记是从零开始随机初始化的这些随机初始化的标记会干扰原本已经训练稳定的注意力机制需要更多数据才能收敛在数据有限时则会破坏其他任务的表现。这一发现本身也是一种重要的洞察在基于预训练模型做微调时对模型架构的改动越少越好或者反过来如果任务确实需要很大的架构改动那或许需要从预训练阶段就把这些需求纳入设计而不是等到微调阶段再拼凑。---**这对我们意味着什么**说到底GenCeption代表的是一种思维方式的转变。过去让机器看懂世界和让机器画出世界是两条完全不同的路。现在谷歌DeepMind及合作机构的研究表明这两条路其实是同一条路的两个方向先走过画出这条路积累了足够的世界知识再回头走看懂这条路反而走得更远、更稳。对于普通人而言这意味着未来的视觉AI助手可能会越来越像一位真正的全科医生——同一个系统既能帮你测量照片里家具到墙的距离又能识别视频里运动员的姿势还能根据你的文字描述找到并标记特定物体。不同功能之间的切换不再需要更换整套软件只需要换一条文字指令。当然目前这套系统仍有未竟之处通才版本相比各专才版本仍有差距特别是在需要精确坐标输出的稀疏任务上。数据也还主要依赖合成真实世界数据的多模态标注难题尚未彻底解决。但研究团队展示的数据和模型扩展规律表明随着投入的数据量和模型规模增加性能在稳步提升这为未来的发展指明了方向。假如视频生成模型的训练规模继续翻倍、再翻倍那个内置了越来越完整的世界物理模型的生成骨干所能赋予感知系统的能力边界现在还很难预见。有兴趣追踪这一方向的读者可以通过arXiv:2607.09024获取完整论文项目主页genception.github.io也提供了更多演示视频。---QAQ1GenCeption和普通视频生成AI有什么不同A视频生成AI比如Sora的目标是凭空创造出新视频。GenCeption则是把已经学会画视频的AI改造成能分析视频的感知工具——输入一段真实视频输出深度图、人体关键点、物体分割等理解结果。核心区别是一个生产内容一个理解内容但它们共享同一套对世界的底层知识。Q2用合成数据训练出来的模型在真实视频上真的管用吗A从GenCeption的实验来看效果确实出乎意料地好。该模型完全用电脑渲染的虚拟人物视频训练却在真实世界的人物、动物甚至机器人视频上都表现良好有些细节的输出质量甚至超过了合成训练数据本身。研究者认为这是因为视频生成预训练赋予了模型超越具体训练数据的抽象世界知识使得从合成到真实的迁移能够自然发生。Q3GenCeption的通才版本比专才版本性能差多少A差距因任务而异。在前景分割上通才版本反而略好于专才版本。在深度估计和相机姿态估计上通才版本在部分测试集上持平在另一些测试集上略差一点。差距最大的是三维人体关键点估计联合训练会明显拉低这个任务的表现。总体而言通才版本在保持多数任务高水平的同时个别任务存在一定代价。
谷歌DeepMind等机构证实:让AI先“看懂“世界,再让它“画出“世界
这项由谷歌DeepMind、多伦多大学、伦敦大学学院、牛津大学、麻省理工学院及隆德大学联合开展的研究以预印本形式于2026年7月10日发布论文编号为arXiv:2607.09024。有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。**计算机视觉的专科医院困境**医疗体系里有一种现象让很多人感到困惑同一个病人量血压要去心内科看眼睛要去眼科检查骨骼要去骨科每个科室的医生都只认识自己负责的那一块。这当然有其道理但如果有一位全科医生能一次性完成所有评估岂不更好当前的计算机视觉领域正深陷一种类似的专科医院困境。人工智能要识别图中的人在哪里需要用一个叫做Segment Anything的专门模型要估算照片里物体离镜头有多远需要另一个叫做Depth Anything的专门模型要理解人的姿势、分析相机角度又需要各自不同的专门模型。每一个专科医生在自己的领域都非常厉害但他们彼此互不相通整个视觉AI系统像一座分科极细的专科医院缺少那位能统揽全局的全科大夫。与此形成鲜明对比的是自然语言处理领域——也就是让机器理解和生成人类语言的技术领域。那里已经出现了ChatGPT这样的全科大夫同一个模型既能翻译法语又能写诗还能解数学题做代码审查。语言AI之所以能实现这种大统一核心秘诀是一种叫做下一个词预测的训练方式让模型不断猜测下一个词是什么通过海量文本的反复练习模型自然而然地理解了语言的方方面面。那么视觉AI能否也找到这样一种万能训练秘方谷歌DeepMind领导的研究团队给出了他们的答案那个秘方藏在**视频生成**里。他们提出了一个名为**GenCeption**的系统并通过大量实验证明先让AI学会生成逼真视频再让它转型做视觉感知效果比从零开始专门训练的感知模型更好有时甚至超过那些在特定任务上磨砺多年的专业模型。---**一、为什么视频生成是视觉AI的九阳神功**要理解这个想法的独到之处先从一个问题入手要生成一段逼真的视频一个AI系统需要真正懂得什么以生成一个人走进咖啡馆这段视频为例。系统必须明白推门而入的人身体各部分之间的比例和运动规律光线从窗户射进来打在脸上、桌面上应该形成怎样的阴影从一帧到下一帧人的位置怎么移动、背景怎么保持不动桌子在远处时看起来比在近处小这是透视规律……这一切并没有人明确告诉AIAI是通过不断尝试生成视频、让结果尽可能真实自己悟出来的。换句话说**一个足够强大的视频生成模型实际上已经在内部建立了一套对物理世界的深刻理解**三维几何结构、物体的运动规律、光照与阴影、物体随时间的持久存在。这些恰恰都是视觉感知任务所需要的底层知识。研究团队认为一个好的视觉预训练范式应该满足三个核心条件。第一它要让模型真正理解时空演化——世界是四维的三维空间加上时间模型必须学会时间上的因果关系和物理规律。第二它要实现视觉与语言的原生对齐——因为现代视频生成模型本来就是根据文字描述来生成视频的视觉特征和语言含义天然地绑定在一起。第三它必须能够大规模扩展——视频生成模型因为商业价值巨大各大公司已经投入了海量数据和计算资源来训练它这种规模效应可以直接继承。以前流行的视觉预训练方式比如遮住图片的一部分让AI猜掩码自编码器或者让AI分辨哪两张图更相似对比学习都在某一方面有所欠缺前者缺少语言对齐后者缺少时序理解而且两者的规模都无法与视频生成相提并论。视频生成则三条都满足了。---**二、GenCeption的转型之路从画家到侦探**GenCeption的核心思路可以用一个职业转型的故事来理解。设想有一位极其优秀的写实画家经过多年训练他能把任何场景画得惟妙惟肖人物的皮肤纹理、远山的层次感、光线在水面的反射……为了画好这一切他不得不深入理解人体结构、透视规律、光影物理。某一天这位画家转行做了法医侦探需要看一张照片判断凶案现场里物体之间的距离、人的姿势、光线来向。你会发现他此前在绘画中积累的所有知识此刻都成了破案的利器。GenCeption就是这么干的。研究团队选用了一个已经训练好的开源视频生成模型——WAN 2.1这个模型有1.3B13亿参数和14B140亿参数两个版本。这个模型的内部结构是一种叫做扩散变换器DiT可以理解为视频生成的核心引擎的架构辅以负责压缩和还原图像的编码解码器以及理解文字指令的文本编码器。**把迭代画家变成一步侦探**视频生成模型原本的工作方式类似于一位画家反复修改草稿从一张随机噪点图开始经过50次迭代修改逐渐去掉噪点显现出清晰画面。这个过程很慢而且每次修改都有随机性不适合需要精确、快速的感知任务。GenCeption做了一个关键改造让这位画家跳过所有草稿阶段直接给出答案。具体做法是把输入视频直接送进模型而不是送入随机噪点并把时间步长固定为零告诉模型你已经完成了这是最终状态然后只做一次前向计算直接得到输出。这样原本需要50步的慢速生成变成了1步的快速感知。这里有一个技术细节值得用通俗方式解释一下。这个模型是用一种叫整流流Rectified Flow的方式训练的它的输出实际上是速度从噪点到清晰图像的变化方向而不是直接的图像。研究团队发现把这个速度取反就能得到最接近目标输出的结果而且这样做能让训练更快收敛、性能更好。可以把它类比为模型本来告诉你往东走能到达目的地的反方向你把它翻转一下就知道了正确的方向。**用文字遥控感知任务**GenCeption的另一大亮点是用文字指令来切换输出模式。输入同一段视频配上输出深度图模型就给出深度估计换成输出法线图就给出表面法线估计换成输出分割蒙版就给出前景分割……整个过程就像用遥控器切换电视频道同一台电视机不同频道不同内容。这与以前的做法形成了鲜明对比。以前的多任务模型通常需要为每个任务设计专门的模块、专门的损失函数系统越来越复杂任务之间的协调也越来越困难。GenCeption则把所有任务的差异从架构设计层面转移到了数据格式设计层面——只要能把任务的输出用合适的方式表示成图像就能加入这个统一系统。这个思路和大语言模型统一处理各种语言任务的方式如出一辙。---**三、万能输出格式把什么都塞进三个颜色通道**电脑屏幕上的所有图像本质上都是由红、绿、蓝三个颜色通道RGB组成的。GenCeption的一个巧妙设计是把各种感知任务的输出统统转换成RGB格式来处理。深度图表示远近距离本来只有一个数值就把这个数值复制三份填入红绿蓝三个通道。表面法线图表示物体表面朝向本来有三个维度的数值恰好对应红绿蓝三个通道。密集姿态估计表示人体各部位的位置同样是三维的也直接映射进去。更有意思的是相机姿态估计的处理方式。相机的姿态通常用矩阵来表示维度远超三个通道。研究团队发明了一种叫做Rothko射线图Rothko Raymap的表示方式——名字来源于美国抽象画家罗斯科的色块风格。做法是把画面空间分成几个区域中间区域存放相机的平移信息射线起点周边区域存放相机的旋转信息射线方向就像把一幅建筑平面图和立面图拼贴在同一张纸上从而用一张三通道图像表达了原本需要六个通道的信息。这种把高维信息折叠进图像格的思路被研究团队称为视觉版的把非文字信息转成文字字符串——正如大语言模型把一切信息都转成文本来处理GenCeption把一切信息都转成图像来处理。**应对需要坐标输出的任务额外的感知探针**不是所有任务都能优雅地表示成图像。比如估计人体关键点的三维坐标手腕在哪里、膝盖在哪里需要输出的是一串数字而不是一张图。对此研究团队设计了一种轻量级扩展在视频的每一帧对应位置额外插入一个可以学习的探针标记模型处理完整段视频后这些探针会携带该帧的语义信息再经过一个简单的多层感知机MLP可以理解为一个小型转换器解码出坐标数值。这些探针的位置编码经过特别设计与原有模型兼容不破坏模型原有的注意力机制。---**四、合成厨房用虚拟数据喂出真实能力**现实世界的视频数据有一个大麻烦真实视频很难同时配备深度、法线、分割蒙版、三维关键点等所有标注。收集这样的多模态标注数据既费钱又费时。GenCeption的解决方案是**自己用电脑动画软件合成训练数据**。研究团队使用了800个来自RenderPeople数据库的三维人体模型用200段来自卡内基梅隆大学动作捕捉数据库的真实运动数据为这些模型做动画配以各种三维场景和HDRI高动态范围背景以及不同的焦距、相机位置和运动轨迹最终用Blender这款开源三维软件渲染生成了7500段视频。这些视频在渲染时可以同时输出深度图、法线图、分割蒙版等所有需要的标注相当于一次拍摄所有角度同时拍清楚。这批合成数据还混入了若干公开的合成数据集TartanAir、Virtual KITTI、MVS Synth来补充深度和相机轨迹数据的多样性。对于表达引导分割任务由于现成真实数据容易获取则直接使用了MeViS、Ref-COCO和YouTube-VOS等真实数据集。**统一损失函数告别多科室会诊的混乱**传统多任务学习还有一个工程上的大麻烦不同任务需要不同的损失函数衡量预测结果与真实结果差距的数学公式深度估计要用尺度不变损失法线估计要用角度损失分割要用交叉熵损失……每次加入新任务就要重新调整各个损失函数的权重反复试错耗费大量人力。GenCeption采用了一个更简洁的方案所有任务统一使用最普通的L2损失就是预测值与真实值差的平方。但问题来了深度估计这种任务有尺度歧义——同一张图深度值可以是1米到10米也可以是10米到100米预测出来的结果难以统一比较。解决方案不是改损失函数而是在数据层面做处理把每段视频的深度图用该场景的中位深度做归一化再用一个非线性函数映射到0到1的范围。这样所有任务的输出都在相同量级用同一个L2损失就能一起训练。任务间的权衡只需调整数据混合比例就像调整一道菜里各种食材的比例一样直观。**训练细节稳定是第一要务**训练在256块谷歌v6e TPU一种专为AI训练设计的芯片上进行批量大小64学习率5×10??共训练15000步前250步做线性预热。为了保持训练稳定研究团队使用了两种保险机制梯度裁剪当梯度太大时自动压缩和梯度丢弃当某批数据的梯度异常时直接跳过这两个措施被描述为对稳定训练和高质量性能至关重要。---**五、考试成绩单在多个科目同时拿高分**研究团队在一系列标准测试数据集上把GenCeption与各领域的顶尖专业模型进行了对比涵盖表面法线估计、深度估计、相机姿态估计、前景分割、表达引导分割和三维人体关键点估计六大类任务。在表面法线估计方面GenCeption的大型版本14B参数在Sintel数据集上的平均角误差为29.3度超过了专门做法线估计的NormalCrafter30.7度和Lotus-230.3度在Hi4D数据集上的误差11.47也好于Sapiens12.14和David15.37。在深度估计方面这套方法在KITTI数据集上的相对误差达到0.048与专门做深度估计的顶尖模型D4RT0.055和VGGT-Ω0.041处于同一量级而且训练数据量比它们少7到500倍。更具体地说D4RT使用了约86M8600万帧训练数据VGGT-Ω使用了约600M6亿帧而GenCeption只用了1.23M123万帧却能达到接近的水平。在相机姿态估计判断拍摄时相机在哪里、朝哪里方面GenCeption的平均位移误差为0.156优于MapAnything0.306、VGGT0.247和DepthAnything30.201与D4RT0.148和VGGT-Ω0.145的差距很小。在前景分割把画面中的主体从背景中分离出来方面GenCeption在VideoMatte数据集上的均方误差为0.0018在PhotoMatte上为0.0008与专门做视频抠图的RVM模型0.0010接近还好于MODNet0.0054。在表达引导分割根据黄色毛衣从左边开来的白色面包车这样的语言描述找到并分割对应物体方面GenCeption的JF分数在MeViS数据集上达到69.0超过了SAM341.3和SAM3加Gemini的组合64.5与专门为此设计的ReferEverything60.3和VoCap51.9相比也有明显优势。在三维人体关键点估计方面GenCeption的大型版本在EMDB数据集上的MPJPE每关节平均位置误差单位毫米越小越好为71.8毫米优于GVHMR72.6、Genmo73.0和TRAM74.4。**与其他预训练方式的正面较量**一个关键的对照实验是在完全相同的训练数据下比较不同预训练方式的效果。研究团队分别用V-JEPA一种视频特征预测方法、VideoMAE V2视频掩码自编码器和WAN 2.1视频扩散生成模型即GenCeption所用的预训练骨干在同样的7500段合成视频上微调测试深度估计性能。结果显示V-JEPA在Sintel上的相对误差高达0.422VideoMAE V2最大版本为0.260而WAN 2.1的1.3B版本已经降至0.20114B版本进一步降至0.181。生成式扩散预训练对感知任务的帮助远超现有的判别式预训练方法。研究团队还做了一个从多少层开始预训练有意义的实验分别把DiT的0层、8层、16层、24层、32层和全部40层的预训练权重迁移过来从头训练其余层。结果非常清晰完全从零开始训练0层预训练权重训练损失曲线几乎是一条水平线几乎学不到东西随着迁移的预训练层数增多收敛速度越来越快最终性能越来越好。这有力地证明了预训练权重对下游任务的核心价值。**推理速度已经足够实用**由于去掉了原本的50步迭代GenCeption的推理速度相当实用。在单块v6e TPU上处理一段81帧、480×832分辨率的视频1.3B版本需要5.92秒帧率约13.6帧/秒其中核心DiT网络只需0.96秒占用约15.3GB显存14B版本需要10.03秒帧率约8.0帧/秒核心DiT需5.11秒占用约42.8GB显存。两个版本共享的文本编码器需要10GBVAE编码解码器需要0.25GB都可以卸载到系统内存以节省显存。---**六、超出预期的意外收获三种让人惊喜的泛化能力**GenCeption最令研究者兴奋的地方或许不是那些量化指标而是一系列完全出乎意料的泛化现象。**从合成跳到真实**整套系统几乎完全在电脑合成的虚拟视频上训练却能直接用于真实世界的视频而且效果出色。更有意思的是模型输出的细节质量有时甚至超过了用于训练的合成数据本身的质量——比如对于真实视频中猫的胡须模型能给出相当精细的法线估计对于人的头发能做出柔和自然的分割而这种细腻程度在合成训练数据里根本没有出现过。这意味着模型从视频生成预训练中学到的那些世界知识为它提供了超越训练数据的感知能力。**从一个人跳到多个人**训练数据里每段视频只有一个人物。但在测试时面对多个人同时出现的真实视频模型能够同时对所有人进行正确的深度估计、姿态估计和分割没有出现混淆或崩溃。这种泛化能力完全是自发涌现的研究者并没有专门设计任何机制来实现它。**从人类跳到动物和机器人**训练数据清一色都是人类的视频但模型对猫、狗、熊、狮子这些动物以及机器人这类非人类铰接式物体同样能给出合理的姿态估计和分割结果。换句话说模型似乎学到了铰接式可运动物体这个更抽象的概念而不仅仅是人类这个具体类别。在表达引导分割的实验中即便查询词是火箭完全不在训练数据中模型也能根据视觉和语言理解正确地把火箭分割出来。研究团队认为这些涌现行为的根源正是视频生成预训练赋予模型的那些丰富表征它们远比感知任务本身所需的知识更加宽泛和深厚。---**七、联合训练的副作用多面手的代价**诚实地面对局限性是好研究的标志之一。当把所有任务放在一起联合训练时形成通才模型相比各任务单独训练专才模型结果呈现出不均匀的变化。前景分割任务在联合训练下反而受益性能小幅提升。深度估计在部分测试集上性能基本持平在另一些测试集上略有下降。表面法线估计的表现在不同数据集上有涨有跌。最显著的副作用出现在三维关键点估计上联合训练会使这个任务的性能明显下降同时拖累其他密集预测任务。研究团队分析认为这源于两个根本矛盾一方面坐标数值预测是离散的、结构化的与模型在预训练阶段所擅长的连续像素空间表示格格不入另一方面为稀疏任务额外引入的探针标记是从零开始随机初始化的这些随机初始化的标记会干扰原本已经训练稳定的注意力机制需要更多数据才能收敛在数据有限时则会破坏其他任务的表现。这一发现本身也是一种重要的洞察在基于预训练模型做微调时对模型架构的改动越少越好或者反过来如果任务确实需要很大的架构改动那或许需要从预训练阶段就把这些需求纳入设计而不是等到微调阶段再拼凑。---**这对我们意味着什么**说到底GenCeption代表的是一种思维方式的转变。过去让机器看懂世界和让机器画出世界是两条完全不同的路。现在谷歌DeepMind及合作机构的研究表明这两条路其实是同一条路的两个方向先走过画出这条路积累了足够的世界知识再回头走看懂这条路反而走得更远、更稳。对于普通人而言这意味着未来的视觉AI助手可能会越来越像一位真正的全科医生——同一个系统既能帮你测量照片里家具到墙的距离又能识别视频里运动员的姿势还能根据你的文字描述找到并标记特定物体。不同功能之间的切换不再需要更换整套软件只需要换一条文字指令。当然目前这套系统仍有未竟之处通才版本相比各专才版本仍有差距特别是在需要精确坐标输出的稀疏任务上。数据也还主要依赖合成真实世界数据的多模态标注难题尚未彻底解决。但研究团队展示的数据和模型扩展规律表明随着投入的数据量和模型规模增加性能在稳步提升这为未来的发展指明了方向。假如视频生成模型的训练规模继续翻倍、再翻倍那个内置了越来越完整的世界物理模型的生成骨干所能赋予感知系统的能力边界现在还很难预见。有兴趣追踪这一方向的读者可以通过arXiv:2607.09024获取完整论文项目主页genception.github.io也提供了更多演示视频。---QAQ1GenCeption和普通视频生成AI有什么不同A视频生成AI比如Sora的目标是凭空创造出新视频。GenCeption则是把已经学会画视频的AI改造成能分析视频的感知工具——输入一段真实视频输出深度图、人体关键点、物体分割等理解结果。核心区别是一个生产内容一个理解内容但它们共享同一套对世界的底层知识。Q2用合成数据训练出来的模型在真实视频上真的管用吗A从GenCeption的实验来看效果确实出乎意料地好。该模型完全用电脑渲染的虚拟人物视频训练却在真实世界的人物、动物甚至机器人视频上都表现良好有些细节的输出质量甚至超过了合成训练数据本身。研究者认为这是因为视频生成预训练赋予了模型超越具体训练数据的抽象世界知识使得从合成到真实的迁移能够自然发生。Q3GenCeption的通才版本比专才版本性能差多少A差距因任务而异。在前景分割上通才版本反而略好于专才版本。在深度估计和相机姿态估计上通才版本在部分测试集上持平在另一些测试集上略差一点。差距最大的是三维人体关键点估计联合训练会明显拉低这个任务的表现。总体而言通才版本在保持多数任务高水平的同时个别任务存在一定代价。