具身智能概述:概念、VLM、VLN、VA、VLA、WM、WAM、VLX

具身智能概述:概念、VLM、VLN、VA、VLA、WM、WAM、VLX 概述2026年WAIC大会最热门的话题就是具身智能草草粗略翻完《具身智能从理论到实战》以及网络资源试图汇总梳理加深印象。具身智能Embodied AI智能体Agent的终极形态之一拥有物理实体如机器人、自动驾驶汽车突破数字世界束缚真正走入物理世界。目标让模型从看懂世界走向能在世界里行动再走向行动前能预判后果。具身智能被广泛认为是实现通用人工智能AGI的关键路径要求智能体在复杂物理世界中通过感知、推理与执行动作来完成长程任务。概念从感知理解到通用任务扩展的能力演进链概念全称主要解决什么问题典型输入典型输出VLMVision Language Model看懂图像/视频并用语言表达图像/视频文本描述、问答、检测结果、空间关系VLNVision Language Navigation根据语言指令在空间里走到目标第一视角图像路线指令路径、航点、导航动作VAVision Action从视觉直接到动作图像/视频状态轨迹、控制量、动作VLAVision-Language-Action按语言指令完成动作图像/视频语言机器人状态动作token、连续轨迹、action chunkWMWorld Model预测世界会怎样变化当前状态候选动作未来状态、未来视频、奖励/风险WAMWorld Action Model把动作和未来结果一起建模视频/状态目标/动作条件未来变化对应动作VLXVision-Language-X视觉语言模型向更多任务扩展图像/视频文本X模态导航、动作、定位、视频理解、控制等VLM偏感知理解VLN把视觉语言理解放进导航任务VA和VLA开始输出动作WM和WAM则进一步关注动作发生后世界会怎样变化。VLM、VLN、VLA、WM的使用相对稳定VA更像本文对“视觉到动作”路线的归纳VLX则用来指向视觉语言模型向更多具身任务扩展。VLM视觉语言模型负责把图像、视频和语言放到同一个语义空间里理解。输入通常是图像或视频再加上一段文本提示输出可以是图像描述、视觉问答答案、目标位置、空间关系或更结构化的检测结果。价值不只是给图像贴标签还能理解物体、位置、关系和场景含义。列举CLIP、PaLM-E、Gemini RoboticsVLN视觉语言导航关注智能体能不能一边看环境一边按自然语言路线走到目标位置。VLM让机器知道眼前有什么VLN让机器知道该往哪里走。和VLM相比VLN多“移动”和“停下”。VLM可能简单输出门在前方VLN要进一步判断现在该往哪里走走到哪里转弯什么时候停下来。经典VLN任务里智能体会拿到一条路线指令然后在陌生环境中通过第一视角观察一步步移动。如Room-to-Room这类任务中经常会出现类似指令上楼穿过正前方的拱门经过钢琴。当走廊尽头是画作和桌子时向右转。在挂在墙上的麋鹿鹿角旁等待。这类指令难在语言里的“上楼”“拱门”“钢琴”“右转”“等待”都要和第一视角画面、当前位置、历史路径对上模型还要记住自己走到了哪一步。核心难点语言和视觉要对齐局部视野下判断方向长路线中的进度记忆环境变化后的重新规划。拓展Room-to-Room、Foundation Models for Embodied Navigation。VA不一定需要语言。模型看到图像、视频和当前状态后直接预测动作、轨迹或控制量。自动驾驶里的端到端驾驶策略driving policy就接近这条路线摄像头看到道路、车辆、行人和车道线模型直接输出未来轨迹、转向、加速度或刹车。特点是链路短、延迟低适合任务边界清楚、数据覆盖充分的实时控制问题。局限也很直接模型能输出动作但不一定能解释依据遇到训练里没覆盖的长尾场景泛化和安全性都会变成问题。不同论文可能会写成end-to-end policy、behavior cloning、diffusion policy或driving policy。拓展Diffusion Policy机器人动作策略VLA可说是最常见的概念。相比VAVLA多了语言条件语言让VLA能处理更开放的任务。传统的机器人要么依赖于复杂的编程要么受限于特定任务的强化学习难以适应千变万化的现实世界。LLM和VLM的成功催生VLA这类模型旨在将视觉感知、语言理解和物理动作融为一体。综述性论文对应开源GitHub617 Star31 Fork库。通用架构图直观地展示VLA模型的核心工作流程接收状态State如摄像头捕捉的图像和指令Instruction如用户的语言命令作为输入通过视觉编码器和语言编码器进行处理最终由动作解码器Action Decoder生成机器人需要执行的动作Action。整个系统还与强化学习、世界模型等重要相关技术紧密相连。从单模态模型到VLA模型的发展时间线单模态模型的奠基CV从ResNet、ViT到SAMCV模型提供强大的视觉感知能力让AI能看懂世界。NLP从GRU、Transformer到BERT、ChatGPTNLP模型让AI能听懂人类语言。RL从DQN、AlphaGo到决策TransformerDTRL为AI提供从试错中学习最优策略的理论框架。多模态模型兴起VLM以CLIP、LLaVA为代表将视觉和语言两种模态对齐实现看图说话、视觉问答等功能为VLA的出现奠定基础。VLA模型的诞生与发展底层控制策略Control Policy早期工作如CLIPort将VLM的能力与机器人控制相结合。RT-1、VIMA等模型利用Transformer架构将机器人控制问题转化为序列预测问题极大提升模型泛化能力。高层任务规划器Task Planner如SayCan、PaLM-E利用LLM强大的推理能力将复杂的长时程任务分解为一系列简单的子任务指导底层控制器逐步执行。概念正式提出RT-2模型正式提出VLA术语。视觉编码器的好坏直接决定VLA模型对环境的感知能力。一个好的PVRs能从输入的图像中提取出物体的类别、姿态、几何形状等关键信息。常用的PVRs方法如CLIP、R3M、MVP、DINOv2等。视觉编码器类型如ResNet、ViT训练目标如视觉-语言对比学习VL-CL、时间对比学习Time-CL、掩码自编码器MAECLIP通过在海量图文对上进行对比学习学习到强大的图文对齐能力使其成为许多VLA模型的首选视觉编码器。R3M和VIP专注于从视频数据中学习采用时间对比学习Time-contrastive learning核心思想在同一段视频中时间上相近的帧在表征空间中也应该相近而时间上相远的帧则应该被推开。这使得模型能够学习到物体的动态变化和时间连贯性。基于MVP和MAE方法借鉴NLP中BERT的成功经验采用掩码自编码Masked Autoencoding 的方式进行自监督学习。随机遮挡输入图像的一部分patches然后训练模型去重建被遮挡的内容。迫使模型学习到图像的底层结构和细节对于需要精细操作的机器人任务尤其有用。DINOv2和I-JEPA最新的自监督学习方法通过知识蒸馏等技术在不依赖大规模标注数据的情况下学习到媲美甚至超越有监督学习的视觉表征潜力巨大。任务规划器主要分为两大类整体式规划器(Monolithic Planners)通常是端到端的大型多模态模型如PaLM-E。直接接收视觉和语言输入生成任务计划。能力强大但训练和部署成本高昂。模块化规划器(Modular Planners)更加灵活将LLM和VLM等模块组合起来无需大量重新训练。模块化任务规划器的两种主流方法。基于语言(Language-based)以自然语言作为不同模块间信息交换的通用语。物体检测模块将检测到的物体以文本形式告知LLMLLM再根据这些信息生成下一步的自然语言指令。代表Inner Monologue基于代码(Code-based)利用LLM强大的代码生成能力。将感知和控制模块封装成API函数如detect_objects()pick(obj)。LLM通过生成一段Python代码来调用这些API从而完成任务规划。这种方法可控性强易于调试。代表作ProgPrompt和CaP主要难点动作怎么表示token、连续轨迹、扩散策略、flow matching都在被尝试数据从哪里来机器人动作轨迹要真实设备、遥操作和安全场地跨本体怎么做机械臂、夹爪、移动底盘、人形机器人动作空间差别很大实时性和安全怎么保证机器人不能慢慢想每一步也不能只靠语言推理保证安全VLA现在很受关注但还远没有到一个模型解决所有机器人任务的程度。π0.7π0https://www.physicalintelligence.company/blog/pi0当前挑战安全第一在物理世界中安全是机器人应用的首要考量数据集与基准仍然缺乏覆盖多样化场景、任务和机器人的大规模、高质量数据集模型泛化如何训练出能够泛化到新物体、新环境、新任务的通用VLA基础模型仍然是一个开放性问题实时性当前的大型VLA模型推理速度较慢难以满足动态环境下的实时交互需求长时程任务现有的分层框架虽然实用但增加了系统复杂性容易出现故障未来趋势更强的基础模型构建规模更大、能力更强的VLA基础模型类似NLP领域的GPT-4多模态融合不仅仅是视觉和语言未来将融合触觉、听觉、力觉等更多模态的信息高效的实时推理研究模型压缩、量化、蒸馏等技术在保证性能的同时提升模型的推理速度更广阔的应用场景从目前的家庭、工业场景拓展到医疗手术机器人、特种服务护理机器人等更具挑战性的领域数据集汇总一些基准测试数据集BC-ZRT-1-KitchenBridgeData V2V-JEPA 2OXEOpen X-Embodiment通过聚合来自22种不同机器人的数据达到百万级别的轨迹数量。仿真环境为了解决真实世界数据采集难的问题许多研究者转向仿真环境。仿真环境可大规模、低成本地生成数据并提供精确的评测指标但也面临着Sim-to-Real Gap仿真到现实的鸿沟的挑战。iGibsonAI2-THORRLBenchCALVINOpenVLAhttps://openvla.github.io使用视觉编码器接收图像再用语言模型主干融合视觉和语言上下文最后输出动作Token。RT-2https://robotics-transformer2.github.io核心思路把机器人动作离散成Token让视觉语言模型直接学习输出动作把互联网图文知识和机器人控制接起来。WM世界模型要回答的问题如果现在这样做接下来会发生什么。早期的经典论文Recurrent World Models Facilitate Policy Evolution对应项目主页类比认知科学中人脑的心智模型mental model提出的智能体模型包含三个组件视觉感知组件V可将它所看到的画面压缩成一小段代码表示记忆组件M可根据历史信息预测未来的代码控制器C决策组件根据视觉和记忆组件的表示来决定采取什么行动。主要包含状态表征和预测模型正好对应心智模型中的mental representations和mental simulation状态表征环境提供高维观察作为输入纵向V-z将每个输入帧压缩成抽象表示低维特征向量预测模型水平的M-h-M-h是以序列方式预测下一个时刻的表征用RNN实现V、M、C与环境交互强化学习使AI能够随着时间的推移改进其决策。强化学习算法可分为无模型model-free通过大量与环境交互的试验来了解哪些行为在不同情况下是成功的有模型model-based即世界模型在基于世界模型的强化学习中智能体首先学习一个关于环境的内嵌模型从中学习行为决策并用于规划从而提高在真实环境中的表现。世界模型可以从更少的交互中学习促进离线数据的概括支持前瞻性探索并允许在多个任务中重用知识。世界模型也可称为预测动力学模型对于决策十分重要核心任务是预测智能体特定的行动下世界状态的变化即尝试建模世界的状态转换函数。如果能获得准确的世界模型就能在其中反复试错找到现实最优决策。综述性论文对应开源GitHub339 Star15 Fork库。提出一个以功能、时间建模和空间表示三个核心维度为中心的框架在功能层面区分决策耦合模型与通用模型在时间层面区分序列仿真与推理和全局差异预测在空间层面涵盖从潜在特征到显式几何结构及神经场的多种表示方式。为现有方法提供统一的组织结构并整合标准化数据集与评估指标有助于实现定量比较为未来研究提供全景式且可操作的知识地图。从数据与评估、计算效率、建模策略三个维度全面探讨具身智能中世界模型面临的挑战和未来研究方向。数据与评估挑战具身智能领域缺乏统一的大规模数据集现有数据分散且特定于领域限制模型的泛化能力。评估指标多关注像素保真度忽视物理一致性和因果关系。未来方向需构建统一的多模态、跨域数据集改进评估框架全面评估物理一致性、因果推理和长时域动态。计算效率挑战Transformer和扩散网络虽性能强大但高推理成本与机器人实时控制需求冲突。传统方法虽高效但在捕捉长期依赖性上有限。未来方向利用量化、剪枝和稀疏计算等技术优化模型架构探索状态空间模型等新型时间方法以提升实时效率和长期推理能力。建模策略挑战世界模型在长时域时间动态和高效空间表示上存在困难自回归设计与全局预测方法各有优缺点时间和空间建模存在效率与表达力的权衡。未来方向结合自回归和全局预测方法通过显式记忆或任务分解提高时间一致性。优化长距离推理和生成保真度将时间和空间建模集成到统一架构中平衡效率、保真度和交互性。分类多种分类方式决策耦合区分决策耦合和通用型世界模型。决策耦合模型是任务特定的学习动态以优化特定的决策任务。通用型模型是任务无关的模拟器专注于广泛的预测从而实现对各种下游应用的泛化。时间推理区分两种不同的预测范式。序列仿真与推断模型以自回归的方式模拟动态过程逐步展开未来状态。全局差异预测直接并行估计整个未来状态虽然效率更高但可能以降低时间一致性为代价。空间表示包括当前研究中用于建模空间状态的四种主要策略全局潜在向量表示将复杂的世界状态编码为紧凑的向量从而在物理设备上实现高效的实时计算Token特征序列表示将世界状态建模为Token序列重点在于捕捉Token之间的复杂空间、时间及跨模态依赖关系空间潜在网格表示通过利用几何先验如鸟瞰图BEV特征或体素网格将空间归纳偏置融入世界模型中分解渲染表示将三维场景分解为一组可学习的基元例如三维高斯点阵3DGS或神经辐射场NeRF然后利用可微分渲染实现高保真度的新视角合成。数据资源为了满足具身智能的多样化需求将数据资源分为四类仿真平台、交互式基准、离线数据集和真实机器人平台。仿真平台为世界模型的训练和评估提供可控且可扩展的虚拟环境。MuJoCo可定制的物理引擎因其在机器人学和控制研究中对连杆系统及接触动力学的高效仿真而被广泛采用NVIDIA Isaac端到端、基于GPU加速的仿真栈包含Isaac Sim、Isaac Gym以及Isaac Lab。提供逼真的渲染效果和大规模强化学习能力CARLA基于Unreal Engine的开源模拟器用于城市自动驾驶提供逼真的渲染、多样化的传感器以及闭环评估协议Habitat高性能的具身智能模拟器专注于逼真的三维室内导航交互式基准提供标准化的任务套件和协议用于对世界模型进行可重复的闭环评估。DeepMind ControlDMC基于MuJoCo的标准控制任务套件为从状态或像素观测中学习的智能体提供统一的比较基础Atari一套基于像素、离散动作的游戏合集用于评估智能体性能。Atari100k 通过将交互限制在100k步内专门评估样本效率Meta-World用于多任务和元强化学习的基准包含50种多样化的机器人操作任务使用MuJoCo中的Sawyer机械臂并遵循标准化的评估协议RLBench提供100个模拟的桌面操作任务具有稀疏奖励和丰富的多模态观测旨在测试复杂技能和快速适应能力LIBERO一个用于持续学习机器人操作的基准提供130个程序生成的任务和人类示范以评估样本高效性和持续学习能力nuPlan一个自动驾驶规划基准采用轻量级闭环模拟器和超过1500小时的真实世界驾驶日志来评估长时程性能离线数据集大规模预先收集的轨迹消除交互式滚动采样为世界模型的可复现评估和数据高效预训练提供基础数据集名称类型/领域数据规模与内容描述特点与用途RT-1机器人操作17个月收集13台机器人700任务13w条示范语言图像输入11-DoF动作支持语言指令与视觉感知的多模态机器人学习OpenX-Embodiment(OXE)跨形态机器人21机构60数据源22种形态527项技能100万轨迹统一格式支持跨机器人平台训练提升模型泛化能力nuScenes自动驾驶感知1K场景20s波士顿新加坡6摄像头5雷达1激光雷达GPS/IMU23类3D标注HDMap多模态融合、3D感知、长时程预测基准Waymo自动驾驶感知1,150场景20s10Hz旧金山凤凰城山景城5激光雷达5摄像头1,200万3D/2D标注大规模真实场景3D目标检测与轨迹预测Occ3D自动驾驶占据预测Occ3D-nuScenes4w帧0.4m分辨率Occ3D-Waymo20w帧0.05m分辨率体素级占据标签超越边界框的细粒度场景理解OpenDV自动驾驶视频-文本2,059小时6,510万帧YouTube7公开数据集40国家244城市带命令与上下文标注支持语言与动作条件下的视频预测与规划Something-Somethingv2视频动作理解220,847视频片段174类文本提示生成如“将某物放入某物”训练/验证/测试集划分明确细粒度动作识别强调时序推理与语言-动作对齐VideoMix22M自监督预训练2,200万样本来源YT-Temporal-1B、HowTo100M、Kinetics、SSv2、ImageNet转视频用于视频自监督预训练支持V-JEPA等模型训练HM3D(Habitat-Matterport3D)室内仿真具身智能1k室内场景112,500m²可导航面积面向Habitat平台含元数据与资源包支持大规模室内导航与具身AI研究提升场景多样性与仿真真实性现实世界中的机器人平台为交互提供物理实现支持闭环评估、高保真度的数据采集以及在真实环境约束下的S2R验证。Franka Emika7-DoF协作机械臂全关节内置扭矩传感器支持1kHz力矩控制专为精细力控与接触密集型任务设计提供官方ROS包与Franka Control Interface即插即用是力控操作与操作学习研究的标配桌面平台。Unitree Go1低成本小型四足机器人12关节电机驱动最高速度4.7 m/s机载1.5 TFLOPS计算盒全景深度相机可高帧率感知开放ROS/C/Python SDK已成为运动控制、步态学习和具身导航领域的事实标准平台。Unitree G1轻量化人形机器人全身43-DoF膝关节峰值扭矩120 N·m集成3D LiDAR、深度摄像头、可换电池与机载计算支持ROS与多语言SDK提供多模态感知与全身控制接口为训练和评估具身世界模型提供可落地的实体测试环境。指标用于评估世界模型性能的指标这些指标从像素预测质量、状态级理解到任务表现涵盖了从低级信号保真度到高级目标达成的多个层面。像素生成质量Fréchet 初始化距离FID比较真实图像和生成图像在预训练模型特征空间中的分布值越低表示分布越接近。Fréchet 视频距离FVD扩展 FID 到视频评估每帧质量及时间一致性值越低表示外观和动态分布越接近。结构相似性指数测量SSIM比较生成图像与参考图像的亮度、对比度和结构值越接近 1 表示相似性越高。峰值信噪比PSNR衡量重建图像与参考图像的像素级失真值越高表示保真度越高。学习感知图像块相似性LPIPS通过比较预训练网络的特征衡量生成图像与参考图像的感知相似性值越低表示相似性越高。VBench综合评估视频生成的多个维度包括视频质量和条件一致性提供细粒度的性能评估。状态级理解平均交并比mIoU评估语义分割的准确性通过平均各类别的交并比来衡量值越高表示场景理解越精确。平均精度均值mAP评估检测和实例分割的准确性通过平均每个类别的平均精度来衡量值越高表示识别和定位越准确。位移误差评估关键点、物体中心和轨迹航点的空间精度包括平均位移误差ADE和最终位移误差FDE值越低表示定位越准确。查准距CD量化预测与真实情况之间的几何相似性适用于表面、占用、鸟瞰视图和三维结构的评估值越低表示相似性越高。任务表现成功率SR衡量在具身环境中完成任务的比例值越高表示性能越好。样本效率SE衡量达到目标性能所需的样本数量值越低表示样本效率越高。奖励在强化学习中衡量代理在时间步 t 的表现通过累积奖励或平均回报来评估值越高表示性能越好。碰撞率衡量在导航或自动驾驶中发生碰撞的比例值越低表示安全性越高。DreamerGenieNVIDIA Cosmos官网World Labs官网正在开发一种能够理解三维物理世界的模型本质上是对物体的物理特性、空间位置和功能的理解和模拟。WAM世界动作模型WAMVLAWM把动作生成和未来预测放进同一个模型里不只学习动作是什么还学习动作如何改变世界。论文VLXVLX还不是一个完全统一的学术类别更适合用来理解趋势视觉语言能力正在继续外接到更多任务。X不是固定答案还可以是detection甚至是更复杂的具身任务输出。Omniverse英伟达推出的Isaac仿真平台可用于生成仿真数据。Isaac Sim 3.0 平台基于其强大的 GPU 算力及先进的仿真技术赋予了机器人操控现实世界物体的能力通过构建高度逼真的虚拟环境让机器人能在其中反复训练并将技能迁移至现实。谷歌DeepMind 的 RT-1 和 RT-2 模型借助 Transformer 架构在序列处理上的优势成功实现对真实机械臂的精准控制大幅提升机械臂操作的灵活性与准确性。微软则巧妙地将具身智能技术融入 Mesh 平台利用混合现实技术致力于构建沉浸式虚拟世界让虚拟智能体与现实环境产生交互。CloudRobo华为云推出整合数据合成、数据标注、模型开发、仿真验证、云边协同部署以及安全监管等端到端能力提供具身多模态生成大模型、具身规划大模型、具身执行大模型三大核心模型加速具身智能创新。面对具身智能领域机器人品类多、传感器类型多、接口协议多等挑战华为云提出了机器人到云的联接协议R2CRobot to Cloud希望与机器人伙伴与行业组织共同打造R2C开放协议让更多的机器人本体能够拥有高效安全的智能。