标题Hy-Embodied-VLM-1.0: Efficient Physical-World Agents来源arXiv, 2607.12894v1️文章简介研究问题如何构建既具备强大物理世界感知与推理能力又满足低延迟部署需求的高效具身智能体主要贡献论文提出Hy-Embodied-VLM-1.0一种基于混合专家架构的高效具身基础模型在仅激活30亿参数的情况下于38个基准测试中超越同类模型实现了性能与效率的最佳平衡。重点思路构建以动作为核心的能力分类体系将具身智能划分为动作相关状态理解、动作转换推理、序列与自适应推理三个递进维度以此指导数据构建与评估。设计系统化的数据流水线涵盖预训练、监督微调及强化学习阶段引入深度推理、社会交互、轨迹监督及失败感知等高质量数据强化模型对物理因果与长程任务的理解。采用Hy3-A3B语言主干与Hy-ViT2视觉编码器结合混合专家架构在保持约300亿总参数容量的同时每次前向传播仅激活30亿参数显著提升推理效率。实施自进化后训练循环利用强化学习激发推理能力通过拒绝采样合成高质量思维链数据并重新训练模型最后进行奖励专项微调以融合连续与离散任务的优势。分析总结在38个涵盖感知、理解与推理的基准测试中该模型在19项上取得最佳成绩平均性能比前代模型提升8.4%优于Qwen3.6-A3B和Cosmos 3等强劲竞品。尽管激活参数量仅为前代大模型的十分之一其整体性能却与之相当证明了混合专家架构在具身场景下能有效兼顾模型容量与计算成本。在视觉语言导航任务中表现出色不仅在指令跟随导航中达到最先进水平还在零样本物体目标导航中展现出强大的空间记忆与长程规划能力。定性分析显示模型能准确识别物理属性、推断动作后果并在执行失败时进行诊断与恢复体现了从静态感知到动态适应的完整具身智能闭环。个人观点论文打破了传统视觉语言模型仅关注静态感知的局限建立了从状态理解到长程自适应的动作中心能力框架。
腾讯:具身智能基模Hy-Embodied-VLM-1.0
标题Hy-Embodied-VLM-1.0: Efficient Physical-World Agents来源arXiv, 2607.12894v1️文章简介研究问题如何构建既具备强大物理世界感知与推理能力又满足低延迟部署需求的高效具身智能体主要贡献论文提出Hy-Embodied-VLM-1.0一种基于混合专家架构的高效具身基础模型在仅激活30亿参数的情况下于38个基准测试中超越同类模型实现了性能与效率的最佳平衡。重点思路构建以动作为核心的能力分类体系将具身智能划分为动作相关状态理解、动作转换推理、序列与自适应推理三个递进维度以此指导数据构建与评估。设计系统化的数据流水线涵盖预训练、监督微调及强化学习阶段引入深度推理、社会交互、轨迹监督及失败感知等高质量数据强化模型对物理因果与长程任务的理解。采用Hy3-A3B语言主干与Hy-ViT2视觉编码器结合混合专家架构在保持约300亿总参数容量的同时每次前向传播仅激活30亿参数显著提升推理效率。实施自进化后训练循环利用强化学习激发推理能力通过拒绝采样合成高质量思维链数据并重新训练模型最后进行奖励专项微调以融合连续与离散任务的优势。分析总结在38个涵盖感知、理解与推理的基准测试中该模型在19项上取得最佳成绩平均性能比前代模型提升8.4%优于Qwen3.6-A3B和Cosmos 3等强劲竞品。尽管激活参数量仅为前代大模型的十分之一其整体性能却与之相当证明了混合专家架构在具身场景下能有效兼顾模型容量与计算成本。在视觉语言导航任务中表现出色不仅在指令跟随导航中达到最先进水平还在零样本物体目标导航中展现出强大的空间记忆与长程规划能力。定性分析显示模型能准确识别物理属性、推断动作后果并在执行失败时进行诊断与恢复体现了从静态感知到动态适应的完整具身智能闭环。个人观点论文打破了传统视觉语言模型仅关注静态感知的局限建立了从状态理解到长程自适应的动作中心能力框架。