2026年7月WAIC一场由商汤科技首席科学家林达华主持的基座大模型架构创新与生态合作论坛上五位首席科学家围绕多模态展开了一场激烈辩论。辩论的核心问题是多模态到底只是大语言模型能力边界的延伸还是下一代智能真正的起点一、三种立场三种未来林达华开场便指出如今最先进的大模型几乎都已经把多模态理解能力变成标配能力。但标配之后分歧才刚刚开始。立场一语言是核心多模态是外挂。复旦大学邱锡鹏教授的观点鲜明智能还是要依赖语言的。他认为多模态未来的发展重点不是取代语言而是如何把多模态信息与语言真正对齐。在他看来今天的大模型距离真正理解世界还相差很远。模型真正欠缺的不只是多模态而是Context——这里的Context是指真实世界复杂情境的理解能力。未来模型面对的不只是更多图片、更多视频而是如何把现实世界复杂情境转化成模型能够理解的信息。立场二多模态是下一代智能的范式。达摩院首席科学家赵德丽持截然不同的观点。他从更宏大的视角总结出通向智能的四条路径大语言模型、走向开放空间的机器人、基于数字生命的模拟、基于神经信号的交互。这四条路径有一个共同特点——都与人类产生智能的源头信号有关而且全都是多模态的没有一个单一模态。大语言模型是知识的压缩视频生成模型也是人类行为的压缩和记录。赵德丽举了猎豹捕猎、蚂蚁寻路的例子——这些高超的技能都不是通过语言学习的而是通过与环境的交互、模仿、反馈。他更进一步指出物理世界需要的是四维因果关系的建模——物理空间、物理属性、因果关系、动作与运动——而大语言模型只是一维的。因此无论从智能生发的原理还是算法的逻辑基于多模态的模型都是下一代智能的范式。立场三核心不是语言还是视觉而是学习范式。阶跃星辰首席科学家张祥雨把焦点从模态之争转向了学习范式之争。他认为核心问题是怎么让智能体学会自主学习或者叫后天学习、在线学习。这个不解决你不管是走语言还是视觉其实都是一样的。为什么语言模型今天看起来更成功张祥雨认为我们现在的训练数据是静态的是经过人类大量收集、清洗、整理得到的。语言天生信息密度高在这种模仿学习范式下自然占优势。二、从多模态到全模态技术路线在收敛尽管学术圈还在争论多模态的终极地位产业界已经在用脚投票。腾讯在2026年7月宣布将混元多模态模型部门与大语言模型部门合并成立基础模型部统一由腾讯首席AI科学家姚顺雨管理。以混元大语言模型为基础腾讯构建了图像、视频、语音、3D生成模型等完整的模型矩阵。智元机器人发布的WITA-Omni Preview具身大模型则更进一步。在中训练阶段该模型使用总计千万小时级的开源和自有多模态数据将强文本、视觉底座进一步升级为能够听得见、看得懂并进行音画联合推理的全模态模型。三、世界模型多模态的终极形态如果说多模态是让AI看得见、听得懂那么世界模型就是让AI理解世界为什么这样运转。智源研究院发布的智源悟界·RoboBrain Orca突破现有大模型仅预测文本、画面、动作单模态输出的技术路径率先实现对整体世界状态的前后演化推演。当输入视频、图片、文字指令、事件描述等任意多模态信息后模型可将视觉、语言、任务意图等多元信号统一整合自主学习物体运动规律、场景演变逻辑、动作因果关联、事件时序关系。这已经超越了多模态的范畴——它不是在处理多种模态的输入而是在构建一个关于世界如何运转的内部模型。这或许才是多模态技术的终极形态。四、一点判断多模态是外挂还是灵魂这个问题的答案可能取决于你问的是哪个时间尺度。短期1-3年多模态是大语言模型的能力延伸。绝大多数应用场景中语言模型仍然是核心多模态是锦上添花的外挂。中期3-5年多模态正在成为标配。最先进的大模型已经把多模态理解能力变成标配能力。当所有模型都具备多模态能力时多模态这个词本身就会失去区分度。长期5-10年如果AI真的要走向物理世界、要理解因果、要构建世界模型那么多模态就不是外挂而是灵魂。物理世界本身就是多模态的一个只能处理语言的智能体永远无法真正理解这个世界。
多模态是“外挂“还是“灵魂“?——2026年多模态大模型的路线之争
2026年7月WAIC一场由商汤科技首席科学家林达华主持的基座大模型架构创新与生态合作论坛上五位首席科学家围绕多模态展开了一场激烈辩论。辩论的核心问题是多模态到底只是大语言模型能力边界的延伸还是下一代智能真正的起点一、三种立场三种未来林达华开场便指出如今最先进的大模型几乎都已经把多模态理解能力变成标配能力。但标配之后分歧才刚刚开始。立场一语言是核心多模态是外挂。复旦大学邱锡鹏教授的观点鲜明智能还是要依赖语言的。他认为多模态未来的发展重点不是取代语言而是如何把多模态信息与语言真正对齐。在他看来今天的大模型距离真正理解世界还相差很远。模型真正欠缺的不只是多模态而是Context——这里的Context是指真实世界复杂情境的理解能力。未来模型面对的不只是更多图片、更多视频而是如何把现实世界复杂情境转化成模型能够理解的信息。立场二多模态是下一代智能的范式。达摩院首席科学家赵德丽持截然不同的观点。他从更宏大的视角总结出通向智能的四条路径大语言模型、走向开放空间的机器人、基于数字生命的模拟、基于神经信号的交互。这四条路径有一个共同特点——都与人类产生智能的源头信号有关而且全都是多模态的没有一个单一模态。大语言模型是知识的压缩视频生成模型也是人类行为的压缩和记录。赵德丽举了猎豹捕猎、蚂蚁寻路的例子——这些高超的技能都不是通过语言学习的而是通过与环境的交互、模仿、反馈。他更进一步指出物理世界需要的是四维因果关系的建模——物理空间、物理属性、因果关系、动作与运动——而大语言模型只是一维的。因此无论从智能生发的原理还是算法的逻辑基于多模态的模型都是下一代智能的范式。立场三核心不是语言还是视觉而是学习范式。阶跃星辰首席科学家张祥雨把焦点从模态之争转向了学习范式之争。他认为核心问题是怎么让智能体学会自主学习或者叫后天学习、在线学习。这个不解决你不管是走语言还是视觉其实都是一样的。为什么语言模型今天看起来更成功张祥雨认为我们现在的训练数据是静态的是经过人类大量收集、清洗、整理得到的。语言天生信息密度高在这种模仿学习范式下自然占优势。二、从多模态到全模态技术路线在收敛尽管学术圈还在争论多模态的终极地位产业界已经在用脚投票。腾讯在2026年7月宣布将混元多模态模型部门与大语言模型部门合并成立基础模型部统一由腾讯首席AI科学家姚顺雨管理。以混元大语言模型为基础腾讯构建了图像、视频、语音、3D生成模型等完整的模型矩阵。智元机器人发布的WITA-Omni Preview具身大模型则更进一步。在中训练阶段该模型使用总计千万小时级的开源和自有多模态数据将强文本、视觉底座进一步升级为能够听得见、看得懂并进行音画联合推理的全模态模型。三、世界模型多模态的终极形态如果说多模态是让AI看得见、听得懂那么世界模型就是让AI理解世界为什么这样运转。智源研究院发布的智源悟界·RoboBrain Orca突破现有大模型仅预测文本、画面、动作单模态输出的技术路径率先实现对整体世界状态的前后演化推演。当输入视频、图片、文字指令、事件描述等任意多模态信息后模型可将视觉、语言、任务意图等多元信号统一整合自主学习物体运动规律、场景演变逻辑、动作因果关联、事件时序关系。这已经超越了多模态的范畴——它不是在处理多种模态的输入而是在构建一个关于世界如何运转的内部模型。这或许才是多模态技术的终极形态。四、一点判断多模态是外挂还是灵魂这个问题的答案可能取决于你问的是哪个时间尺度。短期1-3年多模态是大语言模型的能力延伸。绝大多数应用场景中语言模型仍然是核心多模态是锦上添花的外挂。中期3-5年多模态正在成为标配。最先进的大模型已经把多模态理解能力变成标配能力。当所有模型都具备多模态能力时多模态这个词本身就会失去区分度。长期5-10年如果AI真的要走向物理世界、要理解因果、要构建世界模型那么多模态就不是外挂而是灵魂。物理世界本身就是多模态的一个只能处理语言的智能体永远无法真正理解这个世界。