GS-Agent:基于生成式仿真构建四维物理世界

GS-Agent:基于生成式仿真构建四维物理世界 GS-Agent基于生成式仿真构建四维物理世界论文原始链接https://arxiv.org/html/2607.21522v1摘要利用自然语言生成动态、物理真实的四维3D空间时间虚拟世界兼具巨大价值与技术难点。传统计算机图形管线高度依赖人工调整材质、运动、渲染参数现有生成式大模型虽可直接由文本输出4D内容但普遍存在物理真实性差、可控性不足两大缺陷。本文提出GS-Agent端到端多智能体框架将物理引擎纳入智能体迭代循环模仿人类影视/游戏场景制作全流程自动生成四维物理仿真世界。GS-Agent将世界生成任务拆解为两大核心模块实体管理3D资产检索/生成、材质调参、物体摆放、运动控制、渲染配置相机与灯光调度。三类专业智能体通过代码与物理引擎交互接收多模态图像/仿真反馈协同迭代最终产出符合文本描述、具备流体/可变形体/刚体真实物理交互的动态场景并支持电影级运镜与光影设计。在牛顿物理基准、复杂多物体交互场景上开展完整实验相比Sora2、Wan2.2等文生视频模型、SWE-Agent类代码智能体基线GS-Agent生成结果物理一致性、文本指令匹配度、精细可控性全面领先同时框架可自主检测仿真故障并完成修复。本工作为生成式物理世界构建提供全新范式赋能内容创作与具身AI仿真数据生成。图1 GS-Agent整体效果展示GS-Agent接收自然语言输入生成具备真实物理交互的四维仿真世界支持刚体、可变形物体、流体耦合模拟同时输出电影级相机与灯光画面。框架不止输出像素视频还同步输出深度图、法向图、粒子动力学等多模态结构化仿真数据可直接用于机器人训练等下游任务。1 引言动态、物理可信的四维仿真世界在具身智能、自动驾驶、游戏、影视制作领域具备广泛应用价值高质量仿真环境可安全、低成本训练机器人智能体大幅缩小仿真到现实sim-to-real差距同时自然语言驱动的世界生成可降低内容创作门槛拓展叙事与交互内容形式。现有技术路线存在明显短板传统人工管线需人工完成3D资产整理、材质调试、场景搭建、物体运动编排、相机灯光设计人力成本极高纯生成式文生视频/3D模型Sora、Wan、4D-Fy等扩散模型仅从像素数据学习难以严格遵循物理守恒定律物体碰撞、流体形变等动态过程易出现违背常识的失真且用户难以精细控制物体、镜头时序行为3代码智能体如Blender专用Agent仅能生成静态3D场景缺少完整实时物理仿真闭环无法处理多材料动态交互。本文创新思路模仿人类场景导演工作流采用大模型多智能体架构将物理引擎嵌入迭代优化循环全程通过仿真反馈修正场景参数。本文三大核心贡献提出GS-Agent端到端多智能体框架以物理引擎为底层支撑全自动完成自然语言到四维动态物理世界的全流程构建复刻专业影视/游戏制作流水线设计三层分工智能体体系总管智能体/实体智能体/渲染智能体配套标准化智能体-仿真交互工具接口智能体通过代码调用仿真、接收多模态反馈协同迭代优化场景在两套评测集开展量化人工用户评测验证GS-Agent在物理真实性、文本对齐度、镜头可控性上全面超越主流基线框架具备自主故障修复、细粒度自然语言调控能力同时可输出结构化仿真数据支撑具身AI训练。图2 GS-Agent系统总架构总管智能体解析文本、拆解子任务并分发至实体/渲染智能体实体智能体负责3D资产、材质、物体运动渲染智能体控制相机、灯光与视频录制。智能体通过消息工具互通统一标准化接口调用Genesis物理引擎最终输出可执行仿真代码与渲染视频。完整工具定义见附录B。2 相关工作2.1 3D/4D场景生成早期文本生成3D方案依赖规则映射现代方法基于扩散、高斯泼溅等生成模型从海量数据学习场景几何但普遍忽略物理动力学约束。近期工作引入物理求解器提升动态真实性但大多仅生成单段视频帧。区别于现有单模型/单智能体方案GS-Agent采用多智能体分层架构内置完整实时物理引擎闭环全程迭代校验动力学一致性规避纯视觉生成模型泛化缺陷。2.2 文生视频模型主流文生视频基于扩散Transformer架构部分工作引入物理先验但仍存在时序不一致、物理违背、镜头难以精准控制三大痛点。GS不直接生成像素而是基于确定性物理仿真渲染画面从底层保证运动、碰撞、流体行为严格遵循物理守恒从根源解决时序失真。2.3 大模型智能体现有大模型智能涵盖文本工具、GUI操作、机器人控制、代码生成等方向部分Blender专用智能体仅支持静态3D场景制作。GS-Agent是首个内置统一物理引擎、全自动生成完整四维动态世界的多智能体框架。3 GS-Agent内置生成式仿真的多智能体框架人类专业场景制作流程为导演拆解需求、分配建模/动画/渲染任务、反复预览迭代修正。GS-Agent复刻该流程设计三类专业化智能体协同工作底层基于Genesis物理引擎完成所有仿真计算。本章先介绍物理引擎基础组件再分模块说明三类智能体完整功能。3.1 底层物理引擎核心组件GS后端采用Genesis通用物理仿真引擎三大核心模块实体Entity实体统一定义格式E(几何形态Morph,物理材质Material,视觉表面Surface)E(\text{几何形态Morph},\text{物理材质Material},\text{视觉表面Surface})E(几何形态Morph,物理材质Material,视觉表面Surface)Morph网格/基础几何体定义物体外形Material区分刚体、可变形体、流体决定动力学求解方案Surface纹理、颜色等视觉属性附加参数初始速度、外力、运动约束、粒子发射器等动态控制参数。动力学求解器Solver根据材质自动匹配求解算法刚体标准刚体求解可变形连续介质MP物质点法流体SPH光滑粒子流体动力学支持自定义仿真步长、分辨率平衡仿真精度与计算速度。渲染器Renderer独立于仿真计算模块包含相机位置/视角/视场、光源方向光/球形/环境HDR、阴影三大可调模块支持光栅实时预览、光线追踪高质量输出。3.2 总管智能体Manager Agent全局调度核心承担四大功能任务拆解与分发读取用户自然语言需求推理所需全部场景组件生成分步执行计划逐个将子任务下发实体/渲染智能体每轮子任务完成后校验仿真结果不达标则触发迭代修正。全局仿真配置提前/运行中调整全局仿真超参重力、仿真子步、MPM网格分辨率、SPH粒子尺寸、阴影/分割可视化等保证仿真稳定、便于智能体视觉调试。仿真时间线控制支持推进仿真步数、重置场景分步查看中间动态效果全部组件校验通过后触发完整仿真与视频录制。跨智能体通信通过SendMessage工具向实体、渲染智能体下发文字指令接收反馈并决策下一步优化方向。3.3 实体智能体Entity Agent负责场景内全部物体的创建、材质、运动控制五大核心能力3.3.1 3D资产检索内置BlenderKit、PolyHaven开源资产库采用CLIP文本图像联合嵌入构建语义检索索引输入文本即可匹配匹配度最高的网格模型同步返回模型路径、包围盒、预览图。3.3.2 3D资产生成资产库无匹配模型时调用Meshy文生3D接口生成网格多次生成失败自动降级为立方体、球体等基础几何体搭建物体。3.3.3 实体空间摆放读取资产包围盒信息自动缩放、对齐物体世界坐标保证无穿插、合理间距摆放完成后请求渲染智能返回视觉截图检测碰撞、错位并迭代修正。3.3.4 物理材质调参核心创新传统3D工具材质参数调参门槛极高GS自动迭代优化基于常识初始化杨氏模量、泊松比、塑性屈服应力等物理参数运行仿真读取形变、流体动态反馈反向微调参数同步匹配MPM/SPH求解器分辨率保证仿真数值稳定。3.3.5 实体运动控制支持PD控制器、直接力/速度指令、粒子发射器三类运动脚本可编写时序运动逻辑在统一仿真时间轴内执行刚体位移、流体喷射等动态事件。3.4 渲染智能体Render Agent负责全部视觉输出与镜头灯光设计三大模块相机定位解析用户镜头描述远景、特写、侧拍等读取实体世界坐标自动设置相机三维位置、朝向、视场角时序相机轨迹与视频录制将运镜逻辑编写为可执行代码环绕、推拉、跟随物体与仿真步数同步录制画面轨迹代码可独立修改无需重新运行物理仿真灯光系统配置支持方向光、球形光源、HDR环境光调整位置、强度、色温匹配场景氛围规避画面过曝、阴影失真等渲染瑕疵。3.5 智能体统一交互机制跨智能体通信全局SendMessage工具携带文字指令可选截图/视频仿真调用接口标准化工具集附录B完整工具列表智能体仅调用封装接口无需编写底层仿真代码迭代闭环每轮操作后获取仿真数值、渲染图像、视频多模态反馈自动判断是否符合文本需求循环优化直至达标。4 实验部分4.1 实验配置4.1.1 两套评测数据集NewtonGen基准24组场景覆盖抛物线运动、弹性形变等12类基础物理定律量化物理一致性自制复杂场景集30组流体、软体、刚体多物体碰撞、动态镜头等高难度复合任务。4.2 评测指标State-PIS 物理不变性得分核心指标直接读取物理引擎每一帧物体质心、速度真值计算能量、加速度等守恒量标准差分数越高物理越真实传统文生视频仅能通过图像分割计算Video-PIS精度更低文本对齐得分感知编码器对比文本与生成视频视觉特征相似度美学指标采用VBench官方美学打分标准。4.3 对比基线文生视频模型Sora2闭源SOTA、Wan2.2开源SOTA代码智能基线原生SWE-Agent、增加视觉反馈增强版SWE-Agent w/ Visual4.4 实现细节底层物理引擎Genesis大模型基座统一使用GPT-5所有输出统一720p分辨率用于公平对比GS原生支持更高分辨率渲染。4.2 主实验量化结果表1 自动量化指标对比模型Video-PISState-PIS文本对齐得分美学得分Sora20.62-30.648.5Wan2.20.46-29.8SWE-Agent0.410.4425.842.0SWE-Agent视觉增强0.490.5726.844.6GS-Agent本文0.710.8332.247.6结论GS-Agent物理不变性、文本匹配度显著超越全部基线美学分数仅略低于闭源Sora2。表2 人工用户调研15名受试者5分李克特量表270份有效问卷模型物理真实性相机可控性内容匹配度画面美学Sora24.013.924.654.18Wan2.22.723.494.453.71SWE-Agent3.183.493.402.40SWE-Agent视觉增强3.253.963.722.44GS-Agent4.334.324.703.86人工评测用户最认可GS的物理真实度与镜头控制能力纯扩散模型画面美学小幅领先但物理逻辑大量失真。定性对比结论文生视频模型仅表层匹配文字流体破碎、子弹穿水等场景违反流体力学镜头旋转后背景物体几何错乱SWE类代码智能体无法精准调参易出现材质、动力学错误文本指令完整匹配度不足GS依托实时物理引擎全程严格遵循动力学守恒镜头、物体均可自然微调同时支持完整多材料耦合仿真。4.3 框架特有涌现能力图4 自主仿真故障修复示例浴缸3D模型存在几何缝隙导致流体泄漏GS自动检测仿真异常生成刚性补丁修改模型几何无需人工介入完成修复。图5 细粒度自然语言操控示例支持自然语言指令修改渲染、新增物体、调整物体速度等精细化操作降低专业仿真使用门槛。4.4 消融实验与基座测试表3 不同大模型基座性能基座模型State-PIS文本对齐美学GPT-50.8329.947.6Gemini3-Pro0.8128.245.7Qwen3.5-27B0.6227.145.3框架兼容开源/闭源主流大模型开源27B模型仍可正常运行整套管线仅物理推理精度小幅下降。表4 架构消融实验方案State-PIS文本对齐美学完整GS-Agent0.8329.947.6移除多智能体单一体智能体0.4227.947.3移除专用仿真工具接口0.5726.844.6多智能体分工至关重要单智能体同时处理建模、渲染、仿真易混淆任务推理逻辑混乱物理一致性大幅下滑专用仿真工具封装不可省略直接暴露底层仿真API给大模型会频繁出现参数错误、引擎崩溃。5 讨论5.1 框架核心优势不止生成视频GS底层输出可执行完整仿真代码同步输出深度图、物体分割、曲面法向、粒子动力学等结构化多模态数据可直接用于机器人强化学习、自动驾驶仿真数据集构建区别于仅输出视频的文生模型。5.2 物理时序全局一致性保证纯扩散视频基于像素分布生成长时序易出现物体形变、空间位置漂移GS所有动态由确定性物理方程求解几何、运动、能量全局自洽天然适配交互式世界模型、具身智能仿真。5.3 局限性物理引擎本身算力与精度限制高精度流体、软体仿真计算开销巨大复杂真实世界完整模拟仍存在瓶颈大模型影视叙事理解短板智能体自检、镜头美学评判能力有限复杂分镜、长时序剧情生成仍存在优化空间。6 结论本文提出GS-Agent多智能体生成仿真框架将物理引擎纳入智能体迭代循环可直接由自然语言生成具备真实刚体、可变形体、流体交互的四维动态世界。总管、实体、渲染三类专业智能分工协作通过标准化工具接口调用仿真、接收多模态反馈自主迭代优化。大量量化与人工评测证明GS在物理真实性、文本指令匹配、镜头精细可控性上全面超越现有文生视频、静态3D智能体基线框架支持自主修复仿真故障、兼容多款开源/闭源大模型输出结构化仿真数据支撑具身AI研究。未来工作将进一步优化智能体影视理解能力、提升大规模并行仿真生成效率。附录A 更广社会影响正向价值内容创作普惠无需专业图形学、仿真知识普通人通过自然语言即可制作影视、游戏动态场景降低创作门槛具身AI数据供给低成本批量生成物理可信仿真环境减少真实机器人实地采集数据的高昂成本加速sim-to-real算法迭代。潜在风险虚假内容滥用可生成高度真实、严格遵循物理的伪造动态画面难以通过常规视频鉴伪工具识别存在虚假信息传播风险算力能耗大模型高精度物理仿真组合计算密集碳排放量较高行业冲击自动化场景制作可能挤压传统三维美术、动画从业者岗位。风险缓解方案仿真代码、渲染视频嵌入加密数字水印提供溯源依据底层大模型增加安全提示词拦截恶意仿真生成需求推进行业透明化评估完善生成内容监管标准。附录B 完整工具接口与系统提示脚本B.1 智能体-仿真标准化工具总表工具参数规范必填参数[]可选参数通用全局工具全部智能体可用工具名参数功能说明GetSceneInfo无获取当前全场景全局信息GetEntityInfoname查询指定实体几何、材质、运动参数SendMessagerecipient, message, [image]向其他智能体发送指令附带截图/视频总管智能体专属工具| 工具 | 参数 | 功能 ||------|------|| ConfigureSimOptions | [dt],[substeps],[gravity] | 设置全局仿真步长、重力 || ConfigureMPMOptions | [网格分辨率],[粒子尺寸] | 可变形体求解器配置 || ConfigureSPHOptions | [粒子尺寸] | 流体求解器配置 || ConfigureVisOptions | [阴影],[背景色] | 可视化调试开关 || AdvanceScene | steps | 向前推进N帧仿真 || ResetScene | 无 | 重置整个场景到初始状态 || FinalizeOutcome | video_path | 任务完成输出视频路径 |实体智能体专属工具| 工具 | 参数 | 功能 ||------|------|| AddEntity | name, code | 新增实体code包含几何/材质脚本 || RemoveEntity | name | 删除指定实体 || UpdateEntity | name, code | 修改实体材质、外形参数 || AddEmitter | name, code | 流体粒子发射器创建 || RetrieveAsset | query | 文本检索3D资产库 || GenerateAsset | query | 调用文生3D生成网格 || ConfigureEntitiesControl | code | 编写实体时序运动控制逻辑 |渲染智能体专属工具| 工具 | 参数 | 功能 ||------|------|| ConfigureCameraModel | [分辨率],[坐标],[视场角] | 设置相机参数 || AddDirectionalLight | 方向,颜色,强度 | 添加平行光光栅渲染 || AddSphereLight | 坐标,颜色,半径 | 球形点光源光线追踪 || RenderCurrentFrame | 无 | 渲染当前单帧截图 || ConfigureCameraControl | code | 编写相机运动、录制时序代码 |B.2 全套智能系统提示脚本完整总管智能体、实体智能体、渲染智能体Prompt脚本见Listing1/2/3所有脚本开源可直接复用适配GPT、Qwen、Gemini等主流基座。B.3 智能体自检迭代流程每轮仿真推进后总管智能读取渲染视频分析流体泄漏、物体穿插等故障通过SendMessage下发修复指令给实体智能渲染智能可读取单帧截图调整灯光、相机参数循环迭代至满足文本需求或达到最大调用轮次。附录C 补充实验细节C.1 更多定性对比样例附录图7包含多组流体、软体、镜头控制场景GS与基线直观对比图。C.2 用户调研完整流程15名受试者随机打乱所有模型生成视频从物理真实性、相机可控性、内容匹配、画面美学四项5分制打分共收集270份有效问卷完整调研界面见附录图8。打分标准物理真实性物体运动、形变、流体符合物理守恒无瞬移、穿插相机可控镜头平稳严格遵循文本描述运镜内容匹配物体、场景、动作与文本描述一致美学构图、光影无噪点、闪烁等视觉瑕疵。C.3 故障根源分析自检上下文污染大模型容易受自身规划文本干扰产生确认偏见无法客观识别画面缺陷故障归因错误仿真报错时智能容易调整无关参数如反复调摩擦实际是模型几何穿插陷入迭代死循环API幻觉智能体会编造物理引擎不存在的参数/工具造成执行报错。开源资源汇总项目主页含演示视频https://umass-embodied-agi.github.io/gs-agent/arXiv论文PDFhttps://arxiv.org/pdf/2607.21522完整智能体Prompt脚本、工具代码、实验复现脚本项目主页开源仓库NewtonGen、自制评测集任务文件、仿真场景Docker镜像仓库data目录消融实验、用户调研完整原始数据项目配套Hugging Face数据集