【论文解读】AeroAct:训练用未来视频当“后果监督“,部署丢掉视频只解码轨迹——World-Action 模型第一次飞上真无人机

【论文解读】AeroAct:训练用未来视频当“后果监督“,部署丢掉视频只解码轨迹——World-Action 模型第一次飞上真无人机 论文AeroAct北京理工大学自动化学院 · arXiv 2026发布时间2026 年 7 月arXiv:2607.14997作者Xinhong Zhang、Qiyuan Zhu、Yubo Huang、Haolin Chen共一等通讯作者 Gang Wang核心一句话把 1.3B 视频扩散 Transformer 改成动作中心的 World-Action 模型——训练时让未来第一人称帧当稠密监督部署时关掉视频生成、只解码平滑局部轨迹块第一次把 WAM 真正飞上物理四旋翼。核心关键词World-Action Model (WAM) · 视频扩散 Transformer (Wan2.1-1.3B) · 语言条件四旋翼飞行 · 轨迹动作块 (action chunk) · 后果监督 / 未来帧预测 · 分块因果掩码 · 自引导 (self-guidance) · DiffAero Isaac Lab 3DGS · 手持采集设备带着问题阅读同样是看图出动作VLA 直接解码动作、WAM 联合预测未来视频差别在哪无人机为什么更需要后者视频扩散模型推理又慢、误差还会累积AeroAct 怎么做到训练用视频、部署不用视频真机飞行数据又贵又危险它怎么用仿真双分支加一个手持设备把数据凑齐1 帧参考和 9 帧参考为什么成功率能从 20% 跳到 100%一、核心导读让无人机听一句飞到那张黄色泡沫垫就自主飞过去这件事比地面机器人听指令难得多第一人称相机随飞行快速运动、动作会立刻改变后续画面、一个不安全的指令就可能让飞机震荡、丢目标或撞墙。已有的空中视觉-语言导航aerial VLN和视觉-语言-动作VLA方法大多用离散动作、高层航点或瞬时速度命令——它们能让飞机动得对方向却没教策略我这个动作会让下一秒画面变成什么样。AeroAct 给出的答案是World-Action ModelWAM把一个预训练的视频扩散 Transformer 当骨干让它同时学两件事——生成未来第一人称帧、解码一段局部轨迹动作。训练时未来帧作为稠密的后果监督约束动作分布部署时关掉视频生成、只解码动作流。这样既吃到了视频模型的时间-几何先验又不背视频推理的延迟和误差累积包袱。作者自称这是首个在真实四旋翼上落地、并完成飞行演示的 WAM 策略。围绕它论文解决了三件事一个动作中心的架构训练有视频、部署没视频、一套可扩展的混合数据流水线DiffAero Isaac Lab 3DGS 手持设备、一个让连续动作块衔接平滑的自引导采样法。二、问题与动机把 WAM 搬上无人机为什么难WAM 的好处是用视频当稠密监督把动作的视觉后果显式学进策略。但在四旋翼上落地有两个硬约束。第一是数据。训练一个飞行 WAM需要大规模、严格同步的多模态轨迹第一人称视频、语言指令、本体感知状态、动力学可行的飞行动作。这比桌面操作的数据难采集得多——无人机运动快、安全关键、还受欠驱动动力学约束。第二是推理。以视频生成为中心的 WAM 推理很贵自回归生成未来帧会拉高延迟而微小的视觉预测误差会沿时间累积、污染下游动作解码。这对地面机械臂还能忍对无人机不行——底层控制器要的是平滑、局部可执行的轨迹参考一旦参考抖动飞控直接不稳。AeroAct 的取舍正是冲这两点动作不预测离散命令或全局航点而是输出一段局部五阶多项式轨迹段未来视频只在训练时存在部署时用分块因果掩码把动作流和未来帧流隔开推理直接砍掉视频分支。三、方法动作中心的 World-Action Transformer3.1 问题建模从第一人称历史到动作块时刻ttt无人机观测到 RGB 图oto_tot​、本体状态sts_tst​在 yaw 对齐局部系下的速度、加速度、体系 z 轴方向9 维、语言指令lll。策略不以单帧决策而是看一段时间跨步的观测历史Oth(ot−(h−1)Δ,…,ot)\mathcal{O}_t^h(o_{t-(h-1)\Delta},\dots,o_t)Oth​(ot−(h−1)Δ​,…,ot​)输出长度为ppp的动作块at:tp−1a_{t:tp-1}at:tp−1​。每个动作不是瞬时速度命令而是参数化一段动力学可执行的局部轨迹段。实现里取Δ3\Delta3Δ3、p24p24p24即一次推理输出 24 步低层动作、对应 8 帧K⌊p/Δ⌋K\lfloor p/\Delta\rfloorK⌊p/Δ⌋未来视觉帧。遵循 WAM 的统一建模同一个模型gΘg_\ThetagΘ​既出动作、又出动作潜在ctc_tct​去条件视觉预测给定上下文与ctc_tct​再预测未来观测。换句话说动作和未来画面共享一个骨干、互为监督。3.2 架构与掩码训练有视频、部署没视频AeroAct 把 1.3B 参数的 Wan2.1 视频扩散 Transformer 改造成飞行策略。视频 VAE 把一段观测编成时空 latent token3D RoPE 加位置编码后分成参考 tokenToT_oTo​和未来 tokenTfT_fTf​本体状态和动作块经 MLP 编成TsT_sTs​、TaT_aTa​语言经文本编码器编成TlT_lTl​。关键设计是不引入独立专家而是把非语言 token 拼成一条序列Tt[Ts;To;Ta;Tf]T_t[T_s;T_o;T_a;T_f]Tt​[Ts​;To​;Ta​;Tf​]语言 token 作为交叉注意力上下文再用一张分块因果掩码维持动作-后果次序状态、参考 token 看不到预测 token动作 token 只能看状态、参考、动作 token——即动作预测不能偷看未来帧未来视觉 token 能看所有 token。这张掩码图是全文的命门训练时未来帧监督着动作分布部署时直接砍掉TfT_fTf​、只解码动作流。4 步去噪下关掉视频预测把推理时间从 0.296 秒降到 0.184 秒省 37.8%更关键的是避免想象出来的帧把误差传给控制。3.3 训练目标动作预测 视觉后果建模损失是两项之和LLactλvisLvis\mathcal{L}\mathcal{L}_{act}\lambda_{vis}\mathcal{L}_{vis}LLact​λvis​Lvis​动作项让模型预测的动作 token 噪声/速度场贴合目标视觉项让未来帧 latent 的预测贴合目标。视觉项只在训练期塑造表征与动作先验部署只靠gΘag_\Theta^agΘa​。这个分离对飞行很重要——策略吃到了后果监督的好处但闭环控制器不必等待、也不必信任生成出来的未来帧。四、数据流水线仿真双分支 手持真机普通视频和具身数据集给不了这里要的同步监督第一人称 RGB、本体感知、自然语言、动力学可行动作四者都得和无人机运动一致。于是作者围绕 DiffAeroGPU 加速可微分的四旋翼仿真器搭了一套混合流水线。两个渲染分支共用 DiffAero 的控制接口互补各补对方的短Isaac Lab 分支光照、材质、阴影、相机效果真实但场景多样性受资产和人工配置成本限制3DGS 分支直接从高斯泼溅场景渲染 RGB 与深度容易跨生成场景和物体扩展短板是近距几何与光照保真略低。仿真侧采三类示教走廊里跟运动目标学运动 anticipation 和视觉伺服、在干扰物中逼近语言指定物体把语言 grounding 接到目标飞行、3DGS 场景里随机起点逼近物体。预训练集含 90 万仿真片段、3.2 亿帧50 万跟踪 20 万 Isaac 逼近 20 万 3DGS 逼近。真机侧用一台廉价手持设备补数据鱼眼相机 Intel RealSense T265 立体相机 轻量计算单元。T265 估计自身里程计、把测得的运动转成仿真无人机位姿再据此把鱼眼图像裁成与无人机相机运动一致的第一人称画面。这样不用大规模自主飞行就采到 858 条真机轨迹、约 33.2 万帧、≈3 小时数据用于真机微调。五、平滑轨迹与自引导扩散/流匹配模型能表达多模态动作分布但相邻两次重规划各自独立采样动作块之间可能在重叠时段对不上——对无人机来说这种不一致会让参考轨迹抖动尤其当动作时域长于推理间隔时。AeroAct 的解法是自引导当第n1n1n1次推理在第nnn块还没过期前就开始两块时间上重叠去噪时把新块前缀的速度替换成上一块对应后缀只正常采样剩余部分。它不改模型结构只约束采样器让底层控制器拿到时间一致的轨迹参考。动作本身参数化得很讲究在 yaw 对齐局部系下每个动作指定一段T2T2T2秒局部轨迹段的终点写作a[r,θ,ψ,vendl,aendl]a[r,\theta,\psi,\mathbf{v}_{end}^l,\mathbf{a}_{end}^l]a[r,θ,ψ,vendl​,aendl​]9 维其中(r,θ,ψ)(r,\theta,\psi)(r,θ,ψ)给出终点位移的极坐标。对x/y/zx/y/zx/y/z每维用五阶多项式pμl(t)α0⋯α5t5\mathbf{p}_\mu^l(t)\alpha_0\dots\alpha_5 t^5pμl​(t)α0​⋯α5​t5由起点的位姿/速度/加速度和终点条件解出系数。这种动作一段平滑局部轨迹的设计正是它能把视频扩散策略接到底层飞控上的接口。六、实验从仿真闭环到真机飞行骨干用 Wan2.1-1.3B含视频 DiT、文本编码器、视频 VAE本体与动作编/解码器是隐藏层 128/256 的 MLP。数据 30 Hz 采、3 倍下采样每三步一帧视频 → 8 帧未来视频 24 步动作每块。用 9 帧参考 ≈ 2.4 秒视觉上下文。仿真预训练单机 8×A100 跑 36 小时AdamW、lr4.3×10−54.3\times10^{-5}4.3×10−5。推理在单张 RTX 5090 24G 笔记本 GPU 上、约 4.5 GB 显存真机经 ZeroMQ 把请求发到工作站、回传动作块、转成局部轨迹段、由 on-manifold MPCOM-MPC跟踪。**仿真闭环Isaac Lab**核心对比是 1 帧参考 vs 9 帧参考模型参考帧跟踪成功 ↑跟踪碰撞 ↓搜索成功 ↑搜索碰撞 ↓AeroAct120.090.090.010.0AeroAct9100.00.0100.00.0AeroAct-FT995.00.0100.00.0单帧参考时跟踪只有 20% 成功率、90% 撞——印证单张第一人称图不足以估相对运动、出安全轨迹块升到 9 帧后两类任务都 100% 成功、零碰撞。在未见目标物体上成功率从 75% 升到 100%、平均终点距离从 3.819 m 降到 1.983 m。真机微调后AeroAct-FT仍保持零碰撞、成功率仅微降说明真机适配没有显著破坏学到的闭环策略。论文还给了 1/2/5 Hz 三档推理频率的跟踪/搜索细化表趋势一致。真机飞行平台由 OddityRC 35Pro 机架改装配 RealSense D435i 相机和 Radxa ROCK 5C 机载计算机实验室里用动捕做状态测量与安全监控推理延迟约tinfer0.8t_{infer}0.8tinfer​0.8秒。演示指令是fly to the yellow foam mat飞到那张黄色泡沫垫。策略生成可行飞行命令、把无人机引向指定目标物。作者称这是首个基于 WAM 的真实四旋翼飞行演示——一个学出来的模型把视觉-语言任务描述、预测式动作生成和闭环四旋翼执行直接串了起来。七、局限与展望短室内、离板推理、单阶段论文坦白了几条边界真机实验目前只限短距离室内轨迹时间上下文够单阶段目标逼近但还撑不住需要多个语义子目标、恢复行为或长程记忆的复杂指令真机部署因为视频扩散骨干的计算成本依赖离板推理。未来工作指向机载高效化、更激进飞行动力学下的鲁棒性、不确定性感知的动作生成、长程多阶段空中指令跟随。八、一句话总结AeroAct 的要害不是又把视频模型用到了机器人上而是把 WAM 拆成两层——训练时让未来帧当稠密监督把动作后果学进去部署时用一张分块因果掩码把视频分支整个关掉、只解码平滑局部轨迹块再配上 DiffAero Isaac Lab 3DGS 仿真双分支和一台手持设备凑数据、用自引导让连续动作块不抖。结果是 9 帧参考下仿真 100% 成功零碰撞、真机闭环飞到指定物体——WAM 第一次真正上了天。它的局限同样诚实还只能短室内、还靠离板推理、还只单阶段但训练借视频、部署丢视频这个取舍给把生成式世界模型塞进快动态物理系统提供了一个很务实的范式。考下仿真 100% 成功零碰撞、真机闭环飞到指定物体——WAM 第一次真正上了天。它的局限同样诚实还只能短室内、还靠离板推理、还只单阶段但训练借视频、部署丢视频这个取舍给把生成式世界模型塞进快动态物理系统提供了一个很务实的范式。