ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

机器人运动误差降低90.4%,英伟达/哈佛等提出Hydra-0,用Action Flow统一世界建模与控制

机器人运动误差降低90.4%,英伟达/哈佛等提出Hydra-0,用Action Flow统一世界建模与控制 将机器人的动作表示为像素运动来自英伟达、哈佛大学等的联合研究团队提出了 Hydra-0一种以动作流Action Flow为条件的通用世界模型。在最佳配置下与以动作作为条件的基线模型相比Hydra-0 将机器人运动误差降低了 90.4%将物体运动误差降低了 60.2%同时支持零样本组合以及数据高效的适应。如果说大模型正在让机器「理解语言」那么世界模型World Model试图解决的则是让机器真正理解一个更复杂的问题做出一个动作之后现实世界会发生什么这个问题远比「看懂一张图片」复杂——机器人不仅需要识别桌面上的杯子、衣服、箱子等物体还需要理解自身运动与环境变化之间的因果关系。例如当机械臂向前移动时夹爪会出现在什么位置当夹爪抓住一块布料并向右拉动时布料会如何变形当机器人执行一段动作序列时几秒之后整个场景又会变成什么样。一个基于多样化交互数据训练的基础世界模型可以通过捕捉不同机器人和交互场景之间共享的物理规律成为适用于多种机器人及交互环境的通用预测模拟器。然而尽管目前已经拥有大量丰富的交互数据业界仍然缺乏能够跨越不同机器人本体、任务和环境进行泛化的可迁移基础世界模型transferable foundation world models。为了填补这一空白来自英伟达、哈佛大学等的联合研究团队提出了 Hydra-0一种以动作流Action Flow为条件的通用世界模型。该模型将机器人的动作表示为像素运动pixel motion。这种统一的视觉接口使通用世界建模与控制成为可能模型能够跨越不同的机器人本体、任务、环境以及视频生成骨干网络学习机器人动作所产生的后果。在最佳配置下与以动作作为条件的基线模型相比Hydra-0 将机器人运动误差降低了 90.4%将物体运动误差降低了 60.2%同时支持零样本组合以及数据高效的适应。在 RoboLab 基准测试中Hydra-0 对重放实验与参考实验的成功率进行了预测两者之间的 Pearson 相关系数达到 r 0.96。相关研究成果以「Hydra-0: Action Flow for Generalist World Modeling and Control」为题已发布预印本于 arXiv 。研究亮点* 将机器人动作条件建模为具有运动学约束的图像平面动作* 证明动作流可以成为跨机器人本体和视频生成骨干网络的通用世界建模接口* 将同一接口反向用于世界动作模型实现从任务意图到机器人动作的推断论文地址https://hyper.ai/en/papers/2608.18077从 7 个数据源汇聚多机器人本体训练语料库为了构建这样的通用世界模型研究人员从 7 个数据源汇集了一个涵盖机器人与人类交互的多机器人本体训练语料库multi-embodiment training corpus。下表对该语料库进行了汇总包括各数据源在筛选前后的数据规模以及相应的数据许可协议多机器人本体训练语料库* DROID 提供了大规模、场景多样的单臂 Franka 机器人操作数据是本研究的主要机器人数据来源* ABC-130k 和 MolmoAct2 提供了双臂遥操作数据* EgoDex 提供了使用 Apple Vision Pro 采集的第一视角人手操作数据* Deform360 提供了使用 UMI 夹爪进行可变形物体操作的手持式夹爪示范数据* XVLA-Soft-Fold 和 H1-Fold-Clothes 分别贡献了规模较小的双臂以及人形机器人折叠衣物数据集。* Interactive World SimulatorIWS任务仅用于数据效率评估并不纳入训练语料库由于本文重点关注可变形物体交互因此主要保留与可变形物体相关的数据包括布料、电缆、绳索、袋子和纸张等。研究人员将主要数据源统一转换为共享的、以单个 episode 和单个摄像机视角为单位的数据布局视频帧被重新采样至 480p、16 fps并切分为互不重叠的 81 帧窗口。每个窗口包含密集点轨迹dense point tracks、语言描述language caption、预先计算的 VAE 潜在表示VAE latents以及在数据源允许的情况下提供的本体与物体标注。除上述针对任务层面的可变形物体数据筛选外研究人员还针对不同数据源组合使用了三种窗口级筛选条件其阈值根据运动评分直方图进行调整。第一种是静态窗口筛选static-window filter如果一个窗口中可见轨迹的路径长度第 90 百分位数在 480p 分辨率下低于 50 像素则删除该窗口。第二种是夹爪冻结筛选frozen-gripper filter如果机器人本体轨迹的运动幅度低于同样的 50 像素阈值则删除该窗口。第三种是无内容语言描述筛选contentless-caption filter如果 DROID 数据集中的 episode 语言标注没有描述任何可执行的操作内容则删除该 episode。Hydra-0 框架兼顾正向模式和逆向模式Hydra-0 的模型框架可以理解为两个相互对应的方向正向模式和逆向模式。正向模式解决的是世界模型最基本的问题如果机器人这样运动接下来世界会发生什么在逆向模式下模型可以反过来回答另一个问题如果希望物体按照某种方式运动那么机器人应该怎么动研究人员考虑一个部分可观测的环境在该环境中机器人在时间 (t) 接收一个 RGB 观测并执行一个动作编码器将初始观测映射为空间潜在状态使用动作流action flow表示动作序列并令动力学模型根据初始潜在状态和动作流预测未来的潜在状态序列随后解码器生成与之对应的 RGB 视频序列。下图展示了由此形成的世界模型整体架构Hydra-0 概览① 动作流的构建与采样Constructing and Sampling Action Flow研究人员并不直接让模型以依赖特定机器人本体的控制指令作为条件而是首先将控制指令映射为动作流。动作流由一组位于相机平面上的轨迹构成用于描述机器人本体可见部分按照给定指令产生的运动。在每一个训练步骤中从经过语义约束的轨迹集合中采样以下四种条件策略之一* Embodiment选择作用主体上的轨迹是主要采用的动作条件策略它包括可见的机器人连杆、夹爪以及人手等轨迹。* Object选择训练过程中被操作物体的未来运动轨迹。当在推理阶段显式提供物体轨迹时同一种模式还可以进一步提供目标运动条件使世界模型根据目标物体运动推断与之匹配的机器人运动。* All从所有已经完成语义约束和未完成语义分配的轨迹中进行采样当数据中的语义标注不完整时这种策略仍能够让训练过程保留大致的运动对应关系。* None移除轨迹条件相当于进行条件随机丢弃使模型仅依赖文本和图像条件进行预测。② 基于动作流条件的视频预测Action-Flow-Conditioned Video Prediction在长度为 (H) 的预测时间范围内运动学约束视频预测器以动作流作为条件生成未来的观测结果。③ 高效因果式滚动生成Efficient Causal Rollout为了满足机器人实际部署对效率的要求研究人员将因果式生成的自回归转换autoregressive conversion与改进的分布匹配蒸馏Distribution Matching Distillation相结合从而实现长时间范围的因果生成以及少步采样。④ 开放环策略评估与逆向控制Open-Loop Policy Evaluation and Inverse Control* 正向模式-策略评估在正向模式下模型接收根据机器人控制指令或机器人实际完成的运动轨迹计算得到的夹爪运动流并预测由此产生的视频结果。* 逆向模式-世界动作模型针对逆向模式构建了一个世界动作模型该模型以目标物体运动流作为条件同时不提供夹爪运动流。有效提升动作条件视频预测性能和数据高效迁移能力Hydra-0 的实验重点围绕以下问题展开动作流是否真的能够提升世界模型的预测能力多机器人本体训练能否提高数据效率模型是否能够用于机器人策略的开放环评估以及动作流能否反向驱动真实机器人执行可执行动作流条件的有效性Effectiveness of Actionable Flow Conditioning研究人员通过训练采用相同动作流构建方式、数据集组合和预测时间范围的可执行动作流条件 Cosmos 2.5 和 Wan2.2 模型检验可执行动作流能否在不同视频生成架构之间实现迁移。在下表所展示的大多数指标单元格中研究提出的方法均取得了最佳的点估计结果多机器人本体数据集上的评估结果在采用相同 Cosmos 2.5 骨干网络的情况下将 Cosmos 2.5 原生的相对 6D 动作表示替换为我们提出的可执行动作流后OursCosmos 2.5 2B在全部五个数据集上的 PSNR、SSIM、夹爪流 EPE、FID 和 FVD以及报告物体 EPE 的四个数据集上的物体流 EPE均取得了更优的点估计结果。多机器人本体中期训练带来的数据效率提升在动作流能够支持高效的多机器人本体中期训练multi-embodiment mid-training的基础上研究人员希望验证的问题是多机器人本体中期训练能否减少后续后训练阶段所需的任务特定机器人数据量。如下图所示本研究的多机器人本体中期训练在尚未接触任何任务特定数据之前就能够实现最强的迁移性能。IWS 任务上的数据效率在 0% 数据条件下在全部六项任务中Ours (MT) 的 LPIPS、物体流 EPE 和 FVD 点估计结果均优于 Ours (PT)这一结果与多机器人本体中期训练所带来的知识迁移相一致。这种优势在经过任务适应后依然存在在 100% 数据条件下Ours (MT) 在全部六项任务上均取得最低的 LPIPS 和 FVD并在其中四项任务上取得最低的流 EPE在 Bimanual box 任务上Ours (MT) 与 Ours (PT) 的差距仅为 0.014 像素在 Bimanual rope 任务上与 IWS 的差距仅为 0.15 像素。从视觉外观、运动以及时间一致性这三个互补维度的指标来看模型较早出现的性能平台期表明多机器人本体中期训练有望显著降低动作流后训练所需的目标任务数据量。推理速度机器人实际部署对生成延迟和吞吐量提出了要求因此研究人员也对模型的生成速度进行测量以评估其滚动生成过程是否能够满足机器人交互的时间预算。与完整序列的双向采样相比采用 KV Cache 的因果式自回归转换cached causal autoregressive conversion速度提高了 1.68 倍。尽管网络评估次数从 50 次增加到了 153 次但每次评估仅处理一个包含 7 个潜在帧的时间块并且每个时间块只需要进行一次重新缓存因此整体速度反而更快如下表。不同优化阶段的推理速度进一步采用蒸馏后网络评估次数减少至 15 次速度在此基础上进一步提升约 9.5 倍最终达到 62.0 帧/秒相对于原始方法实现了 16.0 倍的纯生成速度提升。开放环策略评估如下图所示RoboLab 策略在生成环境中的成功率与参考成功率高度一致Pearson 相关系数 r 0.96Spearman 相关系数 ρ 0.93平均绝对误差为 5.7 个百分点。在跨任务进行平均后生成结果的成功率同样能够复现 5 个策略在参考环境中的排名。使用 Hydra-0 进行开放环策略评估真实世界概念验证Real-World Proof of Concept此外研究人员还在真实世界机器人环境中对成功和失败的折叠衣物轨迹进行了重放。如下图所示生成的运行过程在定性上保留了原始任务中不同的结果初步表明这种策略评估方法有望进一步拓展到 RoboLab 基准测试之外的真实机器人环境。真实世界开放环策略评估结语总体而言Hydra-0 提出的运动学约束动作流为跨机器人本体、跨视频生成骨干网络的神经世界模拟提供了一种统一的视觉控制接口。实验表明该方法不仅能够提升动作条件视频预测和数据高效迁移能力还可用于开放环策略评估在 RoboLab 中生成结果与真实重放结果的成功率达到 Pearson r 0.96。进一步通过世界动作模型Hydra-0 能够从人类示范中的目标物体运动流反推出匹配的机器人运动并转化为可执行动作。不过目前模型仍存在厘米级抓取误差对深度及接触状态的理解也存在局限腕部摄像机和移动操作等场景尚缺乏系统验证。未来随着深度、触觉、力觉等多模态信息以及闭环评估的引入动作流能否真正成为连接任务意图、世界预测与机器人执行的通用接口值得持续关注。原文链接机器人运动误差降低90.4%英伟达/哈佛等提出Hydra-0用Action Flow统一世界建模与控制-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink
返回列表