ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

DEX-X:仿真补全视频缺失的触觉,机器人操作不再凭感觉

DEX-X:仿真补全视频缺失的触觉,机器人操作不再凭感觉 做了这么多年机器人操作和仿真我越来越觉得一个事情很反直觉人类看视频学动作靠的从来不止是眼睛。你看一个人剥果壳、拧瓶盖、翻煎饼的时候真正决定成败的是手里的“感觉”——什么时候该用力什么时候力道刚好东西是不是快滑了。但这些问题一旦落到数据层面就崩了因为视频里根本没有触觉这条信息通道。DEX-X这个项目干的事情说白了就是一句话人类视频里缺失的触觉用仿真环境补回来。这篇文章我打算把DEX-X的整体思路、触觉补全的原理、可落地的实操流程以及我在调试仿真接触参数时候踩过的一堆坑完整拆开讲一遍。不管你是做机器人学习、触觉感知还是单纯对仿真环境感兴趣这应该都是一份可以直接拿去参考的实战记录。1. 先搞清楚DEX-X到底在解决什么问题1.1 人类视频里看不见的那部分信息先说个最基础的问题一段人类操作视频里到底有什么严格来说只有RGB像素序列。如果再加上音频也就是声音。但机器人要去复现这个任务光有RGB远远不够因为机器人需要的物理量——接触力、压力分布、摩擦力方向、滑移状态——在视频里一个都不存在。我最早接触这类问题是在做抓取稳定性分析的时候。当时拿了个开源的人类倒水数据集想训练一个机器人模仿倒水动作。视觉轨迹学得很像机械臂末端路径跟视频里几乎重合但一到真实操作就翻车要么把杯子捏碎了要么没捏住杯子直接滑出去。原因太明显了——我不知道视频里那个人用了多大的力。拧瓶盖是个更经典的例子视觉上你只能看到手在转动但瓶盖什么时候松动、手施加的扭矩有没有超过阈值这些全靠触觉才能判断。视频里没有那就只能靠猜而猜出来的力在物理世界里基本都会出事。DEX-X的核心定位就是补上这个缺口。它不是去重建一个多么精细的人体触觉模型而是做一件更务实的事从视频里提取人的运动意图在仿真环境里重现这个交互过程然后用物理引擎算出一套任务可用的触觉信号。注意“任务可用”这四个字这是整个项目最关键的判据——补出来的触觉不需要和真实人手完全一致但它必须能让下游的策略、遥操作、分析任务真正用得上。这个思路我越做越觉得聪明。因为真实触觉数据的采集成本高得离谱要贴传感器、要标定、要处理噪声而且一个场景一套数据重换个物体就得重新采。而仿真里的触觉是“算出来的”只要有物体模型和物理参数随时随地都可以生成。成本低、可扩展、还能批量生成这在数据驱动的时代几乎是降维打击。1.2 三条补触觉的路线为什么仿真赢了要补上视频里缺失的触觉其实有三条路可以走我都或多或少试过。第一条路是用深度网络直接从视频帧预测触觉。比如输入一段手指按压海绵的视频输出一个力曲线或者压力分布图。这条路的优点是不需要任何物理建模一副GPU就能干。缺点也很致命纯数据驱动的方法没有物理约束模型很容易学出“幻觉”。我做过一个实验让模型预测一个杯子的接触力输出结果里居然出现了负的接触力——它觉得手在“吸”杯子。这种违反物理常识的预测放在仿真里会导致物体乱飞放在真实机器人上就是灾难。第二条路是在真实手上装触觉传感器再想办法和人类视频对齐。这个方法物理上最可靠但工程上极其痛苦。传感器采到的信号频率高、噪声大不同人的手形、力度习惯差异巨大数据集很难通用一个任务的触觉数据要采几百次时间和人力成本都撑不住。第三条路就是DEX-X选的仿真补全。把人类视频里的手部轨迹和物体状态映射到仿真环境里让物理引擎去算接触力。这条路的本质是什么是用物理定律来做“外插”——视频没拍到的物理量由仿真环境根据接触几何、摩擦模型、动力学参数推算出来。这个方案最大的价值在于物理引擎的输出是一致和自洽的不会出现负接触力这种反物理的事而且不同物体的触觉信号只要换模型和参数就能批量生成天然适合做数据扩充。三条路对比下来仿真补全几乎是现阶段最优解。它不需要昂贵硬件不受限于真实数据量还能在已知物理约束下提供相对可靠的触觉估计。标题讲“让仿真补上”补的不只是触觉信号更是补上了视觉数据和物理交互之间的那道鸿沟。2. 仿真怎么“摸”出触觉原理拆解2.1 触觉信号的物理来源仿真里没有“手”那它凭什么给出触觉答案不在手在接触。所有触觉信号本质上都是接触几何和物理模型的产物。当两个物体在仿真里发生碰撞物理引擎会在接触面上做几件事检测接触点、计算接触法线、根据穿透深度或接触速度计算法向力、再利用摩擦模型算出切向摩擦力。这些力汇总起来就构成了我们需要的触觉信号。我拿MuJoCo来举例因为这是DEX-X最常用的底层引擎之一。MuJoCo的接触力计算基于软接触模型它把接触想象成带刚度和阻尼的虚拟弹簧。接触刚度决定“硬碰硬”的程度阻尼决定冲击能量的耗散速度。当手指和物体接触时引擎会计算一个接触面在这个面上逐点计算法向力再约束摩擦力落在摩擦锥范围内。把所有这些力在接触面上积分就能得到总力、力矩还能输出压力中心CoP和接触区域的近似压力分布。这个过程可以类比成一个戴着厚手套的盲人摸东西——他看不清但能从手套上感受到的压强变化判断接触情况。仿真里的“数字手套”就是接触网格和物理引擎网格划分越细压力分布越接近真实物理模型选得越好力的大小越可靠。搞清楚这个原理之后很多事情就通了。为什么DEX-X补出的触觉能支撑下游任务因为它输出的不是凭空猜出来的力而是由物体质量、几何形状、接触刚度、摩擦系数这些物理量共同决定的标准接触力。这套信号的内部一致性很强——物体越重仿真算出的支撑力越大接触面积越小、压强就越高。这些符合直觉的物理规律让策略网络有机会学到真正有用的触觉表征。2.2 仿真触觉和真实触觉的差距必须承认仿真触觉和真实触觉之间永远存在鸿沟。真实的皮肤触觉包含软组织变形、粘弹性、温度、湿度甚至微观纹理导致的振动。这些东西在主流物理引擎里都没有——刚体引擎只处理刚体碰撞软体引擎比如SoFA能建模变形但极慢离实时生成大量训练数据还有距离。初期我对这个差距耿耿于怀总觉得仿真里的压力分布太“假”了没有真实感。后来做多了才明白触觉补全的目标本来就不是复刻真实触觉而是提供“相对一致”的信号。什么意思就是只要仿真触觉随接触变化的大趋势是准的——按压越深力越大、接触面积越大压力越分散、摩擦越大越不容易滑——下游策略就能学到正确的行为模式。真实触觉传感器再准如果采集环境变化一次数据就不可复用那价值也不大。这也是为什么DEX-X项目不跟真实触觉传感器较劲的原因。它把仿真触觉当成一种“标准化接口”——像是一个稳定的仿真仪器永远用同一套标准去测量不同的交互过程。这种一致性对机器学习训练尤其重要因为模型学的是特征映射关系只要输入分布稳定泛化才有保障。真实世界传感器会有温漂、零点漂移、安装误差仿真引擎只会老老实实按物理公式算。当然这不意味着仿真参数可以随便拍脑袋。触觉信号准不准很大程度上取决于接触参数标得对不对。这个后面实操部分我会细讲先记着一点仿真的触觉虽然不追求绝对真但必须追求相对合理。目标物体的质量设错了算出来的力就是错的摩擦系数设得离谱滑移判断就完全失效。物理参数的设定是仿真触觉能否“用得上”的生命线。2.3 视觉和触觉怎么对齐现在到了整个项目最精妙的部分视频里的视觉信息和仿真里算出来的触觉信号怎么在时间上和空间上对齐。空间对齐相对好理解。先从视频里检测出人手的关键点和物体的位姿然后把这些值映射到仿真环境的坐标系里。DEX-X在这个环节做得比较灵活简单任务可以直接用手部关键点驱动一个简化的灵巧手模型复杂任务则可以先估计人手操作物体的轨迹再让仿真里的机械臂末端去跟这条轨迹。关键是保证视频里交互发生的区域和仿真里接触发生的位置一致。时间对齐才是真正折磨人的地方。视频是30fps或者60fps的离散帧而仿真求解器通常在几百赫兹甚至千赫兹的步长上运行。这意味着视频里相邻两帧之间仿真已经计算了几十个到几百个接触解算周期。要想让触觉信号和视频帧对应起来必须做重采样把仿真在某个时间窗口内的触觉数据聚合到视频帧的时间戳上。我一般习惯的做法是先跑完整个仿真过程记录所有触觉信号的原始时间序列然后再用视频帧的时间戳去插值或者聚合这样得到的触觉标签本身就是和视频帧对齐的。除了时间戳对齐还有一个视觉-触觉的阶段映射问题。人的手指接触物体通常会经历几个阶段接近、刚接触、按压加深、保持、释放。视觉里能看出手和物体距离的变化仿真里能算出接触力从零开始增长。把这两条线索对应起来特别重要只有接触深度和视觉观察一致下游策略才知道“看到什么阶段就该用什么力度”。我做一个倒水动作测试的时候就是因为没有做阶段对齐策略在仿真里学会了提前发力把杯子里的水全甩了出去。从工程角度看视觉到触觉的对齐本质上是把两个不同频率、不同模态的时序信号同步成一个统一的时间轴。只要这一步做稳了后面训练策略就有了可靠的监督信号。3. 从零搭一套“视频补触觉”的最小流程我不会只讲概念实际操作才最有参考价值。下面我以“用手指按压桌面上的一个软木块”这个最简单的任务为例把DEX-X的最小可行流程完整走一遍。这个任务足够简单不会让感情上的顾虑干扰理解但你基本能看清所有关键环节是怎么串起来的。3.1 第一步从视频里抽出运动和交互信息流程第一个环节是数据端目标是拿到手部的运动轨迹、物体位姿以及大概的接触时间点。我常用的方案是用MediaPipe做手部关键点检测。它会输出21个手部关键点的2D/3D坐标包括指尖、指节、掌根这些关键位置。对于视频里的按压任务我只需要关注食指指尖的轨迹就够了。注意MediaPipe输出的3D坐标是相对相机坐标系的尺度不一定真实所以接下去要做一个归一化用手掌宽度作为尺度参考把轨迹缩放到实际物理尺寸。物体位姿估计稍微麻烦一点。如果场景里有ArUco标记或者目标物体纹理清晰可以用PnP求解姿态如果场景没有标记我就手动在仿真里调整物体位置直到渲染出来的投影和视频背景对得上。听起来很土但在一两个物体的场景里这个土办法反而最稳省掉一堆标定环节。接触时间点怎么找可以通过手部关键点和物体表面之间的距离来判断。当指尖到物体表面的距离低于某个阈值并开始持续减小就认为进入了接触阶段。把标记好的接触时间点输出成一个时间戳文件后续用来做触觉信号的分段评估。这一步是整个流程里最容易出错但也是最重要的一步——场景错了后面所有仿真接触都是空中楼阁。我建议每处理完一段视频都做一次可视化检查把关键点轨迹叠加在原始视频上逐帧确认一遍。3.2 第二步在仿真里重建接触场景拿到轨迹和物体位姿后进入仿真环节。我先在MuJoCo里建一个场景包含三样东西一个桌面、一个软木块、一只简化的手指模型。物体模型很好办MuJoCo原生支持用Primitive几何体组合木块用box桌面用plane手指可以用capsule近似加上几个关节模拟手指的弯曲和按压。重点在物理参数设置上。软木块的尺寸按视频里估计质量设为0.05kg左右这是常见软木的密度换算出来的。摩擦系数我一开始设0.6后面针对纹理再做微调。手指模型末端加一个球形接触面半径0.8cm模拟真实指腹的接触面积。参数先从视频反推如果视频里是“缓慢按压”那仿真里的目标就是让手指末端按视频轨迹缓慢下压不能出现高速冲击。这一步的目的是让接触力主要由静态按压产生而不是动态碰撞这样得到的触觉信号才符合直觉。重建场景有一个容易被忽略的细节视觉上很小的物体物理质量可能差很多。一块软木和一块金属看起来差不多大接触力完全不是一个量级。所以从视频里估计物体尺寸之后必须结合真实世界的密度范围做一次合理性检查。质量设对了接触力的绝对数值才有意义。3.3 第三步生成触觉信号并和视频同步场景搭好之后让仿真的手指模型去跟踪视频里提取出来的指尖轨迹。这里可以用位置控制每个控制周期把手指末端的目标位置设为视频轨迹的当前值同时读取仿真器输出的接触力和接触面积。仿真跑完之后输出一个包含时间戳、接触力三维分量、总力大小、接触面积、压力中心位置的数据文件。注意这个数据的原始频率是仿真步长我习惯设0.002秒对应500Hz而视频只有30fps。要做同步我写一个小工具按视频帧时间戳做线性插值把500Hz的触觉数据重采样到30Hz。重采样之后每一帧视频都对应一组触觉标签可以直接作为训练集使用。关于“软木块被按压”这个任务输出结果会看到清晰的阶段变化手指接近时接触力为零接触后力缓慢爬升按压越深力增长越快因为接触面积增大了释放时力又回落。这个趋势和物理直觉完全一致说明参数设得合理。如果看到接触力突然跳变、或者物体被弹飞那基本就是接触参数或轨迹有问题后面问题排查章节我会详细讲。我还习惯把仿真阶段生成的接触区域热力图叠加在视频画面上做成一张带压力颜色的可视化图。这个过程特别有成就感——原本只有RGB的视频现在多了一层“看不见的力量”的渲染一眼就能看出按压的位置和力度分布。4. 工具选型和关键参数一页纸说清楚4.1 主流仿真平台怎么选DEX-X这类“视频补触觉”项目对仿真平台的选择直接影响开发效率和最终效果。我试过好几款各有各的脾气列个表方便对比。仿真平台接触精度仿真速度可微分性软体支持适合干什么MuJoCo高软接触模型成熟快CPU并行支持有限刚体/关节交互、触觉力估计、强化学习Isaac Gym高极快GPU大规模并行支持有限大规模并行训练、策略迭代SAPIEN高中支持一般物体操作任务、可交互场景GENESIS中高快支持较好生成式仿真、运动生成与物理结合PyBullet中中弱一般快速原型验证、教学演示我的习惯是单任务快速验证用MuJoCo因为它在接触力计算上有优势文档也足够详细需要批量生成训练数据或者做强化学习策略迭代就把场景移植到Isaac Gym或者GENESIS上做大规模并行。DEX-X的主流程我建议先固定在MuJoCo上把“视频转触觉”这条路跑通再考虑扩大规模。项目初期不建议一上来就上并行框架调试成本太高容易劝退。4.2 触觉标签怎么设计很多人在这一步翻车一上来就想输出一个完整的压力分布图像结果下游任务根本用不上。正确的做法是先想清楚你要这个触觉信号干什么做抓取稳定性判断需要的是合力方向和接触点位置重点看力是不是落在稳定区域内。做灵巧手操作需要的是每个指尖的接触力和力矩用来判断哪个手指该加力哪个该松。做遥操作反馈需要的是连续的压力分布图比如触觉手套上每个单元的压强值这样才能给人手提供有空间分辨率的反馈。DEX-X项目里我一般设计成多层级触觉标签并存底层输出完整的高频力/力矩数据和接触点坐标中间层是降采样后的接触区域mask表示哪些区域正在接触最顶层的压缩标签比如总力F、总扭矩T、CoP坐标方便快速做判断和分析。不同标签给不同模块用互不干扰。设计标签时有一个原则让下游任务用最容易的信息。策略网络不关心一千个接触点上每个点的压强它真正需要一个五维向量就能解决问题。你的标签越精简网络越容易收敛。把完整的压力分布图留着做可视化不参与训练决策效果反而更好。4.3 参数调试的真实经验参数调试是DEX-X项目里最磨人也最讲究经验的部分。接触相关参数设错仿真里会出现各种妖魔鬼怪一样的行为。下面是我总结的几条核心经验每条都是从失败案例里提炼出来的。仿真步长是一个分水岭式参数。MuJoCo里我习惯设0.002秒也就是500Hz。步长太大接触穿透严重物体经常被“压进”桌面里然后下一帧被暴力弹出来表现就是疯狂抖动步长太小单步仿真耗时成倍增加大批量生成数据时完全不划算。500Hz这个值是在精度和速度之间比较平衡的折中点大部分刚体接触任务都够用。接触刚度和阻尼是一对搭档。接触刚度太大会导致数值刚性仿真的稳定性变差太小则接触过于柔软物体像陷在棉花里。我的经验是先用MuJoCo的默认值跑一遍观察接触力曲线是否连续如果出现高频振荡就调大阻尼如果穿透太明显就调大刚度。摩擦系数不能只设一个静摩擦和动摩擦要分开设两者的比例影响滑移判断。对常见材质橡胶和木头的静摩擦系数我通常设在0.7-1.0光滑塑料0.3-0.5软木0.5-0.8。最后记得要定期做“反向验证”——用仿真算出的力去解释视频里的物理现象。如果视频里手指没有任何移动仿真里却测到了大的接触力波动那一定有问题。参数调试没有一劳永逸的方案同一个物体换一个表面纹理摩擦系数可能都得重新标定。好在仿真环境里改参数只是改一个数字的事试错成本比真实传感器标定低了好几个数量级。5. 常见问题与排查技巧实录5.1 仿真发散一碰就弹飞怎么治“仿真发散”这四个字做过物理仿真的都懂那种崩溃感。现象是物体一旦接触不是被弹到天上就是陷入地面内部或者直接NaN——数值炸了。我排查这类问题有一套固定顺序。第一步看仿真步长特别是刚接触的瞬间如果物体穿透深度在一帧内超过了自身的尺寸那基本就是步长太大。把步长从0.002秒改到0.0005秒很多发散问题当场消失。第二步看接触参数接触刚度太高加上阻尼太低会造成一个极硬的虚拟弹簧在高速振荡发散几乎是必然的。第三步检查初始状态物体初始位置如果和桌面有重叠那么第一帧就会产生一个巨大的排斥力直接让仿真“起飞”。初始接触状态应该让物体刚好接触或略微分离而不是穿插。如果这些都查完了还发散还有一个隐蔽的原因网格质量问题。导入的STL模型如果存在重叠面或者退化三角形碰撞检测会计算出错误的接触法线表现为物体朝莫名其妙的方向弹射。解决方案是导入前用网格修复工具清理一遍或者换成简单的Primitive几何体做重新测试。排查发散最忌讳瞎调参数把下面这张检查顺序背下来能省你一整天的调试时间。5.2 触觉信号抖动滤波方向别搞反仿真算出来的接触力如果不做处理直接丢给下游模块经常会得到一个高频抖动的曲线。特别在接触发生和断开的瞬间力会跳变得很厉害这样的信号没法直接用来训练或者反馈。很多人的第一反应是上一个强力低通滤波器把高频全砍掉。这是一个经典的错误——强力滤波确实会让曲线平滑但同时会把接触发生的“细节”抹掉。接触瞬间的力变化往往在几十毫秒内完成强力滤波后这个瞬态信息就完全消失了。下游策略学到的是“用力揉皱了才开始逐渐发力”的假象。正确做法是分阶段处理。先做刚体阶段的轻微低通只去除数值噪声保住瞬态再做接触阶段的事件检测标记出接触开始和结束的时间点最后在触觉信号上应用一个自适应的移动平均窗口窗口大小根据接触状态动态调整——稳定按压时窗口大一点刚接触时窗口小一点。这样得到的触觉信号既平滑又保留了关键的事件特征。如果嫌麻烦也可以用Savitzky-Golay滤波器它比移动平均更能保留信号峰值和跳变。5.3 仿真力跟直觉对不上查这几个地方有时候仿真没发散、也没抖动但算出来的力就是不符合直觉。比如一个水果放在桌上手指轻轻一碰力居然有十几牛顿显然不对。这种“数值对但感觉错”的问题排查方向跟发散完全不同。先查重力是否加载正确。仿真里忘了开重力或者重力方向设反了都会导致接触力莫名其妙。再查物体质量。初学的人经常贪方便不讲物体质量或者按视觉体积瞎填一个数值自然会偏。0.05kg的软木随便一压接触力应该只有零点几牛顿如果你看到几十牛顿十有八九是质量多了两三个数量级。最后查初始状态物体是不是在仿真启动时已经处于“微穿透”状态穿透会人为增大接触力。这些都是非常低级但常见的错误。我踩过最深的坑是在一个多物体场景里某个物体的mesh和另一个mesh在初始状态下就有很小的重叠导致整个系统一启动就带着数牛顿的“预紧力”后面所有接触力读数全被抬高了。5.4 把仿真触觉迁移到真实机器人上的坑补全触觉的最终目的大概率要落到真实机器人上。从仿真触觉到真实机器人的迁移是DEX-X项目中最容易引发“纸上谈兵”质疑的环节。最大的一个坑是仿真里触觉信噪比太高了。真实接触力的噪声通常很重包含电机振动、传感器电气噪声、结构弹性形变带来的串扰。如果训练策略时只用干净的仿真触觉真实环境下很难直接用。我的做法是在仿真触觉上叠加随机噪声和延迟模拟真实传感器的非理想特性让策略在训练阶段就见惯这种干扰。第二个坑是真实机器人的力控响应速度。仿真里你假设接触力可以瞬间计算出来并立即反馈但真实机械臂的力控回路存在几十毫秒级别的延迟。如果策略依赖高频触觉反馈做快速反应迁过去必然失败。对策是在仿真里主动加入反馈延迟的模拟让策略适应低带宽触觉操作。最后一个坑是物体物理属性的领域偏差。仿真里设的摩擦系数和真实物体总有出入domain randomization几乎是必须的——训练时随机化摩擦系数、物体质量、接触刚度让策略学会在参数变化下依然稳定。这些做足之后仿真触觉策略在真实机器人上的成功率才会有保障。6. DEX-X接下来还能往哪走触觉补全这件事越往深做越发现它不只是个“替代传感器”的权宜之计它完全可以成为连接视觉数据和物理交互的重要基础设施。这里聊几个我最近在琢磨的扩展方向供参考。6.1 触觉数据增强给人类视频批量生成标签互联网上有海量的人类操作视频这些视频里蕴含了丰富的操作方式唯独缺少物理量信息。DEX-X可以把这套流程变成了一条流水线视频进去带触觉标签的交互数据出来。这意味着我们不再需要依赖昂贵的触觉传感器就能构建大规模的“视觉-触觉”配对数据集。这样的数据集对训练触觉感知模型、跨模态对齐模型甚至基础操作模型都有巨大价值。我算过一笔账一个场景从视频采集到仿真触觉生成单人操作大概需要一到两天而真实触觉传感器采集同样数据硬件成本至少几万块还得花更多时间做标定。仿真的成本优势和速度优势在这里完全体现出来。6.2 遥操作与数字孪生DEX-X的另一个典型应用场景是遥操作。操作员看视频画面控制机器人时缺少触觉反馈一直是个痛点。如果把仿真环境作为数字孪生体实时计算接触力再通过触觉手套反馈给操作员操作体验会有一个质的提升。不需要在机械臂末端额外装传感器只需要场景的数字模型和机械臂的关节状态就能生成触觉反馈。这个方向上我已经做了些原型验证延迟是瓶颈。仿真计算力、通信、触觉手套渲染的整个链路延迟必须控制在50毫秒以内才有实用价值。目前来看简单场景能做到复杂场景还得优化。6.3 触觉语义化和大模型结合最后一个方向我特别看好把触觉信息语义化跟大模型结合。现在的具身智能大模型主要靠视觉和语言两个模态触觉几乎是空白。如果把DEX-X生成的触觉数据变成自然语言描述——比如“这个接触很轻”“这里有滑移趋势”——就能让大模型理解物理交互的状态。我在实验中发现触觉信号可以通过简单的阈值和规则转换成离散事件再组合成语言描述。比如“手指接触杯盖压力缓慢增加开始旋转出现滑移”。这类结构化描述喂给大模型之后它就能基于触觉事件做推理。如果这条路走通机器人就不只是“看到”世界还能“感知”世界而且在交互中具备真正的物理直觉。我在DEX-X项目里最深的体会是仿真补触觉这个思路的价值不是把物理引擎用到极致而是把人类数据里稀缺的物理量变成可以规模化和标准化的资产。每一次从视频到触觉的重建本质上都是在给机器人补上一种“看不见的常识”——知道多大劲儿算大、什么情况会滑、按压到什么程度算到位。这些常识我们人类靠千万次试错获得而仿真正在让机器人用更高效的方式学会它们。最后再分享一个我觉得很实用的技巧生成触觉标签后别急着丢进训练集先挑几个典型帧把接触区域热力图渲染出来跟原视频并排看一遍。当看到仿真算出的“用力位置”跟视频里手指的“姿势”严丝合缝地对应上时你大概就能确信这套流程真的补上了视频缺失的那部分触觉。
返回列表