ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

国产模型综合指标逼近Astra!GPT-6证明拿下物理基模才是具身智能的正确解题思路

国产模型综合指标逼近Astra!GPT-6证明拿下物理基模才是具身智能的正确解题思路 GPT-6 Astra在具身领域的爆火相信大家都看到了。在独立评测机构Robocurve公布的一组真机测试中GPT-6 Astra 已经能在积木放碗任务中完成 19/20 次。数字大模型在物理世界能力的涌现又进了一步。昨天我们也分享了Astra的能力涌现这件事儿OpenAI通过加入一些机器人数据进入训练使其能够具备赋予机器人操作的能力。虽然后面的精密操作任务不尽人意但Astra给了行业一个很直观的信号。“依然需要继续打磨基座模型当模型足够强大仅需少量具体场景数据就能产生让人兴奋的效果”。这一点对具身基模也很有参考价值。是继续坚持轨迹模仿这条路还是先把基模打磨好让其有足够大的能力去适配具身各个子任务。在这个事情上具身公司开始出现了分歧。有的坚持真机路线想让模型快速预测更丝滑的轨迹有的坚持先做基座模型让模型先理解物理世界的规律然后少量垂直场景去部署。而GPT-6 Astra的表现为“先做强基座再向物理任务迁移”提供了一个新的外部样本。OpenAI的研发模式也慢慢成为主流具身需要专属基座模型这一点几乎是行业共识了。但基模能力的下放依然需要更多的投入来探索。原因很简单对物理世界的通用理解能力可以成为适配各类子任务的基础但理解到执行的鸿沟依然需要突破。特别是频繁接触、交互试错的过程。谁能补齐这些能力谁就有机会把模型推向工厂、实验室和日常生活。国外的dyna正在做这件事而国内一家叫深度机智的公司1年前就在坚持这个方案。原文链接国产模型综合指标逼近AstraGPT-6证明拿下物理基模才是具身智能的正确解题思路开源模型综合第一、14项指标SOTA近日深度机智又有了一个大动作发布了物理智能基座模型PhysBrain 1.5。在28项公开评测中登顶开源模型第一与GPT-6 Astra、Gemini 3.6 Flash的整体差距缩小到1分以内。有趣的是这次和GPT-6 Astra做了一次全方位对比再次把这条能力边界推到行业面前。但真正吸引我们的不是SOTA本身。而是这家公司才成立一年多但从first day就开始坚持以“人类学习”路线开展ego数据基建和基础模型研发直到现在。这次对外的技术报告显示评测汇总了空间感知、多视角理解、任务推理、交互定位和视觉轨迹等五类能力。比较的是模型理解物理场景、判断如何交互的能力。从结果看PhysBrain 1.5-8B取得72.5分在参评开源模型中综合排名第一并拿下14项开源最佳、10项开源第二。同一评测下GPT-6 Astra为73.3分Gemini 3.6 Flash为73.0分。国内这家主打物理AI基座模型的新秀已在空间理解、任务推理和交互定位等能力上进入了全球前列。而且他们的模型比GPT-6这类头部闭源模型小很多。带着这个问题我们和创始人陈凯博士及其团队进行了一次更深入的沟通。陈凯说“支撑这份成绩的是我们围绕人类经验展开的一整套训练设计。让模型从人的操作过程中学习场景、动作与结果再把这些能力组织进面向物理交互的统一基座”。主要体现在模型和数据侧两部分。数据端PhysBrain 1.5主要是基于第一人称视频学习学习人类行为和场景动作的因果关系这让通用视觉语言底座接触到更密集的物理交互监督。模型端语言、动作与未来状态进入共享的自回归主干用统一的预测目标训练。“我们没有选择直接去学习轨迹而是从第一性原理出发强调要用大模型方法论解决具身智能泛化性难题。最近GPT-6在具身任务上的表现说明这条路走得通也值得继续走下去”。“基座模型相当于练内功内功不好盲目去追那些hot words就变成花拳绣腿了。如果基模能力提升了即便不用特定真机数据也能达到好的效果”。这是他们团队的出发点也是他们长期投入的战略主线。打造物理世界的基础模型在陈凯他们看来具身模型的演进应该围绕一个统一的物理交互闭环来组织。深度机智将这个闭环称为Physical Loop机器人看到了什么准备怎么做做完之后世界会怎样变化需要围绕同一个任务连续衔接。需要将“观察世界—理解空间与任务—判断动作后果—执行—反馈修正”组织进同一个基座模型中。此前语义理解、空间感知、物体识别、动作生成和动态预测大多在各自的专用模型中发展。模块之间缺少统一的世界表征、行动目标与反馈机制即使分别拿到高分Physical Loop也很难自然运转起来。柜门没完全打开、杯子在夹爪里偏移、轨迹需要临时修正系统都必须把新的观察重新传回决策过程。只传递一个目标点或一句指令会丢失这些变化。Physical Loop的连续运转需要额外的信息对齐与反馈设计。而PhysBrain 1.5正是让Physical Loop开始运转的实践。构建连续、稳定的闭环难在哪里。连续、稳定的闭环要过三道关。一是误差会累积。真实操作中一次抓取稍有偏差下一次观察就会改变物体发生滑动后续动作也需要随之调整。长任务中的每一步都可能把误差带到下一步并在后续操作中被持续放大。二是能力要耦合。理解不能停在“看懂画面”动作不能停在“生成轨迹”预测也不能只是单独生成未来画面。它们必须围绕同一个任务目标持续衔接理解给动作提供依据动作改变环境预测提前描述可能出现的结果新观察再反过来修正下一步动作。少了任何一环闭环就会断裂。三是数据要完整。要学习这样的闭环过程数据必须保留足够完整的交互信息不只是“手往哪里动”还包括行动前后的因果链条、任务推进中的状态变化。碎片化的操作数据无法支撑闭环学习这正是深度机智重仓人类经验数据的原因。PhysBrain 1.5的设计正是围绕这三大难点展开统一建模为闭环提供基础让能力成为可能持续执行、比较预测与观测、再据此纠错让误差在闭环中被及时修正。要做出能“在世界中行动并自我修正”的底座必须先回到这个闭环本身把能力重新组织起来。这种架构的价值在于把“如何支撑持续交互”前置到了基座设计中。模型需要积累的能力开始围绕行动过程组织起来。所有模态的token都在一个回归流中理解、动作、预测如果分散在不同模型里就很难在同一个任务目标下互相校准。不同能力更新同一套物理表征这件事儿很重要。PhysBrain 1.5统一建模了具身理解、动作生成与未来状态预测。它基于开源基础模型在原有语言词表之外扩展动作 token 和视觉状态 token。语言回答、空间坐标、末端轨迹以及一秒后的 RGB 图像、深度图和机器人掩码都通过共享主干、共享嵌入和共享输出头用同一个 next-token prediction 目标学习。这样做的价值不只是接口统一。而是把基座模型原本的语义和空间理解能力继续延伸到动作生成和后果预测上。其中ActionPiece将单只手腕未来16步的轨迹编码成32个离散动作token让连续运动进入自回归生成框架。未来视觉状态也经过离散编码相同空间位置的RGB、深度与掩码token相邻排列便于模型关联同一区域的不同信息。PhysBrain 1.5从视觉语言底座出发将动作和未来视觉状态纳入统一离散词表。让模型在延伸VLM语义与空间理解能力的同时也具备了行动与预判的能力让理解、行动与预测在同一个基座中彼此对齐、协同演进Physical Loop才得以转动。具身圈内率先押注人类学习路线的团队大概一年前我们问过陈凯博士一个问题人类学习路线真的会work吗那个时候还没有英伟达的Egoscale、Dyna这类公司的定律论证。时隔一年再回头看这个路线是正确的。越来越多团队开始把人类第一视角视频、动作监督和世界模型放在一起讨论。今年 8 月发布的 Dyna-2验证了人类行为数据到机器人行为的Scaling Law也进一步说明了人类在真实世界里的操作经验正在成为训练机器人世界模型的重要燃料。而深度机智更早就在押注这条路。所以只看这个榜单PhysBrain 1.5 像是在一波新的行业共识里拿到了高分。但把时间线往前拨会发现是厚积薄发。2025 年 10 月深度机智发布了《源于人超越人》技术路线图将“人类学习”作为物理智能研发的核心技术路线那个时候就已经把“以人类数据为起点”、“以动作为中心建模”、“身体为 AI 设计”放进了同一套研发框架里。不过在去年那个时间段Ego 数据、物理智能基座、WAM、RSI这些词还没有像今天这样密集出现。从data infra与数采范式不断升级到基座模型PhysBrain的持续迭代再到其自研Prime系列本体的闭环验证。一年多的时间陈凯和他的团队打磨了一套全栈能力闭环。所以PhysBrain 1.5 更像是一次阶段性回收一年前押下去的人类学习路线今天开始在模型评测、数据体系和本体链路上同时显影。人类完整经验是机器人进入物理世界的必备燃料陈凯做了一个形象介绍“具身的通用性一定是基模能力提升之后的事情”。“就像金庸里面的萧峰内力深厚太祖长拳都能虎虎生风击败各路高手”。这和GPT-6的具身表现是一个道理。基模的通用能力依赖的不是少而精的真机轨迹而是海量具备丰富物理常识和动作经验的人类数据。在深度机智看来人类经验与Physical Loop存在天然的契合。人类智能的形成有赖于人类在真实世界中持续地感知、理解、行动、并修正自己的行为。人类经验是Physical Loop的原点也是其根本的驱动力。如果只记录一只手从桌面左侧移动到右侧我们知道它怎么动却未必知道它在完成什么。结合周围环境才能看清它拿的是哪件工具加上任务语境才能理解为什么选择这件工具保留后续画面才能观察动作究竟改变了什么。而“完整经验”的提取恰恰依赖于对人类交互过程尽可能完整的记录。深度机智团队自研的Ego360人类全景真实数据体系就是在做这个事情。这套系统能够提供周围环境的全景视频以及全身姿态、手部运动和任务级语音把动作放回发生时的环境与任务中。拿到数据之后PhysBrain 1.5 将人类交互视频加工为三类监督1场景描述与空间标注用于理解2恢复的手腕轨迹用于动作学习3后续 RGB、深度和人体区域用于未来状态预测。训练数据包括整体人类视频语料约为3万小时来自公开与内部数据。最终经过筛选与标注形成2430万感知样本、3120万动作样本和2680万未来状态样本。在实际训练中还发现人类经验能传递给模型超出单个任务的价值。一次搬运中学到的空间关系可以帮助理解另一种摆放一次操作失误留下的状态变化也可能成为识别类似失败的线索。关于数据增长问题深度机智团队说“Ego360体系目前以每月万小时级速度新增数据”。基模的能力会随着数据继续提升。Human-as-Humanoid让人类运动成为机器人能用的监督数据的完整度和丰富度得到后。还有一个很重要的转换让机器人真的能“吃下去”这些补给。也就是Human-as-Humanoid。人和机器人的身体比例、关节结构、视角与控制接口存在差异。把人体轨迹直接交给机器人可能出现够不到、关节超限或者手腕到位而指尖位置不对的问题。深度机智团队利用同步第一、第三视角视频恢复人体运动再通过分阶段逆运动学生成适配 PrimeU 的 60 自由度动作标签训练 PhysDex 策略。第一视角提供接近执行时的观察第三视角帮助补足身体与手部运动信息。深度机智给出的报告显示当前方案原始示范吞吐量达到遥操作的4.8—7.2倍。在部分任务中执行策略PhysDex仅用转换后的人类示范进行目标任务后训练就能开展无需目标任务机器人示范的真机测试。基座模型越强post-training需要真机数据越少预训练越扎实后训练就越有机会减少对新增真机示范的依赖。陈凯博士说这也是他们为什么重仓基座模型。很多团队为了短期效果放弃了长期价值。方向已经偏了。拿起杯子、移动容器、接近目标这些行为在不同环境中有大量变化也存在可复用的规律。如果模型在预训练中已经接触过足够丰富的交互后续机器人数据就有机会更多用于适配本体、控制方式和具体任务。就像 EgoScale 里面的实验一样在大规模人类数据预训练后引入较轻量的人类—机器人对齐训练能取得很可观的收益。而 PhysBrain 1.5也是类似它的具身预训练监督来自人类交互视频后续监督微调再引入真机数据。报告还给出了一个迁移信号。随着预训练推进在未加入训练的RoboDojo数据上动作token困惑度从12.39降到6.57。也就是说给定真实动作历史模型对后续参考动作的离线预测改善了。所以具身模型预训练的价值就是让真机学习更集中。如果模型已经掌握了任务的大部分结构新增的机器人经验就可以更多用于接触控制、硬件差异与失败恢复。对于一个需要覆盖大量任务的系统减少每个任务的重复学习意味着更低的扩展成本。这也是人类数据路线最值得持续验证的价值。GPT-6 给了新范式具身公司下一程需要补上物理闭环GPT-6 Astra 给行业提供了一个很强的信号基座模型的能力已经开始下放到真实机器人任务里。这件事对具身公司真正的提醒是机器人能力的上限正在越来越依赖基模本身。要训练这样的模型数据不能只是一段孤立轨迹。机器人需要学到的是完整经验任务发生在什么环境里人为什么这么做动作之后物体和场景发生了什么变化。深度机智押注人类学习路线本质上就是在补这块经验来源。这种长期坚持基于他们对物理智能一个更加底层的判断物理智能的源头不在对动作的模仿而在对人类真实交互经验的理解与提炼。这条路没有捷径也正因如此它需要持续的技术信念和长期主义的坚持。但有经验不等于能闭环Physical Loop的转动需要从数据采集到transfer、模型训练一整套的工程能力闭环。下一阶段的竞争拼的将会是谁能把人类经验稳定转化成模型能力再把模型能力带回真实世界在持续行动、反馈和自我修正中跑起来。
返回列表