ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

【Omni】OmniGAIA: Towards Native Omni-Modal AI Agents

【Omni】OmniGAIA: Towards Native Omni-Modal AI Agents note先让 Gemini 把媒体“翻译”为 detailed textual description再让 DeepSeek 利用自己更强的 reasoning tool-use 能力生成训练轨迹。论文也明确说因为 Gemini 不暴露原始 reasoning traces所以他们改用 DeepSeek-V3.2 来合成 tool-integrated trajectoriesOmniGAIA 填补了原生全模态 Agent 评测的空白其事件图构造法可扩展至更多场景OmniAtlas 证明了通过高质量轨迹合成 Masked SFT OmniDPO 能显著提升开源模型的工具集成推理能力但感知底座与 Hard 任务推理仍是开放挑战。构造benchmark数据真实多模态数据→ 抽事实→ 构图→ Agent 扩图→ 选一条复杂证据路径→ 隐藏关键节点→ 反向生成 Query构造训练数据Query 已知→ DeepSeek 每步采样 k3→ Gemini verifier 剪枝→ 找到成功轨迹→ 拿成功 trajectory 做 SFT造数据时的探索 agent loop → DeepSeek-V3.2Hindsight-Guided Tree Exploration 里那个走 TIR 轨迹、采样 k3 分支、调 web_search / read_video / code_executor​ 的循环体是 DeepSeek-V3.2​ 当探索器感知前置Gemini-3-Flash 先把原始视频/音频转成文本描述然后 DeepSeek-V3.2 在这个文本化环境里跑 agent loop 合成轨迹剪枝验证器Gemini-3-Flash拿 ground-truth 判哪条分支对OmniAtlas 真正被训练的 agent loop模型 → Qwen2.5-Omni / Qwen3-Omni训练pipeline轨迹级监督微调Masked SFT- OmniDPO细粒度错误纠正OmniDPO 里的“找第一个错步”→ Gemini-3-Flash。失败轨迹归因用的 verifier 是 Gemini-3-Flash文章目录note一、研究动机二、OmniGAIA 基准 OmniAtlas 智能体2.1 OmniGAIA如何构造“难而可解”的全模态任务数据底座四阶段流水线2.2 OmniAtlas原生全模态基础智能体1) 自主工具集成推理TIR2) 主动全模态感知Active Perception3) 基于引导树探索的轨迹合成4) 轨迹级监督微调Masked SFT5) OmniDPO细粒度错误纠正三、实验结果四、实验结果分析4.1 细粒度错误剖析Figure 5 Table 44.2 工具调用分布4.3 原生感知 vs. 外挂感知工具4.4 训练有效性拆解4.5 典型案例启示总结一、研究动机项目链接https://github.com/RUC-NLPIR/OmniGAIA当前多模态大模型MLLM存在三个明显的断层维度现状缺口模型能力主流仍是视觉‑语言或音频‑语言双模态即便出现 Qwen3‑Omni 等全模态模型也偏重感知缺乏长程推理 多轮工具调用没有“原生全模态 Agent”评测基准OmniBench、WorldSense、Daily‑Omni、UNO‑Bench 等大多基于短音视频 选择题 感知导向缺少多跳、多轮工具、开放可验证答案的 Agent 评测Agent 研究文本 Agent 已较成熟但融合视‑听‑语言的全模态 Agentic 推理几乎空白无法衡量真实场景下的通用助手能力核心诉求补上“全模态感知 × 复杂推理 × 工具使用”三位一体的评测与训练范式推动下一代通用 AI 助手。二、OmniGAIA 基准 OmniAtlas 智能体2.1 OmniGAIA如何构造“难而可解”的全模态任务数据底座视频音频FineVideo43K 视频平均 4 分钟、LongVideoBench / LongVideo‑Reason约 10 分钟长视频图像音频COCO 201712.2 万图像 FineVideo 的音频轨道四阶段流水线① 细粒度信号挖掘用 Gemini‑3‑Flash 对每种模态提取时间对齐的确定信息视频按 ≤60s 切片生成场景、事件、非语音环境音描述音频时间戳 ASR、说话人日志、音频事件检测、环境标签图像OCR、物体/人脸检测、全局描述② 全模态事件图构建用 DeepSeek‑V3.2 将提取的信息自动构建为图结构节点实体/事件边跨模态关系。图能自然表达分支一对多、级联顺序、混合拓扑避免线性链的逻辑漏洞。③ Agent 驱动的事件图扩展赋予探索 AgentDeepSeek‑V3.2一套工具主动寻找缺失证据并链接回图search_related_{video/audio/image}_info跨模态检索web_search/page_browser引入外部时效知识web_image_search/visual_question_answering扩展视觉证据code_executor支持多步数值推理Agent 自主决定调用时机将图的边界推到“需要多跳关联工具验证”的复杂度。④ 事件模糊化Fuzzification生成 QA直接问图节点是“事实查找”因此选择长推理路径上的关键节点/边用类型替换实体或遮蔽属性例如把“Ruby Street Bridge”模糊为“一座可移动桥梁”。这强制模型遍历完整逻辑链、融合多源多模态证据才能推出唯一答案。⑤ 质量管控LLM 委员会DeepSeek‑V3.2 Gemini‑3‑Pro筛选 → 可选难度膨胀 → 3 名研究生人工核验可解性、答案唯一性。最终产出360 个任务覆盖 9 个真实领域包含 Easy / Medium / Hard 三档答案类型均为开放可验证且必须调用外部工具主要是网页搜索偶尔代码。2.2 OmniAtlas原生全模态基础智能体不是从头预训练而是在开源全模态模型Qwen2.5‑Omni / Qwen3‑Omni上注入 Agent 能力的训练配方。1) 自主工具集成推理TIR轨迹定义τ [ ( s t , a t , o t ) ] \tau [(s_t, a_t, o_t)]τ[(st​,at​,ot​)]其中s t s_tst​为思考a t a_tat​为工具调用或最终回答o t o_tot​为工具返回。模型基于历史自回归生成p θ ( τ ∣ x ) ∏ t p θ ( s t , a t ∣ x , s t , a t , o t ) p_\theta(\tau|x) \prod_t p_\theta(s_t, a_t | x, s_{t}, a_{t}, o_{t})pθ​(τ∣x)∏t​pθ​(st​,at​∣x,st​,at​,ot​)检测到工具调用 token 时暂停执行把观察追加进上下文继续生成。2) 主动全模态感知Active Perception针对长视频/高分辨率图像避免无差别下采样导致细节丢失。模型可主动调用read_video(video_id, t_start, t_end)read_audio(audio_id, t_start, t_end)read_image(image_ids, crop_box)实现“按需看/听”只加载需要的片段或区域。3) 基于引导树探索的轨迹合成由于闭源模型Gemini不暴露原生推理轨迹作者用DeepSeek‑V3.2作为探索器先用 Gemini‑3‑Flash 把原始多模态输入转为详细文本描述从根状态开始每步采样k3个候选延续思考工具动作用Gemini‑3‑Flash 验证器已知标准答案剪枝错误/冗余分支只保留成功轨迹用于训练4) 轨迹级监督微调Masked SFT标准 teacher forcing但只对 Agent 自身生成的 token思考、工具调用计算损失屏蔽工具返回的 observation。公式L SFT ( θ ) − 1 ∑ m i ∑ i 1 L m i log ⁡ p θ ( y i ∣ y i , x ) \mathcal{L}_{\text{SFT}}(\theta) -\frac{1}{\sum m_i} \sum_{i1}^L m_i \log p_\theta(y_i | y_{i}, x)LSFT​(θ)−∑mi​1​i1∑L​mi​logpθ​(yi​∣yi​,x)这防止模型记忆环境反馈噪声专注学习“如何思考与行动”。5) OmniDPO细粒度错误纠正全轨迹 SFT 不足以修正细微错误。OmniDPO 流程让 SFT 模型在训练集上探索对每个失败轨迹用 Gemini‑3‑Flash已知标注答案定位第一个错误步骤生成纠正后的前缀得到( τ win , τ lose ) (\tau_{\text{win}}, \tau_{\text{lose}})(τwin​,τlose​)对优化masked DPO 目标同样只在 Agent 生成 token 上计算 log‑probL D P O − E [ log ⁡ σ ( β log ⁡ π θ ( τ w i n ) π r e f ( τ w i n ) − β log ⁡ π θ ( τ l o s e ) π r e f ( τ l o s e ) ) ] \mathcal{L}_{DPO} -\mathbb{E} \left[ \log \sigma \left( \beta \log \frac{\pi_\theta(\tau_{win})}{\pi_{ref}(\tau_{win})} - \beta \log \frac{\pi_\theta(\tau_{lose})}{\pi_{ref}(\tau_{lose})} \right) \right]LDPO​−E[logσ(βlogπref​(τwin​)πθ​(τwin​)​−βlogπref​(τlose​)πθ​(τlose​)​)]这样每次优化只聚焦修正单一错误模块感知、推理或工具使用实现精准提升。三、实验结果评测采用LLM‑as‑a‑JudgeDeepSeek‑V3.2判断答案等价性统一提供 web / browser / code 工具。四大核心发现闭源‑开源差距高达 4.7 倍62.5 vs 13.3开源社区在全模态感知与工具推理上急需突破。单纯扩大参数无效560B 的 LongCat 甚至不如 30B 的 Qwen3‑Omni说明工具使用策略才是瓶颈而非参数量。OmniAtlas 带来显著提升Qwen3‑Omni 从 13.3 → 20.87.5小模型增益更夸张7B 3.6→13.3近 3.7 倍证明训练配方能有效解锁各尺寸模型的 Agent 潜力。Hard 任务仍是共同噩梦Gemini‑3‑Pro 在 Easy 达 78.7Hard 暴跌至 38.5OmniAtlas 在易/中档提升明显但 Hard 上仍挣扎揭示深度多跳推理是未来重点。四、实验结果分析4.1 细粒度错误剖析Figure 5 Table 4错误类型占比Qwen3‑Omni‑30B无效工具调用81.1%推理错误79.7%视觉感知错误31.7%音频感知错误33.9%关键规律在 Hard 任务上开源模型工具误用率饱和至90‑96%推理错误率80‑90%说明上游取证失败会级联导致下游推理崩溃。Gemini‑3‑Pro 各项错误率远低于开源工具 35.3%推理 15.8%体现更成熟的规划与验证能力。OmniAtlas 的改进Qwen3‑30B 经 SFTDPO 后无效工具调用降至59.4%推理错误降至64.4%但感知错误仍徘徊 30% 左右 →感知底座是下一个必须攻克的瓶颈。4.2 工具调用分布0 次调用的模型几乎全挂→ 原生感知不足以解决 OmniGAIA 的大多数任务必须借助外部工具。高调用次数10‑20≠ 高成功率→ 大量失败轨迹伴随长尾调用表明模型存在低效探索或“抖动”thrashing反复调用工具却未消除不确定性。OmniAtlas 改变了调用模式从 Qwen3‑30B 的“不敢调/少调”变为“积极调用”分布更广与工具错误下降、总分上升一致但调用效率仍有优化空间。4.3 原生感知 vs. 外挂感知工具实验设计将听觉/视觉模型封装为工具audio_qa/vision_qa让 Agent 通过工具获取缺失模态信息对比“原生全模态输入”与“工具辅助”的性能。结论对强模型Gemini原生感知就是最优解外挂工具不仅掉点还增加工具调用次数4.4 → 6.8‑9.4没有准确性‑成本优势。对弱模型Qwen3‑Omni外挂工具有助于Easy/Medium13.3→15.8/18.1但Hard 档反而下降9.0→3.9/5.1/7.7。说明工具输出能修补低层信号缺失但无法替代原生跨模态融合进行长程推理。外挂感知一致增加交互成本Qwen 工具调用从 0.2 升至 0.5‑2.0意味着更高延迟与部署开销。启示原生全模态感知应作为默认配置外挂感知仅作为弱模型或缺失模态场景的兜底方案。4.4 训练有效性拆解SFT 贡献了大部分增益Qwen3‑30B13.3→18.9主要压低了无效工具调用81.1→65.3。OmniDPO 进一步全面优化在 SFT 基础上再提 1.9 个点并继续降低各类错误验证了细粒度错误纠正的有效性。4.5 典型案例启示参考原文附录 Table 5‑7同一道关于“Joliet Iron Works 历史遗址中出现的桥梁与电影《The Blues Brothers》”的问题失败案例 I无工具模型依赖先验芝加哥大桥不调用工具验证得出错误桥名与建成年限。失败案例 II工具漂移虽然调用工具但查询被错误假设锁定“LaSalle Street Bridge”确认偏误导致计算正确但事实错误。成功案例OmniAtlas先按地点锚定Joliet Iron Works → 附近可移动桥再针对性检索验证桥名Ruby Street Bridge1935 年建与电影开拍时间1979 年 7 月最后用代码计算 1979‑193544。核心教训工具访问是必要非充分条件。成功的 Agent 需要“地点优先锚定 → 假设检验 → 验证后再计算”的鲁棒模式而非盲目检索或过早闭合。总结OmniGAIA 填补了原生全模态 Agent 评测的空白其事件图构造法可扩展至更多场景OmniAtlas 证明了通过高质量轨迹合成 Masked SFT OmniDPO 能显著提升开源模型的工具集成推理能力但感知底座与 Hard 任务推理仍是开放挑战。论文最后指出三个方向全模态 Agentic RL直接优化长程 Agent 策略全模态 MCP 服务扩展工具生态具身全模态智能体迈向物理世界交互
返回列表