
标题UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City来源arXiv, 2608.27456v1️文章简介研究问题当前的多模态大语言模型MLLM智能体能否在真实规模的复杂城市中将局部的视觉感知转化为可靠且持续的物理行动与空间代理能力主要贡献提出了URBANGROUND这是首个基于香港全域3D地理数据构建的真实规模城市沙盒支持第一人称闭环交互用于系统评估MLLM智能体从局部感知到全局空间代理的能力。重点思路构建基于Unity的真实城市仿真环境利用香港地政总署发布的3D可视化地图和3D行人网络数据实现具有物理碰撞约束、动态天气光照及行人流动的连续地理空间模拟。设计五层空间代理评估阶梯涵盖局部环境理解视觉识别、定向、主动探索、显式指令导航、隐式意图探索、多任务规划以及动态环境适应道路封闭、行人避让逐步增加对空间状态持久性和适应性的要求。建立闭环交互协议智能体仅能通过第一人称视角和交互式地图获取信息执行移动、转向等操作无法获取隐藏的全局坐标或路径规划API以此测试其真实的具身推理能力。选取包括GPT-5系列、Claude-Opus、Gemini等在内的主流MLLM进行基准测试分析其在不同任务层级下的表现重点关注局部能力向长程行为的转化效率及错误累积效应。分析总结在局部感知层面现有模型在视觉识别和短距离空间推理上表现良好但在方向感理解和主动探索中准确率显著下降且常为追求速度而违反行人网络约束显示其对物理规则的理解尚不稳固。在长程导航中随着距离增加和指令隐含性增强模型性能急剧崩溃。尽管能识别大致方向但无法将局部原子能力组合成持续的目标导向行为错误随交互步数积累且缺乏有效修正机制。在动态环境适应方面天气和时间变化主要影响局部问答准确性对短程导航影响不一面对道路封闭或移动行人时模型虽能保持局部合规移动但难以及时更新全局路径规划导致任务失败。实验表明孤立的高识别率不代表具备城市级代理能力当前MLLM的核心缺陷在于无法在视图变化后维持一致的空间估计以及在环境变动时缺乏有效的在线状态更新与规划修正能力。个人观点论文突破了以往游戏环境或静态街景数据的局限构建了真正具有地理注册属性和物理约束的真实城市仿真平台。揭示了MLLM在“感知-行动”循环中的深层弱点即局部感知优势无法自然延伸至长程空间代理。