ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

UI-TARS Desktop 视觉 GUI Agent:从克隆到跑通第一条指令的完整指南

UI-TARS Desktop 视觉 GUI Agent:从克隆到跑通第一条指令的完整指南 UI-TARS Desktop 视觉 GUI Agent从克隆到跑通第一条指令的完整指南【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktopUI-TARS Desktop 是字节跳动开源的 GUI Agent 桌面应用。它用视觉语言模型VLM能同时看懂图像和文本的模型驱动鼠标键盘你用一句自然语言它代替你操作电脑。模型调用在本地发起操作全程不经过第三方脚本。零基础读者按本文从克隆走到第一条指令有经验的读者重点看第 7 节调参与第 9 节扩展入口。一个让你头疼的真实场景自动化脚本写着写着就废了。坐标写死窗口挪一挪全部点击落空。选择器写死应用一升级脚本集体罢工。重跑一遍再修一遍一下午耗在维护上。UI-TARS 的解法是不写脚本VLM 实时看屏、理解界面结构、生成下一步动作循环直到任务完成。环境摸底开工前花 2 分钟确认系统要求 macOS12 Monterey 及以上推荐 M 系列芯片 16GB 内存 Windows10/11 64 位推荐 16GB 内存 Linux20.04 及以上发行版X11 环境最稳推荐单显示器依赖版本快检node -v # 需 20.xmonorepo 根 engines 硬性要求 pnpm -v # 建议 9.x与 packageManager 字段锁定版本一致 which chrome || which google-chrome # Browser Operator 需要浏览器 which firefox # Chrome/Edge/Firefox 任一即可没有就先装把项目跑起来从克隆到窗口弹出拉代码与装依赖git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop # 拉取仓库 cd UI-TARS-desktop corepack enable # 用仓库锁定的 pnpm 版本 pnpm install # 安装 monorepo 全部依赖首次启动与权限pnpm dev:ui-tars # 等价于 turbo run ui-tars-desktop#dev启动 Electron 应用macOS 首次启动走 3 步打开应用按弹窗提示跳转「系统设置 → 隐私与安全性 → 辅助功能」打开 UI TARS 开关同一区域找到「屏幕录制」再打开一次重启应用两项权限生效后才能截屏和模拟键鼠macOS 权限配置入口。辅助功能管模拟键鼠屏幕录制管截屏少开一个功能就瘸一半。Windows / Linux无需额外权限装好浏览器后直接启动即可。卡住了看第 8 节踩坑记录。第一次跑通一个真实任务模型配好之前应用能开但任务跑不动。设置页填完四项参数点「Check Model Availability」变绿再开聊。最简指令 打开系统计算器跑通后试试这几条由浅入深 打开 VS Code 设置把 Auto Save 延迟设为 500 毫秒 # 多步定位 参数输入 新建一个浏览器会话搜索 UI-TARS GitHub 并打开项目主页 # 切到 Browser Operator 打开系统设置进入网络配置页面 # 系统级导航 截取当前屏幕并用一句话描述界面内容 # 纯视觉理解不做操作任务执行界面。左侧是自然语言指令输入区右侧实时显示截屏与每步动作方便逐帧核对它点到了哪里。它到底怎么工作架构速览指令你输入的自然语言会连同动作空间一起交给模型Operator操作器负责截屏和执行动作桌面与浏览器各有一套VLM视觉模型做核心推理结合指令、动作空间和最近几帧截图输出下一步预测action-parser把模型输出的文本预测解析成结构化的click/type/scroll动作执行循环screenshot → 模型预测 → 执行 → 再截图直到模型判定finished或触顶 Max Loop任务执行与数据采集闭环。每一步动作、每帧截图都会进入事件流这也是报告导出功能的来源。进阶配置把精度和速度拉满模型与提供商切换VLM Provider 选择界面。不同 Provider 对应不同的动作解析策略切换模型时务必同步切换这一项。配置可以整包导成预设文件仓库里有一份示例examples/presets/default.yamlname: UI TARS Desktop Example Preset # 预设名称 language: en # 控制 VLM 输出语言 vlmProvider: Hugging Face for UI-TARS-1.5 # 必须与模型匹配 vlmBaseUrl: https://your-endpoint.huggingface.cloud/v1 # 注意末尾 /v1/ vlmApiKey: your_api_key # 对应平台的 API Key vlmModelName: your_model_name # 端点页可查到的模型名预设支持从本地文件导入也支持从 URL 拉取远程预设每次启动应用时自动同步。按场景调参场景推荐参数一句话理由简单单步任务Max Loop 25Loop Wait 1000ms步数少跑完即停省 token多步验证流程Max Loop 100Loop Wait 1000ms给每步截图留足确认时间动态加载页面Loop Wait 2000ms等内容渲染完再截屏本地 vs 云端# 本地模型服务指到内网端点数据不出内网 export VLM_BASE_URLhttp://192.168.1.10:8080/v1/# 云端用托管端点免维护按量付费 vlmBaseUrl: https://ark.cn-beijing.volces.com/api/v3踩坑记录我实际遇到的几个问题Base URL 少斜杠现象模型检查直接 404Key 明明是对的。 解决vlmBaseUrl必须以/v1/结尾端点页上能看到完整写法。Provider 选错现象动作全乱点一开始以为是模型太弱。 解决Provider 是动作解析器的路由换模型时把它同步换成对应选项。多显示器漂移现象点击落在副屏坐标看着合理却总差一截。 解决单显示器下最稳多屏任务大概率失败先切单屏再跑。想动手改扩展开发入口扩展的核心是 Operator 接口实现screenshot()返回屏幕 base64 与缩放因子实现execute()按解析后的预测执行动作再挂进GUIAgent即可。import { Operator } from ui-tars/sdk/core; // SDK 基类 import { browser } from playwright; // 换成你自己的驱动 export class MyOperator extends Operator { // 声明动作空间注入模型的系统提示词 static MANUAL { ACTION_SPACES: [ click(start_box) # 点击指定坐标, type(content) # 在当前输入框输入, finished() # 结束任务, ], }; async screenshot() { const shot await this.page.screenshot({ encoding: base64 }); // 抓屏 return { base64: shot, scaleFactor: 1 }; } async execute(params) { const { parsedPrediction } params; // 已解析好的动作 if (parsedPrediction.action_type finished) { return { status: END }; // 通知 Agent 收工 } return { status: SUCCESS }; } }更多接口细节见 docs/sdk.md。上线前 5 分钟检查清单Node 版本 20模型检查按钮变绿macOS 双权限已开单显示器运行最小指令跑通一轮延伸阅读五分钟内配好 UI-TARS 桌面应用部署VLM 模型配置与参数说明预设导入与远程同步教程SDK 扩展开发与 Operator 实战模型服务可换解析策略随 Provider 走Operator 接口随时可以插自己的实现。把看屏幕这件事交给 VLM硬编码坐标就退场了。克隆下来配好端点跑第一条指令。【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表