ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

3步跑通OmniParser:纯视觉屏幕解析工具完整教程

3步跑通OmniParser:纯视觉屏幕解析工具完整教程 3步跑通OmniParser纯视觉屏幕解析工具完整教程【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParserOmniParser是一个屏幕解析Screen Parsing工具能把一张 GUI 截图转成带编号、带描述的结构化界面元素。读完本文你可以装好环境、解析出自己的第一张截图并把解析结果接入视觉大模型生成界面操作。它解决什么问题不依赖系统辅助功能树只靠截图**识别Grounding**界面元素定位按钮、输入框等可交互区域并给每个图标生成文字描述支持桌面、网页、移动端截图见 demo.ipynb通过OmniToolomnitool/驱动 Windows 11 虚拟机执行操作适合做 GUI Agent、界面自动化或训练数据采集从零到跑起来先建环境git clone https://gitcode.com/GitHub_Trending/omn/OmniParser cd OmniParser conda create -n omni python3.12 conda activate omni pip install -r requirements.txt这条命令创建 Python 3.12 环境并安装依赖依赖来自 requirements.txt含 torch、transformers、gradio、paddleocr 等全部装完才算就绪。再下载 V2 模型权重huggingface-cli download microsoft/OmniParser-v2.0 icon_detect_v3/model.pt --revision refs/pr/37 --local-dir weights for f in icon_caption/{config.json,generation_config.json,model.safetensors}; do huggingface-cli download microsoft/OmniParser-v2.0 $f --local-dir weights; done mv weights/icon_caption weights/icon_caption_florence第一段下载 YOLOv9-E 检测器权重在 HF PR #37 合并前需用该方式第二段下载 Florence2 描述模型并改目录名weights/下最终应有icon_detect_v3和icon_caption_florence两个子目录。启动网页演示python gradio_demo.py浏览器会打开演示页默认 7861 端口左侧上传截图右侧出解析结果。第一次真实使用解析一张 Word 界面截图以 demo.ipynb 使用的 Word 截图为例走一遍流程输入启动 gradio 演示后上传一张 Word 文档截图。调参确认 Box Threshold 为 0.05、IOU Threshold 为 0.1默认值打开 Use PaddleOCR。执行点击 Submit检测与描述两个模型依次跑完终端打印finish processing。查看右侧出现带编号边框的标注图文字框输出icon 0: ...形式的元素列表。衔接把这份编号元素清单交给视觉大模型它即可输出点哪个框、做什么动作的决策。进阶用法如何调整元素识别精度网页演示里有两个滑杆Box Threshold过滤低置信度边框0.01–1.0IOU Threshold去除重叠框0.01–1.0代码在 gradio_demo.py。服务化部署时在 omniparserserver/omniparserserver.py 的启动参数里用--BOX_TRESHOLD设置检测阈值--device cuda可切到 GPU 加速。经验做法小图标漏检就调低 Box Threshold边框杂乱就调高它。模型组合与密钥怎么配在 omnitool/gradio/app.py 的界面模型选择器中切换方案除默认omniparser gpt-4o外还有omniparser o1、omniparser R1、omniparser qwen2.5vl和claude-3-5-sonnet-20241022走 Anthropic Computer Use不经 OmniParser。界面上填入对应 OpenAI 或 Anthropic 的 API Key 后即可开始。OmniTool 虚拟机链路怎么搭三个组件omniparserserverFastAPI 解析服务、omniboxDocker 容器里的 Windows 11 虚拟机、gradio下指令的界面说明见 omnitool/readme.md。omnibox 依赖 KVM适合在 Linux 或 Windows 上跑需准备 Windows 11 Enterprise 评估版 ISO 并放入omnitool/omnibox/vm/win11iso。依次启动python -m omniparserserver再用omnitool/omnibox/scripts下的./manage_vm.sh create建虚拟机最后python app.py --windows_host_url localhost:8006 --omniparser_server_url localhost:8000。它是怎么工作的解析分两阶段先用YOLOv9-E检测器找出屏幕上的可交互区域再用微调的Florence2模型为每个图标生成文字描述同时用 OCRPaddleOCR/EasyOCR提取文本三类信息合并成带编号的结构化元素列表交给视觉语言模型做动作决策。它只做看懂截图这一步本身不执行鼠标键盘操作OmniTool 场景里执行由虚拟机内的 pyautogui 完成。边界提醒解析质量受截图分辨率和界面样式影响omnibox 目前只支持 Windows 11。避坑指南现象gradio 界面点提交后报 Windows Host is not responding。原因虚拟机里接收命令的服务还没起来通常是 omnibox 首次安装没跑完。解决办法在 NoVNC 里确认桌面没有残留终端窗口等待 10 分钟无效就用./manage_vm.sh stopstart重启仍不行则delete后重新create已有存储会很快。现象Windows 上启动报libpaddle: The specified module could not be found。原因PaddleOCR 依赖 C Redistributable 运行时。解决办法先安装 C Redistributable再重新执行pip install -r requirements.txt。现象manage_vm.sh create长时间不结束。原因首次创建要下载组件并安装一批预装应用通常耗时 20–90 分钟。解决办法耐心等终端出现 VM server is up and running!如果只需最小环境可按 omnitool/readme.md 的说明注释掉部分预装应用。OmniParser 用纯视觉链路把截图变成可被大模型消费的元素清单配合 OmniTool 即可构成完整的 GUI 操作闭环。下一步建议阅读 README.md 和 docs/Evaluation.md 了解基准评测细节。【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParser创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表