ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

3分钟上手 OpenResearch Ray Jobs:用 Ray Jobs API 快速跑分布式实验指南

3分钟上手 OpenResearch Ray Jobs:用 Ray Jobs API 快速跑分布式实验指南 3分钟上手 OpenResearch Ray Jobs用 Ray Jobs API 快速跑分布式实验指南【免费下载链接】OpenResearchTurn your coding agents into research agents项目地址: https://gitcode.com/GitHub_Trending/op/OpenResearchOpenResearch 是一款把 Claude Code、Codex 等编程代理变成研究代理的本地优先工作区工具它的ray后端可以直接对接Ray Jobs API把一次实验提交到你自己的 Ray 集群上分布式运行自动跟踪状态与日志全程无需手写调度脚本。本文带你完成从配置集群地址到监控运行的完整流程。为什么研究实验需要 Ray 集群大模型研究动辄要跑几十个小时的训练和成百上千组超参组合单台笔记本显然扛不住。Ray 提供了弹性的分布式计算底座通过它的 Jobs/Dashboard API默认端口 8265你可以像提交一个作业一样把实验命令扔给整个集群。OpenResearch 把这条链路封装得非常简单你不需要关心 Ray 的runtime_env打包细节也不需要用ray job submit命令行——orx exp run一条命令搞定并且会为每次运行保留不可变的代码快照保证实验可复现。准备工作配置 Ray 集群地址OpenResearch 按以下优先级解析 Ray Jobs API 地址保存在 OpenResearch 设置里的地址$XDG_CONFIG_HOME/openresearch/ray.json环境变量ASTROAI_RAY_JOBS_ADDRESS环境变量RAY_DASHBOARD_URLRay 自身常用默认值http://127.0.0.1:8265也就是说只要你的 Ray 集群 Dashboard 在本地 8265 端口运行开箱即用、零配置如果是远程集群导出RAY_DASHBOARD_URL或在设置面板填入地址即可。地址解析逻辑实现于 ray.rs在提交前 OpenResearch 还会先调用/api/version接口做一次连通性预检连不上会直接给出清晰的报错提示避免提交到一半才发现地址配错。三步提交第一个 Ray 分布式实验第 1 步提交代码。每个后端运行的都是实验分支已记录 commit的快照未提交的文件不会被带上。所以先git addgit commit。第 2 步启动运行。orx exp run expId --backend ray成功后会打印 run id、Ray 的 submission id形如orx-xxxx和一个 Dashboard 观察链接。内部流程是把代码快照打成working_dir包上传到集群按内容摘要寻址重复提交不会重复上传再以bash -c run command作为 entrypoint 提交相关逻辑见 local/ray.rs。第 3 步交给监督进程。OpenResearch 会拉起一个后台的orx supervise进程持续轮询任务状态并镜像日志——不要杀掉它它是 run 状态更新的来源。用 --flavor 指定 GPU 与内存资源Ray 作业的资源需求通过--flavor参数声明语法为cpu[:N]、gpu[:N]、mem:size用逗号组合orx exp run expId --backend ray --flavor gpu:1 orx exp run expId --backend ray --flavor cpu:2,mem:8GiB几个实用细节解析实现见 parse_flavor省略 flavor时 CPU/GPU 预留量为 0能避免小规格集群 head 节点因入口进程占资源而卡在Pending状态mem只是调度预留不是硬性上限内存单位支持GiB、MiB等如mem:8GiB。监控运行日志、状态与等待提交后你可以随时用 CLI 查看进展orx runs project-id # 项目内所有运行 orx logs run-id # 拉取该运行的完整日志 orx exp wait expId # 阻塞等待本次运行进入终态 orx exp cancel expId # 取消在跑的作业orx exp wait默认每 5 秒轮询一次、最长等 1800 秒是驱动自动科研循环的关键原语——运行一结束代理就能接着分析结果。你也可以打开启动时打印的 Dashboard 链接直接在 Ray Web 界面里查看作业详情。实战场景分布式扫描 Scaling LawsRay 后端最适合的玩法之一是像上图这样扫描不同 FLOPs 预算下的最优模型尺寸与训练 token 数。配合 OpenResearch 的实验树每个分支是一个变体不同深度、不同数据、不同优化器基线分支上固定 run command子分支只改代码或配置。多个 Ray 作业可以并行探索不同方向orx exp wait --project projectId在任一作业完成时返回形成跑完一个、再发一个的预算循环。仓库中的 nanochat 示例 就是这类实验的完整载体从预训练、SFT 到评估一条龙runs/speedrun.sh 单脚本即可复现 GPT-2 级模型训练其证据包见 demo/nanochat/evidence/README.md。常见坑与注意事项现象原因与解决报 Could not reach Ray Jobs地址未配置或集群没起检查RAY_DASHBOARD_URL或设置面板作业卡在 SCHEDULING/PENDING资源预留超过集群容量去掉--flavor或调小gpu数量想用--image/--host/--timeoutRay 后端不支持这三个参数作业运行在集群自身的运行环境中无超时限制需在工作命令内部自行限时状态突然变成 GONE集群侧记录被清理如 head 重启OpenResearch 会做去抖处理Ray 后端的设计约定完整记录在官方技能文档 references/ray.md多后端hf、slurm、k8s、ssh 等的通用启动规范见 orx-compute/SKILL.md。相关源码与文档Ray Jobs REST 客户端预检、提交、日志拉取src/jobs/ray.rsRay 本地提交与监督进程编排src/local/ray.rsexp run/wait/cancel命令实现src/commands/exp.rs计算后端路由规范agent-skills/orx-compute/SKILL.md小结OpenResearch 让 Ray Jobs API 分布式实验 变成三件事——提交代码、orx exp run --backend ray、orx logs看结果。可复现快照、资源 flavor、后台监督与实验树并行是它把多后端计算统一成一套研究工作流的完整闭环。【免费下载链接】OpenResearchTurn your coding agents into research agents项目地址: https://gitcode.com/GitHub_Trending/op/OpenResearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表