ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

如何把多台闲置设备拼成一个 exo 本地大模型集群:原理、门槛与实操指南

如何把多台闲置设备拼成一个 exo 本地大模型集群:原理、门槛与实操指南 如何把多台闲置设备拼成一个 exo 本地大模型集群原理、门槛与实操指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo手头有两台吃灰的 Mac Studio或者一台 M4 Pro 加一台 Mac Mini单独用都跑不动 70B 以上的大模型exo 是一个开源框架能把所有装了它的设备自动连成一个 AI 集群内存累加跑单机塞不下的大模型在 Thunderbolt 5 上启用 RDMA远程直接内存访问让两台机器直接读写对方内存、绕开 CPU之后加设备还能变得更快而不是更慢。原理白话拆解三台设备为什么能跑 235B模型分片把一本 2000 页的书拆成四章四个人各读一章、同时翻页——本质是 tensor parallelism张量并行按层把模型权重切到不同设备的显存里每台只放 1/4。exo 支持 pipeline按整层分段和 tensor 两种切法。自动发现就像新同事进办公室扫一眼名片就知道谁是法务谁是财务。每台装了 exo 的设备启动后自动广播自己的内存、芯片和网络能力零手动配置就互相看见。拓扑感知调度老厨师知道哪个灶台离菜桌近就优先用哪口——exo 会实时读取每台设备的资源和每条链路间的延迟、带宽自己算出最优切分方案而不是拍脑袋平均分配。传统方式单台设备塞不下就换更贵的硬件。exo 的方式内存横向堆叠设备越多总容量越大且 RDMA 下速度随节点数增长。资源门槛评估你的设备够不够格维度最低要求推荐配置难度单台设备一台 Apple Silicon Mac可运行 Llama-3.2-1B约 730MB 内存占用M4 Pro 及以上★★☆☆☆集群规模2 台设备同网段直连4 台 TB5 机型全互联★★★★☆系统版本Linux 可跑目前仅 CPU 后端macOS 26.2解锁 RDMA★☆☆☆☆网络有线局域网Thunderbolt 5 数据线直连★★★☆☆如果你只有一台 8GB 内存的旧 MacBook也可以先用 Llama-3.2-1B-Instruct-4bit 把整套流程跑通验证后再考虑扩容。分阶段实操从装依赖到跑通对话第一步装好依赖做什么macOS 上先装 brew再执行brew install uv node然后安装 Rust nightlyrustup toolchain install nightly。为什么uv 管理 Python 依赖node 用来构建前端仪表板Rust 用于编译底层网络绑定。检查点终端里uv --version、node --version、rustc --version三条命令都能输出版本号即成功。⚠️ Linux 用户注意exo 目前只走 CPU 后端GPU 支持还在路上预期别拉太高。第二步拉代码并起服务做什么克隆仓库、构建仪表板、启动服务一共三条命令git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build cd .. uv run exo为什么仪表板要先构建好静态页面uv run exo会把 API、调度器和 worker 一起拉起来。检查点进程常驻不退出服务同时监听http://localhost:52415的 API 与仪表板页面。第三步跑通第一个模型做什么浏览器打开http://localhost:52415/在模型列表里选 Llama-3.2-1B-Instruct-4bit发一句对话。为什么1B 小模型内存占用只有几百 MB是验证下载—加载—推理全链路的最快方式。检查点看到回复逐字流式出现即成功。第四步给集群加上 RDMA 加速做什么仅限 macOS 26.2 的 TB5 设备M4 Pro Mac Mini、M4 Max MacBook Pro、M4 Max / M3 Ultra Mac Studio。关机后长按电源键 10 秒进恢复模式在终端执行rdma_ctl enable重启。然后用 TB5 线把所有成员互连。为什么RDMA 把设备间通信延迟降了 99%是加设备变快的关键。检查点仪表板里能看到新出现的 RDMA 连接即成功。⚠️ 三个坑Mac Studio 上紧挨网口的那个 TB5 口不能用所有设备的 macOS 版本号必须完全一致连 beta 号都要一样每台设备要和集群里其他所有设备直连不是串成一条链。数据背书4 节点集群实测以下数字全部来自仓库内 Jeff Geerling 的 4 × M3 Ultra Mac Studio 集群 benchmark 图表Qwen3-235B8-bit单节点exo 19.5 t/sllama.cppTCP20.4 t/s4 节点exoRDMA31.9 t/s相比自身单节点提升 63.6%llama.cpp 反而跌到 15.2 t/sDeepSeek V3.1 671B8-bit单节点exo21.1 t/sllama.cpp 14.8 t/s4 节点exo32.5 t/s提升 54%llama.cpp 跌到 14.6 t/sKimi K2 Thinking1T原生 4-bit2 节点 21.6 t/s → 4 节点 28.3 t/s提升 31%同样远超 llama.cpp 的 16.4 t/s。排坑清单与下一步为什么两台设备互相发现不了先确认在同一局域网再检查 macOS 版本号是否逐字一致如果你用EXO_LIBP2P_NAMESPACE隔离过集群所有成员必须设同一个命名空间。为什么 RDMA 没生效确认系统是 26.2 以上、机型带 TB5、执行过rdma_ctl enable、线缆互连无遗漏以及 Mac Studio 避开了网口旁那个 TB5 口。模型下不动或磁盘不够用EXO_MODELS_DIRS指向外接 SSD用EXO_MODELS_READ_ONLY_DIRS指向共享存储里的现成权重EXO_OFFLINEtrue表示只用本地已有模型、不联网。现有工具怎么接入API 同时兼容 OpenAI Chat Completions/v1/chat/completions、Claude Messages/v1/messages、Ollama 三种格式把客户端的地址指向本机 52415 端口即可。下一步可以探索用uv run bench/exo_bench.py压测不同分片配置看哪种切法在你的设备上最快也可以从 HuggingFace 加载自定义模型配合EXO_ENABLE_IMAGE_MODELStrue试试图像生成。检查每台设备的空闲内存和 TB5 口数量确认所有设备 macOS 版本逐字一致规划模型放置位置外接盘 / 共享存储准备 TB5 数据线数量 设备数 − 1 起步【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表