ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Miles:高性能企业级强化学习框架,为大规模模型后训练带来多项突破!

Miles:高性能企业级强化学习框架,为大规模模型后训练带来多项突破! 面向大规模模型后训练的企业级强化学习网站、文档、快速开始、支持的模型、Miles 扩散模型等相关链接待补博客、Slack (#miles-rl)、新闻等相关链接待补。2026 年各月动态如下[2026/08] Miles v0.1 版本发布可阅读博客文章Miles v0.1生产级后训练[2026/07] 有多条动态包括迈向原生 Blackwell 的 8 位和 4 位强化学习Miles 中的端到端 MXFP8 和 NVFP4 强化学习SGLang 和 Miles 为 Kimi K3 提供首日支持Miles 引入策略内蒸馏SGLang 和 Miles 为前沿多模态模型 Inkling 提供首日支持借助 MilesDeepSeek - V4 闪存强化学习训练登陆 AMD Instinct MI355X[2026/06] SGLang 和 Miles 为 NVIDIA Nemotron 3 Ultra 提供首日支持[2026/05] 一个 token 都不落下Miles 中的 token 输入 - token 输出[2026/04] 数秒内更新 1T 参数大规模分布式强化学习中的 P2P 权重传输DeepSeek - V4 首日支持通过 SGLang 和 Miles 实现从快速推理到经过验证的强化学习。关于 MilesMiles 是一个高性能、适用于企业的强化学习框架专为大规模模型后训练而设计。它将用于高吞吐量采样的 SGLang 与可扩展训练的 Megatron - LM 相结合具备在万亿参数规模下进行强化学习所需的精度、稳定性和可观测性特性。对于希望直接训练 HuggingFace 实现的运行也提供了 PyTorch FSDP2 后端不过相关配方、并行策略和最大规模的模型都基于 Megatron - LM。详见训练后端。“千里之行始于一次采样。”性能全异步强化学习采样和训练工作进程相互解耦支持可配置的策略内和策略外调度经过优化的流水线减少了空闲时间还提供可定制的异步采样和评估模式。详见全异步强化学习。快速智能体采样生成过程在 SGLang 上运行通过路由器将请求分发到各个引擎保留每个请求的元数据并对集群进行健康检查。针对多轮智能体工作负载进行了优化。快速权重更新即使是像 Kimi - K2.6 这样的万亿参数模型新的权重也能在数秒内通过 P2P RDMA 快速路径更新到引擎中适用于分布式设置。低精度训练支持 MXFP8 和 NVFP4 训练采用数值稳定的强化学习配方减少因精度问题导致的偏差。同时也支持 FP8、INT4 QAT、BF16 和 FP16。LoRA 和多 LoRA低秩适配器可以在少量 GPU 上训练前沿规模的模型并且相同的适配器可以直接加载到 SGLang 中进行采样。正确性和弹性Token 输入 - Token 输出TITO支持所有模型和黑盒封装在采样和训练之间无需进行解 token/重新 token 化的往返操作。采样路由重放R3在训练器的前向传播过程中重放采样期间记录的专家路由消除了在大规模运行中导致不稳定的混合专家MoE路由不匹配问题同时通过计算和通信重叠降低成本。容错能力当 SGLang 引擎出现故障时Miles 能够恢复并继续运行无需重启或暂停。Miles 支持的运行内容首日模型支持DeepSeek - V4、Kimi - K3、GLM - 5.2、Inkling 和 Nemotron 在发布当天即可支持。除了发布首日支持的模型外几乎所有前沿模型都能在 Miles 上运行包括 Kimi - K2.6 和 Qwen3.5。详见模型。广泛的硬件支持通过 ROCm 支持 NVIDIA GB300、GB200、B300、B200、H200、H100 和 A100以及 AMD MI300X、MI325、MI350 和 MI355X。详见安装了解每个 GPU 的支持状态和相应的容器镜像。丰富的配方支持支持 GRPO、GSPO、PPO 和 REINFORCE 等强化学习算法以及监督微调SFT和策略内蒸馏。智能体环境通过与 Harbor、HUD、NeMo Gym、OpenEnv、Verifiers 等的连接器来训练编码和计算机使用智能体每个连接器都可以插入适合它的采样层并在 AgentENV、Daytona、E2B 或 Modal 上使用任务沙箱。详见智能体环境。扩散模型在 Miles - diffusion 中支持基于 sglang - diffusion 采样引擎和 FSDP2 训练器的 Flow - GRPO、DiffusionNFT 和 SFT。快速开始安装 Miles、快速开始、支持的模型、核心概念、启动脚本演练、训练后端、贡献指南等相关链接待补。致谢Miles 派生自 slime并集成了 SGLang、Megatron - LM 和 torch_memory_saver。Miles 的发展离不开众多团队的支持从硬件和云服务提供商到模型实验室、智能体基础设施团队和学术界。引用如果 Miles 在你的研究或产品中发挥了作用请引用它misc{miles2026, title Miles: Enterprise - Grade Reinforcement Learning for Large - Scale Model Post - Training, author Miles Team, year 2026, howpublished \url{https://github.com/radixark/miles}}
返回列表