← 返回总览

radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

2,544Fork: 442语言: Python协议: Apache-2.0今日 +55GitHub ↗

🤖 深度介绍

它是什么

Miles 是一个面向企业级场景的强化学习(RL)框架,专为 LLM 与 VLM 的后训练阶段设计。它源自 slime 项目的分支,并与上游保持协同演进,目前已在 GitHub 上积累 2.5k+ stars。

核心亮点

  • 企业级设计:针对生产环境优化,支持大规模分布式训练与稳定部署
  • 双模态覆盖:同时支持文本(LLM)与视觉-语言(VLM)模型的 RL 微调
  • 与 slime 协同:继承成熟架构,同时持续吸收社区改进,保持技术前沿性
  • Apache-2.0 许可:商业友好,无使用限制

为什么火

RLHF 已成为大模型后训练的关键环节,但现有框架多停留在学术原型阶段。Miles 精准切入“企业可用”这一痛点,将研究代码转化为可落地的工业级工具。其与 slime 的共生关系也吸引了关注生态演进的开发者,近 55 个日增 stars 印证了需求的真实性。

适合谁用

  • 需要将 RL 流程接入生产环境的 AI 工程团队
  • 从事 LLM/VLM 对齐研究、希望快速实验的算法工程师
  • 对开源 RL 框架演进路径感兴趣的技术决策者

快速上手

# 安装
pip install miles-rl

# 基本用法(伪代码)
from miles import RLConfig, post_train
config = RLConfig(model_name="your-base-model", rl_algorithm="ppo")
post_train(config, dataset="alignment-dataset.jsonl")

完整配置与分布式启动脚本见项目 examples/ 目录,支持 PyTorch 生态原生集成。