verl-mint¶
verl-mint 是 MinT 训练运行时的开源版本,基于 veRL 与 Ray 构建。它在 API 边界暴露 MinT 的训练工作流, 客户端可保留熟悉的 session、checkpoint、sampler 与 future 语义,同时将计算迁移到自己的 GPU、 Ray 或 veRL 集群与存储上。
在 MinT SaaS 上运行的同一个 SDK 脚本,可以不加修改地在本地 verl-mint 部署上运行。
算法¶
| 算法 | 状态 | 说明 |
|---|---|---|
| SFT | 可用 | LoRA SFT、checkpoint 保存/加载、断点续训、采样器交接 |
| GRPO | 可用 | Group Relative Policy Optimization;组相对优势,无需价值 critic |
| DPO | 计划中 | 偏好优化方向 |
支持模型¶
| 系列 | 规模 | 状态 |
|---|---|---|
| Qwen | 0.6B | 可用 |
| Qwen | 4B | 可用 |
| Qwen | 30B | 可用 |
| Qwen | 8B | 计划中 |
安装¶
smoke 扩展会从 MindLab 仓库安装官方 MinT SDK(mindlab-toolkit)。
前置条件¶
verl-mint 假设执行环境已就绪;它不会为你准备 Ray、GPU 或 worker 镜像。
| 前置条件 | 要求 |
|---|---|
| Ray | API 节点与每个 worker 上需 ray[default]>=2.46.0,<3 |
完整的安装指南、算法细节与集群配置,请参见 verl-mint 仓库。