术语表¶
MinT 文档里的核心术语速查。
训练¶
| 术语 | 含义 |
|---|---|
| SFT | 监督微调(supervised fine-tuning)。用带标签的输入-输出对训练模型模仿目标行为。 |
| RL | 强化学习(reinforcement learning)。用奖励信号优化模型,常见算法 GRPO / PPO。 |
| DPO | 直接偏好优化(direct preference optimization)。用偏好对直接优化策略,无需显式 reward model。 |
| LoRA | 低秩适配(low-rank adaptation)。冻结原模型权重,只训练注入的低秩矩阵,显著降低训练与存储成本。 |
| adapter | LoRA 训练产物,可挂载到基础模型上改变其行为。 |
| checkpoint | 训练中间状态,包含 adapter 权重与优化器状态,用于恢复训练或采样。 |
| policy | RL 中被优化的模型(策略)。 |
| rollout | RL 中从 policy 采样轨迹的过程。 |
| reward | RL 中衡量轨迹好坏的标量信号。 |
模型与推理¶
| 术语 | 含义 |
|---|---|
| macaron | 基于 MinT 训练的模型系列,当前版本 macaron v1。 |
| base model | 基础模型,adapter 挂载的宿主模型。 |
| token | 模型处理的最小文本单元,与 tokenizer 输出的整数对应。 |
| sampling | 从模型生成文本的过程。 |
| logprob | 模型对某 token 的对数概率,用于评估与 RL。 |
平台组件¶
| 术语 | 含义 |
|---|---|
| MindForge | MinT 的网页端训练平台,用于管理 SFT / RL / DPO 任务。 |
| MinT SDK | 终端侧 Python 库,import mint 后驱动训练与采样。 |
| Model Router | MinT 服务端组件,路由推理请求到对应 GPU。 |
| Task Manager | MinT 服务端组件,调度训练任务。 |
| LoRA Manager | MinT 服务端组件,管理 adapter 生命周期。 |
Note
本文档面向终端用户。