跳转至

术语表

MinT 文档里的核心术语速查。

训练

术语 含义
SFT 监督微调(supervised fine-tuning)。用带标签的输入-输出对训练模型模仿目标行为。
RL 强化学习(reinforcement learning)。用奖励信号优化模型,常见算法 GRPO / PPO。
DPO 直接偏好优化(direct preference optimization)。用偏好对直接优化策略,无需显式 reward model。
LoRA 低秩适配(low-rank adaptation)。冻结原模型权重,只训练注入的低秩矩阵,显著降低训练与存储成本。
adapter LoRA 训练产物,可挂载到基础模型上改变其行为。
checkpoint 训练中间状态,包含 adapter 权重与优化器状态,用于恢复训练或采样。
policy RL 中被优化的模型(策略)。
rollout RL 中从 policy 采样轨迹的过程。
reward RL 中衡量轨迹好坏的标量信号。

模型与推理

术语 含义
macaron 基于 MinT 训练的模型系列,当前版本 macaron v1。
base model 基础模型,adapter 挂载的宿主模型。
token 模型处理的最小文本单元,与 tokenizer 输出的整数对应。
sampling 从模型生成文本的过程。
logprob 模型对某 token 的对数概率,用于评估与 RL。

平台组件

术语 含义
MindForge MinT 的网页端训练平台,用于管理 SFT / RL / DPO 任务。
MinT SDK 终端侧 Python 库,import mint 后驱动训练与采样。
Model Router MinT 服务端组件,路由推理请求到对应 GPU。
Task Manager MinT 服务端组件,调度训练任务。
LoRA Manager MinT 服务端组件,管理 adapter 生命周期。

Note

本文档面向终端用户。