跳转至

训练

训练页启动 LoRA SFT 任务并跟踪其记录。

训练——训练配置卡片与训练记录表。

训练配置

训练配置卡片构建单个 SFT 任务。字段:

  • 数据版本——从数据页选一个 SFT 版本。点 上传 SFT 可直接上传新 JSONL。
  • 训练起点(基座模型)——冻结的基座,LoRA 适配器挂载其上,如 Qwen/Qwen3.6-35B-A3B
  • epochsbs(批大小)、lr(学习率)、rank(LoRA 秩)——超参。

展开完整命令 预览生成的 scripts/train.sh,再点 开始训练。任务在后台运行。

训练只消费自建题库产生的 SFT

训练只消费自建题库通过轨迹产生的 SFT。官方 Benchmark 记录进入训练——仅用于评测。

训练记录

训练记录列出每个任务:ID(版本)、Session、数据版本、行数、epochs/bs/lr/rank、 指标(NLL)、时间与操作(详情 / 日志 / 删除)。点 详情 看训练曲线, 日志 看运行日志。

训练对比

训练对比 让你选择多个记录叠加指标——便于观察新数据版本或超参是否优于上一轮。勾选记录后 点 对比

最近训练产物

最近训练产物列出最近的 sampler_pathstate_pathsampler_path 用于 推理state_path 用于 续训

续训

要从上一版本继续,把训练配置指向该版本的 state_path(见 Checkpoint)。用 --resume-state 恢复权重,加 --resume-with-optimizer 同时恢复 Adam optimizer 状态以实现真正续训。