训练¶
训练页启动 LoRA SFT 任务并跟踪其记录。

训练配置¶
训练配置卡片构建单个 SFT 任务。字段:
- 数据版本——从数据页选一个 SFT 版本。点 上传 SFT 可直接上传新 JSONL。
- 训练起点(基座模型)——冻结的基座,LoRA 适配器挂载其上,如
Qwen/Qwen3.6-35B-A3B。 - epochs、bs(批大小)、lr(学习率)、rank(LoRA 秩)——超参。
点 展开完整命令 预览生成的 scripts/train.sh,再点 开始训练。任务在后台运行。
训练只消费自建题库产生的 SFT
训练只消费自建题库通过轨迹产生的 SFT。官方 Benchmark 记录不进入训练——仅用于评测。
训练记录¶
训练记录列出每个任务:ID(版本)、Session、数据版本、行数、epochs/bs/lr/rank、
指标(NLL)、时间与操作(详情 / 日志 / 删除)。点 详情 看训练曲线,
日志 看运行日志。
训练对比¶
训练对比 让你选择多个记录叠加指标——便于观察新数据版本或超参是否优于上一轮。勾选记录后 点 对比。
最近训练产物¶
最近训练产物列出最近的 sampler_path 与 state_path。sampler_path 用于
推理;state_path 用于
续训。
续训¶
要从上一版本继续,把训练配置指向该版本的 state_path(见
Checkpoint)。用 --resume-state 恢复权重,加
--resume-with-optimizer 同时恢复 Adam optimizer 状态以实现真正续训。