Checkpoint 管理¶
训练产出两种 checkpoint,内容与用途不同。
| 类型 | 路径格式 | 包含内容 | 用途 |
|---|---|---|---|
| State | tinker://<session>/weights/<name>-state |
模型权重 + optimizer 状态 | 恢复训练(续训) |
| Sampler | tinker://<session>/sampler_weights/<name>-sampler |
仅模型权重 | 推理 / 评测 |
两种路径都可在训练页的版本记录与最近训练产物列表中找到。
恢复训练(增量续训)¶
训练页支持从上一版本的 state_path 续训。
import mint
sc = mint.ServiceClient()
# 仅恢复权重(optimizer 重置,适合换数据集)
training_client = sc.create_training_client_from_state(state_path).result()
# 恢复权重 + optimizer(真正续训,保持 Adam 动量)
training_client = sc.create_training_client_from_state_with_optimizer(state_path).result()
在 MindForge 训练面板中,用 --resume-state 指定上一版本的 state_path,加
--resume-with-optimizer 实现保留 Adam optimizer 状态的完整续训。
从 checkpoint 到推理¶
Sampler checkpoint 已可直接推理——把其路径作为 model 字段传入。三种推理方式见
使用训好的模型。