VLA¶
MinT 上的 VLA(Vision-Language-Action)微调即将推出(Coming Soon)。VLA 模型以图像和语言指令为输入、输出机器人动作;待具身基座模型在 mint.macaron.im 与 mintcn.macaron.xin 上线后,MinT 将支持 OpenPI 兼容的 VLA 训练。
如需预先登记意向,请联系 sales@mindlab.ltd,或预约 Demo 并在申请中注明 VLA。
本页将覆盖的内容¶
VLA 上线后,本页将按与其它算法页一致的四段式结构编写:
- Configuration ——
mint.ServiceClient、为 VLA 可用的 OpenPI 基座模型调用create_lora_training_client、相机布局选择、动作 token 预算。 - Prompting Guide —— 多相机图像放置、本体感觉(proprioceptive)状态向量、量化动作 token 目标。
- Output Format —— 模型输出的动作 token 如何反量化为连续控制信号;每步动作范围。
- All Parameters —— VLA 专属参数(最大帧数、动作维度、量化层级、自回归掩码),叠加在标准 SFT / RL 参数之上。
相关阅读¶
VLA 尚在推进期间,最接近的已上线内容: