跳转至

VLA

MinT 上的 VLA(Vision-Language-Action)微调即将推出(Coming Soon)。VLA 模型以图像和语言指令为输入、输出机器人动作;待具身基座模型在 mint.macaron.immintcn.macaron.xin 上线后,MinT 将支持 OpenPI 兼容的 VLA 训练。

如需预先登记意向,请联系 sales@mindlab.ltd,或预约 Demo 并在申请中注明 VLA。

本页将覆盖的内容

VLA 上线后,本页将按与其它算法页一致的四段式结构编写:

  • Configuration —— mint.ServiceClient、为 VLA 可用的 OpenPI 基座模型调用 create_lora_training_client、相机布局选择、动作 token 预算。
  • Prompting Guide —— 多相机图像放置、本体感觉(proprioceptive)状态向量、量化动作 token 目标。
  • Output Format —— 模型输出的动作 token 如何反量化为连续控制信号;每步动作范围。
  • All Parameters —— VLA 专属参数(最大帧数、动作维度、量化层级、自回归掩码),叠加在标准 SFT / RL 参数之上。

相关阅读

VLA 尚在推进期间,最接近的已上线内容:

  • VLM —— 视觉语言模型微调状态。
  • SFT 概览 —— VLA 复用的监督微调循环。