跳转至

模型

Macaron 托管 API 服务 Macaron-V1 模型家族。所有变体基于 Mixture-of-LoRA(MoL)架构: 冻结基座模型加一组小型专家 LoRA 适配器,路由器在每个用户轮次选择一个专家。架构与路由 循环见什么是 Macaron

托管阵容

模型 ID 总参数 基座 专家 用途
macaron-v1-venti 748B 744B GLM-5.2(冻结) 4 × 1B LoRA(L0 Chat, L1 Agent, L2 Coding, L3 GenUI) 旗舰;通过路由覆盖对话、智能体、编码、GenUI
macaron-v1-tall 50B Qwen3.6-35B-A3B(冻结) 4 × 1B LoRA(相同四专家设计) 本地 / 低延迟部署
macaron-v1-coding-venti 748B 744B GLM-5.2 coding LoRA 合入基座(单专家) 编码专精;无路由开销
glm-5.2 744B GLM-5.2 无(仅基座) 无 MoL 专家的基座模型

路由

两个 MoL 服务变体(macaron-v1-ventimacaron-v1-tall)通过三阶段循环路由每个用户 轮次:路由(L0 在 24 token 预算下将请求分类到一个专家)、回答(被选专家响应)、 摘要(专家输出 ≤192 token 摘要存于服务端作为共享上下文)。macaron-v1-coding-ventiglm-5.2 跳过路由:coding LoRA 合入基座,glm-5.2 仅为基座。

定价

有效每 token 定价,来源于 dashboard /api/v1/models/pricing 端点(2026-08-06)。定价 可能调整;以 dashboard 当前费率为准。

模型与定价——dashboard Inference 标签列出每个模型的最终输入、缓存输入、缓存存储与输出每百万 token 费率。

模型 输入($/1M tok) 输出($/1M tok) 缓存写($/1M tok) 缓存读($/1M tok)
macaron-v1-venti 7.00 25.00 2.00 2.00
macaron-v1-tall 1.80 10.00 0.00 0.20
macaron-v1-coding-venti 5.20 18.20 1.30 1.30
glm-5.2 5.20 18.20 1.30 1.30

macaron-v1-coding-ventiglm-5.2 对基础费率有 0.65 有效倍率;macaron-v1-ventimacaron-v1-tall 为基础费率。macaron-v1-tall 的缓存写成本为零。

自部署基座模型

以上阵容为托管 Macaron 家族。若你自部署 MinT 并在自己的端点上服务 Qwen3 社区基座模型, Qwen3 阵容见自部署模型参考。两个接口不同:托管 API 通过 /v1/chat/completions 服务 Macaron 模型;自部署接口通过 /oai/api/v1 服务 Qwen3 基座 模型。