模型¶
Macaron 托管 API 服务 Macaron-V1 模型家族。所有变体基于 Mixture-of-LoRA(MoL)架构: 冻结基座模型加一组小型专家 LoRA 适配器,路由器在每个用户轮次选择一个专家。架构与路由 循环见什么是 Macaron。
托管阵容¶
| 模型 ID | 总参数 | 基座 | 专家 | 用途 |
|---|---|---|---|---|
macaron-v1-venti |
748B | 744B GLM-5.2(冻结) | 4 × 1B LoRA(L0 Chat, L1 Agent, L2 Coding, L3 GenUI) | 旗舰;通过路由覆盖对话、智能体、编码、GenUI |
macaron-v1-tall |
50B | Qwen3.6-35B-A3B(冻结) | 4 × 1B LoRA(相同四专家设计) | 本地 / 低延迟部署 |
macaron-v1-coding-venti |
748B | 744B GLM-5.2 | coding LoRA 合入基座(单专家) | 编码专精;无路由开销 |
glm-5.2 |
744B | GLM-5.2 | 无(仅基座) | 无 MoL 专家的基座模型 |
路由¶
两个 MoL 服务变体(macaron-v1-venti、macaron-v1-tall)通过三阶段循环路由每个用户
轮次:路由(L0 在 24 token 预算下将请求分类到一个专家)、回答(被选专家响应)、
摘要(专家输出 ≤192 token 摘要存于服务端作为共享上下文)。macaron-v1-coding-venti
与 glm-5.2 跳过路由:coding LoRA 合入基座,glm-5.2 仅为基座。
定价¶
有效每 token 定价,来源于 dashboard /api/v1/models/pricing 端点(2026-08-06)。定价
可能调整;以 dashboard 当前费率为准。

| 模型 | 输入($/1M tok) | 输出($/1M tok) | 缓存写($/1M tok) | 缓存读($/1M tok) |
|---|---|---|---|---|
macaron-v1-venti |
7.00 | 25.00 | 2.00 | 2.00 |
macaron-v1-tall |
1.80 | 10.00 | 0.00 | 0.20 |
macaron-v1-coding-venti |
5.20 | 18.20 | 1.30 | 1.30 |
glm-5.2 |
5.20 | 18.20 | 1.30 | 1.30 |
macaron-v1-coding-venti 与 glm-5.2 对基础费率有 0.65 有效倍率;macaron-v1-venti
与 macaron-v1-tall 为基础费率。macaron-v1-tall 的缓存写成本为零。
自部署基座模型¶
以上阵容为托管 Macaron 家族。若你自部署 MinT 并在自己的端点上服务 Qwen3 社区基座模型,
Qwen3 阵容见自部署模型参考。两个接口不同:托管 API 通过
/v1/chat/completions 服务 Macaron 模型;自部署接口通过 /oai/api/v1 服务 Qwen3 基座
模型。