跳转至

什么是 Macaron

Macaron-V1 是一个开放的智能体模型家族,围绕两个系统目标构建:通过在线生产 harness 上的版本化递归改进循环实现持续适应,以及通过在共享冻结基座之上的 Mixture-of-LoRA(MoL)架构实现可组合专业化。Macaron 不把所有能力整合进一个 单一检查点,而是保持大基座模型冻结,在其上叠加一组小型专家 LoRA 适配器,并通过 路由器在每个用户轮次选择一个专家。

本页介绍模型家族与架构。托管 API 接口见模型 API;模型列表与 定价见模型

两个赌注

Macaron 围绕两个赌注构建:

  • 适应。 版本化递归改进循环:一个模型-harness 版本生成的经验在外部契约下被 评估,并用于构造后继版本。适应是跨 successive 版本追求的属性,而非任何单一检查点 的属性。
  • 协作。 通过 MoL 实现组合:专家保持可分离,使异构目标不通过共享参数相互干扰。 一个团队训练的专家或为某用户个性化的专家可与其它专家在同一运行时上组合。

模型家族

Macaron-V1 是一个模型家族而非单一产物:

模型 总参数 基座 专家 服务方式
Macaron-V1-Venti 748B 744B GLM-5.2(冻结) 4 × 1B LoRA MoL harness
Macaron-V1-Tall 50B Qwen3.6-35B-A3B(冻结) 4 × 1B LoRA MoL harness
Macaron-V1-Coding-Venti 748B 744B GLM-5.2 coding LoRA 合入基座 单专家

Venti 是旗舰:744B GLM-5.2 基座加四个 1B LoRA 专家,通过一个 OpenAI 兼容端点暴露。 Tall 在 Qwen3.6-35B-A3B 基座上提供相同的四适配器设计,面向本地与低延迟部署,LoRA 秩按较小基座调整。Coding-Venti 是单专家例外:coding LoRA 直接合入基座,而非作为 MoL 适配器服务。

Mixture-of-LoRA 架构

智能体工作负载混合了思维链模式差异很大的任务:对话、智能体工具使用、编码、生成式 UI 各自要求模型以不同形态思考。当这些行为共享一个参数空间时,一族的梯度会把模型 推向损害另一族的方向。MoL 通过一条规则显式暴露这一权衡:

将共享技能与思维模式的任务聚到一个 LoRA,将技能差异大的任务分到不同 LoRA。

由此得到两个属性:

  • 基座冻结。 新能力通过训练并注册新适配器添加,而非重训基座。基座知识不会被后续 专业化覆盖。
  • 适配器可移植。 由于基座共享,一个团队训练的或为某用户个性化的专家可与其它团队 或用户的专家在同一运行时上组合。

四个专家(Venti / Tall)

适配器 职责
L0, Chat 对话骨干、指令跟随、模型身份。同时是路由入口。
L1, Agent 长时域、重工具使用任务;个人智能体工作流与服务集成。
L2, Coding 代码生成、SWE 类任务、终端使用。
L3, GenUI UI4A 渲染与 UI 驱动操作;专精 TSX(React 与 SolidJS)。

四个适配器以 L0-L3 之名常驻引擎;L0 同时是路由入口。

路由循环

MoL 不训练单独的路由器模型。适配器选择由入口适配器 L0 自身的推理在每个用户轮次决定, 并由 MoL Proxy 执行。一个客户端请求经历三阶段生命周期:

  1. 路由。 L0 在紧凑解码预算(24 token)下将请求分类为恰好一个规范适配器标签 (L0-L3)。路由提示将请求作为引用的、不可信文本处理,并在约束解码文法下返回 单一标签。若 L0 选择自身,请求留在 L0;否则 Proxy 切换到目标适配器。
  2. 回答。 被选专家从自身的对话视图回答,以先前轮次的跨适配器摘要为种子。
  3. 摘要。 专家输出对刚才所做之事的简短摘要,上限 192 输出 token。Proxy 将此摘要 存于服务端,从不返回给客户端;它成为任何适配器在后续轮次可继承的共享上下文。

路由完全由 L0 的推理决定:没有单独的路由器模型,也没有覆盖决策的关键词规则库。这使 路由准确率成为对话专家对请求理解的一个属性,并随基座与 L0 适配器改进,而非随一个 独立产物改进。

路由成本与准确率

路由并非免费:每个用户轮次在专家自身生成之上增加一个路由跳与一个摘要跳。在 Venti 上 以 48 个多轮请求(temperature 0)测量:

Venti 均值 占比 Tall 均值 占比
路由(L0 约束解码,24 tok) 0.54 s 11% 0.20 s 12%
回答(专家生成) 3.17 s 68% 1.24 s 70%
摘要(192 tok 上限) 0.97 s 21% 0.32 s 18%
合计 4.68 s 100% 1.76 s 100%

开销占比(约 30%)在不同基座规模下稳定。在 6,448 样本轨迹集上路由准确率为 99.12% (Venti)/ 99.04%(Tall),规范标签合规率 100%,解析错误为零。

头部基准

Venti 在两个内部个人智能基准、TerminalBench 2.1 与 UI4A-Bench 上的报告点估计最强。 数值归一化到 0-100,越高越好。这些是描述性点估计,非统计确立的胜出。

基准 Venti GLM-5.2 GPT-5.5 Opus 4.8
ChatBench 58.3 54.5 55.5 52.8
LivingBench 64.0 60.5 61.9 63.8
TerminalBench 2.1 87.6 82.7 83.4 78.9
UI4A-Bench 87.8 67.1 72.1 75.9
SWE-Verified 85.6 80.4 82.9 88.6
PinchBench 94.0 88.1 89.0 91.8

个人智能基准(ChatBench、LivingBench)与改进循环使用的目标分布重叠,因此这些分数 衡量的是对系统特定分布的拟合,而非泛化。外部基线值来自公开报告而非匹配重跑。完整 对比集与出处见技术报告。

持续学习与集体智能

冻结基座加可插拔适配器注册表使 MoL 适合持续学习与集体智能:

  • 能力可加。 新能力通过训练新 LoRA 并注册添加。路由器多看到一个候选标签;已部署 的无需重训。
  • 基座无灾难性遗忘。 梯度只进入适配器,基座不会因专业化副作用而漂移。
  • harness 在线更新。 harness 层(路由规则、工具暴露、配置)可不重部署权重而编辑。

由于基座共享且适配器可移植,相同属性支持跨团队与跨用户组合:一个团队可为 Macaron 未覆盖的领域发布专家,用户专属适配器可低成本训练并与出厂专家并列挂载。

参考

本页事实来自 Macaron-V1 技术报告。服务 harness 开源于 MindLab-Research/Mixture-of-LoRA-Harness