Meta 昨日发布了 Muse Glimmer,一款约 30B 参数的多模态 Agent 模型,支持 128K 级上下文,可调用工具、执行代码,并能处理图片和屏幕信息。该模型采用 Apache 2.0 许可证开放,同时提供两套 4bit 量化版本、独立视觉编码器和 DFlash 推理加速组件,支持 llama.cpp、MLX、ExecuTorch 等本地部署方式。
Muse Glimmer 的核心目标并非普通聊天,而是建立一套完整的本地 Agent 运行范式。它面向长期运行的本地 Agent,面临苛刻的工程约束:必须在有限的 24GB 显存内,一边处理不断产生的屏幕截图,一边维持长达几十步的任务逻辑。随着任务推进,工具结果、代码日志、页面状态和推理过程不断累积,许多在聊天场景中不明显的问题会被放大,例如 128K 上下文如何塞进有限显存、截图增多后如何管理历史状态、工具调用失败后如何继续,以及大量推理 Token 对解码速度的影响。
Muse Glimmer 的技术设计围绕这些问题展开,没有依赖单一新架构,而是在 Attention、KV Cache、训练方式、量化和解码上进行了激进取舍。其架构采用 52 层 Dense Transformer,Hidden Size 为 6656,拥有 32 个 Query Head 但仅 2 个 KV Head,并采用三个 Local Attention 接一个 Global Attention 的循环方式。Local Attention 只处理附近 2048 个 Token,Global Attention 负责远距离信息交换。这种设计显著降低 KV Cache 占用:若 52 层全部保存完整 128K 上下文,KV Cache 约需 6.5 GiB;而实际 39 个 Local 层仅维护滑动窗口,13 个 Global 层保存长上下文,KV Cache 可降至约 1.7 GiB。相比之下,若采用传统 MHA 结构,KV Cache 理论将扩大约 16 倍,超过 20 GiB,单独就超出 24GB 显卡容量。
在权重量化方面,Muse Glimmer 提供两套 4bit 版本:K Quant 17GB 面向 24GB 显存设备,Dynamic K Quant 约 20GB 面向 32GB 设备。根据 Meta 公布的 15 项 Benchmark 平均精度损失,Dynamic K Quant 约为 0.2%,K Quant 17GB 约为 1.0%。24GB 版本进一步压低显存占用,但需接受更明显的能力损失;32GB 版本则尽量保留原模型表现。
Muse Glimmer 还配备约 1.8B 参数的 ViT G 14 Perception Encoder,用于处理截图、网页、图表和文档,一张图片最多可转换为 4096 个 Visual Token。目前模型支持文本和图片输入、文本输出。在 Agent 工作流中,视觉能力负责读取环境状态,但视觉输入会不断进入上下文,若完整保留所有截图,即使有 128K 上下文也会很快被占满,且旧截图可能与当前状态冲突。Meta 在 OSWorld Verified 评测中并未无限保留截图历史,只保留最近一部分,说明 Perception Encoder 与上下文管理是两个不同问题。
训练方面,Muse Glimmer 从更大的 Muse Spark 蒸馏而来,分为 Pre Training、Mid Training 和 Post Training 三个阶段。Pre Training 使用 Logit Distillation,Mid Training 增加长上下文、推理轨迹和 Agent 数据,Post Training 加入 SFT、On Policy Distillation 和 RL。Logit Distillation 让 Student 学习 Teacher 对候选 Token 的相对偏好,而非仅最终选择;On Policy Distillation 则让 Student 先自行 Rollout,进入真实状态后再接受更强模型监督,从而覆盖 Student 可能产生的错误状态,这与模型强调的 Failure Recovery 能力相关。
解码速度方面,Muse Glimmer 支持 low、medium、high、xhigh 四档 Reasoning Strength,更高档位生成更多推理 Token,可能提高复杂任务成功率,但会拖慢解码。Meta 在公开 Benchmark 中使用 high 档,并引入 DFlash 加速组件。DFlash 采用 Block Diffusion,Block Size 为 16,可并行预测一组候选 Token,并直接读取 Muse Glimmer 第 1、13、25、37、49 层的 Hidden Feature 注入 5 层 Drafter,避免重新理解完整上下文。训练时对 Block 前面的 Token 给予更高 Loss Weight,优化可接受前缀长度。根据 Meta 数据,K Quant 17GB 版本在 RTX 5090 上解码速度从约 74.9 Token/s 提升至 233.4 Token/s,若 Agent 任务累计生成 10000 个 Token,解码时间可从约 134 秒缩短至约 43 秒。
Muse Glimmer 在 MCP Atlas、DeepSearch QA、Gaia2 等 Agent Benchmark 上表现良好,这些任务需要较长执行链,与模型训练方式吻合。不过,128K 上下文并非无限空间,长期记忆仍需 Agent Runtime 管理,且 Local 与 Global 混合结构下,远距离信息需经 Global 层传播,能输入 128K 与能稳定利用整个 128K 并非一回事。整体而言,Muse Glimmer 展示了 Meta 在本地 Agent 推理效率上的系统性优化,为端侧 AI 应用提供了新的技术范式。