Meta 昨日釋出了 Muse Glimmer,一款約 30B 引數的多模態 Agent 模型,支援 128K 級上下文,可呼叫工具、執行程式碼,並能處理圖片和螢幕資訊。該模型採用 Apache 2.0 許可證開放,同時提供兩套 4bit 量化版本、獨立視覺編碼器和 DFlash 推理加速元件,支援 llama.cpp、MLX、ExecuTorch 等本地部署方式。

Muse Glimmer 的核心目標並非普通聊天,而是建立一套完整的本地 Agent 執行範式。它面向長期執行的本地 Agent,面臨苛刻的工程約束:必須在有限的 24GB 視訊記憶體內,一邊處理不斷產生的螢幕截圖,一邊維持長達幾十步的任務邏輯。隨著任務推進,工具結果、程式碼日誌、頁面狀態和推理過程不斷累積,許多在聊天場景中不明顯的問題會被放大,例如 128K 上下文如何塞進有限視訊記憶體、截圖增多後如何管理歷史狀態、工具呼叫失敗後如何繼續,以及大量推理 Token 對解碼速度的影響。

Muse Glimmer 的技術設計圍繞這些問題展開,沒有依賴單一新架構,而是在 Attention、KV Cache、訓練方式、量化和解碼上進行了激進取捨。其架構採用 52 層 Dense Transformer,Hidden Size 為 6656,擁有 32 個 Query Head 但僅 2 個 KV Head,並採用三個 Local Attention 接一個 Global Attention 的迴圈方式。Local Attention 只處理附近 2048 個 Token,Global Attention 負責遠距離資訊交換。這種設計顯著降低 KV Cache 佔用:若 52 層全部儲存完整 128K 上下文,KV Cache 約需 6.5 GiB;而實際 39 個 Local 層僅維護滑動視窗,13 個 Global 層儲存長上下文,KV Cache 可降至約 1.7 GiB。相比之下,若採用傳統 MHA 結構,KV Cache 理論將擴大約 16 倍,超過 20 GiB,單獨就超出 24GB 顯示卡容量。

在權重量化方面,Muse Glimmer 提供兩套 4bit 版本:K Quant 17GB 面向 24GB 視訊記憶體裝置,Dynamic K Quant 約 20GB 面向 32GB 裝置。根據 Meta 公佈的 15 項 Benchmark 平均精度損失,Dynamic K Quant 約為 0.2%,K Quant 17GB 約為 1.0%。24GB 版本進一步壓低視訊記憶體佔用,但需接受更明顯的能力損失;32GB 版本則儘量保留原模型表現。

Muse Glimmer 還配備約 1.8B 引數的 ViT G 14 Perception Encoder,用於處理截圖、網頁、圖表和文件,一張圖片最多可轉換為 4096 個 Visual Token。目前模型支援文本和圖片輸入、文本輸出。在 Agent 工作流中,視覺能力負責讀取環境狀態,但視覺輸入會不斷進入上下文,若完整保留所有截圖,即使有 128K 上下文也會很快被佔滿,且舊截圖可能與當前狀態衝突。Meta 在 OSWorld Verified 評測中並未無限保留截圖歷史,只保留最近一部分,說明 Perception Encoder 與上下文管理是兩個不同問題。

訓練方面,Muse Glimmer 從更大的 Muse Spark 蒸餾而來,分為 Pre Training、Mid Training 和 Post Training 三個階段。Pre Training 使用 Logit Distillation,Mid Training 增加長上下文、推理軌跡和 Agent 資料,Post Training 加入 SFT、On Policy Distillation 和 RL。Logit Distillation 讓 Student 學習 Teacher 對候選 Token 的相對偏好,而非僅最終選擇;On Policy Distillation 則讓 Student 先自行 Rollout,進入真實狀態後再接受更強模型監督,從而覆蓋 Student 可能產生的錯誤狀態,這與模型強調的 Failure Recovery 能力相關。

解碼速度方面,Muse Glimmer 支援 low、medium、high、xhigh 四檔 Reasoning Strength,更高檔位生成更多推理 Token,可能提高複雜任務成功率,但會拖慢解碼。Meta 在公開 Benchmark 中使用 high 檔,並引入 DFlash 加速元件。DFlash 採用 Block Diffusion,Block Size 為 16,可並行預測一組候選 Token,並直接讀取 Muse Glimmer 第 1、13、25、37、49 層的 Hidden Feature 注入 5 層 Drafter,避免重新理解完整上下文。訓練時對 Block 前面的 Token 給予更高 Loss Weight,最佳化可接受字首長度。根據 Meta 資料,K Quant 17GB 版本在 RTX 5090 上解碼速度從約 74.9 Token/s 提升至 233.4 Token/s,若 Agent 任務累計生成 10000 個 Token,解碼時間可從約 134 秒縮短至約 43 秒。

Muse Glimmer 在 MCP Atlas、DeepSearch QA、Gaia2 等 Agent Benchmark 上表現良好,這些任務需要較長執行鏈,與模型訓練方式吻合。不過,128K 上下文並非無限空間,長期記憶仍需 Agent Runtime 管理,且 Local 與 Global 混合結構下,遠距離資訊需經 Global 層傳播,能輸入 128K 與能穩定利用整個 128K 並非一回事。整體而言,Muse Glimmer 展示了 Meta 在本地 Agent 推理效率上的系統性最佳化,為端側 AI 應用提供了新的技術範式。