Muse Glimmerは、Metaの「Muse Spark」を教師モデルとして蒸留したマルチモーダルモデル。用途としては、複数ステップの計画立案や逐次的なツール呼び出し、失敗からの復帰を伴うローカルAIエージェントのほか、コーディングエージェント、スクリーンショットや図表を扱うマルチモーダル推論、合成データ生成、LLM-as-a-judgeによる評価などを挙げる。入力はテキストと画像、出力はテキストのみで、学習データは100以上の言語をカバーする。コンテキスト長は13万1072トークン以上で、推論の強さはlow/medium/high/xhighの4段階から選べる。「OpenClaw」などのエージェント用スキャフォールドとも組み合わせられるとしている。
ローカル動作のための最適化も施した。完全精度では55GBを超えるメモリが必要になるが、約4bitに量子化することで言語モデル部分を20GB未満に圧縮。KVキャッシュや画像認識用のエンコーダーを含めても24GBまたは32GBのVRAMに収まるとする。同社の測定では、15種のベンチマークの平均精度の低下は、24GB向けの構成で1.0%、32GB向けで0.2%にとどまったという。
ベンチマークでは、米Googleの「Gemma4-31B」や中国Alibabaの「Qwen3.6-27B」と比較して同クラスで高い性能を示したと説明する。公開された数値では、エージェント関連の「MCP Atlas」で75.5、「DeepSearch QA」で74.6、コーディングの「SWE-Bench Pro」で51.2、数学の「AIME 2026」で94.7と2モデルを上回った。一方で「OSWorld-Verified」「SWE-Bench Verified」「TerminalBench 2.1」などはQwen3.6-27Bが上回った。いずれもMetaによる測定値だ。