💡 核心結論速覽 (TL;DR)
- 門檻是 24GB 記憶體:Meta 官方測試機是 RTX 5090、MacBook M4 Max 與 M5 Max,量化版塞得進 24GB 或 32GB。
- 「不到 20GB」只是主檔:真要跑起來是三個檔案——主檔 16.8GB+視覺編碼器 1.4GB+加速器 1.63GB=19.83GB,還沒算 KV cache。
- 媒體引用的 233 tok/s 有條件:那是開了 DFlash 加速的數字,不開只有 74.9,差 3.1 倍;M4 Max 是 37.8 對 23.7。
- 先別急著買顯卡:一個月 token 用量沒破千萬的人,租 API 還是比較划算。先算清楚再決定要不要為它升級硬體。
「開源權重」這四個字,我已經被騙過好幾次了。
Meta 在 8 月 10 日放出 Muse Glimmer,一個約 296 億參數、Apache 2.0 授權的模型,主打「在你自己的 Mac 或 PC 上跑得動」。這次跟過去不一樣的地方是:它真的塞得進一張消費級顯卡。
我每天用 AI 超過 10 小時,同時養著好幾家的付費方案。所以每次有人說「這個可以自己架」,我的反射動作是先去翻硬體規格,而不是看跑分——因為上次那個號稱開源的 2.8 兆參數模型,我算完才發現一般人根本跑不動,權重公開等於看得到吃不到。
這次我把官方規格從頭對到尾,結論是:真的跑得動,但有一件事官方講得很輕描淡寫,媒體則幾乎全部漏掉——你要下載的不是一個檔案,是三個。
Muse Glimmer 是什麼?跟以前的開源模型差在哪
Muse Glimmer 是 Meta 在 2026 年 8 月 10 日發布的開放權重模型,約 296 億參數、52 層,用 Apache 2.0 授權,蒸餾自 Meta 自家沒有公開的 Muse Spark 系統。
先講「蒸餾」是什麼,因為這決定了它的個性。你可以想成:Meta 有一個很強但很貴的大模型當老師,讓它把回答方式一題一題教給小模型。學生不會比老師聰明,但可以在很多常見任務上模仿得很像,而且體積小非常多。
比較有意思的是它的定位。這不是一個拿來聊天的模型,官方講得很直接——它是為了 agentic 任務調的:管行程、整理檔案、在本機寫程式、呼叫工具。
| 規格 | Muse Glimmer |
|---|---|
| 參數量 | 約 296 億(含視覺編碼器) |
| 層數 | 52 |
| 脈絡長度 | 131,072 tokens 以上 |
| 知識截止 | 2026 年 1 月 4 日 |
| 語言 | 訓練資料涵蓋 100 種以上 |
| 授權 | Apache 2.0 |
| 輸入 | 文字+圖片(內建視覺編碼器) |
Apache 2.0 這條值得單獨講。它比 Meta 過去 Llama 系列那種自訂授權寬鬆得多——商用不用另外談、沒有使用者數量門檻。對想拿它做產品的人來說,這是實質差別,不只是好聽。
下一步:先確認你要它做什麼。如果只是想找人陪聊,線上免費版體驗好得多;本地模型的價值在後面幾段講的那三種情境。
我的電腦跑得動 Muse Glimmer 嗎?24GB 是那條線
門檻是顯示記憶體或統一記憶體 24GB。官方實際測試的三台機器是 Nvidia RTX 5090、MacBook M4 Max 與 M5 Max,全精度版本則要 64GB。
官方給了三個版本,差別在壓縮程度與品質損失:
| 版本 | 目標記憶體 | 品質劣化 |
|---|---|---|
| 全精度 | 64GB | — |
| K-Quant-Dynamic | 32GB | 0.2% |
| K-Quant-17GB | 24GB | 1.0% |
這張表最值得注意的其實是「劣化」那一欄。壓到 32GB 只掉 0.2%、壓到 24GB 也只掉 1.0%——換句話說,為了跑全精度去湊 64GB 記憶體,性價比很差。多花的錢買到的是 1% 的差距。
把它翻成「我這台到底行不行」大概是這樣:
| 你的記憶體 | 跑得動嗎 | 該抓哪個版本 |
|---|---|---|
| 16GB 以下 | ❌ 不行 | 光主檔就 16.8GB,塞不下 |
| 24GB | ✅ 剛好 | K-Quant-17GB,但脈絡別開太長 |
| 32GB | ✅ 舒適 | K-Quant-Dynamic,劣化只有 0.2% |
| 64GB 以上 | ✅ 綽綽有餘 | 可跑全精度,但只比 32GB 版好 0.2% |
⚠️ Mac 使用者要多扣一層:統一記憶體是跟系統共用的,一台 24GB 的 Mac 不會有完整 24GB 給模型用,作業系統和其他 App 也在吃。想穩,建議直接看 32GB 以上那一列。
我自己判斷這類硬體門檻時,習慣先問一句:官方寫的是「最低可跑」還是「順跑」?這裡的 24GB 屬於前者——它是「塞得進去」的線,不是「跑得舒服」的線。中間差多少,下一段的檔案清單會講。
Mac 使用者有個結構性優勢值得提:統一記憶體是 CPU 和 GPU 共用的,所以一台 36GB 的 MacBook 拿來跑模型,可用額度比一張 24GB 的獨立顯卡還寬鬆。這也是為什麼官方測試機裡有兩台是 Mac。
下一步:去看一下你的顯卡是幾 GB(Windows 在工作管理員的「效能」頁,Mac 在「關於這台 Mac」看記憶體)。低於 24GB 就先跳到最後一段,我會講替代方案。
官方說不到 20GB,為什麼實際要載三個檔案?
因為那個「不到 20GB」講的是語言模型主檔,而要真的跑起來,你還需要視覺編碼器和加速器兩個獨立檔案。
這是我對完官方檔案列表後最想提醒的一件事。Meta 的 GGUF 倉庫裡實際的檔案是這樣:
| 檔案 | 用途 | 大小 |
|---|---|---|
| KQuant-17GB-Q4_K_M | 語言模型主檔(24GB 方案) | 16.8 GB |
| KQuant-Dynamic-Q4_K_XL | 語言模型主檔(32GB 方案) | 19.7 GB |
| mmproj | 視覺編碼器,要讀圖就得載 | 1.4 GB |
| dflash | DFlash 加速器,決定速度 | 1.63 GB |
把 24GB 方案的三個檔案加起來:16.8 + 1.4 + 1.63 = 19.83 GB。
一張 24GB 的卡扣掉這 19.83 GB,剩下大約 4GB 出頭要拿來裝 KV cache 和執行時的緩衝區。KV cache 是模型記住對話脈絡用的空間,對話越長、吃得越多。所以那個 131,072 tokens 的超長脈絡,在 24GB 機器上是不可能吃滿的——你會先撞到記憶體牆。
這就是「塞得進去」和「跑得舒服」的差別。想吃比較長的脈絡,實務上要往 32GB 方案走。
我看規格表時最容易吃虧的一次教訓,就是把「模型大小」直接當成「需要的記憶體」。實際上還要加上執行時的開銷,而這部分官方文件通常只用一句話帶過。我帶團隊算 GPU 要租還是要買的時候,這筆隱藏開銷就是最常被低估的一項。
Muse Glimmer 跑起來有多快?官方三台機器的實測數字
差距非常大,而且關鍵不在機器,在你有沒有開 DFlash 加速。RTX 5090 開了是每秒 233.4 個 token,不開只有 74.9——差 3.1 倍。
| 機器 | 不開加速 | 開 DFlash | 倍數 |
|---|---|---|---|
| Nvidia RTX 5090 | 74.9 | 233.4 | 3.1× |
| Apple M5 Max | 26.6 | 50.2 | 1.8× |
| Apple M4 Max | 23.7 | 37.8 | 1.5× |
(單位是每秒輸出 token 數。)
媒體引用這款模型速度時,幾乎都直接寫 233 tok/s,卻不提那需要額外載 1.63GB 的加速器檔案、而且加速幅度在 Mac 上會縮水一半以上。看到高速數字先問「這是哪個設定下量的」,是我看任何效能宣稱的固定動作。
那這些數字對應到什麼體感?大約每秒 20 個 token 就跟一般人閱讀速度差不多。所以:
- ❶ M4 Max 不開加速的 23.7:剛好追平閱讀速度,能用但你會感覺到它在「打字」。
- ❷ M4 Max 開加速的 37.8:明顯比讀得快,日常問答順暢。
- ❸ RTX 5090 的 233.4:字會整段整段跳出來,接近線上服務的體感。
所以如果你的用途是 agent 自動跑任務(不用盯著看),Mac 完全夠;如果是要一邊對話一邊迭代,速度差距就會很有感。
Muse Glimmer 打得贏線上的付費模型嗎?看它輸的項目更有用
在 agent 類任務上它確實贏過同級開源對手,但在寫程式和電腦操作上會輸給 Qwen3.6-27B——看它輸在哪,比看它贏在哪更能幫你決定要不要用。
Meta 官方的比較對象是 Gemma4-31B 和 Qwen3.6-27B,都是同量級的開源模型。我把有輸有贏的項目都列出來:
| 項目 | Muse Glimmer | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|
| MCP Atlas(工具呼叫) | 75.5 | 54.2 | 62.5 |
| DeepSearch QA | 74.6 | 61.7 | 71.1 |
| SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| SWE-Bench Verified | 76.0 | 66.6 | 77.2 |
| OSWorld-Verified(操作電腦) | 65.9 | 58.5 | 75.6 |
| AIME 2026(數學) | 94.7 | 89.2 | 94.1 |
| GPQA Diamond | 83.5 | 85.7 | 84.2 |
模式很清楚:凡是「呼叫工具、串流程、找資料」它就強,凡是「直接操作電腦畫面、跑終端機」它就落後。MCP Atlas 領先 13 分,但 OSWorld-Verified 輸將近 10 分。
這對選型是有意義的。如果你想做的是「讀我的檔案、整理成表、丟進某個 API」這類流程,它很對;如果你想要的是「幫我操作這個軟體的介面」,Qwen 那一掛目前比較穩。
順帶一提,表上這個把它壓在電腦操作項目的 Qwen3.6-27B 是阿里巴巴那條線的模型,千問這幾家在台灣的註冊門檻與免費額度差在哪我一個一個開登入頁看過。
另外要說句公道話:這張表比的全是同量級開源模型,不是線上旗艦。一個 296 億參數的模型不會贏過雲端上那些大好幾個數量級的模型,主流付費模型的橫向能力比較我另外整理過。本地模型的賣點從來不是最強,是「不用連網、不用付費、資料不出門」。
什麼人真的需要在自己電腦跑?三種情境,和不適合的兩種
老實說,多數人不需要。線上免費版體驗更好、更快、更聰明。但有三種情況本地模型是不可取代的。
❶ 資料不能出門的人。
合約、病歷、客戶名單、還沒公開的財報——這類東西丟進雲端服務,就算對方承諾不拿去訓練,你也解釋不清楚。本地跑的模型完全不連外,這是唯一能講得清楚的作法。
❷ 需要長時間、大量、重複跑的人。
批次整理一萬份檔案、跑整個資料夾的摘要——這種用量按 token 計費會很痛,本地跑只花電費。這也是我覺得它「agentic 定位」最實在的地方:agent 就是會反覆讀同一批東西,而那正是雲端帳單暴增的主因。
❸ 網路不穩或要離線工作的人。
飛機上、工地、實驗室、頻寬受限的環境。這種需求少但很硬。
反過來,兩種人先別跳進來:
顯示記憶體低於 24GB 的人——為了跑它去買顯卡,成本遠高於你未來一年會付的 API 費用。還有只想「省訂閱費」的人,這是最常見的誤判,下一段我直接算。
為了省錢買顯卡划算嗎?我用 API 現價算一次
結論先講:一個月輸出 token 沒到千萬等級,租 API 幾乎一定比較划算,而且省下的不只是錢,是你不用維護。
拿我剛查證過的同期最便宜的一檔 API 價格當基準:離峰輸出每百萬 token 是 US$0.66。
假設你每個月輸出 1,000 萬 token,這已經是相當重度的自動化用量了:
- 租 API(離峰):10 × US$0.66 = 每月約 US$6.6
- 一年:約 US$79
而一張能跑 24GB 方案的顯卡,價格是這個數字的很多倍——還沒算電費、機殼散熱、以及你自己花在設定和排錯上的時間。要靠省 API 費把顯卡回本,用量得比上面這個假設再高一個數量級。
所以我的判斷是:買顯卡的理由應該是隱私或離線,不是省錢。如果你的動機是後者,那個數字通常算不過去。已經有一張夠力顯卡的人(例如本來就打遊戲或做影像),那又完全是另一回事——邊際成本是零,當然值得裝來玩。
還有一條中間路線常被忽略:短期租雲端算力。想驗證這個模型適不適合你的流程,租幾個小時比買一張卡理性得多——先拿線上免費版把任務跑一遍也行,確認流程本身走得通,再談要不要搬到本機。
我會怎麼開始?四個步驟,先確認再下載
二十多 GB 的下載量不小,順序錯了會白花時間。這是我會照著跑的順序。
❶ 先確認記憶體,再決定要哪個版本。
24GB 抓 K-Quant-17GB,32GB 以上抓 K-Quant-Dynamic(品質劣化只有 0.2%,有空間就選它)。低於 24GB 的話,這個模型現階段不適合你,別硬試。
❷ 三個檔案一起載,不要只載主檔。
主檔、mmproj、dflash 三個都要。少了 mmproj 它讀不了圖,少了 dflash 速度直接砍到三分之一——這兩件事在下載頁上不會有人提醒你。
❸ 用能吃 GGUF 格式的工具載入。
Meta 提供的是 GGUF 格式,這是本地模型工具的通用格式。Ollama 這類工具就是吃這個格式的。要注意各工具對新模型的支援有時間差,載入前先看一下該工具的版本說明。
❹ 先用你真正的工作測,不要用跑分題測。
拿你自己手上最典型的那份文件、那個任務去跑一次。跑分表告訴你的是平均,你要的是「它在我這個場景行不行」。這一步我覺得比看任何評測都準。
如果你的目標是把它接進自動化流程,用自動化工具串本地模型的完整實戰可以直接參考——把雲端 API 換成本機端點,其餘流程幾乎一樣。
FAQ 常見問題
Muse Glimmer 和 Kimi K3 那種開源模型,我該選哪個?
看你的機器。這兩個雖然都叫「開放權重」,但對一般人是兩種東西——兆級參數那類模型的自架成本我算過,個人電腦完全沒有機會;Muse Glimmer 是 296 億參數、量化後 24GB 就能塞。如果你是想在自己機器上跑,這題基本上只有 Muse Glimmer 這種量級是可行的。
16GB 顯卡真的完全不能跑嗎?
以官方目前提供的版本來說,最小的 K-Quant-17GB 主檔就有 16.8GB,加上另外兩個檔案接近 19.83GB,16GB 顯卡塞不下。硬跑會溢出到系統記憶體,速度會掉到難以使用的程度。比較務實的作法是等更小的量化版本出現,或改用同量級但體積更小的其他開源模型。
Apache 2.0 授權是不是代表我可以拿它做產品賣錢?
Apache 2.0 本身是相當寬鬆的授權,商業使用不需要另外談授權、也沒有使用者規模的門檻,這確實比 Meta 過去 Llama 系列的自訂授權寬鬆很多。但真的要商用前,還是建議自己讀一次授權原文與模型頁上的使用政策,因為模型發布方有時會另外附加使用限制條款。
本地跑的模型,資料真的不會外流嗎?
模型本身在本機推論時不需要連外,這是它最實在的價值。但要注意兩件事:一是你用來載入模型的那個工具本身可能有遙測或雲端同步功能,要自己去關;二是如果你讓它連上外部工具或 API,資料就會從那個管道出去。開源模型的資安評估我另外寫過一篇,判斷邏輯可以參考。
知識截止在 2026 年 1 月,那它是不是很快就過時?
對「查最新消息」這種用途來說是的,本地模型不會自己更新。但它的定位是 agent 任務——管檔案、串流程、呼叫工具,這些不太依賴模型腦內的新知。真的需要新資訊時,正確做法是讓它去呼叫搜尋工具,而不是期待它自己知道。
能跑得動,跟值得跑,是兩件事
Muse Glimmer 讓我比較有感的不是跑分,是「開放權重」這四個字終於對一般人有了實質意義。過去幾年放出來的權重,多數人只能看著別人跑;這次是真的下載完就能在自己桌上跑起來。
但「跑得動」跟「值得跑」中間還有一段距離。三個檔案的隱藏容量、DFlash 開不開的 3.1 倍差距、24GB 扣完只剩四 GB 給脈絡——這些細節決定了你的實際體驗,而它們都不在宣傳稿裡。
我自己的判斷很簡單:如果你買硬體的理由是隱私或離線,這個模型現在值得裝;如果理由是省訂閱費,先把上面那筆帳算完再說。多數人算完會發現,繼續租 API 比較理性,而這個結論一點都不丟臉。
想從別的角度衡量要不要換工具,各家 AI Agent 的官方免費額度我一家一家對過,先確認免費層夠不夠用,往往比研究硬體更快得到答案;已經在用免費 API 接自動化的人,先撞到的通常是另一道牆。
訂閱夜羽凌的部落格,開放權重模型的硬體門檻只要有變動,我會不定期寄信告訴你。
參考資料
- Meta AI Research:Introducing Muse Glimmer, An Open Agentic Model That Runs on Your Device
- Muse Glimmer 30B 官方模型卡(規格、量化版本與完整跑分表)
- Muse Glimmer 30B GGUF 官方檔案列表(各檔案實際大小)
- Apache License 2.0 授權原文
- CNBC:Meta launches Muse Glimmer open-weight AI model