GLM-5.3 贏 Claude 是真的嗎?它贏的那個模型你根本買不到

目錄

💡 核心結論速覽 (TL;DR)

  • 贏的對手你買不到:GLM-5.3 拿 84.5,83.8 那格是 Anthropic 邀請制的 Mythos 5。
  • 0.7 分只等於 1,507 題裡的 11 題,單次跑分。
  • API 還沒開賣,現在唯一路徑是 US$18 起的 GLM Coding Plan。
  • 先做這件事:把 thinking.type 改成 enabled、reasoning_effort 降到 low 再換 model ID,否則請求會失敗。

一張官方跑分表可以同時做到兩件事:把自己捧上頭條,也把最關鍵的那行字藏在圖表底下。

GLM-5.3 在 CyberGym 這一項確實以 84.5 分超過了 Anthropic 的 83.8 分。但那個 83.8 屬於 Mythos 5,不是你打開網頁就能訂的那個 Claude。

我每天用 AI 的時間超過 10 小時,同時付著 ChatGPT 和 Claude 各 US$200 一個月,外加 Google AI Pro。所以看到「中國模型贏了 Anthropic」這種標題,我第一個反應不是興奮,是把官方原文那份頁面資料整包拉下來,一格一格對。

對完之後我只想說一句:這一版真的有進步,但媒體幫它加的那層濾鏡厚得離譜。

贏的是哪一格、贏多少、你今天拿不拿得到、帳單怎麼算才不會爆?我把官方數字全攤開,順序往下走。


GLM-5.3 贏了 Claude 嗎?先看清楚它贏的是哪一個模型

GLM-5.3 只在 CyberGym 這一項小幅領先,領先的對象是 Mythos 5 而不是一般供應的 Fable 5,而且同一張表上還有三項是明顯落後的。

Z.ai 官方部落格在 2026 年 8 月 14 日發布 GLM-5.3,標題直接叫「Frontier Coding with Emergent Cyber Capabilities」。資安能力是這一版的主打。

官方原始資料裡,CyberGym 的排名由高到低是:GLM-5.3 84.5、GPT-5.6 Sol 83.6、DeepSeek-V4 Pro-0813 83.3。

後面依序是 Kimi K3 80.0、Qwen3.8-Max 78.5、Opus 4.8 78.1、GLM-5.2 77.2,另外還有一格掛在 Anthropic 名下的 83.8。

問題就出在那個 83.8。官方總表上它掛在「Fable 5 (w/ fallback)」這一欄,但同一篇的內文寫了三次 Mythos 5,官方那張資安圖表的圖例也明明白白標著 Mythos 5。

同一頁的表格和圖表,對同一組數字給了兩個名字。這不是我在挑語病,這是官方頁面自己前後不一致。

結果就是媒體分裂成兩派。有幾家寫成 Mythos 5,也有幾家照抄總表寫成「beats Fable 5」,其中一家甚至把 benchmark 名字寫成不存在的「CyberBench」。

我看過太多次這種傳話遊戲了:官方留了一個模稜兩可的欄位名稱,媒體照抄,讀者記住的是最聳動的那個版本。

下一步可以做的事很簡單:看到任何一篇說「GLM-5.3 打敗 Claude」的報導,先問一句「打敗的是哪一顆 Claude」。答不出來的那篇,你就知道它沒讀原文。

上一代 GLM-5.2 在資安項目就已經咬到 Claude,我把當時那批數字和信任問題整理過一輪,這一版可以直接接著看。


GLM-5.3 贏的 Mythos 5 是什麼?Anthropic 官方寫著邀請制、不對外賣

Mythos 5 是 Anthropic 在 Project Glasswing 底下的邀請制預覽模型,官方文件明列「非一般供應」「僅提供給經核可的客戶」,而且沒有自助註冊管道。

這段不是我推論的。Anthropic 官方模型總覽文件裡寫著,Claude Mythos 5(模型代號 claude-mythos-5)與 Claude Fable 5 同規格、同定價。

它屬於 Claude Mythos Preview,官方原文一句話講死:「invitation-only and there is no self-serve sign-up」,沒有自助註冊這條路。

官方同時寫了它的定位:專門為防禦性資安工作流另外提供(offered separately for defensive cybersecurity workflows)。而 Fable 5 才是 2026 年 6 月 9 日起一般供應的那一顆。

把兩邊拼起來,結論很硬:GLM-5.3 在 CyberGym 超車的那個模型,一般人根本買不到。你刷卡訂閱 Claude 拿到的是 Fable 5,不是 Mythos 5。

這件事對「該不該相信這個標題」的影響非常直接。一個對外賣的模型輸給一個不對外賣的特規模型,跟「消費級產品被超車」是兩件事。

我自己判斷這類新聞的標準只有一條:那個被超車的東西,我這種一般訂閱用戶能不能刷卡買到。買不到,就不會影響我今天的工具選擇。

順帶一提,Anthropic 會把資安能力另外圈成一個受限產品線,其實有前因。想知道 Anthropic 為什麼會把資安能力另外圈起來,那 18 天的出口管制風波是最好的背景

如果你只是想搞清楚自己該用 Fable 5 還是 Opus,那是另一個問題。還在猶豫 Fable 5 跟 Opus 該用哪一顆的話,我把四顆模型的分工寫成一份選型表,比對照跑分快得多。


GLM-5.3 的 84.5 對 83.8 差多少?換算成題數只有 11 題,而且只跑一次

GLM-5.3 在 CyberGym 領先 Mythos 5 的那 0.7 個百分點,攤回 1,507 題上只等於大約 11 題,而且 Z.ai 官方註腳寫明是單次跑分,沒有任何變異數估計。

這是我自己拿官方註腳算的,算式很簡單,你可以自己驗:

1,507 × 84.5% = 1,273.4 題。

1,507 × 83.8% = 1,262.9 題。

兩者相減 = 10.5 題,四捨五入約 11 題。

官方 footnote 交代得比正文誠實:CyberGym 共 1,507 題、single-run Pass@1、每題不限時,而且是在 Claude Code 2.1.207 內跑的。

參數也全寫了:最高推理檔位、無網路工具、temperature 1.0、top_p 1.0、max_new_tokens 128000,並移除 Git 資訊、套用網域白名單防作弊。

單次跑分是這裡最關鍵的一句話。沒有重複實驗就沒有標準差,你無法知道 11 題的差距是能力差異,還是這一次的運氣。

我從做產品那幾年學到一件事:任何只跑一次的 A/B,差距小於個位數百分點時,我一律當成「打平」處理,不會拿去改路線圖。

換成讀者能用的判斷就是:84.5 對 83.8 你應該讀成「兩者在這一項打平」,而不是「中國模型超車了」。真正有意義的差距,要看下一節那三格。

Z.ai 願意把 1,507 題、單次跑分、白名單防作弊這些細節寫進 footnote,其實已經比很多發布會誠實。可惜幾乎沒有一篇報導把它引出來。


為什麼往漏洞利用走,GLM-5.3 的差距反而拉開到 1.9 倍?

GLM-5.3 在 CyberGym 領先、在 ExploitBench 與 ExploitGym 落後,是因為前者測的是「找不找得到漏洞」,後者測的是「能不能把漏洞打通成可用的利用鏈」,而利用鏈才是真正吃長鏈推理能力的地方。

官方那三格數字放在一起看,故事完全變了。

資安項目 GLM-5.3 Mythos 5 GLM-5.2
CyberGym(分) 84.5 83.8 77.2
ExploitBench(分) 54.4 78.0 24.4
ExploitGym 2 小時(題) 105 181 29
ExploitGym 6 小時(題) 130 247 39

ExploitBench 差 23.6 個百分點,換成倍數是 78.0 ÷ 54.4 = 1.43 倍。ExploitGym 六小時預算是 247 ÷ 130 = 1.90 倍,兩小時是 181 ÷ 105 = 1.72 倍。

對上 GPT-5.6 Sol 更難看:六小時 293 題對 130 題,等於 2.25 倍。

官方自己寫了一句話,媒體全部沒引:能力成長最快的地方,正是他們落後最多的地方。這句話出現在官方部落格裡,我覺得它比任何跑分都值錢。

另外有一個沒人提的方法論細節:ExploitGym 的「2 小時」不是牆鐘時間。

官方 footnote 寫明,時間預算是依各模型的吐字速度重新縮放過的,數據取自 Artificial Analysis:GLM-5.3 以 115 TPS、Kimi K3 以 40 TPS、Qwen3.8-Max 以 47 TPS 換算。

而且只有這三顆是 Z.ai 自己跑的,Anthropic 與 OpenAI 那兩欄的數字來源官方沒有交代。所有報導都直接引「兩小時完成 105 題」,沒有一篇說那是換算過的時間。

你可以帶走的判斷:GLM-5.3 目前的資安能力,比較像是一個很會做初步偵測的助手,而不是一個能自己走完攻擊鏈的工具。真的要做安全評估,它現在還不是最後一道。


2,436 個漏洞是真的嗎?官方揭露帳本現在只公開了 2.2%

Z.ai 宣稱 GLM 模型在真實專案裡挖出的 2,436 個漏洞,數字來自官方自己維護的揭露帳本,但其中只有 53 筆已經公開、2,383 筆仍在禁令期,讀者現在能自行驗證的部分只有 2.2%。

Z.ai 說他們與中國數個資安團隊合作,經專家複核去重後,在 269 個專案裡找出 2,436 個漏洞。官方那份漏洞協調揭露帳本把數字拆得很細。

拆開之後有兩處官方自己兜不攏,我對的時候看到就記下來了。

第一處:官方內文寫「1,097 個中到高風險問題」,但帳本上的分布是 Critical 107 + High 990 = 1,097,Medium 另有 1,286 筆、Low 53 筆。那 1,097 是「高風險加嚴重」,不是「中到高」。

第二處:同一段官方說最舊的漏洞「大約 40 年」,帳本卻寫最舊的缺陷在 1981 年被引入。從 1981 算到現在是 45 年,不是 40 年。平均存活年數則是 26.6 年。

53 ÷ 2,436 = 2.2%,這是我自己除出來的。換句話說 97.8% 的成果現在是「請相信我們」的狀態。

我不覺得禁令期本身有問題,那是負責任的揭露流程。我在意的是敘事順序:先公布 2,436 這個大數字,再把 97.8% 的驗證推遲到未知的未來,中間的落差全部由讀者的信任填補。

如果你是中小企業或個人開發者,這一節的實際意義是:不要因為這串數字就把自家程式碼丟給任何一個模型做「安全稽核」然後照單全收。它現在證明的是找得到,不是判得準。

資安這件事最容易踩的雷,往往不是模型本身。OpenClaw 從爆紅到卸載潮那次資安風暴,正好示範了排隊限流之外更該擔心的東西


GLM-5.3 權重什麼時候放出來?上一代當天開源,這次是第一次隔天

Z.ai 官方說 GLM-5.3 的權重會在發布後兩週釋出,以 2026 年 8 月 14 日起算大約落在 8 月 28 日前後;重點不是「比預期慢」,而是這是 GLM 系列第一次沒有做到發布當天同步開源。

官方部落格兩處都寫了同一件事:等安全評估與加固完成後,兩週內公開釋出模型權重。這是 2026 年 8 月當下的官方說法。

幾乎所有報導都寫了「兩週後開源」,但沒有一篇問「上一代隔幾天」。我去對了一下,答案有點意外。

GLM-5.2 是 2026 年 6 月 16 日發布,同一篇內文當天就寫著權重已經公開在 HuggingFace 與 ModelScope 上。Hugging Face 上那個 repo 的建立時間也是同一天。

也就是說上一代是 0 天,這一代是大約 14 天。「延後」的正確意義不是進度落後,是打破了自家同日開源的慣例

還有一個差別更值得注意:GLM-5.2 官方明寫是 MIT 授權、沒有地區限制;GLM-5.3 的官方部落格與文件,對授權條款隻字未提。

能不能商用、有沒有地區限制,現在都還沒有官方答案。在授權條款公布前就把它排進產品規劃,是我不會做的事。

另外一個可以自己驗的事實:Hugging Face 上目前查 GLM-5.3 的 repo 會回 401,代表它還不是公開存在的;官方部落格資料裡對應的 HuggingFace 欄位也還是一個佔位符,而 GLM-5.2 的同一欄是真實網址。

所以在權重真正上架之前,官方公布過的相關頁面只有這幾個:Z.ai 的發布公告頁、官方文件站、ZCode、訂閱頁、漏洞揭露帳本,以及 GitHub 上的 THUDM/slime 與 zai-org/GLM-5 兩個 repo。

不在這份清單上的來源,就不在官方清單上。這句話我寫得很保守,但足夠讓你在權重釋出前避開一堆自稱官方的東西。

至於「放出來我跑不跑得動」,一句話回答:官方權重檔的參數量 metadata 是 753,329,940,480,以 BF16 每個參數 2 bytes 計,光權重就是約 1.51 TB,個人機器不用想。真的想把兆級參數的模型搬回自己機器上,先看 Kimi K3 那筆自架成本的實際數字


現在唯一買得到 GLM-5.3 的路:Coding Plan 積分係數怎麼算才不會爆

GLM-5.3 的 API 官方寫著即將上線、價目表上還沒有這一列,聊天版也沒上,所以現階段唯一的取得路徑是 GLM Coding Plan 訂閱,官方寫「US$18 起」。

這一格是被媒體寫錯最多的地方。有幾家英文媒體寫「available now through Z.ai's API」,但 Z.ai 官方文件置頂的 Tip 寫的是「The GLM-5.3 API is coming soon.」,中文版文件寫「模型 API 將會盡快上線」。

官方價目表最新也只到 GLM-5.2(每百萬 token 輸入 US$1.4、快取輸入 US$0.26、輸出 US$4.4),根本沒有 GLM-5.3 這一列。三處官方互相印證,媒體那句話是錯的。

規格本身則是純文字進出、上下文 1M、最大輸出 128K token。訂閱後可以在 ZCode、Claude Code、OpenCode、Cline 這些工具裡直接呼叫。

重點來了,訂閱制不是按 token 收錢,是扣「積分」,而積分是用係數換算的。

模型 Input 係數 Cached Input Output 係數
GLM-5.3 6.9 1.7 24
GLM-5-Turbo 5.7 1.5 21
GLM-4.7 4.6 1.2 16
GLM-4.6V(Vision MCP) 1.2 0.3 2.7

官方公式是:積分 =(Input × 6.9 + Cached × 1.7 + Output × 24)÷ 10,000。

表格最後一列的 GLM-4.6V 不是拿來寫程式的,它是方案內附的視覺理解 MCP。另外三個 MCP(Web Search、Web Reader、Zread)走的是完全不同的算法:官方寫的是呼叫次數 × Output 係數,每呼叫一次固定扣 1.2 積分,與 token 長度無關。

這條容易被忽略,因為它不吃 token 卻真的會扣積分。agent 一輪跑十幾次搜尋是常態,那就是十幾次 1.2。

把係數互相除一下,三個結論就跳出來了。Output 是 Input 的 3.48 倍、是快取輸入的 14.1 倍;快取命中可以省下 75.4%(1.7 ÷ 6.9)。

而 GLM-5.3 的 reasoning_effort 有 low、high、max 三檔,官方預設是 max。思考產生的 token 全部照 24 這個係數計費。

換句話說,你什麼都不設定,就是跑在最貴的模式上。我在別家的訂閱上踩過同一個雷:把「預設值」當成「平衡值」,結果額度掉得比預期快,回頭才發現預設一直是頂配。

再對比一下:GLM-5.3 的 Output 係數 24 比 GLM-4.7 的 16 貴了 50%。而 Coding Plan 上呼叫 GLM-5.2 或 GLM-5.1 的請求會自動改導到 GLM-5.3。

舊訂閱用戶什麼都沒改,單價先漲了。這條官方寫得很清楚,卻很少人提。

我拿官方係數試算一次給你看,假設一次請求輸入 20,000 token(其中 18,000 命中快取)、輸出 3,000 token:

尖峰時段:(2,000 × 6.9 + 18,000 × 1.7 + 3,000 × 24)÷ 10,000 = 11.64 積分。

非尖峰時段以 50% 計:11.64 × 0.5 = 5.82 積分。

同樣的請求若完全沒有快取命中:(20,000 × 6.9 + 3,000 × 24)÷ 10,000 = 21 積分,比有快取貴 80.4%。

把它換算成額度就有感了。Lite 的 5 小時額度是 2,000 積分,用上面那個請求跑,尖峰大約 171 次、非尖峰大約 343 次。

官方三檔的額度是:Lite 每 5 小時 2,000、每週 10,000;Pro 12,000 / 60,000;Max 28,000 / 140,000。5 小時額度是消耗後動態回補,週額度自訂閱起每 7 天重置。

官方另外給了每週可用 token 的估算(以 90.9% 快取命中率計):Lite 43 到 87 百萬、Pro 263 到 526 百萬、Max 613 到 1,226 百萬。

這組數字有個陷阱,我把上下限相除就看出來了:87 ÷ 43 = 2.02、526 ÷ 263 = 2.00、1,226 ÷ 613 = 2.00。

上限精準等於下限的兩倍。那不是額外贈送,就是「你完全不在平日下午工作」的那個版本。看到「最高 12.26 億 token」就以為買得到 12.26 億的人,實際拿到的是 6.13 億。

所以省積分的正解不是少問,是三件事:讓快取盡量命中、壓縮輸出長度、非寫程式任務把 reasoning_effort 降到 low。

同樣是「預設檔位最貴」的問題,Opus 5 那次我算過壓縮輸出能省下多少,思路可以直接搬過來用。

另外還有一個限時的東西要標清楚時間:ZCode 目前有 98% 以上快取命中率的加成(重複脈絡以較低的快取費率計,約多 30% 有效 token),加上 1.5 倍限時額度加成,官方稱兩者疊加最高可到標準額度的 180%。這個優惠到 8 月 31 日為止。


尖峰是台北時間下午兩點到六點,新舊方案倍率差在哪

GLM Coding Plan 官方定義的尖峰時段是週一至週五 14:00 到 18:00(UTC+8),其餘所有時段包含週末全天,模型呼叫只消耗標準積分的 50%。UTC+8 就是台北、香港、北京時間。

這一條看起來平平無奇,實際上是整篇裡最影響荷包的一格。因為那四個小時,正好整段砸在正常上班的下午。

你在辦公室最專心寫程式、最需要模型連續跑 agent 的那段時間,剛好就是官方定義的最貴時段。這不是巧合,尖峰本來就是照使用量畫的。

換到其他時區,同一份訂閱的體感差很多:

  • 台北/香港/北京:14:00–18:00,上班下午整段命中。
  • 東京:15:00–19:00,一樣是工作時間尾段。
  • 倫敦(8 月夏令時間):07:00–11:00,上午前半段命中。
  • 美東(夏令時間):02:00–06:00,幾乎沒人在那時寫程式。
  • 美西(夏令時間):前一天 23:00 到凌晨 03:00,同樣避開。

結論有點荒謬但很真實:同一個方案,你人在哪裡決定你付幾折。在北美的華人開發者幾乎永遠落在非尖峰,等於天生半價;在台北、香港按正常作息工作的人,反而最容易吃到全價。

第二個坑更隱蔽:新舊方案根本是兩套規則。

新積分制是尖峰 1 倍、其餘時段 0.5 倍,也就是尖峰等於非尖峰的 2 倍。但官方在 2026 年 7 月 30 日發布的方案更新公告裡,Legacy V2 與團隊版的規則是:GLM-5.3 與 GLM-5-Turbo 尖峰 3 倍、非尖峰 1 倍,GLM-4.7 則全天 1 倍。

兩套的計量單位不一樣,新制扣的是積分、Legacy V2 算的是 prompt 次數,所以不能直接比絕對扣除量。能比的是尖峰罰則:新制尖峰是自己離峰的 2 倍,Legacy V2 是 3 倍,罰則陡了 50%。

官方另外註明既有訂閱者週末全天以非尖峰計。至於論壇上流傳的「高峰 3 倍、非高峰 2 倍」則是錯的,那是把兩套規則混在一起講,中英文報導我看下來也都沒有把兩套分開。

怎麼確認自己在哪一套:登入後開「我的方案」頁,官方寫明個人方案會直接顯示「Legacy Plan V1」或「Legacy Plan V2」,團隊方案顯示「Team Edition」,三個都沒有就是新積分制。

查完之後才是真正的分歧點。能不能換到新方案,官方公告分成三條完全不同的路,這一段幾乎沒人讀到。

❶ Legacy V1:不能提前換,只能等現有計費週期結束、方案到期後再訂新方案。

❷ Legacy V2:只有「升級到更高一階的新方案」可以立刻換;同階平轉或降級一律等到期。立刻換的話舊方案當下終止,未用價值折抵新方案價格。

❸ 團隊版:與 V1 相同,到期前不能換,到期後才能訂新方案。

還有一句官方講得很白:方案不會自動切換,你不手動操作就會一直待在 3 倍那套裡。

所以順序要對:先查方案,再決定時段策略。查完發現這一期換不了的人,時段安排就是你唯一還能動的變數,那條就得排得更嚴格。

你今天可以做的兩件事:先去「我的方案」頁確認自己屬於哪一套;再把重跑測試、批次重構、長 agent 任務這種吃 token 的活,排到平日下午兩點到六點以外。

另一家中國模型調整計費時我也逐格對過官方價目表,那次的教訓是倍數只在最便宜那一格成立,看標題的倍數會被騙。


除了 GLM Coding Plan,寫程式訂閱還有哪些可以一起比

如果你的目的是「寫程式的月費支出更划算」,GLM Coding Plan 是選項之一但不是唯一,真正要比的是同一筆預算在哪裡能跑完你手上那類任務。

我自己在配這筆預算時,會先把工具分成三類,不混在一起比。

❶ 編輯器型CursorDevin Desktop(windsurf.com 現在會直接導到這個頁面)這類把模型包進 IDE 的訂閱,強項是在既有專案裡改動。

❷ 程式庫理解型Augment Code 這種主打大型 codebase 索引的服務,強項是在幾十萬行的專案裡找到該改的地方。

❸ 模型額度型:GLM Coding Plan、Claude 的用量方案這類,你買的是模型呼叫額度,工具自己挑。

GLM Coding Plan 屬於第三類。它最誠實的定位是:當你已經有順手的工具,只是想把模型呼叫的單位成本壓下來

還有一個官方文件裡沒人提的細節:中國站的 Coding Plan 文件明寫支援 OpenClaw,但採次級調度與盡力交付,高負載時會排隊限流。如果你的工作流重度依賴它,這條要先看清楚。

適合現在就訂 GLM Coding Plan 的人:主要在非平日下午的時段寫程式、任務以重複脈絡為主(快取命中率高)、已經有慣用的 CLI 工具、能接受授權條款還沒公布。

先不要訂的人:必須用穩定的 API 計價做成本預估(GLM-5.3 的 API 還沒上線)、公司政策不允許把程式碼送到中國廠商、或是你只是想試玩一下(現在沒有聊天版可以碰)。

圖片這一項要講精確一點。GLM-5.3 本身是純文字進出,但方案有附視覺理解 MCP(走 GLM-4.6V),所以「工作流裡要讀截圖」不等於不能訂,「要 GLM-5.3 自己看圖」才是真的不行。

如果你還在盤點今年的寫程式工具該留哪幾個,這份清單可以省下一輪試用編輯器內建的補全跟獨立訂閱到底差在哪,我把兩家的實際使用差異寫過一篇

至於「我現在付的那份還有沒有被用滿」,這是我每季都會重算一次的題目。先確認你現在付的那份訂閱有沒有被用滿,我把它的回本門檻拆過


不改設定今天就會壞:GLM-5.3 思考模式停用與舊版請求自動改導

GLM-5.3 的 thinking.type 只支援 enabled,過去的 disabled 已經不支援;官方明寫如果現有應用還在傳 disabled,必須先改成 enabled 並把 reasoning_effort 設為 low,再更換 model ID,否則請求將失敗。

這是全篇唯一一條「今天不處理就會出事」的變更,卻被埋在文件中段。

要命的是它跟另一條規則疊在一起:Coding Plan 上呼叫 GLM-5.2 或 GLM-5.1 的請求會自動改導到 GLM-5.3。你沒有辦法靠「不換版本」來躲。

所以正確的處理順序只有一種,順序錯了就會噴錯:

先把 thinking.type 從 disabled 改成 enabled。

把 reasoning_effort 設成 low,先把行為和成本穩住。

最後才改 model ID,改完再逐步把需要深度推理的任務調回 high 或 max。

我特別想提醒一件事:先改 model ID 再改 thinking 參數,就是官方說會失敗的那條路。如果你的服務是排程跑的,錯誤可能要等到半夜才被你發現。

另外一個常被問到的風險是「把第三方模型接進 Claude Code 會不會出事」。把第三方模型接進 Claude Code 會不會被封號,這題我查過官方條款,風險點不在模型在憑證

同一個工具接兩家模型時,額度計算也常常有誤會。同一個工具接兩家模型時額度會怎麼互吃,我拆過一次實際的計量方式

今天就能做完的檢查:搜一下你所有專案裡有沒有寫死 "type": "disabled",有的話今天改掉,不要等排程半夜噴給你看。


如果是我,現在會怎麼配這筆 coding 訂閱預算

我不會為了 GLM-5.3 動現有的主力訂閱,但我會把它當成「重複性高、輸出可壓縮」那類任務的第二條線來評估。

理由很直接。Z.ai 的 GLM-5.3 發布公告在自家的私有 benchmark 上就承認了:GLM-5.3 仍落後 Claude Fable 5(34.5% 對 39.5%)。連自己出題都沒贏,天花板在哪裡很清楚。

但同一張圖也給了它真正的強項。GLM-5.3 的 High 檔拿 31.4% 只花了大約 50K 輸出 token,而 Claude Opus 4.8 的 High 檔是 29.5%、花了 120K。

同樣的活,少吐 58% 的 token。對自家上一代則是 34.5% 對 23.4%,分數多 47.4%、token 少 21.9%。

所以它的定位是「單位 token 效率好、絕對天花板不夠高」。中英文報導都只挑一面講,一邊喊超車,一邊喊還是輸,兩邊都對一半。

有個做外包接案的朋友前幾天問我,要不要為了它把手上那份貴的訂閱砍掉。我的回答是先別動。

他真正的問題不是模型不夠強,是他把所有任務都丟給同一顆最貴的模型跑。那個問題換家廠商不會解決,只會換一張帳單繼續痛。

如果是我,會照這個順序做:先確認訂閱是不是 Legacy V2、再把大量重複的任務排到平日下午兩點到六點以外、然後把非寫程式任務的 reasoning_effort 降到 low。做完這三件事再看要不要加訂。

想知道同樣一份預算在 Claude 那邊能換到多少額度,我把它的用量制度算過一次,兩邊放在一起比才有意義。

如果你要的是跨品牌一次比完,我把今年五家旗艦的分工整理成一張選擇表

喜歡這種把官方文件逐格拆開對照的內容,可以訂閱夜羽凌的部落格,我把每次對帳、對規格、對條款的過程都寫下來,你會不定期收到信。


FAQ 常見問題

GLM-5.3 和 GLM-5.2 差在哪?基座沒換是不是代表沒進步?

官方明說 GLM-5.3 使用與 GLM-5.2 相同的基礎模型,所有提升都來自後訓練。從數字看進步很明顯:CyberGym 從 77.2 到 84.5、ExploitBench 從 24.4 到 54.4、ExploitGym 六小時從 39 題到 130 題。

基座不換而靠後訓練拉分數,是省算力的做法,不代表偷懶;但它也意味著這一版的能力上限,仍然受限於同一個基座。

沒有 API、也沒有聊天版,非工程師現在有辦法碰到 GLM-5.3 嗎?

現階段沒有。官方文件只列了 GLM Coding Plan 一條路徑,API 寫著即將上線,官方部落格的「試用」旗標在這一版是關閉的,而 GLM-5.2 那一版是開啟的。也就是說如果你不是開發者、也不打算裝 CLI 工具,最務實的做法是等權重釋出後由第三方平台上架,或等官方 API 正式開賣。

我在台灣或香港,要從 Z.ai 用美元買,還是從中國站用人民幣買?

官方文件目前只有「US$18 起」這一個公開數字,Pro 與 Max 的實際金額在任何一份官方文件頁上都查不到,要登入訂閱頁才看得到。網路上流傳的人民幣價格來自論壇與二手整理,我不建議拿來當比價依據。比較務實的做法是兩邊的訂閱頁各開一次自己看,並確認你要的付款方式與發票需求哪邊支援。

GLM-5.3 開源之後,我可以拿它幫公司做程式碼安全稽核嗎?

目前有兩個門檻沒過。第一,授權條款官方還沒公布,能不能商用、有沒有地區限制都是未知;GLM-5.2 是 MIT 且沒有地區限制,但那不能自動套到這一版。

第二,從 ExploitBench 54.4 與 ExploitGym 六小時 130 題來看,它在利用鏈深處仍落後 1.43 到 1.90 倍,適合當第一輪篩選,不適合當最後一道把關。

我現在的程式碼會不會因為換版直接壞掉?

有可能,而且不用你主動換版。官方寫明 thinking.type 的 disabled 已不支援,而 Coding Plan 上呼叫 GLM-5.2 或 GLM-5.1 的請求會自動改導到 GLM-5.3。

正確順序是先把 thinking.type 改成 enabled、把 reasoning_effort 設成 low,最後才改 model ID;順序反了官方明說請求會失敗。今天先全域搜一次專案裡有沒有寫死 disabled,就能避掉大半風險。


參考資料

 

延伸閱讀