💡 核心結論速覽 (TL;DR)
- 贏的對手你買不到:GLM-5.3 拿 84.5,83.8 那格是 Anthropic 邀請制的 Mythos 5。
- 0.7 分只等於 1,507 題裡的 11 題,單次跑分。
- API 還沒開賣,現在唯一路徑是 US$18 起的 GLM Coding Plan。
- 先做這件事:把 thinking.type 改成 enabled、reasoning_effort 降到 low 再換 model ID,否則請求會失敗。
一張官方跑分表可以同時做到兩件事:把自己捧上頭條,也把最關鍵的那行字藏在圖表底下。
GLM-5.3 在 CyberGym 這一項確實以 84.5 分超過了 Anthropic 的 83.8 分。但那個 83.8 屬於 Mythos 5,不是你打開網頁就能訂的那個 Claude。
我每天用 AI 的時間超過 10 小時,同時付著 ChatGPT 和 Claude 各 US$200 一個月,外加 Google AI Pro。所以看到「中國模型贏了 Anthropic」這種標題,我第一個反應不是興奮,是把官方原文那份頁面資料整包拉下來,一格一格對。
對完之後我只想說一句:這一版真的有進步,但媒體幫它加的那層濾鏡厚得離譜。
贏的是哪一格、贏多少、你今天拿不拿得到、帳單怎麼算才不會爆?我把官方數字全攤開,順序往下走。
GLM-5.3 贏了 Claude 嗎?先看清楚它贏的是哪一個模型
GLM-5.3 只在 CyberGym 這一項小幅領先,領先的對象是 Mythos 5 而不是一般供應的 Fable 5,而且同一張表上還有三項是明顯落後的。
Z.ai 官方部落格在 2026 年 8 月 14 日發布 GLM-5.3,標題直接叫「Frontier Coding with Emergent Cyber Capabilities」。資安能力是這一版的主打。
官方原始資料裡,CyberGym 的排名由高到低是:GLM-5.3 84.5、GPT-5.6 Sol 83.6、DeepSeek-V4 Pro-0813 83.3。
後面依序是 Kimi K3 80.0、Qwen3.8-Max 78.5、Opus 4.8 78.1、GLM-5.2 77.2,另外還有一格掛在 Anthropic 名下的 83.8。
問題就出在那個 83.8。官方總表上它掛在「Fable 5 (w/ fallback)」這一欄,但同一篇的內文寫了三次 Mythos 5,官方那張資安圖表的圖例也明明白白標著 Mythos 5。
同一頁的表格和圖表,對同一組數字給了兩個名字。這不是我在挑語病,這是官方頁面自己前後不一致。
結果就是媒體分裂成兩派。有幾家寫成 Mythos 5,也有幾家照抄總表寫成「beats Fable 5」,其中一家甚至把 benchmark 名字寫成不存在的「CyberBench」。
我看過太多次這種傳話遊戲了:官方留了一個模稜兩可的欄位名稱,媒體照抄,讀者記住的是最聳動的那個版本。
下一步可以做的事很簡單:看到任何一篇說「GLM-5.3 打敗 Claude」的報導,先問一句「打敗的是哪一顆 Claude」。答不出來的那篇,你就知道它沒讀原文。
上一代 GLM-5.2 在資安項目就已經咬到 Claude,我把當時那批數字和信任問題整理過一輪,這一版可以直接接著看。
GLM-5.3 贏的 Mythos 5 是什麼?Anthropic 官方寫著邀請制、不對外賣
Mythos 5 是 Anthropic 在 Project Glasswing 底下的邀請制預覽模型,官方文件明列「非一般供應」「僅提供給經核可的客戶」,而且沒有自助註冊管道。
這段不是我推論的。Anthropic 官方模型總覽文件裡寫著,Claude Mythos 5(模型代號 claude-mythos-5)與 Claude Fable 5 同規格、同定價。
它屬於 Claude Mythos Preview,官方原文一句話講死:「invitation-only and there is no self-serve sign-up」,沒有自助註冊這條路。
官方同時寫了它的定位:專門為防禦性資安工作流另外提供(offered separately for defensive cybersecurity workflows)。而 Fable 5 才是 2026 年 6 月 9 日起一般供應的那一顆。
把兩邊拼起來,結論很硬:GLM-5.3 在 CyberGym 超車的那個模型,一般人根本買不到。你刷卡訂閱 Claude 拿到的是 Fable 5,不是 Mythos 5。
這件事對「該不該相信這個標題」的影響非常直接。一個對外賣的模型輸給一個不對外賣的特規模型,跟「消費級產品被超車」是兩件事。
我自己判斷這類新聞的標準只有一條:那個被超車的東西,我這種一般訂閱用戶能不能刷卡買到。買不到,就不會影響我今天的工具選擇。
順帶一提,Anthropic 會把資安能力另外圈成一個受限產品線,其實有前因。想知道 Anthropic 為什麼會把資安能力另外圈起來,那 18 天的出口管制風波是最好的背景。
如果你只是想搞清楚自己該用 Fable 5 還是 Opus,那是另一個問題。還在猶豫 Fable 5 跟 Opus 該用哪一顆的話,我把四顆模型的分工寫成一份選型表,比對照跑分快得多。
GLM-5.3 的 84.5 對 83.8 差多少?換算成題數只有 11 題,而且只跑一次
GLM-5.3 在 CyberGym 領先 Mythos 5 的那 0.7 個百分點,攤回 1,507 題上只等於大約 11 題,而且 Z.ai 官方註腳寫明是單次跑分,沒有任何變異數估計。
這是我自己拿官方註腳算的,算式很簡單,你可以自己驗:
❶ 1,507 × 84.5% = 1,273.4 題。
❷ 1,507 × 83.8% = 1,262.9 題。
❸ 兩者相減 = 10.5 題,四捨五入約 11 題。
官方 footnote 交代得比正文誠實:CyberGym 共 1,507 題、single-run Pass@1、每題不限時,而且是在 Claude Code 2.1.207 內跑的。
參數也全寫了:最高推理檔位、無網路工具、temperature 1.0、top_p 1.0、max_new_tokens 128000,並移除 Git 資訊、套用網域白名單防作弊。
單次跑分是這裡最關鍵的一句話。沒有重複實驗就沒有標準差,你無法知道 11 題的差距是能力差異,還是這一次的運氣。
我從做產品那幾年學到一件事:任何只跑一次的 A/B,差距小於個位數百分點時,我一律當成「打平」處理,不會拿去改路線圖。
換成讀者能用的判斷就是:84.5 對 83.8 你應該讀成「兩者在這一項打平」,而不是「中國模型超車了」。真正有意義的差距,要看下一節那三格。
Z.ai 願意把 1,507 題、單次跑分、白名單防作弊這些細節寫進 footnote,其實已經比很多發布會誠實。可惜幾乎沒有一篇報導把它引出來。
為什麼往漏洞利用走,GLM-5.3 的差距反而拉開到 1.9 倍?
GLM-5.3 在 CyberGym 領先、在 ExploitBench 與 ExploitGym 落後,是因為前者測的是「找不找得到漏洞」,後者測的是「能不能把漏洞打通成可用的利用鏈」,而利用鏈才是真正吃長鏈推理能力的地方。
官方那三格數字放在一起看,故事完全變了。
| 資安項目 | GLM-5.3 | Mythos 5 | GLM-5.2 |
|---|---|---|---|
| CyberGym(分) | 84.5 | 83.8 | 77.2 |
| ExploitBench(分) | 54.4 | 78.0 | 24.4 |
| ExploitGym 2 小時(題) | 105 | 181 | 29 |
| ExploitGym 6 小時(題) | 130 | 247 | 39 |
ExploitBench 差 23.6 個百分點,換成倍數是 78.0 ÷ 54.4 = 1.43 倍。ExploitGym 六小時預算是 247 ÷ 130 = 1.90 倍,兩小時是 181 ÷ 105 = 1.72 倍。
對上 GPT-5.6 Sol 更難看:六小時 293 題對 130 題,等於 2.25 倍。
官方自己寫了一句話,媒體全部沒引:能力成長最快的地方,正是他們落後最多的地方。這句話出現在官方部落格裡,我覺得它比任何跑分都值錢。
另外有一個沒人提的方法論細節:ExploitGym 的「2 小時」不是牆鐘時間。
官方 footnote 寫明,時間預算是依各模型的吐字速度重新縮放過的,數據取自 Artificial Analysis:GLM-5.3 以 115 TPS、Kimi K3 以 40 TPS、Qwen3.8-Max 以 47 TPS 換算。
而且只有這三顆是 Z.ai 自己跑的,Anthropic 與 OpenAI 那兩欄的數字來源官方沒有交代。所有報導都直接引「兩小時完成 105 題」,沒有一篇說那是換算過的時間。
你可以帶走的判斷:GLM-5.3 目前的資安能力,比較像是一個很會做初步偵測的助手,而不是一個能自己走完攻擊鏈的工具。真的要做安全評估,它現在還不是最後一道。
2,436 個漏洞是真的嗎?官方揭露帳本現在只公開了 2.2%
Z.ai 宣稱 GLM 模型在真實專案裡挖出的 2,436 個漏洞,數字來自官方自己維護的揭露帳本,但其中只有 53 筆已經公開、2,383 筆仍在禁令期,讀者現在能自行驗證的部分只有 2.2%。
Z.ai 說他們與中國數個資安團隊合作,經專家複核去重後,在 269 個專案裡找出 2,436 個漏洞。官方那份漏洞協調揭露帳本把數字拆得很細。
拆開之後有兩處官方自己兜不攏,我對的時候看到就記下來了。
第一處:官方內文寫「1,097 個中到高風險問題」,但帳本上的分布是 Critical 107 + High 990 = 1,097,Medium 另有 1,286 筆、Low 53 筆。那 1,097 是「高風險加嚴重」,不是「中到高」。
第二處:同一段官方說最舊的漏洞「大約 40 年」,帳本卻寫最舊的缺陷在 1981 年被引入。從 1981 算到現在是 45 年,不是 40 年。平均存活年數則是 26.6 年。
53 ÷ 2,436 = 2.2%,這是我自己除出來的。換句話說 97.8% 的成果現在是「請相信我們」的狀態。
我不覺得禁令期本身有問題,那是負責任的揭露流程。我在意的是敘事順序:先公布 2,436 這個大數字,再把 97.8% 的驗證推遲到未知的未來,中間的落差全部由讀者的信任填補。
如果你是中小企業或個人開發者,這一節的實際意義是:不要因為這串數字就把自家程式碼丟給任何一個模型做「安全稽核」然後照單全收。它現在證明的是找得到,不是判得準。
資安這件事最容易踩的雷,往往不是模型本身。OpenClaw 從爆紅到卸載潮那次資安風暴,正好示範了排隊限流之外更該擔心的東西。
GLM-5.3 權重什麼時候放出來?上一代當天開源,這次是第一次隔天
Z.ai 官方說 GLM-5.3 的權重會在發布後兩週釋出,以 2026 年 8 月 14 日起算大約落在 8 月 28 日前後;重點不是「比預期慢」,而是這是 GLM 系列第一次沒有做到發布當天同步開源。
官方部落格兩處都寫了同一件事:等安全評估與加固完成後,兩週內公開釋出模型權重。這是 2026 年 8 月當下的官方說法。
幾乎所有報導都寫了「兩週後開源」,但沒有一篇問「上一代隔幾天」。我去對了一下,答案有點意外。
GLM-5.2 是 2026 年 6 月 16 日發布,同一篇內文當天就寫著權重已經公開在 HuggingFace 與 ModelScope 上。Hugging Face 上那個 repo 的建立時間也是同一天。
也就是說上一代是 0 天,這一代是大約 14 天。「延後」的正確意義不是進度落後,是打破了自家同日開源的慣例。
還有一個差別更值得注意:GLM-5.2 官方明寫是 MIT 授權、沒有地區限制;GLM-5.3 的官方部落格與文件,對授權條款隻字未提。
能不能商用、有沒有地區限制,現在都還沒有官方答案。在授權條款公布前就把它排進產品規劃,是我不會做的事。
另外一個可以自己驗的事實:Hugging Face 上目前查 GLM-5.3 的 repo 會回 401,代表它還不是公開存在的;官方部落格資料裡對應的 HuggingFace 欄位也還是一個佔位符,而 GLM-5.2 的同一欄是真實網址。
所以在權重真正上架之前,官方公布過的相關頁面只有這幾個:Z.ai 的發布公告頁、官方文件站、ZCode、訂閱頁、漏洞揭露帳本,以及 GitHub 上的 THUDM/slime 與 zai-org/GLM-5 兩個 repo。
不在這份清單上的來源,就不在官方清單上。這句話我寫得很保守,但足夠讓你在權重釋出前避開一堆自稱官方的東西。
至於「放出來我跑不跑得動」,一句話回答:官方權重檔的參數量 metadata 是 753,329,940,480,以 BF16 每個參數 2 bytes 計,光權重就是約 1.51 TB,個人機器不用想。真的想把兆級參數的模型搬回自己機器上,先看 Kimi K3 那筆自架成本的實際數字。
現在唯一買得到 GLM-5.3 的路:Coding Plan 積分係數怎麼算才不會爆
GLM-5.3 的 API 官方寫著即將上線、價目表上還沒有這一列,聊天版也沒上,所以現階段唯一的取得路徑是 GLM Coding Plan 訂閱,官方寫「US$18 起」。
這一格是被媒體寫錯最多的地方。有幾家英文媒體寫「available now through Z.ai's API」,但 Z.ai 官方文件置頂的 Tip 寫的是「The GLM-5.3 API is coming soon.」,中文版文件寫「模型 API 將會盡快上線」。
官方價目表最新也只到 GLM-5.2(每百萬 token 輸入 US$1.4、快取輸入 US$0.26、輸出 US$4.4),根本沒有 GLM-5.3 這一列。三處官方互相印證,媒體那句話是錯的。
規格本身則是純文字進出、上下文 1M、最大輸出 128K token。訂閱後可以在 ZCode、Claude Code、OpenCode、Cline 這些工具裡直接呼叫。
重點來了,訂閱制不是按 token 收錢,是扣「積分」,而積分是用係數換算的。
| 模型 | Input 係數 | Cached Input | Output 係數 |
|---|---|---|---|
| GLM-5.3 | 6.9 | 1.7 | 24 |
| GLM-5-Turbo | 5.7 | 1.5 | 21 |
| GLM-4.7 | 4.6 | 1.2 | 16 |
| GLM-4.6V(Vision MCP) | 1.2 | 0.3 | 2.7 |
官方公式是:積分 =(Input × 6.9 + Cached × 1.7 + Output × 24)÷ 10,000。
表格最後一列的 GLM-4.6V 不是拿來寫程式的,它是方案內附的視覺理解 MCP。另外三個 MCP(Web Search、Web Reader、Zread)走的是完全不同的算法:官方寫的是呼叫次數 × Output 係數,每呼叫一次固定扣 1.2 積分,與 token 長度無關。
這條容易被忽略,因為它不吃 token 卻真的會扣積分。agent 一輪跑十幾次搜尋是常態,那就是十幾次 1.2。
把係數互相除一下,三個結論就跳出來了。Output 是 Input 的 3.48 倍、是快取輸入的 14.1 倍;快取命中可以省下 75.4%(1.7 ÷ 6.9)。
而 GLM-5.3 的 reasoning_effort 有 low、high、max 三檔,官方預設是 max。思考產生的 token 全部照 24 這個係數計費。
換句話說,你什麼都不設定,就是跑在最貴的模式上。我在別家的訂閱上踩過同一個雷:把「預設值」當成「平衡值」,結果額度掉得比預期快,回頭才發現預設一直是頂配。
再對比一下:GLM-5.3 的 Output 係數 24 比 GLM-4.7 的 16 貴了 50%。而 Coding Plan 上呼叫 GLM-5.2 或 GLM-5.1 的請求會自動改導到 GLM-5.3。
舊訂閱用戶什麼都沒改,單價先漲了。這條官方寫得很清楚,卻很少人提。
我拿官方係數試算一次給你看,假設一次請求輸入 20,000 token(其中 18,000 命中快取)、輸出 3,000 token:
❶ 尖峰時段:(2,000 × 6.9 + 18,000 × 1.7 + 3,000 × 24)÷ 10,000 = 11.64 積分。
❷ 非尖峰時段以 50% 計:11.64 × 0.5 = 5.82 積分。
❸ 同樣的請求若完全沒有快取命中:(20,000 × 6.9 + 3,000 × 24)÷ 10,000 = 21 積分,比有快取貴 80.4%。
把它換算成額度就有感了。Lite 的 5 小時額度是 2,000 積分,用上面那個請求跑,尖峰大約 171 次、非尖峰大約 343 次。
官方三檔的額度是:Lite 每 5 小時 2,000、每週 10,000;Pro 12,000 / 60,000;Max 28,000 / 140,000。5 小時額度是消耗後動態回補,週額度自訂閱起每 7 天重置。
官方另外給了每週可用 token 的估算(以 90.9% 快取命中率計):Lite 43 到 87 百萬、Pro 263 到 526 百萬、Max 613 到 1,226 百萬。
這組數字有個陷阱,我把上下限相除就看出來了:87 ÷ 43 = 2.02、526 ÷ 263 = 2.00、1,226 ÷ 613 = 2.00。
上限精準等於下限的兩倍。那不是額外贈送,就是「你完全不在平日下午工作」的那個版本。看到「最高 12.26 億 token」就以為買得到 12.26 億的人,實際拿到的是 6.13 億。
所以省積分的正解不是少問,是三件事:讓快取盡量命中、壓縮輸出長度、非寫程式任務把 reasoning_effort 降到 low。
同樣是「預設檔位最貴」的問題,Opus 5 那次我算過壓縮輸出能省下多少,思路可以直接搬過來用。
另外還有一個限時的東西要標清楚時間:ZCode 目前有 98% 以上快取命中率的加成(重複脈絡以較低的快取費率計,約多 30% 有效 token),加上 1.5 倍限時額度加成,官方稱兩者疊加最高可到標準額度的 180%。這個優惠到 8 月 31 日為止。
尖峰是台北時間下午兩點到六點,新舊方案倍率差在哪
GLM Coding Plan 官方定義的尖峰時段是週一至週五 14:00 到 18:00(UTC+8),其餘所有時段包含週末全天,模型呼叫只消耗標準積分的 50%。UTC+8 就是台北、香港、北京時間。
這一條看起來平平無奇,實際上是整篇裡最影響荷包的一格。因為那四個小時,正好整段砸在正常上班的下午。
你在辦公室最專心寫程式、最需要模型連續跑 agent 的那段時間,剛好就是官方定義的最貴時段。這不是巧合,尖峰本來就是照使用量畫的。
換到其他時區,同一份訂閱的體感差很多:
- 台北/香港/北京:14:00–18:00,上班下午整段命中。
- 東京:15:00–19:00,一樣是工作時間尾段。
- 倫敦(8 月夏令時間):07:00–11:00,上午前半段命中。
- 美東(夏令時間):02:00–06:00,幾乎沒人在那時寫程式。
- 美西(夏令時間):前一天 23:00 到凌晨 03:00,同樣避開。
結論有點荒謬但很真實:同一個方案,你人在哪裡決定你付幾折。在北美的華人開發者幾乎永遠落在非尖峰,等於天生半價;在台北、香港按正常作息工作的人,反而最容易吃到全價。
第二個坑更隱蔽:新舊方案根本是兩套規則。
新積分制是尖峰 1 倍、其餘時段 0.5 倍,也就是尖峰等於非尖峰的 2 倍。但官方在 2026 年 7 月 30 日發布的方案更新公告裡,Legacy V2 與團隊版的規則是:GLM-5.3 與 GLM-5-Turbo 尖峰 3 倍、非尖峰 1 倍,GLM-4.7 則全天 1 倍。
兩套的計量單位不一樣,新制扣的是積分、Legacy V2 算的是 prompt 次數,所以不能直接比絕對扣除量。能比的是尖峰罰則:新制尖峰是自己離峰的 2 倍,Legacy V2 是 3 倍,罰則陡了 50%。
官方另外註明既有訂閱者週末全天以非尖峰計。至於論壇上流傳的「高峰 3 倍、非高峰 2 倍」則是錯的,那是把兩套規則混在一起講,中英文報導我看下來也都沒有把兩套分開。
怎麼確認自己在哪一套:登入後開「我的方案」頁,官方寫明個人方案會直接顯示「Legacy Plan V1」或「Legacy Plan V2」,團隊方案顯示「Team Edition」,三個都沒有就是新積分制。
查完之後才是真正的分歧點。能不能換到新方案,官方公告分成三條完全不同的路,這一段幾乎沒人讀到。
❶ Legacy V1:不能提前換,只能等現有計費週期結束、方案到期後再訂新方案。
❷ Legacy V2:只有「升級到更高一階的新方案」可以立刻換;同階平轉或降級一律等到期。立刻換的話舊方案當下終止,未用價值折抵新方案價格。
❸ 團隊版:與 V1 相同,到期前不能換,到期後才能訂新方案。
還有一句官方講得很白:方案不會自動切換,你不手動操作就會一直待在 3 倍那套裡。
所以順序要對:先查方案,再決定時段策略。查完發現這一期換不了的人,時段安排就是你唯一還能動的變數,那條就得排得更嚴格。
你今天可以做的兩件事:先去「我的方案」頁確認自己屬於哪一套;再把重跑測試、批次重構、長 agent 任務這種吃 token 的活,排到平日下午兩點到六點以外。
另一家中國模型調整計費時我也逐格對過官方價目表,那次的教訓是倍數只在最便宜那一格成立,看標題的倍數會被騙。
除了 GLM Coding Plan,寫程式訂閱還有哪些可以一起比
如果你的目的是「寫程式的月費支出更划算」,GLM Coding Plan 是選項之一但不是唯一,真正要比的是同一筆預算在哪裡能跑完你手上那類任務。
我自己在配這筆預算時,會先把工具分成三類,不混在一起比。
❶ 編輯器型:Cursor、Devin Desktop(windsurf.com 現在會直接導到這個頁面)這類把模型包進 IDE 的訂閱,強項是在既有專案裡改動。
❷ 程式庫理解型:Augment Code 這種主打大型 codebase 索引的服務,強項是在幾十萬行的專案裡找到該改的地方。
❸ 模型額度型:GLM Coding Plan、Claude 的用量方案這類,你買的是模型呼叫額度,工具自己挑。
GLM Coding Plan 屬於第三類。它最誠實的定位是:當你已經有順手的工具,只是想把模型呼叫的單位成本壓下來。
還有一個官方文件裡沒人提的細節:中國站的 Coding Plan 文件明寫支援 OpenClaw,但採次級調度與盡力交付,高負載時會排隊限流。如果你的工作流重度依賴它,這條要先看清楚。
適合現在就訂 GLM Coding Plan 的人:主要在非平日下午的時段寫程式、任務以重複脈絡為主(快取命中率高)、已經有慣用的 CLI 工具、能接受授權條款還沒公布。
先不要訂的人:必須用穩定的 API 計價做成本預估(GLM-5.3 的 API 還沒上線)、公司政策不允許把程式碼送到中國廠商、或是你只是想試玩一下(現在沒有聊天版可以碰)。
圖片這一項要講精確一點。GLM-5.3 本身是純文字進出,但方案有附視覺理解 MCP(走 GLM-4.6V),所以「工作流裡要讀截圖」不等於不能訂,「要 GLM-5.3 自己看圖」才是真的不行。
如果你還在盤點今年的寫程式工具該留哪幾個,這份清單可以省下一輪試用。編輯器內建的補全跟獨立訂閱到底差在哪,我把兩家的實際使用差異寫過一篇。
至於「我現在付的那份還有沒有被用滿」,這是我每季都會重算一次的題目。先確認你現在付的那份訂閱有沒有被用滿,我把它的回本門檻拆過。
不改設定今天就會壞:GLM-5.3 思考模式停用與舊版請求自動改導
GLM-5.3 的 thinking.type 只支援 enabled,過去的 disabled 已經不支援;官方明寫如果現有應用還在傳 disabled,必須先改成 enabled 並把 reasoning_effort 設為 low,再更換 model ID,否則請求將失敗。
這是全篇唯一一條「今天不處理就會出事」的變更,卻被埋在文件中段。
要命的是它跟另一條規則疊在一起:Coding Plan 上呼叫 GLM-5.2 或 GLM-5.1 的請求會自動改導到 GLM-5.3。你沒有辦法靠「不換版本」來躲。
所以正確的處理順序只有一種,順序錯了就會噴錯:
❶ 先把 thinking.type 從 disabled 改成 enabled。
❷ 把 reasoning_effort 設成 low,先把行為和成本穩住。
❸ 最後才改 model ID,改完再逐步把需要深度推理的任務調回 high 或 max。
我特別想提醒一件事:先改 model ID 再改 thinking 參數,就是官方說會失敗的那條路。如果你的服務是排程跑的,錯誤可能要等到半夜才被你發現。
另外一個常被問到的風險是「把第三方模型接進 Claude Code 會不會出事」。把第三方模型接進 Claude Code 會不會被封號,這題我查過官方條款,風險點不在模型在憑證。
同一個工具接兩家模型時,額度計算也常常有誤會。同一個工具接兩家模型時額度會怎麼互吃,我拆過一次實際的計量方式。
今天就能做完的檢查:搜一下你所有專案裡有沒有寫死 "type": "disabled",有的話今天改掉,不要等排程半夜噴給你看。
如果是我,現在會怎麼配這筆 coding 訂閱預算
我不會為了 GLM-5.3 動現有的主力訂閱,但我會把它當成「重複性高、輸出可壓縮」那類任務的第二條線來評估。
理由很直接。Z.ai 的 GLM-5.3 發布公告在自家的私有 benchmark 上就承認了:GLM-5.3 仍落後 Claude Fable 5(34.5% 對 39.5%)。連自己出題都沒贏,天花板在哪裡很清楚。
但同一張圖也給了它真正的強項。GLM-5.3 的 High 檔拿 31.4% 只花了大約 50K 輸出 token,而 Claude Opus 4.8 的 High 檔是 29.5%、花了 120K。
同樣的活,少吐 58% 的 token。對自家上一代則是 34.5% 對 23.4%,分數多 47.4%、token 少 21.9%。
所以它的定位是「單位 token 效率好、絕對天花板不夠高」。中英文報導都只挑一面講,一邊喊超車,一邊喊還是輸,兩邊都對一半。
有個做外包接案的朋友前幾天問我,要不要為了它把手上那份貴的訂閱砍掉。我的回答是先別動。
他真正的問題不是模型不夠強,是他把所有任務都丟給同一顆最貴的模型跑。那個問題換家廠商不會解決,只會換一張帳單繼續痛。
如果是我,會照這個順序做:先確認訂閱是不是 Legacy V2、再把大量重複的任務排到平日下午兩點到六點以外、然後把非寫程式任務的 reasoning_effort 降到 low。做完這三件事再看要不要加訂。
想知道同樣一份預算在 Claude 那邊能換到多少額度,我把它的用量制度算過一次,兩邊放在一起比才有意義。
如果你要的是跨品牌一次比完,我把今年五家旗艦的分工整理成一張選擇表。
喜歡這種把官方文件逐格拆開對照的內容,可以訂閱夜羽凌的部落格,我把每次對帳、對規格、對條款的過程都寫下來,你會不定期收到信。
FAQ 常見問題
GLM-5.3 和 GLM-5.2 差在哪?基座沒換是不是代表沒進步?
官方明說 GLM-5.3 使用與 GLM-5.2 相同的基礎模型,所有提升都來自後訓練。從數字看進步很明顯:CyberGym 從 77.2 到 84.5、ExploitBench 從 24.4 到 54.4、ExploitGym 六小時從 39 題到 130 題。
基座不換而靠後訓練拉分數,是省算力的做法,不代表偷懶;但它也意味著這一版的能力上限,仍然受限於同一個基座。
沒有 API、也沒有聊天版,非工程師現在有辦法碰到 GLM-5.3 嗎?
現階段沒有。官方文件只列了 GLM Coding Plan 一條路徑,API 寫著即將上線,官方部落格的「試用」旗標在這一版是關閉的,而 GLM-5.2 那一版是開啟的。也就是說如果你不是開發者、也不打算裝 CLI 工具,最務實的做法是等權重釋出後由第三方平台上架,或等官方 API 正式開賣。
我在台灣或香港,要從 Z.ai 用美元買,還是從中國站用人民幣買?
官方文件目前只有「US$18 起」這一個公開數字,Pro 與 Max 的實際金額在任何一份官方文件頁上都查不到,要登入訂閱頁才看得到。網路上流傳的人民幣價格來自論壇與二手整理,我不建議拿來當比價依據。比較務實的做法是兩邊的訂閱頁各開一次自己看,並確認你要的付款方式與發票需求哪邊支援。
GLM-5.3 開源之後,我可以拿它幫公司做程式碼安全稽核嗎?
目前有兩個門檻沒過。第一,授權條款官方還沒公布,能不能商用、有沒有地區限制都是未知;GLM-5.2 是 MIT 且沒有地區限制,但那不能自動套到這一版。
第二,從 ExploitBench 54.4 與 ExploitGym 六小時 130 題來看,它在利用鏈深處仍落後 1.43 到 1.90 倍,適合當第一輪篩選,不適合當最後一道把關。
我現在的程式碼會不會因為換版直接壞掉?
有可能,而且不用你主動換版。官方寫明 thinking.type 的 disabled 已不支援,而 Coding Plan 上呼叫 GLM-5.2 或 GLM-5.1 的請求會自動改導到 GLM-5.3。
正確順序是先把 thinking.type 改成 enabled、把 reasoning_effort 設成 low,最後才改 model ID;順序反了官方明說請求會失敗。今天先全域搜一次專案裡有沒有寫死 disabled,就能避掉大半風險。
參考資料
- Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities(官方發布公告與完整跑分表)
- Z.ai Docs — GLM-5.3 模型文件(規格、思考模式與遷移說明)
- Z.ai Docs — GLM Coding Plan 總覽(積分係數、額度與時段規則)
- Z.ai Docs — 方案更新公告(Legacy V2 與團隊版倍率)
- Anthropic — Claude 模型總覽(Claude Mythos 5 與 Fable 5 的官方定義)
- Z.ai — 漏洞協調揭露帳本(2,436 筆漏洞的公開統計)