Grok 4.6 vs Gemini 3.7 vs GLM-5.3:沒有一個是純升級

目錄

💡 核心結論速覽 (TL;DR)

  • 五家同一週換代,沒有一家是純升級:8/3 到 8/14 之間,Qwen、Grok、OpenAI、Google、Z.ai 全部推新版,每一家都附帶一個沒寫進公告標題的代價。
  • 牌價沒動不等於沒漲:Grok 4.6 的 $2/$6 一毛沒變,但快取輸入從 $0.30 漲到 $0.50,整整多三分之二。
  • 「半價」是誤傳:Gemini 3.7 Flash 與 3.6 Flash 現在同為 $0.75/$3.75,換過去不會變便宜;而最快的那個(Ultrafast)是 API 限定預覽,訂閱者根本開不到。
  • 先別急著改設定:這波真正該做的第一件事,是確認你手上那個模型有沒有被換掉預設值——有兩家會在你什麼都不做的情況下自動換。

十二天,五個新模型。這是我看 AI 這幾年,換代最密集的一週。

從 8 月 3 日的 Qwen3.8-Max 開始,接著 8 月 12 日 Grok 4.6、8 月 13 日 GPT-5.6 Sol Ultrafast 與 Gemini 3.7 Flash,到 8 月 14 日 GLM-5.3——五家在十二天內全部把旗艦換了一輪。

我每天用 AI 超過 10 小時,手上同時養著好幾家的付費方案。看到這種密集發表,我不會先問「誰最強」,而是先問一句更實際的:我現在正在用的那個,是不是被換掉了?換過去要付什麼代價?

把五家的官方文件從頭對到尾之後,我得到一個有點意外的結論:這五個換代,沒有一個是「換了就更好」的單純升級。每一家都藏了一個代價,而且都不在公告標題裡。


這波 AI 模型換代到底換了哪五個?先確認你手上那個在不在名單上

十二天內換代的是 Qwen3.8-Max、Grok 4.6、GPT-5.6 Sol Ultrafast、Gemini 3.7 Flash 與 GLM-5.3,分屬阿里巴巴、xAI、OpenAI、Google 與 Z.ai 五家。

先講為什麼「確認名單」比「看誰最強」重要。這五個裡面有兩個會在你什麼都不做的情況下影響你——一個是 agent 的預設模型被換掉,一個是你原本吃的折扣悄悄消失。剩下三個則是你想換也未必換得成。

發布日 模型 上一版
8 月 3 日 Qwen3.8-Max Qwen3.7-Max
8 月 12 日 Grok 4.6 Grok 4.5
8 月 13 日 GPT-5.6 Sol Ultrafast 同一顆模型,換執行硬體
8 月 13 日 Gemini 3.7 Flash Gemini 3.6 Flash
8 月 14 日 GLM-5.3 GLM-5.2

Ultrafast 那一列要特別說明:它不是新模型,是同一顆 GPT-5.6 Sol 換了執行它的硬體。這在這波裡是獨一份的形態,也是最容易被誤讀的一個。

下一步:打開你的程式碼或工具設定,把目前寫死的模型名稱找出來。如果上面「上一版」那一欄有你手上那個,往下讀;一個都沒有,這篇你可以只看下一段的總表就好。


為什麼這五個 AI 模型換代沒有一個是純升級?代價一次攤開

因為每一家的新版本都至少有一項比上一版差、比上一版貴,或是你根本拿不到。我把五家官方文件裡最關鍵的那一條各抓一個出來並排。

模型 公告主打 沒寫進標題的代價
Grok 4.6 牌價與 4.5 相同 快取輸入從 $0.30 漲到 $0.50,多 66.7%
Gemini 3.7 Flash 限時優惠價 3.6 Flash 同價,換過去不會變便宜
GPT-5.6 Ultrafast 最高快 14 倍 API 限定預覽,訂閱者選單裡沒有
GLM-5.3 資安跑分超車 官方文件寫 API coming soon,現在買不到
Qwen3.8-Max 首次開源 Max 級 上一版有 5 折、這版沒有,換代帳單翻倍

這張表是本篇的骨架,下面五段就是逐個把「代價那一欄」攤開。我不做跨家的跑分排名——原因很簡單:五家的官方跑分根本不能直接並排,各自挑的對照組、benchmark 和執行設定都不一樣,有的還把時間預算依照自家吐字速度重新縮放過。並排看起來很科學,其實是誤導。

想看「跑分表該怎麼讀才不會被唬」,我在上一輪模型大戰那篇拆過三個訣竅,這裡就不重複了。本篇只比一件事:換過去你要付什麼


Grok 4.6:牌價一毛沒漲,快取輸入卻悄悄貴了 66.7%

Grok 4.6 的短脈絡牌價維持 $2/$6,跟 4.5 完全一樣——但官方價目表上兩列並排時會看到,快取輸入從 $0.30 漲到 $0.50,長脈絡快取從 $0.60 漲到 $1.00,兩個都是漲三分之二。

這個設計很妙,也很容易漏掉。多數人比價只看那組最顯眼的「輸入/輸出」牌價,而快取那格通常被當成小數點後的零頭。問題是快取命中率越高的工作流,越吃這一格——常駐系統提示詞、固定的參考文件、長對話,全都走快取。

換句話說,你的流程設計得越好、快取用得越兇,這次換代對你的漲幅反而越大。這種「優化得越好越吃虧」的計價結構,我第一次在這類公告裡看到。

它還有另一道坑:200K 是斷崖不是級距,達門檻後整筆請求的所有 token 都改用長脈絡費率。多送 1 個 token 那筆請求就翻倍的完整算法我另外拆過一篇,包含工具呼叫的另計費用怎麼疊上去。

還在用 4.5 的人,上一版的定位與 SuperGrok 訂閱判斷那篇仍然有效,不用急著作廢。


Gemini 3.7 Flash:不是半價,而且可能讓你的 agent 直接回錯誤

Gemini 3.7 Flash 與 Gemini 3.6 Flash 現在同為每百萬 token 輸入 $0.75、輸出 $3.75,優惠期都到 2026 年 12 月 31 日,2027 年 1 月 1 日起同步變成 $1.50/$7.50。所以「換到 3.7 會變便宜」這件事,今天不成立。

這是這波我覺得最值得講清楚的一條。中文媒體幾乎一面倒地寫「限時 5 折」「半價優惠」,讀者很自然會理解成「換過去省一半」。但官方遷移指南的定價段落白紙黑字寫著優惠同時適用 3.6 與 3.7 兩個版本。

那既然同價,換不換就完全不是價格題,而是遷移風險題。而風險是真的存在的:思考等級的 MINIMAL 檔位在 3.7 Flash 被移除了,你如果原本明確設定了這個值,換過去會直接收到 API 驗證錯誤。

更需要注意的是,Google 把 Antigravity agent 的預設模型直接換成了 3.7 Flash——這代表有一群人什麼都沒做,模型也已經被換掉了。這波五個換代裡,這是最「無感中招」的一個。

官方遷移清單六步、以及它有哪一項反而輸給 3.6,我另外整理成一篇;想知道留在 3.6 這一代原本省下多少,舊那篇的算法仍然可以對照著看。


GPT-5.6 Ultrafast:14 倍是峰值,而且多數人根本開不到

Ultrafast 官方宣稱最高每秒 750 個輸出 token、最高達 Standard 的 14 倍,但同一批官方物料裡的 GDP-Val 實測圖,標的是端到端快 5.6 倍——差距來自「峰值吐字速度」不等於「任務完成速度」。

更關鍵的是可及性。它目前是 API 限定的有限預覽,官方原文只說「先在 OpenAI API 上線」,ChatGPT 的 Go、Plus、Pro 訂閱者在模型選單裡不會看到這個選項。

所以如果你是看到「AI 快 14 倍」這個標題進來的訂閱用戶,我必須誠實說:這件事跟你目前沒有關係。你的 ChatGPT 不會因為這則新聞變快。

它在這五個裡的特殊性也值得記一下——其他四個是換模型,它是同一顆模型換執行它的硬體。這條路線如果走通,未來「升級」可能不再等於「換更聰明的模型」,而是「換更快的機器」。官方兩張圖的秒數我逐格除過,連純推論段都到不了 14 倍。


GLM-5.3 與 Qwen3.8-Max:一個現在買不到,一個換代反而變貴

GLM-5.3 的官方 API 文件目前寫的是 coming soon,權重也宣布延後約兩週釋出;Qwen3.8-Max 則是上一代掛著 5 折、新一代沒有折扣,同樣用量下換代帳單直接翻倍。

先講 GLM-5.3。它這次的話題性來自資安跑分超車,但有兩件事媒體普遍沒講清楚:它超車的那個對手是邀請制、一般人買不到的;而且贏的幅度換算成題數,在 1,507 題裡只差約 11 題,還是單次跑分沒有變異數。

更實際的問題是——現在想用也用不到。多家英文媒體寫「已可透過 API 使用」,但官方文件置頂寫著即將推出。權重什麼時候放、現在唯一買得到的路是哪條,我把時間軸與積分算法整理在另一篇。

Qwen3.8-Max 這邊則是完全相反的坑。多數人的直覺是「新版本通常比較划算」,但實際查官方價目:上一代 qwen3.7-max 現正掛限時 5 折,新的 3.8-max 沒有折扣,換過去等於同樣用量付兩倍

它的「開源」也需要看清楚——放出來的那一版是純文字、原生只有 262,144 上下文,跟 API 版不是同一個東西。權重實際多大、六個地區價差 21% 是怎麼回事,那篇有完整的檔案清單加總。

兩家都是中國模型線,想先搞清楚在自己這邊註冊得上嗎、免費額度怎麼算,我開過三家的登入頁做過對照


這波 AI 模型換代到底要不要跟?按「你現在卡在哪」分流

結論先給:五個裡面只有一個值得你今天就動手,其餘三個可以等,一個你想動也動不了。判斷依據不是誰跑分高,是你目前卡在什麼問題上。

❶ 如果你卡在「帳單越來越貴」

先別換模型,先去翻你的快取命中率與上下文長度。Grok 那條快取漲價和 200K 斷崖,都是「不改模型也會影響你」的變數。這一類人真正該做的是重算成本結構,不是換品牌。

❷ 如果你卡在「agent 跑到一半壞掉」

這波唯一該優先處理的就是你。Gemini 那邊移除了一個思考檔位、又換了 agent 預設模型,兩件事都會在你沒改任何程式碼的情況下改變行為。今天就去確認設定是「指定版本」還是「跟隨預設」。

❸ 如果你卡在「回應太慢」

可以等。Ultrafast 現在拿不到,而它的實際加速幅度也比標題小得多。與其排隊等預覽,不如先看看自己的延遲是不是卡在工具呼叫和網路往返,那部分換多快的模型都救不了。

❹ 如果你是想找便宜的替代方案

這波沒有一個比上一代便宜。真要省,方向反而是回頭把既有流程的浪費擠掉——agent 任務為什麼特別會燒 token、該從哪裡砍起,那套心法比換模型有效得多。

順帶一提,同一週還有兩件事跟成本直接相關但不在這五個裡:DeepSeek 在 8 月 17 日凌晨開始改成尖峰離峰兩段收費,以及 Meta 放出了一個 24GB 顯卡就跑得動的開放權重模型。前者影響帳單,後者影響「要不要乾脆搬回自己機器」這個選項。


官方公告不會告訴你的三件事,以及怎麼自己驗

把五份公告對完之後,我歸納出三個固定會出現的落差。這幾條不只適用這一波,下次再有新模型發表也能直接拿來用。

❶ 牌價不動不代表沒漲價。

公告會強調「價格與上一代相同」,但那通常只指最顯眼的輸入/輸出兩格。快取、長脈絡、工具呼叫這些「第二層」費用是分開列的。驗法很簡單:把新舊兩個版本在官方價目表上並排,逐格比對,不要只看公告文字。

❷ 「最強」和「你買得到」是兩件事。

這一波至少有兩個案例——一個是預覽制拿不到,一個是超車的對手根本是邀請制。看到跑分超車的新聞,第一個要查的不是分數,是那兩個模型現在能不能自助註冊。

❸ 新版本不一定比舊版本划算。

促銷是綁在特定版本上的。上一代掛折扣、新一代原價,這種情況下換代就是漲價。查法是把新舊兩版的「實付價」而不是「牌價」拉出來比。

我自己看這類發表已經養成一個習慣:先開官方價目表,再看公告文字,最後才看媒體標題。這一波五家對完之後,我更確定這個順序是對的——因為五家裡面,媒體標題與官方文件對不上的就有三家。

如果你想從能力面而不是成本面重新盤一次,三大付費 AI 的訂閱怎麼選那篇是另一個切入點;開源模型該不該用的信任評估則適合正在考慮中國線的人。


完全不碰 API 的人,這波 AI 模型換代跟你有關嗎?

有關,但影響的形式跟開發者完全不同:你不會收到帳單變化,你會收到的是「同一個問法,答案突然變得不太一樣」。而且多數平台不會通知你。

這是我覺得這波最容易被忽略的一群人。所有報導都在談 API 價格、遷移清單、跑分,但用網頁版和 App 的人其實佔絕大多數,而他們受到的影響是另一種形態。

具體會怎麼發生?大致三種:

  • ❶ 預設模型被換掉:你什麼都沒改,但後台把新版設成預設。這波 Google 就把 Antigravity agent 的預設換成了 3.7 Flash。
  • ❷ 回答風格或長度變了:新版本的思考檔位、預設推理強度常跟著改,最直接的體感就是「以前會展開的地方變簡略了」或反過來。
  • ❸ 方案內含的模型清單變動:某個版本從高階方案下放到免費層,或反過來被移出。

怎麼確認你到底在用哪一版?最快的方法不是去翻設定,是直接問它——在對話框裡問「你是哪個版本」,多數平台的模型會回答自己的識別名稱。答案不一定百分之百準確(模型對自己的認知本來就常有誤差),但足以看出有沒有被換掉。

然後判斷標準很簡單:如果你沒有感覺到任何差別,那就不用做任何事。這波沒有一個換代值得一般使用者主動去做什麼——真正該警覺的只有一種情況,就是你有一套固定在用、而且很吃穩定性的流程(例如每天用同一組提示詞產出報告),那才需要去確認能不能鎖版本。

下一步:如果你只是想知道自己該不該從免費版升級到付費,那跟這波換代其實是兩個問題——三大付費 AI 的訂閱到底怎麼選那篇才是你要看的。


FAQ 常見問題

這五個新模型,我一定要跟著換嗎?

不一定,而且多數人不用急。這波沒有一個是「換了就明顯更好又更便宜」的升級:Gemini 同價、Grok 快取變貴、Qwen 換代翻倍、GLM 現在買不到、Ultrafast 開不到。唯一建議今天就處理的是「agent 跑到一半壞掉」那一類人,因為 Gemini 那邊有兩個會在你沒改設定的情況下改變行為的變動。

牌價沒漲,為什麼我的帳單還是變多了?

檢查三個「第二層」費用:快取輸入單價、長脈絡門檻、工具呼叫另計。這波 Grok 就是牌價完全不動、但快取輸入漲了 66.7% 的典型案例。比價時把新舊版本在官方價目表上逐格並排,不要只讀公告文字。

我用的是網頁版或 App,這波換代跟我有關嗎?

影響比 API 使用者小很多,但不是零。多數平台的網頁與 App 會在某個時間點自動把預設模型換成新版,你可能會感覺到回答風格或速度變了卻找不到原因。真正完全不受影響的是那些明確指定版本的流程;跟隨預設的一律會被換。

官方跑分表為什麼不能直接拿來排名?

因為各家挑的對照組、benchmark 項目與執行設定都不同——有的用自家最強檔位跑、卻讓對手跑預設值,有的把時間預算依照各模型吐字速度重新縮放。這種情況下把五張表的數字並排,看起來科學但結論不可靠。這也是本篇只比「換代代價」不做能力排名的原因。

如果我想省錢,這波該怎麼做?

先別換模型。這五個沒有一個比上一代便宜,省錢的槓桿反而在既有流程:把重複內容前置以提高快取命中率、控制上下文長度避開長脈絡門檻、把可延後的批次任務挪到離峰時段跑。這幾招不用改模型就能生效,而且效果通常比換品牌大。


密集換代的時候,最不該做的就是急著跟

這一週把我提醒了一件事:發表密度變高之後,「跟上最新版本」這個直覺反而變成風險。十二天五個新版本,如果每一個都跟,你花在遷移、重測 prompt、追查行為變化的時間,會遠超過那些版本帶給你的好處。

我自己的做法是把模型當成基礎設施而不是新玩具——沒有具體問題要解,就不換。而當我真的要換的時候,第一個動作永遠是打開官方價目表逐格對,而不是看誰的跑分圖比較漂亮。

這波真正值得記住的,其實不是哪個模型比較強,而是那三個固定落差:牌價不動不代表沒漲、最強不代表買得到、新版本不一定比舊版划算。下次再有新模型發表,這三條可以直接拿出來用。

訂閱夜羽凌的部落格,各家模型的價格與可用性只要有變動,我會不定期寄信告訴你。


參考資料

 

延伸閱讀