Qwen3.8-Max-0902 快取怎麼算才划算?我算完:不到 8 次別開顯式

目錄

💡 核心結論速覽 (TL;DR)

  • $0.17 那個數字有前提:Qwen3.8-Max-0902 的顯式快取命中確實只要 $0.17/百萬 token,但建立要先付 $2.5——比標準輸入價 $2 還貴 25%。官方公告只講前半句。
  • 我算完的分界線是「8 次」:同一段前綴重複命中不到約 8 次,隱式快取($0.25、不用建立費、自動開)反而比顯式便宜。而且顯式快取只活 5 分鐘,等於這 8 次要壓在 5 分鐘內。
  • 官方文件裡有一句例外,多數人會漏掉:通則寫顯式命中是標準價 10%、隱式是 20%,但官方明文寫 qwen3.8-max「不適用」——實際是 8.5% 與 12.5%,比通則便宜。所以別拿別人家的比例換算 Qwen 的帳單。
  • 0902 這一版該不該換:升級的是 Coding、協作 agent 與原生視覺三項,1M 上下文和價格都沒動。已經在跑多工具 agent 的人值得換;只做單次問答的人換了感覺不到差別,不如先把快取模式選對,那個省得比較多。

看到 Qwen 那則公告寫「顯式快取命中 0.17 美元」時,我的第一反應是:這比輸入價便宜快 12 倍,怎麼可能有人不用?

翻開官方的快取文件,我看到一行公告沒提的字:建立那份快取,要先付 2.5 美元。比標準輸入價還貴四分之一。

這不是坑,是所有前綴快取的通用設計——你要先讓機器把那段內容算一次存起來。但它會直接改變「該不該用」的答案,因為 Qwen 同時提供另一種不用付建立費的快取模式。兩種怎麼選,取決於你會重複用幾次。

這篇我把官方定價頁和快取文件逐條對完,算出那條分界線在哪,也把 0902 這一版實際升級了什麼講清楚。先說結論方向:多數人該用的不是那個 $0.17 的模式。


Qwen3.8-Max-0902 升級了什麼?官方只講了三件事

Qwen3.8-Max-0902 是 Qwen3.8-Max 的快照版本(官方 Version Tag 標的就是 SNAPSHOT),完整 alias 是 qwen3.8-max-2026-09-02。官方頁面在 Overview 只寫了三項升級:

❶ 編碼能力:官方原文說它「breaks new ground」,能處理更複雜的工程級專案與長時程的自主開發。

❷ 協作 agent 表現:多工具調度與端到端任務交付上「更有定力」(原文用的是 composure)。

❸ 原生視覺理解:在圖表推理、文件解析與多模態感知上更精準可靠。

接在三項升級後面的那句話同樣重要:保留 1M 上下文視窗、thinking 模式與完整工具生態。翻成人話——這一版沒有動你的架構,只是同一個殼裡換了更會做事的引擎。

這裡有個小細節值得記一下:官方頁面的「Updated」欄位寫的是 Sep 1, 2026,但版本號和 alias 都是 09-02。兩個日期不一致,官方沒有解釋。我不打算幫它選一個當「發布日」,只是提醒你:如果你要在文件或報告裡寫這個模型的上線日期,兩處都截圖存著比較保險。

還有一件事我覺得很有意思。這一版的輸入模態官方列的是 Image、Text、Video——原生吃圖也吃影片。而我上個月拆過 Qwen3.8-Max 的開放權重版,那一版是純文字、原生只有 256K。同一個名字底下的兩個東西差距有多大,那篇算得很細,這裡就不重複了。

這段你可以先做的事:如果你的程式碼裡寫的是 qwen3.8-max(不帶日期),先確認你要不要固定到 qwen3.8-max-0902。快照版的好處是行為不會在你沒注意時被換掉,代價是你要自己追新版。


Qwen3.8-Max-0902 的 1M 上下文,實際只有 991K 能放輸入

官方的宣傳數字是 100 萬 token 上下文,但實際可用的分配我建議直接看官方那張規格表,因為輸入上限是 991K,不是 1M

項目 一般模式 Thinking 模式
最大輸入 991K 983K
最大輸出 131K 131K
上下文視窗 1M 1M
最大推理長度 262K

差的那 9K 不是重點,重點是開了 thinking 模式之後輸入上限還會再掉 8K,而推理本身最多可以吃掉 262K。如果你打算把整份程式碼庫塞進去又要它深度思考,這幾個數字要一起算,不能只看「1M」那個行銷數字。

速率限制的部分官方標的是 TPM 100 萬 token/分鐘、RPM 1.5 萬次/分鐘,新帳號另有 100 萬 token 的免費額度可以先試(各家標榜的免費額度我對過官方數字,帳面和實際能跑的量差很多,這個 100 萬也一樣先當試用而不是預算)。以個人或小團隊的用量來說,這個限制不太可能撞到——會撞到的是錢,不是速率。

台灣能不能直接開來用?可以,走的是國際站端點。註冊門檻與免費額度那一層我另外實查過三家大陸 AI:哪一種身分直接不能用、哪些資料絕對別丟進去,我開了三個登入頁對照過——這篇只談成本,合規與資料邊界請務必先看那篇。

所以接下來講錢。


Qwen3.8-Max-0902 有三種快取,不是兩種

大部分報導只提「顯式」和「隱式」,但官方文件寫的是三種模式。我把對照表整理成這樣:

模式 建立費用 命中費用 有效期
顯式快取 $2.5 $0.17 5 分鐘(命中重置)
隱式快取 $2(標準價) $0.25 不定,系統定期清
工作階段快取 $2.5 $0.17 5 分鐘(命中重置)

(金額單位都是每 100 萬 token,標準輸入價是 $2、輸出 $6。)

三者的差別不只在價格,更在「誰來管」:

顯式快取要你自己在 messages 陣列裡插 cache_control 標記,換來的是「保證命中」與更低的延遲。你控制得最多,也付得最多。

隱式快取是自動的,而且你關不掉——官方 FAQ 直接寫了不能停用,理由是它不影響輸出品質。系統自己找共同前綴,但命中機率不保證

工作階段快取只給 Responses API 用,加一個 x-dashscope-session-cache: enable 標頭,伺服器自動幫你管多輪對話的上下文,計費規則跟顯式一樣。

還有一條很容易踩的規則:在 Chat Completions、DashScope 和 Anthropic 相容這三種 API 下,顯式與隱式是互斥的。你不能兩個都要。

官方文件裡那句例外,可能是全篇最值錢的一行

官方文件的通則寫的是:顯式快取命中「typically 10% of the standard input token price」、隱式命中「typically 20%」。照這個算,Qwen3.8-Max 的顯式命中應該是 $0.2、隱式應該是 $0.4。

但實際標價是 $0.17 和 $0.25。

為什麼?因為官方在 Billing 段落特別列了例外:qwen3.8-max、qwen3.8-flash 和 qwen3.8-2.4t-a95b 這三個模型的快取命中價「不是」標準價的 10%/20%,要去 Model Marketplace 看實際數字。

我用官方金額自己換算了一次(這是我算的比例,不是官方寫的字):

  • 顯式建立 $2.5 ÷ 輸入 $2 = 1.25 倍(這個符合通則)
  • 顯式命中 $0.17 ÷ $2 = 8.5%(比通則的 10% 便宜)
  • 隱式命中 $0.25 ÷ $2 = 12.5%(比通則的 20% 便宜不少)

這件事的實務意義是:如果你拿別人整理的「Qwen 快取省 80%」這類通則去估自家帳單,會估錯。我自己吃過這種虧——照通用比例算完預算,實際帳單對不上,回頭才發現該模型有專屬定價。所以現在我養成習慣,價格一律回該模型的頁面看金額,不看比例。


Qwen3.8-Max-0902 快取回本試算:不到 8 次別開顯式

直接給算式。假設同一段前綴要用 N 次(第 1 次建立,之後 N−1 次命中),單位都是每 100 萬 token:

完全不用快取:成本 = 2.0 × N

顯式快取:成本 = 2.5 + 0.17 × (N−1)

隱式快取:成本 = 2.0 + 0.25 × (N−1)

把幾個常見次數代進去:

重複次數 不用快取 顯式 隱式
1 次 $2.00 $2.50 $2.00
2 次 $4.00 $2.67 $2.25
5 次 $10.00 $3.18 $3.00
8 次 $16.00 $3.69 $3.75
20 次 $40.00 $5.73 $6.75

兩條線的交叉點在 N ≈ 7.25,也就是第 8 次起顯式才開始比隱式便宜。在那之前,那個看起來很貴的隱式快取一直是比較省的那個——而且它本來就自動開著,你什麼都不用做。

但這裡有個更重要的限制會把這個結論再往下壓:顯式快取只活 5 分鐘。每次命中會重置成 5 分鐘,可是如果 5 分鐘內沒被打到,系統就清掉了。

把兩件事合起來看,顯式快取真正的成立條件是:同一段前綴要在 5 分鐘的滾動視窗內被打到 8 次以上,換算下來大約每 37 秒一次。這在什麼情境成立?高頻的程式碼補全、同一份長文件的密集連續問答、跑在迴圈裡的 agent。這在什麼情境不成立?一天跑幾次的批次任務、使用者零星進來的客服對話——那些場景你付了 $2.5 建立費,快取還沒被用第二次就過期了。

三個前提要講清楚(這是我的試算,不是官方保證)

❶ 假設建立那一次的費用取代該次的標準輸入費,而不是另外加收。

❷ 假設隱式快取後續每次都命中——但官方明說命中機率不保證,實際會比這張表差。

❸ 只算輸入端。輸出 $6 兩種模式都一樣,不影響比較。

要拿去做預算前,建議先用小量請求跑一次,讀回傳的 cache_creation_input_tokenscached_tokens 對帳,再放大。

順帶一提,這種「便宜的那一格其實有前置成本」的設計不是 Qwen 獨有。前幾天 Claude Fable 5.1 只降快取讀取價,我也算過同一件事——官方說省 25%,但實際上有人只省 0.6%、有人省 58%,差別全在你的快取命中結構。兩家的定價邏輯不同,但要問的問題是同一個:你到底重複用了多少?


顯式快取最容易踩的 4 個雷

如果你算完決定要開顯式,官方文件裡有四條限制值得先記起來,這幾條是我看完最容易讓人「明明開了卻沒省到」的地方:

❶ 最低 1,024 tokens 才快取得起來。不到這個長度,插了標記也沒用。而且達到 1,024 只代表「符合技術條件」,不等於保證命中。

❷ 回看窗口只有 20 個 content blocks。系統從你的 cache_control 標記往前找,最多只看 20 個內容區塊。中間隔太多就直接 miss。

❸ 單一請求最多 4 個 cache marker。超過的話只有最後 4 個生效。官方建議把標記放在穩定的位置——像 system message 或不常變的外部知識——而不是全部塞在一起。

❹ 平行工具呼叫會把回看窗口撐爆。這條最陰險。當模型一次回傳多個 tool_calls,如果你把每個工具結果各發一則 tool 訊息,content blocks 數量會暴衝,很快就超過那 20 格。官方明確建議:把連續同 role 的 tool 訊息合併成一則、內含多個 content block 再送下一輪。

第四條讓我想起自己在別的專案踩過的類似坑——工具用得越多、訊息結構越碎,看起來很乾淨,實際上把快取效率吃光了。agent 帳單暴增的原因我整理過一輪,結構性問題永遠比「模型太貴」更常見。想把工具數量本身壓下來的話,哪些情境該掛哪些 MCP server、我的實測分工在這裡——掛得少一點,回看窗口才有機會夠用。

還有兩條規則跟成本規劃有關:快取不跨帳號、也不跨模型共用,所以你在 A 模型建的快取換到 B 模型就沒了;而 Batch(檔案輸入)方式不享快取折扣——如果你原本打算用批次省錢,這兩件事要一起算。

這段你可以先做的事:把你目前最長、最常重複的那段 prompt 找出來,數一下它有沒有超過 1,024 tokens、以及它到你實際變動內容之間隔了幾個 content block。這兩個數字決定你有沒有資格談快取。


Qwen3.8-Max-0902 該不該換?我的三條分界

先給結論:在跑多工具 agent 或大型程式專案的人值得換,做單次問答的人換了感覺不到差別,而想省錢的人該調的是快取模式不是模型版本。

理由是官方自己講的升級只有三項(編碼、協作 agent、原生視覺),價格、上下文、工具生態都沒動。換句話說,這是能力更新不是規格更新——你如果沒在用那三項能力,換過去帳單一樣、體感也一樣。

你的情況 我的建議 先做什麼
在跑多工具 agent/長時程開發 值得換,這版就是為此調的 固定到 0902 快照,跑一輪你自己的任務對照
單次問答、簡單補全 不必急著換 先確認快取模式選對,那個省得比較多
要處理圖表/文件解析 值得試,原生視覺是這版重點之一 拿你最難解析的那份文件當測試題

至於跑分。第三方榜單 Arena.ai 的 CodeArena 前端編程總榜上,Qwen3.8-Max 以 1,691 分排第一,比前一版進步 22 分。但我要把後面那半句也講出來:它只比 Claude Opus 5 高 3 分。

3 分在一個以千為單位的分數上是什麼概念?大概就是「兩者沒有實質差距」的概念。這個榜單值得看的是「它終於進到第一梯隊」這個事實,不是那個第一名的位置。我不會因為 3 分去換掉整條工作流——但如果你本來就在比價,那第一梯隊裡最便宜的那個確實值得測。

拆跑分這件事我做過幾次,結論每次都很像。上次 GLM-5.3 號稱贏 Claude,我對完官方表才發現它贏的那個模型你根本買不到Kimi K3 開源那次,真正的問題也不是分數而是你跑不跑得動。榜單只回答「誰在同一個級別」,回答不了「你該不該換」。

有兩件事要提醒。第一,官方頁面沒有列 0902 的參數量,網路上流傳的 2.4T/950 億活化是上一版的數字,直接沿用要小心。第二,官方國際站的標價是 $2/$6,但不同區域之間有價差,我在上一篇實測過同一顆模型六個地區的差距——結帳前先確認你打的是哪個端點。

如果你正在做跨模型比價,站內幾篇同性質的成本拆解可以一起看:Claude API 沒漲價但帳單為什麼多三成DeepSeek V4-Pro 換算成每題成本後其實不划算Grok 4.6 那道 200K 的價格斷崖Gemini 3.7 Flash 換過去反而可能壞掉的那份遷移清單。都是同一種算法,換不同的對象。


FAQ 常見問題

Qwen3.8-Max-0902 的顯式快取和隱式快取,我到底該用哪一個?

看你同一段前綴會在 5 分鐘內重複用幾次。用不到約 8 次,隱式比較省,而且它自動開著、你什麼都不用做;超過 8 次而且頻率夠密(大約每 37 秒一次以上),顯式才划算。另外要注意兩者在 Chat Completions、DashScope、Anthropic 相容 API 下是互斥的,不能兩個都要。

隱式快取可以關掉嗎?

不行。官方 FAQ 明寫所有支援的模型都會自動啟用且無法停用,理由是它不影響輸出品質、命中時還能降成本與延遲。所以「我沒設定快取所以沒省到」這個假設是錯的——你可能一直都有省到,只是沒去看回傳裡的 cached_tokens

0902 和不帶日期的 qwen3.8-max 有什麼差?

0902 是快照版本,行為被固定在那個時間點;不帶日期的別名會隨官方更新滾動。要穩定性就固定快照,要自動吃到新能力就用別名。我自己的習慣是:正式產品固定快照,實驗環境用別名,這樣模型換版時不會在半夜給你驚喜。

Qwen3.8-Max-0902 的 1M 上下文可以整包塞滿嗎?

不行。官方規格寫的是最大輸入 991K、最大輸出 131K;開 thinking 模式後最大輸入再降到 983K,而推理本身最多可用 262K。1M 是上下文視窗總量,不是你能塞的輸入量。要把整份大型專案丟進去之前,先把這幾個數字加一加。

我算出來的快取成本和實際帳單對不上,可能是哪裡錯了?

最常見的三個原因:一是套用了通則比例(10%/20%)而不是這個模型的實際金額,官方文件明文列了 qwen3.8-max 是例外;二是顯式快取在 5 分鐘內沒被命中就過期,你付了建立費卻沒省到;三是回傳的 input_tokens 本來就不等於建立加命中的總和——官方說明後端會在提示後面附加少於 10 個 token,那些不計入快取。


結論:先選對快取模式,再談要不要換版本

這一輪更新裡,我覺得最容易被忽略、但最省錢的決定不是「要不要換到 0902」,而是「你在用哪一種快取」。換版本頂多讓某些任務做得更好,選錯快取模式卻是每一次呼叫都在多付。

而那個 $0.17 的數字之所以值得警惕,不是因為它假,是因為它只講了故事的後半段。前半段是 $2.5 的建立費和 5 分鐘的保鮮期,兩件事加起來就決定了它只適合高頻重複的場景。

我自己現在看任何 AI 服務的定價頁,都會多做一個動作:把最便宜的那一格找出來,然後去找它的前置條件。免費的、超便宜的那一格,前面幾乎都有一道門檻——可能是建立費、可能是有效期、可能是命中率不保證。把門檻找出來,那個數字才有意義。

如果你喜歡這種「把官方定價頁算成回本次數」的做法,歡迎訂閱我的部落格,會不定期收到信。下一家調價的時候,我們可以一起再算一次。


參考資料

 

延伸閱讀