Qwen3.8-Max 開源是真的嗎?放出來的那版沒有視覺、只有 256K

目錄

💡 核心結論速覽 (TL;DR)

  • Qwen3.8-Max 開源的不是那一版:2.4 兆權重是純文字、上下文 262,144、自訂授權。
  • 真 Apache 的是 27B:原生看圖看片,FP8 僅 30.9 GB,下載量是旗艦 12.6 倍。
  • 權重體積:官方檔案加總 BF16 版 4,892.4 GB,光放就要 57 張 H100。
  • 先做這件事:API 端點從新加坡換到香港,$2 降到 $1.65,省 17.5%。

阿里說 Qwen3.8-Max 是第一次把 Max 級模型的權重放出來,這句話是真的。但我點進官方模型卡想確認規格,第一行就跟我看過的所有中文報導對不上。

先把結論放在前面:放出來的那一版是純文字模型,原生上下文只有 262,144 個 token,授權也不是 Apache-2.0,而是一份自訂的 Qwen3.8-Max License。

真正掛 Apache-2.0、而且原生就看得懂圖片與影片的,是同期發的 Qwen3.8-27B——體積只有旗艦的百分之一。

我每天用 AI 的時間超過 10 小時,手上同時養著幾家月費不便宜的付費方案。每次有新旗艦出來,我第一件事從來不是看跑分圖,是去翻官方模型卡跟價目頁。

原因很現實:新聞稿最愛寫的那句「比肩某某」,通常在官方自己貼出來的那張表裡就被打臉了。這次也一樣。

所以這篇我想把五件事講清楚:開源的到底是哪一版、權重實際多大、授權能不能拿去做產品、在台灣連不連得上、以及同樣一顆模型為什麼六個地區價格不一樣。


Qwen3.8-Max 的 2.4 兆參數是什麼概念?每個 token 其實只用 950 億

Qwen3.8-Max 的總參數量是 2.4 兆(2.4T),但每處理一個 token 實際只啟用 950 億(95B)參數。這兩個數字差了 25 倍以上,理解錯了整篇規格都會歪掉。

這是稀疏混合專家(MoE)架構的典型設計。官方模型卡寫得很清楚:92 層、hidden size 8192、總共 512 個專家,每次只叫醒其中 10 個路由專家加 1 個共享專家。

我自己是這樣理解的:想像一間有 512 個顧問的事務所,你每問一個問題,櫃檯只把最對口的 10 個人叫進會議室,其他 501 個繼續坐在位子上。付薪水的人數沒變,但每場會議的成本只有那 11 個人。

注意力機制也是混搭的。官方列出 Gated DeltaNet(V 128 頭、QK 16 頭)與 Gated Attention(Q 64 頭、KV 4 頭)並用,另外帶 MTP,詞表 248,320。

🚨 這裡有個中文圈已經傳開的錯誤:不少簡中來源把「95B 啟用參數」寫成「激活約 95 億」。官方原文是 95B,也就是 950 億,差了整整 10 倍。看到寫 95 億的那些文章,後面的推論可以直接不用看了。

對讀者實際有意義的一句話是:2.4 兆是「總薪資成本」,950 億才是「單次推論的算力成本」。前者決定你自架時要準備多少顯示記憶體,後者決定跑起來快不快。

同樣是兆級參數的中國模型,我先前算過 Kimi K3 那 2.8 兆權重的自架帳單,那次的結論是「開源了但你放不下」。這次的數字待會兒會告訴你,Qwen 這邊只是換了一個位數。

這段你可以帶走的判斷:看到 MoE 模型的參數量,先問「總參數」還是「啟用參數」;只講一個數字的報導,多半沒看過模型卡。


Qwen3.8-Max 開源的那一版跟 API 版差在哪?沒有視覺,上下文也不是 1M

Qwen3.8-Max 的開放權重與 API 版是兩個規格不同的東西,這是整題最大的誤導點。官方模型卡自己用一句英文寫死:Max 版才有視覺輸入、非思考模式、預設 1M 上下文與官方內建工具。

換句話說,你從 Hugging Face 下載回來的那包權重,看不懂圖片。它的 pipeline 標籤是 text-generation,模型標籤是 qwen3_5_moe_text,純文字生成。

上下文也一樣。開放權重的原生長度是 262,144 個 token,官方寫明「可外推至 1,010,000」——外推是技術手段,不是預設值。而 Max API 版是預設就給 1M。

我把兩邊逐條對過,整理成這張表:

項目 開放權重 Qwen3.8-2.4T-A95B Qwen3.8-Max API 版
輸入模態 純文字 文字+圖片(影片兩份官方文件說法不一)
原生上下文 262,144 token 預設 1,000,000 token
可延伸上限 外推至 1,010,000 token 輸入上限 991K(思考模式 983K)
非思考模式
官方內建工具
授權 自訂 Qwen3.8-Max License 依服務條款計費使用

API 版還有幾個平常沒人寫、但真的會卡到你的上限:單次輸出最多 131K token、推理過程最多 262K token、每分鐘 200 萬 token(TPM)與 15,000 次請求(RPM)。

這些數字我是從 QwenCloud 官方模型頁逐格抄下來的。媒體一律只寫「支援 100 萬 token」,那只是 context 欄位,不是你實際能塞進去的量。

另外有一個官方自己打架的地方,我覺得該講:QwenCloud 模型頁的 Input 欄位列了 Image / Text / Video 三種,但官方 blog 附的 Codex 設定檔卻寫 input_modalities 只有 text 與 image。

同一家公司的兩份官方文件,對「能不能吃影片」給了不同答案。如果你的專案要靠影片理解,這件事一定要先寫信問清楚,不要照著新聞稿排時程。

下一步可做:真的要用視覺功能,就走 API 版;只是要一顆能離線跑的模型,下載回來的那包不會給你視覺,別浪費頻寬。


真正 Apache 授權的是誰?Qwen3.8-27B 的下載數是旗艦的十二倍

Qwen3.8 系列裡真正掛 apache-2.0 授權的是 Qwen3.8-27B,不是那包 2.4 兆參數的旗艦開放權重。Qwen3.8-27B 的 pipeline 標籤是 image-text-to-text,官方 README 直接寫它是「原生視覺語言模型,看得懂圖片與影片」。

整件事就變得很諷刺:所有中文報導都寫「阿里開源多模態旗艦」,但多模態的那顆是 27B,旗艦那顆反而是純文字。

體積差距更誇張。Qwen3.8-27B 的 BF16 版是 55.6 GB、FP8 版 30.9 GB,倉庫建立於 2026-08-05。旗艦那邊的數字待會兒你會看到,是四位數起跳的 GB。

最有說服力的證據其實不是規格,是下載數。我在 2026-08-16 抓了 Hugging Face 的官方 API,四個倉庫的數字長這樣:

先講清楚一個容易被誤引的細節:HF API 的 downloads 欄位算的是近 30 天,不是歷史總量。不過這四個倉庫都是 2026 年 8 月才建立的,所以現階段這個數字等同於至今的總下載量。

Qwen3.8-2.4T-A95B(BF16):6,381 次

Qwen3.8-2.4T-A95B-FP8:10,745 次

Qwen3.8-27B:91,917 次

Qwen3.8-27B-FP8:123,157 次

兩邊各自加總:27B 兩版共 215,074 次,旗艦兩版共 17,126 次。相除是 12.56——27B 的下載量是旗艦的 12.6 倍

老實說我看到這組數字時笑了一下。「首次開源 Max 級模型」是真的,「幾乎沒有人下載得動」也是真的,這兩件事同時成立。

市場其實早就用腳投票完了。真正被抱回家跑的是那顆 30 GB 的小模型,不是那包快 5 TB 的旗艦。

這段你可以帶走的判斷:看到「某某開源」的新聞,先去 Hugging Face 看下載數。下載數是最誠實的指標,它不會幫任何人寫新聞稿。


Qwen3.8-Max 的自訂授權會不會擋到我商用?兩條營收門檻換算成台幣

Qwen3.8-Max License 對絕大多數團隊來說不會擋到商用,但它確實不是 Apache-2.0,條文裡有兩條營收門檻。我把授權原文逐條讀完,重點只有這兩件事。

第一條門檻:如果你的產品月活躍使用者超過 1 億,或月營收超過 US$2,000 萬,你必須在介面顯著位置標示所使用的模型名稱。

第二條門檻:如果你經營 MaaS(模型即服務),或做「AI Work Assistant」這類 AI 輔助寫程式/辦公生產力產品,且連續 12 個月合計營收超過 US$5,000 萬,商用前必須另外向 Qwen 取得授權。

純內部使用、不對第三方開放的情況,第二條不適用。官方也留了聯絡窗口在授權文件裡(model-business 開頭的信箱)。

「AI Work Assistant」的定義授權原文也寫死了,而且明列三種不算的情況:單一用途的 AI 工具(原文舉的例子是 AI 翻譯)、主戰場不在寫程式或辦公生產力的領域型助理、以及只是某個非 AI 產品裡的一項功能。

所以做 AI 客服、AI 選品或 AI 記帳的團隊,即使營收破了門檻,第二條也落不到你頭上。條文舉的正例是 Qoder 與 QwenWork 這種產品本身就是 AI 寫程式/辦公助手的類型。

我用 1 美元約 30 元新台幣試算一下,好讓門檻有體感:US$2,000 萬約等於月營收 6 億新台幣;US$5,000 萬約等於連續 12 個月合計 15 億新台幣。這個匯率只是抓個整數方便對照,實際換算請以當日匯率為準。

所以我的判斷是這樣:如果你的公司月營收沒有 6 億台幣、也沒在賣 AI 寫程式助手,這份「非 Apache」授權在商用上跟 Apache 沒有實際差別。

網路上很多人只喊一句「不是真開源」就結束了,但沒人把門檻翻成看得懂的數字。門檻在哪,決定的是這句話對你成不成立。

順帶一提,媒體傳的「新的分潤授權」我沒有在原文裡找到——條文裡沒有任何分潤條款,只有上面那兩條。這種轉述錯誤在中國模型的報導裡出現頻率非常高。

真的要把它放進公司產品之前,我會先確認的不是授權,是資料流向與合規流程。這一塊我在中國開源模型進公司前該先問哪幾個資安問題那篇裡整理過一份可以直接丟給法務的清單。

下一步可做:把授權原文那兩段截圖存下來,加上你公司的年營收數字,一頁就能回答法務的問題。


Qwen3.8-Max 的權重到底多大?我把官方檔案清單加總出 4,892 GB

Qwen3.8-Max 開放權重的 BF16 版總共 4,892.4 GB,FP8 版 2,496.1 GB。這不是估算,是我把 Hugging Face 官方 API 回傳的檔案清單一個一個加起來的結果。

BF16 版由 213 個 safetensors 檔組成,位元組總和是 4,892,365,649,336 bytes。換成 GiB 是 4,556.4 GiB;FP8 版是 2,496.1 GB,也就是 2,324.7 GiB。

接下來這個算式,你可以自己按計算機驗:以單張 H100 80GB 為單位,4,556.4 ÷ 80 = 56.96,也就是光放權重就要 57 張卡

但實務上不會剛好湊到 57 張。GPU 節點通常是 8 卡一台,你得開 8 台、共 64 張,而且這還只是「放得下」,沒算 KV cache、沒算並行框架的額外開銷。

FP8 版好一點:2,324.7 ÷ 80 = 29.06,最少 30 張 H100。要湊整節點一樣是 32 張起跳。

對照組是 27B 的 FP8:30.9 GB,一張 40 GB 以上的卡就放得下。差距是 80 倍等級的,不是「多買幾張」能跨過去的門檻。

這裡補一句免得誤會:30.9 GB 指的是權重本身,24 GB 的消費級顯卡放不下 FP8 全量,還得再留 KV cache 的空間。Qwen 官方組織下只發了 BF16 與 FP8 兩種精度,網路上流傳的 4-bit 版本是社群量化的產物,不是官方發布的。

我先前算 2.8 兆參數到底要幾張卡才塞得下那次,結論是「開源給你了但你架不起來」。Qwen 這邊只是把 2.8 兆換成 2.4 兆,結論一模一樣。

所以「首次開源 Max 級旗艦」這句話,實際能受惠的對象是雲端服務商與少數研究機構,不是你我這種在自己機器上跑模型的人。

如果你正在評估要不要為了跑大模型去租一整櫃卡,我建議先看過GPU 到底該租還是該買的判斷順序,那篇把折舊、閒置率、電費都算進去了。

下一步可做:把你手上能動用的顯示記憶體總量除以 80,得到卡數,再跟上面兩個數字對一下,30 秒就知道自己在哪一段。


台灣連得上 Qwen3.8-Max 嗎?我開了網頁版,介面直接是繁體中文

Qwen3.8-Max 的網頁版在台灣連得上,而且介面自動吐繁體中文。我直接開了 Qwen Studio 網頁版,畫面上是「登入/註冊」跟「有什麼可以幫你的嗎?」,模型選擇器預設就停在 Qwen3.8-Max。

這點我覺得挺意外的。多數人的預設印象是「大陸 AI 服務在台灣一定要翻牆或要大陸手機號」,至少在載入頁面這一關,這裡不成立。

而且這不是瀏覽器自動翻譯的結果:頁面 HTML 的 lang 屬性直接就寫著 zh-TW,分頁標題是 Qwen Studio,模型名稱那一格印的就是 Qwen3.8-Max。

我另外用 curl 看了 QwenCloud 的回應標頭,via 欄位帶著 ens-cache 開頭、tw8 結尾的節點名稱——代表流量是走阿里 ESA 邊緣節點在台灣落地的,不是繞一大圈回大陸。

但「打得開」不等於「用得了」。要真的發問還是得登入或註冊,而註冊門檻才是多數人真正卡住的地方。

這一段我不重複寫流程,千問、豆包、Kimi 三個登入頁的註冊門檻差在哪那篇我已經把三家的登入頁逐個開過一次,包含手機號、信箱與第三方登入的支援差異。

免費額度這邊有個很容易踩的坑,兩個 console 是各自為政的。中國站寫明「僅在華北 2(北京)地域有免費額度」,國際站則寫「免費額度僅限新加坡」。

額度本身是 100 萬 token,有效期是自開通、模型發布或申請通過起算 90 天。你在錯的地域開通,會發現額度根本不會出現。

如果你是第一次接觸大陸的 AI 服務,我會建議先把資料流向這件事想清楚再開帳號。第一次用大陸 AI 服務最該注意的資料流向那篇裡有我整理的判斷順序,比「能不能連上」重要得多。

下一步可做:先用網頁版免登入的頁面確認你的網路連得上,再決定要不要花時間處理註冊,順序反過來會浪費一個晚上。


Qwen3.8-Max 同一顆模型六個地區價差 21%,台港預設走的正是最貴那條

Qwen3.8-Max 的 API 價格會因為部署地區不同而差 21.2%,同一個 model id、同一顆模型。這是我把國際站價目頁六個地區分頁逐個切過去撈出來的,全網中英日文都沒人寫。

部署地區 輸入(US$/百萬 token) 輸出(US$/百萬 token)
新加坡 2 6
中國(北京) 1.65 4.951
香港 1.65 4.951
德國(法蘭克福) 1.65 4.951
美國(維吉尼亞) 1.65 4.951
日本(東京) 1.65 4.951

算式很單純,你可以自己驗:2 ÷ 1.65 = 1.2121,6 ÷ 4.951 = 1.2119。輸入與輸出都正好貴 21.2%,不是四捨五入湊出來的巧合。

反過來算省下多少:1 −(1.65 ÷ 2)= 0.175,也就是從新加坡換到香港立省 17.5%。北京站的公告價是人民幣 12 元與 36 元,換算過去也是同一組數字。

刺人的地方在這裡:QwenCloud 模型頁上那段官方範例程式,base_url 一律寫 dashscope-intl.aliyuncs.com,而那正是新加坡端點——照著官方教學貼上去,你預設就走最貴的那一條

我用一組假設試算給你看差多少。假設每天輸入 100 萬 token、輸出 20 萬 token,跑滿 30 天,等於 3,000 萬輸入加 600 萬輸出:

新加坡端點:30 × 2 + 6 × 6 = 60 + 36 = US$96

香港端點:30 × 1.65 + 6 × 4.951 = 49.5 + 29.7 = US$79.2

一個月差 16.8 美元,看起來不多,年化就是 200 美元。這筆錢不是靠優化 prompt 省下來的,是換一個部署地域就有——我自己在看 SaaS 訂閱帳單時,最恨的就是這種白白多付的。

香港地域實際上要怎麼切?官方的存取網域對照表

Qwen3.8-Max 要改走香港地域,不是把網址字串改掉就好。正規做法是先到阿里雲百煉的工作空間管理頁,建立一個香港地域的工作空間、選定服務部署範圍,再把程式裡的 API Host 換成該工作空間的網域。

官方的存取網域文件把六個地域列得很清楚,我整理成這張表:

部署地域 地域 ID 工作空間專屬網域 舊版 DashScope 網域
中國(北京) cn-beijing {WorkspaceId}.cn-beijing.maas.aliyuncs.com dashscope.aliyuncs.com
新加坡 ap-southeast-1 {WorkspaceId}.ap-southeast-1.maas.aliyuncs.com dashscope-intl.aliyuncs.com
中國(香港) cn-hongkong {WorkspaceId}.cn-hongkong.maas.aliyuncs.com cn-hongkong.dashscope.aliyuncs.com
德國(法蘭克福) eu-central-1 {WorkspaceId}.eu-central-1.maas.aliyuncs.com 不支援
日本(東京) ap-northeast-1 {WorkspaceId}.ap-northeast-1.maas.aliyuncs.com 不支援
美國(維吉尼亞) us-east-1 {WorkspaceId}.us-east-1.maas.aliyuncs.com 不支援

這張表最實用的一格是香港:它是除了北京與新加坡以外,唯一還留著舊版 DashScope 網域的地域。既有專案想搬過去,把 dashscope-intl.aliyuncs.com 換成 cn-hongkong.dashscope.aliyuncs.com 就是最短路徑。

法蘭克福、東京與維吉尼亞沒有舊版網域可用,只能走 {WorkspaceId} 開頭的專屬網域。維吉尼亞還多一個規則:模型名稱要加 -us 後綴,不加會被導回 Global 範圍。

官方也直說專屬網域才是建議用在正式環境的那一條——請求逾時上限 3,600 秒,舊版 DashScope 網域只有 600 秒。長任務跑到一半被切斷,多半就是卡在這個差別。

換代反而變貴:3.7 到 3.8 這一步帳單會翻倍

這件事媒體一律寫成「新旗艦定價與上一代持平」,但那是只看原價沒看實付價。上一代 qwen3.7-max 現在正掛著限時 5 折——我對照官方價目頁的當下仍在檔期,但官方沒有公告結束日,你看到這篇時可能已經恢復原價,務必自己回頁面確認一次。

中國站的公告價是原價 12 元與 36 元、限時 5 折,實付人民幣 6 元與 18 元。新旗艦沒有折扣,實付就是 12 元與 36 元——同樣用量,帳單直接翻 2 倍

國際站也一樣,只是倍數不同。新加坡的 qwen3.7-max 標價 US$2.5/$7.5、限時 5 折後是 $1.25/$3.75;換成 3.8-max 的 $2/$6,等於 2 ÷ 1.25 = 1.6 倍。

不過「翻幾倍」還得看你在哪個地域。香港、法蘭克福、東京與維吉尼亞這四個 Global 地域的 qwen3.7-max 掛的不是單純 5 折,而是「夜間 2 折、日間 5 折」

換算下來,在這四個地域從 3.7-max 換到 3.8-max,日間帳單是 2 倍,夜間直接變 5 倍

這裡先埋一個伏筆:按量付費的價目表上確實有「夜間折扣」這種東西,但它掛在 qwen3.7-max 那一列,qwen3.8-max 那一列是空的。下一段就是在講這件事。

限時折扣是有期限的,這種價格我從來不當成長期成本來規劃。前陣子 DeepSeek 那次漲價我逐格算完的帳單變化就是活生生的例子,優惠結束那天帳單長什麼樣,最好現在就先算一次。

「夜間 5 折」到底在講哪一個方案

Qwen3.8-Max 的夜間 5 折只存在於 Token Plan 的個人版 Credits,不是 API token 單價,也不是團隊版有的東西。這點我覺得非講不可,因為現在中文站幾乎都拿它當賣點。

官方頁寫得很清楚:個人版在 22:00–08:00(UTC+8)之間 Credits 消耗打 5 折;團隊版的夜間折扣只給另一顆模型,不含 qwen3.8-max。按量付費的價目頁上,qwen3.8-max 根本沒有夜間折扣這一欄。

另外那個被到處引用的「夜間 0.2 折/日間 1 折」,適用對象是 Qwen3.8-Max-Preview 在 Qoder 上的 Credits 倍率,活動從 2026-07-19 起跑、到 2026-08-03 上午 10:00 結束,官方頁標題現在已經標著「已結束」。

還有一個時區陷阱,海外華人特別容易中。22:00–08:00 是 UTC+8——台港澳與大陸不用換算,但在美西(UTC-7)等於當地早上 7 點到下午 5 點,正好是上班時間;在英國夏令時則是下午 3 點到凌晨 1 點。

照著「晚上跑比較便宜」操作的人,如果人在美國,會整批打在最貴的時段上。

「比 Claude 便宜 5-8 倍」是拿誰來比

那句話是拿最頂階的 Claude Fable 5 來比的。Anthropic 官方模型總覽的每百萬 token 價格是:Fable 5 US$10/$50、Opus 5 US$5/$25、Sonnet 5 US$2/$10、Haiku 4.5 US$1/$5。

用同一組假設(3,000 萬輸入+600 萬輸出)算下來,Fable 5 是 30 × 10 + 6 × 50 = US$600。拿去除新加坡端點的 $96,正好是 6.25 倍,「5-8 倍」就是這樣來的。

但真正該比的對象不是 Fable 5。Sonnet 5 的算法是 30 × 2 + 6 × 10 = US$120——而 Qwen3.8-Max 新加坡端點的輸入單價 $2,跟 Sonnet 5 完全一樣貴,只有輸出便宜 40%。

走香港端點的話 $79.2 對上 $120,便宜 34%,這才是一個誠實的比法。至於 Opus 5 的 30 × 5 + 6 × 25 = US$300,差距是 3.8 倍左右,也不是坊間喊的那個數字。

我同時付著兩家高階方案,所以對這種比價法特別敏感:拿別人的旗艦比自己的旗艦,數字最好看,但那不是你實際會拿來替換的那一顆。

想看更完整的跨品牌對照,把五家旗艦模型放在同一張表上比那篇有整理過各家的定位差異。

下一步可做:打開你現在的 base_url 設定,看結尾是不是 dashscope-intl;是的話,先確認能不能換到香港地域,這是最快的一筆省錢。


Qwen3.8-Max 跑不動又想用大模型:托管、租卡與模型路由怎麼挑

跑不動 Qwen3.8-Max 這種兆級開放權重、又需要大模型能力的人,可行的路只有三條:托管推理 API、模型路由、純租 GPU。三條路的成本結構完全不同,選錯會多付好幾倍。

托管推理 API:別人幫你把開源模型架好,你按 token 付費,不碰硬體。Together AIFireworks AINovita AI 都屬於這一類。

模型路由:一個 API key 打到幾十家供應商,同一顆模型自動挑最便宜或最快的那家。OpenRouter 是這一類裡最常被拿來當預設的。

純租 GPU:你自己裝環境、自己管權重,按小時計費。RunPodVast.ai 是這一類的常見選擇。

我自己的判斷順序很簡單,先問一個問題:你需要的是「這顆模型的輸出」,還是「這顆模型跑在你自己的機器上」

只要答案是前者,托管 API 或路由服務永遠划算——你不用扛折舊、不用扛閒置、不用扛半夜卡掛掉的維運。這也是我看多數團隊算完之後的實際選擇。

答案是後者的話,才輪到租卡,而且通常是因為資料不能出公司內網,不是因為便宜。租卡的隱藏成本是工程人力,這一項最常被漏算。

但有件事要先講清楚:這三條路裡,只有租卡那條真的能跑 2.4 兆的那包權重,而且要 30 張卡起跳。托管與路由服務上你買到的是他們部署好的版本,通常也不是 BF16 全精度。

如果你的需求其實只是「有一顆便宜好用的模型可以打」,我會建議乾脆放棄自架的念頭。我帶團隊算完才發現多數公司其實不用租 GPU 的那筆帳那篇裡的結論到今天還是成立的。

預算完全還沒到位的人也不用急。先從免費額度就夠用的 AI 工具開始試,等你真的被額度卡住了,再回來看這一段的三條路。

下一步可做:先在路由服務上跑一週真實流量,拿到實際 token 消耗量,再拿那個數字去比托管與租卡,比憑感覺估準得多。


Qwen3.8-Max 官方跑分表自己說了什麼?強在照著做,不在更聰明

Qwen3.8-Max 在阿里官方 blog 與 Hugging Face 模型卡刊出的同一張跑分表裡,並沒有全面領先 Claude 與 GPT。這是我覺得最有意思的部分——不用找第三方評測,用官方的表就能拆穿官方的新聞稿。

下面這幾列是官方 blog 與 Hugging Face 模型卡上完全相同的數字(雙源一致):

測試項目 Qwen3.8-Max Claude Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86.6 84.6 88.8
SWE-bench Pro 67.7 80.0 64.6
FrontierSWE 73.5 88.8
GPQA Diamond 92.6 92.6 94.1
HLE 43.6 53.3 47.2

Claude Opus 4.8 的對應數字我放在文字裡,免得表格擠爆:Terminal Bench 84.6、SWE-bench Pro 69.2、FrontierSWE 70.0、GPQA Diamond 92.0、HLE 45.7。

看出來了嗎?Qwen3.8-Max 的 SWE-bench Pro 只有 67.7,輸給 Fable 5 的 80.0;FrontierSWE 的 73.5 也輸給 88.8。

Terminal Bench 2.1 的 86.6 輸給 GPT-5.6 Sol 的 88.8;DeepSWE 1.1 的 56.6 則同時輸給 Fable 5 的 70.0 與 Opus 4.8 的 59.0。

而 HLE 這一項的 43.6,是四家裡最低的(Opus 4.8 45.7、Fable 5 53.3、GPT-5.6 Sol 47.2)。HLE 考的是知識密集型推理,這個反差我到現在還沒看到有人寫。

那它強在哪?官方表裡拿第一的是 PaperBench 93.0 與 IFBench 82.8,另外 MRCR v2 在 256K 長度下有 92.9。

把這三項翻成人話:PaperBench 是「照著論文把實驗復現出來」,IFBench 是「指令遵循」,MRCR 是「長文裡找得到東西」

所以我的判斷是——這顆模型強在「照著做」,不在「更聰明」。你給它一份規格明確的長任務,它會執行得很穩;你要它在知識邊界上想出新東西,它是四家裡最弱的。

順帶一提,長文這塊也不是全贏:LongBench v2 的 66.3 輸給 Opus 4.8 的 69.1。

官方自報的長任務案例,我去 GitHub 對了一次

官方說它讓 AI 全自主運行約 16 天,從零建出一個叫 oh-my-cli 的專案,截至 2026-07-30 累積 265 commits、127 PRs、151 issues。

這種自報數據我一律會去找可獨立驗證的痕跡。我拿 GitHub API 查了 qwen-code-dev-bot/oh-my-cli:專案確實存在,建立時間 2026-07-13,到 7/30 剛好 17 天,跟「約 16 天」對得上。

目前這個倉庫用 TypeScript 寫成,最後一次 push 是 2026-08-12,累積 770 顆星、72 個 fork,預設分支的 commit 數已經到 841。

但有一個細節要修正媒體的說法:倉庫自述是「a minimal autonomous code-agent CLI」,它是一個命令列工具,不是很多報導寫的「Agent 框架」。

官方另外還自報了幾組長程任務數據,包含連續約 125 小時、約 7,600 行程式碼、33 輪 GPU 訓練的論文復現,以及一場 24 小時內提交 45 次、把準確率從 0.60 拉到 0.853 的比賽紀錄。

這些我沒有辦法獨立驗證,所以請一律當成官方自測數據看待,不要當客觀事實引用。這是我讀所有模型發布稿的預設立場。

還有一件跟工具鏈有關的事值得知道:官方文件確實教你把 ANTHROPIC_MODEL 設成 qwen3.8-max、把 base URL 換掉,就能直接接 Claude Code。想這樣做之前,我會先看過把 Claude Code 後端換成別家模型會不會被封號那篇,問題其實不在模型,在憑證。

下一步可做:把你手上最常跑的那類任務,對照 PaperBench/IFBench 這一組還是 HLE 那一組,就知道換過去會變好還是變差。


如果是我會怎麼選?Qwen3.8-Max、27B 與托管服務的三條路

選 Qwen3.8-Max 的 API、下載 Qwen3.8-27B 的開放權重、還是走托管服務,取捨點在於你要的是模型的輸出,還是模型跑在自己的機器上。以下是我把整篇結論收成的判斷順序,照著往下走大概三分鐘就有答案。

只想要輸出、不在意跑在哪:直接打 Qwen3.8-Max API,但把端點從新加坡換到香港,同樣用量省 17.5%。

想在自己機器上跑:放棄 2.4 兆那包,抓 Qwen3.8-27B 的 FP8 版,30.9 GB,單卡就動得起來,而且授權是 Apache-2.0。

要視覺功能:開放權重的旗艦沒有視覺,你只有兩個選擇——走 Max API 版,或用原生看得懂圖片與影片的 27B。

沒有卡又想跑大模型:走托管推理或模型路由,不要為了一顆模型去開 8 台 GPU 節點。

我認為適合換過去的人:任務是長流程、規格明確、需要穩定執行的(自動化腳本、資料處理、文件轉換),而且輸出量大到讓輸出單價變成主要成本。

我認為先別動的人:吃知識密集推理、需要模型自己想出解法的(研究、複雜除錯、策略推演)。HLE 那個 43.6 就是給你的訊號。

預算怎麼抓:先用免費額度的 100 萬 token 跑一輪你的真實任務,記下實際消耗,再乘上香港端點的單價,就是你的月成本下限。

老實說,我對這顆模型最有感的不是跑分,是那個 12.6 倍的下載數落差。它提醒我一件事:開源這兩個字,重點從來不在放不放,而在放出來的東西你架不架得起來

如果你還在盤點主力模型要押哪一家,同一組任務丟給五家旗艦跑出來的差異那篇會比單看一家有用。

喜歡這種把官方頁一格一格撈出來對帳的內容,可以訂閱夜羽凌的部落格,之後有新的查證結果會不定期收到信。


FAQ 常見問題

Qwen3.8-Max 和 Qwen3.8-27B 我該下載哪一個?

絕大多數情況都是 27B。旗艦的開放權重 BF16 版 4,892.4 GB、FP8 版 2,496.1 GB,最少要 30 張 H100 80GB;27B 的 FP8 只有 30.9 GB,單卡就能跑。

而且 27B 是 apache-2.0 授權,還原生看得懂圖片與影片,旗艦的開放權重反而是純文字。除非你在做大模型基礎研究,否則我想不到下載旗艦的理由。

拿 Qwen3.8-Max 的開放權重做商用產品會不會被告?

授權原文只有兩條門檻。月活破 1 億或月營收破 US$2,000 萬(以 1 美元 30 元台幣試算約 6 億台幣)要在介面標示模型名稱;做 MaaS 或 AI 寫程式/辦公助手類產品且連續 12 個月營收破 US$5,000 萬(約 15 億台幣)要另外取得授權。

純內部使用不對外開放的情況,第二條不適用。中小型團隊實務上兩條都不會觸發,但正式簽約前還是請法務讀一次授權原文。

用 Qwen3.8-Max 跟繼續用 Claude 比,哪個划算?

要看你的輸出量。以每天 100 萬輸入、20 萬輸出、跑 30 天試算,Qwen3.8-Max 香港端點是 US$79.2、新加坡端點 US$96,Claude Sonnet 5 是 US$120、Opus 5 是 US$300、Fable 5 是 US$600。

但輸入單價上,Qwen3.8-Max 新加坡端點的 $2 跟 Sonnet 5 完全一樣。所以「便宜 5-8 倍」只在跟 Fable 5 比時成立,跟同級的 Sonnet 5 比只有輸出端便宜。

「夜間 5 折」我能不能用?

只有 Token Plan 個人版的 Credits 才有,時段是 22:00–08:00(UTC+8),團隊版與按量付費都沒有。如果你是直接打 API 按 token 計費,這個折扣跟你無關。

另外那個「夜間 0.2 折」是給 Preview 版在 Qoder 上的 Credits 倍率,活動 2026-08-03 上午 10:00 就結束了,官方頁已經標示已結束。

Qwen3.8-Max 要怎麼換到比較便宜的香港地域?

正規做法是先在阿里雲百煉的工作空間管理頁建立一個「中國(香港)」地域的工作空間、選定服務部署範圍,再把程式裡的 API Host 換成該工作空間的專屬網域,格式是 {WorkspaceId}.cn-hongkong.maas.aliyuncs.com。

既有專案想搬,最短路徑是改用舊版網域:把 dashscope-intl.aliyuncs.com(新加坡,$2/$6)換成 cn-hongkong.dashscope.aliyuncs.com(香港,$1.65/$4.951)。法蘭克福、東京與維吉尼亞沒有舊版網域,只能走專屬網域。

在台灣用 Qwen3.8-Max 需要大陸手機號嗎?

網頁版在台灣打得開、介面是繁體中文、模型選擇器預設就是 Qwen3.8-Max,但要發問仍須登入或註冊。註冊門檻各家不同,這部分我在註冊時卡在手機號那一關的解法裡整理過。

API 這邊還有一個地域坑:免費額度中國站只給華北 2(北京)、國際站只給新加坡,開在錯的地域會領不到。真的要開帳號之前,大陸 AI 工具安不安全的完整判斷清單建議先看一遍。


參考資料

 

延伸閱讀