💡 核心結論速覽 (TL;DR)
- 綜合最強:Claude Fable 5——獨立指數 60 分、SWE-Bench Pro 約 80%(8/6 更新:獨立指數榜首已由 7/24 上市的自家 Opus 5 以 61 分接走,以官網當下數據為準),但 API 每百萬 tokens $10/$50 是五家最貴,訂閱端 7/13 起改制、7/20 再定案:Pro 走「額外使用量」按量計費,Max 與 Team Premium 則是方案內含(上限為常規週額度的 50%)
- 省錢黑馬:Grok 4.5——$2/$6 比 Fable 便宜超過 6 成、token 效率高 4.2 倍,但連 xAI 自家發佈頁的 5 項跑分,也有 4 項輸給 Fable 5
- 多數人最該看:GPT-5.6 Terra——用 GPT-5.5 一半的價格拿到貼近旗艦的表現;Gemini 3.5 Pro 官方一再延期還沒出,先別為它按兵不動
- 半路殺出的第五家:Kimi K3(7/16)在 Arena 前端盲測拿下第 1、領先 Fable 5 約 48 Elo,但綜合對話只排第 9——它強得很偏食,只值得前端與 agent 工作流的人加測
- 下一步:趁 Grok Build 限時免費先試 Grok 4.5;$20 訂閱黨先不搬家,等 Gemini 3.5 Pro 揭曉再重新洗牌一次
一週之內,四大 AI 旗艦全部到齊;再過一週,又殺出第五個——這是我做 AI 模型比較這麼久以來,最擁擠的一次改朝換代。
直接給答案:要最強大腦選 Claude Fable 5,要 CP 值選 Grok 4.5,要均衡與生態選 GPT-5.6,Gemini 3.5 是「Flash 先用、Pro 再等等」,而純做前端或長流程 agent 才輪得到後來殺出的 Kimi K3。這幾句話後面的代價和陷阱,才是這篇要講的重點。
老實說,7 月這一週我過得有點狼狽。7/8 Grok 4.5 上線、7/9 GPT-5.6 全面開放、Gemini 3.5 Pro 傳出 7/17 進場(後來跳票,3.5 Pro 至今未上線;Flash 線倒是先在 7/21 換代成 3.6 Flash),再加上 7/1 才剛解禁回歸的 Fable 5——我同時付著 ChatGPT 和 Claude 各 200 美金的訂閱,再加一份 Google AI Pro,看著發佈會一場接一場,第一個反應不是興奮,是摸摸錢包:這些訂閱費,還花得對嗎?
你可能也在問一樣的問題:到底該把錢押在哪一家?要不要趁機換陣營?這篇我把價格、跑分、可用性和適合誰一次攤開,包含幾個官方發佈頁不會主動告訴你的細節。
2026 年 7 月這一週,AI 模型市場到底發生什麼事?
簡單說:四大陣營在十天內把 2026 下半年的旗艦全部亮出來,隔一週再被中國的 Kimi K3 補上第五張牌,上一輪「三強鼎立」的 AI 模型比較直接作廢。
如果你有印象,去年 11 月三巨頭也在兩週內輪番轟炸過一次,我當時寫了上一代三旗艦對決的完整比較(Opus 4.5、GPT-5.1、Gemini 3 Pro)。八個月後劇本重演,但這次多了一個攪局者,而且每一家的故事都比上次精彩。
❶ 6/9:Anthropic 發佈 Claude Fable 5——史上第一個開放一般用戶的「Mythos 級」模型,結果 6/12 就因為出口管制被下架,6/30 解除、7/1 才全面回歸,戲劇性拉滿。
❷ 7/8:xAI 發佈 Grok 4.5——注意,官方頁面現在自稱 SpaceXAI,這是併入 SpaceX 體系後的新品牌。主打 coding 與 agent 任務,跟 Cursor 一起訓練,價格殺到見骨。
❸ 7/9:OpenAI 的 GPT-5.6 家族(Sol、Terra、Luna 三個版本)全面開放。6/26 就預覽了,但應美國政府要求先給信任夥伴、過安全審查才放行——這個「先審後放」的流程,跟 Fable 5 的遭遇對照著看特別有意思。
❹ 5/19 已出、Pro 還在路上:Google 在 I/O 發佈 Gemini 3.5,但目前能用的只有 Flash;真正的旗艦 3.5 Pro 官方說了「下個月推出」之後一再延期,外媒流出的日期是 7/17,但那天已經過去;7/21 官方端出的仍是 Flash 線(Gemini 3.6 Flash 與 3.5 Flash-Lite),3.5 Pro 的官方說法是「正與合作夥伴測試、準備好就開放」。
❺ 7/16:月之暗面發佈 Kimi K3——2.8 兆參數、原生多模態、100 萬 tokens 上下文,在 Arena 的 WebDev 前端盲測直接拿下第 1。這是這一輪唯一一個非美國陣營的攪局者,也是唯一走「開放權重」路線的旗艦——而且它說到做到:完整權重已於 7/27 上架 Hugging Face,採 Moonshot 自訂的 Kimi K3 授權。
看懂這條時間線,你就懂為什麼現在網路上大部分的 AI 模型比較文章都過期了——它們比的還是 GPT-5.5 和 Opus 4.8 那一代。這段的重點只有一個:先確認你看的評比是不是 7 月之後寫的,再決定信不信。
五大 AI 模型比較總表:價格、規格、定位一次看
先給你一張表看懂全局,再一家一家拆。價格都是 API 每百萬 tokens 的輸入/輸出定價,美金計。
模型 | API 價格(輸入/輸出) | 上下文窗口 | 一句話定位 |
|---|---|---|---|
| $10 / $50 | 100 萬 tokens | 最強大腦,最貴,速度偏慢 | |
| $5 / $30 | 約 100 萬 tokens | 均衡旗艦,生態最完整 | |
GPT-5.6 Terra | $2.5 / $15 | 約 100 萬 tokens | 旗艦九成功力、一半價格 |
| $1.5 / $9 | 官方未特別標示 | 快、便宜,Pro 出來前的過渡主力 | |
| $2 / $6 | 50 萬 tokens | 價格殺手,coding 專精,EU 未開放 | |
$3 / $15 | 100 萬 tokens | 前端盲測第 1,綜合對話第 9 |
表格之外,有一個獨立參考值得記:Artificial Analysis 的綜合智力指數把這一輪新模型排成一列——Fable 5 拿 60 分,GPT-5.6 Sol 59 分緊咬——8/6 再查,7/24 上市的 Opus 5 已以 61 分(Max 檔)反超登頂、Fable 5 退居次席,Opus 4.8 56、GPT-5.5 與 Terra 同為 55、Grok 4.5 54,Luna 51。前後差距其實只有一個志願的距離,這件事對你怎麼花錢很重要,後面算帳段會講。
這張表你可以先拿走一個判斷:「最強」和「最划算」從來不是同一家。接下來就是拆開看,每一家的甜頭跟代價。
GPT-5.6 的 Sol、Terra、Luna 怎麼挑?多數人其實只需要 Terra
GPT-5.6 不是一個模型,是三個:旗艦 Sol、均衡版 Terra、輕量版 Luna。我的判斷很直接——會讓多數人受益的不是最強的 Sol,是 Terra。
先看定價的巧思:Sol 維持 GPT-5.5 的 $5/$30,Terra 直接砍半到 $2.5/$15,Luna 更低到 $1/$6。OpenAI 官方數據裡,Terminal Bench 2.1 的分數 Sol 是 88.8%、Terra 84.3%、Luna 82.5%——Terra 用一半價格保住九成以上戰力,這種「次旗艦最香」的定價結構,跟手機市場的 Pro 與標準版根本同一套劇本。
訂閱端的分配就沒那麼慷慨了。聊天介面的 Sol 給 Plus($20/月)以上的付費用戶;免費仔在聊天裡摸不到 5.6,只能在 ChatGPT Work 和 Codex 裡用到 Terra。同日推出的 ChatGPT Work 是內建 Codex 的代理工作環境,Pro 和 Enterprise 還有多代理並行的 Ultra 模式——OpenAI 這次押的不是「聊天變聰明」,是「AI 幫你把工作做完」。
獨立評測人 Simon Willison 的評語我覺得很中肯:Sol「非常稱職」,但在複雜編碼任務上沒有超越 Fable 5;反倒是 Terra 和 Luna 用大約 1/16 的成本,在部分 agent 測試裡打贏了貴森森的旗艦。如果你的任務不是天天挑戰極限,貴的那個未必是對的那個。
三個版本怎麼挑、各方案實際拿到什麼、要不要為了 Sol 升級 Pro,我在ChatGPT 5.6 三版本的完整選擇指南裡逐一算過帳,猶豫的人先看那篇再刷卡。
Claude Fable 5 值得 $10/$50 嗎?最強跑分背後的三個代價
Fable 5 是這一輪 AI 模型比較裡跑分最漂亮的,但我要先潑冷水:它的強是要付三次錢的強。
先講強在哪。SWE-Bench Pro 約 80% 的解題率,比 GPT-5.5 的 58.6% 高出一大截;FrontierCode 在旗艦模型裡拿最高分;Anthropic 官方說法是它比過去的 Claude 更省 token、更少回合就能收工。它是第一個把過去只給政府資安夥伴用的「Mythos 級」能力開放到一般 API 的模型——Fable 5 和 Mythos 5 其實是同一顆大腦,差別在 Fable 加了安全分類器。
甜頭講完,換三個代價。第一,錢:$10/$50 是 Opus 4.8($5/$25)的整整兩倍,五家旗艦裡最貴。第二,速度:官方規格表自己標「Slower」,它是那種你丟一個大任務出去、泡杯茶再回來收成果的模型,不是即問即答的聊天咖。
第三個代價最容易被忽略:Pro 訂閱不再內含。解禁回歸後官方給的緩衝期到 7/12,7/13 起 Pro 訂閱跑 Fable 5 要走「額外使用量」按量計費;7/20 官方又修了一次規則——Max 與 Team Premium 改成方案內含 Fable 5(上限是常規週額度的 50%),Pro 則維持用量點數制。所以「不再內含」現在只對 Pro 成立,訂 Max 的人反而是白撿一層。我把額外使用量的三條路怎麼算才不虧整理成獨立一篇,重度用戶建議先算再開。
還有一個很少人講的風險維度:6 月那場出口管制風波,Fable 5 上架三天就被下架、整整消失 18 天,完整始末我當時全程追蹤記錄過。它教會我的事不是「別用 Fable」,而是別把工作流 100% 押在任何單一模型上——再強的模型,也可能因為模型能力以外的原因暫時消失。
我自己的用法是把 Fable 5 當「總工程師」:只派最難的活給它——大型重構、跨十幾個檔案的除錯、需要一次到位的長任務;日常瑣事交給便宜的模型跑。Fable 5 值不值得用的完整分析有我更細的取捨邏輯。
👉 查看 Anthropic 官方的 Fable 5 發佈公告
Gemini 3.5 該不該先付錢?Flash 很能打,Pro 還在路上
先破除一個誤會:你現在能用到的 Gemini 3.5,只有 Flash;到處在傳的 2M 上下文、Deep Think 都是還沒出的 3.5 Pro。YouTube 上一堆「Gemini 3.5 Pro 碾壓全場」的標題,點進去講的其實是流出規格,別被騙了。
但 Flash 本身值得尊重。5/19 Google I/O 發佈當天就全面開放,Terminal Bench 2.1 拿 76.2%、MCP Atlas 83.6%,官方宣稱輸出速度是其他旗艦的 4 倍、agent 任務成本常常不到別人一半。以一個「非旗艦」來說,這成績已經夠打掉不少上一代旗艦,而且 Gemini App 標準層每天有免費額度就能用到。
問題出在 Pro 的難產。官方 5 月說「下個月推出」,結果一路延到現在;外媒流出的 7/17 上線、2M 上下文窗口等說法都沒兌現,7/21 官方發佈的反而是 3.6 Flash($1.5/$7.5,輸出價比 3.5 Flash 再降),3.5 Pro 只留下一句「正與合作夥伴測試中」。以 Google 過去的節奏,我的建議是:日期沒出現在官方部落格之前,都當傳聞處理。我在Gemini 3.5 Pro 的規格與上線追蹤那篇會持續更新最新狀態。
那現在該怎麼對待 Gemini?我的答案:訂閱 Google AI Pro($19.99/月,約 NT$650)的人繼續留著——Flash 快又夠用,還綁著 Gmail、Docs 整個工作區;但想「為了 3.5 Pro 提前升級」的人先忍住,等它真的上線、真的有第三方跑分再說。付錢給規格表是投資人做的事,不是使用者。
👉 查看 Google 官方的 Gemini 3.5 發佈文
Grok 4.5 便宜 60% 是真的嗎?「Opus 級」的代價我幫你拆開看
Grok 4.5 的定價確實兇:$2/$6,不到 Fable 5 的五分之一,比 Opus 4.8 也便宜超過六成。再加上官方數據說它解同一批 SWE Bench Pro 任務,平均只花 15,954 個輸出 tokens,對比 Opus 4.8 的 67,020——token 用量省了 4.2 倍,等於價格乘以用量的雙重折扣,對按量付費的 API 黨是真金白銀。
但「Opus 級」這個宣傳詞要拆開看。最誠實的證據反而在 xAI 自家發佈頁:他們把五項跑分圖表大方放出來,其中四項的第一名都是 Fable 5,不是 Grok。
細看數字:DeepSWE 1.0 它排第三(62.0%,輸 Fable 的 66.1% 和 GPT-5.5 的 64.31%);SWE Bench Pro 64.7% 對 Fable 的 80.4% 差距明顯;唯一奪冠的是 SWE Marathon 長時程任務(29.0%)。翻譯成人話:Grok 4.5 不是最聰明的,它是「夠聰明、超級省、跑得快」的那一個——80 TPS 的輸出速度在這批旗艦裡確實數一數二。
可用性是另一個要注意的坑。它目前的主要入口是 Grok Build、Cursor 和 API console,Office 三件套外掛也有;但 EU 整區還沒開放,一般聊天訂閱怎麼接官方也還沒講清楚。我之前用 Grok Build 從零建過一個網站,這次 4.5 上線後丟了幾個小任務進去,第一印象跟官方主打一致:快、便宜、程式任務有模有樣,但要它接手我的長文寫作,我還不敢。
有個朋友看到定價直接問我:「這麼便宜,是不是該把訂閱全換過去?」我的回答是:先用免費的試,別急著搬家。工具再便宜,換掉整個工作流的隱形成本(重寫提示詞、重建習慣、重踩一輪雷)都不便宜。
👉 限時免費:到 Grok Build 試跑 Grok 4.5(官方公告載明 Grok Build 與 Cursor 限時免費開放)
Kimi K3 半路殺出:這張比較表被一個中國模型改寫了哪一格?
先說結論:Kimi K3 沒有改變「誰最強」,但它改變了「前端工程該付錢給誰」這一格。
阿里開源的其實不是多模態旗艦,我把官方模型卡逐條對完發現差很多。
這篇原本寫的是四大旗艦。7/16 月之暗面丟出 Kimi K3,一個 2.8 兆參數的模型,在 Arena 的 WebDev 前端盲測拿下 1679 分排全球第 1,把 Claude Fable 5 的 1631、GPT-5.6 Sol xhigh 的 1618 都壓在後面(觀察日 2026-07-19)。
盲測第一名的含金量比廠商自報高——開發者不知道自己在評哪個模型,純粹比輸出誰好。廠商公布的評測可以挑題目,人類盲測的偏好挑不了。所以這個名次我認。
但翻到同一個平台的綜合對話榜,畫面就完全不一樣:它只有 1486 分、排第 9,還跟 Gemini 3 Pro、GPT-5.6 Sol xhigh 三方同分。獨立智力指數則是 57,卡在 Sol 的 59 和 Opus 4.8 的 56 中間。
📌 一句話總結
K3 是「跑馬拉松的工程師」,不是「什麼都聰明的通才」。你要它照著複雜規格把一個網站蓋完很行,要它想通一個很繞的問題就沒那麼行——HLE 這類高難度推理它約 43.5 分,Fable 5 是 53.3。
價格上它也不再是印象中那個「便宜的中國模型」。$3/$15 已經進到 Claude Sonnet 的價位帶,比自家上一代 K2.6 的 $0.95/$4 漲了三倍多。更麻煩的是它永遠在滿級推理、沒有省錢檔位,連瑣事都得付滿級費用,實際帳單會比標價再高一截。
所以它對這張表的實際影響其實很侷限:如果你的活是前端網頁或長流程 agent,K3 值得排進來測一輪;其他情況,原本四家的排序不用動。
下一步:K3 的定價、免費額度與台灣可用性我另外拆過一篇——兩張榜單的落差,以及該不該為它多付一筆訂閱;至於媒體說的「開源」其實沒那麼單純,2.8 兆參數的自架成本與跑不動真相在這裡。
這一輪 AI 模型大戰最被低估的變化:安全審查成了新關卡
這一輪發佈的熱鬧背後,有一條安靜但影響深遠的暗線:2026 年的旗艦 AI 模型,發佈前後都多了一道「安全關卡」,而且這道關卡開始直接影響你什麼時候用得到、用到的是哪個版本。
證據攤開來看。Fable 5 是第一個開放一般用戶的 Mythos 級模型,代價是內建安全分類器——資安、生物化學這類高風險查詢會被導去 Opus 4.8 處理;即便如此,它還是在上架三天後撞上出口管制,消失了 18 天。GPT-5.6 那邊,OpenAI 應美國政府要求先給信任夥伴、過完審查才全面開放,觸發原因據報導是資安能力大躍升(ExploitBench 從 47.9% 跳到 73.5%)。
這對一般使用者的實際意義有三條。
❶ 發佈日期越來越不可信:官方說「下個月」可能變兩個月,Gemini 3.5 Pro 的一再延期就是現在進行式。
❷ 你用的版本和跑分的版本可能不同:加了安全層、降了檔位的公開版,表現會跟發佈會數字有落差。
❸ 能力越強的模型,供應越不穩定——這正是我反覆強調別單押一家的原因。
身為每天在這些工具上跑十小時工作的人,我現在評估模型多了一個維度:不只看它多聰明,還看它「明天還在不在」。這個判斷維度,我猜一年後會變成所有 AI 模型比較的標配。
官方跑分都挑自己好看的:3 個訣竅讓你看懂 AI 模型比較不被唬
寫這篇查資料時我再次確認一件事:同一場考試,每家官方公佈的分數可以差到 4 個百分點以上。不是誰造假,是遊戲規則根本不同。三個訣竅教你自保。
❶ 看後綴。跑分表上的「Fable (max)」「GPT-5.5 (xhigh)」不是型號,是火力全開的檔位——等於讓考生喝三杯咖啡加無限延長考試時間。你日常用的預設檔位跑不出那個分數,看到沒標檔位的比較表,先扣三分可信度。
❷ 看主辦方跟考卷。xAI 的圖表引用各家 system card 的公開數字,這算有誠意;但換一份考卷結果就翻盤——Grok 4.5 在自選 harness 的 DeepSWE 1.0 拿 62.0% 贏過 Opus 4.8,到了中立 harness 的 DeepSWE 1.1 掉到 53%、反被 Opus 4.8 的 59% 超車。誰出題、誰監考,比分數本身更重要。
❸ 找獨立指數對帳。我自己的習慣是官方數字先存疑,再去 Artificial Analysis 這類第三方看綜合排名,兩邊說法一致才當真。這一輪的獨立指數差距(Fable 5 的 60、Sol 的 59、Kimi K3 的 57、Grok 4.5 的 54)遠比官方宣傳的「碾壓」溫和——旗艦之間的智力差距在縮小,價格差距在拉大,這才是 2026 年中 AI 模型比較最該記住的一句話。
下次再看到任何「XX 碾壓 XX」的標題,把這三招拿出來過一遍,能幫你省下很多衝動訂閱費。
AI 模型訂閱費怎麼花才不冤枉?我的算帳方式
把規格放一邊,來算錢。這段是寫給每個月看到信用卡帳單上一排美金扣款、心會揪一下的人——包括我自己。
先看訂閱端的現狀(美金月費,刷卡另有約 1.5% 海外交易手續費,記得挑一張海外回饋卡再訂):
方案 | 月費 | 7 月起你實際拿到的新旗艦 |
|---|---|---|
ChatGPT Plus | $20 | 聊天可用 GPT-5.6 Sol |
ChatGPT Pro | $200 | Sol+Sol Pro+Work 的 Ultra 模式 |
Claude Pro / Max | $20 / $100-200 | Opus 4.8、Sonnet 5 內含,7/24 起新增 Opus 5(Max 新預設);Fable 5 至 7/12 止,7/13 起 Pro 走用量點數,7/20 起 Max/Team Premium 改為內含(上限週額度 50%) |
Google AI Pro | $19.99 | Gemini 3.5 Flash(Pro 上線後依官方分配) |
Kimi 會員(Moderato 起) | $19 | K3 全開;免費層只給 6 個 agent 額度、1 個並行任務 |
看出關鍵了嗎?$20 級距的訂閱,這一輪其實都有拿到新東西,唯一的例外是 Fable 5 從 $20 的 Pro 方案裡畢業了(7/20 起 Max 那一階倒是把它收了回去)。所以我的第一條算帳原則:既有的 $20 訂閱先不要動,這輪升級不換陣營也吃得到。我在三大付費 AI 怎麼選的訂閱對比裡建立的判斷框架,這次依然適用。
第二條原則:重度需求走 API 混搭,比無腦升頂級訂閱划算。舉個透明的算式:一個輸入 20 萬 tokens、輸出 3 萬 tokens 的大型任務,Fable 5 約 $3.5(約 NT$110,匯率以 32 估)、GPT-5.6 Terra 約 $0.95、Grok 4.5 約 $0.58。如果十次任務裡只有兩次真的需要最強大腦,全包給 Fable 就是把錢燒在用不到的火力上。
第三條:先堵漏再加訂。很多人的訂閱其實卡在用量上限而不是智力上限,Claude 和 ChatGPT 的用量上限與降智傳言我查證過一輪;搭配不升級方案也能省 token 的 10 個習慣,常常能把「該升級了吧」的衝動再壓半年。要總體檢自己的訂閱組合,可以用哪些 AI 訂閱值得續訂的盤點清單跑一遍。
第四條:升級要有觸發點,不是有新模型就掏錢。我的判準是「連續兩週天天撞用量上限」才升級——偶爾卡一次就加訂,多付的大多是閒置火力。從免費層、Plus 到 Pro 每一階多付的錢實際換到什麼,我在ChatGPT 各級訂閱逐階拆帳、找出你該停的那一階算得很細,升級前先對號入座。
同樣是 GPT-5.6,選錯型號額度可以差到 20 倍以上——Codex 用量上限怎麼撐久一點、官方會發的重置券去哪裡拿,我把官方額度表和四條回血路線拆過一次。
寫作、程式、研究、日常:五大 AI 模型我會這樣派工
當了十年 PM,我看這五個模型的方式跟看團隊成員一樣:沒有最強的人,只有派錯工的主管。以下是我的派工表,直接抄去用。
任務類型 | 我會派給誰 | 為什麼 |
|---|---|---|
大型程式重構、跨檔案除錯 | Fable 5 | SWE-Bench Pro 約 80% 的實力,難題一次到位反而省 token |
日常 coding、批次雜活 | Grok 4.5 或 Terra | 價格低、速度快,錯了重跑也不心疼 |
長文寫作、需要細膩判斷的文字 | Fable 5 / Sol | 語感與長脈絡穩定度目前仍是這兩家最強 |
快速摘要、翻譯、日常問答 | Gemini 3.5 Flash / Luna | 4 倍速輸出加免費額度,殺雞不用牛刀 |
前端網頁、長流程 agent 任務 | Kimi K3 | Arena WebDev 盲測第 1,領先 Fable 5 約 48 Elo,但只在這一格強 |
兩個派工心法補充。第一:用任務的「失敗成本」決定模型等級——重跑一次只花你 30 秒的任務,用最便宜的;錯一次要重做一下午的任務,才值得上旗艦。第二:同一個任務讓兩家跑,是最便宜的評測——與其看十篇評比,不如把你自己的真實任務丟給兩個模型各跑一次,答案立刻出來。
這套方法的三模型舊版我寫過五種場景的 AI 派工實戰,搭配這篇的新模型對照著看,你可以直接升級自己的派工表。
派工表外我再補一格:查資料、要附來源的研究活,我不派給這五家通用模型,而是丟給搜尋型 AI 處理。要不要為這件事單獨多付一份月費,Perplexity Pro 到底值不值得為查資料多訂一份我拆過帳,常做研究的人先看那篇再決定。
這張派工表是用規格和日常經驗推的。如果你想看我實際讓原本那四家各做一款遊戲、各寫一封婉拒加班訊息,還能親手玩玩看、盲測猜哪家做的真人實測,我寫成了另一篇——那篇照出的是規格表看不到的「手感」與「性格」。
AI 模型怎麼選?決策框架:你是哪種人,就走哪條路
最後把所有結論收斂成一份對號入座清單。找到你自己的那一行,照著做就好。
如果你是——
- 輕度使用、一個月用不到 10 次的人:不用付錢,免費層就夠。Gemini App 每日免費額度+Grok Build 限時免費輪著用,一毛錢都不用掏(預算:$0)。
- 已經訂了一家 $20 方案的上班族:原地不動,這輪三家 $20 級距都有拿到新模型。下一步是把你最常做的任務丟給新模型驗收一週,而不是急著換家。
- 工程師或 API 重度用戶:混搭最划算——難題派 Fable 5、雜活派 Grok 4.5 或 Terra。下一步是設好用量警示,跑兩週看實際帳單再定案(預算:多數人 $20-60/月就能組出很強的混搭)。
- 觀望型、有選擇困難的人:合理!等 Gemini 3.5 Pro 真的揭曉再一次做決定——原本傳的 7/17 已經跳票,官方至今只給得出 Flash。先收藏這篇,Pro 上線後回來對照。
不適合現在行動的人也講清楚:如果你的工作這個月正忙到火燒屁股,別在旗艦剛發佈的第一週搬家——新模型的生態、外掛、額度政策都還在滾動調整,等塵埃落定的第二、三週再動,踩雷機率低一半。我追了三代模型發佈,這條教訓每一代都適用。
FAQ 常見問題
Grok 4.5 那麼便宜,該把 ChatGPT 或 Claude 的訂閱退掉換過去嗎?
先別。Grok 4.5 的強項是 coding 和 agent 任務的性價比,但入口目前偏開發者(Grok Build、Cursor、API),EU 還沒開放,聊天訂閱的配套也未明朗。正確姿勢是趁限時免費把你的真實任務丟進去測,測完滿意再談搬家——訂閱可以月退,工作流重建的時間退不了。
這張表上的 Gemini 與 Grok 在 8 月又各換了一代,五家十二天內全部翻新,而且沒有一個是純升級。
Fable 5 和 Opus 4.8 都是 Claude,我該用哪個?
預設用 Opus 4.8,難題才叫 Fable 5——8 月更新:Anthropic 已於 7/24 推出 Opus 5(同樣 $5/$25、訂閱內含,Max 方案新預設),官方定位是「接近 Fable 5 的智力、一半的價格」,預設那顆現在可以直接換成 Opus 5。Opus 4.8($5/$25)訂閱內含、速度中等,日常九成任務夠用;Fable 5 貴一倍、速度偏慢,計費上 7/20 定案為「Max/Team Premium 內含(上限週額度 50%)、Pro 走用量點數」,它的價值在「一次解掉別人解不掉的題」。可以搭配Opus 4.8 升級後的變化整理和Sonnet 5 的定位分析把 Claude 全家的分工排清楚。
要不要等 Gemini 3.5 Pro 出來再做決定?
看你現在卡不卡。手上工具夠用就先不動——原本傳的 7/17 已跳票,Google 7/21 發佈的是 3.6 Flash,3.5 Pro 官方只說「正與合作夥伴測試、準備好就全面開放」,沒有給日期,時程以官方部落格當下公告為準;但如果你天天被現有模型的短板卡住,先按這篇的派工表補位,Pro 上線後再微調——它的 2M 上下文如果屬實,最先受益的會是長文件分析型的用戶。
完全不想付錢,2026 下半年還跟得上嗎?
跟得上,而且這波對免費仔其實變好了:Gemini 3.5 Flash 有每日免費額度、Grok 4.5 在 Grok Build 限時免費、ChatGPT 免費層也能在 Work/Codex 摸到 Terra。差距主要在用量上限和尖峰時段的優先權,免費版和付費版差在哪的完整分析可以幫你判斷自己是不是真的需要付費。
另外提醒:$0 預算不是只有這五家的免費層可選。我把目前免費就很能打的 AI 工具整理成一份不用刷卡也能把活做完的免費 AI 工具清單,先把免費的天花板摸清楚,再決定要不要為誰掏錢。
官方跑分和獨立指數不一致時,該信哪個?
信獨立指數的「排序」,信官方數據的「絕對值範圍」,兩邊都別信「碾壓」。官方跑分用的是火力全開檔位加自選考卷,適合看這家模型的能力上限;獨立指數統一條件測試,適合看排名。做購買決策時,用獨立排序+你自己的真實任務試跑,最不會被行銷話術帶走。
Kimi K3 值得加進來一起比嗎?
看你的活是什麼。主力做前端網頁或長流程 agent 的人值得——它在 Arena 的 WebDev 盲測目前第 1,領先 Fable 5 約 48 Elo。其他情況先別急:它的綜合對話只排第 9、純推理落後 Fable 5 將近 10 分,連 Moonshot 自己都在發布文寫「與 Claude Fable 5 和 GPT-5.6 Sol 相比,使用者體驗仍有明顯落差」。而且 $3/$15 的 API 已經不算便宜,加上它永遠滿級推理、沒有省錢檔位,實際帳單會比標價更高。
結論:與其糾結最強 AI 模型,不如練好派工的手感
寫到這裡,回頭看這場五方大戰,我最深的感觸其實是:模型之間的差距,已經小於「你會不會用」的差距。獨立指數上第一名和第四名只差 6 分,但同一個模型在會派工的人和不會派工的人手上,產出可以差三倍。與其焦慮選錯家,不如把這篇的派工表和算帳法真的跑一遍——工具會一直換,判斷的方法不會。
派工表看完之後,下一個要決定的通常是「那我到底該付哪一家的訂閱」。這題我按家拆成了一個系列:Claude 四檔加價買不到更長的上下文、Google 那一包多付的錢大半不是買 AI、Grok 兩條訂閱線別買重,還有Kimi 聊天免費、付費買的是 agent。跑分決定誰做得好,這幾篇決定你要付多少。
如果你想在下一波模型大戰開打時(相信我,不會等太久)第一時間看到我的比較和踩雷紀錄,歡迎訂閱我的部落格,會不定期收到信。
關於作者
夜羽凌,遊戲業產品經理、部落客、Podcaster。每天使用 AI 超過 10 小時,同時訂閱 ChatGPT 與 Claude 的高階方案和 Google AI Pro,長期記錄 AI 工具的真實使用心得與訂閱算帳。更多背景故事見關於夜羽凌。
參考資料
- Introducing Grok 4.5 — SpaceXAI 官方發佈頁
- Claude Fable 5 and Claude Mythos 5 — Anthropic 官方公告
- Redeploying Claude Fable 5 — Anthropic 恢復服務與方案安排說明
- Previewing GPT-5.6 Sol — OpenAI 官方說明
- Gemini 3.5: frontier intelligence with action — Google 官方部落格
- Claude Models Overview — 官方規格文件(定價與上下文窗口)
- Artificial Analysis — 獨立模型智力指數
- Kimi K3 定價與規格 — Moonshot 開放平台官方文件
- Arena — 人類盲測排行榜(Text Arena / WebDev Arena)