GPT-6 Astra vs Claude Fable 5.1 該選哪個?同價不同帳單

目錄

💡 核心結論速覽 (TL;DR)

  • 牌價第一次一樣:GPT-6 Astra 與 Claude Fable 5.1 的 API 都是輸入 $10、輸出 $50,Batch 也同價,問題只剩你踩到哪一格。
  • 真正不同的三格:快取讀取 $1 對 $0.25、Astra 超過 272K 整筆翻倍、知識截止 4/30 對 6 月。
  • 聰明與便宜各贏一邊:AA 9/5 v4.2 智慧指數 Fable 5.1 56.8 高於 Astra 54.7,但 Astra 每題輸出 token 只有一半。
  • 今天先做:抓上月帳單的快取讀取佔比與單筆最大輸入,任一偏高選 Fable 5.1,否則選 Astra。

GPT-6 Astra 和 Claude Fable 5.1 的 API 牌價第一次長得一模一樣:輸入 $10、輸出 $50。我把兩張定價頁並排的那一刻,第一個念頭不是「太好了省得比」,而是「那這篇文章要比什麼」。

答案很快就出來了。牌價相同,帳單不會相同。兩家真正的差異藏在三格:快取讀取一個收 $1、一個收 $0.25;一個在 272K token 畫了一條線、超過整筆翻倍,另一個 900K 和 9K 同價;知識截止差了兩個月。

你的工作落在哪一格,決定了你該站哪一邊。

同時付兩家最高檔方案這幾年,我學會先看合約細則再看跑分;API 也兩邊都在燒。

9 月 1 日到 3 日,兩家各丟出一款旗艦,我做的第一件事是把兩張價目表逐格對——做過採購的人都知道,兩個供應商報同一個價的時候,比的從來不是報價單,是合約細則。

這篇就把細則攤開:價目表哪三格不同、272K 那條線怎麼算錢、官方跑分表贏哪裡輸哪裡、獨立評測為什麼三種讀法、以及最後——三種用法各該選誰。


先講結論:GPT-6 Astra vs Claude Fable 5.1,三種用法各該選誰

GPT-6 Astra 與 Claude Fable 5.1 的 API 牌價都是每百萬 token 輸入 $10、輸出 $50,但三種用法會選到不同邊:一次性任務與短脈絡看 token 用量,選 Astra;反覆重讀同一份長脈絡的 agent 看快取讀取,選 Fable 5.1。

單筆輸入常超過 272K 的長文件,直接選 Fable 5.1。

這個結論是從官方定價頁的三格差異推出來的,不是從跑分表。跑分表兩邊都有贏的格子,後面會逐格拆;但價目表上那三格差異是硬的,每一次請求都會結算,跑分不會。

先看你帳單上的兩個數字、再看你的題型。

❶ 你的請求會不會重複讀同一段上下文?會的話——agent 迴圈、長對話、每一輪都把整份文件送回去——快取讀取那一格就是你的主要帳單,Fable 5.1 的 $0.25 對 Astra 的 $1 是四倍差距。

❷ 你的單筆輸入會不會超過 272K token?會的話,Astra 那一筆的輸入與快取價變成 2 倍、輸出 1.5 倍,而且是整筆算,不是只算超出的部分。Fable 5.1 沒有這條線。

❸ 你的題型要的是「答對」還是「答得便宜」?Artificial Analysis 9/5 v4.2 的智慧指數 Fable 5.1 56.8 高於 Astra 54.7,差 2.1 分;但 AA 9/3 評測文章量到 Astra 每題輸出的 token 只有 Fable 5.1 的一半。

兩個數字與題型裡任何一項對上了,下面對應的那一段就是為你寫的。

順帶交代時間點:Astra 是 2026 年 9 月 3 日發布,官方原文寫「rolling out today to a limited set of organizations」,分批灰度開放中、官方尚未宣告全面開放。

同一週 Google、Meta 與阿里也各出了新模型,那幾款按預算擺在一起看的版本我另外寫了一篇,這篇只做 Astra 對 Fable 5.1 的雙人對決。

這段能帶走的判斷:先看你的帳單結構,再看跑分。快取讀取佔比與單筆輸入長度這兩個數字,比任何 benchmark 都更早決定你該選誰。


同樣 $10/$50,GPT-6 Astra 和 Claude Fable 5.1 的價目表差在哪三格

GPT-6 Astra 和 Claude Fable 5.1 的價目表,輸入、輸出、快取寫入、Batch 四個地方相同,不同的只有快取讀取($1 對 $0.25)、1 小時快取寫入(Astra 沒有這一檔)、以及 Fast mode 這種 Astra 才有的 2 倍價計費層。

我把兩家官方定價頁逐格對出來是這樣:

計費項目 GPT-6 Astra Claude Fable 5.1 差異
輸入$10 / MTok$10 / MTok相同
輸出$50 / MTok$50 / MTok相同
快取讀取$1 / MTok$0.25 / MTok差 4 倍
快取寫入(Claude 為 5 分鐘檔)$12.50 / MTok$12.50 / MTok相同
1 小時快取寫入無此檔$20 / MTokClaude 才有
Batch$5 / $25$5 / $25相同(各半價)
Fast mode$20 / $100(2 倍價)—(本篇只比五格常設價)Astra 才有的計費層

資料來源是 OpenAI 官方 API 定價頁Claude Fable 5.1 官方模型總覽,查證日 2026 年 9 月 5 日,單位是美元、每百萬 token。Claude 那邊我只比五格常設價,Fast 這種加價層不在本篇範圍。

快取讀取那一格為什麼差四倍?因為兩家的倍率邏輯不同。OpenAI 這一代四款模型(Astra、Sol、Terra、Luna)的快取讀取一律是輸入價的 0.1 倍、快取寫入一律 1.25 倍,Astra 只是把這個通則套在 $10 上,所以是 $1。

Anthropic 則替 Fable 5.1(與同價的 Mythos 5.1)破例,快取讀取只收輸入價的 0.025 倍,官方定價頁註明其他模型一律 0.1 倍。

這裡就是我說「合約細則」的地方。我帶團隊採購過工具,同價的兩家供應商坐在會議室裡,第一輪報價一定打平,勝負全在第二輪:誰的續約條款鬆、誰的超量計費狠。快取讀取就是 AI 模型的續約條款——你每多重讀一次上下文,就是在續約一次。

有個跑 agent 的開發者朋友,Fable 5.1 上線那天原本沒打算換,理由是「牌價沒動」。他把自己迴圈裡的快取讀取量代進去算完之後改了主意——他的帳單裡重讀的比例高到讓那一格的四倍差距壓過其他所有格子。

他沒告訴我精確數字,但我把Fable 5.1 只降一格卻有人省 63%、有人只省 0.6% 的那份試算拿出來對,結論方向一致:差距全看你重讀多少。

他後來把長時 agent 的迴圈整段搬到 Fable 5.1,短的批次任務留在 OpenAI 那邊——這也是我後面那張配法表的雛形。

1 小時快取寫入那一格也不是裝飾。Astra 的快取只有一種寫入價,意思是你要在讀取窗口內反覆命中才划算;Fable 5.1 多了一個 $20 的 1 小時檔,讓「重讀間隔拉長」的工作流仍然吃得到 $0.25 的讀取價。做批次分析、幾十分鐘才回來讀一次同一份脈絡的人,這格比快取讀取本身還關鍵。

Fast mode 那一列我特別放進來,是因為它最容易被當成「免費升級」。GPT-6 Astra 官方模型頁寫的是:

up to 2x the speed … at 2x the Standard price

而且明文「does not include a latency SLA」——付兩倍價換的是「最多兩倍速」,不是保證。歐盟資料落地的端點也不能用 Fast。

這段能帶走的判斷:輸入輸出同價的兩家,快取讀取就是唯一會讓帳單分岔的常設格。先去帳單後台看 cached 那一欄佔多少,佔比越高,Fable 5.1 的 $0.25 越值錢。


272K 這條線:GPT-6 Astra 超過就整筆翻倍,Claude Fable 5.1 送 900K 和 9K 同價

GPT-6 Astra 的輸入一旦超過 272K token,那一筆請求的輸入與快取價變成 2 倍、輸出變成 1.5 倍,而且是整筆計算;Claude Fable 5.1 的 100 萬 token 視窗全段同一個費率。

Claude 官方原文寫:

A 900k-token request is billed at the same per-token rate as a 9k-token request.

這是三格差異裡最容易被忽略、也最容易一次噴掉最多錢的一格。

先把官方的話原樣放上來,因為這句的每個字都在算錢。OpenAI 定價頁寫:

Prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request.

關鍵是最後三個字——for the full request,整筆。不是階梯式只算超出的部分。

GPT-6 Astra 計費層 輸入 快取讀取 輸出
輸入 ≤ 272K$10$1$50
輸入 > 272K(整筆)$20$2$75
Fast mode 且 > 272K$40$150

我自己踩的坑就在這裡,講出來給你省一次。看到「1,050,000 token 脈絡窗」的第一直覺,是把它當成價格邊界——反正在窗內都一個價。結果定價頁的邊界畫在 272K,大約只有整個視窗的 26%。剩下那 74% 的容量是給你用的,但用的時候價目表換了一張。

用一個我自己算的例子(這是推算,不是官方數字,每格單價都來自官方定價頁):一份 30 萬 token 的文件丟進去、回 1 萬 token 的分析。

❶ GPT-6 Astra:輸入 300K × $20 = $6.00,輸出 10K × $75 = $0.75,合計 $6.75。

❷ Claude Fable 5.1:輸入 300K × $10 = $3.00,輸出 10K × $50 = $0.50,合計 $3.50。

❸ 同一份工作切成 25 萬 token 送 Astra:輸入 $2.50、輸出 $0.50,合計 $3.00——跟 Fable 5.1 的價格回到同一個量級。

所以 272K 這條線的實際效果不是「Astra 長文件比較貴」,而是「Astra 逼你在 272K 前切片」。切得動的工作(逐章摘要、分批比對)沒差;切不動的工作——整個 codebase 一次進去找跨檔案的關聯、一份合約要前後條款互相對照——Fable 5.1 的全段同價就是實實在在的省一半。

還有一個容易漏的細節:Astra 的視窗是 1,050,000,但最大輸入是 922,000,最大輸出 128,000。你的長文件塞到 92 萬就頂了,不是 105 萬。Fable 5.1 官方寫的是 1M 視窗、128K 輸出。

兩家的斷詞器也不一樣,同一份中文文件在兩邊數出來的 token 不會相同,272K 這條線要用 OpenAI 自己的計數去量。這件事我在Claude 換斷詞器那次多算三成 token 的帳裡踩過一次,同樣的坑不要在 OpenAI 這邊再踩一次。

這段能帶走的判斷:把你最近一個月「單筆最大輸入 token」拉出來。經常超過 272K 又切不動的,Fable 5.1 直接勝出;從來不到 272K 的,這條線對你不存在,回到快取讀取那一格去比。


同樣 1M/128K,GPT-6 Astra 和 Claude Fable 5.1 差在知識截止與 effort

GPT-6 Astra 與 Claude Fable 5.1 的脈絡窗都是 100 萬 token 等級、最大輸出都是 128K,規格表上真正不同的兩格是知識截止(Astra 2026 年 4 月 30 日、Fable 5.1 2026 年 6 月)與思考檔位的控制方式。

「視窗變大」這件事在兩邊都不成立——Astra 的 1,050,000 跟上一代 GPT-5.6 Sol 一模一樣。

項目 GPT-6 Astra Claude Fable 5.1
脈絡窗1,050,000(最大輸入 922,000)1M
最大輸出128,000128K
知識截止2026-04-302026 年 6 月
思考控制effort:low/medium/high/xhigh/max,不支援 none思考永遠開啟不能關;claude.ai 預設 medium
輸入型態文字+圖片,只出文字(本篇不比)
Batch$5 / $25$5 / $25

知識截止差兩個月,聽起來很小,但它落在一個很尷尬的區間。照官方寫的知識截止推算,Astra 的 4 月 30 日意思是 5 月到 8 月發生的事它訓練時不該看過——包括同一家在 8 月的 Sol 降價、8 月的節奏調整,也包括它自己的競爭對手在 6 月發的 Fable 5。

Fable 5.1 的 6 月截止多吃到兩個月,但同樣看不到 7、8 月。所以問今年下半年的事,兩邊都要開搜尋,只是 Astra 要開得更勤。

effort 那一格才是開發者真正會有感的差異。Astra 提供五檔,但把上一代的 none 拿掉了——原本用 GPT-5.6 跑 none 來省錢的人,被迫升到 low,成本只會往上。Fable 5.1 更直接:思考永遠開著,任何 effort 都關不掉。

兩家不約而同做了同一件事:不再讓你買「不思考」的便宜版旗艦。對聊天訂閱戶的意思是:想在 claude.ai 省 Max 額度,能動的只有把 effort 從預設的 medium 往下調,關思考這條路沒有。

Astra 還有幾條寫在模型頁上、不會出現在公告裡的限制:不接受 temperature、top_p、logprobs;不支援 fine-tuning;工具呼叫必須走 Responses API;API 免費層寫的是「Not supported」;Tier 1 是 500 RPM/500K TPM。

這幾條對只用聊天介面的人沒差,對正在把 GPT-5.6 的程式改成 Astra 的人,每一條都是一個要改的地方。

規格表越來越像,差異全部往「控制權」那邊移。兩年前比的是誰的視窗大,現在視窗都一樣大,比的是你能不能關思考、能不能調溫度、超過某條線之後誰跟你多收錢。這篇會一直繞著這個主軸走。

如果你是從 Claude 這邊出發、正在猶豫該用 Fable 5.1 還是留在 Opus 5,effort 五檔各自怎麼用,我在Opus 5 那一代少燒 26% token 的四個習慣裡拆過,那套調法在 Fable 5.1 上仍然適用。

這段能帶走的判斷:規格表只剩兩格會影響你的決定——問時效性題目的人記住 4 月 30 日這條線;用 API 省錢靠 none 檔的人,Astra 上這條路沒了。


OpenAI 自家表有兩格輸給 Claude Fable 5.1:其他十三格先看腳註 5、8、11、17

OpenAI 自己放在 GPT-6 Astra 公告文末的比較表,Astra 在終端、代理、科學、數學類的多數項目領先 Claude Fable 5.1,但在兩個綜合指標上輸給它。

那兩格是 Artificial Analysis 智慧指數(公告表引 AA v4.1.1)61.2 對 65.7、Humanity's Last Exam 57.2% 對 65.0%。

連官方自家表格都不是每格第一,這件事本身就是資訊。

下面是我從 OpenAI 的 GPT-6 Astra 發布公告文末表格抄下來、只留 Astra 與 Fable 5.1 兩欄的版本。全表註記「Evaluation scores are the maximum at any effort」,每一格都是該模型在任何 effort 檔位下的最高分。

項目 Astra Fable 5.1 讀法備註
AA Intelligence Index v4.1.161.265.7公告表引用 v4.1.1、Astra 在六款裡排第 4;AA 站上 9/5 已改 v4.2:54.7 對 56.8,順序仍 Fable 5.1 在前
Humanity's Last Exam(含工具)57.2%65.0%有數字的模型裡 Astra 最低
AA Coding Agent Index v1.467.0(空白)AA 自家文章另說 Fable 5.1 在 Claude Code 是 70
Terminal-Bench 4.057.9%55.8%差 2.1 個百分點
DeepSWE v1.174.1%67.4%
FrontierCode 1.1 Main53.3%50.9%Astra 搭近似 Codex 開發者訊息跑;競品是否同等提示未確認
Terminal-Bench Science 0.164.6%52.6%
FrontierMath Tier 497.6%87.8%公告內文寫成 98%
GPQA Diamond96.0%93.7%
AutomationBench41.4%31.4%
BenchCAD95.9%84.3%Claude 分數套了 3 項修改(腳註 5)
ARC-AGI-295.0%90.0%
SRE-Bench pass@188.0%12.5%差距最大的一格
HealthBench Professional63.4%58.1%Claude 分數由 OpenAI 自行測得(腳註 11)
ExploitBench(無防護)100%70%Fable 分數來自防護較少的 Mythos 版本(腳註 17)

這張表的四個腳註各會改變某一格的讀法,我按腳註的順序講。

❶ 腳註 5、11、17:競品分數不全是同一種來源。官方主詞是「GPT evaluations」,但 Claude 那幾格各有各的出處。

BenchCAD 的 Claude 分數套了三項修改(腳註 5);HealthBench 是 OpenAI 自己跑 Claude(腳註 11);ExploitBench 那格 Fable 拿的是防護較少的 Mythos 版本的分數(腳註 17)。

❷ 腳註 8:FrontierCode 的提示詞。Astra 那兩格是搭「近似 Codex developer message」跑的,原文寫「The prompt was not optimized for the eval.」,競品有沒有同等提示官方沒說明,我只能標「未確認」。

❸ 全表註記:「最高分」是拿每一檔 effort 的最高值,空白格也不能當 0 讀。你在 API 或聊天介面預設檔位跑出來的,本來就不會是這個數字;官方在正文另外報過低成本檔的 Terminal-Bench Science 61.1%、GPQA 94.9%,那才比較接近你日常會拿到的。

Coding Agent Index 那一列 Fable 5.1 是空白,Artificial Analysis 自家文章說的是 Fable 5.1 在 Claude Code 上拿 70 分、榜首,Astra 在 Codex 上是 67——這是「模型+harness」的組合分。

OSWorld 2.0 與 ScreenSpot-Pro 兩列 Fable 5.1 也是空值,有分數的 Claude 分別是 Opus 5 的 70.2% 與 Fable 5 的 87.3%,不能籠統寫成「Fable 5.1 的分數」。

SRE-Bench 那格 88.0% 對 12.5% 是全表差距最大的一格,做維運自動化的人可以直接把它當決定性證據;其他格子的差距大多落在個位數到十幾個百分點之間。

還有一格公告表沒放、但公告正文有寫的:FrontierCode Extended,Astra 64.5%,輸給上一代 Fable 5 的 64.9%,仍高於 Fable 5.1 的 63.6%。

同一個 benchmark 家族,Main 贏、Extended 輸,而且輸的是對手的舊版——這種格子最能說明「贏」是分項目的。

官方在表格旁邊還放了幾個成本宣稱:Terminal-Bench 4.0 每題成本比 Fable 5.1 低約 63%、BenchCAD 低 86%。這些是 OpenAI 自估,不是第三方;方向跟下面獨立評測量到的「Astra 省 token」一致,幅度就當廠商說法看。

如果你想看上一輪兩家旗艦是怎麼交手的,GPT-5.5 對 Claude Opus 4.7 那五個場景的對決那篇的結論到現在還沒翻:純寫程式與視覺推理一邊、agent 與長文本另一邊。這一代的表格只是把同一條分界線畫得更細。

這段能帶走的判斷:Astra 贏的格子集中在終端、代理、科學、數學;輸的兩格是綜合智慧與 HLE。你的工作像前者,看官方表就夠;像後者,往下看獨立評測。


獨立評測怎麼說:AA v4.1.1 打平前代、v4.2 拉開 3.4 分、Epoch 史上最高、ARC 兩個分數

三家獨立評測機構對 GPT-6 Astra 給出三種讀法:Artificial Analysis 9/5 v4.2 智慧指數 Astra 54.7,輸 Claude Fable 5.1 的 56.8、贏上一代 GPT-5.6 Sol 的 51.3。

Epoch AI 的 ECI 169.23 是史上最高;ARC Prize 在兩種 harness 下分別量到 62.7% 與 99.9%。

AA 的版本要特別交代:9/3 評測文章用的 v4.1.1 是 Astra 61.2 對 Sol 60.9、只差 0.29,等於打平;9/5 改版成 v4.2 之後變成 54.7 對 51.3,拉開 3.4 分。

Epoch 那個 169.23 高於 Fable 5.1 的 162.88。同一顆模型,三個機構、三個結論,這才是這一代最真實的樣子。

Artificial Analysis:v4.2 只輸 Fable 5.1,幻覺率與 token 效率大進步

Artificial Analysis 的 GPT-6 Astra 頁面在 9 月 5 日改版成 Intelligence Index v4.2:Fable 5.1 56.8、Astra 54.7、Opus 5 54.1、Fable 5 53.2、Sol 51.3。

Astra 只輸 Fable 5.1,已經越過 Opus 5 與 Fable 5。OpenAI 公告表引用的是 9/3 的舊版 v4.1.1(61.2 對 65.7,當時 AA 文章列全站第 8、Astra 排在三款 Claude 之後)。

兩個版本的順序都是 Fable 5.1 在前,變的是 Astra 跟 Opus 5、Fable 5 誰先誰後。

AA 9 月 3 日的評測文章(v4.1.1 分項)還量到兩件 OpenAI 表格上沒有、對日常使用更有感的事。

第一是幻覺率從 Sol 的 92.2% 降到 51.3%(AA-Omniscience),Fable 5.1 是 72.6%、Opus 5 是 60.8%——這一格 Astra 贏 Fable 5.1 二十幾個百分點。

第二是 GDPval-AA v2 的知識工作 Elo:Astra 1629,不但輸 Fable 5.1 的 1853,連自家上一代 Sol 的 1710 都輸了 81 分,四款旗艦裡最低。

速度欄 AA 9/5 已補上:Astra 87.5 tok/s、上一代 Sol 85.4、Fable 5.1 68.7、Opus 5 59.1——量的是 Standard 模式;Fast mode 的「up to 2x」仍沒有第三方實測。

Epoch AI:綜合指數史上最高,但信賴區間跟 Fable 5 重疊

Epoch AI 的評測儀表板(測試日 8 月 28 到 30 日,預發布版)把 Astra 的 ECI 記為 169.23,史上最高;Fable 5 是 162.9、Fable 5.1 是 162.88、Opus 5 是 162.33、Sol 是 162.03。

看起來拉開了 6 分,但 Astra 的下界 164.85 跟 Fable 5 的上界 166.77 是重疊的,統計上不能寫成「碾壓」。

更有意思的是 Epoch 自己的兩個 benchmark 排序相反。FrontierMath Tier 4 Astra 95.12%,但 FrontierMath-Erdős 只有 2.94%(Sol 是 0%)。

EBR-bench Astra 76.19% 大勝 Fable 5.1 的 47.62%,MirrorCode 卻是 Astra 0.467 輸給 Fable 5 的 0.639。同一家機構、同一顆模型,在不同題型上分別是第一名和落後者。這就是所謂鋸齒狀的能力,不是評測方矛盾。

判讀方式很簡單:你的任務像 FrontierMath 那種封閉的難題,Astra 的天花板最高;像 MirrorCode 那種要先讀懂既有程式再動手改的題,Fable 家族還在前面。Epoch 這幾張分項表,比 ECI 那個總分更接近你會遇到的差異。

ARC Prize:同一顆模型,62.7% 和 99.9% 都是真的

ARC Prize 對 Astra 的評測文(9 月 3 日)給了兩個數字:標準 harness 62.7%、花費 $26,098;用 OpenAI 的 Responses API harness(保留推理+壓縮)則是 99.9%、花費 $18,817。

兩個都是 ARC 自己測的,差別只在 harness。

而且這個分數量的是「相對人類動作效率」(RHAE),不是答對率。ARC 從此雙軌列榜,ARC 排行榜規則只列 $10,000 以下的系統,Astra 兩個都超過門檻。這一段 AGI 論述的部分我不展開,誰說了 AGI、公告頁出現幾次,我在主文那篇拆過

LMArena 在發布兩天後還沒有 Astra 的排名。所以到查證日為止,能拿來跟 Fable 5.1 並排的第三方數字,就是 AA 與 Epoch 這兩家。

把三家當三種量法,而不是三個互相矛盾的答案:AA 量平均、Epoch 量天花板、ARC 量動作效率。你的工作像哪一種量法量的東西,就信哪一家。這跟不會拿使用者滿意度去否定效能測試是同一回事:兩個都對,只是問的問題不同。

這段能帶走的判斷:要做知識工作(報告、分析、文件)看 GDPval(AA 9/3 文章),Fable 5.1 領先 224 分;要做難題與代理,看 Epoch 與 ARC,Astra 領先;要少被騙,看幻覺率,Astra 51.3% 明顯好。


GPT-6 Astra 每題只想一萬個 token:同價的 Claude Fable 5.1 帳單為何是兩倍多

在 Artificial Analysis 9/3 評測文章(v4.1.1)跑智慧指數的同一套題目上,GPT-6 Astra 每題平均輸出 14,934 個 token,Claude Fable 5.1 在 xhigh 檔每題輸出 31,173 個。牌價同樣是 $10/$50,帳單差的全在用量。

換算成每題成本,AA 9/5 v4.2 是 Astra $2.57 對 Fable 5.1 $6.12、差約 2.4 倍;把同一週的中價與平價模型一起按每題成本排層,我在同一週那五款我按每題成本分層的那篇攤開,這裡只講旗艦對旗艦的 token 用量。

拆開來看更清楚。Astra 那 14,934 個 token 裡,答案佔 4,936、思考佔 9,998;上一代 Sol 是 16,879,所以 Astra 還比自家前代少用 11.5%。

Fable 5.1 的 31,173 是 Astra 的兩倍多,Opus 5 的 31,185、Muse Spark 1.3 的 30,543 都在同一個量級——Astra 是這一批旗艦裡唯一把思考 token 壓在一萬左右的。

但 AA 9/5 v4.2 的智慧指數 Fable 5.1 高 2.1 分。所以正確的句子不是「Astra 比較便宜」,是「Astra 用一半的 token 換到少 2.1 分」

這個交換划不划算,只有你的任務能回答:分類、摘要、格式轉換這種「答對就好」的工作,2.1 分可能一點差別都沒有;需要多推一步的分析,那 2.1 分就是你會不會回頭重問的差別。

AA 9/3 文章(v4.1.1)還算了一個數字:以 Sol 的促銷價為基準,Astra 每題比前代貴 75%——牌價 2.5 倍,省下的 token 把它壓回 1.75 倍。

注意這個「2.5 倍」是拿 Sol 的促銷價 $4/$20 算的,那個促銷價官方保證到 2026 年 11 月 21 日,之後如果回到原價,這個倍數會縮小。

我做 PM 最常用的一句話是:單價是給採購看的,用量才是給財務看的。這一代兩家把單價對齊之後,等於把所有的差異都推給用量,而用量是模型自己決定的——你只能選模型,不能選它要想多久。

Fable 5.1 那三萬個 token 的思考,跟前面那格 $0.25 的快取讀取加在一起,就是它的帳單長相:讀得便宜、想得貴。

這段能帶走的判斷:你的任務如果「答對就好」,Astra 每題只燒一半 token 是實打實的省;任務如果「要想深」,Fable 5.1 多出的 2.1 分可能省掉你重問的那一次。


兩家拒答的東西不一樣:GPT-6 Astra 拒 PoC 攻擊碼,Claude Fable 5.1 拒生科題

GPT-6 Astra 與 Claude Fable 5.1 各自有一堵功能牆,方向剛好相反:Astra 明文拒絕撰寫 proof-of-concept 攻擊碼,一般存取下的 PoC 完成率只有 2.4%。

Fable 5.1 則在 LifeSciBench、GeneBench、MedChemBench 三個生科評測上拒答多數題目。OpenAI 腳註 12 的原文是:

refuse the majority of questions

OpenAI 的比較表所以沒列 Fable 那三格的分數。你的工作在哪一邊,這一段直接決定你能不能用。

Astra 這邊:資安工作有一道明確的線

OpenAI 在 GPT-6 Astra 發布公告寫得很直接:

Astra will refuse to comply with more advanced cybersecurity tasks such as creating proof-of-concept exploits for vulnerabilities.

System Card 的數字對照更具體——PoC 撰寫的完成率,一般存取是 2.4%,只有通過 Daybreak Blue 較寬鬆防護的用戶才到 92%;紅隊類任務是 7.4% 對 76.9%。漏洞發掘、分析、修補這三類則兩邊都是 100%。

換句話說,你可以用 Astra 找洞、分析洞、修洞,就是不能叫它寫打進去的那段。而且就算是 Daybreak Blue,任意網安請求也只完整完成 3.5%——寬鬆版也不是全開。

越獄拒答率 Astra 是 91.5%,上一代 Sol 是 59%。這對想繞過限制的人是壞消息,對把它接進公司系統的人是好消息。

還有一件跟拒答不同、但會有同樣體感的事:Astra 的安全監控可能把合法工作誤判為濫用而暫停,而且在 API 上任務會直接停。Path to Astra 的原文是:

The system may occasionally flag legitimate activity as potential cyber misuse or unauthorized behavior

這套機制怎麼運作、被暫停之後你能做什麼,主文那篇有完整的一段,這裡只提醒:長時間跑的 agent 要有被中途停下的心理準備。

Fable 5.1 這邊:生科題官方腳註寫 refuse,轉單規則在另一篇

OpenAI 比較表的腳註 12 寫得很清楚:Fable 5 與 Fable 5.1 在 LifeSciBench、GeneBench、MedChemBench 上拒答多數題目,所以那三列沒有 Claude 的分數。

腳註 12 只寫拒答;至於拒答後會不會轉給 Opus 5 回你,我在 Fable 5.1 那篇的防護段落整理過官方規則,這裡不重複。

對照 HealthBench Professional 那格就有意思了:Astra 63.4%、Fable 5.1 58.1%——但別忘了那格 Claude 的分數是 OpenAI 自己跑的。能確定的只有一件事:做醫療、生科、藥物相關工作的人,Astra 目前是「能回答」的那一邊。

我怎麼判斷該站哪一邊

❶ 做防禦性資安(找洞、修洞、分析):兩邊都可以,Astra 的完成率數字更透明。

❷ 做攻擊性資安(寫 PoC、滲透):Astra 一般存取 2.4%,Fable 5.1 的防護規則另有一套——兩邊都會撞牆,撞法不同。

❸ 做生科、化學、醫療:Fable 5.1 會拒多數題,Astra 是能用的那一邊。

❹ 一般寫程式、寫文件、做分析:兩堵牆你都碰不到,回到前面的價格與跑分去選。

這段能帶走的判斷:拒答不是模型強弱,是廠商決定不賣你什麼。先確認你的工作有沒有落在任何一邊的牆上,再比其他的。


訂閱戶拿得到嗎?ChatGPT 端叫 GPT-6 Pro,Claude 端 Fable 5.1 看 Max 還是 Pro

不寫程式、只用聊天介面的人,兩家給的東西差很多:ChatGPT 裡它不叫 Astra、叫「GPT-6 Pro」,目前以這個名義出現在模型選單的只開給 Pro $100 以上的方案。

Claude 這邊 Fable 5.1 對 Pro 與 Max 都開放,但 Pro 從第一個 token 就走 usage credits 另外計費,Max 是方案內含、上限為週額度的 50%。兩邊的 Free 都拿不到。

你付的 ChatGPT 端(GPT-6 Pro) Claude 端(Fable 5.1)
US$0英文與繁中定價頁對照表 Free、Go 標示 No/否Free 不可用
US$20Plus:官方三處說法不同,說明中心限縮到 Work 與 Codex 的有限額度Pro:可用,但按 API 費率走 usage credits
US$100Pro $100:GPT-6 Pro 每週 50 則,與 Sol Pro 共用同一份Max(官方頁 From $100):方案內含,上限週額度 50%
更高檔Pro $200:每週 200 則Max 高階檔:同上,額度池更大

ChatGPT 那一欄的 Plus 是整張表最需要自己驗證的一格。公告寫「all ChatGPT Plus」、英文定價頁標 Yes(繁中頁同一格是「有限額」)、說明中心卻限縮到 Work 與 Codex、且是「limited Astra usage」:

Plus plans include GPT‑6 Astra in ChatGPT Work and Codex

三處口徑不同,最準的方法是自己打開模型選單看

額度怎麼撞牆、Pro $200 撞牆後自動切到哪個模型、其他檔只能自己換或等重置,GPT-6 Astra 到底誰用得到、Pro 一週幾則的主文裡有完整的表,這裡不重複。

Claude 那一欄要注意的是「Pro 可用」的真正意思。Pro 月繳 $20(年繳折合 $17)用 Fable 5.1 不是免費,是另一張按 API 費率算的帳單;Max 那個 50% 是上限不是加碼,而且 Fable 系列吃額度比其他模型快。

Fable 也不是任何方案的預設,Claude Code 要更新到 2.1.255 以上(官方三處版本號有出入,以說明中心為準)、自己打 /model fable。方案改制那一輪怎麼算,Fable 5 剛移出 Pro 時我逐條算過的三條路現在還適用。

台灣這邊的價格,ChatGPT 官網以美金顯示,App Store 內購是 Plus NT$690、Pro 5x NT$3,300、Pro 20x NT$6,990(Apple 內購價,非官網結帳價)。

Claude 消費端也是美金計價,Pro $20 月繳、Max 從 $100 起。兩家官網我查到的都是美金計價。

兩家的限制寫法不同:ChatGPT 端的限制寫在「則數」,Claude 端的限制寫在「額度比例」。前者你數得出來、後者你感覺得到。

Pro $100 那格的 50 則是 GPT-6 Pro 跟 Sol Pro 共用的同一份,用完兩個 Pro 都沒了,只能換別的模型或等介面顯示的重置時間;Claude Max 的 50% 則是「你可以把一半的週額度拿去給 Fable 燒,燒完自己看著辦」。

這段能帶走的判斷:付 US$20 的人,Claude 這邊確定能用但要另付、ChatGPT 這邊要自己開選單驗證;付 US$100 以上才是兩邊都「內含」,而內含的計量單位一邊是則數、一邊是比例。


預算到不了旗艦:Gemini 3.8 Flash、Muse Spark 1.3、Qwen3.8-Max 在哪層

如果 $10/$50 的旗艦價本來就不在你的預算內,同一週發布的 Gemini 3.8 Flash($0.75/$3.75)、Muse Spark 1.3($1.25/$4.25)與 Qwen3.8-Max-0902 是實際會拿來對照的三款。

最值得看的一格:Muse Spark 1.3 在 AA 9/5 v4.2 的智慧指數 53.0,只比 GPT-6 Astra 的 54.7 低 1.7 分,每題成本不到 Astra 的四成。

模型 牌價(輸入/輸出) AA 9/5 v4.2 智慧/每題成本 便宜的條件
GPT-6 Astra$10/$5054.7/$2.57272K 內、快取讀取佔比低
Claude Fable 5.1$10/$5056.8/$6.12反覆重讀長脈絡才吃得到 $0.25
Muse Spark 1.3$1.25/$4.25(Contributor 檔 $0.10/$0.20)53.0/$0.96折扣檔要讓 Meta 用你的資料訓練,RPM 只剩 1/30
Gemini 3.8 Flash$0.75/$3.7547.1/$0.74介紹價到 2026-12-31,之後翻倍;會多跑幾趟

Qwen3.8-Max-0902 我沒放進表,因為這篇比的是牌價與每題成本,而它這次真正的變化在快取結構——顯式快取 $0.17、建立時要付 1.25 倍、只活 5 分鐘,同一段脈絡用不到 8 次別開顯式快取。

這條線我在Qwen 顯式快取要重複幾次才划算的那篇裡整段算過。

先講 Muse Spark 1.3,因為它最容易被誤讀。53.0 那個分數是 max 檔的,每題成本約是旗艦的三分之一到四成;幻覺率 31.5%(AA 9/3 文章)更是全表最低。

但它便宜的條件寫在 Contributor 檔的定價裡:$0.10/$0.20 那組價格的代價是 Meta 可以用你的資料訓練,而且速率限制只剩標準檔的三十分之一。

拿公司程式碼去跑折扣檔的人,先看一眼自己的資料規範。細節在便宜 21 倍但速率只剩 1/30 的 Muse Code 那篇

Gemini 3.8 Flash 則是另一種便宜法:牌價三代同價,但官方公告自己承認它「works harder」、可能多用 token,AA 9/3 文章(v4.1.1)量到它的每題成本比上一代 3.7 Flash 高 43.4%。

而且這個 $0.75 是介紹價,2026 年 12 月 31 日到期後變 $1.50/$7.50。

Terminal-Bench 4.0 它只有 19.1%,跟 Astra 的 57.9% 不在同一個世界——它便宜,但代理任務不是它的場子。Google 自己在公告裡勸你可以不要換的那一句,我整篇拆過。

速度這一欄(AA 9/5 v4.2)也值得看一眼:Muse Spark 1.3 190 tok/s、Astra 87.5、Fable 5.1 68.7;Gemini 3.8 Flash 在 AA 9/3 文章量到 397.6。

便宜的模型也快,貴的模型也慢,這一代是這樣。要即時互動的產品,這格比智慧分數更決定使用者體感。

我自己的用法是把 Muse Spark 1.3 當「先跑一遍」的工具:分類、初稿、篩選用它,通過的再丟旗艦。這不是這篇的主軸——五款怎麼按預算擺、哪一款先看,同一週幾款新模型該先看哪一款的那篇是專門做這件事的,這裡只給旗艦以外的三個座標。

這段能帶走的判斷:預算卡在旗艦之下,Muse Spark 1.3 標準檔是這週智慧/價格比最高的一款,但 Contributor 折扣檔先過資料規範;Gemini 3.8 Flash 便宜且快,代理任務除外,年底前記得它會漲價。


所以 GPT-6 Astra 和 Claude Fable 5.1 我會怎麼配?三種人的選法

GPT-6 Astra 和 Claude Fable 5.1 我兩邊都用,但不是隨機分:單筆短、答對就好、批次跑的工作給 Astra;反覆重讀同一份長脈絡、或單筆超過 272K 的工作給 Fable 5.1;生科醫療題只能給 Astra,攻擊性資安兩邊都不給。把前面所有東西收成一張表。

你是誰 我會選 理由(對應哪一格)
不寫程式、只用聊天介面 看你已經付哪一家 ChatGPT 端要 Pro $100 起才穩拿 GPT-6 Pro;Claude 端 Pro 能用但另付 credits、Max 內含
開發者,短任務、批次、分類摘要 GPT-6 Astra 每題輸出 token 14,934 對 31,173(AA 9/3 文章);Batch 同價下 Astra 的用量只有一半
開發者,長時 agent、大 codebase Claude Fable 5.1 快取讀取 $0.25、1 小時快取寫入、沒有 272K 那條線
知識工作:報告、分析、文件 Claude Fable 5.1 GDPval-AA Elo 1853 對 1629(AA 9/3 文章);智慧指數高 2.1 分(AA 9/5 v4.2)
生科、化學、醫療 GPT-6 Astra Fable 5.1 拒多數題;HealthBench 63.4% 對 58.1%(OpenAI 自測)
怕它一本正經講錯 GPT-6 Astra 幻覺率 51.3% 對 72.6%(AA 9/3 文章)

我自己的配法,講給你當參考、不是標準答案。

❶ 部落格與長篇內容的判斷、需要前後文互相對照的分析,留在 Claude Fable 5.1。理由不是它比較聰明(雖然指數上它是),是我的工作流會反覆讀同一份素材,快取讀取那格 $0.25 對我有感。

❷ 自動化雜活——分類、抽欄位、格式轉換、批次摘要,丟給 GPT-6 Astra 的 Batch。$5/$25 的 Batch 價兩家一樣,但 Astra 每題燒的 token 只有一半,同樣的錢跑的量差一倍。

❸ 每個月換一次的功課:11 月 21 日 Sol 促銷價到期後,「Astra 比前代貴 2.5 倍」這個倍數要重算;快取讀取佔比也要重看一次,因為模型換版之後我的用法會跟著變。這兩個日期我都記在行事曆上。

🧭 換邊之前的三個檢查

  • 抓快取讀取佔比:從帳單後台或 API 回應的用量欄位,看重讀 token 佔輸入的多少——高於一半,Fable 5.1 的 $0.25 就是你的主戰場。
  • 抓單筆最大輸入:最近一個月有沒有請求超過 272K 又切不動——有,Astra 那一筆是整筆兩倍價。
  • 看拒答牆:生科化學題 Fable 5.1 會拒、PoC 攻擊碼 Astra 會拒——你的工作落在任一邊,另外兩個檢查都不用做了。

三家一起選、不只兩家的話,Claude、ChatGPT、Gemini 三家到底怎麼選的購買建議那篇是總入口;只在 Claude 家族裡挑,Fable、Opus、Sonnet、Haiku 的 30 秒決策樹更直接。

上一代 ChatGPT 5.6 三個版本怎麼分、你付的錢用到哪一版,那篇的方案表到今天大部分還適用,只是選單裡多了一列 GPT-6 Pro。

這段能帶走的判斷:不要選「一家」,選「哪一格給哪家」。同價的兩個供應商,正確的用法是把帳單拆開,讓每一格都落在便宜的那一邊。


FAQ 常見問題

長文件該用 GPT-6 Astra 還是 Claude Fable 5.1?

單筆輸入經常超過 272K token 又切不動的,選 Claude Fable 5.1。Astra 超過 272K 的請求是整筆用 2 倍輸入價、1.5 倍輸出價計算,不是只算超出的部分;Fable 5.1 的 100 萬視窗全段同價,官方寫 900K 與 9K 同費率。

文件能切成 272K 以下分批送的話,兩邊價格回到同一量級,再看快取讀取佔比決定。

ChatGPT 和 Claude 都訂了,要退哪一家?

先看你付的是哪一檔。付 US$20 的人:Claude Pro 用 Fable 5.1 要另付 usage credits;ChatGPT Plus 能不能在聊天選單拿到 GPT-6 Pro,主文那篇有三處官方說法的對照

付 US$100 以上的人兩邊都內含,差的是計量單位——ChatGPT 是每週則數,Claude Max 是週額度的 50%。兩家都留的理由只有一個:工作流有一半重讀長脈絡、一半是批次雜活,各吃到一邊的便宜格。

GPT-6 Astra 比 Claude Fable 5.1 聰明嗎?

看你要量的是哪一項。AA 9/5 v4.2 智慧指數 Fable 5.1 56.8 高於 Astra 54.7,GDPval-AA 知識工作 Elo(AA 9/3 文章)也是 Fable 5.1 1853 對 1629。

但 Epoch AI 的 ECI Astra 169.23 是史上最高、高於 Fable 5.1 的 162.88,OpenAI 自家表上 Terminal-Bench 4.0、DeepSWE、FrontierMath、GPQA 等多數項目 Astra 領先。

幻覺率 Astra 51.3% 明顯好於 Fable 5.1 的 72.6%(AA 9/3 文章)。綜合與知識工作看 Fable 5.1,難題、代理與不亂講看 Astra。

GPT-6 Astra 的 Fast mode 什麼情況才該開?

只在「等待時間本身有成本」的場景開。Fast mode 是輸入 $20、輸出 $100 的 2 倍價,官方寫「up to 2x the speed」且「does not include a latency SLA」,付兩倍換的是最多兩倍速、不是保證。

超過 272K 再疊上去是 $40/$150;歐盟資料落地端點不能用。批次、非即時、排程跑的工作不該開,那些反而該走半價的 Batch。

AA 9/5 量到 Astra Standard 模式 87.5 tok/s(Fable 5.1 68.7);Fast mode 的實際倍率仍沒有第三方數字。

不會寫程式的人,GPT-6 Astra 和 Claude Fable 5.1 差別在哪?

差在三件你在聊天視窗就會遇到的事。第一,名字:ChatGPT 裡它叫 GPT-6 Pro,Claude 裡叫 Fable 5.1 且不是預設要自己選。第二,門檻:ChatGPT 端穩拿要 Pro $100 起,Claude 端 Pro $20 能用但另付、Max 內含。

第三,知識截止:Astra 停在 2026 年 4 月 30 日、Fable 5.1 到 6 月,問今年下半年的事兩邊都要開搜尋。快取、272K 那些 API 的格子,聊天訂閱戶碰不到。


寫在最後:同價之後,帳單搬到了合約細則裡

GPT-6 Astra 與 Claude Fable 5.1 把牌價對齊,是我追這幾代模型以來第一次看到兩家旗艦的輸入輸出價一模一樣。以前寫比較文,第一段永遠是「誰比較貴」;這篇的第一段寫不出來,因為答案是「一樣」。

但寫到最後我反而覺得這是好事。單價一樣,代表廠商終於不能靠一個數字贏你,得靠細則。快取讀取的倍率、272K 那條線、1 小時快取、拒答的方向、每題燒多少 token——這些以前躲在定價頁腳註裡的東西,現在就是全部的差異。

看得懂的人帳單會變薄,看不懂的人繼續為同一件事付兩種價。

採購桌上最難談的從來不是報價高的那家,是報價一模一樣的兩家——你得回頭翻自己的帳單才知道該簽誰。這一代的 AI 旗艦,正在變成那種東西。

兩家的帳單我每個月都會再拆一次,想跟著看的可以訂閱我的部落格,會不定期收到信;關於夜羽凌那頁寫了我為什麼同時付兩家。

9 月 1 到 3 日三天內五款新模型(三家旗艦+Muse Spark 1.3+Qwen3.8-Max-0902)怎麼按預算排,接著讀我把那五款按每題成本分層排開的那篇;想看這一輪的「同價」是怎麼從上一輪的「Fable 最貴」走過來的,上一輪五大模型的價格與跑分總表還在。


參考資料

 

延伸閱讀