💡 核心結論速覽 (TL;DR)
- 價格沒漲:Claude Opus 5 的 API 維持每百萬 token 輸入 5 美元、輸出 25 美元,跟 Opus 4.8 完全同價,只要 Fable 5 的一半。
- 訂閱戶沒得選:官方明講 Opus 5 已是 Claude Max 的預設模型、Claude Pro 上最強的模型——你什麼都沒改,模型已經換了。
- 省的和多的不是同一種 token:官方說平均少產生 26% token,你卻會覺得它話變多——省在思考、多在寫給你看的字,調 effort 沒用。
- 先做這件事:把提示詞裡「請再檢查一遍」「最後加一個驗證步驟」整段刪掉,官方文件直說這在 Opus 5 上只會多燒錢。
我每天用 AI 超過十小時,同時養著兩家 200 美元等級的訂閱,所以模型換代對我來說從來不是新聞稿,是隔天早上的工作流會不會突然卡住。
Claude Opus 5 在 2026 年 7 月 24 日上線,價格一毛沒漲、跑分全面往上。聽起來是那種「不用想、直接換」的版本對吧?
但我把官方文件逐頁讀完之後,發現真正該擔心的不是它強不強,而是你手上那套用了半年的用法,有幾條會在 Opus 5 上反過來扣你的分。有一條甚至是幾乎每一篇中文 prompt 教學都在教、而官方現在叫你刪掉的。
先講最容易被忽略的那件事:這次你可能根本沒有「要不要換」的選擇權。
Claude Opus 5 是什麼?先確認你到底有沒有得選
它是 Anthropic 在 Opus 這條線上的新旗艦,定位是「複雜的代理式寫程式與企業工作」。但對多數人來說更關鍵的一句話,藏在官方發表公告裡:
Opus 5 是 Claude Max 的新預設模型,也是 Claude Pro 上最強的模型。
翻成人話:如果你是 Max 用戶,你今天早上打開 Claude,對話框後面接的已經不是 Opus 4.8 了。你沒有點過任何按鈕,模型就換了。
這就解釋了一件我這兩天一直看到有人在問的事——「我什麼設定都沒動,怎麼覺得 Claude 最近怪怪的、回答變長了?」那不是你的錯覺,也不是老掉牙的突然變慢變笨到底是不是被降智的那套陰謀論,就只是模型真的被換掉了而已。
目前它出現在四個地方:Claude API(模型代號 claude-opus-5)、Claude.ai 聊天版、Claude Code,以及 Claude Cowork。
這段你可以帶走的一件事:先進去看一眼你現在用的是哪個模型。如果你是 Pro 或 Max,接下來這幾段的「舊習慣」你也逃不掉,因為它們有一半是提示詞層面的問題,不是 API 參數的問題。
Opus 5 比 Opus 4.8 強在哪?三個數字比跑分表更有感
直接說結論:官方公布的跑分是全面往上,而且「往上的幅度」大到有點反常。以下都是官方自評數字,我照原文轉述,不加油添醋。
- Frontier-Bench v0.1(從工程圖說做出可運作軟體):超越所有其他模型,成績是 Opus 4.8 的兩倍以上。
- CursorBench 3.2:跟 Fable 5 的最佳成績差距不到 0.5%,但每題成本只要一半。
- ARC-AGI 3:官方說是次佳模型的三倍。(實際榜單可在文末參考資料自行查核。)
- OSWorld 2.0(電腦操作):超過 Fable 5 的最佳結果,成本大約只要三分之一。
- Zapier AutomationBench:通過率約為次佳模型的 1.5 倍。
跑分我一向只看趨勢不看小數點,真正讓我覺得「這代不一樣」的是另外三個數字。
❶ 少 26% 的 token。 官方原話是:在達成相似表現的前提下,平均比 Opus 4.8 少產生 26% 的 token。這句話後面藏著一個大坑,我下一段整段拿來拆。
❷ 工具使用的固定開銷砍到剩四成多。 這個藏在官方定價文件的工具使用計價表裡:只要你的請求帶了工具,系統會自動塞一段提示詞進去,Opus 4.7 要吃掉 675 個 token,Opus 4.8 是 290,Opus 5 只要 286。你如果在跑一個一天呼叫上千次工具的自動化流程,這個固定成本是真的會反映在帳單上。
❸ 官方自己承認的弱項。 公告裡明寫它在資安任務與生物研究能力上仍落後 Mythos 5。一家公司願意在發表當天把「我們哪裡還不行」寫進公告,這件事本身比跑分更值得記一筆。
這段你可以帶走的一件事:如果你的工作是多檔案重構、長時間代理任務、或是要模型看懂圖表跟簡報,這次的提升值得你花一個下午重新測一輪。如果你只是拿它寫寫社群文案,說真的,差別不會大到讓你有感。
Opus 5 價格怎麼算?同價、半價,還有一個兩倍價的隱藏檔
先把四個現役模型的牌價攤在同一張表上,這樣「同價」跟「半價」才有比較基準。
| 模型 | 輸入 / 百萬 token | 輸出 / 百萬 token | 一句話定位 |
|---|---|---|---|
| Claude Fable 5 | US$10 | US$50 | 最難的推理與超長任務 |
| Claude Opus 5 | US$5 | US$25 | 複雜代理與寫程式的主力 |
| Claude Opus 4.8 | US$5 | US$25 | 上一代旗艦,同價 |
| Claude Sonnet 5 | US$2 | US$10 | 高量產工作的性價比檔 |
看到重點沒有?Opus 5 跟 Opus 4.8 同價——這代表對 API 使用者來說,留在 4.8 沒有任何價格上的理由,除非你有版本釘死的需求。
而 Fable 5 是它的兩倍價,可是 CursorBench 上兩者差距不到 0.5%。這就是這次改版最尖銳的地方,也讓我原本為了 Fable 5 到底該不該加訂而算過的那筆帳,整個要重算一次。
順帶提醒一件會過期的事:Sonnet 5 的 2 美元/10 美元是優惠價,官方文件標明只到 2026 年 8 月 31 日,9 月 1 日起回到 3 美元/15 美元。你如果正在做明年的 SaaS 訂閱預算,這個日期要記進去。
三個能砍帳單、但很多人沒開的開關
❶ Batch API 直接打五折:不趕時間的批次任務丟 Batch,單價變成 2.5 美元/12.5 美元。我自己所有的例行整理都走這條。
❷ 提示詞快取讀取只要一折:重複的長系統提示做快取,命中的部分算 0.5 美元/百萬 token。長對話跟 agent 迴圈的省幅大到會嚇到你。
❸ 1M 脈絡窗不另外加價:官方文件寫得很清楚,長文不收長文費,90 萬 token 的請求跟 9 千 token 的請求是同一個單價。
反過來,有一個檔會讓你付兩倍:Fast mode。它跑的是同一顆模型、速度約 2.5 倍,但價格變成 10 美元/50 美元,而且只在第一方 Claude API 上有。急件才開,不要當預設。
訂閱端的話,Claude Pro 是月繳 20 美元、年繳攤下來約 17 美元;Max 從 100 美元起跳,分 5 倍與 20 倍兩檔。
以 1 美元約 31 元新台幣估算,Pro 大約落在 620 元、Max 起跳約 3,100 元一個月(依當日匯率浮動)。這種每月固定扣款的海外訂閱,刷哪張卡的差別一年下來很可觀,我另外把海外手續費跟信用卡回饋實際算過一遍,也順手戳破了「台幣計價免手續費」這個迷思。
為什麼它「省 26% token」,我卻覺得它變囉唆?
因為省的和多的,根本不是同一種 token。這是這次改版最容易讓人誤判帳單的地方,也是我認為所有中文報導都漏掉的一段。
模型花掉的 token 可以粗分成兩個帳戶:一個是思考帳戶(它自己在腦內推演,你看不到),另一個是輸出帳戶(它寫給你看的字)。官方那句「少 26%」講的是整體平均,主要省在思考帳戶——公告裡甚至提到在部分任務上只用了大約七分之一的推理 token、延遲不到一半。
但官方的提示詞指南同時承認:它給使用者看的回應,預設就是比前幾代 Opus 更長。它寫到硬碟上的檔案——報告、Markdown 文件、摘要——也更長。
兩件事加起來,就是你會有的那個體感:帳單可能真的下降了,閱讀負擔卻上升了。
最容易踩的坑是接下來這一步。多數人的直覺反應是「那我把 effort 調低就好了吧」——這招沒用。官方 effort 文件寫得毫不客氣:effort 控制的是它想多久,不是它講多長,在 Opus 5 上調 effort 不會可靠地縮短可見回應,要控制長度請用提示詞。
⚠️ 我踩過的雷:我第一天就是照舊習慣把 effort 從 xhigh 拉到 medium,想讓它「講短一點」。結果回應長度幾乎沒變,倒是幾個要拆步驟的任務品質掉了。白白繞一圈,才回頭去讀文件。
正確做法是在系統提示詞或自訂風格裡加一句話。官方給的範例大意是:「回應保持聚焦、簡短;免責與注意事項寫短一點,把篇幅留給主要答案;被要求解釋時先給高層次摘要,除非對方明確要求深入。」
聊天版沒有系統提示詞欄位怎麼辦?用「自訂風格」。這是我認為 Claude 最被低估的功能,設定一次就全域生效,不用每次重講——我把 Projects、記憶跟風格一次調成不用重講背景的專屬助理那套設定,現在剛好可以直接拿來壓這次的話癆問題。
這段你可以帶走的一件事:今天就去自訂風格裡加一句「回答保持簡短聚焦,先給結論」。這是投報率最高的一個動作,三十秒。
舊習慣一:「請你再檢查一遍」現在要整句刪掉
這條反直覺到我讀了兩次才確定沒看錯。
官方提示詞文件明白寫著:如果你的提示詞裡有明確的驗證指令——「任何非瑣碎的任務都要加一個最終驗證步驟」「用子代理驗證」——請把它們移除。因為 Opus 5 本來就會自己驗證,這些指令會疊加成過度驗證,多燒 token 而且品質沒有變好。
連「double-check your answer」「回答前再確認一次」這種我們寫了三年的句子,官方也點名說不要再寫。
你發現問題在哪了嗎?「請 AI 自我檢查」幾乎是所有 prompt 教學的通用建議,包括我自己過去寫的那些讓 Claude 別再給罐頭答案的提示詞模板裡也有。它在絕大多數模型上是對的,在 Opus 5 上剛好是錯的。這就是模型換代最陰險的地方——不會報錯,只會默默多收你錢。
同一段還提到另一個相關行為:它會自己擴大任務範圍,多做你沒要求的事,或自行判斷「這個任務應該長什麼樣」。你如果是丟一個很窄的需求給它,記得補一句限縮:交付被要求的東西、維持原本的範圍,覺得需求有問題就用一句話講出來然後照做,不要默默把任務改掉。
這段你可以帶走的一件事:打開你最常用的那組提示詞,搜尋「檢查」「驗證」「確認一次」四個詞,看到就刪。這不用花錢測試,刪掉就是省。
舊習慣二:effort 別再從 xhigh 開始,官方自己改口了
如果你有在調 effort 這個參數,這段是本篇對你最值錢的一段。
effort 是 Claude 的「用力等級」,從 low、medium、high、xhigh 到 max 五檔,預設是 high。它管的是模型願意花多少 token 在整個回應上,包含思考跟工具呼叫。
重點來了。官方 effort 文件裡,Opus 4.7 跟 Opus 4.8 的建議是同一句話:「coding 與代理式工作從 xhigh 開始」。到了 Opus 5 那一段,官方改成:
從預設的
high開始,再依你自己的評測調整;low與medium請大方使用,把它們當成控制 token 成本與回應時間的主要手段。如果你把 effort 設定從前代模型直接沿用過來,請重跑一次 effort 掃描,不要沿用。
官方在同一頁裡,把上一代的建議跟這一代的建議並排寫出來,等於承認了改口。理由也很直白:它在 low 跟 medium 的品質,好到可以用零頭的 token 與延遲撐住。
以我這兩天的用法,我的分配大概是這樣:例行整理、分類、摘要一律 low;日常寫程式跟改稿走 medium;只有跨檔案重構跟長時間代理任務才拉到 xhigh。max 我幾乎沒動過,那是留給你確定值得燒的題目。
⚠️ 兩個容易忘的細節:第一,effort 跑到
xhigh或max時要把max_tokens開大(官方建議從 64k 起跳),不然會被截斷。第二,effort 是請求層級的設定,同一段對話中途改值會讓提示詞快取失效——長 session 請一開始就選定,不要中途調。
這段你可以帶走的一件事:拿三個你最常跑的任務,各跑一次 low 跟 high,比對輸出。多數人會發現有一半的任務可以永久降檔,那是每個月實打實的錢。想再往下壓,可以接著看不升級 Max 也能讓用量砍半的十個習慣。
舊習慣三與四:關掉思考、放養子代理,這兩件事現在會咬人
這兩條主要衝著 API 跟 Claude Code 的使用者來,但影響的是錢,所以值得放進來。
舊習慣三:為了省錢直接關掉思考
它的思考是預設開啟的,這跟 Opus 4.8、4.7 相反——那兩代不寫 thinking 參數就等於不思考。所以一份直接沿用的舊程式碼,換過來會突然開始花思考 token,而 max_tokens 是思考加輸出的總上限,抓太緊就會被截斷在半句話。
更麻煩的是,你不能無腦關掉它。官方規則是:thinking: disabled 只在 effort high 以下能用,配 xhigh 或 max 會直接回 400 錯誤。而且是逐次請求檢查的,前面幾次成功不代表後面調高 effort 那次不會被打槍。
官方還列了關掉思考時的兩個副作用,第一個我覺得特別陰險:
- 工具呼叫被寫成純文字:模型偶爾會把該用結構化格式送出的工具呼叫,直接寫進給你看的文字裡。這一輪會正常結束、不會報錯,但那個呼叫根本沒有執行。在代理迴圈裡,這段假文字還會留在對話歷史裡繼續污染後面的回合。
- 內部標籤外洩:可能把
<thinking>之類的內部 XML 標籤吐進回應裡。而且官方特別警告:如果你的系統提示詞裡有「不要思考」「不要推理」這種規則,請刪掉,那反而讓標籤更容易外洩。
官方給的正解很乾脆:不要為了省錢關思考,改用低 effort。原文的說法是,對多數任務來說「開著思考跑 low」比「關掉思考」在相近成本下表現更好。
舊習慣四:讓它自由派子代理
這一代比前代更愛派子代理。這在真正能平行處理的大任務上是好事,但套到小任務上就是成本與時間雙殺——每個子代理都要重新建立脈絡、重新探索、回報一次,然後主代理再把回報讀一遍。
官方的建議是給明確的授權規則,或直接設一個數量硬上限。我自己的規則簡化成一句:幾次工具呼叫就能自己做完的事,不准外包;也不准用子代理來檢查自己的工作。後面這半句跟舊習慣一是同一件事的兩個面向。
這類 agent 帳單暴增的狀況我之前追過一輪,一個任務燒掉好幾美元的真相跟砍半心法那篇的排查邏輯在 Opus 5 上依然適用,只是這次要多看一欄「它派了幾個代理出去」。
四個舊習慣一次看
| 你的舊習慣 | 換過來會怎樣 | 改法 |
|---|---|---|
| 寫「請再檢查一遍」 | 疊成過度驗證,多燒 token、品質沒變好 | 整句刪掉,它本來就會自己驗 |
| effort 從 xhigh 起跳 | 成本與延遲被墊高,官方已改建議 | 回到預設 high,大方用 low/medium |
| 關掉思考來省錢 | 工具呼叫可能變純文字不執行、標籤外洩 | 思考開著,改用低 effort 控成本 |
| 讓它自由派子代理 | 小任務被外包,成本與時間雙殺 | 設數量上限+禁止用子代理驗證 |
那到底要不要換?三種人的決策框架
我把「該不該動」拆成三種身分,你對號入座就好。
❶ 你是 Claude Pro / Max 訂閱戶(不碰 API)
- 要不要換:你已經被換了,Max 是預設、Pro 是最強選項。
- 該做的事:去自訂風格加一句控制長度的指令,然後把提示詞裡的「再檢查一遍」刪掉。
- 成本:0 元,純設定。
❷ 你在用 API 或 Claude Code,之前跑 Opus 4.8
- 要不要換:換。同價、跑分更好、工具開銷更低,留在 4.8 沒有價格理由。
- 該做的事:改模型代號、重跑一次 effort 掃描(別沿用 xhigh)、確認沒有
thinking: disabled配xhigh的組合、把驗證指令刪掉、給子代理設上限。 - 成本:一個下午的測試時間,換來的是每個月的帳單。
❸ 你在付 Fable 5 的兩倍價
- 要不要換:先測,別急著砍。CursorBench 差距不到 0.5% 是官方自評的單一情境,你的任務不一定一樣。
- 該做的事:挑三個最吃重的真實任務,兩邊各跑一次,比對品質差距值不值那多出來的一倍錢。
- 成本:測試的 token 錢,通常一杯咖啡以內。
什麼情況我會建議你先不要動
❌ 你的產出需要跨月穩定重現:學術、稽核、法遵這類場景,模型行為變動本身就是風險,先在測試環境跑完再說。
❌ 你的提示詞是外包寫的、你不敢動:那些驗證指令跟 effort 設定沒人改,換過去只會多花錢又拿不到好處,先找得到人維護再換。
❌ 你只是拿它閒聊或寫短文案:老實說,這種用途你用 Sonnet 5 就夠了,價格是 Opus 5 的四成不到。我把各家模型的分工邏輯整理在Fable 5、Opus、Sonnet、Haiku 我每天實際怎麼分派那篇,還有Sonnet 5 用六成價追平旗艦的那個陷阱可以一起看。
👉 前往 Claude 官方方案頁確認目前價格(Anthropic 以美元計價,台幣金額依當日匯率浮動)
FAQ 常見問題
Opus 5 跟 Fable 5 該選哪一個?
先看預算再看任務。Fable 5 是 Opus 5 的兩倍價,官方自評在 CursorBench 上兩者差距不到 0.5%、OSWorld 上 Opus 5 甚至以約三分之一成本超過 Fable 5 的最佳結果。
我的判斷是:把 Opus 5 當主力,只有在真的撞到天花板、而且那個任務值得燒兩倍錢時才切 Fable 5。切之前務必用你自己的任務實測,不要相信任何人的跑分表——包括我的。
我沒改任何設定,為什麼 Claude 最近回答變長了?
因為模型被換掉了。官方公告寫明 Opus 5 是 Claude Max 的新預設模型、Claude Pro 上最強的模型,而新版的預設回應本來就比前幾代 Opus 長。解法不是降 effort(官方明講那不會可靠縮短可見回應),而是在自訂風格或系統提示詞裡直接要求簡短。三十秒設定,全域生效。
換過去之後帳單真的會少 26% 嗎?
不一定,而且我會建議你別這樣期待。那是官方在特定評測情境下的平均值,指的是「達成相似表現時少產生的 token」,主要省在思考端。你的實際帳單同時受回應長度、工具呼叫次數、子代理數量影響——而後兩項在 Opus 5 上反而有上升傾向。想真的省,Batch API 五折跟提示詞快取一折的影響遠大於這 26%。
踩到「工具呼叫沒執行」的雷之後怎麼補救?
先確認你是不是設了 thinking: disabled——這個副作用只在關掉思考時出現。最乾淨的修法是把思考打開、改用低 effort 控制成本。
如果整合上非得關思考,官方給的緩解句大意是:使用工具時可以先講一句話;沒有合適的工具就直說而不要硬猜;不要在回應裡輸出內部或系統 XML 標籤。另外記得把系統提示詞裡「不要思考」這類規則刪掉,那會讓情況更糟。
非工程師需要學到 API 這一層嗎?
不需要。訂閱戶只要做兩件事:自訂風格加一句控制長度、提示詞裡的驗證指令刪掉,這篇八成的效益你就拿到了。真的想再往前一步,我整理過非工程師該不該學 Claude Code 的判斷標準跟我用三個月後的真心話,可以先看完再決定要不要投時間。
結論:這次要改的不是模型,是你的手感
這一代最有意思的地方,不在跑分表上。它是我印象中第一次,官方文件花了整整一頁在教你「把以前教你寫的東西刪掉」——刪驗證指令、刪 xhigh 預設、刪「不要思考」那條規則。
這件事對我這種每天靠 AI 排工作流的人來說是個提醒:我們累積的那些「祕訣」,其實有保鮮期。模型每一次變強,都是在把你辛苦補上的那些拐杖收走;你如果沒跟著收,那些拐杖就會反過來絆你。
所以如果你今天只做一件事,我建議是最便宜的那一件:打開你最常用的提示詞,把「請再檢查一遍」刪掉,然後補上一句「回答簡短一點,先給結論」。不用花一毛錢,也不用等誰的評測。
然後過兩週再回頭看你的帳單跟閱讀時間,你會知道我在講什麼。
覺得這種「模型換代要跟著改什麼」的整理對你有用的話,訂閱夜羽凌的部落格,我會不定期把這類實測心得寄給你;也可以直接看最強的那個不一定是你最該付錢的那個這篇跨家比較,或回頭看 Opus 4.8 當初的升級重點跟 Fast Mode 怎麼用,對照著看會更清楚這條產品線在往哪走。
參考資料
- Anthropic — Introducing Claude Opus 5(官方發表公告、跑分與方案定位)
- Claude Platform Docs — Pricing(各模型單價、Batch、快取、Fast mode、工具使用計價)
- Claude Platform Docs — Effort(五檔用力等級與 Opus 5 專屬建議)
- Claude Platform Docs — Prompting Claude Opus 5(回應長度、過度驗證、子代理、關閉思考的副作用)
- Claude — 官方方案與訂閱價格
- ARC Prize — ARC-AGI 公開榜單