Claude Opus 5 值得換嗎?同價省 26% token,這 4 個舊習慣先改掉

目錄

💡 核心結論速覽 (TL;DR)

  • 價格沒漲:Claude Opus 5 的 API 維持每百萬 token 輸入 5 美元、輸出 25 美元,跟 Opus 4.8 完全同價,只要 Fable 5 的一半。
  • 訂閱戶沒得選:官方明講 Opus 5 已是 Claude Max 的預設模型、Claude Pro 上最強的模型——你什麼都沒改,模型已經換了。
  • 省的和多的不是同一種 token:官方說平均少產生 26% token,你卻會覺得它話變多——省在思考、多在寫給你看的字,調 effort 沒用。
  • 先做這件事:把提示詞裡「請再檢查一遍」「最後加一個驗證步驟」整段刪掉,官方文件直說這在 Opus 5 上只會多燒錢。

我每天用 AI 超過十小時,同時養著兩家 200 美元等級的訂閱,所以模型換代對我來說從來不是新聞稿,是隔天早上的工作流會不會突然卡住。

Claude Opus 5 在 2026 年 7 月 24 日上線,價格一毛沒漲、跑分全面往上。聽起來是那種「不用想、直接換」的版本對吧?

但我把官方文件逐頁讀完之後,發現真正該擔心的不是它強不強,而是你手上那套用了半年的用法,有幾條會在 Opus 5 上反過來扣你的分。有一條甚至是幾乎每一篇中文 prompt 教學都在教、而官方現在叫你刪掉的。

先講最容易被忽略的那件事:這次你可能根本沒有「要不要換」的選擇權。


Claude Opus 5 是什麼?先確認你到底有沒有得選

它是 Anthropic 在 Opus 這條線上的新旗艦,定位是「複雜的代理式寫程式與企業工作」。但對多數人來說更關鍵的一句話,藏在官方發表公告裡:

Opus 5 是 Claude Max 的新預設模型,也是 Claude Pro 上最強的模型

翻成人話:如果你是 Max 用戶,你今天早上打開 Claude,對話框後面接的已經不是 Opus 4.8 了。你沒有點過任何按鈕,模型就換了。

這就解釋了一件我這兩天一直看到有人在問的事——「我什麼設定都沒動,怎麼覺得 Claude 最近怪怪的、回答變長了?」那不是你的錯覺,也不是老掉牙的突然變慢變笨到底是不是被降智的那套陰謀論,就只是模型真的被換掉了而已。

目前它出現在四個地方:Claude API(模型代號 claude-opus-5)、Claude.ai 聊天版、Claude Code,以及 Claude Cowork。

這段你可以帶走的一件事:先進去看一眼你現在用的是哪個模型。如果你是 Pro 或 Max,接下來這幾段的「舊習慣」你也逃不掉,因為它們有一半是提示詞層面的問題,不是 API 參數的問題。


Opus 5 比 Opus 4.8 強在哪?三個數字比跑分表更有感

直接說結論:官方公布的跑分是全面往上,而且「往上的幅度」大到有點反常。以下都是官方自評數字,我照原文轉述,不加油添醋。

  • Frontier-Bench v0.1(從工程圖說做出可運作軟體):超越所有其他模型,成績是 Opus 4.8 的兩倍以上。
  • CursorBench 3.2:跟 Fable 5 的最佳成績差距不到 0.5%,但每題成本只要一半。
  • ARC-AGI 3:官方說是次佳模型的三倍。(實際榜單可在文末參考資料自行查核。)
  • OSWorld 2.0(電腦操作):超過 Fable 5 的最佳結果,成本大約只要三分之一。
  • Zapier AutomationBench:通過率約為次佳模型的 1.5 倍。

跑分我一向只看趨勢不看小數點,真正讓我覺得「這代不一樣」的是另外三個數字。

❶ 少 26% 的 token。 官方原話是:在達成相似表現的前提下,平均比 Opus 4.8 少產生 26% 的 token。這句話後面藏著一個大坑,我下一段整段拿來拆。

❷ 工具使用的固定開銷砍到剩四成多。 這個藏在官方定價文件的工具使用計價表裡:只要你的請求帶了工具,系統會自動塞一段提示詞進去,Opus 4.7 要吃掉 675 個 token,Opus 4.8 是 290,Opus 5 只要 286。你如果在跑一個一天呼叫上千次工具的自動化流程,這個固定成本是真的會反映在帳單上。

❸ 官方自己承認的弱項。 公告裡明寫它在資安任務與生物研究能力上仍落後 Mythos 5。一家公司願意在發表當天把「我們哪裡還不行」寫進公告,這件事本身比跑分更值得記一筆。

這段你可以帶走的一件事:如果你的工作是多檔案重構、長時間代理任務、或是要模型看懂圖表跟簡報,這次的提升值得你花一個下午重新測一輪。如果你只是拿它寫寫社群文案,說真的,差別不會大到讓你有感。


Opus 5 價格怎麼算?同價、半價,還有一個兩倍價的隱藏檔

先把四個現役模型的牌價攤在同一張表上,這樣「同價」跟「半價」才有比較基準。

模型 輸入 / 百萬 token 輸出 / 百萬 token 一句話定位
Claude Fable 5 US$10 US$50 最難的推理與超長任務
Claude Opus 5 US$5 US$25 複雜代理與寫程式的主力
Claude Opus 4.8 US$5 US$25 上一代旗艦,同價
Claude Sonnet 5 US$2 US$10 高量產工作的性價比檔

看到重點沒有?Opus 5 跟 Opus 4.8 同價——這代表對 API 使用者來說,留在 4.8 沒有任何價格上的理由,除非你有版本釘死的需求。

Fable 5 是它的兩倍價,可是 CursorBench 上兩者差距不到 0.5%。這就是這次改版最尖銳的地方,也讓我原本為了 Fable 5 到底該不該加訂而算過的那筆帳,整個要重算一次。

順帶提醒一件會過期的事:Sonnet 5 的 2 美元/10 美元是優惠價,官方文件標明只到 2026 年 8 月 31 日,9 月 1 日起回到 3 美元/15 美元。你如果正在做明年的 SaaS 訂閱預算,這個日期要記進去。

三個能砍帳單、但很多人沒開的開關

❶ Batch API 直接打五折:不趕時間的批次任務丟 Batch,單價變成 2.5 美元/12.5 美元。我自己所有的例行整理都走這條。

❷ 提示詞快取讀取只要一折:重複的長系統提示做快取,命中的部分算 0.5 美元/百萬 token。長對話跟 agent 迴圈的省幅大到會嚇到你。

❸ 1M 脈絡窗不另外加價:官方文件寫得很清楚,長文不收長文費,90 萬 token 的請求跟 9 千 token 的請求是同一個單價。

反過來,有一個檔會讓你付兩倍:Fast mode。它跑的是同一顆模型、速度約 2.5 倍,但價格變成 10 美元/50 美元,而且只在第一方 Claude API 上有。急件才開,不要當預設。

訂閱端的話,Claude Pro 是月繳 20 美元、年繳攤下來約 17 美元;Max 從 100 美元起跳,分 5 倍與 20 倍兩檔。

以 1 美元約 31 元新台幣估算,Pro 大約落在 620 元、Max 起跳約 3,100 元一個月(依當日匯率浮動)。這種每月固定扣款的海外訂閱,刷哪張卡的差別一年下來很可觀,我另外把海外手續費跟信用卡回饋實際算過一遍,也順手戳破了「台幣計價免手續費」這個迷思


為什麼它「省 26% token」,我卻覺得它變囉唆?

因為省的和多的,根本不是同一種 token。這是這次改版最容易讓人誤判帳單的地方,也是我認為所有中文報導都漏掉的一段。

模型花掉的 token 可以粗分成兩個帳戶:一個是思考帳戶(它自己在腦內推演,你看不到),另一個是輸出帳戶(它寫給你看的字)。官方那句「少 26%」講的是整體平均,主要省在思考帳戶——公告裡甚至提到在部分任務上只用了大約七分之一的推理 token、延遲不到一半。

官方的提示詞指南同時承認:它給使用者看的回應,預設就是比前幾代 Opus 更長。它寫到硬碟上的檔案——報告、Markdown 文件、摘要——也更長。

兩件事加起來,就是你會有的那個體感:帳單可能真的下降了,閱讀負擔卻上升了。

最容易踩的坑是接下來這一步。多數人的直覺反應是「那我把 effort 調低就好了吧」——這招沒用。官方 effort 文件寫得毫不客氣:effort 控制的是它想多久,不是它講多長,在 Opus 5 上調 effort 不會可靠地縮短可見回應,要控制長度請用提示詞

⚠️ 我踩過的雷:我第一天就是照舊習慣把 effort 從 xhigh 拉到 medium,想讓它「講短一點」。結果回應長度幾乎沒變,倒是幾個要拆步驟的任務品質掉了。白白繞一圈,才回頭去讀文件。

正確做法是在系統提示詞或自訂風格裡加一句話。官方給的範例大意是:「回應保持聚焦、簡短;免責與注意事項寫短一點,把篇幅留給主要答案;被要求解釋時先給高層次摘要,除非對方明確要求深入。」

聊天版沒有系統提示詞欄位怎麼辦?用「自訂風格」。這是我認為 Claude 最被低估的功能,設定一次就全域生效,不用每次重講——我把 Projects、記憶跟風格一次調成不用重講背景的專屬助理那套設定,現在剛好可以直接拿來壓這次的話癆問題。

這段你可以帶走的一件事:今天就去自訂風格裡加一句「回答保持簡短聚焦,先給結論」。這是投報率最高的一個動作,三十秒。


舊習慣一:「請你再檢查一遍」現在要整句刪掉

這條反直覺到我讀了兩次才確定沒看錯。

官方提示詞文件明白寫著:如果你的提示詞裡有明確的驗證指令——「任何非瑣碎的任務都要加一個最終驗證步驟」「用子代理驗證」——請把它們移除。因為 Opus 5 本來就會自己驗證,這些指令會疊加成過度驗證,多燒 token 而且品質沒有變好。

連「double-check your answer」「回答前再確認一次」這種我們寫了三年的句子,官方也點名說不要再寫。

你發現問題在哪了嗎?「請 AI 自我檢查」幾乎是所有 prompt 教學的通用建議,包括我自己過去寫的那些讓 Claude 別再給罐頭答案的提示詞模板裡也有。它在絕大多數模型上是對的,在 Opus 5 上剛好是錯的。這就是模型換代最陰險的地方——不會報錯,只會默默多收你錢。

同一段還提到另一個相關行為:它會自己擴大任務範圍,多做你沒要求的事,或自行判斷「這個任務應該長什麼樣」。你如果是丟一個很窄的需求給它,記得補一句限縮:交付被要求的東西、維持原本的範圍,覺得需求有問題就用一句話講出來然後照做,不要默默把任務改掉。

這段你可以帶走的一件事:打開你最常用的那組提示詞,搜尋「檢查」「驗證」「確認一次」四個詞,看到就刪。這不用花錢測試,刪掉就是省。


舊習慣二:effort 別再從 xhigh 開始,官方自己改口了

如果你有在調 effort 這個參數,這段是本篇對你最值錢的一段。

effort 是 Claude 的「用力等級」,從 lowmediumhighxhighmax 五檔,預設是 high。它管的是模型願意花多少 token 在整個回應上,包含思考跟工具呼叫。

重點來了。官方 effort 文件裡,Opus 4.7 跟 Opus 4.8 的建議是同一句話:「coding 與代理式工作從 xhigh 開始」。到了 Opus 5 那一段,官方改成:

從預設的 high 開始,再依你自己的評測調整;lowmedium大方使用,把它們當成控制 token 成本與回應時間的主要手段。如果你把 effort 設定從前代模型直接沿用過來,請重跑一次 effort 掃描,不要沿用。

官方在同一頁裡,把上一代的建議跟這一代的建議並排寫出來,等於承認了改口。理由也很直白:它在 lowmedium 的品質,好到可以用零頭的 token 與延遲撐住。

以我這兩天的用法,我的分配大概是這樣:例行整理、分類、摘要一律 low;日常寫程式跟改稿走 medium;只有跨檔案重構跟長時間代理任務才拉到 xhighmax 我幾乎沒動過,那是留給你確定值得燒的題目。

⚠️ 兩個容易忘的細節:第一,effort 跑到 xhighmax 時要把 max_tokens 開大(官方建議從 64k 起跳),不然會被截斷。第二,effort 是請求層級的設定,同一段對話中途改值會讓提示詞快取失效——長 session 請一開始就選定,不要中途調。

這段你可以帶走的一件事:拿三個你最常跑的任務,各跑一次 lowhigh,比對輸出。多數人會發現有一半的任務可以永久降檔,那是每個月實打實的錢。想再往下壓,可以接著看不升級 Max 也能讓用量砍半的十個習慣


舊習慣三與四:關掉思考、放養子代理,這兩件事現在會咬人

這兩條主要衝著 API 跟 Claude Code 的使用者來,但影響的是錢,所以值得放進來。

舊習慣三:為了省錢直接關掉思考

它的思考是預設開啟的,這跟 Opus 4.8、4.7 相反——那兩代不寫 thinking 參數就等於不思考。所以一份直接沿用的舊程式碼,換過來會突然開始花思考 token,而 max_tokens 是思考加輸出的總上限,抓太緊就會被截斷在半句話。

更麻煩的是,你不能無腦關掉它。官方規則是:thinking: disabled 只在 effort high 以下能用,配 xhighmax 會直接回 400 錯誤。而且是逐次請求檢查的,前面幾次成功不代表後面調高 effort 那次不會被打槍。

官方還列了關掉思考時的兩個副作用,第一個我覺得特別陰險:

  • 工具呼叫被寫成純文字:模型偶爾會把該用結構化格式送出的工具呼叫,直接寫進給你看的文字裡。這一輪會正常結束、不會報錯,但那個呼叫根本沒有執行。在代理迴圈裡,這段假文字還會留在對話歷史裡繼續污染後面的回合。
  • 內部標籤外洩:可能把 <thinking> 之類的內部 XML 標籤吐進回應裡。而且官方特別警告:如果你的系統提示詞裡有「不要思考」「不要推理」這種規則,請刪掉,那反而讓標籤更容易外洩

官方給的正解很乾脆:不要為了省錢關思考,改用低 effort。原文的說法是,對多數任務來說「開著思考跑 low」比「關掉思考」在相近成本下表現更好。

舊習慣四:讓它自由派子代理

這一代比前代更愛派子代理。這在真正能平行處理的大任務上是好事,但套到小任務上就是成本與時間雙殺——每個子代理都要重新建立脈絡、重新探索、回報一次,然後主代理再把回報讀一遍。

官方的建議是給明確的授權規則,或直接設一個數量硬上限。我自己的規則簡化成一句:幾次工具呼叫就能自己做完的事,不准外包;也不准用子代理來檢查自己的工作。後面這半句跟舊習慣一是同一件事的兩個面向。

這類 agent 帳單暴增的狀況我之前追過一輪,一個任務燒掉好幾美元的真相跟砍半心法那篇的排查邏輯在 Opus 5 上依然適用,只是這次要多看一欄「它派了幾個代理出去」。

四個舊習慣一次看

你的舊習慣 換過來會怎樣 改法
寫「請再檢查一遍」 疊成過度驗證,多燒 token、品質沒變好 整句刪掉,它本來就會自己驗
effort 從 xhigh 起跳 成本與延遲被墊高,官方已改建議 回到預設 high,大方用 low/medium
關掉思考來省錢 工具呼叫可能變純文字不執行、標籤外洩 思考開著,改用低 effort 控成本
讓它自由派子代理 小任務被外包,成本與時間雙殺 設數量上限+禁止用子代理驗證

那到底要不要換?三種人的決策框架

我把「該不該動」拆成三種身分,你對號入座就好。

❶ 你是 Claude Pro / Max 訂閱戶(不碰 API)

  • 要不要換:你已經被換了,Max 是預設、Pro 是最強選項。
  • 該做的事:去自訂風格加一句控制長度的指令,然後把提示詞裡的「再檢查一遍」刪掉。
  • 成本:0 元,純設定。

❷ 你在用 API 或 Claude Code,之前跑 Opus 4.8

  • 要不要換:。同價、跑分更好、工具開銷更低,留在 4.8 沒有價格理由。
  • 該做的事:改模型代號、重跑一次 effort 掃描(別沿用 xhigh)、確認沒有 thinking: disabledxhigh 的組合、把驗證指令刪掉、給子代理設上限。
  • 成本:一個下午的測試時間,換來的是每個月的帳單。

❸ 你在付 Fable 5 的兩倍價

  • 要不要換:先測,別急著砍。CursorBench 差距不到 0.5% 是官方自評的單一情境,你的任務不一定一樣。
  • 該做的事:挑三個最吃重的真實任務,兩邊各跑一次,比對品質差距值不值那多出來的一倍錢。
  • 成本:測試的 token 錢,通常一杯咖啡以內。

什麼情況我會建議你先不要動

❌ 你的產出需要跨月穩定重現:學術、稽核、法遵這類場景,模型行為變動本身就是風險,先在測試環境跑完再說。

❌ 你的提示詞是外包寫的、你不敢動:那些驗證指令跟 effort 設定沒人改,換過去只會多花錢又拿不到好處,先找得到人維護再換。

❌ 你只是拿它閒聊或寫短文案:老實說,這種用途你用 Sonnet 5 就夠了,價格是 Opus 5 的四成不到。我把各家模型的分工邏輯整理在Fable 5、Opus、Sonnet、Haiku 我每天實際怎麼分派那篇,還有Sonnet 5 用六成價追平旗艦的那個陷阱可以一起看。

👉 前往 Claude 官方方案頁確認目前價格(Anthropic 以美元計價,台幣金額依當日匯率浮動)


FAQ 常見問題

Opus 5 跟 Fable 5 該選哪一個?

先看預算再看任務。Fable 5 是 Opus 5 的兩倍價,官方自評在 CursorBench 上兩者差距不到 0.5%、OSWorld 上 Opus 5 甚至以約三分之一成本超過 Fable 5 的最佳結果。

我的判斷是:把 Opus 5 當主力,只有在真的撞到天花板、而且那個任務值得燒兩倍錢時才切 Fable 5。切之前務必用你自己的任務實測,不要相信任何人的跑分表——包括我的。

我沒改任何設定,為什麼 Claude 最近回答變長了?

因為模型被換掉了。官方公告寫明 Opus 5 是 Claude Max 的新預設模型、Claude Pro 上最強的模型,而新版的預設回應本來就比前幾代 Opus 長。解法不是降 effort(官方明講那不會可靠縮短可見回應),而是在自訂風格或系統提示詞裡直接要求簡短。三十秒設定,全域生效。

換過去之後帳單真的會少 26% 嗎?

不一定,而且我會建議你別這樣期待。那是官方在特定評測情境下的平均值,指的是「達成相似表現時少產生的 token」,主要省在思考端。你的實際帳單同時受回應長度、工具呼叫次數、子代理數量影響——而後兩項在 Opus 5 上反而有上升傾向。想真的省,Batch API 五折跟提示詞快取一折的影響遠大於這 26%。

踩到「工具呼叫沒執行」的雷之後怎麼補救?

先確認你是不是設了 thinking: disabled——這個副作用只在關掉思考時出現。最乾淨的修法是把思考打開、改用低 effort 控制成本。

如果整合上非得關思考,官方給的緩解句大意是:使用工具時可以先講一句話;沒有合適的工具就直說而不要硬猜;不要在回應裡輸出內部或系統 XML 標籤。另外記得把系統提示詞裡「不要思考」這類規則刪掉,那會讓情況更糟。

非工程師需要學到 API 這一層嗎?

不需要。訂閱戶只要做兩件事:自訂風格加一句控制長度、提示詞裡的驗證指令刪掉,這篇八成的效益你就拿到了。真的想再往前一步,我整理過非工程師該不該學 Claude Code 的判斷標準跟我用三個月後的真心話,可以先看完再決定要不要投時間。


結論:這次要改的不是模型,是你的手感

這一代最有意思的地方,不在跑分表上。它是我印象中第一次,官方文件花了整整一頁在教你「把以前教你寫的東西刪掉」——刪驗證指令、刪 xhigh 預設、刪「不要思考」那條規則。

這件事對我這種每天靠 AI 排工作流的人來說是個提醒:我們累積的那些「祕訣」,其實有保鮮期。模型每一次變強,都是在把你辛苦補上的那些拐杖收走;你如果沒跟著收,那些拐杖就會反過來絆你。

所以如果你今天只做一件事,我建議是最便宜的那一件:打開你最常用的提示詞,把「請再檢查一遍」刪掉,然後補上一句「回答簡短一點,先給結論」。不用花一毛錢,也不用等誰的評測。

然後過兩週再回頭看你的帳單跟閱讀時間,你會知道我在講什麼。

覺得這種「模型換代要跟著改什麼」的整理對你有用的話,訂閱夜羽凌的部落格,我會不定期把這類實測心得寄給你;也可以直接看最強的那個不一定是你最該付錢的那個這篇跨家比較,或回頭看 Opus 4.8 當初的升級重點跟 Fast Mode 怎麼用,對照著看會更清楚這條產品線在往哪走。


參考資料

 

延伸閱讀