GPT-5.6 Sol Ultrafast 快 14 倍?ChatGPT 訂閱者用不到

目錄

💡 核心結論速覽 (TL;DR)

  • 訂閱者不會變快:Ultrafast 是 2026-08-13 開放的 API 限定預覽,ChatGPT 選單看不到。
  • 14 倍是峰值不是體感:官方端到端只有 5.6 倍,我把圖裡秒數除完=462÷83.0=5.57 倍。
  • 價格官方零公布:唯一參考點是 Fast mode,2.5 倍速收 2 倍價。
  • 今天能做的:先把 service_tier 設成 fast 拿 2.5 倍速,並盯著被降回 default。

「快 14 倍」這種標題我看多了,第一反應通常不是興奮,是先去找那個「倍」到底在比什麼。

OpenAI 在美西時間 2026 年 8 月 13 日(台北時間 8 月 14 日)公布 GPT-5.6 Sol Ultrafast 模式,官方寫的是每秒最高 750 個輸出 token,最高比 Standard 快 14 倍。

先講最重要的結論:你的 ChatGPT 不會因此變快。這是 API 端的限定預覽,只開給少數客戶,訂閱方案的模型選單裡不會冒出這個選項。

我每天用 AI 超過 10 小時,同時養著 ChatGPT 跟 Claude 兩個 US$200 的方案,所以看到倍數第一件事是去翻官方那兩張圖,而不是先轉發。

翻完發現一件很有意思的事:官方自己公布的端到端實測只有 5.6 倍,而且那張速度長條圖裡還立著一根幾乎沒人提過的柱子。

下面我把秒數一格一格除給你看,也講清楚今天你手上真正能動的那個開關到底是哪一個。


GPT-5.6 Sol Ultrafast 到底是什麼?我的 ChatGPT 會跟著變快嗎

GPT-5.6 Sol Ultrafast 是 OpenAI 與 Cerebras 合作、把同一顆 GPT-5.6 Sol 模型放到晶圓級晶片上執行的加速服務層級,2026 年 8 月 13 日起以限定預覽開放給少數 API 客戶,ChatGPT 訂閱方案碰不到。

這個定義裡最容易被跳過的三個字是「同一顆」。GPT-5.6 Sol 的模型權重沒改、訓練沒重跑、參數沒動,變的只有跑它的那台機器。

這一點跟站內另一篇談推理加速的題目剛好形成對照。推理速度暴增的新聞通常在講模型本身被改造,我拆過那次到底改了什麼——那是換模型,這次是換執行模型的硬體。

OpenAI 的官方公告頁用的措辭是 limited preview、開放給 a select group of customers,並且明寫 launching first in the OpenAI API。

「first in the OpenAI API」這個 first 很多中文報導直接省略了。它的意思是先從 API 開始,不是承諾之後會進 ChatGPT。

官方也沒有給 GA 時程、沒有講開放地區、沒有公布可以填進程式碼的 model ID 或 service_tier 字串。要拿到目前只能在公告頁登記接收更新。

所以如果你是訂閱用戶,這篇你其實看到這裡就可以走了:你的 Go/Plus/Pro 模型選單不會多出任何東西,帳單也不會變。

真正該操心「我現在選哪一個」的是訂閱端的模型選擇,那是另一個題目。Sol、Terra、Luna 三顆到底差在哪、哪一顆是半價卻更強,我整理過一份對照可以直接拿去用。

如果你連自己現在在用哪一版都不太確定,從 GPT-5.6 一路往回到 4o、o1 的全系列選型與退場時間表會比官方文件好讀很多。


GPT-5.6 Sol Ultrafast 的「快 14 倍」是怎麼算出來的?峰值吐字不等於任務變快

GPT-5.6 Sol Ultrafast 的「快 14 倍」指的是輸出 token 的生成速度峰值,不是你按下送出到拿到完整答案的總時間。這兩件事在實際任務裡差很多。

官方原文寫的是 Ultrafast generates up to 750 output tokens per second,以及 up to 14× faster than Standard processing。兩個數字前面都掛著 up to。

我特別想提醒一件事:官方從頭到尾沒有公布 Standard 的絕對每秒吐字數。你在社群上看到的「Standard 大概每秒 53 個」是別人拿 750 ÷ 14 ≈ 53.6 回推之後再把小數抹掉的估算值,不是官方數字,引用前請自己心裡打個折。

更關鍵的是,Cerebras 官方那張速度長條圖其實有三根柱子,不是兩根。

服務層級 官方相對速度 短上下文輸出價 現在能不能用
Standard 1x(基準) US$30/百萬 tokens 可以,預設值
Fast mode 最高 2.5x US$60/百萬 tokens 可以,改一個參數
Ultrafast 最高 14x 官方未公布 限定預覽,多數人不能

中間那根 2.5x 在 Cerebras 圖上還標著舊名 Priority。OpenAI 已於 2026 年 7 月 30 日把 Priority processing 更名為 Fast mode,Cerebras 的圖上仍是舊名,兩邊就是沒同步——官方沒說明原因,我也不幫它猜。

那為什麼峰值倍數會跟體感差這麼多?第一,750 前面掛著 up to,那是最好狀況下的峰值,不是你每一次請求都拿得到的平均值。

第二,一次請求裡除了生成 token,還有工具呼叫、檔案讀寫、網路往返這些開銷,它們不會因為晶片變快就跟著消失。

我自己判斷這類宣傳數字的習慣是:先問這個倍數的分母是「單一環節」還是「整段任務」。分母是單一環節的倍數,永遠比你實際感受到的大。

如果你想看主觀體感那一側的證據,站內那篇五大 AI 做同一件事的實測裡,最慢的那個反而最認真剛好是這個論點的反面教材——速度不是唯一變數。


官方那張 GDP-Val 圖我除完,GPT-5.6 Sol Ultrafast 只剩 6.61 倍

Cerebras 與 OpenAI 公布的 GDP-Val 端到端加速只有 5.6×,並註明 no quality degradation,比 GPT-5.6 Sol Ultrafast 宣傳標題的 14× 小了一半以上。

更有價值的數據不在正文,在那張圖裡。Cerebras 的部落格把逐格秒數畫進了圖片,但正文一個字都沒寫。

測試條件是 Cerebras 在 2026 年 7 月 31 日於 Codex 環境內、以 medium reasoning 檔位,跑 6 個品質對齊過的任務取平均 wall-clock 時間。

時間組成 Sol Standard Sol Ultrafast 我除出來的倍數
推論時間 7.5 分鐘(450 秒) 68.1 秒 6.61 倍
非推論開銷 14.2 秒 14.9 秒 幾乎沒變
總計 7.7 分鐘(462 秒) 83.0 秒 5.57 倍

算式我攤開給你自己驗:7.5 分鐘 × 60 = 450 秒,450 ÷ 68.1 = 6.61。這是「純推論那一段」的加速。

總時間那一行是 7.7 分鐘 × 60 = 462 秒,462 ÷ 83.0 = 5.57,四捨五入就是官方寫的 5.6 倍。

這裡先講一個細節免得你算到懷疑人生:官方圖上的秒數本身就是四捨五入過的,所以你拿 450 + 14.2 會得到 464.2 秒,跟總計那格的 462 秒差了 2 秒。差額來自「7.5 分鐘」是概數,不影響倍數的量級。

換句話說,連把非推論開銷全部剝掉、只看最有利的那一段,也只有 6.61 倍,離 14 倍還有一大段距離

官方另外還放了一組 Humanity's Last Exam 的實測:2,500 題,Ultrafast 花 11 小時 11 分,Claude Fable 5 花 78 小時 27 分。

但這組數字要非常小心讀。官方的措辭只有 comparable accuracy nearly 7× faster,從頭到尾沒有公布任一方的實際準確率分數。

兩邊的測試條件也不同:Ultrafast 是 7 月 10 日在 Codex 用 xhigh reasoning 跑,Fable 5 是 7 月 13 至 15 日在 Claude Code 用 xhigh reasoning 跑。日期、環境都不一樣。

我的判斷是:這組數字可以拿來說「速度差距很大」,但不能拿來說「誰比較準」。官方沒給分數,任何補上分數的說法都是別人自己加的。


為什麼再快也有天花板?14.9 秒的固定開銷我算給你看

就算推論時間快到趨近於零,GPT-5.6 Sol Ultrafast 在這組 GDP-Val 任務上最多也只能加速到大約 31 倍,因為有 14.9 秒的非推論開銷永遠減不掉。

算式一樣攤開:總時長 462 秒 ÷ Ultrafast 的非推論開銷 14.9 秒 ≈ 31.0。這是以「推論時間可以無限趨近 0」為假設的理論上限。

這條算式沒有出現在任何一篇報導裡,是我自己拿官方圖的兩個數字除出來的,你可以自己按一次計算機驗證。

它想說的事情其實很樸素:當你已經把一段任務裡最慢的環節加速到某個程度之後,再往上堆速度,你實際能感受到的邊際效益會急速遞減

把數字換成場景會更好懂。原本要等 7 分半的任務變成等 83 秒,這是「泡咖啡回來」變成「滑一下手機」,差別很大。

但 83 秒再壓到 30 秒,對多數工作流來說只是從「滑一下手機」變成「發呆一下」。體驗改善的幅度不可能跟前一段一樣有感。

我自己每天的工作流裡,真正的分水嶺不是幾倍,而是「我會不會切走去做別的事」。超過大概一分鐘我一定會切走,切走之後回來要重新讀上下文,那個重新進入狀態的成本比等待本身還貴。

所以我判斷這類加速服務值不值得,看的是它有沒有把等待壓到「我不會離開這個視窗」的門檻以下,而不是它宣稱幾倍。

順帶一提,時間成本跟金錢成本在 agent 型任務裡常常是反向的。想省的是錢而不是時間的話,一個 agent 任務就燒掉好幾美元,錢到底花在哪、我拆過該從哪裡砍起那篇的思路可以直接套用。


已經在用 Fast mode 的人,換 GPT-5.6 Sol Ultrafast 實際只多快多少?

如果你目前已經在用 Fast mode,切到 GPT-5.6 Sol Ultrafast 的理論增幅是 14 ÷ 2.5 = 5.6 倍,不是所有報導寫的 14 倍。

Cerebras 官方長條圖上三根柱子分別標著 14x、2.5x、1x,中間那根 2.5x 就是 Fast mode,而幾乎所有報導只拿頭尾兩根來比。

這裡要提醒一個巧合:14 ÷ 2.5 算出來的 5.6,跟官方 GDP-Val 的 5.6× 剛好同一個數字,但兩者定義完全不同。

前者是「兩個加速檔位之間的峰值倍數比」,後者是「Ultrafast 對上 Standard 的端到端任務時間比」。同數不同義,看到別人把兩者混講要立刻警覺。

接下來是這一題最容易讓人對不上官方文件的地方:市面上有三個不同的「Fast」在互相打架。

  • ❶ OpenAI 的 Fast mode:2026 年 7 月 30 日由 Priority processing 更名而來,指的是 2.5 倍速那一檔。
  • ❷ Cerebras 圖表上的 Priority:講的是同一個東西,只是還在用舊名,兩家沒同步。
  • ❸ Anthropic 的 Fast mode:Cerebras 說「比 Claude Opus 4.8 的 Fast mode 快 5×」時指的是這個,跟 OpenAI 的 Fast mode 完全是兩回事。

那組跨品牌的比較數字還有一個細節值得知道:Cerebras 明確註明依據是第三方 Artificial Analysis 回報的輸出速度,不是自家實測。同一份物料裡還寫了比 Claude Fable 5 快 11×。

不過速度只是選模型的其中一個維度而已。GPT-5.6、Fable 5、Gemini 3.5、Grok 4.5 這幾顆在能力面怎麼互相比較,我另外整理過一份橫向對照表。

我會把這種「引用第三方測速」的數字放在比自家實測低一階的可信度,因為測試時間點、負載狀況都不在公布範圍內。

老實說,光是三個 Fast 撞名這件事,就足以讓一個照著中文報導去翻官方文件的人整個對不上。這也是我覺得這題值得寫長一點的原因。

想確認自己現在到底該留在哪一顆模型上,半價的那一顆竟然比上一代旗艦還強,這個判斷我整理成了選型表會比在這裡展開更清楚。


GPT-5.6 Sol Ultrafast 價格官方沒公布,我用 2 倍價回推一條基準線

GPT-5.6 Sol Ultrafast 的價格官方完全沒有公布,OpenAI 的定價頁與 Fast mode 指南全文都查不到這個字,任何列出具體數字的比價站都是自己猜的。

官方零價格不代表你沒有判斷依據。OpenAI 公布過另一個加速檔 Fast mode 的完整定價,那就是目前最好的錨點。

先把官方定價表攤開(單位都是每 100 萬 tokens)。gpt-5.6-sol 的 Standard 短上下文是 input US$5.00、output US$30.00。

長上下文那一欄則是 input US$10.00、output US$45.00。長短的分界是 272K tokens。

Fast mode 的每一格恰好都是 Standard 的兩倍:短上下文 input US$10.00、output US$60.00;長上下文 input US$20.00、output US$90.00。官方 changelog 的文字也寫得很直白,twice the price。

有一件容易被漏掉的事:官方文件寫明 cached input 的折扣在 Fast mode 一樣適用。所以重複前綴多的請求切過去,實際漲幅會比帳面的 2 倍小一些。

重點來了。2.5 倍的速度收 2 倍的價,換算成「每單位速度的成本」是 2 ÷ 2.5 = 0.8,也就是加速檔的單位速度成本反而比 Standard 便宜了 20%。

我把這條當成判斷 Ultrafast 開價合不合理的基準線:如果哪天官方公布的加速倍數與價格倍數比值遠高於 0.8,那就是這一檔的性價比比 Fast mode 差。

換成新台幣比較有感。以 1 美元約 32 新台幣試算(匯率會浮動,請以你當下的帳單為準),Standard 每百萬輸出 token 約 NT$960,Fast mode 約 NT$1,920,差額約 NT$960。

如果你的方向是反過來的——不趕時間、只想壓成本——官方其實給了明確的路。Batch 與 Flex 同價,短上下文 input US$2.50、output US$15.00;長上下文 input US$5.00、output US$22.50。

也就是說,同一顆模型公開過的輸出價,從最省的 Batch/Flex 短上下文 US$15,一路拉到最貴的 Fast mode 長上下文 US$90,中間差了 6 倍。選錯檔位的代價比選錯模型還大。

想做世代對照的話,上一代 GPT-5.5 的 1M 上下文與 $5/$30 定價結構我完整拆過,兩篇對著看就知道這一代的價格骨架其實沒有大改。

至於怎麼在不換檔位的前提下把總花費壓下來,砍半省 token 的那套心法我整理成了可以照做的清單,跟這裡的檔位選擇是互補的兩件事。


今天就能做的事:service_tier 怎麼開、什麼情況會被偷偷降級

OpenAI API 上今天唯一真的能動的加速開關是 service_tier,把它設成 fast 就能拿到 Fast mode 最高 2.5 倍速,代價是 2 倍價,不需要等 Ultrafast 的預覽名額。

OpenAI 的 Fast mode 指南寫明 service_tier 填 "fast" 或 "priority" 行為完全相同,因為前者是後者改名後的新寫法,舊寫法沒有被廢掉。

除了逐次請求帶參數,還有一個專案層級的開關:Settings 裡 Project 的 General 頁,把 Project Service Tier 改成 Fast。

這個開關的副作用要先知道:改完之後,那個專案裡所有沒指定 service_tier 的請求都會預設走 Fast mode,等於整個專案的單價默默變成兩倍。

但接下來有六個坑,中文報導完全沒寫,我按照踩到的機率排序。

  • ❶ 回應欄位對不上文件:GPT-5.6 及更早的模型,回應物件的 service_tier 一律回傳 priority,不管你請求時填的是 fast 還是 priority。看到 priority 不代表設定沒生效。
  • ❷ 流量爬太快會被降級:官方的觸發條件是兩個同時成立——你送出至少每分鐘 100 萬 tokens(TPM),而且在 15 分鐘內把 TPM 拉高超過 50%。只達到其中一個不會觸發。
  • ❸ 降級的痕跡藏在回應裡:被降級時回應會變成 service_tier: "default",並改以標準費率計價。如果你沒有記錄這個欄位,帳單對得上、速度卻莫名其妙變慢,你會完全查不出原因。
  • ❹ rate limit 是共用的:Fast mode 與 Standard 共用同一組 rate limit,所以切過去不會多給你額度,只會改變速度與單價。
  • ❺ 有兩類東西直接開不了:官方文件明列 Fast mode 不支援微調(fine-tuned)模型與 embeddings。服務如果跑在自己微調過的模型上,這個開關對你等於不存在。
  • ❻ 降級額度是跨專案共用的:官方 FAQ 直接回答 Yes,名下所有流量都算進同一個 ramp rate limit。把流量拆到不同專案或組織,不會讓你避開降級。

官方也直接給了避開降級的三條做法:換模型或快照時漸進切換、用 feature flag 把流量分成幾小時慢慢導過去、不要把大型 ETL 或批次工作丟進 Fast mode。

最後那條特別值得畫線。批次工作本來就不趕時間,丟進 Fast mode 不只多付一倍價,還會把整條流量曲線拉陡,害到真正需要低延遲的那些請求。

降級這一組坑之所以值得單獨記住,是因為它讓「AI 突然變慢」這件事第一次有了官方文件級的機制說明。

過去大家在社群上抱怨模型被降智、被限流,多半只能靠體感。突然變慢變笨到底是不是被降智,我把限流與體感落差拆開查過一輪,那篇的疑問在這份文件裡剛好拿到了一個具體答案。

還有一個時間點要記:2026 年 8 月 5 日起,Fast mode 開始支援 GPT-5.6 Sol/Terra/Luna 超過 272K tokens 的長上下文請求,速度一樣是最高 2.5 倍。

這個 272K 同時也是計價的長短分界。所以你的 prompt 跨過這條線的時候,速度檔位還在,但每一格單價會跳到長上下文那一欄。

組織裡買過 Scale Tier 的話,還要知道兩者是分開的:Fast mode 請求分開計費、不吃 Scale Tier 買來的 TPM 額度,Scale Tier 的溢出流量也不會自動轉到 Fast mode。

我如果現在要導入,會用這個順序:先只在真正吃延遲的那條路徑上開 fast,把 service_tier 回傳值記進 log,跑一週再決定要不要擴大。一次全開最容易在月底看到不認識的帳單。

順帶一提,如果你想避開這一整套速度與降級的複雜度,同一篇裡我也整理過遇到明顯變慢時的自查順序,可以先排除掉不是計費層造成的問題。


Cerebras 是誰?把權重塞進晶片為什麼能繞開 GPU 的頻寬瓶頸

Cerebras 用的是 Wafer-Scale Engine 架構,每一片晶圓級晶片上封了 44 GB 的 SRAM,讓模型權重可以常駐在晶片裡,避開 GPU 推論時的記憶體頻寬瓶頸。

同一週還有四家也換了代,哪一個值得今天就動手、哪三個可以等,我整理成一張分流表

權重常駐這件事用生活場景比喻大概是這樣:一般 GPU 推論像是廚師每炒一道菜都要跑一趟冰箱拿食材,權重留在晶片裡等於所有食材都攤在流理台上。

跑的路少了,出菜自然快。真正的限制不在廚師手速,在冰箱到流理台的那段距離。

這也解釋了為什麼同一顆模型換硬體就能快這麼多——瓶頸本來就不在模型,在資料搬運。想對照另一種加速路線的話,從模型本身下手的加速方案改了什麼、又沒改什麼,我拆給你看

另一件值得知道的事:Cerebras 是那斯達克上市公司,代號 CBRS。它自己在新聞稿的前瞻性陳述段落裡,把 OpenAI 列為少數幾個重要客戶之一,與 Group 42、MBZUAI、AWS 並列。

換句話說,公司自己承認營收高度集中在少數客戶身上。這是它自報的風險,不是外界推測。

這條線一路拉下去就會碰到 AI 硬體的循環採購與交叉持股問題,但那是另一個題目的範圍。想追這條線的話,循環融資到底怎麼查、哪些訊號才算警訊,我列過一份可以照著跑的清單

這篇我只點到原理與依賴結構為止,不往財經分析展開。


訂閱用戶、API 開發者、想省錢的人,看 GPT-5.6 Sol Ultrafast 各自該做什麼

面對 GPT-5.6 Sol Ultrafast,三種人的行動完全不同:訂閱用戶什麼都不用做,API 開發者今天就能開 Fast mode,想省錢的人該往 Batch 與 Flex 走。

❶ 如果你是 ChatGPT 訂閱用戶:不用做任何事,也不需要為了這則新聞加開方案。Ultrafast 在 API 端,訂閱端拿不到,官方也沒承諾會進 ChatGPT。真要優化體驗,先確認自己有沒有停在已經排進退場時間表的那幾顆舊模型上

❷ 如果你是 API 開發者、任務真的吃延遲:今天就把 service_tier 設成 fast 試一條路徑,同時把回傳值記進 log,觀察有沒有被降回 default。

❸ 如果你在意的是成本不是速度:往反方向走,把可以離線跑的批次任務丟到 Batch 或 Flex,輸出價從 US$30 降到 US$15,直接砍半。

那什麼樣的場景才真的需要 14 倍?官方公告自己列了五類:事故應變與可靠性、金融研究與安全(含可疑交易偵測)、客服與語音即時應答、電商在結帳前挽回棄單、即時研究與實驗迭代。

這五類的共同點是「使用者正在螢幕前面等」或「錯過這幾秒就沒有第二次機會」。如果你的任務可以先跑著、晚點回來看,它就不在這個清單裡。

OpenAI 也點名了四家已經在用的早期客戶:Jane Street、Podium、Basis、Rogo。

這份名單其實比五類場景更有資訊量。Podium 做的是語音 AI 客服,Basis 做 AI 會計代理,Rogo 做 AI 金融研究,全部都是「使用者掛在電話上或盯著畫面等」的產品型態。

換句話說,會為這一檔速度付錢的不是寫程式的人,是把 AI 直接放在客戶面前、每多等三秒就掉一單的那種產品。這也解釋了為什麼官方要在公告裡強調結帳前挽回棄單。

我自己現階段的判斷是:不會去排這個預覽的隊。理由很簡單,我的工作流裡最慢的環節從來不是模型吐字,是我自己決定要問什麼。

但我會做兩件事——把 GDP-Val 那組秒數存起來當基準線,以及在真正需要即時回應的那一小段流程上先試 Fast mode。這兩件事今天就能做,不用等名額。

還有一個誠實的提醒:官方對品質的承諾只到 no quality degradation 與 comparable accuracy 為止,沒有公布任何分數。所以「會不會變笨」這題,目前只能拿官方的措辭去信,沒有第三方分數可以驗。

如果你覺得這種「把官方數字翻出來自己除一遍」的角度對你有用,可以訂閱夜羽凌的部落格,之後有新的拆解會不定期收到信。


FAQ 常見問題

我是 ChatGPT Plus 或 Pro 訂閱者,要為了 Ultrafast 另外開 API 帳號嗎?

不建議。Ultrafast 目前是限定預覽、只開給少數被選中的客戶,開了 API 帳號也不代表拿得到名額,官方也沒有提供公開的申請條件或排隊機制。如果你真正想要的是更快的日常體驗,把錢花在挑對模型上比較實際;要用 API 才動 API,不要為了一則新聞先開帳號。

手上任務要壓延遲,我該先開 Fast mode 還是等 Ultrafast?

先開 Fast mode。它今天就能用、只要改一個 service_tier 參數,官方標的是最高 2.5 倍速、2 倍價,每單位速度成本反而比 Standard 低 20%。Ultrafast 沒有 GA 時程、沒有價格、沒有地區說明,等它等於現在什麼都不做。先把延遲敏感的那條路徑跑起來,等它真的開放再評估要不要遷。

發現速度突然變回原樣,被降級成 default 之後怎麼補救?

先確認回應物件的 service_tier 是不是回傳 default,那是被降級的唯一明確訊號。官方說明的觸發條件要兩個同時成立:送出至少每分鐘 100 萬 tokens(TPM),而且 15 分鐘內把 TPM 拉高超過 50%。

官方給的避開方式有三條:換模型或快照時漸進切換、用 feature flag 把流量分成幾小時導過去、不要把大型 ETL 或批次工作丟進 Fast mode。被降級時以標準費率計價,不會多收錢,只是速度掉回去。

台灣、香港的開發者現在能不能申請 GPT-5.6 Sol Ultrafast?

官方沒有給任何地區資訊,所以誠實的答案是「現在等於還不能用」。OpenAI 只寫了 limited preview 與 a select group of customers,並提供在公告頁登記接收更新,沒有公開的申請表、沒有排隊順序、也沒有可用地區清單。

至於今天就能開的 Fast mode,官方文件的說法是可用性取決於各司法管轄區的法律與規範,有疑問要問自己的 account director,同樣沒有公開的地區清單。看到任何寫著某地區已開放的說法,都要回官方頁面核對。

速度變快會不會讓答案變笨?速度是拿品質換的嗎?

官方的說法是不會,但要看清楚它承諾到哪裡。GDP-Val 那組實測寫的是 no quality degradation,Humanity's Last Exam 那組寫的是 comparable accuracy,兩個都是定性描述,官方沒有公布任一方的實際分數。

模型權重本身沒有改動,變的只有執行硬體,理論上輸出不該變差;但在有第三方分數之前,這一題只能拿官方措辭當依據。想看不同模型在同一件事上的表現差異,我讓五個 AI 做同一份東西,結果最貴的不是最好玩那組觀察比跑分好懂。


參考資料

 

延伸閱讀