Gemini 3.6 Flash 省多少錢?降價和省 token 是相乘,我算給你看

目錄

💡 核心結論速覽 (TL;DR)

  • 降價和省 token 會相乘:output 從每百萬 US$9 降到 US$7.50,又少用 17% token,output 帳單約剩 69%。
  • 省多少看你的用法:長文件摘要只省約 6%,coding agent 省到 26%,走批次模式最多砍 6 成。
  • 不是新世代:上下文仍是 100 萬進、64K 出,跟 3.5 Flash 一樣,prompt 大多能沿用。
  • 先做這件事:別急著改程式,先翻帳單算出 input/output 比例。手機用 Gemini 的人更簡單,免費方案已經能用 3.6 Flash。

Google 這次發新模型,最有感的地方不是它變聰明了,而是它幫你把帳單改小了。

Gemini 3.6 Flash 在 2026 年 7 月 21 日跟 3.5 Flash-Lite、3.5 Flash Cyber 一起登場。直接講結論:它的 output 單價從每百萬 token US$9 降到 US$7.50,同時官方說它比上一代少用 17% 的 output token。這兩件事會相乘,不會只是相加。

我每天用 AI 超過 10 小時,同時養著好幾家的付費方案。看新模型發表,我的第一個動作從來不是點跑分表,而是打開定價頁——因為「更快」「更聰明」這種話每一代都在講,只有數字會誠實。

而「省 token」這種宣稱,過去我大多直接略過。原因很簡單:模型省了 token,但單價不動,你的帳單降幅就只有那一點點,感受不到。這次不一樣的地方在於,Google 把單價也一起砍了。兩件事疊在一起,才是這篇要拆的重點。

那到底省多少?答案不是一個數字,而是「看你怎麼用」。往下我把三種真實用法的差距算出來,也會誠實說哪一種人這次幾乎沒感覺。


Gemini 3.6 Flash 是什麼?先講一件很多人搞錯的事

Gemini 3.6 Flash 是 Google 在 2026 年 7 月 21 日推出的 Flash 系列新版本,主打 token 效率與更低的使用成本。但這裡有個關鍵:它不是新世代模型,是建立在 3.5 Flash 之上的後訓練更新。

怎麼判斷?看規格就知道。Google DeepMind 官方的 Gemini Flash 頁面寫得很清楚:輸入上下文 100 萬 token、最大輸出 64K token——跟 3.5 Flash 一模一樣。真正的世代更替通常會動這兩個數字。

我知道有人看到版本號從 3.5 跳到 3.6 會覺得「才 0.1,沒什麼」。但老實說,這一版對帳單的影響,比我看過的某些「大版本」還有感。版本號跟你的荷包是兩回事。

能力面官方公布的對照數字是這樣(左邊是 3.6 Flash、右邊是 3.5 Flash):

測試項目 它在測什麼 3.6 / 3.5
DeepSWE 長流程軟體工程任務 49% / 37%
MLE Bench 機器學習實作 63.9% / 49.7%
OSWorld-Verified 直接操作電腦介面 83.0% / 78.4%
GDPval-AA v2 知識工作綜合表現 1421 / 1349

看得出重點都壓在「agent 型任務」上:寫程式、跑實驗、操作電腦。這不是巧合,是 Google 這一版的定位就是給自動化流程用的。

規格面還有兩個值得記的:輸入吃文字、圖片、影片、音訊跟 PDF,輸出只有文字;內建工具包含 function calling、把搜尋當工具用,以及直接操作電腦(computer use)。

這段你可以帶走的判斷:如果你正在用 3.5 Flash,不需要重新學怎麼跟它講話——同一個底模,你的 prompt 大多可以直接沿用。真正要重測的是輸出長度,因為它變短了,下游如果有字數或格式的硬檢查,可能會被觸發。

還沒搞清楚 Gemini 自家 Pro、Flash、Flash-Lite 到底該開哪一檔?這篇把三個等級的實際差別拆給你看,先看完再決定要不要換


Gemini 3.6 Flash 省多少錢?降價和省 token 是相乘,我算給你看

Gemini 3.6 Flash 省多少錢圖解:輸出單價 ×0.833、輸出用量 ×0.83,相乘後帳單剩 69%,輸入單價完全沒降
降價和省 token 會相乘:output 帳單約剩 69%,但 input 那側單價沒動,總帳單省多少要看你的 input/output 比例。

先給答案:output 那一側的帳單,約剩下原本的 69%,也就是省掉約三成。算法是 US$7.50 ÷ US$9.00 = 0.833(單價降 16.7%),再乘上 output token 少 17%(也就是剩 0.83 倍),0.833 × 0.83 ≈ 0.69。

但這裡有個大多數報導不會講的但書:input 那一側完全沒動。3.6 Flash 跟 3.5 Flash 的輸入單價都是每百萬 token US$1.50,而且你餵進去多少字,跟換不換模型無關。

所以「省三成」只成立在 output。你的總帳單省多少,完全取決於一件事——你的 input 跟 output 比例長什麼樣。

我用官方單價把三種常見用法算了一遍。以下用量都以 3.5 Flash 為基準,3.6 Flash 的 output 量套官方公布的 0.83 倍:

用法 3.5 Flash 3.6 Flash 省下
長文件摘要/翻譯
(進 50M、出 2M)
$93.00 $87.45 6.0%
客服/一般對話
(進 30M、出 10M)
$135.00 $107.25 20.6%
coding agent
(進 20M、出 20M)
$210.00 $154.50 26.4%

這張表是用官方公布的單價與 token 效率推算的,不是我的實際帳單——我把算式攤開就是要讓你能拿自己的用量重算一次。

差距大到有點誇張對吧?同一次降價,有人省 6%,有人省 26%。決定性因素不是你多會用,是你的任務形狀。

如果你的用法接近 DeepSWE 那種長流程工程任務,還有更好的消息:官方說在那個基準上 token 降幅最高可以到 65%。套進上面第三列,帳單會從 $210 掉到約 $82.50——省 6 成。但我要先講清楚,65% 是單一基準的最佳情況,不是你所有任務都能拿到的數字,看到別人拿這個數字當通例就要小心。

還有兩個很多人沒去按的開關。第一個是批次模式:不趕時間的任務走 batch,input 收 US$0.75、output 收 US$3.75,直接對半。第三列用批次跑,帳單會來到約 $77.25,比原本省超過 6 成。第二個是上下文快取,適合反覆餵同一份長文件的情況。

⚠️ 我踩過的雷:單價降不等於帳單降

我自己在評估這種「換模型省錢」時吃過一次虧:單價明明降了,月結出來卻沒省多少。回頭查才發現問題出在 input——換模型時順手把上下文塞得更滿、對話歷史一路累積不清,input 那側漲掉的,剛好把 output 省下來的吃回去。

所以我現在的順序是:先看帳單結構,再改模型字串。不知道自己 input/output 比例的人,這次降價對你是薛丁格的省錢。

這段的下一步很具體:去 Google AI Studio 或你的雲端主控台把上個月的 input 與 output token 數各抓出來,除一下,對照上面那張表找到你那一列。三分鐘的事,決定你要不要今天就動手改。

順帶一提,省 token 這件事不只能靠換模型。我整理過 AI agent 一個任務就燒掉好幾百的原因與省法,那些習慣換到 Gemini 一樣適用;如果你是不想升級方案、只想靠用法把成本壓下來的人,這 10 個省 token 習慣不用花錢就能先試


免費版能用 Gemini 3.6 Flash 嗎?能,但 Google 已經不告訴你一天幾次了

能用,而且不用付錢。Google 官方的 Gemini 訂閱方案頁在免費方案那一欄就直接寫著「使用 3.6 Flash」,Deep Research、Canvas、Gems 這些也都在免費層裡。

接著是這一段的重點,也是最多人搜卻查不到正確答案的問題:免費版一天可以用幾次?答案是 Google 已經不用「次數」在算了。

官方支援頁的原文是這樣寫的——用量限制「是以運算量為依據」,會受到「提示詞複雜度、使用的模型和功能,以及對話長度」影響,而且「系統每 5 小時會重設一次用量,直到達到每週用量上限」。

翻成白話:你問一個複雜的長問題,扣掉的額度比你問十個「今天天氣如何」還多。所以網路上那些「免費版一天 X 則」的數字,現在基本上都對不上。

我覺得這個改動其實是誠實的,只是很反直覺。它承認了一件事:讓模型想很久跟讓它秒答,成本差好幾倍,用「則數」計價本來就不合理。但代價是你沒辦法事先規劃了,只能撞到牆才知道自己用超了。

在台灣的方案與價格是這樣:

方案 月費 用量 誰適合
免費版 NT$0 基準 先用這個,能用 3.6 Flash
Google AI Plus NT$165 2 倍 偶爾撞到上限的人
Google AI Pro NT$650 4 倍 每天都在用、要 Pro 級模型
Google AI Ultra NT$3,300 起 Pro 的 5-20 倍 重度創作、跑影片生成

我的建議很直接:先別升級,用「撞牆頻率」當判斷標準。連續兩週、每週都被額度擋下來超過兩次,才有理由往上跳一階;只是偶爾卡一次,等 5 小時就好,NT$650 買的是餘裕不是能力。

還有一個很多人忽略的細節:往上跳一階時,多的是「用量」不是「智商」——3.6 Flash 免費版就給你了。你要的如果是更聰明的模型而不是更多次數,那才是升到 Pro 的理由。

下一步打開 Gemini App 確認模型選單裡已經有 3.6 Flash,拿你最常做的三件事各跑一次,記一下幾次會撞到額度。

糾結要不要從免費跳到付費的人,我把免費版是不是真的落後一年這題實測寫成一篇了;如果你想拉高一階看 Ultra 值不值得,這篇連 Pro 跟 Ultra 的價差怎麼算都幫你拆好了。想先把免費層的火力用滿,Deep Research 這個免費功能的完整用法在這裡


Gemini 3.6 Flash 打得贏 Pro 嗎?官方自己說「接近 Pro」,但這句話有前提

Google DeepMind 官方對 3.6 Flash 的定位語是:它提供「接近 Gemini Pro 的程式碼與推理品質」,同時保留 Flash 的速度與成本結構。這是官方自評,但值得認真看——因為價差實在太大了。

攤開官方的 Gemini API 定價頁,目前列出的 Pro 版本(3.1 Pro Preview)在 20 萬 token 以內是每百萬 token 進 US$2.00、出 US$12.00,而且沒有免費層。3.6 Flash 是進 US$1.50、出 US$7.50,還有免費額度可以先試。

拿前面那個 coding agent 情境(進 20M、出 20M)直接對照:Pro 要 US$280,3.6 Flash 是 US$154.50。Pro 貴了約 81%。

那什麼時候還是該用 Pro?我的判斷標準是「錯一次的代價」。

🤔 3.6 Flash 夠用嗎?對號入座

3.6 Flash 就夠的人:任務可以重跑(重跑成本低於 30 秒)、走的是自動化流程要跑很多次、預算敏感、輸出長度不是關鍵、需要免費額度先驗證可行性。

還是該掏錢給 Pro 的人:一次錯誤要賠掉一個下午(大型重構、對外文件、合約分析)、需要超長上下文的深度推理、任務跑一次但影響很大、模型判斷力比帳單重要。

預算怎麼抓:先用 3.6 Flash 的免費額度跑同一份題目,只有在它明顯做不到時才往 Pro 加錢——你會發現需要 Pro 的任務比想像中少。

下一步:挑 2-3 個你最在意的任務當「同題考卷」,兩個模型各跑一次,比的不是誰答案漂亮,是誰讓你少改幾輪。

老實說,Flash 這條線推進到 3.6,官方定價頁上的 Pro 線卻還停在 3.1 Preview,這個對比本身就很有意思。便宜的那條產線跑到前面去了。

我自己的原創觀察是:這一兩年模型競賽的重心,正在從「旗艦誰更強」換成「便宜的那檔夠不夠用」。因為真正在燒錢的不是你偶爾問一個難題,是那些一天跑幾千次的自動化流程——那裡的成本差是用乘的。

想看更完整的橫向比較,我把幾家旗艦的價格、跑分、適合誰攤成一張派工表了。至於 Gemini 自家的 Pro 線走到哪,這篇有完整的規格與定位整理

覺得跑分看再多也沒感覺?我拿同一份真實任務餵給四家 AI,最貴的那家沒有贏——那次的結果讓我對「旗艦一定比較好」這件事徹底改觀。想知道三家在日常使用上的體感差在哪,這篇的橫向對比可以當入門


同天發的 3.5 Flash-Lite 和 Flash Cyber,你用得到哪個?

直接說結論:Flash-Lite 你用得到,而且可能比 3.6 Flash 更適合你;Flash Cyber 你拿不到。

先講 3.5 Flash-Lite。它的定價是每百萬 token 進 US$0.30、出 US$2.50——output 只有 3.6 Flash 的三分之一。吞吐量官方公布是每秒 350 個 output token,定位就是高頻、低延遲的任務。

什麼情況該選它?分類、抽取欄位、路由判斷、大量文件的第一輪處理——這些任務你要的是「快而且便宜地做完幾萬次」,不是「想得很深」。我自己的分法是:需要判斷力的用 3.6 Flash,只需要執行力的用 Flash-Lite。

💰 三檔怎麼分?照「這一步需不需要判斷」切

3.5 Flash-Lite(US$0.30 進 / US$2.50 出):分類、抽取欄位、路由判斷、第一輪過濾——要跑幾萬次、不需要想很久的執行型工作。

3.6 Flash(US$1.50 進 / US$7.50 出):寫程式、跑 agent、跨步驟推理——需要判斷力但可以重跑的工作。

Pro(US$2.00 進 / US$12.00 出,無免費層):錯一次要賠掉一個下午的工作。

最省的做法不是三選一:同一條流程裡不同步驟配不同檔,執行型往下丟、判斷型往上留。

至於 3.5 Flash Cyber,它是資安專用版本,經過 CodeMender agent 微調來找和修補漏洞。官方公布在 V8 JavaScript 引擎上找到 55 個確認問題,3.5 Flash 是 47 個。

但我必須誠實講:它目前只開放給政府與受信任夥伴的限量試行,一般人和一般開發者拿不到。看到有人寫「快來試試資安模型」,那多半是抄新聞沒看清楚條件。

這段的下一步:把你手上的自動化流程列出來,逐一問「這一步需要判斷嗎」。不需要的那些,全部往 Flash-Lite 搬——這通常是整份帳單裡最快見效的一刀。

如果你是在終端機裡跑 Gemini 的開發者,我把 Gemini CLI 的安裝、費用與權限風險整理過一輪,換模型前值得先看權限那段。


我會怎麼換到 Gemini 3.6 Flash?換之前先做這 4 件事

換模型不是把字串改掉那麼簡單,這是我付過學費才學會的。以下是我自己會走的順序。

❶ 先量出你的 input/output 比例。沒有這個數字,你根本不知道這次降價對你是省 6% 還是 26%。翻上個月的帳單,兩個數字相除,三分鐘的事。

❷ 挑一條流量最小的流程先換。不要一次全上。挑一條出事也不會痛的,跑一週,看輸出品質跟成本兩條線。

❸ 重測輸出長度相關的環節。3.6 Flash 少用 17% 的 output token,代表它的回答會比以前短。如果你的下游有字數檢查、格式解析、或是靠固定段落數在切資料,這裡最容易爆。

❹ 順手把不需要判斷的步驟丟給 Flash-Lite。既然都要動手了,一次做完。單價差三倍,這一刀通常比換 3.6 Flash 本身省得更多。

那什麼情況先別換?我會說三種:正在趕上線的專案(不要在死線前換底層)、prompt 已經被調到很極致的流程(重調的人力成本可能大於省下的錢)、以及一個月 API 花費不到十幾美元的個人專案——省 26% 也就是幾塊美金,不值得你花一個下午。

前陣子有朋友問我:「這麼便宜,是不是該把所有 API 全部換過去?」我的回答是:先算你一個月花多少。花 US$500 的人,省 26% 是 US$130,值得認真做一輪;花 US$20 的人,省下的錢還不夠買一杯咖啡,把時間拿去改 prompt 反而更划算。

換模型的隱形成本永遠是驗證,不是那行字串。這是我從產品端做久了最深的體會:遷移的風險成本,通常被低估,而省下的錢,通常被高估。

還沒開始跑自動化、只是好奇「一般人到底能拿 API 做什麼」的人,可以先看我用 AI Agent 從安裝到上線架起一個站的完整過程——自動化流程一跑起來,token 成本才會從抽象數字變成你真的看得到的東西。

下一步:如果你決定要動手,先到 Google AI Studio 的免費額度把你最常跑的那個 prompt 貼進去試一次,確認輸出格式沒跑掉,再回頭改正式環境。

順帶提醒一個很多人忘記算的成本:這些 API 跟訂閱都是美金計價,海外刷卡手續費與匯差累積一年不是小數字。我把幾家 AI 訂閱的實際扣款方式與海外刷卡回饋卡的搭配算過一輪,同時養好幾家的人特別該看。

真的覺得訂閱太多要斷捨離,這篇幫你盤點哪些該續、哪些免費版就夠;如果你的問題是「該讓哪家做哪件事」,按任務切片的分工法在這裡


FAQ 常見問題

我該從 Gemini 3.5 Flash 換到 3.6 Flash 嗎?還是等 Gemini 4?

如果你的 output 用量佔比高(coding agent、長推理),現在就換,省下的是實打實的錢。Google 確實說已經展開 Gemini 4 的預訓練,但沒有給時程;而且 3.6 Flash 是同一個底模的後訓練更新,prompt 大多能沿用,之後要再換成本也不高。真正該等的只有一種人:正在趕死線的專案。

Gemini 3.6 Flash 和 3.5 Flash-Lite,我該選哪個?

看那一步需不需要判斷力。需要推理、寫程式、跨步驟決策的用 3.6 Flash;只是分類、抽取欄位、路由這種執行型任務,用 Flash-Lite——它的 output 單價只有三分之一(US$2.50 對 US$7.50),而且每秒能吐 350 個 token。最理想的做法其實是混用:同一條流程裡不同步驟配不同模型。

免費版的 Gemini 3.6 Flash 會不會是閹割版?

模型本身是同一個,差別在用量不在能力。Google 現在用「運算量」計算額度、每 5 小時重設一次並設週上限,所以免費版跟 AI Pro 的差別是你能跑多少次,不是它有多聰明。付費方案買的是餘裕:AI Plus 是免費版的 2 倍、AI Pro 是 4 倍。如果你只是偶爾撞到上限,等 5 小時比付 NT$650 划算。

官方說省 65% token,為什麼你算出來只有 26%?

因為 65% 是 DeepSWE 這個單一基準的最佳情況,不是通例。官方在整體指數上給的是「少用 17% output token」,我用的是這個保守值。而且降價只影響 output,input 單價沒動、用量也不變,總帳單的降幅一定小於 output 的降幅。拿 65% 當成你會省到的數字,那是把最佳情況當平均值講。

Gemini 3.5 Flash Cyber 我能拿來檢查自己的程式碼嗎?

目前不行。它是限量試行,只開放給政府與受信任的合作夥伴,一般開發者沒有管道。如果你要做程式碼安全檢查,現階段比較務實的做法是用 3.6 Flash 搭配既有的靜態掃描工具,而不是等 Cyber 開放——官方也沒有公布一般開放的時程。


省下來的錢,比多出來的分數重要

把整篇收束成一句:Gemini 3.6 Flash 這一版最值得注意的不是跑分,是它讓「省 token」第一次真的變成省錢。

過去這種宣稱我大多略過,因為單價不動,省下來的量感受不到。這次 Google 兩邊一起動,效果才會相乘。但也正因為是相乘,你省多少完全取決於你的用法——input 重的人這次幾乎沒感覺,output 重的人省到三成。

所以真正的行動不是「趕快改模型」,而是「先去看你的帳單長什麼樣」。我在產品端待久了最常看到的浪費,就是大家忙著追新工具,卻從來沒算過自己的成本結構。工具會一直換,會算帳這件事不會過期。

手機上用 Gemini 的人更簡單:免費方案已經能用 3.6 Flash,先開來跑幾天你最常做的事,撞不到額度就別急著付錢。

👉 想把哪家 AI 該做哪件事一次理清楚,先看這篇按任務切片的分工對照,把預算花在刀口上。喜歡這種把數字攤開算的內容,也可以訂閱我的部落格,會不定期收到信。

對了,如果你好奇我是誰、為什麼會同時養這麼多家 AI 訂閱,我的自我介紹在這裡


參考資料

 

延伸閱讀