💡 核心結論速覽 (TL;DR)
- 兩版同價:3.7 與 3.6 Flash 都是 US$0.75/US$3.75,換過去不會變便宜。
- 破壞性變更:thinking_level 拿掉 MINIMAL,設了會回錯誤。
- 唯一退步:圖表推理 CharXiv 84.5%,輸給 3.6 的 85.2%(Google 自測)。
- 先做這步:全域搜一次 MINIMAL,跑 agent 的先換,判讀圖表的先留 3.6。
繁中快訊的標題幾乎清一色是「限時半價」。我把 Google 官方定價頁的英文版逐格對過之後,發現一件所有人都沒寫的事:Gemini 3.6 Flash 現在也是 US$0.75/US$3.75,跟 3.7 Flash 一模一樣。
所以「該不該換到 Gemini 3.7 Flash」這題,答案根本不在價格欄。它在遷移欄——你改一行模型 ID,會不會有東西當場壞掉。
我每天用 AI 超過 10 小時,同時養著 ChatGPT、Claude 各 US$200 的高階方案跟 Google AI Pro。新模型發表時我的第一個動作從來不是打開跑分表,而是打開遷移文件,因為跑分贏了兩位數、但參數不相容,那筆帳最後是我的團隊在付。
這次翻完,我在官方文件裡撈到一條所有中文報導都沒提的東西:3.7 Flash 把 thinking_level 的 MINIMAL 拿掉了,而且不是靜靜忽略,是直接回一個 API validation error。
下面我把官方英日兩版註腳、遷移清單六步、還有 Google 自己表格裡那一項退步,全部攤開講。先從「這一版到底改了什麼」開始。
Gemini 3.7 Flash 到底改了什麼?官方說的三週其實是 23 天
Gemini 3.7 Flash 是正式版不是預覽版:Vertex AI 官方模型頁的 Launch stage 標的是 GA,API 模型 ID 就是 gemini-3.7-flash,release notes 也列了 generally available。
GA 這個標記值得留意,因為它代表 Gemini 3.7 Flash 可以直接上正式環境,而不是玩玩就好。預覽版模型隨時可能改行為或下架,正式版至少有一層承諾。
發布日這件事,有人寫 8/13、有人寫 8/14,兩邊其實都沒錯。Google 英文官方部落格標的是 Aug 13, 2026(美西時間),同一篇文章的日文版標的是 2026 年 8 月 14 日。
台北跟東京都領先美西一大截,所以中文讀者實際刷到這則消息的那天是 8/14。這不是媒體抄錯,是官方自己兩個語版的時區差。
另一個更好玩的小數字:官方跟所有媒體都寫「距離上一版只有三週」,實際是 23 天。
算式很簡單,Vertex 文件寫 Gemini 3.6 Flash 的 Release date 是 2026 年 7 月 21 日,3.7 Flash 是 8 月 13 日。7 月剩下 10 天(7/22 到 7/31)加上 8 月的 13 天,等於 23 天,不是 21 天。
差兩天當然不影響誰的決策,但它揭露了一件事:這篇新聞稿被複寫了幾十遍,中間沒有一個人回去對過官方文件的日期欄。這也是我後面每一段都要你自己去點官方頁的原因。
📌 這一版的本質:不是新地基,是同一棟樓的第二次裝修。DeepMind 的 model card 裡,架構、訓練資料集、資料處理、硬體、軟體五個章節全部寫「Gemini 3.7 Flash is based on Gemini 3.6 Flash」並指回 3.6 的 model card。
規格面也印證了這件事。上下文視窗還是 1,048,576 tokens(也就是常說的 1M),最大輸出還是 65,536 tokens——跟 3.6 Flash 完全一樣,這一版根本沒動這兩個數字。
倒是官方文件的用字動了。models 文件現在把 Gemini 3.6 Flash 寫成「previous-generation Flash model」、把 3.5 Flash 寫成「legacy Flash model」,3.7 Flash 才是「latest and most capable」。
這排序值得放在心上:Flash 這條線的主力位置整個往前移了一格。你手上那個「還很新」的版本,在官方口徑裡已經是上一代。
官方部落格的署名是 Gemini 團隊的 Senior Director, Product Management,Tulsee Doshi。我看發表文的習慣是先看署名:由產品管理出面而不是研究團隊領銜,通常代表這一版的重點在產品線的排序調整,不在底層技術突破。
你這一段可以先做的事:打開你的專案,把目前寫死的模型 ID 找出來,看看它是 3.5、3.6 還是更舊。這個答案決定你後面要改幾行。如果你連 Pro、Flash、Flash-Lite 該怎麼分工都還沒想清楚,先看整條 Gemini 線每天實際會遇到的分流情境,再回來談換版。
Gemini 3.7 Flash 限時半價是真的嗎?3.6 Flash 現在同一個價
Gemini 3.7 Flash 的限時優惠價是真的,但「換過去會變便宜」是假的。原因是 Google 把同一組優惠價也套用到了 Gemini 3.6 Flash:兩個版本現在都是 input US$0.75、output US$3.75,每百萬 token 的單價完全一致。
官方原文寫得很硬:Introductory pricing 適用於 Google AI Studio 與 Gemini Enterprise Agent Platform,期間到 2026 年 12 月 31 日,而且是 for both Gemini 3.7 Flash and Gemini 3.6 Flash。
這句話最妙的地方在於——英文官方部落格的註腳 1 沒有寫這件事,日文官方部落格的同一個註腳寫了。日文版直接註明初回特別價格也適用於 Gemini 3.6 Flash。
我第一次看到這個落差的時候,還以為自己看錯分頁。回頭去對了四個地方才確定不是眼花:
- ❶ 官方遷移指南的 Pricing 段落,明文寫 for both 3.7 and 3.6 Flash。
- ❷ 同一頁的 What's new 段落補了一句:我們也把這個新費率套用到 3.6 Flash。
- ❸ 官方定價頁裡,gemini-3.6-flash 區塊的數字跟 3.7 完全相同。
- ❹ DeepMind model card 的星號註寫:3.6 和 3.7 Flash 的 introductory price 都在 2026 年 12 月 31 日到期。
還有第五個佐證,是 Google 自己遞出來的。model card 裡有一張競品牌價對照表,Google 把 3.7 Flash 和 3.6 Flash 兩列都標成 US$0.75/US$3.75。
同一張表裡,Claude Sonnet 5 是 US$2.00/US$10.00、GPT-5.6 Terra 是 US$2.00/US$12.00、Muse Spark 1.2 是 US$1.25/US$4.25——這幾組競品價格是 Google 自己引用的版本。
所以那些「限時 5 折」「半價流血戰」的標題,指的是相對 3.6 Flash 的原始定價。今天你要是拿著這個標題去做決策,會得到一個錯的結論:以為換過去帳單會變輕。
🚨 換版前先把這句話唸一遍:現在留在 3.6 Flash 跟換到 3.7 Flash,每百萬 token 的單價一毛錢都沒差。價格欄位在這題上是死的,會動的只有你的相容性風險。
那 2027 年呢?官方定價頁、英日兩版部落格註腳、model card 星號註、遷移指南五處文字一致:2027 年 1 月 1 日起,標準層價格變成 input US$1.50/1M、output US$7.50/1M。而且是 3.6 和 3.7 一起變。
很多人看到這裡會說「漲一倍」。這句話技術上沒錯,但把時間軸拉長一格就沒那麼可怕了。
拿上上代的 Gemini 3.5 Flash 現行牌價來對:input US$1.50、output US$9.00,沒有任何優惠。也就是說 3.7 Flash 在 2027 年的「漲價後」價格,input 跟 3.5 Flash 完全相同,output 還便宜。
便宜多少我算給你驗算:(9.00 − 7.50)÷ 9.00 = 0.1667,也就是 output 比上上代牌價便宜約 16.7%。所謂的漲價,其實是從促銷價回到一個仍然低於前代牌價的水位。
不過有一條漲價媒體真的完全沒提,而且會咬到特定的人:context caching 的儲存費也同步翻倍。官方定價頁寫,快取的儲存費在 2026 年 12 月 31 日前是每 1M tokens 每小時 US$0.50,2027 年起變成 US$1.00。快取輸入本身也從 US$0.075/1M 變成 US$0.15/1M。
如果你的架構是「把一份大文件長期掛在快取裡反覆問」,你在 2027 年吃到的是雙重上漲——輸入單價漲、掛著不動的儲存費也漲。這種架構的人現在就該把快取生命週期重新盤一次。
另外一個容易被誤會的額度:Grounding with Google Search/Maps 每月有 5,000 次免費,但官方寫明這個額度是 shared across all Gemini 3.x models。換模型不會多拿一份免費額度,超出後每 1,000 次 US$14。
至於其他計費層,官方定價頁的分頁裡還有 Batch/Flex 的 US$0.375/US$1.875,2027 年起變成 US$0.75/US$3.75。
Priority 層則是 US$1.35/US$6.75,2027 年起變成 US$2.70/US$13.50。要注意 Priority 的速率上限只有標準值的 0.3 倍,這點在官方 rate limits 頁另有說明。
這一段的下一步很單純:把「因為便宜所以換」這個理由從你的決策表上劃掉。想知道留在 3.6 Flash 這一代到底省下多少,我另外把降價和省 token 相乘之後的帳單算過一遍,那篇的結論跟這篇不衝突,是互補的。
thinking_level 少了 MINIMAL,我的 agent 會不會直接壞掉?
Gemini 3.7 Flash 會讓設了 MINIMAL 的請求直接壞掉,而且是最直接的那種壞法:回一個錯誤,不是安靜降級。官方把 thinking_level 的可用值縮到 low、medium、high 三檔,MINIMAL 這一檔在 3.7 Flash 上已經不存在。
官方 thinking 文件有一張 Levels Supported 對照表,寫得清清楚楚:gemini-3.7-flash 支援 low、medium(預設)、high 三檔;gemini-3.6-flash 支援 minimal、low、medium、high 四檔。
Vertex AI 的 3.7 Flash 模型頁還在最上方掛了一則 Note,明文寫 thinking_level="MINIMAL" 對 3.7 Flash 不可用,明確設定為 MINIMAL 會回傳 API validation error。我去比對 3.6 Flash 的模型頁,同一則 Note 一次都沒出現。
📌 一句話判斷你會不會中招:在你的專案根目錄全域搜尋
MINIMAL和thinking_level。有命中而且你打算換模型 ID——你會在換上去的第一秒就收到錯誤。沒命中——這一段對你只是知識,不是風險。
接下來的問題是改成哪一檔。官方在最新模型指南裡替三個檔位各給了明確用途,這是把 MINIMAL 換掉時最直接的對照依據。
- low:縮短回答時間,官方點名的情境是事故應變流程、即時對話、寫草稿、快速資料分析。
- medium(預設):官方說法是多數任務的最佳品質,並特別建議用在複雜程式碼與 agent 場景,第一次就答對的比例較高。
- high:把思考與工具使用拉到最滿,適合複雜推理、難的數學、最難的程式與 agent 任務;官方同時註明它會吃掉更多 token 與成本。
照這個對照,原本掛 MINIMAL 的高頻簡單任務對應到的是 low,不是預設的 medium。遷移時如果只是把 thinking_level 整段刪掉,你會落到 medium 而不是 low,帳單的跳幅會比你預期的更大。
但真正麻煩的不是那個錯誤,錯誤至少會叫。麻煩的是你把 MINIMAL 改成 low 之後,帳單那邊沒有人會叫你。
原因在計價方式:官方定價頁註明,Gemini 3.7 Flash 的 output 單價 US$3.75/1M 是含 thinking tokens 的。模型「想」出來的那些字你看不到,但你要付錢。
所以每次呼叫的成本可以寫成這條式子,你可以直接代自己的數字:
每次呼叫成本 =(輸入 tokens ÷ 1,000,000 × 0.75)+((輸出 tokens + thinking tokens)÷ 1,000,000 × 3.75)
我用一個假設情境把它跑一遍,讓你看清楚變數在哪。以下數字全部是假設值,不是官方數據,也不是實測——官方從頭到尾沒有公布 low 這一檔會產生多少 thinking tokens。
假設你有一個高頻分類任務,輸入 2,000 tokens、輸出 50 tokens。在能用 MINIMAL 的情況下,假設 thinking tokens 趨近於 0:
- 輸入:2,000 ÷ 1,000,000 × 0.75 = US$0.0015
- 輸出:50 ÷ 1,000,000 × 3.75 = US$0.0001875
- 合計約 US$0.0016875 一次
現在假設換到 low 之後,每次多產生 300 個 thinking tokens(再強調一次,這個 300 是我隨手設的假設值,官方沒有公布):
- 輸入不變:US$0.0015
- 輸出變成 (50 + 300) ÷ 1,000,000 × 3.75 = US$0.0013125
- 合計約 US$0.0028125 一次,約為原本的 1.67 倍
1.67 這個數字沒有意義,因為 300 是我編的。有意義的是那條式子的形狀:分子裡多出來的 thinking tokens 是乘上 output 單價,不是 input 單價。output 單價是 input 的 5 倍,所以簡單任務對思考檔位特別敏感。
換句話說,用量越大、單次越簡單的任務,MINIMAL 消失的痛感越強。跑分類、抽取欄位、路由判斷這種一天跑幾萬次的活,正好全部落在這個區間。
那我會怎麼做?不猜倍數,直接量。我的習慣是換模型之前先開一個對照組:同一批 200 筆真實請求,一組打 3.6 Flash 的 minimal、一組打 3.7 Flash 的 low,把回傳的 usage metadata 裡的 thinking token 數存下來,兩邊各算一次平均。
這件事花不到半天,但它會把「換過去會不會變貴」從猜測變成一個數字。我帶團隊時最常擋掉的一種提案,就是「先換了再說,貴不了多少」——貴不了多少這五個字,通常是還沒算過的意思。
如果你連 usage metadata 都還沒開始記錄,那真正該先做的不是換模型,而是把浪費擠掉。agent 一個任務就燒掉好幾美元的原因跟砍半 token 的做法我整理過一份,先做完那一輪,你這次換版的對照數字才有意義。
工具面補一句:如果你的程式碼裡模型 ID 是散在十幾個檔案的字串,這次就是把它收斂到一個設定檔或模型路由層(OpenRouter 這類)的好時機。順手把 LLM 可觀測性或評測工具接上,下次再換版你就有基準線可以比,不用每次重來。
換到 Gemini 3.7 Flash 之前要改哪幾行?官方遷移清單六步
Google 把 Gemini 3.7 Flash 的官方遷移清單放在英文版的開發者最新模型指南裡,沒有中文版,也沒有任何一篇繁中報導提到它。整份清單共六個步驟,其中一步正好就是 MINIMAL 出事的地方。我把六步整理成中文版,你可以直接照著跑:
- ❶ 更新 model ID,改成
gemini-3.7-flash。 - ❷ 從 generation config 移除 temperature、top_p、top_k。
- ❸ 把 thinking_budget 改成字串列舉的 thinking_level(這一步就是 MINIMAL 出事的地方)。
- ❹ 移除 candidate_count,Gemini 3.x 系列不支援這個參數。
- ❺ 多輪對話改用伺服器端的 previous_interaction_id,並移除自己預先塞的 model turns。
- ❻ 稽核函式呼叫:多模態素材要放進 response payload、行內指令用
\n\n分隔;走 generateContent API 的還要讓每個 FunctionResponse 都帶上 call_id 與 name。
第 ❻ 步是最多人只做一半的一步。官方在這裡其實列了三件事,call_id 與 name 只是最後一條;如果你換完之後看到 Malformed_Function_Call,官方指的是工具呼叫前的文字造成的,文件裡另有一節專講繞法。
清單最後還壓了一條容易被跳過的前提:官方寫明 SDK 更新與 thought signature 的保存規則屬於 Gemini 3.x 的共同要求,要回頭看 Gemini 3.5 那份遷移清單。從 3.5 以前一路跳過來的人,這份基礎要先補完,上面六步才會成立。
其中第 ❷ 步有個好消息:官方另外註明 Gemini 3.6 Flash 就已經不支援 temperature/top_p/top_k 了。所以你如果是從 3.6 換到 3.7,這一步早就做完了,不用再改一次。
要從 3.5 Flash、3 Flash 或 3.1 Pro 一路跳過來的人才是苦主——上面六步你大概全部都要動。這也是我一直不建議跳版的原因:版本一次跨太多,遷移清單就會從六步變成六個下午。
🚨 這裡有一組官方自己打架的說法,你不要照抄任何一邊。Vertex AI 的 3.7 Flash 模型頁列出 Parameter defaults:Temperature 1.0/topP 0.95/topK 64。
但 Gemini API 那側的遷移指南要你把這三個參數全部拿掉,並說 3.6 Flash 起就不再支援。兩份都是 Google 官方文件,內容直接矛盾。
遇到這種情況我的處理原則很固定:以你實際會打的那支 API 的文件為準,然後用一次真實請求去驗。走 Gemini API 就以 ai.google.dev 為準,走 Vertex 就以 Vertex 文件為準,改完立刻打一次看它有沒有抱怨。文件會過期,回應不會騙人。
官方其實留了一條偷懶的路,但沒放進任何一篇報導。
遷移清單開頭那則 Note 寫著:可以讓支援 skill 的 coding agent 代跑這次遷移,裝上 Gemini Interactions API 的 skill 之後直接下 /gemini-interactions-api migrate my app to Gemini 3.7 Flash。
我會把它當草稿產生器而不是結案工具——讓它先掃一遍、產出 diff,再自己逐條核對上面六步。自動跑完就直接上線的話,前面講的 thinking_level 它可能幫你改對,也可能整段刪掉讓你默默落到 medium。
我自己會把這六步排成一個下午的工作,順序是:先在測試環境改 model ID 打一發看它噴什麼錯,再照噴出來的錯往回修。這比對著清單逐條改快很多,因為 API 會直接告訴你哪一條跟你有關。
這種「同價換版、但舊習慣要先改掉」的情境我不是第一次遇到。之前 Anthropic 那邊也有一模一樣的形狀,我列過四個換版前要先改掉的舊習慣,那份清單的邏輯跟這裡是通的,只是參數名不同。
這段的下一步:把六步印出來或貼進你的 issue tracker,一步一個 checkbox。不要憑印象改,遷移最常見的失敗不是改錯,是漏改。
用 Antigravity 的人什麼都不做,為什麼預設模型也會被換掉?
因為 Google 把 Antigravity agent 的預設模型直接換成了 Gemini 3.7 Flash。
官方遷移指南的 Updated Antigravity agent 段落寫明:由於效能與推理的改善,Gemini 3.7 Flash 已成為 Gemini Managed Agents 與 Google Antigravity SDK 中 Antigravity agent 的新預設模型。
這條事實在中文網路上一篇都沒有,但它影響的人可能比 API 開發者還多。因為它的觸發條件是「你什麼都不做」。
我看到這條的時候第一個反應是:那前面講的 thinking_level 相容性問題,對這群人來說根本不會出現在他們的程式碼裡,而是出現在他們的 agent 突然表現不一樣的那一天。
📌 沒有版本鎖的環境,等於把發版節奏的決定權交給供應商。三週(好啦,23 天)就換一版的節奏下,「預設值」不是一個穩定的東西。
實務上我會分兩種人給不同建議。
如果你用 Antigravity 是在做探索性的東西——試 idea、做原型、寫一次性腳本——那被換到新預設其實是好事,你白拿了 agent 面的改善,不用做任何事。
如果你已經把 Antigravity agent 接進某個會固定跑的流程,那我會建議你去把模型明確指定成你驗過的那一版,不要吃預設值。理由不是新版比較差,而是你需要「行為改變的時間點由我決定」這件事。
這也是我在產品端養成的偏執:任何我沒辦法解釋的行為變化,追查成本都比事先鎖版高。上一次我看 agent 建站工具的時候就發現,同一份 prompt 在不同底模下的產出差異,遠比大家想像的大——三個 agent 實際建站的差異那篇裡的落差就是活例子。
順帶一提,官方列的可用管道也值得記一下。開發者這邊是 Google AI Studio、Gemini API、Google Antigravity、Android Studio;企業端是 Gemini Enterprise Agent Platform 與 Gemini Enterprise app。
個人使用者比較尷尬:官方寫的是透過 Gemini App 裡的 Gemini Spark,而且限 Google AI Pro 與 Ultra 訂閱者,官方稱涵蓋 160 多個國家。換句話說,不付費的個人使用者在這一版沒有直接管道。
下一步:如果你有在用 Antigravity 或 Gemini Managed Agents,今天就去確認一下你的設定是「指定版本」還是「跟著預設走」。這個確認花不到五分鐘。想先看看 Antigravity 拿來建網站實際會遇到什麼,那篇有完整的操作紀錄。
Gemini 3.7 Flash 有哪一項反而輸給 3.6?官方 blog 沒放的三個數字
Gemini 3.7 Flash 確實有一項輸給 3.6 Flash,而且是 Google 自己放在 model card 表格裡的:CharXiv Reasoning(複雜圖表推理)無工具 84.5%,輸給 3.6 Flash 的 85.2%;有工具是 88.7% 對 89.4%。
這是整張表唯一的退步項,官方部落格只列了贏的五項,完全沒提它。
先把話說在前面:以下所有數字都是 Google 自測,不是第三方獨立評測,看的時候要打折。但即使打折,它們仍然有價值——因為這是 Google 用同一套方法測自家兩代模型的結果,趨勢是可信的。
| 評測項目(Google 自測) | 3.7 Flash | 3.6 Flash |
|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 34.4% |
| Terminal-bench 2.1 | 85.8% | 78.0% |
| Terminal-bench 3.0 | 14.9% | 5.4% |
| AutomationBench | 30.4% | 17.0% |
| OSWorld-2.0 | 47.9% | 33.8% |
| GDP.pdf | 34.0% | 22.0% |
| GDM-MRCR v2(128k) | 97.0% | 91.8% |
| LABBench2 | 82.1% | 76.1% |
| HLE-Verified | 53.6% | 51.2% |
| LVBench | 85.4% | 84.2% |
| CharXiv Reasoning(無工具) | 84.5% | 85.2% |
看得出形狀了嗎?贏最兇的全部集中在同一個方向:終端機操作、自動化任務、電腦操作、寫程式。輸的那一項,剛好是「看懂複雜圖表再推理」。
再說第二個數字。model card 同一張表裡有 Artificial Analysis 的綜合智慧指數:3.7 Flash 是 56,GPT-5.6 Terra 57、Muse Spark 1.2 57、Claude Sonnet 5 55。它不是那張表裡的第一名。
第三個數字更值得留意。GDPVal-AA v2 這個衡量知識工作的 Elo,3.7 Flash 是 1525,在同一張表的五個模型裡最低——Muse Spark 1.2 是 1628、Claude Sonnet 5 是 1598、GPT-5.6 Terra 是 1578。
它相對自己的上一代倒是進步的,3.6 Flash 只有 1422。所以這不是「變差」,是「進步幅度還沒追上別家」。
同一張表還有幾項它沒贏。Agent's Last Exam 是 26.3%,低於 Claude Sonnet 5 的 33.3% 與 GPT-5.6 Terra 的 28.0%。
Terminal-bench 3.0 雖然比自己的上一代進步很多,14.9% 仍然低於 GPT-5.6 Terra 的 20.8%;OSWorld-2.0 的 47.9% 也低於 GPT-5.6 Terra 的 50.2%。
🚨 兩處官方文件的數字對不起來,我兩個都列給你。DeepSWE v1.1 這一項,3.7 Flash 是 65.3%;但 3.6 Flash 的成績,英文與日文官方部落格內文都寫 49.0%,DeepMind model card 表格卻寫 48.6%。兩邊都是 Google 官方,我不替它選邊。
還有一個同類的狀況:那組 1588 對 1538 的 Elo,官方部落格說是來自 WebDev Arena,model card 同一組數字的列名卻是「Code Arena — Web development」。同樣的分數、不同的榜名,我查不到哪一邊才是對的。
這種事其實比跑分本身更值得注意。當一家公司自己的兩份文件對不上,你就知道這些數字被行銷加工過的程度有多高。我看新模型發表現在的習慣是:只信「同一份文件、同一套方法、跨兩代」的比較,跨文件、跨公司的橫向數字一律當參考。
要看跨家橫向怎麼比,那是另一個題目——我在跨家模型的橫向選購比較那篇裡有完整的分工邏輯,這篇就不重複了。
這一段的結論一句話:Gemini 3.7 Flash 是「寫程式與跑 agent 的強化版」,不是「知識工作的最強模型」。這句話直接決定下一段誰該換。
跑 agent 和知識密集分析,該上 Gemini 3.7 Flash 還是留在 3.6?
該上 Gemini 3.7 Flash 還是留在 3.6 Flash,決定權在用途不在版本號。既然兩版同價,你就少了「反正比較便宜」這個懶人理由,只能誠實面對自己每天拿模型在做什麼。
我的判斷分界線只有一條:你的模型是在「動手做事」還是在「看懂東西」?
動手做事的——跑終端機指令、操作瀏覽器、寫程式、跑自動化流程——這些正好是官方自測進步最兇的區塊,Terminal-bench 3.0 從 5.4% 拉到 14.9%、AutomationBench 從 17.0% 到 30.4%,這種幅度不是誤差。這群人我會說:換。
看懂東西的——每天餵一堆財報圖、儀表板截圖、統計圖表進去要它讀出結論——那唯一退步的 CharXiv Reasoning 就是你的日常。這群人我會說:先留在 3.6,等第三方獨立評測出來再說。
有個朋友在做內容自動化,聽到「新版更強」就想全線換過去。我問他一句話他就停了:「你那條線一天裡有幾成是在讀圖表?」他想了三秒說一半以上。那就別急。
這裡有個很多人會忽略的變因,跟跑分完全無關,但更容易咬人:知識截止日的雙標。
官方 model card 標的 knowledge cutoff 是 2026 年 3 月。但同一段 Known Limitations 自己附註:部分領域的使用者會發現模型的知識其實只到 2025 年 1 月(與 Gemini 3 系列一致)。
只看「2026 年 3 月」你會以為它知道今年的事,實際上涵蓋是不均的。做時事、法規、價格這類資訊的人,該做的還是把 Grounding 或自己的檢索接上去,不要相信模型腦子裡的日期。
📌 我的分流原則:進步的那幾項都需要「行動」,退步的那一項需要「理解」。所以判斷標準不是你用哪個 API,是你的任務裡「執行」跟「判讀」哪個比重高。
還有一種人我會建議先不要動:正在趕死線的專案。遷移清單六步不難,但驗證成本永遠比改的成本高。優惠價撐到 2026 年 12 月 31 日,你有的是時間慢慢換,沒必要在最忙的那週去動底層。
下一步:把你手上的任務清單分兩堆,一堆是「執行型」一堆是「判讀型」,數一數比例。真的兩邊都很重,那就分開跑——執行走 3.7、判讀留 3.6,兩版同價,你不用為此多付錢。想先確認自己整條線的模型分工合不合理,Pro、Flash、Flash-Lite 的實際分工對照可以拿來當底稿。
Gemini 3.7 Flash 的三個在地現實:沒有亞洲區域、不能微調、繁中官方頁還是舊的
三個現實裡最硬的一條先講:Vertex AI 上的 Gemini 3.7 Flash 沒有任何 asia 區域選項。
官方模型頁的 Supported regions 欄寫得很直接:Model availability 是 Global 加上 Multi-region 的 us 與 eu,ML processing 只有 us 和 eu。
Provisioned Throughput 與 Standard PayGo 一樣只有 global/us/eu。我去比對 3.6 Flash 的頁面,情況完全相同,所以這不是新版才有的限制。
這對有資料落地要求、或者法遵上必須說明資料在哪裡處理的團隊,是硬限制不是不方便。你沒有「選一個近一點的區域」這個選項,因為選單裡就沒有。中英文報導我一篇都沒看到提這件事。
那能拿到什麼?官方模型頁的 Security controls 欄列出線上推論、批次推論、context caching 三種情境都支援 Data residency、CMEK、VPC-SC 與 AXT。換句話說你拿得到的是「資料留在 us 或 eu」的落地承諾與金鑰控管,不是「資料留在亞洲」。
寫法遵文件時這個差別要講清楚:可控的是處理限定在哪一個多區域、以及金鑰由誰掌握;不可控的是那個區域不會在亞洲。先拿這兩句去問你們的法務,比先接完 API 再回頭補說明省事得多。
第二條是能力矩陣裡的兩個「不支援」:Gemini 3.7 Flash 不支援 Tuning(微調),也不支援 Gemini Live API。
支援的那一側倒是很齊全:Thinking、系統指令、結構化輸出、隱式與顯式的 context caching、Count Tokens、RAG Engine、Chat completions。
再往下還有 URL context、Grounding(Google Search/Maps)、程式碼執行、函式呼叫,以及還在 Preview 階段的 Computer use。
但如果你的產品路線是「拿自家資料微調一顆專用模型」,或者你在做即時語音互動,這一版就不是你的選項。這種限制在選型階段就要知道,不要做到一半才發現。
🚨 第三條最容易讓人做出錯誤決策:官方繁體中文的定價頁到現在還查不到 Gemini 3.7 Flash。我把繁中版整頁撈下來數過,全文 0 次提到 3.7 Flash,頁面最上方第一個模型區塊仍然是 Gemini 3.6 Flash。
models 文件的繁中版同樣是 0 次,官方部落格的繁中站也查無這篇文章,而日文站的對應網址是正常存在的。
對照組是英文版:同一個定價頁,gemini-3.7-flash 是第一個區塊。
解法很簡單,但你要知道才會做:把網址後面的語言參數從 ?hl=zh-tw 改成 ?hl=en,或者直接把 hl 參數整段刪掉。頁面會立刻換成有 3.7 Flash 的那一版。
我會特別把這條寫出來,是因為它的失敗方式很安靜。你打開官方頁、看到 3.6 Flash 是第一個、價格是舊的,你不會覺得哪裡不對——你會以為自己看到的就是最新資訊。這種錯不是你的錯,但代價是你的。
這件事會變。我把複查點設在 9 月中,如果那時繁中頁已經補上,這一段的操作建議就不再需要。
企業端還有兩個規格值得先確認。Batch API 的排隊額度在 Tier 1 下,Gemini 3.7 Flash 的 batch enqueued tokens 是 3,000,000,跟 3.6 Flash、3.5 Flash 相同(Flash-Lite 是 10,000,000)。
另外官方註明,完整的 Gemini 3.7 Frontier Safety Framework Report 會稍後才發布。也就是說現在還沒有公開的完整版可以送進法遵審查,這件事最好先跟法務講清楚。
多模態的硬規格我一併放這裡,這組數字沒有任何中文報導寫過:輸入吃 text/image/audio/video,輸出只有 text。單次最多 3,000 張圖、單檔上限 7MB(inline 或 console)或 30MB(GCS)。
PDF 單檔 50MB、最多 3,000 頁。影片含音訊約 45 分鐘、不含音訊約 1 小時、單次最多 10 支。音訊約 8.4 小時或 100 萬 tokens,單次 1 個檔案。
這一整組規格我只建議你先記兩個上限:單次 3,000 張圖、影片含音訊 45 分鐘。真正會在半夜卡住你的幾乎都是這兩條,其餘的用到再回官方頁查就好,背下來反而佔記憶體。
至於不是工程師、只是想在手機上用到新模型的人:官方寫的是 Gemini App 裡的 Gemini Spark,限 Google AI Pro 與 Ultra 訂閱者。
訂閱層級怎麼挑我不在這篇展開,四檔 Gemini 訂閱到底差在哪、哪一層才吃得到新模型那篇算得比較細;只想知道最高階那層值不值,AI Ultra 和 AI Pro 的規格落差那篇有完整對照。
Gemini 3.7 Flash 誰該換、誰該留?分眾決策表與我設的複查點
Gemini 3.7 Flash 該換還是該留,收成一張表就是下面這個樣子。判斷只問一個問題:你每天拿這顆模型做什麼。
| 你的主要用途 | 我的建議 | 理由與下一步 |
|---|---|---|
| coding agent、終端機自動化 | 換 | 官方自測進步最大的區塊;先跑六步遷移清單,再用同一批任務對照結果 |
| 圖表判讀、財報與統計分析 | 先留在 3.6 | CharXiv Reasoning 是唯一退步項;等第三方獨立評測出來再決定 |
| 高頻分類、抽取、路由 | 先量再換 | MINIMAL 消失可能推高 output 帳單;先做 200 筆對照組量 thinking tokens |
| 用 Antigravity 做原型探索 | 什麼都不用做 | 官方已把它設為新預設模型;白拿改善,但別把正式流程掛上去 |
| 需要資料落地或微調 | 不能換 | Vertex 沒有 asia 區域、不支援 Tuning;選型階段就要排除 |
| 只在手機上用 Gemini App | 看訂閱層級 | 需透過 Gemini Spark,限 AI Pro 或 Ultra;先確認自己那一層有沒有 |
| 正在趕死線的專案 | 先別動 | 優惠價到 2026-12-31,時間很夠;驗證成本高於改的成本 |
接著是時效。這篇裡有三個會過期的東西,我把複查點寫出來,你也可以照著設提醒。
- ❶ 2026 年 12 月 31 日:3.7 與 3.6 Flash 的 introductory pricing 到期,快取儲存費也在同一天結束優惠。
- ❷ 2027 年 1 月 1 日:標準層變成 US$1.50/US$7.50,Batch/Flex 與 Priority 同步調整。
- ❸ 9 月中:回頭看官方繁中定價頁有沒有補上 3.7 Flash,補上了就不必再手動切語言。
最後說一件我在這次翻文件時最有感的事。
我們這幾年被訓練成「看到新版就想升」,因為過去新版通常意味著更便宜或更快。但這一版把那個直覺打斷了:價格一樣、上下文一樣、輸出上限一樣,變的只有行為和相容性。
當變的只有行為,換版就從一個財務決策變成一個工程決策。財務決策可以看表格,工程決策只能靠驗證。這也是為什麼我這篇沒有給你一個「換就對了」的結論——因為我沒有你的任務清單。
同一個形狀最近其實出現過好幾次。上一場 API 價格變動裡,另一家把價目表整個重排的做法,跟這次 Google 用「同價、換行為」的做法對照著看很有意思——供應商越來越懂得把成本變化藏在你不會每天檢查的地方。
如果你手上還有 Claude 那條線要同步盤,同價換版該怎麼驗收那篇的驗證流程可以直接搬過來用;想再往前追一版 Gemini 的規格脈絡,Gemini 3.5 Pro 的規格與上線資訊也還留著。
FAQ 常見問題
我現在用 3.6 Flash,該不該立刻換到 Gemini 3.7 Flash?
看你的任務型態,不看版本號。跑 coding agent、終端機自動化、瀏覽器操作的,官方自測進步幅度很大,值得排一個下午做遷移。每天在判讀圖表的,唯一退步的 CharXiv Reasoning 就是你的日常,我會建議先留著。兩版現在同價,你不換也不會多花錢,這是這次最舒服的地方——你可以慢慢驗證。
我的流程大量用 thinking_level MINIMAL,換過去有沒有補救做法?
沒有直接對應的替代檔位,3.7 Flash 最低就是 low。可走的路有三條:把高頻簡單任務整批留在 3.6 Flash 不跟著換;換到 low 之後先量 thinking tokens 再全線推;或者重新設計 prompt,把需要「想」的部分拿掉。我會先做第一條,因為它的風險是零。
Gemini 3.7 Flash 和 3.6 Flash 現在同價,那 2027 年之後我該怎麼規劃?
2027 年 1 月 1 日起兩版一起變成 US$1.50/US$7.50,所以「留在 3.6 躲漲價」這條路不存在。真正要提前處理的是 context caching:儲存費從每 1M tokens 每小時 US$0.50 變成 US$1.00,長期掛快取的架構會被雙重上調。現在就去盤一次快取生命週期。
不是工程師、只用 Gemini App 的人,怎樣才用得到 Gemini 3.7 Flash?
官方給的路徑只有一條:Gemini App 裡的 Gemini Spark,限 Google AI Pro 與 Ultra 訂閱者,官方稱涵蓋 160 多個國家,免費使用者沒有直接管道。如果你正在考慮為此升級訂閱,先想清楚你會不會真的用到 agent 面的改善——這一版強在執行類任務,日常問答的差別多半感覺不出來。
公司要用 Gemini 3.7 Flash,資料一定會出境嗎?能不能微調?
Vertex AI 的供應區域只有 global 與 multi-region 的 us、eu,ML processing 更是只有 us 和 eu,沒有 asia 選項,資料落地在亞洲目前做不到。微調也不行,官方能力矩陣明列不支援 Tuning,同時也不支援 Gemini Live API。
另外完整的 Frontier Safety Framework Report 官方說會稍後才發布,法遵審查現在還拿不到完整版,這點要先跟法務對齊。
換版這件事,該由你決定時間點
整篇收束成一句:Gemini 3.7 Flash 這一版最值得注意的不是它多強,而是它在同一個價格上換掉了你的行為預設。
價格沒動、上下文沒動、輸出上限沒動,動的是 thinking_level 少一檔、Antigravity 預設換人、還有一項圖表推理反而退步。這三件事湊在一起,指向同一個動作:先確認你的任務屬於哪一類,再決定要不要動那行模型 ID。
我這幾年在產品端學到最實用的一課,是把「供應商改了什麼」跟「我要不要跟著改」分成兩個決定。前者不由你控制,後者完全由你控制。混在一起做,就會變成每次有新版都在救火。
今天就能做的三件事:全域搜一次 MINIMAL、把六步遷移清單貼進待辦、把官方定價頁的語言參數切成英文再看一次價格。三件事加起來不到 20 分鐘。
👉 如果你也習慣在換工具之前先把官方文件翻一遍,可以訂閱夜羽凌的部落格,會不定期收到信,我會繼續把這種藏在註腳裡的東西挖出來寫。
參考資料
- Google 官方部落格 — Introducing Gemini 3.7 Flash(英文版,含註腳 1 的漲價時程)
- Google 官方部落格日文版 — 同一篇發布文(註腳明載優惠同時適用 3.6 Flash)
- Google DeepMind — Gemini 3.7 Flash Model Card(跑分表、競品對照、Known Limitations)
- Google AI for Developers — Gemini API 官方定價頁(Standard/Batch/Flex/Priority 分頁)
- Google AI for Developers — 最新模型遷移指南(Migration checklist 與 Antigravity 預設模型)
- Google Cloud — Vertex AI 的 Gemini 3.7 Flash 模型頁(供應區域、能力矩陣、技術規格)