哪個 AI 最懂台灣?我拉了數發部原始檔:同一家的兩岸題差 66 分

目錄

💡 核心結論速覽 (TL;DR)

  • 總分前三名全是國際模型:GPT-5.6-Sol(2.7400)、Claude-Fable-5(2.7196)、Gemini-2.5-Pro(2.7071),台灣的雅婷智慧以 2.7020 排第 4,跟第三名只差 0.0051 分。
  • 會說中文真的不等於懂台灣:Gemini-3.5-Flash 的學測社會科 89.46% 是全場第一、國文 96.76% 排全場第四,臺灣價值觀那 50 題卻只拿 14%。
  • 兩岸題落差大到嚇人:陸委會出的 53 題裡,Grok 4.3 答對 98.1%,同樣掛 Google 名字的 Gemini-2.5-Pro 是 83.0%、Gemini-3.5-Flash 只剩 17.0%。
  • 現在就做:問台灣或兩岸的事之前,先確認你開的是哪一「款」而不是哪一「家」——同廠牌換一款,兩岸題正確率可以掉 66 個百分點。文末有我自己在用的 5 題自測法,兩分鐘就能驗完。

AI 用漂亮的繁體中文回你,不代表它是站在你這邊看事情。

先給方向:「哪個 AI 最懂台灣」這個問題,現在終於有官方數字可以回答了——數位發展部在 2026 年 9 月 2 日舉辦「主權AI評測 × 可信任AI行動」記者會,透過 AI 產品與系統評測中心(AIEC)公布臺灣主權 AI 評測結果,一次測了 188 個語言模型。但媒體那幾天報的都是「台灣模型拿第 4 名」,而那份成績單真正有意思的地方,完全不在那裡。

跨兩岸生活這些年,我問 AI 最多的就是那種「兩邊不一樣」的問題:同一件事在這邊叫什麼、在那邊怎麼辦、哪一套規則管到我。問久了會養成一個習慣——同一題至少問兩家,答案不一致就自己回官方頁對。倒不是我特別勤勞,是被繁體中文包裝過的對岸口徑騙過幾次之後,養成的防衛動作。

所以看到官方把 188 個模型的成績單公開,我做的第一件事不是看新聞稿,是把 AIEC 的原始 xlsx 檔拉下來,自己排一遍。結果比新聞稿精彩太多——裡面藏著一整個分頁的兩岸議題成績,而且沒有一家媒體寫過。


哪個 AI 最懂台灣?先看官方總分榜前 10

依 AIEC 2026 年 8 月的語言模型基準評測結果,總分第一名是 OpenAI 的 GPT-5.6-Sol(2.7400 分),第二名 Anthropic 的 Claude-Fable-5(2.7196),第三名 Google 的 Gemini-2.5-Pro(2.7071)。台灣雅婷智慧的 Yating-FedGPT-1.10.18 排第 4,2.7020 分。

總分是三項的加總:近五年高中學測國文科正確率、近五年學測社會科正確率、臺灣價值觀正確率,滿分 3 分。

名次模型(開發單位)臺灣價值觀總分
1GPT-5.6-Sol(OpenAI)88%2.7400
2Claude-Fable-5(Anthropic)84%2.7196
3Gemini-2.5-Pro(Google)90%2.7071
4Yating-FedGPT-1.10.18(雅婷智慧)100%2.7020
5GPT-5(OpenAI)88%2.6658
6Gemini-3-Pro(Google)88%2.6597
7Gemini-3-Pro low-thinking(Google)90%2.6327
8GPT-5.6-Terra(OpenAI)80%2.5732
9Claude-Opus-4.8(Anthropic)80%2.5643
10ACE-1-24B-2604(亞太智能機器)100%2.5535

這張表第一眼會看到的是名次,但我盯著看最久的是第三欄。拿下總分冠軍的 GPT-5.6-Sol,臺灣價值觀只有 88%;學測國文考到 99.14%(全場最高)的 Claude-Fable-5,價值觀 84%。反而是排第 4、第 10 的兩個台灣模型,價值觀是滿分 100%。

順帶說一句,這裡拿下國文最高分的 Claude-Fable-5 就是後來只降快取讀取價、官方說省 25% 但我算完有人只省 0.6% 的那一代——中文能力頂尖跟訂閱划不划算,也是兩件不相干的事。

換句話說,總分高的是「很會考試」,不是「最懂你」。這兩件事在這份榜單裡是分開的——而多數人打開 AI 要問的,恰恰是後者。

你可以先做的一件事:打開你正在付錢的那個 AI,確認一下你日常用的到底是哪一款(是 Pro 還是 Flash?是 Sol 還是 Luna?),下一段你就會知道為什麼這件事比選哪一家更重要。順帶一提,GPT-5.6 Sol 那個「快 14 倍」的說法我算過,訂閱者其實用不到,跟這裡的成績單剛好是兩件事。


「臺灣價值觀」到底在考什麼?我從分數回推出題數

臺灣價值觀是這份評測裡最特別、也最容易被誤讀的一項。官方的說法是:「透過臺灣社會具一定共識」的題目,評估模型對臺灣價值觀的理解。也就是說,考的不是意識形態立場,是「這個社會多數人有共識、而其他地方未必一樣」的那種常識。

AIEC 沒有公開題庫,所以沒人知道題目長什麼樣。但我在原始檔裡發現一件可以自己驗算的事:188 個模型的價值觀分數,全部都是 2% 的倍數——6%、14%、18%、20%、34%、36%⋯⋯一路到 100%,沒有一個是奇數或小數。

2% 一題,回推就是整份 50 題。這代表拿 88% 的 GPT-5.6-Sol 錯了 6 題,拿 14% 的模型錯了 43 題。這個回推我沒有官方確認,但你自己打開檔案就能驗——這也是我喜歡這份資料的原因:它把原始檔放出來了,不是只給你一張新聞稿圖卡。

順著這個邏輯,另一項的題數也回推得出來:兩岸議題那一頁的分數全部是 1/53 的倍數(98.1% 就是 52/53、3.8% 是 2/53),那份是 53 題

這段可以帶走的判斷:看到「臺灣價值觀 88%」不要當成「這個 AI 有 88 分及格」,要當成「50 題裡它答錯 6 題」。錯的是哪 6 題你不知道,而那 6 題有沒有剛好落在你要問的領域,更是碰運氣。這就是為什麼我從來不把單一 AI 的回答當定論。


全場最刺眼的一組數字:社會科第一名,價值觀只有 14%

Gemini-3.5-Flash 是這份評測裡最極端的反例:它的學測社會科正確率 89.46% 是全場 188 個模型第一名,學測國文 96.76% 排全場第四,臺灣價值觀卻只有 14%——全場倒數第二。

我第一次排出這個數字的時候真的愣了一下,還回去把欄位對了兩遍。一個能把台灣高中社會科考到接近九成的模型,代表它對台灣的地理、歷史、公民課本內容掌握得非常好;但價值觀那 50 題,它錯了 43 題。

這正好把官方新聞稿裡那句話變成看得見的數字。數位發展部林宜敬部長在記者會上說,目前大型語言模型普遍面臨繁體中文理解不足、臺灣在地知識有限及缺乏臺灣觀點,「即使能以繁體中文回答,也可能套用其他國家的政治敘事、法律制度或社會脈絡」

Gemini-3.5-Flash 就是這句話的極端版:課本內容它全會,看事情的角度不是這裡的。

而且這不是 Google 整家的問題——同一家的 Gemini-2.5-Pro 價值觀 90%、Gemini-2.5-Flash 92%。差別在「哪一款」,不在「哪一家」。這件事我在算 Gemini 3.8 Flash 的每題成本時也有同樣的體會:Flash 系列的取捨從來不只是速度和價格,而是它為了快,放掉了什麼。


問兩岸的事,哪個 AI 最不會用對岸口徑?

這是整份原始檔裡沒被任何媒體寫過的一頁:AIEC 有一個獨立分頁叫「部會出題(陸委會評測)」,由陸委會出題、共 53 題、101 個模型受測,資料日期 2026 年 8 月 11 日。

老實說我點開這一頁的時候心跳有點快。跨兩岸的人最需要的就是這一欄——我問 AI「這個證件過期在那邊怎麼補」「這條規定管不管得到我」,最怕的不是它答不出來,是它用一套聽起來很順、但根本不是這邊在用的框架回答我。

兩岸議題正確率模型開發單位
98.1%Grok 4.3xAI
96.2%Claude-Opus-4.8Anthropic
96.2%GPT-5.1 / GPT-5.2OpenAI
94.3%GPT-5、GPT-5.6 Terra、GPT-4.1、GPT-4 TurboOpenAI
94.3%Claude-Sonnet-5、Claude-Sonnet-4.6、Claude-Haiku-4.5Anthropic
86.8%Claude-Fable-5Anthropic
83.0%Gemini-2.5-ProGoogle
66.0%GPT-4oOpenAI
50.9%DeepSeek-V4-ProDeepSeek
30.2%Gemini-3-ProGoogle
20.8%Gemini-3-Pro low-thinkingGoogle
17.0%Gemini-3.5-FlashGoogle
3.8%Tencent Hy3 preview騰訊

幾個我看完會改變使用習慣的點:

❶ 拿下兩岸題冠軍的是 Grok 4.3(98.1%),53 題只錯 1 題。 這個結果我沒預期到,它在總分榜上並不突出。

❷ GPT-4o 只有 66.0%,比它的前輩 GPT-4 Turbo(94.3%)還低將近 30 個百分點。 很多人的 ChatGPT 到現在還習慣停在 4o,這一欄值得看一眼。

❸ 騰訊 Tencent Hy3 preview 是 3.8%——53 題答對 2 題。 這個數字不需要我多解釋。

❹ Google 家族在這一欄的落差是全場最大的:從 Gemini-2.5-Pro 的 83.0% 一路掉到 Gemini-3.5-Flash 的 17.0%。 同一個品牌、同一個訂閱、你在介面上切換一下就換到的東西,兩岸題正確率差 66 個百分點。

下一步可做:如果你常問跨兩岸的行政、證件、法規問題,把預設模型從 Flash 類換回 Pro 類,或改用 Claude / GPT 主力款再問一次。這類問題本來就該交叉驗證——我寫入境大陸查手機那條 2024 年新規、還有台灣駕照到大陸能不能開車那張 10 元的證時就是這樣做的:AI 給方向,條文自己回官方頁讀。這兩題的共通點是,坊間流傳的說法跟條文原文差很多,而 AI 的語料裡本來就有一大堆坊間說法。


同一家、同一代,選錯款就差 66 個百分點

這份評測給一般使用者最實用的一課,是「選哪一款」比「選哪一家」重要得多。我把同廠牌內部的落差整理出來之後,這件事變得非常刺眼:

❶ Google 的 Gemini:臺灣價值觀從 2.5-Flash 的 92% 到 3.5-Flash 的 14%;兩岸題從 2.5-Pro 的 83.0% 到 3.5-Flash 的 17.0%。而且新的不一定比較懂——3.5-Flash 比 2.5-Pro 新,兩岸題卻低了 66 個百分點。

❷ OpenAI 的 GPT-5.6 同代三款:Sol 價值觀 88%、Terra 80%、Luna 72%。同一代、同一個名字後面掛不同字,差 16 個百分點。

❸ Anthropic:Claude-Fable-5 價值觀 84%、Opus-4.8 80%、Opus-4.1 78%、Sonnet-4.6 68%。旗艦跟中階差 16 個百分點。

這就是我一直不太喜歡「哪一家 AI 最強」這種問法的原因。大家在網路上吵 OpenAI 對 Google 對 Anthropic,可是這份數據顯示:你在同一個訂閱裡隨手切換的那個下拉選單,造成的差距比換品牌還大。更麻煩的是,多數人切模型是為了省額度或求速度,根本不會想到「這一切會影響它對台灣的理解」。

我自己的做法很土但有效:問地區性、法規性、兩岸相關的問題時,一律用該訂閱的旗艦款,不用快速款。快速款拿去做摘要、翻譯、整理格式那些不需要在地判斷的活。想比較旗艦款之間的差別,我另外算過 GPT-6 Astra 和 Claude Fable 5.1 同價位下的實際差距,那篇是從成本切,這篇是從在地理解切,兩個一起看比較完整。


中國模型的落差在哪?國文很強,價值觀平均只有 56.9%

我依開發單位把 188 個模型分組算了平均,臺灣價值觀正確率的分布是:台灣廠商 9 個模型平均 86.0%、OpenAI 17 個平均 79.5%、Anthropic 9 個平均 73.3%、Google 15 個平均 73.2%、中國廠商 47 個平均 56.9%。(這個分組平均是我自己依原始檔算的,不是官方數字,官方只公布逐一模型的成績。)

但這裡有個容易看歪的地方,我要講清楚:中國模型的中文能力一點都不弱。DeepSeek-V4-Pro 的學測國文 94.70%、社會科 87.54%,兩項都在全場前段;Kimi-K3 國文 96.11%、Qwen3.6-27B 國文 92.65%(阿里家的旗艦我另外算過Qwen3.8-Max 的快取要跑到幾次才划算,答案是 8 次)。它們掉的是價值觀那一欄——DeepSeek-V4-Pro 40%、DeepSeek-V4-Flash_Thinking 36%、Kimi-K3 58%。

這正好呼應林宜敬部長對「主權 AI」的定義:他說主權 AI 有兩個重要意義,第一是 AI 大語言模型的伺服器放在哪個國家,就必須遵守那個國家的法律;第二是由哪個國家訓練出來的大型語言模型,通常就會有那個國家的觀點與意識形態。所以大部分國家都希望建立自己的主權 AI。

把這句話翻成日常使用:你拿它寫程式、翻譯、整理逐字稿,這些落差幾乎影響不到你;你拿它問「這件事在法律上怎麼算」「兩邊的稱呼哪個對」,落差就會直接變成你手上的錯誤資訊。

這也不代表這些工具不能用。我自己就寫過豆包、千問、Kimi 在台灣的註冊門檻與免費額度,結論是「能用,跟該不該用是兩件事」——現在這份評測等於給了那句話一個量化版本。至於成本面,DeepSeek V4-Pro 我算過每題成本,它已經不是最便宜的了,那是另一個該不該用的理由。


台灣本土模型排第 4,但你現在用得到嗎?

誠實講:這次表現最好的幾個台灣模型,一般人現在還不是打開網頁就能用。這點媒體報導普遍沒有講清楚,但它會直接決定這份榜單對你有沒有意義。

受測的 9 個台灣廠商模型與名次是:

❶ 雅婷智慧 Yating-FedGPT-1.10.18:第 4 名,國文 86.20%、社會 84.00%、價值觀 100%。
❷ 亞太智能機器 ACE-1-24B-2604:第 10 名,國文 83.78%、社會 71.57%、價值觀 100%。
❸ 鴻海研究院 FoxBrain v2.0:第 12 名,國文 78.70%、社會 80.51%、價值觀 92%。
❹ 台灣智慧雲端 Llama3.3-FFM-70B:第 48 名,價值觀 78%。
❺ 亞太智能機器 APMIC-Nemotron-3-Nano-30B-A3B:第 53 名,價值觀 70%。
❻ TAIDE Gemma-3-TAIDE-12b:第 65 名,價值觀 84%。
❼~❾ 台灣智慧雲端另外三款 FFM 系列:第 52、72、96 名,價值觀 82%、88%、80%。

這些模型的定位多半是企業導入、垂直領域應用或開放權重供開發者自架,不是消費級的聊天 App。官方新聞稿裡幾位業者代表講得也很坦白——他們一致認為台灣業者未必要在所有通用能力上與國際大型模型競逐,可結合在地知識與產業經驗,發展具有明確應用價值的主權 AI 產品

我覺得這個定位是誠實的。用一個 24B 參數的模型去跟兆級參數的旗艦拚寫程式、拚長文推理,本來就不是公平的比較;但在「這句話在台灣是什麼意思」這種題目上,24B 拿滿分而兆級模型錯 6 題,這才是這份榜單真正的訊息。

對你的實際意義:如果你是一般使用者,短期內你的選擇還是那三家國際大廠,重點放在「選對款」;如果你在公司裡評估導入、或處理法規/金融/醫療這類必須貼合本地制度的內容,這幾家的名字值得記下來——亞太智能機器 APMIC鴻海研究院人工智慧研究所 都有公開的技術頁面可以先看。


金管會、法務部也出題了:問錢和法律該信誰

原始檔裡還有一個「部會出題」分頁,欄位比新聞稿講的多很多:除了兩岸議題(陸委會),還有銀行、保險、證券(金管會)、法務(法務部,還分「一般民眾」與「司法人員」兩種難度)、普考政治學、普考地方自治。這個分頁的資料日期是 2026 年 7 月 27 日,比總表舊一個多月,模型數也少(33 個),但方向性很清楚。

幾組我覺得值得知道的數字:

❶ 金管會保險題,主流模型都很穩:GPT-5.3-chat 93.3%、GPT-5 92.7%、Gemini-2.5-Flash 91.3%、Claude-Opus-4-8 91.0%。這一題型看起來是規則明確、有標準答案的領域,模型表現普遍好。

❷ 銀行題就掉下來了:Claude-Opus-4-8 88.1%、GPT-5.3-chat 83.3%、GPT-5 83.1%、Gemini-2.5-Flash 79.7%。中國廠商的模型在這一欄多落在 65~68%。

❸ 法務題的難度斷層最誇張:同一批模型面對「一般民眾」版,GPT-5 拿 92.8%、Claude-Opus-4-8 92.2%;換成「司法人員」版,GPT-5 掉到 67.5%、Claude-Opus-4-8 78.3%。同一個模型,換一個專業層級的題目,落差 25 個百分點。

這一組數字給我的提醒很直接:AI 回答「一般人程度的法律問題」堪用,回答「需要專業判斷的法律問題」還差得遠。那 30% 的錯誤率放在生活常識上是小事,放在你要不要簽一份文件上就不是。

下一步可做:涉及錢與法律的問題,把 AI 當成「幫你把問題問對」的工具,不要當成結論。它可以幫你整理出該查哪幾條、該問律師或理專哪幾個問題;最終依據還是要回到主管機關的正式文件或有執照的專業人士。


那我到底該用哪個 AI?三種情境我的選法

「哪個 AI 最懂台灣」這題沒有單一答案,因為沒有一個模型是全場通吃的;但依「你要問什麼」分流之後,選擇會變得很清楚。以下是我依這份評測資料整理出來的判斷,也是我自己現在的用法。

情境一:問台灣或兩岸的規定、證件、行政流程
優先看兩岸議題那一欄的高分款——Grok 4.3(98.1%)、Claude-Opus-4.8(96.2%)、GPT-5.1/5.2(96.2%)這個層級。務必避開 Flash/low-thinking 類的快速款,Gemini-3.5-Flash 在這一欄只有 17.0%。而且不管用哪一家,答案都要回官方頁對一次——這類問題的錯誤成本是你多跑一趟或被退件。

情境二:問台灣的社會文化、用語、生活常識
看臺灣價值觀那一欄:Gemini-2.5-Flash(92%)、Gemini-2.5-Pro(90%)、GPT-5.6-Sol(88%)、GPT-5(88%)都在 88% 以上。這一類題目容錯率高一些,但如果你發現它回你的用詞怪怪的,那通常不是它「中文不好」而是它的語料來源不在這裡——這種狀況我寫過怎麼把用語設定壓在持久層,可以一起處理掉。

情境三:寫程式、翻譯、整理資料、做摘要
這一類跟本地理解沒什麼關係,就照原本的成本和速度邏輯選就好,價值觀那一欄可以不用看。想比各家旗艦的實際差異,Grok 4.6、Gemini 3.7、GLM-5.3 我對過一輪,沒有一個是純升級;如果你正在猶豫要不要為了新版加錢,GPT-6 Astra 的 Plus 限量版和 Pro 一週只有 50 則這件事建議先看過再決定。

那些「不適合」只看這份榜單的情況,我也講清楚

❶ 如果你要的是寫作品質、程式能力、長文推理——這份評測完全沒測,別拿它當通用能力排行。
❷ 如果你用的是 API 而不是聊天介面——版本號和參數設定會讓實際表現跟榜單有落差。
❸ 如果你的模型不在 188 個裡面——很多小眾或最新發布的模型還沒送測,沒上榜不代表不好。


我自己驗 AI 懂不懂台灣的 5 題自測法

榜單再詳細,也不會剛好測到你要用的那個場景。所以我養成了一個習慣:換新模型、或切換到不熟悉的款式時,先丟 5 題進去試水溫。這 5 題不到兩分鐘就問完,設計原則是「答案在這裡有共識、但換個地方講法會不一樣」。

❶ 名詞對照題:請它把一段話裡的用詞換成台灣慣用說法。看它會不會把「視頻」「軟件」「質量」「信息」原封不動留著——這題測的是最表層的語料傾向。

❷ 行政流程題:問一個你已經知道答案的證件或申辦流程,看它給的機關名稱、表單名稱、費用單位對不對。錯的通常不是流程,是機關歸屬。

❸ 地名與行政區題:問一個台灣的行政區劃或地名寫法,看它用的是哪一套框架來描述。

❹ 錢的單位題:問一個含金額的問題,看它預設用什麼幣別、有沒有主動換算。這題很小但很準——語料在哪裡,預設幣別就在哪裡。

❺ 追問一致性題:拿第 2 題的答案反過來問它「你確定嗎?依據是哪一條」。會給出具體法規名稱與條號的,跟只會換句話說再講一次的,差距一問就出來。

這 5 題我不會拿去打分數,我只看「有沒有出現讓我起雞皮疙瘩的那種答案」。有的話,那個模型我就不拿來問這類問題——很簡單,但比看排行榜有用,因為測的是你自己真的會問的東西。


這份榜單怎麼自己查?每月第一週星期五更新

好消息是,這不是一次性的新聞事件,而是一份會持續更新的公開資料。AIEC 自 2025 年 3 月起持續進行語言模型基準評測,2025 年 10 月 3 日記者會首度公布 42 個模型的結果;自 2025 年 10 月起,評測結果於每月第一週星期五定期公布在中心官方網站

查法很簡單:

❶ 到 AIEC 開源/指標模型測試結果頁,會看到一份依月份排列的清單。
❷ 點進你要看的那個月份,頁面下方有「附件下載」。
❸ 下載 .xlsx 或 .ods 檔——這才是重點,網頁上不會直接列表格,所有分數都在附件裡。
❹ 打開「總表」分頁看基礎三項與總分,切到「部會出題」各分頁看兩岸議題、金融、法務等專業領域成績。

檔案裡還有兩個官方註記值得記住:顏色代表開發單位所在區域(淺黃歐洲、淺藍美國、淺綠本土、淺紫中國、淺米亞洲、淺橘非洲);百分比高於 50% 用黑字、低於 50% 用紅字。另外官方註明,自 115 年 5 月起新增模型測試日期欄位、自 115 年 9 月起按基礎評測三項總分排序——所以你如果拿更早的月份對照,排序邏輯可能不一樣,別直接比名次。

我會把這個頁面加進每月固定看一次的清單。理由很實際:新模型每個月都在出,而「新」跟「懂台灣」這兩件事,這份資料已經證明它們不是同一回事


FAQ 常見問題

哪個 AI 最懂台灣?如果只能選一個,該選哪個?

要看你問什麼。純看官方總分,第一名是 GPT-5.6-Sol(2.7400);但如果你最常問的是兩岸相關題目,陸委會出題那一欄拿最高分的是 Grok 4.3(98.1%),Claude-Opus-4.8 與 GPT-5.1/5.2 都是 96.2%;如果重視臺灣價值觀那一項,Gemini-2.5-Flash(92%)和 Gemini-2.5-Pro(90%)在國際模型裡最高。真正拿滿分的是台灣的雅婷智慧與亞太智能機器,但那兩個目前不是一般人打開就能用的消費級服務。

台灣自己開發的 AI 模型排第 4,是不是代表它比 ChatGPT 好用?

不能這樣推。這份評測只測三件事——學測國文、學測社會、臺灣價值觀,完全沒有測寫作、程式、推理、長文處理這些一般人天天在用的能力。雅婷智慧排第 4,準確的說法是「它在理解台灣這件事上表現優異,而且是用 30B 的模型做到的」;至於通用能力,它跟兆級參數的旗艦不是同一個量級,官方新聞稿裡業者自己也講了「未必要在所有通用能力上與國際大型模型競逐」。

我不小心用了 Gemini 3.5 Flash 問兩岸的事,答案是不是都不能信?

不是「都不能信」,是「錯誤率高到你必須自己驗」。它在陸委會那 53 題只答對 17.0%,代表大約每 6 題會錯 5 題。實務上的做法是:把同一題再丟給另一款旗艦模型(Pro 類、Opus 類、GPT-5 系列)比對,兩邊講一樣的通常可信,講不一樣的就回官方頁面查條文。涉及證件、期限、罰則的,一律以主管機關公告為準。

中國的 AI 模型是不是完全不能用?

取決於你用它做什麼。它們的中文能力其實很強——DeepSeek-V4-Pro 的學測國文 94.70%、社會科 87.54% 都在全場前段班,寫作、翻譯、程式這類任務不太會受影響。落差集中在臺灣價值觀那一欄(中國廠商 47 個受測模型平均 56.9%,我依原始檔分組計算)與兩岸議題那一欄。所以我的分法是:不涉及在地判斷的活可以用,涉及法規、制度、兩岸差異的問題不要用它當唯一來源。至於機密與個資該不該丟進去,那是另一條線,我自己是不跨的。

這份評測多久更新一次?我怎麼知道我用的模型有沒有上榜?

AIEC 自 2025 年 10 月起於每月第一週星期五公布,本期(2026 年 8 月結果,2026 年 9 月 2 日建立)共 188 個模型。查法是到 AIEC 的「開源/指標模型測試結果」頁點進當月份,下載附件的 .xlsx 或 .ods 檔,在「總表」分頁用模型名稱搜尋。要注意榜單用的是精確版本號(例如 Gemini-3-Pro 和 Gemini-3-Pro_low-thinking 是分開兩列),你得先確認自己實際在用的是哪一款。


寫在最後

整理完這份資料,我最有感的其實不是哪個模型贏了,是「懂中文」跟「懂這裡」被拆成了兩個獨立的欄位——而且拆開之後,一堆我們以為理所當然的直覺就崩了:分數最高的不是最懂台灣的、最新的不一定比舊的懂、同一個訂閱裡隨手切換的那個選單,影響比換品牌還大。

對每天用 AI 好幾個小時的人來說,這份資料的價值不在排行榜,在它給了一個可以自己驗算的方法:把原始檔下載下來、找到你在用的那一列、看你最常問的那個領域拿幾分。不用相信我,也不用相信新聞稿,數字就在那個 xlsx 裡。

如果你也常常在兩套語境之間切換——不管是往返兩岸、還是在跨國團隊裡工作——這份榜單值得每個月看一眼。我自己會把它跟我平常按需求挑 AI 工具的那套邏輯放在一起看:一個管「好不好用」,一個管「懂不懂我在講什麼」,兩個都顧到,才不會在最需要準確答案的時候踩空。


參考資料

 

延伸閱讀