AI 味怎麼看出來?維基百科整理的特徵清單,有 6 個判準其實會誤判

目錄

💡 核心結論速覽 (TL;DR)

  • 破折號已經不能當判準:一份 2026 年 7 月的研究指出,當代模型裡只有 Claude 用破折號比專業寫手多,ChatGPT 反而用得更少;GPT-5.1 甚至被特地調整成少用。
  • AI 高頻詞會換代delve 在 2023 年紅極一時,2025 年幾乎消失。拿兩年前的詞表抓今年的稿子,抓到的多半是冤枉的。
  • 真正一抓一個準的是「殘留標記」oaicite[cite: 1]grok_card 這類複製貼上帶出來的字串,搜一次就見真章,比看用詞可靠太多。
  • 先排除誤判再下判斷:完美文法、正式文風、冷冰冰的語氣這 6 項都被維基百科列為無效指標;我拿七百多篇中文稿實測關鍵詞比對,命中的幾乎全是假陽性。

朋友上週丟給我一段截圖,是他部門主管在群組裡發的:「以後交上來的稿子,我看到破折號就退件。」他問我這個標準合不合理。

我的直覺反應是——這條規則在 2023 年可能有點道理,但放到現在,它抓到的冤案會比真案多。而且不只破折號,市面上流傳的那套「AI 味辨識法」,有超過一半的判準其實已經失效或本來就不成立。

這件事其實有一份出乎意料完整的參考資料:英文維基百科的編輯社群,為了對付湧入的 AI 生成條目,協作維護了一份「AI 寫作特徵」指引,分成十三個大類,而且到現在還在更新。更難得的是,它專門留了一個章節叫「無效指標」,寫的是哪些特徵不能拿來當證據

這篇我把那份清單整個拆過一遍,挑出真正還有效的、已經過期的、以及會冤枉人的,再補上英文清單沒有的中文專屬破綻。你可以直接拿去用。


AI 味是什麼?先分清楚「讀起來像 AI」跟「真的是 AI 寫的」

AI 味指的是一種語感上的違和:句子都對、文法都通,但節奏太平均、資訊密度太低、像在填格子。它是閱讀體驗的問題,不等於作者身分的問題。

這兩件事一定要拆開,因為它們的處理方式完全相反。

讀起來像 AI,是可以靠改寫解決的品質問題;真的是 AI 寫的,是一個關於身分的指控。前者你自己修就好,後者你一旦說出口,就要準備好證據。

我看過太多人把這兩件事混在一起講。有人文筆本來就工整,被同事拿「太像 AI」當理由退稿;也有人明明整篇是機器產的,因為刻意加了幾句口語,就這樣過關了。用語感當唯一標準,冤枉的和放過的通常一樣多。

維基百科那份指引一開頭就先說了這件事:光靠文風判斷 LLM 生成的文字,沒有想像中容易。而且誤指他人用 AI 會趕跑新人、製造猜忌氛圍;在指控之前,應該先自問是不是被鄧寧-克魯格效應或確認偏誤影響了判斷。

一份給編輯用的糾察指引,開場先叫你懷疑自己——這個態度我覺得比清單本身更值得抄。


維基百科那份 AI 寫作特徵清單是怎麼來的?為什麼值得看

它是英文維基百科的一份編輯指引,不是條目,而是社群為了處理 AI 生成投稿累積出來的實務筆記,由大量編輯反覆修改而成。

我會建議看它,理由有三個,而且都跟一般網路上那些「十個 AI 味特徵」不一樣。

❶ 它是被實際使用過的。寫它的人每天在處理真的投稿,判斷錯了會有人吵架,所以每一條都被質疑過。

❷ 它會標示過期。清單裡有專門的「歷史指標」章節,收的是以前有效、現在失效的特徵,例如 2022 到 2024 年那種「身為一個 AI 語言模型,我無法……」的免責開場白。

❸ 它有「無效指標」章節。這是我認為最有價值的部分,下一段整段講它。

順帶一提,我去看的時候,那頁頂端還掛著一個維護提示,說「與最新模型相關的部分需要更新」。連這份最勤於維護的清單都在標自己過期——這件事本身就在提醒你,任何 AI 辨識法都有保鮮期。


最常被當證據、其實會誤判的 6 個判準

維基百科把以下六項列為無效指標,意思是它們不但證明不了什麼,有些甚至指向相反的結論。這張表你可以先存起來,下次有人說「這篇一看就是 AI 寫的」時拿出來對。

被拿來當證據的特徵 為什麼不成立
文法完美、幾乎沒有錯字 很多人本來就是專業寫手或編輯出身,文法好是職業技能,不是機器指紋
文風正式、學術、用字華麗 模型偏好的是特定幾個字,不是「所有正式的字」;把整類文風打包當證據是過度推論
文風冷淡、像機器人 模型的預設其實偏正面、偏囉唆;真正的冷硬文風反而不太像它的輸出
口語跟正式語混在一起用 可能只是理工背景的人隨手寫、可能是年輕世代的語感、可能是神經多樣性,也可能只是多人共筆
愛用轉折詞(另外、因此、值得注意的是) 只有少數幾個轉折詞真的被過度使用,而且這種寫法在論說文裡本來就常見,多數風格指南也接受
沒有附出處 維基百科上超過 57 萬篇條目被標缺來源,多數還早於 LLM 出現;而現在的模型反而會主動附引用(雖然不保證正確)

我自己最有感的是第一項跟第三項。

身為那種寫完會逐句回頭改三遍的人,我很早就發現「寫得太順」在某些場合會變成扣分項。這幾年幫朋友看稿,最常聽到的一句抱怨就是:「我明明自己寫的,主管說太像 AI。」要一個人自證沒有用工具,其實是無法完成的任務——你能拿出什麼?

維基百科給的解法我覺得很實際:看對方能不能解釋自己的取捨。問他為什麼這裡用這個字、為什麼這段放在前面。寫的人講得出來,抄的人講不出來。這比任何文風分析都準。


破折號還能當判準嗎?2026 年的答案跟你想的不一樣

不能了,至少不能單獨用。這是這幾年翻轉最徹底的一條判準。

維基百科引用了一份 2026 年 7 月的研究,結論是:當代模型裡只有 Claude 使用破折號的頻率高於專業寫手,而 ChatGPT 用得比專業寫手還少

會變成這樣,是因為廠商真的去調了。Ars Technica 在 2025 年 11 月報導過一件有點好笑的事:OpenAI 的執行長 Sam Altman 公開慶祝 ChatGPT 「終於願意遵守破折號的格式規則」。當「愛用破折號」變成公認的 AI 標記,廠商的反應就是把它調掉。

所以現在的狀況變成這樣:

  • 看到一堆破折號 → 可能是 Claude,也可能是那種本來就愛用破折號的人(我就是)
  • 看不到破折號 → 完全不能排除是 AI,因為新版模型本來就少用了

如果真的要看標點,有個細節比「有沒有破折號」可靠得多:看破折號前後有沒有空格。維基百科指出,模型產生的破折號常常兩邊帶空格,而熟悉這個符號的人多半知道慣例是不加的。這是排版習慣的破綻,不是用字偏好,比較難靠改寫掩蓋。

同一個道理也適用於引號。ChatGPT 和 DeepSeek 傾向使用彎引號(“ ”)而不是直引號,有時甚至在同一段裡混用兩種。但這一條千萬別當證據——Word 的智慧引號、macOS 和 iOS 的系統預設、還有一堆文法檢查工具,都會自動幫你轉成彎引號。


AI 高頻詞會換代:2023、2024、2026 各是哪一批

網路上流傳的「AI 愛用詞表」大多停在 2023 年,這是它們現在失準的主因。維基百科按模型世代把這些詞分了組,看完你會發現詞彙汰換的速度比想像中快。

時期 代表高頻詞
2023 至 2024 年中 delvetapestrytestamentpivotalmeticulousintricateboastsvibrantgarnerunderscore
2024 年中至 2025 年中 align withfosteringshowcasingenhancehighlightingenduring
2025 年中以後 emphasizingenhancehighlighting(整體收斂,辨識度下降)

delve 是最好的例子。它在 2023 年紅到變成梗,2024 年下半開始減少,2025 年急遽下降。現在還在用「有沒有 delve」抓稿子的人,抓的是三年前的模型。

比單字更耐用的是句構層級的習慣,因為那比較不容易被廠商一次調掉:

❶ 迴避基本的「是」。不寫 is/are,改成 serves as、stands as、represents、functions as、boasts、features——中文對應就是不寫「是」,改寫成「扮演著⋯⋯的角色」「堪稱⋯⋯」「體現了⋯⋯」。

❷ 否定式排比。三種變形:「不只 X,還 Y」「不是 X,而是 Y」「與其說 X,不如說 Y」。這條在中文裡特別明顯,下一段細講。

❸ 三的法則。什麼都湊三個:三個形容詞、三個短語、三個要點。維基百科的觀察很銳利——模型常用這個結構讓膚淺的分析看起來很完整


中文的 AI 味長什麼樣?英文清單沒寫的部分

維基百科那份清單是為英文寫的,直接套到中文會漏掉一大半。這一段是我自己整理的觀察,沒有對應的研究可以引,你就當成一份實務筆記來看。

中文最容易露餡的地方,我認為不是用詞,而是句子的長度分布

人寫東西的節奏是不平均的:想通一件事的時候會一口氣寫很長,卡住的時候會突然冒出一個五個字的短句。機器產出的中文,句長會收斂到一個很窄的區間,整段讀下來像節拍器。你把段落貼進編輯器,看每一句的長度是不是都差不多,比逐字比對詞表有效。

除此之外,這幾個中文專屬的痕跡我覺得辨識度最高:

中文 AI 味特徵 實際長相
對比句式成癮 「不是⋯⋯而是⋯⋯」「真正的問題不在⋯⋯而在⋯⋯」一段裡出現兩次以上
萬用抽象名詞收尾 句子最後掛上「的關鍵」「的核心」「的本質」「的底層邏輯」,但沒有具體所指
過度導覽 「接下來我們將探討」「綜上所述」「值得注意的是」——把段落之間的關係講出來,人通常直接寫下一句
情緒詞浮在表面 「令人驚豔」「相當實用」「非常值得」,但沒有任何具體場景支撐這個評價
簡繁語彙混入 繁體文章裡出現「視頻」「軟件」「質量」「信息」「屏幕」,通常是語料混進來的痕跡
條列強迫症 不需要並列的東西硬排成三點,而且每點字數整齊得不自然

最後那個「簡繁語彙混入」,我覺得是中文圈最實用的一條。它不是語感問題,是可驗證的事實錯誤——繁體使用者不會自然寫出「視頻」。這種痕跡和英文的殘留標記是同一類:屬於作業流程漏出來的東西,不是風格偏好。

如果你要建自己的檢查清單,我會建議先從空話、重複、沒觀點這三個高頻毛病下手,因為它們比用詞更影響讀者要不要看完。

還有一件事很多人沒注意到:不同模型的中文語感差很多。同一段提示丟給三家,出來的句長習慣和愛用詞都不一樣,所以「AI 味」根本不是單一種味道。這也是為什麼下指令的寫法要因家而異,用同一套規則套所有工具,結果通常兩邊都不到位。


真正一抓一個準的:各家模型的殘留標記

如果你只能記住這篇的一件事,記這個:去搜殘留標記,不要去猜文風。

這些是模型在生成引用、附件、搜尋結果時使用的內部字串。正常情況下介面會把它們渲染掉,但只要是複製貼上,就有機會整串跑出來留在文件裡。維基百科整理了各家的特徵字串:

來源 會出現的字串
ChatGPT contentReferenceoaiciteoai_citationturn0search0
Gemini [cite: 1][span_1](start_span)
Grok grok_cardgrok_render_citation_card_json
DeepSeek 六角括號、劍號等異常符號
Perplexity attached_fileppl-ai-file-upload

另外還有一類同樣好抓的:對話殘留。像是「當然可以!以下是為您整理的⋯⋯」「希望這個版本符合您的需求」「如需調整請告訴我」,或是引用網址後面掛著 utm_source=chatgpt.com 這種追蹤參數。

這類證據跟文風分析的差別在於它不需要主觀判斷。用 Ctrl+F 搜一次就有答案,也不會冤枉任何人——沒有人會自己手打 oai_citation

不過要提醒一句:抓到殘留標記只能證明「這段經過某個工具」,證明不了整篇的作者是誰。一個人完全可能自己寫完、再丟給模型查資料,然後不小心把引用格式帶回來。


AI 偵測工具到底準不準?該不該付費買

先給結論:可以當參考,不能當判決。而且如果你是要拿它去指控別人,我會直接說不要。

這不是我的個人保留意見,是維基百科寫進指引裡的規定。原文明確要求編輯不要單獨依賴 AI 偵測工具,還直接點名了 GPTZero 和 Pangram。理由列了三條:

  • 它們雖然比隨機猜測好,但錯誤率不可忽視
  • 改寫、加標記、甚至只是改動空格,都可能讓結果翻盤
  • 遇到訓練時沒看過的模型就會失準——而新模型每幾個月就出一批

最能說明態度的是最後那一句:偵測工具給出的高 AI 比例,不構成快速刪除條目的理由。一個每天要處理大量可疑投稿的社群,寧可用人工判斷也不採信分數,這個取捨很說明問題。

那什麼時候值得付費?我的判斷是這樣:

你的情境 我會建議
自己寫完想檢查有沒有 AI 味 不用付費。免費額度足夠,而且你要的是「哪一段讀起來怪」,不是分數
發包給外部寫手,要做交付驗收 可以買,但要搭配寫得出來的驗收標準,不能只看分數退件
學術或人事場合的正式指控 不要用。誤判成本太高,而且對方要自證清白得花很大力氣
只是好奇某篇文章 先用 Ctrl+F 搜殘留標記,三秒鐘,比跑偵測工具準

市面上像 CopyleaksOriginality.ai 這類工具都有月費方案,數字看起來都很漂亮。但你要記得它們賣的是信心,不是證據——所有廠商都會在自己的說明頁寫「結果僅供參考」,那句話不是客套。

真的要在這個環節花錢,我會把預算放在別的地方。與其買偵測工具事後抓,不如按需求把手上的工具組配好,讓草稿一開始就有你的資訊在裡面——因為讀者退出的原因從來不是「這篇有 AI 味」,是「這篇沒告訴我新東西」。


我拿七百多篇中文稿實測「關鍵詞比對」,結果推翻了原本的做法

這段是我自己踩過的坑,也是我後來不再相信詞表的原因。

我想知道「用關鍵詞比對抓 AI 味」這個方法到底行不行,手邊剛好有一批七百多篇的中文文章可以當語料庫,就寫了一支掃描腳本,把常見的 AI 味句式做成規則跑一遍,看看它會抓出什麼。

第一次跑完,命中數字很好看,我還一度覺得這方法可行。但把每一處命中放回上下文看,問題就出來了——絕大多數是假陽性。

舉個實際的例子。「不是 A,而是 B」被我列進規則,因為它是公認的 AI 句式。可是這個句型在中文裡本來就是最自然的轉折方式之一,一篇正常的文章出現兩三次完全不奇怪。規則抓得到字串,抓不到密度異常,也抓不到這句話後面有沒有接具體內容——而後者才是真正的差別。

還有一個更隱蔽的坑,是統計方法本身造成的。我一開始寫的掃描器每篇只回報第一處命中,這讓整體數字看起來低得令人安心。等我改成回報全部位置,同一批文章的命中數翻了好幾倍。你的工具怎麼算,會直接決定你看到的現實。

那次之後我改成兩軌:規則負責快速標出可疑位置,人負責判斷這一處在上下文裡成不成立。規則單獨用會冤枉人,人單獨看會漏掉一半,兩個一起才有用。

這個結論其實和維基百科的立場一模一樣。他們列出一長串特徵,卻在旁邊寫「這些指標最好合併使用,不要單獨採信」——當時我覺得是在打太極,實測完才知道那是經驗談。


想去掉 AI 味,我實際會做的 4 件事(含一條紅線)

如果你的目的不是抓別人,而是讓自己的稿子讀起來更像人寫的,我會做這四件事,順序有差。

❶ 先砍導覽句。「接下來我們將探討」「綜上所述」「值得注意的是」——這類句子刪掉之後,文章幾乎不會少任何資訊。這是投報率最高的一步。

❷ 打散句長。找出連續三句字數接近的地方,把其中一句拆成兩句,或把兩句併成一句長的。節奏一亂,機器感立刻降下來。

❸ 把抽象評價換成具體場景。「這個功能相當實用」沒有資訊,「我用它把每週的稿件盤點從一個下午縮到二十分鐘」才有。這一步同時解決了 AI 味和內容空洞兩個問題,如果你常覺得自己的稿子讀起來很飽但講不出重點,從初稿就把空話擋掉的改法會比事後潤飾省力。

❹ 把你的判斷寫進去。模型不知道你為什麼放棄某個方案、不知道你踩過哪個雷。這些是它產不出來的東西,也是讀者真正會記住的部分。想把個人風格固定下來,可以把常用的偏好設定成專屬風格,省得每次重講。

然後是那條紅線,我認為比上面四點都重要:

潤飾只能改寫法,不能增加內容。你可以請工具幫你把某段改順,但只要它「順手」幫你補了一個案例、一段故事、一個數字,那就不叫潤飾,叫捏造。

這個坑我看過太多人踩。模型很擅長生成聽起來合理的例子,而聽起來合理的假例子,比明顯的錯誤危險得多,因為它不會觸發你的懷疑。對寫東西給人看的人來說,這是第一條也是唯一一條不能退讓的底線。

順帶提醒,去 AI 味和 Google 怎麼看內容是兩件事,別混著焦慮。官方判斷農場文只看兩件事,跟文章讀起來像不像 AI 沒有直接關係;至於最近上路的浮水印,我也實際掃過檔案驗證過影響範圍


這套判斷適合誰?什麼情況我不會這樣建議

這篇的判斷方式,是給需要對內容品質負責、但不想冤枉人的人用的。以下是我的適用邊界。

適合這樣用 不適合這樣用
自己審自己的稿,抓語感問題 當成人事或學術懲處的依據
內容團隊建立交付標準 在群組裡公開指認某人用了 AI
接案前評估對方的交付品質 用單一特徵(例如破折號)一票否決
教新手認出低品質內容 當成通用真理套到英文以外的所有語言

成本這邊也講清楚:整套判斷方法本身不用花錢。維基百科那份清單是公開的,殘留標記用 Ctrl+F 就能搜,句長分布用任何編輯器都看得出來。真的要花錢的只有偵測工具的訂閱,而我前面說過,那筆錢只有在「發包驗收」這個情境下值得。

如果你要的是不用每次重講規則的做法,那要處理的其實不是辨識而是產出端——這時候該調整的是你給的指令本身,或是在流程裡安排不同工具分工,讓草稿一開始就不要長成那個樣子。從源頭調,比事後一句一句改省力太多。


FAQ 常見問題

用了 AI 潤稿,還算是我自己寫的嗎?

我的界線是看資訊是誰產的。觀點、案例、判斷、經驗都是你的,工具只負責把句子改順,那還是你的作品。但如果案例是它給的、結論是它下的,那你只是編輯不是作者。這條界線跟工具用多用少無關,跟「誰決定內容」有關。

AI 檢測工具說我的文章有 90% 是 AI 寫的,怎麼辦?

先不要慌,更不要急著改——急著改反而會讓你失去「原始版本」這個最有力的證據。你該做的是拿具體特徵回頭比對:搜一下有沒有殘留標記、看句長是不是過於平均、檢查有沒有一堆空泛的評價句。這些都沒有的話,那份分數的參考價值就很有限。

如果你是被學校或主管拿分數質疑,那是另一個戰場,我把自證清白的 5 個步驟和能引用的官方說法整理在這篇

那我到底該不該在文章裡揭露有用 AI 輔助?

看場合,但我的傾向是該揭露的是流程,不是工具清單。讀者真正在意的不是你用了什麼軟體,而是「這些資訊有沒有人查證過」。與其寫一行免責,不如把查證的來源、你的判斷依據直接寫進正文——那個比任何聲明都有說服力。學術和公司內部另有規定的話,一律以規定為準。

中文有沒有像維基百科那樣的官方 AI 特徵清單?

就我查到的範圍,繁體中文目前沒有等同層級的協作指引,也沒有對應的研究整理出中文專屬的高頻詞表。所以你在中文圈看到的那些清單,多半是從英文版翻譯或個人歸納來的。這也是我在上面那段中文特徵表明講「這是我自己的觀察」的原因——沒有來源的時候,說清楚沒有來源,比假裝有來源好

如果我完全不用 AI,還需要看這些嗎?

需要,而且理由可能跟你想的相反:你需要知道哪些特徵會冤枉你。寫得工整、文法正確、愛用破折號——這些都可能讓你被誤會。把無效指標那張表存起來,哪天真的被質疑,你至少講得出為什麼那不算證據。


寫在最後:與其猜誰用了 AI,不如問這段話有沒有人負責

拆完整份清單之後,我最大的感想是:「這是不是 AI 寫的」其實是個沒有出口的問題。證據薄弱、誤判成本高、而且判準每半年就過期一次。

真正有用的問題只有一個——這段話有沒有人負責?裡面的數字有沒有人去對過、案例是不是真的發生過、結論是不是有人願意具名承擔。這個問題不會過期,也不需要偵測工具回答。

回到開頭那位「看到破折號就退件」的主管。我後來給朋友的建議是:別去爭破折號,改問對方要什麼——是要可查證的來源,還是要有觀點的判斷。把標準講清楚,比訂一條抓不準的規則有用得多。

我自己現在的做法就是這樣:不糾結讀起來像不像,只確認每個數字都找得到出處、每個判斷我都說得出理由。想知道搜尋引擎那一端怎麼看內容品質,可以順著AI 搜尋時代還保得住流量的做法往下看;想認識我平常在折騰些什麼,也歡迎到關於我那頁逛逛。訂閱我的部落格,會不定期收到信。


參考資料

 

延伸閱讀