AI 分身訓練後還是不像你?問題不在提示詞,是你少了這道驗收

目錄

💡 核心結論速覽 (TL;DR)

  • 你缺的不是提示詞,是驗收:把 60 篇作品全部丟給 AI 叫它「抓共通性」,等於考卷和答案一起給,你永遠不知道它到底學會了沒。
  • 正解是切兩半:30 篇拿去抓規則,另外 30 篇當保留測試集做盲測——給題目不給你的原文,讓它照規則寫一篇,再跟你真正寫的比對。
  • 官方用的就是這個詞:Anthropic 文件寫的是 held-out test set,而且明說評估設計要「題目數量優先於題目品質」,跟多數人的直覺相反。
  • 兩種進化都要:主動式(把這次 80 分改到 90 分的落差寫回技能檔)+被動式(固定回頭盤點衝突點)。先從你最擅長但最花時間的那件事開始練。

你有沒有這種經驗:花了一個下午餵資料、調指令,結果 AI 寫出來的東西每個字都對,但就是不像你寫的

我看過太多人卡在這裡,然後得出「AI 就是學不會我的風格」這個結論,接著放棄。

但真正的問題通常不在餵得不夠多,而在你從來沒有驗收過。大多數人的訓練流程只有前半段:把作品丟進去、叫它歸納風格、拿來用、覺得不對、再丟更多進去。這個迴圈裡沒有任何一步在檢查它到底學會了什麼。

這篇要講的就是缺掉的那半段——怎麼用一個很簡單的切分法,把「它學會了沒」變成一個看得見答案的問題。


為什麼訓練半天,AI 分身寫出來還是不像你?

先給結論:因為你把考卷和答案一起交給它了

最常見的做法是這樣:把自己過去寫的六十篇文章全部貼進去,然後說「請分析這些文章的共通寫法,之後照這個風格幫我寫」。

聽起來很合理,但這裡有個致命的漏洞——它給你的「風格總結」你根本無從驗證。它說你「偏好短句、常用反問、喜歡先講結論」,你看了覺得好像對,就採用了。可是這份總結到底抓到你的特徵,還是抓到中文寫作的通則?你分不出來。

更麻煩的是,這種總結通常會往「安全的中間值」收斂。因為模型的預設參考來源是它訓練時看過的大量書籍與媒體,當你的六十篇沒有明確的對照組,它會不自覺地把你的風格往通用寫法拉。

結果就是你熟悉的那種輸出:句子都通順、結構都完整、看起來很專業,但沒有你的判斷、沒有你的取捨、沒有你會講的那句怪話。這種「通用感」怎麼來的、怎麼看得出來,我在拆解 AI 寫作特徵那篇寫得更細。


訓練 AI 分身時,大多數人只做了「餵資料」這一半

把訓練 AI 分身拆開看,其實是兩件事:給它規格(spec),還有給它評估機制(eval)

規格就是你希望它怎麼做——你的寫法、你的偏好、你的禁忌。這部分大家都做了,而且往往做得很用力。

評估則是回答一個問題:它照著做出來的東西,跟你自己做的差多少?這部分幾乎沒有人做,因為它比較痛——你要面對「訓練了半天其實沒什麼用」這個可能性。

但這一步不做,後面全部是空轉。沒有評估,你就只能靠「感覺不太對」來調整,而感覺沒辦法累積。這次調完覺得好一點,下次又跑掉,你也說不出中間發生什麼事。

Anthropic 官方在講怎麼建 AI 應用時,把這件事放在最前面:先清楚定義成功標準,再設計評估來衡量表現,而這個循環就是提示詞工程的核心。不是先寫提示詞,是先想清楚「怎樣叫做做對了」。

如果你說不出「怎樣算成功」,那你其實沒有在訓練它,只是在跟它聊天。


AI 分身的 30/30 切法:把作品拆成規則組與盲測組

方法本身很簡單,簡單到你今天下午就能做完。

把你手上的作品切成兩半。假設你有六十篇:

❶ 前三十篇是規則組。丟給 AI,請它整理出這些文章的共通做法、句型偏好、結構習慣,寫成一份可重複使用的規範。

❷ 後三十篇是盲測組。這三十篇不要給它看。你只從裡面挑主題,告訴它「請寫一篇關於 X 的文章」,讓它套用剛剛整理出來的規則自己寫。

❸ 然後把它寫的,跟你當初真正寫的那篇並排比對。

落差就在這裡跑出來了。而且是具體的落差,不是「感覺不太對」——你會看到它開頭永遠先給定義而你習慣先講場景、它每段都工整而你會突然插一句短的、它不敢下結論而你會直接說「我不推薦」。

這個切法不是誰發明的技巧,而是機器學習領域拆分訓練集與測試集的標準做法,在官方文件裡也有正式名字,叫做 held-out test set(保留測試集)

Anthropic 的說明裡舉的例子就是「在一組保留測試集上達到某個分數」——保留的意思就是刻意留著不給模型看,用來檢驗它是真的學會,還是只是把看過的東西背出來。

三十這個數字沒有魔力,你有二十篇就切十比十。重點是「有一組它沒看過的」,不是切幾篇。

背後要防的問題也有名字,叫做過適(overfitting)——模型把看過的樣本背得很熟,換個題目就不會了。你只用它看過的資料檢驗,永遠測不出這件事。


盲測怎麼跑?我實際會做的四個步驟

光說切兩半還太抽象,這裡是可以照著做的版本。

❶ 先固定評分項目,不要邊看邊想。我通常看四項:開頭怎麼進入主題、有沒有第一人稱的判斷、句子長短的節奏、結尾收在哪裡。項目先定好,比對才不會每次標準都不一樣。

❷ 一次只比一篇,但要比完整篇。只看開頭會誤判——很多時候前三段像,第五段就散掉了。這也是為什麼要用完整的舊文當對照,而不是憑印象。舊作品散在各種檔案裡的話,先把一批文件整批讀進來會比一篇篇複製貼上快很多。

❸ 把落差寫成「它做了什麼」而不是「它不夠好」。「它不夠有個人風格」這種描述沒辦法變成規則;「它在每個段落開頭都用了轉折詞,而我幾乎不用」才可以。

❹ 改完之後,再跑一次盲測。用盲測組裡的另一個主題,看落差有沒有真的縮小。沒有重測的修改等於沒有修改,你只是換了一種說法而已。

如果你覺得一篇一篇人工比太慢,官方的建議其實跟直覺相反:題目數量優先於題目品質——用自動評分跑比較多題目、訊號稍微弱一點,好過只跑幾題但每題人工精評。他們甚至直接寫了人工評分「最有彈性、品質最高,但慢又貴,能避免就避免」。


官方怎麼設計評估?三條原則與三種評分法

如果你想把這套做得更系統,Anthropic 的文件裡有三條設計原則值得抄。

❶ 要貼合真實任務。你的評估題目要反映實際會遇到的分布,而且不要漏掉邊緣案例。官方列的邊緣案例包括:不相關或根本不存在的輸入資料、過長的輸入、惡意或不相關的使用者輸入,還有連人類都很難達成共識的模糊案例

❷ 盡量自動化。把題目設計成可以自動評分的形式——選擇題、字串比對、程式判分、或讓另一個模型判分。

❸ 數量優先於品質。就是上一段那條,我認為是最反直覺、也最容易被跳過的一條。

評分方法則有三種,官方講得很直白:

評分方法 優點 限制
程式判分 最快、最可靠、極易擴展 缺乏細膩判斷,只適合規則明確的題目
人工判分 最彈性、品質最高 慢又貴,官方建議能避免就避免
模型判分 快、彈性、可擴展,適合複雜判斷 要先測過可靠性才能放大使用

用模型判分的話,官方給的技巧我覺得最實用的是這條:讓它先推理再給分數,然後把推理過程丟掉。這會提升評估表現,尤其是需要複雜判斷的任務。另外評分準則要寫得夠死,輸出也要具體——只准回「符合/不符合」,或給 1 到 5 分,不要讓它寫一段感想。

這一整套跟我在設計 AI 交付驗收關卡時的邏輯是同一件事:先定義得出「怎樣算過」,才談得上放手。


落差怎麼記回 AI 分身?主動式進化 vs 被動式進化

盲測跑完、落差抓到了,接下來是最多人做一半就停掉的地方:把改動固定下來。

這裡有兩種進化要同時做,缺一個都會退步。它們合起來其實就是一個設計得好的迴圈:產出、比對、修正、再產出,而不是每次都從頭開始。

主動式進化是你發現問題當下就處理。假設它第一版給你 80 分,你來回改到 90 分——這時候不要只是把成品拿走,要回頭問一句:「請把這個版本跟你第一版的所有差異整理出來,寫成規則更新進去。」

沒做這一步的話,你下次會從 80 分重新開始,而且會有種「怎麼每次都要重講」的疲勞感。這其實是很多人放棄的真正原因——不是效果不好,是不會累積。

被動式進化則是固定回頭盤點。我的做法是每週一次,把這段時間交辦的任務攤開來看:哪些一次就過、哪些改了三輪、哪些我最後乾脆自己重寫。改三輪以上的那類就是規範不清楚的地方,直接補進去。

這裡有個心態要提醒。你很容易變成那種老闆——覺得自己最厲害、產出不好都是它的問題。但被動式盤點常常會盤出來另一種結論:不是它做不好,是你交辦的時候根本沒講清楚要什麼。這個發現不太舒服,但它是進步最快的一條路。

要讓這些規則真的能重複使用,就得存成檔案而不是每次貼在對話裡。Anthropic 把這種東西叫做 Agent Skills,官方定義是「模組化的能力,每個 Skill 打包了指示、中繼資料,以及選配的資源如腳本與範本,Claude 在相關情境會自動使用」。

和提示詞的差別官方講得很清楚——提示詞是對話層級的一次性指示,Skills 是檔案層級、可重複使用、按需載入的,所以你不用每次對話重講同一套規範。實際操作面我另外寫過Projects、記憶與自訂風格怎麼設


AI 分身該從哪個任務開始訓練?挑你很擅長但很花時間的那件

方法有了,但從哪裡開始練,決定你會不會撐過第一週。

我的建議很明確:挑一件你自己做得很好、但每次都要花掉一大段時間的事。回覆詢問信、寫活動企劃、整理會議紀錄、做競品比較表,都算。

理由有兩個。第一,你很擅長,所以你有能力判斷它做得對不對——這正是盲測能成立的前提。你不擅長的事,你連比對的基準都沒有。

第二,你有大量歷史樣本可以切成規則組跟盲測組。沒做過的事,你連三十篇都湊不出來。

最常見的錯誤剛好相反:大家都想拿 AI 去解決自己搞不定的事。沒寫過書就叫它寫書、沒寫過論文就叫它寫論文。結果一定是東西出來了、看起來也像那麼回事,但你不知道哪裡有問題,改也改不動——因為你根本不知道好的長什麼樣。

這件事違反人性我知道。自己最擅長的東西交出去,感覺像在拆自己的招牌。但天花板就是這樣才打得開——你把熟練的事交出去,才空得出時間做只有你能做的判斷。


我踩過的坑:規則寫太細,反而綁死它

講一個我自己走過的彎路,因為它跟這篇的主軸剛好是一體兩面。

我一開始很努力把規則寫得非常詳細,細到「第一段幾個字、第二段要有一個問句、每三段插一個小標」。結果產出變得很怪:格式全中,但讀起來像在填表格。

後來我才想通問題在哪。我把「我的做法」跟「好的做法」混為一談了。那些規則是我寫作時的習慣,不是寫作的原理;把習慣當成鐵律灌進去,等於要求它模仿我的動作,而不是理解我的判斷。

更根本的是,如果我對某個領域根本不是專家,我寫進去的方法很可能比它原本會的更差。你不是那件事的專家,卻把方法寫死進要求裡,出來的東西就會被你的天花板卡住。

我現在的做法是留一個逃生口:規則照給,但後面加一句「如果你認為有更好的做法,請先提出兩個不同方向讓我選,再開始寫」。這句話成本很低,但常常會讓它給出我沒想過的角度。

這跟提示詞技巧本身也有關,寫法差異我整理在怎麼把指令寫到它真的聽話,各家模型的差別則在這篇對照


什麼時候該停手?AI 分身做不到的三件事

訓練得再好,有三件事我到現在都不會交出去。

❶ 產生新的事實。它可以整理你講過的事,但不能替你「補」一個案例或一個數字。潤飾就只能潤飾,一旦它順手幫你加了一段故事,那不叫優化叫捏造——對任何要具名發表的東西來說,這是唯一不能退的底線。

❷ 最後一關的判斷。就算重疊度很高,最後看過一遍的還是要是人。不是因為它會出大錯,是因為署名的人要能為每一句話負責,而負責這件事沒辦法外包。

❸ 你自己都還沒想清楚的事。如果你對一個題目的立場還在搖擺,先不要問它。它會給你一個聽起來很完整的答案,然後你就照著走了——那不是它的判斷取代你的判斷,是你放棄了判斷。

這三條的共同點是:可以交出去的是「執行」,不能交出去的是「負責」。把這條線劃清楚,訓練得越好就越省力;劃不清楚,訓練得越好反而越危險。


這套 AI 分身訓練法適合誰?成本與下一步

把邊界講清楚,你才知道要不要投時間進去。

適合這樣做 不適合這樣做
手上有 20 篇以上同類型的舊作品 樣本不到十篇,切不出盲測組
同一種產出每週都要做好幾次 一年只做一兩次的任務
你自己就是這件事的判準 你也不確定怎樣算做得好
願意花一次性的下午建規範 只想要一句話就能用的萬用提示詞

成本怎麼算?這套不需要額外付費工具,免費版就能跑——真正的成本是第一次建規範的那兩三個小時,加上之後每週大約十五分鐘的盤點。

要不要升級付費方案,我的判斷是看你會不會用到可重複載入的規範檔與較長的脈絡。如果你只是偶爾用,免費版加上一份寫好的規則文件就夠了;如果你每天都要跑同一種產出,把規範存成可自動載入的檔案才會真的省時間。各家方案怎麼挑,可以參考我整理的依需求選工具的清單

今天可以先做的一件事:把你最常做的那種產出翻出十篇,切成五比五,跑一次盲測。光是這一次比對,你就會看到至少三個你自己從來沒意識到的寫作習慣。


FAQ 常見問題

我只有十幾篇作品,樣本太少怎麼辦?

照樣切,只是比例改成七比三或八比二。樣本少的時候,重點從「歸納規則」轉成「抓禁忌」——與其讓它總結你的風格,不如直接列出你絕對不會寫的東西(例如不用某類開場、不做某種收尾)。負面清單用少量樣本就寫得出來,而且比正面規則更不容易被誤解。

盲測比對很花時間,有沒有辦法自動化?

可以,但要先自己手動跑過三五次。原因是你得先知道自己在看什麼,才寫得出讓模型判分的準則。官方的建議是評分準則要寫得很死、輸出只准是「符合/不符合」或 1 到 5 分,並且讓它先推理再給分、然後丟掉推理過程。準則沒寫死就自動化,你只會得到一堆看起來很客觀的亂數。

訓練好的規則要放在哪裡才不會每次重貼?

存成檔案,不要留在對話裡。Anthropic 的 Agent Skills 就是為這件事設計的——它是檔案層級、可重複使用、需要時才載入,跟一次性的對話指示不同。其他家也有對應的機制,記憶、Projects 與 GPTs 的分工我拆過一次,原理相同:把常用規範從「每次講」變成「一次設定」。

AI 分身能取代我回覆客戶或發文嗎?

執行可以,署名不行。它可以起草、可以照你的規範產出、可以處理掉八成的重複勞動,但送出去之前那一眼還是要你自己看。真正的風險不是它寫得不好,是它寫得夠好、好到你開始不看就送出去。

為什麼要留一組不給它看,直接全部餵不是學得更多嗎?

因為「學得多」和「你知道它學到什麼」是兩件事。全部餵進去,它的表現會看起來很好,但那可能只是把看過的東西重組出來。保留一組沒看過的,你才有辦法分辨它是真的抓到你的規律,還是在複述。這就是官方文件用「保留測試集」這個詞的原因。


寫在最後:分身像不像,取決於你敢不敢驗收

回頭看,訓練 AI 分身這件事最大的門檻其實不是技術。切三十比三十誰都會,難的是你願不願意把它寫的跟你寫的並排放在一起看

因為那個比對會同時暴露兩件事:它哪裡不像你,還有你自以為的風格其實沒那麼特別。第二件事比較刺,但也是最有價值的部分——很多人比對完才第一次講得清楚自己到底怎麼寫東西。

所以如果你只想帶走一句話,我會說:不要再問「怎麼讓它更像我」,改成問「我怎麼知道它像不像」。前者沒有終點,後者今天下午就有答案。

想看我平常怎麼安排不同工具分工,可以參考多模型分工的做法;對整個代理式工作流還沒概念的話,入門避雷指南會比較好進入。也歡迎到關於我那頁逛逛。訂閱我的部落格,會不定期收到信。


參考資料

 

延伸閱讀