💡 核心結論速覽 (TL;DR)
- 提示詞注入不是駭客技術,是社會工程:OpenAI 官方把它定義成「專門針對對話式 AI 的社會工程攻擊」——騙的不是你,是替你上網辦事的那個 AI。
- 三種手法都已被實證:網頁隱形字、截圖被 OCR 讀成指令、把指令寫進 AI 的長期記憶;Cato Networks 揭露的 HashJack 更能把合法網站當載體。
- 不是個案:華盛頓大學與 LayerX 測 7 款 AI 瀏覽器,4 款有嚴重到能竊取其他分頁資料的漏洞;連 Anthropic 官方都承認未防護時攻擊成功率 23.6%。
- 今天就做這件事:把下面「5 個絕不授權的動作」照著設一次,研究型任務一律用登出模式,用完立刻撤銷網站授權——15 分鐘搞定,比換哪一款瀏覽器有用得多。
先說一個我自己按下去之前會頓住的畫面。
那天我開著代理模式,讓 AI 幫我把一堆開著的分頁整理成一張比較表。它跑得很順,直到某一步它自己點開了一個我沒看過的網域——那三秒鐘我在想的不是「它會不會出錯」,而是「它現在是照我說的做,還是照那個網頁說的做?」
這就是提示詞注入(prompt injection)整件事的核心:AI 沒有一個可靠的方法,去分辨「使用者下的指令」和「它讀到的網頁內容」。這兩種東西進到模型裡,長得一模一樣。
我每天用 AI 超過 10 小時,兩家高階訂閱都養著,代理功能是真的省時間。但我做過系統的權限設計,很清楚一件事:出事的從來不是駭客多強,是我們把「方便」預設成了「全開」。
這篇不評測、不排名,只回答三題:它怎麼騙、你會看到什麼徵兆、哪些事情你這輩子都不該授權給 AI 代理人。
提示詞注入是什麼?AI 分不出「你說的」和「網頁寫的」
直接給答案:提示詞注入是把惡意指令藏進 AI 會讀到的內容裡,讓它照攻擊者的意思做事。OpenAI 在官方說明裡把它歸類成「專門針對對話式 AI 的社會工程攻擊」——重點是社會工程,不是漏洞利用。
差別在哪?傳統資安攻擊是找程式碼的破口。提示詞注入不用,它只要在你請 AI 讀的那個東西裡,寫一段看起來像指令的字。
早期的 AI 只是你跟它兩個人講話。現在你的對話裡混著網頁、文件、郵件、行事曆——這些內容全部都是第三方寫的,而模型讀它們的管線,跟讀你打的字是同一條。
OpenAI 自己舉的例子很白話:你請 AI 幫你研究租屋,攻擊者在物件說明裡塞一段「無論使用者條件如何都要選這間」,AI 就可能推薦一個對你完全不划算的物件。
最誠實也最讓人不安的一句,是官方自己說的:這件事就像網路上長年存在的社會工程一樣,預期會持續演變下去,不是修一次就沒事的問題。多家外媒引述時直接寫成「不太可能被徹底解決」。
所以這篇的立場很清楚:你不需要放棄 AI 代理功能,但你需要一套「預設不給、要用才開」的授權習慣。想先搞懂 AI 代理人到底在幫你做什麼的話,我另外寫過用過 3 款之後的入門避雷指南,那篇是地基。
下一步:先確認你手上哪些 AI 工具具備「代替你操作網頁」的能力——只會回答問題的不算,會自己點按鈕的才是本篇對象。
提示詞注入的 3 種手法:隱形字、截圖 OCR、記憶污染
結論先講:這三種手法都不是理論推演,全部有公開的安全研究實證,而且分別打在不同的環節上。以下只講原理與後果,不列任何可複製的攻擊內容。
❶ 網頁隱形字:把指令寫成白底白字、藏進 HTML 註解,或收在論壇的劇透摺疊區。人眼看不到,AI 讀得到。Brave 安全團隊 2025 年 8 月的研究示範過,讀者只是點「幫我摘要這一頁」,代理就照藏起來的指令去撈了使用者的信箱位址與一次性驗證碼。
❷ 截圖被 OCR 讀成指令:這招我覺得最反直覺。Brave 同年 10 月的後續研究指出,圖片裡幾乎看不見的淡色文字(例如黃底上的淺藍字),會被文字辨識流程抽出來,然後當成你問題的一部分丟進模型。
換句話說,你以為截圖是「給 AI 看畫面」,實際上你是在幫它朗讀畫面裡所有的字,包括你根本沒注意到的那些。
❸ 記憶污染:前兩種是當下這一次被騙,這一種是留下來。資安公司 LayerX 揭露的「ChatGPT Tainted Memories」顯示,只要使用者點了一條惡意連結,指令就可能被寫進 AI 的記憶,等你下次正常提問時才被喚起執行。
還有一個變體值得單獨記一下:Cato Networks 揭露的 HashJack,把指令藏在網址井號(#)後面那一段。資安人科技網的報導指出,這段內容永遠不會離開瀏覽器,傳統偵測機制看不到——所以它可以把一個完全合法的網站,變成攻擊的載體。
| 手法 | 指令藏在哪 | 你會看到的徵兆 |
|---|---|---|
| 網頁隱形字 | 白底白字、HTML 註解、摺疊區 | 摘要出現你沒問的動作;AI 突然要求登入或索取驗證碼 |
| 截圖 OCR | 圖片裡的極淡色文字 | 回覆內容跟畫面明顯對不上,多出來歷不明的指示 |
| 記憶污染 | 寫進 AI 的長期記憶 | 開新對話也一直冒出同一個奇怪偏好或連結 |
| 網址片段(HashJack) | 網址 # 之後 | 合法網站的摘要裡出現支援電話、外部連結或下載提示 |
我把「徵兆」這欄放進來,是因為多數文章講完原理就收了。但一般使用者要的不是原理,是下次它怪怪的時候,我怎麼知道那是被劫持而不是它笨。
下一步:把上面四個徵兆記起來,只要中任何一個,立刻停止該次任務並開新對話,不要接著追問。
提示詞注入是個案還是通病?7 款測了 4 款有嚴重漏洞
先給結論:這是全類別的結構性問題,不是某一家做壞。TechNews 引述美國華盛頓大學與資安公司 LayerX 的測試,7 款主流 AI 瀏覽器裡有 4 款存在嚴重到足以讓惡意網站竊取「你其他分頁裡的資料」的漏洞。
報導點出的矛盾我覺得講得很好:瀏覽器從 1995 年就靠同源政策、沙盒隔離把不同網站彼此隔開;而 AI 瀏覽器為了做到跨頁面代辦,刻意把這道牆拆了一個口——它必須讀得到你全部的分頁,才能幫你比價、彙整、代填。
連做得相對保守的一家也承認風險確實存在。Anthropic 公布 Claude for Chrome 的紅隊測試數字是這樣:沒有防護時,被刻意針對的攻擊成功率 23.6%;加上防護後降到 11.2%;而針對瀏覽器設計的四類專門攻擊,則從 35.7% 降到 0%。
11.2% 是什麼概念?大概是每九次刻意攻擊還有一次會過。這是廠商自己願意公開的數字,我認為比任何行銷話術都值得看。
另一個更新的訊號來自學術端。TechNews 報導新墨西哥州立大學一篇 arXiv 論文提出的 GhostWriter 攻擊,專打 AI 的長期記憶。
論文裡的記憶注入成功率約 98%,惡意記憶後續被叫出來執行的比例平均 60%。這是單一研究的實驗結果、不是產品實測,但它指向的方向跟 LayerX 那條完全一致:記憶會留,而留下來的東西會回來找你。
我自己看到這裡的判斷是:與其糾結「哪一款比較安全」,不如假設每一款都會被騙一次,然後去設計「被騙一次也不會死」的用法。這跟我在喊了 11 次「不要動」還是被刪檔的那幾起災難裡得到的教訓是同一個——防線要放在授權,不是放在祈禱。
下一步:先接受「沒有一款免疫」這個前提,再往下看授權清單,不要花時間比較哪一款漏洞比較少。
為什麼提示詞注入一次得手就全破?因為它帶著你的登入狀態
直球答案:因為 AI 代理人是用你已經登入的身分在瀏覽。它看得到的,就是你打開瀏覽器看得到的——信箱、雲端硬碟、網銀後台、公司的內部系統。
一般的惡意網頁最多騙到你這一個分頁。但代理模式一旦被劫持,攻擊者拿到的是「你的整組工作階段」。這也是華盛頓大學那份研究裡「竊取其他分頁資料」最恐怖的地方。
這裡有一個很多人沒接上的時效重點,我覺得非講不可。
OpenAI 已經公告 ChatGPT Atlas 排定 2026 年 8 月 9 日停止運作,瀏覽器代理能力併回 ChatGPT 桌面版與 Chrome 擴充(實際可用範圍視方案與地區而定)。
繁中報導幾乎都在講書籤怎麼匯出,但官方說明頁的 FAQ裡有一句更該被放大:Atlas 既然停止開發,就不該讓使用者繼續留在一個可能不再收到安全更新的瀏覽器上。
一個會替你點按鈕、又不再修補安全問題的瀏覽器,是本篇談的所有風險裡最不需要討論的那一個。如果你還在用它跑代理任務,這件事的優先順序高於本文其他所有建議。
我自己對 AI 瀏覽器的取捨寫在三款比一比、我最後留了哪一個那篇;這篇不重複比較,只補上當時沒展開的攻擊面。至於 AI 是怎麼一路從「回答問題」走到「自己動手」的,可以看從 Artifacts 到 Computer Use 的那條演進線。
下一步:現在就確認你的代理任務跑在哪個瀏覽器上;如果是已宣告停止運作的產品,先搬家再談設定。
我絕不授權給 AI 代理人的 5 個動作(附二次確認位置)
這是全篇最該被你帶走的一段。標準只有一條:做完之後無法一鍵還原的事,都不給。
我做過產品權限設計,很習慣用「不可逆性」當分界線——可逆的動作出錯只是麻煩,不可逆的動作出錯是事故。AI 代理人適用同一把尺。
| 絕不授權的動作 | 為什麼 | 二次確認/撤銷位置 |
|---|---|---|
| ❶ 代替你登入 | 帳密與驗證碼一旦被讀走,後面全部的防線同時失效 | 研究型任務改用「登出模式」(OpenAI 官方建議);擴充套件走網站白名單,只授權你熟悉的站 |
| ❷ 輸入付款資訊 | 金流不可逆,爭議處理成本遠高於你省下的時間 | Claude for Chrome 官方直接封鎖金融服務等高風險類別;其他工具請確認「購買前必須確認」是開著的 |
| ❸ 改權限與分享設定 | 把私人文件改成「知道連結的人都能看」,外洩會持續發生而不是一次 | 雲端硬碟、相簿的分享設定一律手動;定期到 Google 帳戶的第三方存取權頁面清一次 |
| ❹ 刪除 | 刪信、清資料夾、砍檔案幾乎救不回來 | 選有「刪除/送出前需確認」機制的工具,並確認該開關未被關掉 |
| ❺ 送出表單與寄信 | 送出的瞬間資訊已離開你的裝置,撤回權不在你手上 | 敏感網站保持分頁在前景(OpenAI 的「監視模式」會在你切走時暫停代理) |
三個實作上的補充,是我覺得比清單本身更容易被忽略的。
第一,指令越寬越危險。OpenAI 官方直說,像「檢查我的信箱並採取任何必要行動」這種大範圍授權,會讓藏起來的惡意內容更容易得逞。把它換成「只讀今天標星號的三封信,整理成條列,不要回覆任何一封」,攻擊面立刻縮小一大截。
第二,確認視窗不是禮貌提示。它跳出來的時候,請真的讀那一行字寫的是什麼動作、對象是誰。我看過太多人把它當成「同意條款」那樣連點——那等於自己把最後一道鎖打開。
第三,記憶要定期清。既然記憶污染是已被證實的路徑,那「AI 記得我什麼」就不只是隱私問題,也是資安問題。ChatGPT 這邊怎麼查看與刪除,我整理在它到底記住了你哪些事、怎麼一條條刪掉那篇。
下一步:對照上表,把你正在用的那款工具的五個開關逐一點過一次,缺哪個就補哪個。
用完即登出、事後撤銷授權:我的 3 分鐘收尾流程
先講結論:授權最大的問題不是「給錯」,是「給了忘了收」。你昨天為了讓 AI 幫你整理報表而開的那個雲端硬碟權限,如果沒收回來,它今天還在。
TechNews 那篇的專家建議濃縮成三句:嚴格控管權限、用完即登出、定期撤銷授權。這三句都對,但都太抽象——所以我把它變成一個真的做得完的收尾動作。
❶ 收工前先登出敏感帳號:網銀、公司系統、雲端硬碟,做完就登出,不要讓代理在「你剛好還登著」的狀態下跑下一個任務。
❷ 撤銷網站層級授權:Claude for Chrome 這類擴充套件允許你在設定裡隨時收回單一網站的存取權,官方也建議從你信任的站開始給,而不是一次全開。
我自己一開始為了省事全開,用了一陣子才改成白名單——那個「省事」換來的是我後來每次都要重新想一遍它到底看得到什麼,其實更累。
❸ 每個月清一次第三方存取權:到 Google 帳戶的第三方存取權說明頁照步驟走,找到「有權存取您的 Google 帳戶」那一區,把你已經不用的 AI 工具移除。這一步最常被跳過,因為它不痛——直到它痛的時候已經來不及。
我有朋友問過我一題,我覺得很有代表性:「我只是讓它幫我回信,這樣也要收?」我的回答是:能幫你回信,就代表它能替你寄出任何一封信。權限的大小不是看你叫它做什麼,是看它做得到什麼。
順帶一提,如果你連「AI 會不會拿我的對話去訓練」都還沒設定過,那應該先做那一層。五家的開關路徑和關掉後還留多久,我整理成一張表放在五家 AI 隱私開關與資料保留天數對照;想再往上加一層的人可以看Lockdown 模式該不該開、會犧牲哪些功能。
下一步:把「每月清一次第三方存取權」設成手機行事曆的重複提醒,這是唯一能撐過三個月的做法。
那到底還能不能用?我的分級授權法(適合誰 / 不適合誰)
可以用,但要分級。我自己把代理任務切成三層,決定它能碰到什麼。
綠燈|完全不碰你的帳號:查資料、比規格、整理公開頁面的內容、生成草稿。這類我一律用登出模式跑,被劫持了也只是拿到一份錯的資料。
黃燈|碰到你的帳號但不動狀態:讀信、找檔案、看訂單紀錄。這類我開,但只在白名單網站上開,而且指令寫得很窄——只讀、不回、不轉寄。
紅燈|會改變狀態:寄信、下單、付款、改權限、刪除。這一層我從不外包,寧可自己多花兩分鐘。時間成本我算過,划算得很。
這套方法適合誰:每天要處理大量重複資訊、真的想靠代理省時間的人;同時管好幾個平台帳號的自媒體經營者;工作內容會碰到客戶資料、需要對外交代的接案者。
不適合誰:只是偶爾用 AI 問問題、根本沒開代理功能的人(那你不需要處理這些);以及公司電腦上受資安政策管理、本來就不該自行安裝擴充套件的上班族——那要先問你的資訊單位,不是先問我。
成本怎麼算:這套設定本身不用花錢,代價是每次任務多 30 秒的確認時間。真正的成本在你願不願意接受「AI 幫你做的事情變少了」——我認為這是對的取捨,因為做得少但不出事,長期比較快。
想知道自己架一套代理系統要付出什麼隱藏成本的,可以看我把帳算清楚的那篇;如果你想看一個「爆紅到卸載潮」的真實案例怎麼發生,那次資安風暴的來龍去脈是很好的對照組。至於要從哪裡開始挑工具,我把常用的整理在依需求分類的 AI 工具總整理。
下一步:拿你這週最常跑的三個 AI 任務,各自標上綠黃紅,紅燈的那個今天就收回來自己做。
FAQ 常見問題
提示詞注入跟一般的網頁惡意程式差在哪?我裝防毒有用嗎?
差在攻擊對象。惡意程式打的是你的裝置,防毒軟體看得到檔案行為;提示詞注入打的是 AI 的判斷力,內容本身就是一段普通文字,沒有惡意檔案可以掃。所以防毒幫不上忙,真正有效的是限制代理能碰到的範圍,以及不要給它不可逆的權限。
那我到底該選哪一款 AI 瀏覽器比較安全?
我不會給你一個名字,因為研究結果不支持「有一款是安全的」這個前提——7 款測下來 4 款有嚴重漏洞,連官方公布的防護後成功率都還有 11.2%。與其挑產品,不如挑用法:任何一款只要你用登出模式跑研究、用白名單限制網站、五個紅燈動作不授權,風險等級都差不多。
ChatGPT Atlas 要停止運作了,我現在該怎麼辦?
兩件事分開處理。資料面:在停止運作前把書籤匯出成 HTML、把重要分頁另存,因為書籤、歷史紀錄與開啟的分頁都不會自動搬家。安全面更重要——一個已停止開發的瀏覽器不會再收到安全更新,別再用它跑會替你點按鈕的代理任務,先換到仍在維護的路徑再說。
公司電腦上可以裝 AI 瀏覽器擴充套件嗎?
先問你的資訊單位,不要自己決定。技術上它會讀到你分頁裡的所有內容,包含公司內部系統與客戶資料;即使沒被攻擊,這些內容送到外部服務本身就可能牴觸內部規範。如果單位允許,至少堅持三件事:白名單限制、不授權寄送與刪除、每月撤銷一次授權。
如果我懷疑自己已經被劫持過,該做哪些補救?
照順序做四步:❶ 立刻結束該次任務並開新對話,不要在同一個上下文裡追問;❷ 檢查並刪除 AI 的長期記憶,因為記憶污染會跨對話留存;❸ 到帳戶的第三方存取權頁面,把可疑的授權移除;❹ 對曾經登入過的敏感帳號登出所有裝置並改密碼。做完再回頭看那幾個徵兆有沒有消失。
追劇族讀者也在看的兩篇
如果你是追劇順手查資料才點進這篇的,這兩篇你應該用得到:
📺 還在煩惱獨播劇要不要為了一部戲開會員,我把時機算給你看:《天才女友》會不會上 Netflix,開會員的最佳時間點。
🎬 不想每次都在找片源之間耗時間的話,這篇大陸劇平台在台灣怎麼選、哪家合法又划算可以一次省掉這個煩惱。
結論:把「預設全開」改成「要用才給」
寫到這裡我想收在一個很簡單的念頭上。
提示詞注入之所以難解,不是因為技術有多高深,是因為它利用的東西剛好是 AI 最有用的那一面——它會認真讀完你丟給它的所有內容,然後盡力照做。你沒辦法在保留這個優點的同時,要求它完全不受內容影響。
所以能改的不是模型,是我們給權限的習慣。我這一年最有感的一句自省是:我一直在問「AI 能幫我做什麼」,卻很少問「它做得到什麼是我沒打算讓它做的」。這兩個問題的答案落差,就是風險本身。
今天就做三件事:紅燈五個動作不授權、研究型任務用登出模式、行事曆設一個每月撤銷授權的提醒。花不到 15 分鐘,卻比你換三次瀏覽器都有效。
如果這種「先想清楚再交出去」的判斷方式對你有用,歡迎訂閱我的部落格,會不定期收到信,我會把每次踩到的坑和調整後的做法一起寫給你。
參考資料
- OpenAI《理解提示注入:前沿安全挑戰》(提示注入定義、登出模式與監視模式建議)
- OpenAI 說明中心:Atlas 停止運作與資料轉移指引
- Anthropic:Claude for Chrome 安全測試與權限機制說明
- TechNews 科技新報:熱門 AI 瀏覽器爆重大資安漏洞,專家授三招自保
- TechNews 科技新報:新型攻擊「GhostWriter」駭入 AI 長期記憶
- 資安人科技網:HashJack 漏洞與提示注入威脅加劇
- Brave:截圖中不可見的提示注入研究
- LayerX:ChatGPT Tainted Memories 記憶注入漏洞
- Google 帳戶說明:管理第三方應用程式與服務的存取權