AI 讀不到網址怎麼辦?我掃完 18 個網站的 robots.txt,問題不在你的瀏覽器

目錄

💡 核心結論速覽 (TL;DR)

  • 最常見的真正原因:AI 讀不到網址多半不是它當機,是那個網站在 robots.txt 或 CDN 層把 AI 擋掉了,跟你的瀏覽器、快取、網路都無關。
  • 各家爬蟲不只一支:OpenAI 有四支(GPTBot、OAI-SearchBot、OAI-AdsBot、ChatGPT-User)、Anthropic 有三支(ClaudeBot、Claude-User、Claude-SearchBot),站方常常只擋訓練那支。
  • 最反直覺的一條:同樣是「使用者主動叫它去讀」,OpenAI、Perplexity、Google 官方都寫這類請求可能忽略 robots.txt,只有 Anthropic 明寫停用 Claude-User 就會擋掉。
  • 現在就做:把網址結尾換成 /robots.txt 打開來搜那幾個爬蟲代號,30 秒就知道是誰擋你;另外把 2026 年 9 月 15 日記起來,Cloudflare 要改新網域的預設值。

網址貼過去,AI 回你一句「我無法讀取這個連結」;或更氣人的是,它讀了,但回來的內容跟那一頁根本對不上。

先給方向:AI 讀不到網址這件事,絕大多數時候不是它壞掉,也不是你的網路有問題。是那個網站主動把 AI 擋在門外了——而且各家 AI 派出去的爬蟲名字都不一樣,站方常常只擋了拿去訓練的那一支,卻連帶把「你主動叫它去讀」的那一支也一起擋掉。

我每天用 AI 超過十小時,同時付著好幾家的訂閱在產出多個部落格的內容,貼網址請 AI 讀是我一天裡重複最多次的動作。一開始遇到讀不到,我照著中文教學做過一輪:清快取、關擴充、換瀏覽器、關掉 VPN——沒有一次有用。後來我換個方向,直接去看那些網站自己的 robots.txt,答案在三十秒內就出現了。

所以這篇不從「重新整理再試一次」開始。我把四家官方的爬蟲文件逐項攤開對過,還自己掃了 18 個中外網站的 robots.txt,先幫你分清楚是哪一種讀不到,再回答一個更實際的問題:這一頁到底還救不救得回來?


AI 讀不到你貼的網址,先分成四種:每一種的解法都不一樣

AI 讀不到網址的原因可以收斂成四種,而且四種的處理方式互不相通——先分錯類,後面怎麼弄都是白費工。

❶ 站方擋掉 AI。網站在 robots.txt 裡寫了不准某支 AI 爬蟲進來,或是在 CDN 層直接把 AI 流量攔掉。這是最常見、也最少人講的一種。

❷ 內容在登入牆或付費牆後面。那一頁你自己用瀏覽器看得到,是因為你登入過、或訂閱過;AI 拿到的是未登入狀態下的那一份。這種情況它常常會「讀到東西」,但讀到的是登入提示或摘要頁,於是就出現「內容跟頁面對不上」。

❸ 頁面本身不是純文字。整頁靠 JavaScript 才把內容畫出來、或內容其實是一張圖、一份掃描版 PDF、一段影片。AI 抓到的是空殼。

❹ 你用的那條線根本沒開網。某些方案、某些模式、企業版的某些設定,是刻意不給連網的。這種時候它不會說「被擋了」,它會說「我沒辦法瀏覽網頁」。

分辨方法其實很土但很有效:把同一個網址換一家 AI 貼貼看。三家都讀不到,多半是 ❶ 或 ❷;只有一家讀不到,多半是 ❹;三家都讀到但內容不對,那是 ❷ 或 ❸。

我自己踩過最久的一個坑是把 ❷ 誤判成 ❶。那一頁我看得到、AI 也「有回東西」,我就一直以為是 AI 理解力有問題,還去換模型、換提示詞,折騰了大概二十分鐘。後來把那個網址丟進無痕視窗才發現,未登入狀態下那頁只剩前三段。沒登入的你看到什麼,AI 就看到什麼——這句話後來變成我的第一個檢查點。

現在可以做的一件事:把讀不到的那個網址,貼進瀏覽器的無痕視窗開一次。你看到的畫面,就是 AI 看到的畫面。


各家 AI 的爬蟲名字對照:你貼網址時走的其實是另一支

大家在網路上看到的「擋 AI」教學,九成都只教你擋 GPTBot 跟 ClaudeBot——但那兩支是拿去訓練模型的,跟「你貼網址叫它去讀」完全是兩件事。

OpenAI 目前公開的代理有四支。官方爬蟲說明頁寫得很清楚:OAI-SearchBot 負責搜尋、OAI-AdsBot 負責檢查廣告落地頁安全性、GPTBot 負責蒐集訓練素材,而 ChatGPT-User 才是「使用者在 ChatGPT 裡問問題時,它跑去看那一頁」用的。

Anthropic 的說明頁則是三支:ClaudeBot(訓練)、Claude-User(Claude 使用者提問時取用)、Claude-SearchBot(搜尋索引)。Perplexity 的文件是兩支:PerplexityBot 做搜尋索引、Perplexity-User 處理使用者主動觸發的取用,而且官方特別註明 PerplexityBot 不用於訓練模型。

AI 服務 訓練用 搜尋索引用 你貼網址時走的那支
ChatGPT GPTBot OAI-SearchBot ChatGPT-User
Claude ClaudeBot Claude-SearchBot Claude-User
Perplexity 官方註明不用於訓練 PerplexityBot Perplexity-User
Gemini Google-Extended Googlebot 官方清單未單列(歸在「使用者觸發的擷取程式」)

Google 這一格要特別解釋。它的公開清單裡沒有替「你在 Gemini 貼一個網址」單獨開一支可以在 robots.txt 擋的代號,而是把這類動作整批歸進「使用者觸發的擷取程式」。清單裡另有一支 Google-Agent,用途是代替使用者上網執行動作(例如 Project Mariner 那種)。想知道 Gemini 這一側你自己能關掉哪些資料授權,我把官方條款讀完整理過一份 Gemini 個人化智慧要不要開的判斷依據

另外值得站長注意的是,Google 官方明寫 Google-Extended 不影響網站在 Google 搜尋的索引,也不是排名信號——它管的只是內容會不會被拿去訓練 Gemini 系列與 Vertex AI 相關服務。這代表擋掉它不會傷 SEO,跟很多人的直覺相反。想把這條線和搜尋曝光一起看,我另外整理過 Search Console 的 AI 報表怎麼看、AI Overviews 曝光要盯哪幾格

現在可以做的一件事:下次看到「怎麼擋 AI」的教學只列 GPTBot 跟 ClaudeBot,你就知道那份清單至少漏了一半。


最反直覺的一條:使用者主動叫它去讀,只有一家真的認 robots.txt

這是我把四份官方文件排在一起才看出來的落差,也是這篇最想留給你的一句話:「使用者主動觸發」這件事,四家的規則不一樣,而且差很大。

OpenAI 在官方文件裡寫的是:ChatGPT-User 不用於自動爬取網路,「Because these actions are initiated by a user, robots.txt rules may not apply」——因為這些動作由使用者發起,robots.txt 規則可能不適用。

Perplexity 更直接,官方文件對 Perplexity-User 的說明是:既然是使用者要求的取用,這支擷取器「generally ignores robots.txt rules」。

Google 的繁體中文文件也是同一個立場,原文寫著「由於擷取動作是由使用者提出要求,因此擷取程式通常會忽略 robots.txt 規則」。

只有 Anthropic 反過來。它的官方表格對 Claude-User 那一列寫的是:停用 Claude-User 會讓系統無法在回應使用者查詢時取得你的內容,並可能降低你的網站在使用者導向網路搜尋中的能見度。換句話說,四家裡面只有 Anthropic 明講「你擋,我就真的不去拿」。

老實說我第一次讀到這組對照時愣了一下。這代表兩件相反的事同時成立:如果你是讀者,貼網址給 Claude 讀不到的機率,理論上比另外三家高;如果你是網站經營者,你以為的「我擋掉了」,在另外三家可能只是一廂情願。

順帶一提,Anthropic 官方還寫了一件很多人做錯的事:用封鎖 IP 的方式來擋不保證有效,因為那會妨礙它讀到你的 robots.txt。它另外把爬蟲的來源 IP 清單放在 claude.com/crawling/bots.json 供人驗證,我實際打開看過,檔案裡的建立時間是持續在更新的。

現在可以做的一件事:同一個網址在 Claude 讀不到、在 ChatGPT 讀得到,不代表 Claude 比較弱——先去看那個站有沒有寫 Claude-User


怎麼自己查一個網站有沒有擋 AI?三步驟,不用裝任何東西

查一個網站有沒有擋 AI 完全不需要工具,用瀏覽器就能做完,我自己大概三十秒跑完一輪。

❶ 把網址砍到只剩網域,後面接上 /robots.txt

例如你要查的是某篇文章,就把後面那一長串路徑全刪掉,只留 https://網站網域/robots.txt,直接在瀏覽器打開。這是一份公開的純文字檔,任何人都看得到,不需要登入。

❷ 用 Ctrl+F 搜這幾個字。

GPTBotChatGPT-UserClaudeBotClaude-UserOAI-SearchBotPerplexityBot。有搜到,就往下看那一行下面接的是 Disallow: / 還是 Allow: /——前者是擋、後者是明確放行。

❸ 一個字都沒搜到,才去懷疑其他原因。

robots.txt 完全沒提到 AI 爬蟲,代表站方在這一層沒有設限。這時候讀不到就要往登入牆、付費牆、JavaScript 渲染那幾種去找,或者是 CDN 層的設定(那一層不會寫在 robots.txt 裡)。

有兩個地方很容易誤判,先講在前面。第一,robots.txt 的規則是逐行歸屬的,同一個 Disallow: / 底下可能疊了三十支 user-agent,你要往上多看幾行才知道自己搜到的那一支是被歸在擋的那組還是放行的那組。第二,沒有規則 ≠ 沒有擋——站方在 CDN 或防火牆層攔截,robots.txt 上一個字都不會有。

現在可以做的一件事:挑一個你最近讀不到的網址,現在就去看它的 robots.txt,你大概會在三十秒內拿到答案。


我掃完 18 個網站的 robots.txt:媒體之間的差距比想像中大

光講規則不夠有感,所以我直接抓了 18 個常被貼進 AI 的中外網站,逐一把 robots.txt 撈下來看。結果比我預期的分歧得多——同樣是台灣媒體,做法可以完全相反。

網站 訓練爬蟲(GPTBot/ClaudeBot) 你貼網址那支(ChatGPT-User/Claude-User)
中時新聞網 連 ChatGPT-User、OAI-SearchBot 一起擋
中央社 擋(另擋 Google-Extended、PerplexityBot) 未列,等於沒擋
聯合新聞網 未列,等於沒擋
商業周刊 明確 Allow(含 Perplexity-User)
iThome 明確不擋,檔內以中文註解說明
ETtoday 全部 Allow 全部 Allow
自由時報 整份檔案沒有任何 AI 規則 沒有
維基百科/GitHub/知乎/痞客邦 未逐一列名 未逐一列名

18 個網域裡,robots.txt 有逐一列名管理 AI 爬蟲的有 12 個,其中連「使用者主動觸發那一支」也一起處理的只有 7 個;另外 6 個完全沒提到 AI。

最值得單獨拿出來講的是三個極端。

中時是「連你自己貼都不給」那一端。它把 ChatGPT-User 跟 OAI-SearchBot 一起放進 Disallow: / 那一大組。所以你貼中時的文章網址給 ChatGPT 讀不到,不是 AI 的問題,是站方明確表達過不要。

商周是分層做得最細的那一端。它擋掉 GPTBot、ClaudeBot、Google-Extended、CCBot 這些訓練用的,但把 OAI-SearchBot、Claude-User、Claude-SearchBot、PerplexityBot、Perplexity-User 全部明確放行。翻成白話就是:內容不給你拿去訓練,但讀者主動想看、想搜尋,歡迎。這是我看過最清楚的一份立場表達。

iThome 則是唯一在 robots.txt 裡寫中文的。它直接在檔案註解裡寫明哪些是訓練用要擋、哪些即時檢索類「不在此列,仍可正常爬取並引用」,還附了授權洽談的信箱,並要求引用時標註來源與可用回鏈。把 robots.txt 當成授權聲明來寫,這個做法我第一次看到。

另一端則是自由時報——整份 robots.txt 只有 74 個位元組,擋的是兩支無關的監測機器人,AI 這件事一個字都沒提。沒有對錯,只是還沒表態。

現在可以做的一件事:你常貼的那幾個新聞網站,花五分鐘各查一次,之後就不會再對著同一個站反覆試了。


9 月 15 日之後會更常撞到:Cloudflare 要換新網域的預設值

如果你覺得最近讀不到的頻率變高了,這不是錯覺,而且接下來還會更明顯。

Cloudflare 在 2025 年 7 月 1 日宣布成為第一家「預設封鎖未經許可 AI 爬蟲」的網路基礎設施供應商:每一個新註冊上線的網域,都會被問要不要允許 AI 爬蟲,而預設是控制而不是開放。同一份新聞稿裡,Cloudflare 自述管理與保護著全球約兩成網站的流量,並提到自 2024 年 9 月推出「一鍵封鎖 AI 爬蟲」以來,已有超過一百萬名客戶選用。

兩成是什麼概念?意思是你隨手貼的網址,每五個大概就有一個的擋不擋由這一家的預設值決定。所以「它以前讀得到、現在讀不到」,很多時候不是 AI 退步,是那個站換了預設值。

更該記起來的是下一個時間點。依 Cloudflare 官方變更記錄,2026 年 9 月 15 日起,新上線到 Cloudflare 的網域會套用一組新預設值:把爬蟲分成 Search、Agent、Training 三類,Search 維持允許,而 Agent 與 Training 在有顯示廣告的頁面上預設封鎖。官方也註明,所有客戶都可以在 9 月 15 日之前隨時退出新預設。

這裡有個關鍵字要看懂:Cloudflare 對 Agent 的定義是「即時代替使用者行動的自動化活動,例如聊天取用機器人」。那正是你貼網址叫 AI 去讀的那件事。換句話說,這一次調整第一次把「使用者主動觸發」這類流量納入預設封鎖的範圍,而且觸發條件是那一頁有沒有廣告。

官方另外提到,同時具備 Search 與 Training 行為的多用途爬蟲,也會受到新的 Training 封鎖預設影響。這一條對站長端的影響其實比對讀者端更大,因為它會牽動搜尋曝光。想先把 Cloudflare 這一層的設定弄清楚,我寫過一份 部落格用的 Cloudflare 設定與 AdSense 防禦清單可以照著對。

現在可以做的一件事:如果你有網站掛在 Cloudflare,9 月 15 日之前進後台把 AI 流量設定看一次;如果只是讀者,把這個日期記著,之後讀不到的頁面變多不用懷疑自己。


被擋了還能怎麼辦?五個做法,和一個我不建議的

確認是站方擋的之後,最實際的問題是:這一頁還救不救得回來?答案是通常救得回來,只是要換路徑。

❶ 自己複製正文,貼進對話框。

最土也最有效。你用瀏覽器讀得到,就代表你有權限看;把文字複製貼上,等於你自己把內容帶進去,完全繞開爬蟲那一層。長文我會先貼標題和前後段,再補中間。

❷ 存成 PDF 再上傳。

瀏覽器列印成 PDF 是最快的方式。要注意的是掃描版或整頁截圖式的 PDF 常常只剩圖片、抽不出文字,這時候讀不到就跟站方無關了。各家在讀檔案上的差異我另外實測過,可以看 AI 整理 PDF 哪一款最強:Claude、ChatGPT、Gemini 我一頁一頁比過,還有 用 Claude 讀完一堆 PDF 報告的 7 個技巧

❸ 換一家 AI 試。

因為四家對「使用者主動觸發」的處理方式不同,同一個網址在這家讀不到、在另一家讀得到,是完全正常的。這不是誰比較強,是規則不一樣。

❹ 找同一則內容的其他來源。

新聞尤其適用。同一則消息通常有好幾家寫,換一個沒擋的站貼過去就好——我掃過的名單裡,ETtoday 和自由時報這兩端都是可行的替代來源。

❺ 直接把問題描述給 AI,讓它自己去搜。

與其貼那個讀不到的網址,不如把你要問的事講清楚讓它自己找。搜尋走的是另一支爬蟲、另一套索引,路徑不同結果也常常不同。

而我不建議的那一種,是想辦法繞過去。換 user-agent、找鏡像站、丟進第三方轉檔服務讓它代抓——先不論效果,付費牆和登入牆後面的內容本來就是別人的商品。Anthropic 在官方文件裡也明寫,它的爬蟲尊重反規避技術,例如不會嘗試繞過 CAPTCHA。連 AI 公司自己都劃了這條線,我覺得使用者沒有必要替它們跨過去。

現在可以做的一件事:下次讀不到就直接跳到 ❶,複製貼上花的時間,比你試三種偏方還短。


換個位置想:我自己的部落格要不要擋 AI?

寫到這裡一定會有人反過來問:那我自己的網站呢,該不該擋?我自己也認真算過這筆帳,最後選擇不擋訓練以外的任何一支。

理由很單純。擋掉搜尋與使用者取用那幾支,等於自己把 AI 時代的曝光關掉。OpenAI 官方就寫明,退出 OAI-SearchBot 的網站不會出現在 ChatGPT 的搜尋答案裡;Anthropic 也寫停用 Claude-User 可能降低網站在使用者導向搜尋中的能見度。對一個靠內容被看見的部落格來說,這是拿曝光換一個象徵性的姿態。

但這個判斷不是每個人都適用,所以直接把兩邊條件攤開:

適合把 AI 擋起來的情況:內容本身就是你的商品(付費專欄、線上課程、報告訂閱);有在談內容授權,需要保留談判籌碼;站上有大量原創圖片或資料集;或者你的收入主要來自站內轉換而不是搜尋流量。

不適合擋的情況:流量主要靠搜尋而來;靠廣告收益或聯盟分潤變現;經營的是個人品牌需要被引用;站齡還短、正在累積能見度。如果你屬於後面這一群,擋 AI 的代價會直接反映在流量上。

成本這件事很多人算錯。擋或不擋本身完全免費——robots.txt 就是一個純文字檔,Cloudflare 的一鍵封鎖也在免費方案裡。真正的成本是機會成本:你少掉的引用、少掉的曝光、少掉的自然流量。這筆錢不會出現在帳單上,但會出現在報表上。

如果你想走中間路線,商周那份 robots.txt 是很好的範本:訓練用的擋掉,搜尋與使用者取用的放行。想把 AI 時代的內容曝光整套搞懂,可以接著看 Google 偏好來源、Highly Cited 是什麼,內容網站該做對哪 8 件事,以及 Google AI Mode 上線後我實測的 5 招保流量做法

下一步:先打開自己網站的 /robots.txt 看一眼——很多人根本不知道主機商或佈景主題已經替你寫了什麼進去。還沒有自己的站、但想開始累積內容資產的話,我完整記錄過 不會寫程式、用 AI Agent 一天把個人網站架上線的過程


FAQ 常見問題

擋掉 AI 爬蟲會不會害我的 Google 排名掉下來?

擋 Google-Extended 不會。Google 官方明寫這支代理不影響網站在 Google 搜尋的索引,也不是排名信號,它管的只是內容會不會被拿去訓練 Gemini 系列與 Vertex AI 相關服務。

但要小心兩個東西別搞混:Googlebot 是搜尋索引用的,擋掉那支才是真的會讓你從搜尋結果消失。另外依 Cloudflare 官方說法,同時具備搜尋與訓練行為的多用途爬蟲,會受到「封鎖 Training」這個選項連帶影響——在 CDN 層做設定時特別要看清楚勾的是哪一格。分不清這些代號誰管什麼,可以先從 搜尋引擎優化的基本盤怎麼打補起來。

我不是站長,只是讀者,能讓 AI 讀到被擋的頁面嗎?

能,但方法是把內容自己帶進去,不是想辦法繞過封鎖。最快的是複製正文貼進對話框,其次是列印成 PDF 上傳。這兩種都是用你自己的閱讀權限,不涉及規避。

至於換 user-agent、找鏡像站那類做法,我不建議。付費牆後面的內容是別人的商品,而且效果往往也不穩定,花的時間比複製貼上多得多。

ChatGPT 讀不到、Claude 也讀不到,是同一個原因嗎?

不一定,而這正是最容易誤判的地方。因為四家對「使用者主動觸發」的規則不同——OpenAI、Perplexity、Google 官方都寫這類請求可能忽略 robots.txt,只有 Anthropic 明寫停用 Claude-User 就會擋掉。

所以兩家都讀不到,比較可能是登入牆、付費牆,或是 CDN 層的攔截,而不是 robots.txt。這時候先用無痕視窗開一次那個網址,答案通常立刻就出來。

怎麼知道是 robots.txt 擋的,還是 CDN 擋的?

先看 robots.txt。有寫、而且該支爬蟲被歸在 Disallow: / 那一組,答案就確定了。

如果整份檔案一個 AI 爬蟲都沒提,卻還是讀不到,那多半是 CDN 或防火牆那一層——那一層的設定不會出現在 robots.txt 裡。以 Cloudflare 覆蓋約兩成網站的規模來說,這種情況比多數人以為的常見。

9 月 15 日之後,是不是所有網站都會擋掉 AI?

不是。依 Cloudflare 官方變更記錄,新預設值只套用在之後新上線到 Cloudflare 的網域,而且只在有顯示廣告的頁面上預設封鎖 Agent 與 Training 兩類,Search 維持允許;所有客戶也都可以在那之前退出新預設。

不過方向是清楚的:即時取用這類流量正在從「預設可以」往「預設要問過」移動。以讀者的角度,把「複製正文貼上」練成反射動作,比記住哪個站擋哪支實際得多。


寫在最後

把這篇濃縮成一句話:AI 讀不到你貼的網址,絕大多數時候不是它壞掉,是那一頁的主人不想讓它進來,而且擋住它的常常不是你以為的那一支爬蟲。

正確的排查順序是:先用無痕視窗確認你自己看不看得到 → 再去看那個站的 /robots.txt 搜六個爬蟲代號 → 都沒有才去懷疑 CDN、JavaScript 或方案本身沒開網。倒過來做,就會像我一開始那樣,在清快取和換瀏覽器之間反覆繞路。

真正讓我改觀的是把四家官方文件排在一起的那一刻。同樣一句「這是使用者主動要求的」,三家拿來當作可以忽略規則的理由,一家拿來當作要更尊重規則的理由。技術文件其實藏著很多立場,只是平常沒人把它們並排來看。

下次讀不到的時候,別急著怪 AI,也別急著怪自己的網路。把網址砍到只剩網域,加上 /robots.txt,答案通常就在那三十秒裡。

想繼續往下修這類 AI 使用上的小卡關,可以接著看 AI 一直回簡體字該怎麼一次設定好訂閱刷了卻沒生效時我自己對帳的排查順序,或是 用 MCP 讓 AI 直接接上你自己的資料來源文章被 AI 檢測器誤判時怎麼自證清白;也歡迎訂閱夜羽凌的部落格,會不定期收到信。


參考資料

 

延伸閱讀