AI Bot Robots.txt Checker 會產生一份確定性的、瀏覽器端的報告,顯示 32 個現行 robots.txt 產品權杖(由 AI 爬蟲、AI 助理、模型訓練控制項,以及 AI 相關搜尋爬蟲所使用)中,每一個對於單一您指定路徑是「允許」還是「封鎖」的,嚴格依據您所貼上檔案中的規則進行評估。其結果是一張 32 列的表格,每一列皆包含一個運算子標籤、一個用途類別、一個來源狀態,以及一個根據 RFC 9309 配對邏輯所衍生的「允許/封鎖」裁決。由於本工具不會擷取網站、不會上傳檔案,也不會聯絡任何爬蟲運營商,因此該報告可從相同的貼上文字與相同輸入路徑完整重現——但這同時也表示,結果僅描述您貼上的規則所要求的內容,而非您實際伺服器所提供的內容,或任何爬蟲實際上會採取的行動。欲正確解讀結果,必須在使用任何一列作為最終依據前,先理解上述每一項限制,而以下步驟將逐步說明如何做到這點。

AI Bot Robots.txt Checker 報告的內容
在 AI Bot Robots.txt Checker 上執行檢查,會產生一份恰好 32 列的單一確定性表格。每一列對應於一個現行 robots.txt 產品權杖,由 AI 爬蟲、AI 助理、模型訓練控制項,或 AI 相關搜尋爬蟲所使用,且每一列皆包含四項資訊:運營商標籤、用途類別、來源狀態,以及針對您所輸入路徑的單一「允許」或「封鎖」裁決。
用途類別說明了該權杖實際上控管的範圍。某些列代表專屬的訓練控制權杖,由運營商發布,以便發布者能在不阻擋擷取的情況下,選擇退出模型訓練——例如 Google-Extended 或 Applebot-Extended 這類項目。其他列則代表用於 AI 體驗與 AI 相關搜尋而擷取頁面的爬蟲或助理擷取產品。少數幾列為輔助項目,來源是 Cloudflare Radar 機器人目錄,而非運營商的第一方文件,這些列會在來源狀態欄中明確標示,以便您辨識它們為交叉參考,而非主要的運營商聲明。
來源狀態欄是多數讀者快速略過、但實際上不應略過的部分。標示為「運營商第一方」的列可在正常謹慎下據以採取行動;標示為「輔助」或「目錄來源」的列,在裁決被視為具權威性之前,應進一步對照運營商自身的最新文件進行檢視。如需更深入的說明,以了解如何解讀每一欄,以及如何判讀不常見的類別組合,可參考 解碼 32 個產品權杖的 AI robots.txt 報告 一文,該指南與本驗證工作流程可自然搭配使用。
執行檢查並閱讀每一列
該檢查本身是一個三步驟的瀏覽器工作流程。依序遵循步驟,可保持結果的可重現性,並避免網站擁有者最常遇到的裁決意外。
- 將您要檢視的精確 robots.txt 文字貼入輸入區。請將檔案控制在工具強制規範的 500 KiB UTF-8 上限內;若檔案在該位元組上限內,仍可能因超出兩項記載的安全上限之一而被拒絕——即 5,000 條非空存取規則上限,或 20,000,000 項彙總配對工作操作上限——因此一個實用的前置檢查是在貼上前,先掃描是否有失控的群組或重複的區塊。
- 輸入您要模擬的、精確且區分大小寫的 URL 路徑,並以斜線開頭。若您模擬的爬蟲請求包含查詢字串,請一併加入;否則請省略。同一份檔案對於 /Private 與 /private 可能產生不同結果,因此字母大小寫屬於輸入的一部分,而非風格選擇。
- 執行檢查,並檢閱報告中為每個產品權杖所標示的每一條相符規則,然後在您發布或變更任何內容前,針對關鍵裁決對照運營商的最新文件進行驗證。
閱讀每一列結果意味著依序檢視四項內容:產品權杖(該列代表哪個爬蟲或控制項)、用途類別(擷取、訓練控制,或輔助目錄)、來源狀態(運營商第一方,或標示為輔助),以及裁決(允許或封鎖)。某列顯示「Allowed」(允許)僅代表您貼上的規則未要求針對該權杖封鎖所輸入路徑;並不代表運營商會抓取、建立索引、引用、訓練該頁,或在體驗中呈現該頁。「Blocked」(封鎖)僅代表您貼上的規則要求該權杖不要存取該路徑;並不代表運營商會遵循該要求,亦不代表內容已從任何現有索引中移除。
對照您貼上的規則驗證結果
當結果看起來有誤時,最快的核對方式是將裁決回溯到您貼上檔案中的相符規則。AI Bot Robots.txt Checker 實作了 RFC 9309 所標準化的核心規則,因此回溯過程遵循可預期的順序。User-agent 產品權杖的相符比對不區分大小寫,亦即 GPTBot 與 gptbot 指向同一個群組。當有多個群組指向同一個產品權杖時,其規則會予以合併。產品權杖相符的群組優先於萬用字元群組;只有在沒有特定群組相符時,萬用字元群組才會適用。
在適用的群組中,工具會從路徑開頭起,將 Allow 與 Disallow 樣式與您的路徑進行比對。最長的相符樣式獲勝,因此更明確的規則會擊敗同樣相符但較短的規則。當長度相同的 Allow 與 Disallow 規則同時相符於同一路徑時,Allow 獲勝。樣式中的星號可符合任何字元序列,而樣式結尾的美元符號會將樣式錨定於路徑結尾。註解會在任何規則解讀前先予以移除,因此凡不是以 User-agent、Allow 或 Disallow 開頭的內容,皆不影響裁決。Sitemap 與 Crawl-delay 這幾行在檔案中可見,但屬於存取裁決報告範圍之外。
配對邏輯的一個簡短示例,使用一個假設的群組,其中包含 Disallow: /articles/2026/ 與 Allow: /articles/2026/review/。對於路徑 /articles/2026/review/,兩個樣式皆相符,因為 Disallow 樣式是該路徑的前綴。Allow 樣式較長,因此獲勝;裁決為「Allowed」(允許)。若您改為測試 /articles/2026/ 本身,則僅 Disallow 樣式相符,長度平手的規則不適用,裁決為「Blocked」(封鎖)。空白的 Disallow 值不會封鎖任何內容;若沒有適用的 Allow 或 Disallow 規則相符,則存取會回報為「Allowed」(允許)。
以運營商文件交叉核對關鍵權杖
Robots.txt 產品權杖會隨時間變動。運營商會重新命名爬蟲、淘汰舊的爬蟲、與其擷取爬蟲並行發布專屬的訓練控制權杖,並偶爾更新其產品所遵循的路徑。本報告會在可取得時,根據運營商的最新文件建構——OpenAI 與 Anthropic 產品使用主要的運營商文件,Cloudflare AI 爬蟲參考資料及其託管 robots.txt 文件,則為主要產品提供維護中的交叉參考。若某列是來自 Cloudflare Radar 機器人目錄而非運營商,該列會予以標示,而不會作為第一方驗證內容呈現。
兩項實用的交叉核對可涵蓋大多數問題。針對 OpenAI 產品,OpenAI 發布者與開發者常見問題說明了目前存在哪些擷取器與訓練控制權杖,以及它們應如何出現於 robots.txt 中。針對主要 AI 與搜尋爬蟲的更廣泛涵蓋範圍,Cloudflare AI 機器人與爬蟲流量參考資料是一份實用的維護中交叉參考,搭配其 託管 robots.txt 參考資料;針對 Anthropic 產品,Anthropic 網路爬蟲控制項文章記載了 ClaudeBot 及相關權杖。
交叉核對對於訓練控制權杖最為關鍵,因為這是最容易設定錯誤的類別。針對擷取爬蟲的 Disallow 規則本身並不會讓發布者退出訓練;只有運營商發布的控制權杖才能做到。若您的目標是在允許擷取的同時,將頁面排除於訓練之外,則需逐列對照運營商目前的控制權杖名稱來核對報告。
檢查之後:確認實際部署的內容
該檢查僅分析您所貼上的文字。它不會擷取您的網站、不會上傳檔案,也不會聯絡任何爬蟲運營商,這正是為何結果具隱私性與確定性,但也代表它本身無法確認實際上線的內容。數項部署上的現實情況可能使頁面上的結果與報告有所出入,而一個簡短的驗證迴圈即可逐一捕捉這些情況。
| 驗證步驟 | 其重要性 |
|---|---|
| 從完全相同的 scheme 與主機擷取實際的 /robots.txt | 該報告無法偵測重新導向、CDN 覆寫,或僅提供給特定用戶端的規則。 |
| 確認回應為純文字且成功回傳 | 狀態碼為 200 但內容類型非文字,或是快取中的過時副本,皆可能在無聲無息中變更實際有效的檔案。 |
| 比對實際檔案與您貼入檢查器的檔案 | 快取延遲或建置管線飄移,可能導致部署的仍是過時檔案。 |
| 驗證路徑範圍是否正確 | 檢查器無法確認服務該檔案的是否為您預期的正確虛擬主機或子網域。 |
| 於伺服器記錄或運營商工具中確認行為 | 封鎖是一項自願性的請求,而非強制執行;唯有流量證據能顯示實際發生的事情。 |
如需針對「檢查器是否會檢視您的實際網站」取得聚焦的解答,以及其對您可賦予結果之信任度的意義,可參考 AI Bot Robots.txt Checker 是否會擷取您的實際網站 一文,該指南更詳細地說明了隱私與範圍界線。請將本檢查器視為部署前的檢閱工具:貼上精確的正式環境檔案、測試數個重要路徑而非僅測一條、檢視檔案中特定的群組與萬用字元群組,並且只有在發布實際檔案之後,確認您預期的行為才有意義。
同樣的原理亦適用於更廣泛的執行性問題。報告中的「Blocked」結果是一項請求,而非一道牆;爬蟲可以忽略該檔案,而在 Disallow 中公開列出某路徑,甚至可能洩漏該路徑本欲保護的內容。機密或付費內容應置於伺服器端的身分驗證與網路控制之後,實際的爬蟲流量亦應於記錄中加以監測。如此運用之下,這份 32 列的報告便成為一份快速、可重現的發布前檢閱,而非最終答案。