檢查 AI 機器人 robots.txt 的正確做法,是一套具決定性、在瀏覽器內執行的檢查工具,能同時針對一份貼上的 robots.txt 檔,評估所有已記錄的 AI 爬蟲、助理、訓練控制、以及 AI 相關搜尋產品權杖,完整套用 RFC 9309 比對規則,並回報允許或封鎖結果,且不會擷取您的實際網站或聯絡任何業者。選擇這個做法很重要,因為 AI 爬蟲權杖變動快速,業者會在檢索權杖之外,另外發布專屬的訓練控制權杖(例如 Google-Extended 或 Applebot-Extended),而同一路徑的 Allow 與 Disallow 差別,可能因一個尾端斜線、查詢字串、或錯誤的萬用字元群組而翻盤。單一檔案、多權杖的檢閱能一次捕捉所有這類邊緣情況,並在過程中保持檔案私密。另一種做法——一次測試一個業者、用肉眼檢查規則、或依賴搜尋控制台恰好顯示的內容——會留下容易忽略的漏洞,直到不想要的爬蟲已經抓走頁面才發現。

為什麼做法的選擇會改變結果
robots.txt 檔當初是為數量小且穩定的搜尋爬蟲設計的。在 AI 優先的環境中,user-agent 清單分散在檢索機器人、助理產品、模型訓練爬蟲、以及專屬的訓練控制權杖之間。每個業者各自發布慣例,有些權杖甚至根本不會以 HTTP User-Agent 標頭出現。這讓逐一檢閱變得脆弱:您確認了 GPTBot,卻漏掉 ClaudeBot,忘了 Perplexity 檢索機器人,也沒注意到 CDN 開始遵循的目錄來源權杖。
能在單次執行中將同一路徑跑過所有已記錄權杖的檢查工具,會立即凸顯這種不對稱。再搭配嚴格的 RFC 9309 邏輯,便能消除第二種常見的失敗模式:規則在螢幕上看起來正確,卻因為大小寫敏感、美元符號錨定、或最長匹配規則而產生不同的解析結果。RFC 9309 的路徑匹配區分大小寫,/Private 與 /private 是不同的路徑,而當您測試的路徑只是 / 時,Disallow: / 與 Disallow: /$ 代表的意義並不相同。
選擇正確的做法也決定了檢閱的隱私程度。會擷取您實際檔案、上傳檔案、或將路徑送到第三方服務的檢查工具,無法在您當週仍在反覆調整規則時,維持未發布規則更動的機密。實務上經得起考驗的做法,是讓檔案留在您的本機、在本機執行,並把測試視為(貼上文字、路徑)的決定性函式。
區分優良檢查工具與高風險檢查工具的五項準則
在投入某個工作流程之前,請用相同的五項準則衡量每個選項。它涵蓋隱私、協定精確度、涵蓋範圍、可重現性,以及適用範圍。
| 準則 | 應尋找的項目 | 為何重要 |
|---|---|---|
| 隱私 | 僅限瀏覽器、貼上文字輸入、無上傳或擷取 | 您實際的 robots.txt 與未發布的草稿會留在本機 |
| RFC 9309 匹配 | 最長路徑優先、長度相同時 Allow 優先、路徑區分大小寫、字尾 $ 錨定 | 符合規範的邏輯能對應到合規爬蟲實際解析的結果 |
| 權杖涵蓋範圍 | 單次執行涵蓋所有已記錄的 AI 爬蟲、助理、訓練控制、以及 AI 相關搜尋權杖 | 漏掉任何一個權杖,就可能把內容洩漏給您從未打算允許的產品 |
| 決定性 | 相同的貼上文字加上相同的路徑,每次執行都會產生相同的報告 | 讓您能比對版本、稽核變更,並在工單中重現結果 |
| 部署前導向 | 報告針對您貼上的規則,而非業者的行為 | 您在檔案上線前先檢閱;實際執行階段是另一個獨立步驟 |
AI 機器人 Robots.txt 檢查工具符合全部五項。它完全在您的瀏覽器中執行、按照 RFC 9309 規則原文運作、一次評估 32 個現行 AI 及 AI 相關產品權杖、為每個權杖回報穩定的允許或封鎖判定,且明確定位為部署前的檢閱,而非爬蟲監控產品。這種組合就是大多數團隊「正確做法」的實務樣貌。
三步驟執行檢查
- 將您要檢閱的 robots.txt 完整文字貼到輸入區,並控制在 500 KiB 上限以內。註解與非指令行不會影響結果,但從正式環境貼上乾淨內容,能避免您檢閱的版本與實際部署的版本之間出現細微落差。
- 輸入以斜線開頭、區分大小寫的 URL 路徑並執行檢查。當您要模擬的請求包含查詢字串時,請一併加入;比對器會將查詢字串視為路徑的一部分,因此 /search 與 /search?q=internal 在報告中可能對應到不同的列。
- 檢閱每一條匹配規則,並在發布前依據業者的現行說明文件,驗證關鍵的產品權杖。32 列的報告會顯示是哪個 user-agent 群組提供了勝出規則、該規則是 Allow 或 Disallow 模式,以及在沒有特定群組匹配時與萬用字元群組相比的結果。
為每個您真正在意的路徑重複第二步——首頁、付費牆文章、內部搜尋端點、AI 摘要預覽網址——不要只信任單一測試路徑。每個路徑都是獨立的執行;同一份 robots.txt 對 /private 與 /private/ 可能回傳不同結果,這是因為尾端斜線的處理方式以及業者正規化請求的方式。
將報告對照您的實際政策來解讀
32 列的編排方式,讓業者、目的類別與來源狀態一目了然。有些列是專屬的訓練控制權杖——例如 Google-Extended 與 Applebot-Extended——它們規範的是已抓取內容的使用方式,即使檢索爬蟲本身已獲准存取。其他則是來自交叉引用目錄的檢索或助理產品,例如 Cloudflare AI 爬蟲參考,而目錄來源的補充條目會在報告中標示出來,而非以第一方驗證資料呈現。
解讀表格時,請特別留意三個訊號。第一,留意那些勝出規則來自萬用字元群組、卻存在特定產品群組的權杖;這表示您的特定群組要麼未匹配到該產品權杖,要麼對此路徑沒有規則,較嚴謹的檔案能夠補上這個缺口。第二,留意那些在不同路徑間結果翻轉的權杖——這邊 Allow、那邊 Disallow——意外的過度分享通常就藏在那裡。第三,留意讓您意外的權杖;如果您不知道 ClaudeBot 有專屬的檢索權杖,報告就是最便宜的方式,讓您在該業者的爬蟲自行決定前先發現它。
空白的 Disallow 值不會封鎖任何內容,模式中的星號則匹配任意序列。若報告顯示某路徑為允許,僅代表貼上的規則並未要求封鎖;並不證明業者實際上會抓取、建立索引或用於訓練。請將每一列視為對您自身政策的提問,而非對爬蟲行為的聲明。
檢查工具無法觸及之處
在瀏覽器內、僅貼上文字的檢查工具,刻意設計得很局限。它不會擷取 URL,因此無法偵測重新導向、CDN 覆寫、僅對特定用戶端提供的語法、不正確的主機範圍、快取延遲,或單純載入失敗的 robots.txt。關於 AI 機器人 Robots.txt 檢查工具是否會擷取您實際網站的指南,更詳細地說明了這些限制。
它也無法確認目前部署的內容。您可能在本地編輯了檔案卻尚未推送,或代管層重寫了規則。Robots.txt 是自願性的:爬蟲可以忽略它,而列出某個路徑反而會暴露它,即使該規則封鎖了存取。若要可強制執行的保護,您仍然需要伺服器端的身分驗證、IP 或網路控制,以及對重要路徑的流量監控。報告中的封鎖列是一個禮貌性的請求,而不是防火牆規則。
最後,比對器的輸入上限為 500 KiB 的 UTF-8 文字以及 5,000 條非空白的存取規則,另外還有 20,000,000 次操作的整體匹配工作量上限。即使檔案在位元組限制以內,若規則與路徑會超出工作量預算,仍可能遭到拒絕。這是刻意的設計——當惡意的超長路徑遇上龐大的規則集時,能維持主執行緒的反應速度——但在您直接貼上從爬蟲產生的設定檔之前,仍值得先了解這一點。
發布後確認行為
此檢查工具是部署前的檢閱工具,而非監控工具。一旦檔案上線,請從完全相同的通訊協定與主機擷取它、確認回應為純文字且成功回傳,並在您可用的業者工具、搜尋控制台或伺服器記錄中驗證行為。如何驗證 AI 機器人 Robots.txt 檢查結果指南中概述了一套實用的驗證流程,它建立在相同的部署前檢閱做法之上。
請將所選做法視為一個循環,而非一次性作業。起草、貼上、執行、將關鍵權杖對照業者的現行說明文件交叉核對、發布、驗證,並在新爬蟲誕生、或現有 Operator 更新其產品時時重複。這就是讓「檢查 AI 機器人 robots.txt 的正確做法」在六個月後依然正確的方式。