跳至主要內容
Lizely

AI Bot Robots.txt 檢測器

在你的瀏覽器中,將一個 robots.txt 檔案對照 32 AI 與 AI 相關爬蟲產品字元,並符合 RFC 9309 的匹配規則,完全進行分析。

隱私權:你的檔案不會離開裝置,所有處理均在瀏覽器本機完成。

使用方式

  1. 1.貼上你要檢閱的完整 robots.txt 文字,並保持在 500 KiB 限制之下。
  2. 2.輸入一個大小寫敏感的 URL 路徑,並以斜線開頭,然後執行檢查。
  3. 3.檢閱每個符合的規則,並在部署前將關鍵產品標籤與當前營運者檔案進行對照確認。

關於AI Bot Robots.txt 檢測器

AI Bot Robots.txt Checker 會將貼上的 robots.txt 檔案與目前用於 AI 爬蟲、AI 助手、模型訓練控制以及與 AI 相關搜尋爬蟲的 32 種 robots.txt 產品字串進行比對。輸入一個 URL 路徑,執行檢查,並檢視每個字串被允許或被阻擋的結果。處理過程在瀏覽器中進行;這個工具不會抓取網站、上傳檔案或聯絡爬蟲運營者。

檢查器遵循 RFC 9309 標準化的核心匹配規則。使用者代理產品標籤會忽略字母大小寫進行匹配。當多個群組針對相同的產品標籤時,其規則會被合併。匹配產品標籤的群組會優先於萬用符號群組,而萬用符號群組則在沒有特定群組匹配時生效。

在適用的群組中,允許與拒絕模式會從路徑的起始位置進行比較,最符合的模式會獲勝。當允許與拒絕規則同樣具體且同時符合時,允許會獲勝。星號(*)可匹配任何字元序列,而結尾的美元符號($)則會將模式固定在路徑結尾。在規則被解析前,會先移除註解。

路徑應以斜線開頭,並可能包含查詢字串,當這部分是你想要模擬的爬蟲請求時。路徑的匹配是區分大小寫的,因此 /Private 與 /private 可能產生不同結果。空的 Disallow 值不會阻擋任何內容。若沒有適用的 Allow 或 Disallow 規則匹配,則會報告為允許存取。

32 行是 robots.txt 產品令牌,並非保證每個字串都會原封不動地出現在 HTTP User-Agent 頭部中。有些營運者會發布專用的控制令牌,例如 Google-Extended 或 Applebot-Extended,用於模型訓練或資料使用偏好。其他行則代表爬蟲或助理檢索產品。這個表格會標註每個營運者、用途類別以及來源狀態,讓這些區別保持清晰可見。

主要營運者檔案會在可用時用於 OpenAI 和 Anthropic 產品。Cloudflare 的維護 AI 爬蟲參考與管理的 robots.txt 檔案提供目前主要產品的交叉參考。補充的 Cloudflare Radar 目錄字元會根據標籤標註,而非以營運者第一方驗證的方式呈現。爬蟲產品會隨時間改變,因此在釋出前,請先將關鍵政策與營運者最新檔案進行對照。

檢查器最多接受 500 KiB UTF-8 的輸入以及 5,000 個非空的存取規則。RFC 9309 要求解析器必須處理至少 500 KiB,而這個互動式瀏覽器工具也強制執行一個記錄總數匹配工作上限,以防止惡意長路徑與大量規則集導致主執行緒當機。因此,一個符合位元組上限的檔案可以被安全上限直接拒絕。非 User-agent、Allow 或 Dis-Allow 指令的行不會影響結果。網站地圖與爬取延遲行可能對特定爬蟲有意義,但這些內容在此存取決定報告中並未包含。

robots.txt 是一種選擇性機制。它並不是認證、授權、防火牆、契約執行系統,或證明內容不會進入 AI 模型的證據。爬蟲可以忽略這個檔案,且公開列出路徑可能會讓它被發現。保護機密或付費內容應使用伺服器端存取控制,並單獨監測實際流量。

允許的結果僅表示貼上的規則並未要求在已實施的協議邏輯下,針對所選路徑進行封鎖。這並不能證明運營者會爬取、索引、引用、用於訓練或顯示該頁面。同樣地,被封鎖的結果也無法證明已執行封鎖或從索引中移除。搜尋索引、摘要控制、訓練偏好以及即時網路封鎖是不同的控制選項。

使用這個工具作為預部署審查。貼上精確的生產檔案,測試幾個重要的路徑,檢查特定與萬用字元組,並將報告與營運者檔案進行比較。釋出後,從精確的協議和主機取得現行的 /robots.txt,確認回應是純文字且成功返回,然後在可用的營運者工具或伺服器日誌中驗證行為。

這個檢查器無法取得網址,因此無法偵測到重定向、CDN 覆蓋、僅對特定客戶端提供的語法、錯誤的主機範圍、快取延遲,或無法存取的檔案。它也無法確認目前部署的內容。這些限制讓工具保持私有且決定性,同時讓結果容易從相同的文字和路徑重複產生。

方法與來源

解析最多 512,000 UTF-8 位元組至 RFC 9309 瀏覽器使用者端群組;合併重複的不區分大小寫產品標籤群組;僅在無特定群組匹配時才回退至 User-agent: *;從起始位置比較區分大小寫的路徑模式,支援 * 與終端 $;選擇最長匹配,並在相同特異性時優先 Allow;預編譯安全萬用字元片段;將存取規則上限設定為 5,000 並在 20,000,000 操作中進行聚合處理;快取相同適用群組的策略;之後獨立評估相同路徑,針對固定 32 專案、帶來源標籤的 robots.txt 產品標籤表格進行分析。

常見問題

被阻擋的結果會阻止 AI 公司存取我的內容嗎?
不會。robots.txt 是一種自願的爬蟲請求,不是存取控制;使用認證、網路控制和監控來實現強制保護。
所有 32 入口都是 HTTP User-Agent 頭部的字面值嗎?
不是。它們是 robots.txt 的產品標籤;有些是專門的控制標籤,而補充的目錄來源條目則會標註而非視為第一方驗證。
為何更明確的 Allow 規則可以覆蓋 Disallow?
RFC 9309 選擇最長的相符路徑模式,並說明當等價的 Allow 與 Disallow 規則具有相同匹配長度時,Allow 會獲勝。
這個工具會檢查我的現有網站嗎?
不可以。它僅分析貼上的文字與你在瀏覽器中輸入的路徑,因此無法偵測部署、重定向、快取或主機範圍問題。

SEO 與網站管理 使用指南

查看全部