robots.txt 檔案產生器會為單一網站建立一個小型、純文字的爬蟲指令檔,而無需將設定資料傳送至伺服器。產生器會詢問網站的 HTTP 或 HTTPS 來源,以及您希望合規爬蟲遵循的整體政策,接著輸出一個以單一使用者代理群組與一行 sitemap 為基礎的 UTF-8 文字檔。RFC 9309 定義了該文字的解析方式,因此產生器堅持使用標準化的群組與規則模型,而不是嘗試管理每個搜尋引擎的私有擴充功能。萬用字元星號和結尾的錢字號會被保留,因為協議定義了它們;井字號則會被拒絕,讓使用者輸入的規則不會意外變成註解。路徑規則會從第一個八位元組開始比對 URL 路徑,其區分大小寫和最長比對行為同樣由該 RFC 指定。輸出結果的用途是下載、與目前的正式檔案進行比較,然後以所管轄的精確 scheme、主機和連接埠發布為 /robots.txt。

robots txt file generator
Robots.txt 檔案產生器:政策模式與輸出格式

Robots.txt 檔案產生器實際上做了什麼

robots.txt 檔案位於網站的根目錄,告訴合規爬蟲哪些路徑可以請求。手動撰寫時,您必須挑選一個使用者代理、在 Allow 與 Disallow 規則之間抉擇,並記住協議所要求的精確路徑語法。robots.txt 檔案產生器將幾個明確的選擇轉換成可複製或下載的文字檔,省去輸入與反覆猶豫的麻煩。

Robots.txt 產生器在瀏覽器中採用了同樣的做法。您輸入網站來源,選擇合規爬蟲應存取所有內容、避開選定路徑,還是避開整個網站,接著工具會產生純 UTF-8 文字,內容包含單一萬用字元使用者代理群組,以及從該來源衍生的 sitemap URL。產生過程中不會將任何資料傳送至遠端服務,所有輸入的路徑或產生的行數都停留在目前的分頁中。

三種政策模式一覽

即使之後變得更具體,每個 robots.txt 檔案仍是由單一頂層政策選擇所形塑。產生器提供三種涵蓋日常情境的模式,讓您無須假裝去建模協議未定義的行為。

模式產生器寫入的內容使用時機
允許全部User-agent: * 後接 Allow: /預設開放的網站,合規爬蟲可擷取任何內容
選擇性禁止User-agent: * 後接一行 Disallow,對應每個輸入路徑大致開放的網站,但特定區域(草稿、內部搜尋、後台)禁止存取
全部封鎖User-agent: * 後接 Disallow: /暫時離線的網站、預備環境,或完全不應被檢索的佔位頁

接著三種模式都會附加同一行結尾:Sitemap: 後接正規化後的來源加上 /sitemap.xml。若您的實際 sitemap 位於他處,請在上線前編輯該行,因為此工具僅知道來源加上該預設路徑。

產生並檢查您的 robots.txt 檔案

產生器透過三個簡短步驟將政策選擇轉為文字。請將其視為檢查清單,而不是單鍵完成的動作,因為結果管轄的是正式運作的網站,一個打字錯誤可能會悄悄封鎖錯誤的頁面。

  1. 在輸入欄位中輸入網站來源的完整 HTTP 或 HTTPS URL。產生器會將任何頁面路徑、查詢或片段精簡為來源,以免 sitemap 行意外繼承不相關的路由。明確指定的連接埠會被保留。
  2. 選擇整體爬蟲政策。選擇性模式中,每行輸入一個禁止路徑。每條非空白的規則都必須以斜線開頭,完全重複的項目會按其首次輸入的順序移除,清單上限為 50 條規則。井字號會被拒絕,讓使用者輸入的規則不會變成註解;而萬用字元星號與結尾的錢字號則會保留,因為協議將其定義為特殊比對字元。
  3. 產生文字並在輸出面板中檢查。將其與目前的正式檔案進行比較,保留您想留下的任何刻意的、特定於爬蟲的群組,然後下載結果,並在比較完成後才將其以 /robots.txt 發布。

產生輸出的結構

允許全部模式會產生三行:

User-agent: *

Allow: /

Sitemap: https://example.com/sitemap.xml

全部封鎖模式產生相同結構,僅規則不同:

User-agent: *

Disallow: /

Sitemap: https://example.com/sitemap.xml

選擇性模式會寫入相同的 User-agent: * 標頭,接著為每個接受的路徑寫一行 Disallow,最後加上 Sitemap 行。每個區塊皆遵循 RFC 9309 模型:群組以 User-agent 開頭,後接 Allow 或 Disallow 規則。當爬蟲沒有更明確的相符群組時,就會套用萬用字元產品權杖,這也是為什麼此產生器刻意只輸出一個通用群組,而非假裝去管理特定機器人的擴充功能。

路徑比對從 URL 路徑的開頭開始,因此 /draft 代表任何以 /draft 開頭的內容,而 /draft$ 則僅代表該精確路徑。根據RFC 9309,爬蟲會以區分大小寫的方式比對路徑,並採用最明確的相符規則;因此 /Private 與 /private 可能代表不同的意義,Disallow: /draft 也不一定與 Disallow: /draft$ 表達相同的意圖。

在產生器中存活的路徑規則(及其原因)

選擇性模式每行接受一個路徑模式,並在將規則加入輸出前套用一組小型的防護機制。了解這些防護機制可避免那種悄悄封鎖錯誤頁面的錯誤。

  • 前置斜線:每條規則都必須以 / 開頭。Allow 與 Disallow 模式會從第一個八位元組開始比對 URL 路徑,而有效的路徑模式必須以斜線開頭。
  • 萬用字元與錨點:星號與結尾的錢字號會被保留,因為協議將其定義為特殊比對字元。字串中間的星號會逐字保留;只有結尾的 $ 會被視為路徑結尾錨點。
  • 區分大小寫:RFC 9309 指定區分大小寫的比對,因此 /Private 與 /private 是不同的規則。發布前請檢查大小寫。
  • 不允許註解:井字號會將該行其餘內容變成註解,因此產生器會將其拒絕,以免在無形中抹去您的意圖。
  • 去重與上限:完全重複的項目會按其首次出現的順序移除,清單上限為 50 條規則。

若想對規則在實際設定中如何組合有更完整的概念模型,這份建立 robots.txt 檔案的實用指南會逐步講解產生器不打算處理的較長範例。

在正確的來源發布 /robots.txt

產生器所產生的檔案是正確的文字,但前提是它從正確的位置提供服務。根據Google 關於建立 robots.txt 檔案的說明文件,該檔案必須以 /robots.txt 的形式發布於其所管轄之精確 scheme、主機與連接埠的頂層。請使用小寫的檔名,並以 text/plain 形式提供。放在子目錄、其他子網域或不同協議上的檔案,即使內容看似正確,也不會管轄預定的來源。

在上線前快速做一次心智檢查:在正式 URL 後加上 /robots.txt 並開啟,確認回傳的就是新內容。保留一份舊檔以供還原,以防異動封鎖了您無意封鎖的項目。若您的實際 sitemap 位於不同路徑,請在上傳前編輯 Sitemap 行;產生器僅知道來源加上 /sitemap.xml,因此其他內容都必須手動輸入。

發布後的檔案同樣是公開的。每個列出的路徑對於任何請求 /robots.txt 的人都可見,因此請勿將 Disallow 行視為隱藏敏感路由的方式。請改用伺服器端的驗證與授權機制;當您需要比路徑層級禁止更細緻的決策時,請使用頁面層級的索引控制(例如 robots meta 標籤)。

產生器不做的事

產生器刻意維持精簡,這同時也是檔案真正上線前您仍須負責處理的清單。

  • 不會擷取現有的正式檔案。將新文字與目前的正式檔案進行比較是您的責任,而非工具的工作。
  • 不會驗證伺服器回應。檔案是否以 text/plain 在正確的來源提供,需在發布後透過 curl 或瀏覽器請求來確認。
  • 不會將檔案提交至搜尋引擎。重新整理爬蟲快取以及提交更新的 robots.txt 檔案,應在搜尋引擎工具中進行,而不是在產生器中。
  • 不會加入 Crawl-delay。該指令不在 RFC 9309 範圍內,且各爬蟲支援並不統一,因此輸出該指令只是一種猜測,而非保證。
  • 不是存取控制。合規爬蟲可能會遵守請求,但惡意用戶端可以忽略它們;封鎖檢索並不保證 URL 會從搜尋結果中消失。

實際上,這代表產生的 robots.txt 檔案是工作流程的起點,而不是終點。產生文字、與目前的檔案進行比較、視需要編輯 sitemap 行、在精確的來源發布、透過實際請求驗證,並在可用的情況下使用相關的搜尋引擎測試工具測試重要的公開與被封鎖 URL。