跳至主要內容
Lizely

Robots.txt 產生器

在不將配置資料傳送至伺服器的情況下,為單一網站產生符合標準的 robots.txt 檔案。

隱私權:你的檔案不會離開裝置,所有處理均在瀏覽器本機完成。

使用方式

  1. 1.輸入網站來源的完整 HTTP 或 HTTPS URL。
  2. 2.選擇整體爬蟲策略,並在選擇性模式下,每行輸入一個禁止的路徑。
  3. 3.產生並檢視文字內容,僅在與當前生產檔對比無誤後,才發布為 /robots.txt。

關於Robots.txt 產生器

Robots.txt Generator 為網站完全在瀏覽器中建立一個小的爬蟲指示檔案.輸入HTTP或HTTPS網站URL,選擇適合的爬蟲類是否可以訪問一切,應該避免選定的路徑,或應該避免整個網站,並產生純的UTF-8文字.輸出包括一個野生卡使用者代理群和來自網站起源的URL網站地圖.。

產生器遵循 RFC 9309 規範中的群組與規則模型。群組以 User-agent 開始,後接 Allow 或 Disallow 規則。當爬蟲無更精確的匹配群組時,會使用萬用字元產品標記。此專注工具刻意僅產生一個一般性群組,而非假裝能處理各搜尋引擎的私人擴充套件。

選擇模式支援每行輸入一個路徑模式。每條非空規則必須以斜線開頭,重複專案將依首次出現順序移除,且列表限制為 50 個規則。萬用字元星號與尾部美元號會被保留,因為協議明確定義這些特殊匹配字元。井號將被拒絕,以避免誤將使用者輸入的規則片段當作註解。

規則匹配從 URL 路徑的起始處開始。RFC 9309 指出爬蟲應區分大小寫比較路徑,並使用最符合的匹配規則。因此,/Private 和 /private 可能代表不同意思,Disallow: /draft 並不一定與 Disallow: /draft$ 表達相同意圖。在釋出前請檢查大小寫、字首、萬用字元與錨點。

允許所有模式寫入 Allow: /. 阻止所有模式寫入 Disallow: /. 選擇性模式則為每個請求的 Disallow 行寫入。工具隨後會新增 Sitemap:,後接標準化後的來源與 /sitemap.xml。包含網頁路徑、查詢或片段的 URL 會被簡化為來源,以避免預設網站地圖意外繼承不相關的路徑。明確的埠號會被保留。

輸出必須以 /robots.txt 檔案形式釋出,並位於其管理的確切協議、主機和埠的頂層。使用小寫檔名,並以 text/plain 型別提供。子目錄、另一個子域名或不同協議的檔案,並不會管理預期的來源。若你的網站地圖位於其他位置,請在釋出前編輯產生的這一行。

Robots.txt 並不是認證、授權、加密或隱私控制。RFC 9309 明確指出這些規則並不是存取授權。符合規範的爬蟲可能會遵守這些請求,但惡意客戶端可以忽略它們,且每個列出的路徑都是公開可見的。請勿將敏感路徑列為取代登入檢查或伺服器端存取控制的替代方案。

封鎖爬蟲並不能保證該 URL 會從搜尋結果中消失。搜尋引擎可能透過連結發現該 URL,並僅保留有限資訊而不實際抓取被封鎖的頁面。請根據實際目標使用適當的頁面索引控制、HTTP 標頭、移除流程或驗證機制。請勿在不瞭解各爬蟲處理方式的情況下混合使用指令。

生成器不會加入 Crawl-delay,因為這並非 RFC 9309 的標準規範,也非所有爬蟲普遍支援。它不會抓取現有實時檔案、驗證伺服器回應、提交檔案至搜尋引擎,或確認爬蟲已更新其快取。這些動作需要對部署網站及搜尋引擎工具的直接存取。

在取代生產環境檔案前,請先下載結果,與當前檔案進行對比,保留任何有意的爬蟲專用群組,並使用相關的搜尋引擎測試工具驗證重要公開與被封鎖的 URL。請保留舊檔以備回滾。所有輸入的路徑與產生的內容皆會保留在當前標籤中。

方法與來源

將無憑證的 HTTP(S) URL 正規化為其原始來源;在選擇性模式下,需包含 1 至 50 的唯一斜線字首路徑;保留 RFC 定義的萬用字元與路徑末端定點字元;拒絕控制字元與註解;輸出一個 User-agent: * 組,包含 Allow: /、Disallow: / 或所選的 Disallow 路徑;追加一個相對於原始來源的 sitemap URL;並在本機產生 UTF-8 普通文字檔。公開最長匹配、大小寫敏感性、作用範圍,以及無任何存取控制保證。

常見問題

robots.txt 能保護私人頁面嗎?
不可以。這是一種公開的爬蟲請求,並非訪問控制機制;私人內容必須透過伺服器端的驗證與授權來保護。
為何每條路徑都必須以斜線開頭?
Allow 和 Disallow 模式會從第一個八位元開始匹配 URL 路徑,且有效的路徑模式必須以 / 開頭。
封鎖一個 URL 會讓它從搜尋結果中消失嗎?
不一定。爬取與索引是兩個獨立的過程,因此請針對不同目標使用適當的索引或移除控制機制。
為何沒有包含 Crawl-delay?
這並非標準化 RFC 9309 的規範,也非所有爬蟲一致支援。

SEO 與網站管理 使用指南

查看全部