Robots.txt 產生器
在不將配置資料傳送至伺服器的情況下,為單一網站產生符合標準的 robots.txt 檔案。
隱私權:你的檔案不會離開裝置,所有處理均在瀏覽器本機完成。
使用方式
- 1.輸入網站來源的完整 HTTP 或 HTTPS URL。
- 2.選擇整體爬蟲策略,並在選擇性模式下,每行輸入一個禁止的路徑。
- 3.產生並檢視文字內容,僅在與當前生產檔對比無誤後,才發布為 /robots.txt。
關於Robots.txt 產生器
Robots.txt Generator 為網站完全在瀏覽器中建立一個小的爬蟲指示檔案.輸入HTTP或HTTPS網站URL,選擇適合的爬蟲類是否可以訪問一切,應該避免選定的路徑,或應該避免整個網站,並產生純的UTF-8文字.輸出包括一個野生卡使用者代理群和來自網站起源的URL網站地圖.。
產生器遵循 RFC 9309 規範中的群組與規則模型。群組以 User-agent 開始,後接 Allow 或 Disallow 規則。當爬蟲無更精確的匹配群組時,會使用萬用字元產品標記。此專注工具刻意僅產生一個一般性群組,而非假裝能處理各搜尋引擎的私人擴充套件。
選擇模式支援每行輸入一個路徑模式。每條非空規則必須以斜線開頭,重複專案將依首次出現順序移除,且列表限制為 50 個規則。萬用字元星號與尾部美元號會被保留,因為協議明確定義這些特殊匹配字元。井號將被拒絕,以避免誤將使用者輸入的規則片段當作註解。
規則匹配從 URL 路徑的起始處開始。RFC 9309 指出爬蟲應區分大小寫比較路徑,並使用最符合的匹配規則。因此,/Private 和 /private 可能代表不同意思,Disallow: /draft 並不一定與 Disallow: /draft$ 表達相同意圖。在釋出前請檢查大小寫、字首、萬用字元與錨點。
允許所有模式寫入 Allow: /. 阻止所有模式寫入 Disallow: /. 選擇性模式則為每個請求的 Disallow 行寫入。工具隨後會新增 Sitemap:,後接標準化後的來源與 /sitemap.xml。包含網頁路徑、查詢或片段的 URL 會被簡化為來源,以避免預設網站地圖意外繼承不相關的路徑。明確的埠號會被保留。
輸出必須以 /robots.txt 檔案形式釋出,並位於其管理的確切協議、主機和埠的頂層。使用小寫檔名,並以 text/plain 型別提供。子目錄、另一個子域名或不同協議的檔案,並不會管理預期的來源。若你的網站地圖位於其他位置,請在釋出前編輯產生的這一行。
Robots.txt 並不是認證、授權、加密或隱私控制。RFC 9309 明確指出這些規則並不是存取授權。符合規範的爬蟲可能會遵守這些請求,但惡意客戶端可以忽略它們,且每個列出的路徑都是公開可見的。請勿將敏感路徑列為取代登入檢查或伺服器端存取控制的替代方案。
封鎖爬蟲並不能保證該 URL 會從搜尋結果中消失。搜尋引擎可能透過連結發現該 URL,並僅保留有限資訊而不實際抓取被封鎖的頁面。請根據實際目標使用適當的頁面索引控制、HTTP 標頭、移除流程或驗證機制。請勿在不瞭解各爬蟲處理方式的情況下混合使用指令。
生成器不會加入 Crawl-delay,因為這並非 RFC 9309 的標準規範,也非所有爬蟲普遍支援。它不會抓取現有實時檔案、驗證伺服器回應、提交檔案至搜尋引擎,或確認爬蟲已更新其快取。這些動作需要對部署網站及搜尋引擎工具的直接存取。
在取代生產環境檔案前,請先下載結果,與當前檔案進行對比,保留任何有意的爬蟲專用群組,並使用相關的搜尋引擎測試工具驗證重要公開與被封鎖的 URL。請保留舊檔以備回滾。所有輸入的路徑與產生的內容皆會保留在當前標籤中。
方法與來源
將無憑證的 HTTP(S) URL 正規化為其原始來源;在選擇性模式下,需包含 1 至 50 的唯一斜線字首路徑;保留 RFC 定義的萬用字元與路徑末端定點字元;拒絕控制字元與註解;輸出一個 User-agent: * 組,包含 Allow: /、Disallow: / 或所選的 Disallow 路徑;追加一個相對於原始來源的 sitemap URL;並在本機產生 UTF-8 普通文字檔。公開最長匹配、大小寫敏感性、作用範圍,以及無任何存取控制保證。
常見問題
- robots.txt 能保護私人頁面嗎?
- 不可以。這是一種公開的爬蟲請求,並非訪問控制機制;私人內容必須透過伺服器端的驗證與授權來保護。
- 為何每條路徑都必須以斜線開頭?
- Allow 和 Disallow 模式會從第一個八位元開始匹配 URL 路徑,且有效的路徑模式必須以 / 開頭。
- 封鎖一個 URL 會讓它從搜尋結果中消失嗎?
- 不一定。爬取與索引是兩個獨立的過程,因此請針對不同目標使用適當的索引或移除控制機制。
- 為何沒有包含 Crawl-delay?
- 這並非標準化 RFC 9309 的規範,也非所有爬蟲一致支援。
相關工具
- XML 檔案圖譜產生器將已審核的頁面 URL 清單轉換為符合標準的 XML 檔案圖譜,無需爬取或上傳網站。
- Schema Markup 生成器根據頁面中可見的資訊,產生 WebSite、文章或組織型別的 escaped JSON-LD script 模板。
- UTM 連結建造器使用瀏覽器內建的五個傳統 UTM 引數,打造乾淨的活動連結,全程在瀏覽器中完成。
- 關鍵字密度檢查器計算 Unicode 個字元與可選的精確片語,並檢視透明的密度百分比,不作排序保證。
- ads.txt 產生器以明確授權賣方資料建立符合標準形狀的 ads.txt,包含嚴格欄位驗證、重複防護與可直接下載的檔案。
- AI Bot Robots.txt 檢測器在你的瀏覽器中,將一個 robots.txt 檔案對照 32 AI 與 AI 相關爬蟲產品字元,並符合 RFC 9309 的匹配規則,完全進行分析。
SEO 與網站管理 使用指南
查看全部- Best robots.txt File for WordPress: A Safe Setup (英文原文)
- How to Get a Robots.txt File: Retrieve or Generate One (英文原文)
- How to Get a Robots.txt File for Your Website (英文原文)
- How to Generate Robots.txt in WordPress Without a Plugin (英文原文)
- How to Create a Robots.txt File in WordPress (英文原文)
- How to Create a Robots.txt File in Shopify (英文原文)
- How to Create a Robots.txt File: A Practical Guide (英文原文)
- Keyword Density Checker API Alternative Without Uploads (英文原文)
- JOIN Keyword Lists Like SQL Tables: Build Every Pair (英文原文)
- Compare Approaches to Measure HTML Page Weight with an Analyzer (英文原文)
- Hreflang Generator Explained: What It Builds and Why (英文原文)
- Email Obfuscator Bulk: Safe Workflow for Many Addresses (英文原文)
- Canonical Tag Generator Explained: How It Works (英文原文)
- SERP Snippet Preview Tool: Command Line vs Online Compared (英文原文)
- Bulk URL Generator for Large Text: Up to 10,000 URLs (英文原文)
- Bulk QR Code Generator API Alternative: Up to 20 PNGs (英文原文)
- Barcode Generator API Alternative: Skip the Server Calls (英文原文)
- How to Verify Results From an AI Bot Robots.txt Check (英文原文)
- Ads.txt Generator Alternative With Strict Validation (英文原文)
- Create UTM Links in Shopify for Accurate Campaign Tracking (英文原文)