Sitemap URL 提取工具
將貼上的 XML sitemap 或 sitemap index 轉成乾淨、去重、每行一個 URL 的清單,且不會上傳檔案。
隱私權:你的檔案不會離開裝置,所有處理均在瀏覽器本機完成。
使用方式
- 1.將一個 urlset 或網站地圖索引文件中的完整 XML 文字貼入編輯器。
- 2.提取直接的 loc 值,並檢視根型別、唯一數量、重複數量以及完整輸出。
- 3.複製每行一個 URL 的清單,然後根據需要分別執行實際狀態、標準化、robots 與索引檢查。
關於Sitemap URL 提取工具
一個 Sitemap URL 解析器可將 Sitemap XML 轉換為每行一個 URL 的清單。將標準 urlset 或 sitemapindex 文件的內容貼上並執行解析。結果會報告找到的根型別、接受的獨特 數量以及移除的標準化重複項數。會保留首次出現順序,因此輸出仍易於與來源進行比較。複製按鈕會將完整清單複製到剪貼簿,方便爬蟲清單、電子表格匯入、重定向稽核、日誌比較或遷移審查。所有解析動作都在這個瀏覽器中進行,XML 不會上傳。
這個工具識別由網站地圖協議所定義的兩個核心結構. 在 urlset 中,每個 url 輸入必須包含其直接位置小孩. 在 sitemapindex 中,每個網站地圖輸入必須包含其直接位置小孩. 支援一個一致的 namespace 序列,如 sm:urlset, sm:url,和 sm:loc,以及常見的預設 namespace 形式. 忽略了 XML 宣言和評論. 其他可選的小孩,如 lastmod,不會改變取出的位置. 擴充套件位置,如影象:不取代缺失的頁面位置,因為他們描述不同的資源角色.。
XML 文字以保守方式解碼。接受五個內建命名的 XML 實體以及有效的十進位或十六進位數值字元引用。未知實體、無效的 Unicode 基本值、loc 內嵌的標記、DTD 宣告、以及自訂實體宣告會導致提取失敗。拒絕 DTD 有助於維持工具行為簡單且可預測,並防止實體擴充套件變成隱藏的產品邏輯。解析器不會修復錯誤的 XML 或猜測缺失的結束標籤位置。若任一項目或根節點不完整,整個運作將失敗,而不是提供不完整的清單作為完整結果。
每個解碼後的 loc 必須為絕對 HTTP 或 HTTPS URL。瀏覽器標準序列化會將主機名稱轉為小寫並驗證、移除預設埠號,並在必要時對非 ASCII 路徑字元進行百分數編碼。憑證、片段、原始空白字元、格式錯誤的百分數轉義、反斜線、相對路徑及其他協議均被拒絕。每個序列化的 URL 必須包含少於 2,048 個字元,並符合協議的 loc 約束。序列化後值相同的 視為重複,僅返回第一個。瀏覽器工具最多接受 50,000 個獨特 與五百萬 UTF-16 個輸入字元。超過任一限制均會失敗且不進行截斷。
sitemap 索引是 sitemap 檔案的目錄,而不是遞迴封裝。此工具會擷取索引中直接列出的 sitemap 檔案位置,但不會擷取那些檔案或展開其中的頁面網址。同樣地,把遠端 URL 貼到編輯器中也不會下載任何內容;請改為貼上 XML 文字。壓縮的 .gz 資料必須先在工具外解壓縮。解析器不會檢查 HTTP 狀態、重新導向、canonical 標籤、robots 指令、noindex 指令、頁面內容、擁有權、sitemap 放置位置、磁碟上的 UTF-8 位元組,或搜尋引擎是否接受來源檔案;這些都屬於另外的線上網站檢查。
將輸出作為大型審計的證據,而非作為索引的證明。與資料庫中的標準 URL、爬蟲結果、分析著陸頁或先前版本進行對比。意外的重複可能揭示預設埠或主機大小寫變體。解析錯誤會針對特定編號的 loc 或項目明確指出,以便來源可被修正,而不是靜默跳過。若生產環境的 sitemap 接近協議限制,請驗證實際解壓縮後的位元組大小,並考慮將其拆分成較小的檔案,並由 sitemap index 參考。
Sitemaps 協議與 Google 檔案說明將 sitemaps 認為是發現提示,而非索引保證。提取一個 URL 只確認該路徑曾出現在貼入的結構中,並透過此工具公開的驗證。這不代表該 URL 可爬取、為標準、有價值、已被索引或排名。使用清單後,應分別檢視實際的 sitemap 響應與相關頁面。由於此工具為瀏覽器端,私密的測試環境或預發布 URL 應用清單將留在裝置上,除非使用者將其複製至其他位置。
方法與來源
移除開頭的字元順序標記(Byte Order Mark)、XML宣告與註解;拒絕DTD或自訂實體宣告。要求封閉的urlset/url/loc或sitemapindex/sitemap/loc結構,且需有一致的選用名稱空間字首。僅解碼五種預定義的XML實體與有效十進位或十六進位Unicode純量參考。拒絕巢狀loc標記、未知實體、缺少loc子節點、項目不完整或結構錯誤的根節點。使用瀏覽器WHATWG URL實作解析每個解碼值;僅接受絕對HTTP/HTTPS網址,且長度不得超過2,048字元,不得包含憑證、片段、原始空白字元、格式錯誤的百分數轉義或反斜線。按首次出現順序去重序列化的href值。強制50,000唯一網址與五百萬UTF-16輸入字元,若不符合則整個操作失敗,而非直接截斷。
常見問題
- 這個工具會從 URL 下載網站地圖嗎?
- 不會。請將 XML 文字貼入編輯器。此工具不會發出網路請求,也不會下載、解壓縮或追蹤 sitemap 檔案。
- sitemaps index 會擴充套件為所有頁面 URL 嗎?
- 不會。對於 sitemapindex 輸入,結果僅包含直接的 sitemap 檔案路徑。每個子檔必須分別取得並檢視。
- 提取的 URL 代表該頁面已被索引嗎?
- 不會。提取僅確認該有效 loc 出現在貼入的 XML 中。它並未測試可爬取性、標準選擇、索引、排名或頁面狀態。
相關工具
- XML 檔案圖譜產生器將已審核的頁面 URL 清單轉換為符合標準的 XML 檔案圖譜,無需爬取或上傳網站。
- XML 格式化工具在瀏覽器中立即美化或壓縮 XML —— 不會上傳任何內容。
- 連結提取器從貼上的 HTML 中提取獨特的 href 值,針對可選的基礎 URL 解析相對路徑,並在未請求任何目的地的情況下忽略可執行方案。
- 字元標籤產生器將你偏好的絕對 HTTP 或 HTTPS URL 轉換為 HTML-轉義的 rel=canonical 連結元素,並依照瀏覽器標準進行正常化與片段移除。
- ads.txt 產生器以明確授權賣方資料建立符合標準形狀的 ads.txt,包含嚴格欄位驗證、重複防護與可直接下載的檔案。
- AI Bot Robots.txt 檢測器在你的瀏覽器中,將一個 robots.txt 檔案對照 32 AI 與 AI 相關爬蟲產品字元,並符合 RFC 9309 的匹配規則,完全進行分析。
SEO 與網站管理 使用指南
查看全部- Extract Links From a Sitemap for Audits and Migrations (英文原文)
- Extract All URLs From a Sitemap Into a Clean List (英文原文)
- How to Get a Website Sitemap XML as Plain Text (英文原文)
- How to Find Sitemap URLs in Your Browser (英文原文)
- How to Extract URLs From an XML Sitemap in Your Browser (英文原文)
- How to Extract Every URL From a Website Sitemap (英文原文)
- Keyword Density Checker API Alternative Without Uploads (英文原文)
- JOIN Keyword Lists Like SQL Tables: Build Every Pair (英文原文)
- Compare Approaches to Measure HTML Page Weight with an Analyzer (英文原文)
- Hreflang Generator Explained: What It Builds and Why (英文原文)
- Email Obfuscator Bulk: Safe Workflow for Many Addresses (英文原文)
- Canonical Tag Generator Explained: How It Works (英文原文)
- SERP Snippet Preview Tool: Command Line vs Online Compared (英文原文)
- Bulk URL Generator for Large Text: Up to 10,000 URLs (英文原文)
- Bulk QR Code Generator API Alternative: Up to 20 PNGs (英文原文)
- Barcode Generator API Alternative: Skip the Server Calls (英文原文)
- How to Verify Results From an AI Bot Robots.txt Check (英文原文)
- Ads.txt Generator Alternative With Strict Validation (英文原文)
- Create UTM Links in Shopify for Accurate Campaign Tracking (英文原文)
- How to Read JSON-LD Checker Results After Extraction (英文原文)