跳至主要內容
Lizely

Sitemap URL 提取工具

將貼上的 XML sitemap 或 sitemap index 轉成乾淨、去重、每行一個 URL 的清單,且不會上傳檔案。

隱私權:你的檔案不會離開裝置,所有處理均在瀏覽器本機完成。

使用方式

  1. 1.將一個 urlset 或網站地圖索引文件中的完整 XML 文字貼入編輯器。
  2. 2.提取直接的 loc 值,並檢視根型別、唯一數量、重複數量以及完整輸出。
  3. 3.複製每行一個 URL 的清單,然後根據需要分別執行實際狀態、標準化、robots 與索引檢查。

關於Sitemap URL 提取工具

一個 Sitemap URL 解析器可將 Sitemap XML 轉換為每行一個 URL 的清單。將標準 urlset 或 sitemapindex 文件的內容貼上並執行解析。結果會報告找到的根型別、接受的獨特 數量以及移除的標準化重複項數。會保留首次出現順序,因此輸出仍易於與來源進行比較。複製按鈕會將完整清單複製到剪貼簿,方便爬蟲清單、電子表格匯入、重定向稽核、日誌比較或遷移審查。所有解析動作都在這個瀏覽器中進行,XML 不會上傳。

這個工具識別由網站地圖協議所定義的兩個核心結構. 在 urlset 中,每個 url 輸入必須包含其直接位置小孩. 在 sitemapindex 中,每個網站地圖輸入必須包含其直接位置小孩. 支援一個一致的 namespace 序列,如 sm:urlset, sm:url,和 sm:loc,以及常見的預設 namespace 形式. 忽略了 XML 宣言和評論. 其他可選的小孩,如 lastmod,不會改變取出的位置. 擴充套件位置,如影象:不取代缺失的頁面位置,因為他們描述不同的資源角色.。

XML 文字以保守方式解碼。接受五個內建命名的 XML 實體以及有效的十進位或十六進位數值字元引用。未知實體、無效的 Unicode 基本值、loc 內嵌的標記、DTD 宣告、以及自訂實體宣告會導致提取失敗。拒絕 DTD 有助於維持工具行為簡單且可預測,並防止實體擴充套件變成隱藏的產品邏輯。解析器不會修復錯誤的 XML 或猜測缺失的結束標籤位置。若任一項目或根節點不完整,整個運作將失敗,而不是提供不完整的清單作為完整結果。

每個解碼後的 loc 必須為絕對 HTTP 或 HTTPS URL。瀏覽器標準序列化會將主機名稱轉為小寫並驗證、移除預設埠號,並在必要時對非 ASCII 路徑字元進行百分數編碼。憑證、片段、原始空白字元、格式錯誤的百分數轉義、反斜線、相對路徑及其他協議均被拒絕。每個序列化的 URL 必須包含少於 2,048 個字元,並符合協議的 loc 約束。序列化後值相同的 視為重複,僅返回第一個。瀏覽器工具最多接受 50,000 個獨特 與五百萬 UTF-16 個輸入字元。超過任一限制均會失敗且不進行截斷。

sitemap 索引是 sitemap 檔案的目錄,而不是遞迴封裝。此工具會擷取索引中直接列出的 sitemap 檔案位置,但不會擷取那些檔案或展開其中的頁面網址。同樣地,把遠端 URL 貼到編輯器中也不會下載任何內容;請改為貼上 XML 文字。壓縮的 .gz 資料必須先在工具外解壓縮。解析器不會檢查 HTTP 狀態、重新導向、canonical 標籤、robots 指令、noindex 指令、頁面內容、擁有權、sitemap 放置位置、磁碟上的 UTF-8 位元組,或搜尋引擎是否接受來源檔案;這些都屬於另外的線上網站檢查。

將輸出作為大型審計的證據,而非作為索引的證明。與資料庫中的標準 URL、爬蟲結果、分析著陸頁或先前版本進行對比。意外的重複可能揭示預設埠或主機大小寫變體。解析錯誤會針對特定編號的 loc 或項目明確指出,以便來源可被修正,而不是靜默跳過。若生產環境的 sitemap 接近協議限制,請驗證實際解壓縮後的位元組大小,並考慮將其拆分成較小的檔案,並由 sitemap index 參考。

Sitemaps 協議與 Google 檔案說明將 sitemaps 認為是發現提示,而非索引保證。提取一個 URL 只確認該路徑曾出現在貼入的結構中,並透過此工具公開的驗證。這不代表該 URL 可爬取、為標準、有價值、已被索引或排名。使用清單後,應分別檢視實際的 sitemap 響應與相關頁面。由於此工具為瀏覽器端,私密的測試環境或預發布 URL 應用清單將留在裝置上,除非使用者將其複製至其他位置。

方法與來源

移除開頭的字元順序標記(Byte Order Mark)、XML宣告與註解;拒絕DTD或自訂實體宣告。要求封閉的urlset/url/loc或sitemapindex/sitemap/loc結構,且需有一致的選用名稱空間字首。僅解碼五種預定義的XML實體與有效十進位或十六進位Unicode純量參考。拒絕巢狀loc標記、未知實體、缺少loc子節點、項目不完整或結構錯誤的根節點。使用瀏覽器WHATWG URL實作解析每個解碼值;僅接受絕對HTTP/HTTPS網址,且長度不得超過2,048字元,不得包含憑證、片段、原始空白字元、格式錯誤的百分數轉義或反斜線。按首次出現順序去重序列化的href值。強制50,000唯一網址與五百萬UTF-16輸入字元,若不符合則整個操作失敗,而非直接截斷。

常見問題

這個工具會從 URL 下載網站地圖嗎?
不會。請將 XML 文字貼入編輯器。此工具不會發出網路請求,也不會下載、解壓縮或追蹤 sitemap 檔案。
sitemaps index 會擴充套件為所有頁面 URL 嗎?
不會。對於 sitemapindex 輸入,結果僅包含直接的 sitemap 檔案路徑。每個子檔必須分別取得並檢視。
提取的 URL 代表該頁面已被索引嗎?
不會。提取僅確認該有效 loc 出現在貼入的 XML 中。它並未測試可爬取性、標準選擇、索引、排名或頁面狀態。

SEO 與網站管理 使用指南

查看全部