要從 sitemap 免費且無需註冊地擷取網址,最簡單的方式就是把原始 XML 貼到像 Sitemap URL Extractor 這種純瀏覽器工具,然後複製出一份去重複、一行一筆網址的清單——不需要帳號、不需要上傳、不需要電子郵件。在這個情境中,「免費、無需註冊」其實代表三件具體的事:這項工具不要求註冊、不會把你的 sitemap XML 傳送到任何伺服器、也不會在你關閉分頁後默默保留副本。所有解析都在你瀏覽器的 JavaScript 引擎中進行,使用嚴格的 XML 讀取器和瀏覽器內建的網址解析器(該解析器由 WHATWG URL Standard 定義)。你只需要以文字形式提供 XML——可以從文字編輯器開啟已儲存的 sitemap.xml 檔案並複製內容,也可以用瀏覽器在線上 sitemap 網址上執行「檢視原始碼」——接著工具就會把它轉成一份乾淨的絕對 HTTP 與 HTTPS 網址清單,讓你貼到試算表、爬蟲檢查清單或重新導向稽核中。由於資料不會離開你的裝置,這種做法特別適合測試環境網站、上線前的網址盤點,以及不便把 sitemap 上傳到第三方服務的私人客戶專案。

「免費、無需註冊」在 Sitemap 擷取中真正的意義
當有人在搜尋「extract urls from sitemap free no sign up」時,他們其實一次問了三層問題:要花錢嗎?一定要建立帳號嗎?以及——越來越常被提到的——我的 sitemap 會不會離開我的電腦。一個值得信賴的純瀏覽器 sitemap 工具會用同一個架構選擇同時回答這三個問題:解析器以 JavaScript 在本機執行,搭配嚴格的 XML 讀取器和瀏覽器的 WHATWG URL 實作,而這個頁面唯一會發出的網路請求,就是當初載入這個頁面本身的那一次。
這件事很重要,因為 XML sitemap 經常包含一些你不希望外流的網址——測試子網域、草稿 slug、內部重新導向、僅限合作夥伴的登陸頁,以及客戶的上線前網址盤點。一個要求你把 sitemap 貼到第三方網域上網頁表單的工具,等於已經把它上傳了。一個在你瀏覽器裡解析同一份 XML 的工具,則能在不產生這種風險的情況下產出相同的清單。因此,「無需註冊」的承諾與「不上傳」緊密相連,而在這個類別中,「免費」的承諾通常指的是「不需要 API 金鑰、沒有計量、沒有每月額度」,而不是指在輸出內容中暗藏廣告或聯盟行銷連結。
對 SEO 稽核來說,這種純本機的做法也消除了常見的摩擦來源。你不需要把 XML 分享給廠商、不需要安排私密展示,也不需要說明為什麼一個好幾 MB 的壓縮檔應該被允許通過上傳表單。你只要開啟工具、貼上你已有的 XML,然後帶著一份存在剪貼簿裡的純文字清單離開。
免費擷取 Sitemap 網址且無需註冊:操作流程
整個端對端的工作小到可以塞在一個畫面內,前提是你手上已經有 sitemap XML 的文字內容——例如從 CMS 儲存 sitemap.xml、從爬蟲匯出,或從線上 sitemap.xml 網址複製原始回應。
- 開啟 Sitemap URL Extractor。這個頁面本身就是工具,不需要安裝、不需要擴充功能、不需要註冊表單,也不需要申請 API 金鑰。
- 把一份 urlset 或 sitemapindex 文件的完整 XML 文字貼到編輯器中。貼上整份文件,若有 XML 宣告也要一併包含。不要只貼網址——這個小工具不會發出網路請求,也不會代替你去擷取 sitemap 檔案。如果檔案是壓縮的(.gz),請先用其他工具解壓縮;解析器不接受壓縮位元組。
- 執行擷取。解析器會先移除位元組順序標記、XML 宣告和註解,接著逐一走訪各個 <url>(在 urlset 內)或各個 <sitemap>(在 sitemapindex 內)的直接子元素 <loc>。除了預設命名空間的寫法之外,也支援像 sm:urlset、sm:url、sm:loc 這類一致的命名空間前綴。
- 檢視報表。工具會告訴你偵測到的根元素類型、接受了多少筆唯一網址,以及移除了多少筆正規化後的重複項目。如果任何單一的 loc、項目或根元素不完整,也會把這次執行標示為失敗。
- 複製去重複後、一行一筆網址的清單。輸出會保留首次出現的順序,因此結果會忠實反映你的來源。這個清單可以直接當作爬蟲檢查表、試算表匯入、重新導向稽核輸入或遷移基準線。
- 另外分別執行線上網站檢查。擷取只能證明某個 loc 有出現在你貼上的 XML 中,無法證明該頁面可連線、為規範網址、被 robots 允許,或已被索引。這些都是要對每個網址另外執行的線上檢查。
輸出能告訴你什麼——根元素類型、計數與順序
結果面板刻意設計得很精簡。每次成功的執行你應該會看到四項實用資訊:偵測到的根元素類型(urlset 或 sitemapindex)、接受的唯一網址數、移除的重複數,以及依照首次出現順序排列的完整網址清單。這一小組數字通常就足以在不手動閱讀 XML 的情況下看出明顯的問題。
urlset 根元素是標準的頁面層級 sitemap。每個 <url> 項目包含它的直接子元素 <loc>,擷取器回傳的就是這個 loc。選用的子元素——lastmod、changefreq、priority,以及圖片或新聞相關的擴充——雖然會被解析,但不會改變擷取出的位置。如果你在某個 <url> 項目中看到像 image:loc 這種擴充,卻沒有一般的 <loc>,該項目會因為不完整而被拒絕,因為圖片位置描述的是不同的資源角色,無法替代頁面本身。
sitemapindex 根元素是 sitemap 檔案的目錄,而不是遞迴的整包內容。擷取器只會回傳直接的 <sitemap><loc> 值——也就是子 sitemap 檔案的網址——然後停止。如果你要的是底下的頁面網址,必須另外取得並貼上每個子檔案。把索引清單和你的 CMS 實際發佈的內容交叉比對,是最快找出遺漏或孤兒子 sitemap 的方法之一。
去重複是在網址序列化之後進行的,所以兩個只在預設連接埠或主機大小寫上有差異的 loc 值會合併成一筆,並以首次出現的那筆為準。這是刻意的設計:它能把意外產生的變體(例如 https://Example.com 對上 https://example.com)凸顯出來,而不是讓它們藏在一長串清單裡。
貼上之前要先納入考量的硬性限制
兩個互相影響的界線決定了一次執行會完成還是失敗:解析器每次貼上最多接受 50,000 筆唯一網址,以及五百萬個 UTF-16 輸入碼元。超過任何一個界線都會讓整次執行失敗,而不是截斷。在實務上,這對兩種情況很重要——逼近通訊協定本身每檔 50,000 筆網址上限的大型電商或出版商 sitemap,以及未壓縮 XML 達到數 MB 的長期內容網站。
幾個相關的通訊協定層級限制也適用於每個網址。每個解碼後的 loc 必須是序列化後少於 2,048 字元的絕對 HTTP 或 HTTPS 網址,符合 Sitemap 通訊協定的 loc 限制。具備認證資訊、含有片段、含有原始空白字元、百分比編碼錯誤、反斜線,以及非 HTTP 協定的都會被拒絕。如果你的正式環境 sitemap 已逼近這些通訊協定限制,請驗證實際未壓縮的位元組大小,並考慮把它拆成較小的檔案,再以 sitemap 索引互相連結——這正是擷取器本來就理解的那種結構。
壓縮輸入無法處理。sitemap.xml.gz 檔案必須在貼上 XML 之前於工具之外解壓縮;解析器不會去擷取、解壓縮或跟隨 sitemap 檔案。同樣地,把遠端網址貼到編輯器中並不會觸發下載——請改貼 XML 文字。這些限制的存在,是為了讓解析器的行為保持精簡、可預測且容易理解。
為什麼擷取出的網址不等於已索引的網址
擷取只能確認某個有效的 loc 有出現在你貼上的 XML 中,並通過工具已揭露的驗證。它並不代表該頁面可被爬取、是規範網址、具有價值、已被索引或有排名。Google 自己的說明文件把 sitemap 描述為「探索提示」,而不是索引保證;同樣的但書也適用於所有其他會讀取 sitemap 檔案的搜尋引擎。
拿到清單之後,請把它當成更大規模稽核中的一項證據。把它和從資料庫取得的規範網址、爬取結果、分析資料中的登陸頁,以及前一版的 sitemap 進行比對。預期之外的重複可能揭示長期在兩個不同主機名之下被悄悄索引的預設連接埠或主機大小寫變體。冗長的 404 清單可能揭露出從未重新指位的重新導向。遺漏的網址可能揭露從未被加進 sitemap 的全新區塊。這些訊號都不會在 XML 本身中顯現;它們只有在把擷取出的清單和另一個真相來源比對時才會浮現。
當解析器拒絕你的 XML 時
解析器刻意採取保守做法。它只接受符合 Sitemap 通訊協定兩種核心結構、格式良好的 XML,只解碼五個預先定義的 XML 實體與有效的數字字元參照,並拒絕巢狀標記、未知實體、DTD 宣告與自訂實體宣告。特別是拒絕 DTD,能讓工具的行為保持精簡、可預測,並防止實體擴張變成隱藏的產品邏輯。解析器不會去修補格式錯誤的 XML,也不會猜測缺少的結尾標記應該放在哪裡——如果某個項目或根元素不完整,整次執行就會失敗,而不是把一份不完整的清單當成完整的結果呈現。
錯誤訊息刻意對應到特定的編號 loc 或項目,以便修正來源而不是被悄悄略過。
| 貼上的根元素類型 | 擷取器回傳的內容 | 你仍然需要另外做的事 |
|---|---|---|
| urlset | <url> 項目內 <loc> 子元素中的所有頁面網址 | 對每個網址分別檢查線上 HTTP 狀態、規範標記、robots 指令、索引狀態 |
| sitemapindex | <sitemap> 項目中 <loc> 子元素內的直接子 sitemap 檔案網址 | 另外取得並貼上每個子檔案,才能取得底下的頁面網址 |
| sitemap.xml.gz | 不接受——必須先解壓縮 | 於工具之外解壓縮 gzip 檔案,再貼上 XML |
| 一次貼上多份文件 | 不會解析——每次執行只處理一份文件 | 依序貼上每份文件並比對清單 |
若想更深入了解解析規則,Extract URLs From a Sitemap: Rules, Limits, and Output 這篇指南以不同角度說明同樣的限制,而 Extract URLs From a Sitemap: The Parsing Step Explained 則展示解析器每一步在做什麼。若要把擷取出的清單與實際線上行為交叉比對,請參考 Google 官方關於建立與提交 sitemap的說明文件。