.docx Word 檔案會將每個外部 URL 以 Office Open XML 超連結關聯的形式儲存在其封裝內,這表示完整的 URL 清單可以從單一內部 XML 檔讀取,而不必從可見的頁面中擷取。若要從 Word 檔案中取得所有 URL,請在瀏覽器中開啟 Word Hyperlink Extractor,從您的裝置中選擇 .docx 檔案,該工具會在本機讀取該關聯檔案,並回傳一份整齊的 http、https 與 mailto 目的地清單。輸出為一份純文字報告,每行一個 URL,可以下載、貼入試算表,或交給同事進行審閱。由於關聯檔案是每個連結指向位置的唯一權威來源,因此產生的清單不依賴從可見文字猜測 URL,也不必捲動格式化的段落。該工具刻意只回傳安全的外部網頁與電子郵件目的地,因此內部標題、書籤、本機檔案路徑與相對目標在報告顯示前就會被過濾掉。整個過程中不會有任何資料離開您的電腦,擷取器也不會造訪、解析、重新導向或評分任何它回傳的目的地。

how to get word url
how to get word url

Word 檔案中什麼算是 URL

Word 可以顯示許多看起來像連結的物件,但其中只有一部分在嚴格意義上是外部 URL。Office Open XML 格式將 .docx 封裝描述為一個 ZIP 壓縮檔,其中包含文件主體、樣式、設定與關聯等獨立的 XML 檔。外部 URL 會記錄在一個名為 word/_rels/document.xml.rels 的專屬檔案中,每個關聯都帶有 Type、Id 與 Target。Hyperlinks 是用於外部 URL 的關聯類型,而 TargetMode 會設定為 External,以便與內部參照區分開來。

這個結構很重要,因為 Word 也能顯示其他完全不是外部 URL 的可點擊物件:

  • 書籤與內部交叉參照位於同一個關聯檔案中,但其 TargetMode 為 Internal,因此它們只指向同一份文件的其他部分。
  • 由 Word 書目管理工具管理的引文會儲存在獨立的 XML 部件中,並非超連結關聯。
  • 按鈕、形狀與內嵌物件可以透過不同的 XML 元素擁有自己的點擊行為,也不是關聯。
  • 諸如 HYPERLINK、INCLUDEPICTURE 或 MERGEFIELD 等欄位可以呈現看起來像 URL 的可見文字,但會以欄位指令而非關聯的形式儲存。
  • 僅僅看起來像 URL 的純文字(例如以「https://example.com」撰寫、但本身並非超連結的註腳)根本不會出現在關聯檔案中。

精確的 URL 擷取器會直接針對關聯檔案運作,這表示它只會回傳 Word 本身視為外部超連結的內容。它不需要算繪文件、執行其欄位代碼,也不需要解讀上述任何其他可點擊的物件。Word 文件經常將有用的目的地隱藏在格式化文字、按鈕、引文與圖片之後,因此嘗試複製可見文字既緩慢,也很容易遺漏附加於圖片或簡短短語上的連結。

為什麼只擷取 URL(而非連結文字)

想要從 Word 檔案中取得純 URL 字串,日常有幾個原因。發布報告前的來源稽核是最常見的情境之一:審閱者可以將 TXT 清單貼入 URL 檢查工具、掃描過時網域,並確認文件中的每個引文都有記錄在案的真正外部目的地。另一個原因是為了快速交給另一個團隊。與其轉發 .docx 檔案,不如交出一份文件所指向的每個外部 URL 的純文字清單,這在分級評論、加上註解或在另一個工具中重新格式化時都更為容易。從外部收到的文件中蒐集參考資料則是第三種情況。當同事以電子郵件寄來一份充滿參考資料的冗長 Word 檔時,擷取 URL 便能為書目提供一個乾淨且已去除重複的起點。編輯與無障礙稽核人員在審閱重複使用的範本時,也依賴僅含 URL 的清單,因為他們在核准範本之前需要確切知道範本連結到哪些目的地。最後,針對失效或具風險連結的預先檢查非常適合使用純文字 URL 清單,因為它可以透過獨立的 URL 檢查程序執行,讓審閱者無需開啟 Word 即可標記可疑網域。在這些任務中,URL 本身就是唯一重要的資料;可見的錨點文字、頁碼與周圍段落都會保留在原始文件中,需要時可以回頭查閱。

逐步從 Word 檔案擷取 URL

若要取得 .docx 檔案中乾淨且去除重複的外部 URL 清單,Word Hyperlink Extractor 會直接讀取關聯檔案。三個操作步驟刻意設計得很短,確保文件絕不會離開瀏覽器:

  1. 從您的裝置中選擇一份 .docx Word 檔案。
  2. 等待瀏覽器從文件封裝中讀取外部超連結關聯。
  3. 檢視安全的目的地,並下載每行一個連結的 TXT 報告。

實務上使用時,請在目前的瀏覽器分頁中開啟該頁面,點擊檔案選擇器,然後選擇您要檢查的 .docx。瀏覽器會驗證 ZIP 封裝、開啟 word/_rels/document.xml.rels,並只保留 Type 為超連結關聯且 TargetMode 為 External 的 Relationship 項目。XML 實體會經過解碼,http、https 與 mailto 目標會經過正規化,並在清單算繪到頁面上之前移除重複項目。接著,您可以選擇在瀏覽器中檢視結果,或下載一份每行一個 URL 的純文字檔,以便貼入試算表、URL 檢查工具或任何本機文字工作流程中。

URL 報告包含與略過的內容

擷取器刻意採保守作法,因此值得了解在本工具的用途下,哪些目標才算 URL。下表根據關聯檔案讀取器的已記錄行為,摘要說明會被報告的類別以及會被過濾掉的類別。

目標類別 是否納入 TXT 報告? 原因
http URL 標準的外部網頁目標
https URL 標準的外部網頁目標
mailto URL 視為安全的外部目的地
內部標題與書籤 TargetMode 為 Internal,而非 External
相對或本機檔案路徑 並非外部網頁目的地
JavaScript 樣式或不安全的通訊協定 以不安全通訊協定加以排除
格式錯誤或非 URL 的目標 在 XML 驗證過程中已拒絕
重複的目的地 已在去除重複過程中移除

因此,報告旁邊顯示的數量是安全外部目的地的數量,而非 Word 能顯示之每個可點擊物件的數量。以純文字撰寫的可見 URL、引文欄位或並非超連結關聯的可點擊圖片,都不會出現在清單中。報告也不會保留錨點文字、頁面位置或周圍段落;這些細節仍保留在原始 .docx 中。

隱私、限制與更安全的審閱工作流程

隱私性已內建於擷取器的運作方式中。瀏覽器在本機讀取 .docx 封裝、開啟關聯 XML 檔,並在同一個分頁中算繪結果。不會有任何文件文字、註解、頁面或巨集被傳送到遠端服務,也沒有帳號、上傳或註冊步驟。擷取器也不會追蹤任何連結,因此它不會請求網站、解析重新導向、檢查郵件收件人,或判斷某個目的地是否適合造訪。報告中的每個項目都是文件提供的字串,仍需要正常的人工審閱。

在開始之前,有幾項已知的硬性限制值得了解。僅支援現代的 .docx 檔案。舊版 .doc 檔案、加密的封裝以及含有過大關聯 XML 的 ZIP64 目錄,都會在任何結果顯示之前遭到拒絕。內部錨定的連結、損壞的壓縮檔與重複的目標會依設計排除,因為將它們當作外部 URL 處理會造成誤導。該工具不會嘗試保留錨點文字、頁面脈絡或格式設定,而且它並非通用的文件解析器,而是一個具有明確範圍的專注型關聯檔案讀取器。

若要建立更安全的審閱工作流程,請將原始 .docx 與下載的 TXT 報告放在一旁,比對 URL 清單與文件中的可見來源,接著透過經核准的獨立程序來檢查重要的 URL,例如手動造訪、網域信譽工具或您組織的 URL 檢查工具。如此一來,擷取器便可作為精確且可重現的起點,而每個目的地的最終判斷則仍由審閱者掌握。該工具所讀取的關聯檔案格式屬於已發佈的 ECMA-376 Office Open XML 標準 的一部分,並記錄於 Microsoft Open XML 參考文件 中,其中對超連結關聯與 TargetMode External 的描述,與擷取器使用的方式完全一致。

如果您正在權衡各種方案,如何安全地從 Word 檔案中移除超連結對此有詳細說明。

如果您正在權衡各種方案,如何變更 Word 文件中的分行符號顏色對此有詳細說明。