PDF 連結擷取器是一個免費、於瀏覽器中運作的工具,會列出 PDF 檔案內所有可點擊的連結註解,並讓你在不上傳檔案的情況下複製或下載報告。所有處理都在本機透過開源的 PDF.js 引擎完成,因此沒有伺服器端的掃描、不需要建立帳號,也沒有每日配額需要追蹤。對於任何在尋找無限制方式來擷取 PDF 連結的人來說,實際的上限在於執行工作的裝置本身,而非第三方服務的限流。這套免費工具會產生一份依頁面排序的支援目的地清單、顯示連結類型,並提供可直接貼到試算表、研究筆記或純文字檔中的安全、非作用中的輸出。由於文件不會離開你的裝置,你可以依照需求對任意數量的 PDF 執行任意次數,而這正是「有限制的免費」與真正無限的本機處理之間的差別。

「免費且無限制」對 PDF 連結擷取器來說代表什麼
大多數線上 PDF 工具都標榜免費,卻悄悄地加上每日上限、註冊牆、檔案數量限制,或伺服器端的排隊機制來限制可執行的工作數量。本機工具則徹底改變了這個局面。這套免費的 PDF 連結擷取器完全在你的瀏覽器分頁中執行,因此第二次擷取的成本只是載入下一個 PDF 所需的時間。這就是它在一般使用情境下真正無限的原因:沒有共享的伺服器資源池、沒有每位使用者的權杖,也沒有為了換取使用權而插入的浮水印。
兩項事實定義了這套工具「無限」的界線,兩者都直接來自其實作方式。第一,來源 PDF 會保留在你的裝置上,由按下按鈕後載入的 PDF.js 進行處理,並透過 PDF.js 的共享 worker 與其他 PDF 工具共用。第二,每個支援的目標都以非作用中的文字形式回傳,而非可點擊的連結,這表示你可以在同一個工作階段中檢視數百個目的地,而報告本身不會瀏覽任何地方或擷取任何內容。這兩項特性結合起來,提供了一套不依賴任何廠商持續上線的不受限制擷取工作流程。
如何在本地擷取 PDF 中的每一個連結
- 從你的電腦中選擇一個 PDF。工具接受最大 25 MiB 且最多 40 頁的檔案;加密、損壞、格式錯誤、不支援或超出上限的文件會以明顯的錯誤訊息被拒絕。
- 點擊「擷取連結」開始檢查。PDF.js 會視需要載入,依頁面順序讀取頁面註解,再於每頁內依註解順序處理。
- 檢視產生的報告。每個項目會顯示頁碼、註解編號、連結類型以及非作用中的目標文字。同一頁上的完全重複項目會被移除,而出現在不同頁面上的同一個連結則會保留下來,因為頁面出現位置是有用的證據。
- 使用相同安全、非作用中的文字將報告複製到剪貼簿,或下載具有穩定頁面標籤的 UTF-8 TXT 檔,或下載包含頁碼、註解編號、類型與目標欄位的試算表安全 CSV。
整個流程無需帳號,不會將文件傳送到連結分析伺服器,工具也絕不會對任何擷取到的目的地進行擷取、驗證或信譽檢查。如果你需要在開啟工具前複習一下,PDF 連結擷取器頁面是最佳的起點。
匯出內容包含什麼
這份報告不只是簡單的字串清單。它的結構經過設計,可直接用於盤點、遷移檢查或文件品保,無需事後進行任何清理工作。
| 元件 | 包含內容 | 重要性 |
|---|---|---|
| 頁碼 | 找到每個連結註解的頁面 | 告訴你讀者點擊後會到達哪裡 |
| 註解編號 | 該頁面上註解的順序 | 方便交叉參照回原始 PDF |
| 連結類型 | 外部 URL 或內部目的地標籤 | 區分外部連結與文件內部的交互參照 |
| 目標文字 | 非作用中、已跳脫的目標字串 | 複製、貼上與儲存時安全無虞,不會觸發擷取 |
| 摘要計數 | 已檢查的註解、接受的連結、重複項目、略過的目標 | 快速掌握 PDF 連結層的健康狀況 |
僅當外部目標使用 HTTP、HTTPS、mailto 或 tel 時才會被接受。通訊協定檢查不區分大小寫,且會拒絕控制字元;JavaScript、data、file、blob 及其他未核准的通訊協定則會自報告中排除,而非使其變得可點擊。內部 PDF 目的地會以內部目標標示,並提供有限定範圍且易讀的表示方式;由於內部目的地結構與頁面參照在不同文件間有所差異,工具並未宣稱能將每個目的地解析為最終頁碼。
為何基於瀏覽器的工具沒有隱藏上限
本機擷取器的決定性特徵在於瓶頸是你的硬體,而非廠商的配額系統。根據 Mozilla PDF.js 專案文件,PDF.js 透過 PDFPageProxy getAnnotations API 公開連結註解,這正是擷取器用來發現目的地的方式,而非在原始 PDF 位元組中搜尋類似 URL 的字串。這個區別很重要,因為壓縮串流、字型資料、中繼資料以及一般的印刷文字中,經常含有看起來像 URL 但實際上從不是可點擊連結的序列;改為讀取註解可讓報告精確對應實際的連結。
工具內部仍然存在頁數、註解、目標長度與報告總字元數的限制,因為這些上限可防止單一文件產生無限制的工作量或無限制的輸出。可見的限制為每個檔案 25 MiB 與 40 頁的上限。輸出上限則由相同的註解與輸出預算強制執行,加上單一執行原則:開始新的擷取會取消先前的作業、清理 PDF 頁面與載入工作,並撤銷任何下載 URL,避免過時連結外洩。
還有一套在背景運作的安全預算。以試算表公式前置字元開頭的 CSV 儲存格會在序列化前被中和,引號與換行符則依照 CSV 規則進行跳脫,這可防止擷取到的目標在使用者日後於試算表軟體中開啟報告時變成公式。TXT 輸出為純 UTF-8,並使用穩定的頁面標籤。這些規則的結合代表你可以隨心所欲地從 PDF 擷取連結,而不會在報告中累積隱藏的風險。
不受限制的連結擷取發揮價值的場景
無上限的工作流程在涉及大量 PDF 或對同一檔案多次執行時最為實用。常見的情境包括:
- 遷移檢查。在將文件庫移轉到新平台之前,對每個 PDF 執行擷取器,並將擷取到的連結清單與預期盤點進行比對。
- 文件品保與稽核。編輯與合規團隊可抽樣檢查,確保沒有連結註解指向不安全的通訊協定,或指向應已淘汰的目的地。
- 研究典藏。處理數十個 PDF 的研究者可建立單一彙整的外部參照 CSV,無需擔心每日限制或過期的工作階段。
- 重新出版。當 PDF 的印刷版或網頁版被重建時,擷取到的清單可作為來源依據,說明哪些目的地需要重新建立或重寫。
- 衛生檢查。每季對整個舊版 PDF 資料夾執行一次擷取器,可產生一份基準報告,及早發現新的不安全通訊協定或意外的內部目的地。
這套工具刻意不作為爬蟲、無效連結檢查器、釣魚偵測器、輔助使用稽核或內容掃描器。目標出現在報告中,僅代表 PDF.js 公開了該支援的連結註解。重要的目的地在實際前往或發布前仍應獨立驗證,且原始 PDF 應原封不動地保留作為來源紀錄。在此範圍內使用,擷取器能將「免費且無限制地從 PDF 擷取連結」從行銷話術轉化為實用、可重複的工作流程。