從 LinkedIn PDF 匯出連結,代表要將文件中所有可點擊的網址與內部跳躍點全部抽出來,並儲存成單一、易於檢閱的檔案。LinkedIn 資料匯出、儲存的文章集,或存成 PDF 的個人檔案,都可能包含數十個內嵌的超連結——指向外部網站、mailto 聯絡人、內部頁面跳躍,以及電話號碼。PDF Link Extractor 會直接在您的瀏覽器中讀取這些 PDF 連結註解,列出每個目標連同頁碼與連結類型,並讓您複製報表或下載 CSV 或 UTF-8 TXT 檔。PDF 本身從不離開您的裝置,萃取出的目標保持為非作用中的文字,僅納入一小組安全的通訊協定。結果是一份整齊的清單,記錄文件將讀者導向何處,可隨時用於移轉檢查、文件品質檢驗,或離站連結稽核。
LinkedIn 匯出並非唯一值得掃描的 PDF 來源。儲存的文章集、匯出的搜尋結果,以及由 LinkedIn 資料建構的第三方報告,都具有相同的形式:多頁的 PDF,文字中散佈著可點擊的註解。知道哪些網址確實存在於檔案中、哪些只是印刷文字,是建立可信連結清單的第一步。

為何本機、瀏覽器式的萃取工具適合此任務
許多線上的連結萃取方式需要將 PDF 上傳到遠端伺服器,這對含有個人或商務聯絡資料的文件會引發明顯的疑慮。PDF Link Extractor 採取不同的做法:只有當您按下按鈕後,才會將檔案載入瀏覽器,在記憶體中讀取連結註解,絕不會將文件或其目標送至任何連結分析伺服器。PDF.js 及其共用 worker 是按需載入,而非初始頁面套件的一部分,這讓頁面其他部分保持輕量,處理負載也易於掌握。
此工具依賴 PDF.js 的註解資料,而非掃描原始 PDF 位元流中類似網址的字串。這項區別很重要,因為 PDF 會在串流中壓縮文字、編碼字型,並嵌入看起來像連結但實際上不可點擊的中繼資料。直接讀取註解可避免大多數在對所有文字套用規則運算式搜尋時出現的誤判。僅印在頁面上但從未設為可點擊的網址,將不會出現在報表中,這通常正是稽核所想要的行為。
從 LinkedIn PDF 萃取連結
- 在瀏覽器中開啟 PDF Link Extractor,並從您的裝置選擇一個 PDF。檔案大小上限為 25 MiB,頁數上限為 40 頁;加密、損壞、格式錯誤、不受支援或超出限制的文件會以明顯的錯誤訊息遭到拒絕。
- 點擊 Extract Links。瀏覽器依頁面與註解順序讀取連結註解,並在本機建立報表。PDF.js 僅在此步驟後才會載入,因此文件內容不會被提前處理。
- 檢視結果。每一列顯示頁碼、註解索引、連結類型,以及非作用中的目標字串。不安全的通訊協定、控制字元與不支援的目標會被略過,而不會顯示出來。
- 將純文字報表複製到剪貼簿,或下載 UTF-8 TXT 檔或對公式安全的 CSV。CSV 包含頁面、註解編號、類型與目標等欄位,且以試算表公式前置字元開頭的儲存格會被中和,使檔案可在 Excel、Google Sheets 或 LibreOffice 中安全開啟。
- 在造訪、重新發布或分享任何重要目標之前,請獨立進行驗證。此工具不會對其顯示的任何網址進行驗證、抓取或信譽檢查。
如果您需要在第一次作業完成前就開始新的執行,新工作會取消前一個工作,並清除 PDF 頁面、載入任務、下載網址與暫存狀態。這代表您可以快速反覆測試,而不會在記憶體中留下過時資料。
報表中的外部目標與內部目標
報表會區分外部目標(指向網站、電子郵件或電話的網址)與內部目標(指向同一份 PDF 內其他位置的目的地)。外部網址使用 HTTP、HTTPS、mailto 與 tel 的精簡通訊協定清單;不在此清單內的項目會被排除。內部目的地會標示為內部,但它們不一定能解析為最終頁碼,因為 PDF.js 可能會將其公開為具名目的地或明確的目的地陣列,且不同文件的檢視器行為可能有所不同。
| 目標類型 | 說明 | 是否納入? | 備註 |
|---|---|---|---|
| 外部網址 (http/https) | 指向其他網站的標準網頁連結 | 是 | 以非作用中文字儲存 |
| mailto: | 可點擊的電子郵件地址 | 是 | 顯示地址,從不開啟 |
| tel: | 可點擊的電話號碼 | 是 | 顯示號碼,從不撥號 |
| 內部目的地 | PDF 內部具名或明確的跳躍點 | 是 | 標示為內部;頁面可能無法解析 |
| javascript:、data:、file:、blob: | 不安全或受限制的通訊協定 | 否 | 略過,從不可點擊 |
| 無註解的印刷網址 | 看起來像連結的可見文字 | 否 | 非註解;超出工具範圍 |
結果會保留頁面順序與註解順序,因此您可以將任何目標追溯回其來源位置。同一頁面上的完全重複項目會被移除,但不同頁面上的重複連結則會保留——頁面出現次數在稽核時是有用的證據。摘要列包含已檢查的註解數量、接受的連結數、重複數與略過的目標數,讓您在匯出前快速進行合理性檢查。頁面、註解、目標長度與報表總字元數的限制,可防止單一文件產生無限制的運算或輸出,即使面對內容密集的 LinkedIn 封存檔也是如此。
此工具不執行的項目(以及為何這很重要)
PDF Link Extractor 的功能刻意保持精簡。它不會造訪、抓取、驗證或對任何萃取出來的目標進行信譽檢查,也不會在報表本身中將任何目標設為可點擊。它不是爬蟲、斷連檢查器、釣魚偵測器、無障礙稽核工具或內容掃描器。目標出現在報表中,僅代表 PDF.js 在該位置公開了受支援的連結註解。
這種精簡的範疇是一項特性,而非限制。透過將每個目標視為不受信任的文字,此工具可防堵一整類在處理過程中自動點擊文件時出現的攻擊。相同的原則也形塑了 CSV 輸出:以試算表公式前置字元(例如 =、+、- 或 @)開頭的儲存格會在序列化前被中和,引號與換行符則依 CSV 規則跳脫。這可防止萃取出來的網址在同事稍後以試算表軟體開啟報表時變成公式——這是企業資料工作流程中眾所周知的 CSV 執行風險。
讓連結清單派上用場
報表匯出後,連結清單就成為可實際運用的產出,而不僅是個有趣的副產品。以下是一些實際用途:
- 移轉檢查。在將 LinkedIn 封存檔移入新的文件管理系統之前,確認每個外部目標仍可連線,且仍指向其所宣稱的資源。
- 文件品質檢驗。將連結清單與來源 PDF 比對,確認在匯出、分享或編輯過程中沒有註解遭到移除。
- 清點與稽核。在試算表或資料庫中使用 CSV,追蹤哪些連結出現在哪些頁面、每個目的地由誰負責,以及最後驗證時間。
- 隱私檢閱。列出所有 mailto 與 tel 目標,確認文件僅揭露作者有意分享的聯絡資訊。
如果稽核結果發現您不希望 PDF 繼續帶有的註解,Remove PDF Annotations 工具會移除頁面註解陣列——連結、註解、表單元件——同時保留已繪製的頁面內容不變。如需在萃取前快速檢查頁數與頁面範圍,PDF Page Counter 可在不修改文件的情況下回報精確尺寸。如果文件的標題、作者或關鍵字也需要處理,PDF Metadata Editor 會在相同的瀏覽器工作階段中私下讀取並更新該欄位集。
在使用重要目標之前進行驗證
匯出連結清單後,最重要的習慣就是獨立驗證。此工具無法告訴您目標是否仍有效、安全、相關或適合您的受眾——只能告訴您 PDF.js 在該位置公開了受支援的連結註解。請開啟報表,將每一行視為不受信任的資料,並在依賴、重新發布或轉寄給同事之前,以人工方式確認最重要的目標。
請將原始 PDF 保持不變,作為來源紀錄。報表是文件指向位置索引,並非文件本身的替代品。如果某個連結稍後失效,未變更的 PDF 可提供精確的頁面與註解編號供調查,且相同的匯出執行作業可重新產生報表以供比對。作為此工具背後註解引擎的 PDF.js,已記載於 PDF.js API reference for PDFPageProxy.getAnnotations 以及更廣泛的 Mozilla PDF.js project,兩者共同說明了為何某個連結會出現在報表中——或為何不會出現。
如需更深入的說明,請參閱 How to Export Links From a LinkedIn Profile PDF。
如需更深入的說明,請參閱 How to Get Every Link From a PDF Without Uploading。