跳至主要內容
Lizely

PDF 連結提取工具

依照頁面列出外部與內部的 PDF 連結註記,然後複製或下載安全報告至本機裝置。

隱私權:你的檔案不會離開裝置,所有處理均在瀏覽器本機完成。

使用方式

  1. 1.選擇一個最多為 25 MiB 的 PDF;加密、損毀或超出限制的檔案將被拒絕。
  2. 2.點選「提取連結」以檢視頁與註記順序中的支援連結註記。
  3. 3.檢視無活性目標後,複製報告或下載安全的 CSV 或 UTF-8 TXT 檔案。

關於PDF 連結提取工具

PDF 鏈結提取器會從 PDF 中讀取可點選的鏈結註解,並在你的瀏覽器中產生一個按頁碼排序的報告。選擇一個本機文件,開始提取,然後逐一檢視每個支援的目標,並檢視其頁碼和鏈結型別。你可以複製純文字報告,或下載 TXT 和 CSV 版本。PDF 和提取的目標會留在你的裝置上;Lizely 不會上傳文件或將其內容傳送至鏈結分析伺服器。

此工具使用 PDF.js 的註解資料,而不是在原始 PDF 位元組中搜尋看似網址的字串。這項差異可減少因壓縮資料流、字型資料、中繼資料與一般印刷文字所造成的誤判。工具會找出以 PDF 連結註解表示的連結,包括 PDF.js 所提供且支援的外部網址,以及具名或明確指定的內部目的地。若 URL 只以可見文字印在頁面上、卻未設成可點擊連結,便可能不會出現在結果中,因為它不是連結註解。

外部目標只會被接受當他們使用一個狹窄的有用方案:HTTP,HTTPS,mailto或tel. 方案檢查是不敏感的,並拒絕控制符號. JavaScript,資料,檔案,斑點和其他未經批准的方案被排除在報告中,而不是被顯示可點選.結果顯示為惰性文字;工具不導航到,搜尋,驗證,評價檢查,或保證任何提取目的地的安全.。

內部 PDF 目標並不總是包含網頁 URL。它們可能是命名目標或明確指向文件中其他位置的目標陣列。報告會將這些標籤為內部目標,並序列化為有限且可讀取的表示形式。它並未聲稱能解析每個目標至最終頁碼,因為文件中的目標結構、頁碼參考和檢視器行為可能會有所不同。

結果保留頁碼順序與註解順序。相同頁碼上的完全重複專案會被移除,但不同頁碼上的重複連結仍會顯示,因為頁碼出現次數是有用的證據。總結包含已檢視的註解數量、接受的連結、重複專案以及跳過的不安全或不支援目標。對頁數、註解數量、目標長度與總報告字元數的限制,可防止單一文件產生無限的處理或輸出工作。

CSV 輸出包含頁碼、註解編號、型別與目標欄位。以試算表公式字首開頭的單元格會在序列化前被中和,並使用 CSV 規則轉義引號與換行符號。這可防止使用者之後在試算表軟體中開啟報告時,提取的目標變成公式。TXT 輸出為 UTF-8 純文字,並使用穩定的頁碼標籤。複製操作使用相同的安全、無活性報告。

來源檔案最大可為 25 MiB、最多 40 頁。加密、損毀、格式不受支援或超出限制的文件都會顯示明確錯誤。只有在使用者按下按鈕後,PDF.js 與其共用 worker 才會載入;兩者不會進入初始頁面套件,且會共用其他 PDF.js 工具採用的固定 worker URL。新工作會取消先前的工作,PDF 頁面、載入工作、下載連結與暫存狀態也都會妥善清除。

請用這個工具進行詞句庫、遷移檢查、文件 QA 或檢視 PDF 將讀者導向何處。這不是爬蟲、斷鏈檢查器、釣魚網站偵測器、存取性稽核或內容掃描器。目標存在僅表示 PDF.js 曝露了支援的連結註解。在造訪或釋出前,請自行驗證重要目的地,並保持原始 PDF 不變作為來源紀錄。

方法與來源

在使用者明確操作後載入一個有邊界限制的 PDF,請求 PDF.js 的頁面註記,選擇具有支援外部或內部目的地欄位的連結註記,拒絕不安全的協議與控制字元,保留頁碼順序,移除同頁相同目標的重複,執行註記與輸出預算限制,序列化無活性 TXT 與公式中和的 CSV,並在任務更換時清除載入任務與下載 URL。

常見問題

工具會訪問提取的連結嗎?
不會。它僅將註記目標視為無活性文字,從未抓取、開啟、驗證或評估其安全性。
為何印刷的 URL 沒有出現?
可見文字不必然代表可點選的 PDF 連結註記。此工具讀取的是註記,而非搜尋所有文字中類似 URL 的字串。
哪些外部協議被包含?
僅接受 HTTP、HTTPS、mailto 與 tel 網址目標。JavaScript、data、檔案、blob、控制字元與不支援的協議格式將被略過。
此 CSV 可以安全開啟嗎?
欄位會被轉義,公式開頭的值也會被中和,但你仍應將所有文件衍生的文字視為未受信任的資料。

PDF 工具 使用指南

查看全部