免費擷取 PDF 頁面意味著建立一個全新的 PDF,僅包含您從來源文件中選取的頁面,而 Lizely 的擷取 PDF 頁面工具可在您的瀏覽器中完成這項工作,每個來源檔案的大小上限為 50 MiB、頁數上限為 500 頁,可接受像 5 或 1-3 這類按照您指定之確切輸出順序的輸入。瀏覽器會在本地讀取原始位元組,pdf-lib 函式庫會將每個要求的頁面物件複製到全新的文件中,然後您可以直接下載結果,而無需上傳來源檔案。解析器嚴格要求以下語法:以 1 為起始的頁碼、以逗號或空白分隔、遞增的連續範圍,以及針對重複項目採確定性的首次出現規則。受密碼保護的文件無法由該工具開啟,而那些依賴於所選頁面以外物件的功能(例如數位簽章、AcroForm 欄位、書籤以及動態 XFA 表單),在擷取後將無法保留其原始狀態。本指南的其餘部分將說明確切的操作步驟、選取頁面的語法、必須遵守的限制,以及新 PDF 準備就緒後該驗證的項目。

從 PDF 擷取頁面實際上做了什麼
擷取頁面會產生一個獨立且可供下載的 PDF,僅包含您選擇的頁面。原始檔案會保留在您的電腦上,不會遭到修改。在工具內部,瀏覽器透過 File API 讀取您的來源位元組,pdf-lib 的PDFDocument類別會在記憶體中載入文件而不會略過加密機制,並建立一個全新的 PDFDocument。每個要求的頁面物件都會被複製過來,連同其媒體框(media box)、裁切框(crop box)、頁面圖形、一般頁面資源,以及任何 90 度的旋轉設定。接著新檔案會被儲存到一個由下載按鈕所提供的臨時本地 Object URL。
當您想從電子書中取出單一章節、僅寄出合約中已簽署的附件、將散落的參考頁面彙整成一份簡短講義,或是從冗長的報告中組合一份自訂資料包時,這就是正確的作業。它與將 PDF 拆分成多個單頁檔案不同;要是您需要每個頁面一份 PDF,請使用專門的分割工具。它也和刪除頁面不同,因為原始檔案不會被更動,而是會產生一份獨立的新檔案,而非修剪後的原始檔案版本。
如何免費在瀏覽器中擷取 PDF 頁面
- 在最新的桌面瀏覽器(例如 Chrome、Firefox、Safari 或 Edge)中開啟 Lizely 上的擷取 PDF 頁面工具。
- 點選檔案選擇器,從您電腦中挑選一份未加密的 PDF。檔案大小不得超過 50 MiB,且頁數必須介於 1 至 500 頁之間。
- 等待瀏覽器完成讀取來源檔案。
- 在選取欄位中按照您想要的輸出順序輸入頁碼或範圍。使用逗號或空白分隔各個代號,並以連字號表示連續的遞增範圍,例如 5, 1-3 或 2, 4, 6-8。
- 點選擷取按鈕。工具會將符合的頁面物件複製到一個新的 PDF 文件中,並提供一個臨時下載連結。
- 若出現重複頁面的提示,請加以閱讀。系統會保留每個頁面的首次出現,並忽略後續的重複項目,因此結果仍會符合您輸入的順序。
- 點選下載連結,將新的 PDF 儲存到您的裝置。若您想並排比較原始檔案與結果,可以使用本地來源連結。
- 完成後關閉頁面,以釋放瀏覽器所持有的臨時來源與結果 URL。
頁面選取語法一覽
解析器之所以嚴格,是為了避免一個多餘字元悄悄改變您的輸出結果。下表顯示在一份 10 頁的範例文件中,常見輸入如何對應到輸出頁面。頁面的編號方式與 PDF 檢視器的顯示一致,從 1 開始。
| 您輸入的內容 | 輸出中的頁面 | 原因 |
|---|---|---|
| 5 | 5 | 單一頁面代號。 |
| 1, 3, 5 | 1, 3, 5 | 以逗號分隔的單一頁面。 |
| 1-3 | 1, 2, 3 | 包含首尾的遞增範圍。 |
| 5, 2-3 | 5, 2, 3 | 代號順序決定輸出順序。 |
| 3, 1-3 | 3, 1, 2 | 頁面 3 的第二次出現會被忽略。 |
| 5-3 | 發生錯誤並予以拒絕 | 遞減範圍不會被悄悄反轉。 |
| 2.5 或 -1 | 發生錯誤並予以拒絕 | 不允許小數與負數。 |
| 1, 12 | 發生錯誤並予以拒絕 | 12 超出 10 頁的來源範圍。 |
若想看解析器在一個具體運算式上的實際運作,請在一份 10 頁的來源檔案中輸入 1-3, 5, 7-9。從左至右讀取,這些代號會展開為序列 [1, 2, 3, 5, 7, 8, 9],這同時也是輸出頁數:新 PDF 共有 7 頁。由於這些頁面沒有重複,重複出現的規則在此情況下不會改變任何結果。
檔案限制與無法保留的功能
事先了解界線有助於避免失敗的執行作業。以下限制會以嚴格的臨界值強制執行——剛好達到臨界值的檔案會被接受,超過的檔案或更長的文件則會被拒絕,而非加以修剪。
| 限制條件 | 數值或行為 |
|---|---|
| 檔案大小上限 | 50 MiB(52,428,800 位元組);超過此大小的檔案會被拒絕。 |
| 頁數上限 | 來源檔案最多 500 頁;更長的文件會被拒絕。 |
| 加密 | 受密碼保護的 PDF 無法開啟;永遠不會略過加密機制。 |
| 選取欄位長度 | 最多 4,000 個字元;超出上限的輸入會被拒絕,而非截斷。 |
| AcroForm 欄位 | 可能會失去互動功能,因為欄位依賴於所選頁面以外的物件。 |
| 數位簽章 | 擷取後不再保持有效;輸出是一份不同的檔案。 |
| 書籤、大綱、連結 | 跨頁面的目的地與文件層級的結構可能會遭到破壞。 |
| 動態 XFA 表單 | 並非 pdf-lib 中支援的保留目標。 |
| 損壞或不支援的檔案 | 可能無法載入。 |
有一個相關的重點值得特別說明,那就是輸出檔案的大小。所選頁面的資源(例如字型和影像)會被複製到新文件中,因此即使您從一個資源密集的來源中僅擷取一個頁面,結果仍可能會很大。檔案大小並不會與頁數成正比,而瀏覽器的可用記憶體會依裝置與分頁的工作量而有所不同。
為何以瀏覽器為基礎的擷取工具能保護您的檔案
由於每個步驟都是在本地執行,您的來源 PDF 永遠不會離開裝置。瀏覽器會驗證 PDF 的 MIME 類型或副檔名,以及 50 MiB 的位元組上限,接著 pdf-lib 會在不使用 ignoreEncryption 的情況下載入來源檔案,因此加密檔案會以錯誤的形式呈現,而不是悄悄產生錯誤的輸出結果。解析器會建立一個以零為起始的索引清單,由 production 函式直接傳遞給 pdf-lib,所產生的位元組僅透過目前分頁所持有的臨時 Object URL 對外公開。
在頁面開啟期間確實存在兩個臨時 URL:一個用於來源預覽,另一個用於結果。當您變更檔案、執行新的擷取作業或關閉頁面時,這兩個 URL 就會被釋放;而作業層級的防護機制可防止較舊的非同步載入或儲存作業覆蓋較新的狀態。針對 production 函式的真正整合測試,會建立一份混合頁面尺寸的來源檔案,將其執行擷取作業後重新開啟儲存的位元組,並驗證輸出數量、順序、尺寸與頁面身分。這就是為什麼正確的結果會包含您輸入的頁面,按照您輸入的順序排列,並保留頁面尺寸的原因。
下載新 PDF 之後
在將擷取後的檔案視為定稿之前,請以您的收件者將使用的檢視器開啟該檔案,並檢查三件事:所有列出的頁面是否皆已存在、頁面是否依照您指定的順序呈現,以及您所依賴的任何欄位、連結或註解是否仍可正常運作。在確認輸出無誤之前,請將原始 PDF 與新檔案並存保留;當文件涉及數位簽章、XFA、無障礙標籤、組合檔、附件或受規範的歸檔遵循性時,請改用專業的 PDF 編輯器。
如果您還需要執行相關作業,將來源檔案分割成多個單頁檔案的工作適合交給 Split PDF 工具,而將多份 PDF 合併成一份較長的文件則由 Merge PDF 負責。兩者皆採用相同的純瀏覽器方式,因此無需上傳您的檔案。