從 PDF 擷取頁面,意即讀取來源文件、僅複製您所指定的頁面物件,並依您指定的順序將這些頁面寫入一個全新的檔案。來源 PDF 在您的裝置上保持不變;結果是一份獨立的全新文件,僅包含您所選取的頁面。擷取與分割的差異體現在兩方面:輸出是一個單一的新 PDF,而非多個檔案;且頁面順序完全由您掌控,不受原始順序限制。選取欄位中的頁碼採用一般 PDF 檢視器所顯示的相同「從 1 開始」編號,因此第 1 頁就是您開啟文件時會看到的第一頁。頁面選取運算式結合個別數字與連續範圍,以逗號或空白分隔,連字號用於連接每個範圍的起始與結束頁。同一個瀏覽器工作階段會以確定的方式解析該運算式,精確複製每個所要求的頁面物件一次,並產生一份可立即下載的新 PDF。

extract pages from pdf explained
從 PDF 擷取頁面說明:順序與規則

頁面選取運算式的語法

選取欄位接受一組精簡且定義明確的語言。了解這些規則可避免靜默的意外結果與被拒絕的輸入。

每個標記(token)不是單一頁碼就是一個範圍。頁碼是不含小數或正負號的正整數;它對應於 PDF 檢視器頁面指示器中顯示的頁碼。範圍是由連字號連接的兩個整數,其中第一個整數小於或等於第二個。連字號表示一個含首尾的遞增序列,因此「3-5」會依序選取第 3、4、5 頁。標記之間以逗號或任何空白分隔,包括空格、定位字元與換行字元;兩種分隔符號行為相同,額外的空白不會影響結果。

標記的順序具有意義。解析器會記錄標記出現的順序,並依該順序輸出對應的頁面。運算式「5, 2-3」會產生一份新 PDF,其第一頁為原始的第 5 頁,接著是原始的第 2 頁與第 3 頁。這讓您無需事先重新排列來源文件,就能組裝出自訂序列。

解析器刻意採取嚴格的規則。遞減範圍(例如「5-3」)會被拒絕,而不會被靜默地反轉。小數值、負值、格式錯誤的範圍,以及超出已載入文件的頁面,皆會觸發明確的錯誤訊息。輸入欄位最多接受 4,000 個字元;超出上限的輸入既不會被截斷,也不會被部分套用。若選取內容超過該上限,工作必須拆分為多次處理。

模式意義範例輸出狀態
7單一頁面僅第 7 頁接受
1-5含首尾的遞增範圍第 1、2、3、4、5 頁接受
3, 7兩個標記,順序有意義第 3 頁,然後第 7 頁接受
5, 2-3單一頁面加上範圍第 5 頁,然後第 2 頁與第 3 頁接受
5-3遞減範圍—拒絕
1.5小數值—拒絕
999 (超出最後一頁)超出範圍的頁面—拒絕

三個步驟從 PDF 擷取頁面

整個工作流程簡短且完全在本機執行。每個步驟直接對應於瀏覽器型擷取工具的其中一項已驗證操作步驟。

  1. 選擇一個本機的、未加密的、大小不超過 50 MiB,且頁數不超過 500 頁的 PDF。瀏覽器會直接從您的裝置讀取原始位元組,因此該檔案必須已儲存於磁碟上的某處。
  2. 在欄位中輸入頁面選取運算式。使用對應於檢視器頁數的「從 1 開始」編號,並依您希望其在輸出中出現的順序,結合單一頁面與含首尾的遞增範圍。
  3. 執行擷取、檢閱任何出現的重複頁面通知,並下載新的 PDF。更改運算式或重新執行會取代先前的輸出,因此最新的下載永遠對應最新的結果。

瀏覽器實際對您的頁面做了什麼

當您執行擷取時,瀏覽器會先驗證檔案的 PDF MIME 類型或副檔名,並確認檔案落在 50 MiB 位元組上限內,之後才會接觸任何頁面物件。負責執行繁重任務的程式庫 pdf-lib 的 PDFDocument API,接著會在停用繞過加密的情況下載入來源位元組,這代表受密碼保護的檔案無法透過猜測密碼來開啟。一旦載入後,文件必須包含 1 至 500 頁;否則工具會拒絕該檔案,而不是將其截斷。

解析器會逐一走訪您的選取運算式,忽略空白並記錄每個唯一頁面的順序。它會將每個「從 1 開始」的標記轉換為底層程式庫所使用的「從 0 開始」的索引,依記錄的順序複製頁面物件,並將其插入新建立的 PDFDocument。每個複製的頁面物件會保留其 90 度旋轉、裁切框 (crop box)、媒體框 (media box)、頁面圖形,以及一般的頁面資源。頁面不會被點陣化為螢幕截圖,因此向量內容會保持為向量內容。

當所有選取的頁面皆已複製完成後,新文件會被儲存至一個由瀏覽器公開、供下載使用的臨時本機 Object URL。該 URL 會在下列情況被釋放:被較新的擷取作業取代時、您載入不同的來源檔案時,或您關閉頁面時。當選擇了新檔案時,來源位元組、選取文字、來源預覽連結與結果會一併清除,且設有防護機制以避免較舊的非同步載入或儲存作業覆寫較新的狀態。

工具強制執行的界限:大小與頁數

輸入上限正好是 50 MiB,亦即 52,428,800 位元組;解碼後的文件上限正好是 500 頁。這些是明確的本機處理界限,而非柔性目標。達到任一界限的檔案會被接受;超過任一界限的檔案會被拒絕,而非被縮減。兩項限制彼此獨立:一個 49 MiB 但有 600 頁的檔案會因頁數而被拒絕;一個 51 MiB 但只有 100 頁的檔案則會因大小而被拒絕。

輸出並未受輸入上限限制,因為 pdf-lib 會連同頁面本身一併複製每個所選頁面的資源物件。附加於頁面的字型與影像必須隨之轉移,這表示從一個資源密集的文件擷取單一頁面,仍可能產生相當大的檔案。反之,從一個 200 頁的文件中擷取一百頁純文字頁面,並不一定會產生與頁數完全成正比的結果。檔案大小並不一定與頁數成正比。

瀏覽器的可用記憶體也會因裝置與分頁的工作量而異。若大型擷取作業停滯或傳回記憶體不足錯誤,將工作拆分為兩次或多次處理,通常比重試相同的輸入更為可靠。

界限數值達到界限時超出界限時
輸入檔案大小50 MiB (52,428,800 位元組)接受拒絕
輸入頁數500 頁接受拒絕
選取欄位長度4,000 個字元接受拒絕,不會截斷
輸出檔案大小無明確上限視複製的資源而定—

重複頁面的首次出現規則

當範圍與單一頁面或其他範圍重疊時,重複的標記很常見。解析器會採用一項刻意的「首次出現」規則:某個頁碼首次出現在運算式中時,該頁會被選取;該頁碼之後每次再出現都會被忽略。結果會接著回報哪些頁碼是重複的,以便您確認這些重複是否為刻意所為。

因此,運算式「3, 1-3」會依該確切順序產生第 3、1、2 頁,且結果會將第 3 頁回報為重複。這避免了意外的範圍重疊在無聲無息中將重複頁面加入輸出,同時保留了每個唯一頁面在運算式中首次出現的確切順序。

運算式選取的唯一頁面輸出順序回報的重複頁面
3, 1-33, 1, 23, 1, 23
1-5, 31, 2, 3, 4, 51, 2, 3, 4, 53
2, 2, 2222 (兩次)
10-12, 11-1310, 11, 12, 1310, 11, 12, 1311, 12

若輸出中確實需要重複頁面,本工具並不會產生這些重複頁面。專為該目的設計的頁面重新排序或複製工作流程,才是合適的工具。

新 PDF 中會保留的內容,以及不會保留的內容

每個複製的頁面物件會一併帶有其旋轉、裁切框 (crop box)、媒體框 (media box)、頁面圖形,以及一般的頁面資源。在來源中旋轉了 90 度的頁面,在新文件中仍會保持 90 度旋轉;使用自訂裁切框的頁面會保留該裁切框;附加於頁面的普通內嵌影像與字型會隨頁面物件一併轉移。

然而,若干全文件層級的功能,取決於您所選頁面之外的物件。pdf-lib 的 PDFForm 類別文件中說明,動態 XFA 表單並非支援的保留目標。AcroForm 欄位、註記、指令碼、內嵌檔案、圖層、頁面標籤、書籤、文件大綱、跨頁目的地 (destinations) 與連結,亦可能依賴無法在擷取過程中完整保留的物件。數位簽章將不再有效,因為新 PDF 在位元組層級上是另一份不同的文件,任何指向原始位元組資料流的簽章在本質上都會失效。

受密碼保護或加密的檔案無法透過繞過加密的方式開啟,因此加密的來源檔案必須先解鎖。受損或不受支援的檔案則可能根本無法載入。因此,本工具並不保證所有互動式、導覽性、簽章或歸檔相關的屬性能夠完整保留。在仰賴結果之前,請於您的目標檢視器中開啟檔案、確認順序與外觀、測試任何您所需的連結或表單欄位,並保留原始 PDF。當需要保留簽章、XFA、無障礙結構、投資組合 (portfolios)、附件,或符合法規的歸檔時,請使用專業的 PDF 編輯器。

When extraction is the right job, and when it is not

Extraction is purpose-built for one task: copying selected pages from a source into a single new file in a chosen order. It fits well when you want to hand a colleague three specific slides, share one chapter from a long report, or assemble a custom excerpt from several points in a document. The Extract PDF Pages tool is designed for that subset precisely. For a more step-focused walkthrough of the same task, see how to extract PDF pages into a new file.

If your task is different, the rest of the local PDF toolkit covers it. To remove unwanted pages from a document, use a deletion workflow. To break a document into many smaller files at fixed boundaries, use a split-by-range workflow. To rearrange an existing document without removing anything, use the page-reordering tool. To rotate, crop, or resize the output, those tools operate on the new PDF after extraction. When duplicate copies of the same page are needed in the output, the first-occurrence rule will not give them to you, so choose a duplication workflow instead. When preservation of signatures, XFA forms, or accessibility tagging matters, use the original authoring software rather than a page-extraction tool.

For a deeper look, see Change PDF Page Order: A Complete Browser-Based Method.