從 PDF 擷取頁面是指在選取欄位中輸入像 5, 1-3 這樣的頁碼,然後讓工具依照您輸入的確切順序,將這些頁面複製到一個全新的 PDF 中,而來源檔案會在您的瀏覽器中於本機讀取,完全不會被上傳。對初學者來說,整個流程可歸納為三個動作:從您的裝置載入來源 PDF、列出您要的頁面,然後下載產生的檔案。能完成這項任務的工具是 Extract PDF Pages,它完全在您目前的分頁中運作,因此來源的位元組永遠不會離開您的電腦。新檔案只會包含您選取的頁面,且依照您輸入的順序排列,原始文件的其他部分則會保留不動。本指南將逐步說明每個步驟、選取頁面的語法、必須遵守的限制,以及在分享或封存結果前需要知道的取捨。

extract pages from pdf for beginners
Extract Pages from PDF: A Beginner's Step-by-Step Guide

擷取頁面對 PDF 做了什麼

從 PDF 擷取頁面與刪除或分割頁面是不同的。刪除是從同一個檔案中移除頁面,讓您得到原始檔案較短的版本。分割則是將一個 PDF 拆成多個較小的檔案,通常每頁一個或每個範圍一個,因此最後會得到多個檔案而非一個。擷取頁面則會建立一個全新的獨立 PDF,其中只包含您挑選的頁面,且依照您指定的順序排列,來源 PDF 在磁碟上則保持完全不變。

這個區別對初學者很重要,因為人們想「抽出」頁面的常見原因——分享單一章節、傳送幾頁已簽署的頁面、封存長篇報告的某個段落,或只提交相關表格——全都涉及將新檔案交給接收者,而不是就地編輯原始檔案。Extract PDF Pages 就是為此任務而設計的:您挑選來源、列出頁面,然後下載一個只包含這些頁面的第二個檔案。

開始前的限制與需求

在開啟工具之前,請先確認您的 PDF 符合它所接受的限制。來源必須是未加密的 PDF,大小不得超過 50 MiB(52,428,800 位元組),且頁數不得超過 500 頁。剛好達到任一限制的檔案會被接受;超過任一限制的檔案會被拒絕,而不是被截短。對於受密碼保護的檔案,本工具並不會繞過加密來開啟,因此如果您的 PDF 需要密碼才能檢視,您必須先使用另一個工具移除保護。

瀏覽器記憶體也是一個影響因素。由於新檔案是在您目前的分頁中建構,非常大或影像密集的來源 PDF 在不同裝置上的表現可能會有所不同。如果擷取感覺緩慢,關閉其他分頁可以釋放記憶體。由於所選頁面的資源(例如字型和影像)會一併複製,因此輸出檔案仍可能比您預期的大;從資源密集的文件擷取一個頁面,可能就會保留相當多的資料。

限制可接受的值
來源檔案大小最高 50 MiB(52,428,800 位元組)
來源頁數1 到 500 頁
選取欄位長度最多 4,000 字元
加密僅限未加密的 PDF
表單類型動態 XFA 表單不是支援的保留目標

如何逐步從 PDF 擷取頁面

一旦您的 PDF 符合上述限制,實際擷取的過程很短。在瀏覽器中開啟 Extract PDF Pages 工具,然後依照下列步驟操作。

  1. 從您的裝置中選擇一個未加密、且大小不超過 50 MiB、頁數不超過 500 頁的 PDF。瀏覽器會驗證檔案並在本機讀取其位元組。
  2. 依照您想要的輸出順序,輸入以 1 為起點的頁碼或包含首尾的遞增範圍,例如 5, 1-3。記號的順序很重要:5, 2-3 會產生第 5 頁,接著是第 2 和第 3 頁。
  3. 執行擷取。解析器會保留您清單中每個唯一頁面的第一次出現,並將這個精確的集合複製到一個全新的 PDF 文件中。
  4. 如果出現重複頁面的提示,請檢視它,然後下載新的 PDF。來源檔案、選取內容以及輸出結果都不會被上傳。

變更頁面運算式會立即釋放先前的結果,而再次執行擷取會取代先前的輸出 URL。選擇不同的來源檔案會清除舊的位元組、舊的選取內容、來源連結、先前的結果以及任何錯誤訊息。此工具使用了防護機制,可防止較舊的非同步載入或儲存作業覆寫較新的狀態,因此您可以放心重新執行作業,而不必擔心舊的結果會趁機混入。

頁面選取語法與順序規則

頁碼以 1 為起點,這表示第 1 頁是任何 PDF 檢視器所顯示的第一頁。記號之間以逗號或空白分隔,而連字號定義的是包含首尾的遞增範圍。解析器會依照您輸入的順序處理每一個片段,因此您輸入的順序就是新 PDF 將遵循的順序。

您輸入的內容放入新 PDF 的頁面(依序)
55
1-31, 2, 3
5, 1-35, 1, 2, 3
3, 1-33, 1, 2(第二次出現的 3 會被忽略)
5-3遭到拒絕 — 不允許遞減範圍
2.5-1600遭到拒絕 — 小數、負數以及超出範圍的頁碼都是錯誤

重複項目遵循刻意設計的「首次出現」規則。如果您列出 3, 1-3,新 PDF 會包含第 3 頁,然後是第 1 頁,再來是第 2 頁;第二次出現的第 3 頁會被忽略,結果會告訴您哪個頁碼重複了。這可以防止隨意的重疊範圍悄悄膨脹輸出檔案大小,同時保留每個頁面首次出現時的順序。輸出頁數永遠等於所選的唯一頁面數。如果您真的需要在新檔案中重複同一頁,請使用專為複製設計的頁面重新排序工作流程,而不是擷取,因為擷取工具刻意設計為每頁只取一份。

新檔案保留與遺失的內容

擷取工具複製的是實際的頁面物件,而不是將它們光柵化為螢幕擷取畫面。每個選取的頁面會保留其 90 度旋轉、裁切框、媒體框、頁面圖形,以及像影像和字型這類一般的頁面資源。新 PDF 的頁數等於您選取的唯一頁面數,而且整合測試會驗證每個輸出頁面的尺寸和身分是否與其來源頁面相符。這能抓出那些只回傳正確頁數卻複製了錯誤頁面、或在背後偷偷調整您順序的實作。

有些 PDF 功能依賴於整份文件的關聯性,無法在擷取後完好地保留。由於新 PDF 是一份獨立的文件,任何指回原始結構的內容都可能失去其錨點。下表摘要說明預期的情況。

來源 PDF 中的功能擷取後的行為
頁面旋轉、裁切框、媒體框隨每個選取的頁面一併複製
嵌入的字型和影像作為頁面資源一併複製
AcroForm 欄位、註解、指令碼、嵌入的檔案可能取決於所選頁面以外的物件
書籤、頁面標籤、大綱、跨頁連結可能取決於整份文件的結構
數位簽章將不再有效 — 新 PDF 是不同的文件
動態 XFA 表單不是 pdf-lib 中支援的保留目標

在分享或封存結果之前,請在您目標的 PDF 檢視器中開啟它,檢查頁面順序和外觀,並測試您依賴的任何連結或欄位。請保留原始 PDF,以防您需要使用不同的設定重新擷取,或還原未能保留下來的功能。如果保留簽章、XFA、無障礙結構、組合檔、附件或受監管的歸檔符合性很重要,請使用專為此目的設計的專業 PDF 編輯器,而不是擷取工具。

初學者常見的錯誤與快速修正

大多數初學者的錯誤可歸納為幾種模式。最常見的是將頁碼視為以 0 為起點 — 第 0 頁並不存在,輸入 0 會產生明確的錯誤,而不是默默略過。下一個常見的失誤是輸入遞減範圍,例如 5-3;解析器會拒絕它,而不是默默交換端點,因此錯字會立即顯示在錯誤訊息中,而不是產生令人意外的輸出順序。忘記分隔記號是另一個典型錯誤:1, 3-5, 8 有效,但若在回頭閱讀自己的輸入時沒有明確的分隔符,可能會對解析器實際讀到的內容產生差一點點的猜測。

另一個容易犯的錯誤,是假設新 PDF 會保留整份文件的功能,例如書籤、數位簽章或表單指令碼。由於擷取會建立新檔案,簽章無法維持有效,而任何引用其他頁面或附加檔案的內容都可能失去其錨點。如果您的目標是保持已簽署的合約完好無缺,請使用專業的 PDF 編輯器,而不是擷取工具。

最後,如果您的 PDF 大於 50 MiB 或超過 500 頁,工具會將其拒絕,而不是自動縮減。損壞或不支援的檔案也可能無法載入,這對於較舊的掃描檔案來說值得留意。當唯一的問題是限制時,您可以先壓縮 PDF,使其符合大小限制,然後再回來使用 Extract PDF Pages 進行實際的頁面選取。如果問題在於頁數而不是位元組大小,則將來源分割成較小的文件,然後從各部分擷取,可以用兩個步驟達到相同的結果。

若想深入了解,請參閱 Extract Links From a PDF Explained: What the Tool Reads

若想深入了解,請參閱 PDF Page Counter for Beginners: A Plain-English Guide