若要在 Adobe 工作流程中擷取 PDF 頁面,您可以在 Acrobat 中開啟「組織頁面」工具,選擇「擷取」,並儲存一個只包含您選取頁面的新檔案。基於瀏覽器的替代方案 —— 擷取 PDF 頁面 —— 會建立一個新的 PDF,但會讀取原始位元組、解析您要求的頁面清單,並在您的瀏覽器分頁內將符合的頁面物件複製到一份全新的文件。來源檔案、選取範圍與輸出結果都不會上傳至 Lizely,且新的 PDF 會透過一個暫時的本機下載網址提供。選取範圍使用一般的一起始頁碼,因此您在 Acrobat 中看到的「page 5」就是您在工具中輸入的同一個 page 5。由於原始檔案與產生的 PDF 完全不會離開您的裝置,這種方法也避開了某些 Adobe 線上服務所要求的上傳步驟,當來源包含敏感資料或您處於離線狀態時特別有用。

how to extract pdf pages in adobe
how to extract pdf pages in adobe

Adobe Acrobat 的擷取頁面功能在做什麼

Acrobat 的內建擷取功能藏在「組織頁面」工具之後,您可以從右側面板或工具中心開啟它。載入來源 PDF 後,您選取一組連續或不連續的縮圖,點擊「擷取」,Acrobat 就會寫入一個只包含這些頁面的新檔案。擷取出來的檔案會繼承原始檔案的旋轉、裁切與頁面資源,這與基於 pdf-lib 的工具對相同選取範圍所做的處理一致。Acrobat 對話框也讓您選擇「擷取後刪除頁面」,這會將所選頁面從來源檔案中移除,而不是複製出來。Adobe 的做法完全在桌面應用程式中執行,因此它依賴有效的 Acrobat 授權,以及原始檔案能在您的機器上開啟。

線上的對應版本 —— 網頁版 Acrobat —— 流程類似,但會將文件上傳到 Adobe 的伺服器進行處理。這種模式在您只能使用瀏覽器時很方便,但它需要登入,且會將您的來源位元組透過網路傳送。當目標只是「依照您輸入的順序,產生包含第 5、2、3 頁的新 PDF」時,在目前的瀏覽器分頁中執行這項工作可以讓檔案留在本機,並去除帳號需求,同時保留您所輸入的確切順序。

如何在瀏覽器中擷取 PDF 頁面

  1. 選擇一份未受密碼保護、大小不超過 50 MiB(52,428,800 位元組)、且頁數不超過 500 頁的本機 PDF。
  2. 開啟「擷取 PDF 頁面」工具,並從您的裝置載入檔案。瀏覽器會在解析任何頁面之前先驗證 PDF 的類型與大小。
  3. 以一為起始的頁碼,以及以逗號或空白分隔的遞增包含範圍 —— 例如 5, 1-3 —— 按照您想要的輸出順序輸入。
  4. 執行擷取。瀏覽器會解析這些代號,僅保留任何重複頁面的第一次出現,並使用 pdf-lib 將符合的頁面物件複製到一份全新的 PDF。
  5. 若任何代號重複了相同的頁碼,請閱讀重複頁面的通知,然後從暫時的本機網址下載新的 PDF。來源位元組、選取範圍與輸出結果都不會上傳至 Lizely。
  6. 在您平常使用的檢視器中開啟下載的 PDF,並在使用前確認頁面順序、頁面外觀,以及任何連結或表單欄位。

頁面選取語法及其產生結果

選取欄位遵循嚴格的語法,因此相同的輸入永遠會產生相同的輸出。代號為一為起始的頁碼或遞增包含範圍;代號之間以逗號或空白分隔,連字號則用於連接範圍的兩個端點。代號的順序具有意義 —— 它會成為輸出順序 —— 在第一次出現之後的任何重複代號會被忽略,同時會回報給您。像 5-3 這類遞減範圍會被拒絕,而不是悄悄反向;小數值、負值、格式錯誤的範圍,以及超出已載入文件的頁面,會以明確的錯誤訊息加以拒絕。該欄位最多接受 4,000 個字元,超過上限的輸入不會被截斷或部分套用。

輸入產生的頁面(依順序)備註
55單一頁面代號。
1, 3, 81, 3, 8以逗號分隔的單一頁碼。
3-53, 4, 5遞增包含範圍。
5, 2-35, 2, 3代號順序決定輸出順序。
3, 1-33, 1, 2第二個「3」會被忽略;系統會回報重複通知。
5-3(已拒絕)遞減範圍不會悄悄反向。

檔案限制與在邊界時會發生的情況

輸入邊界為 50 MiB,亦即 52,428,800 位元組,而解碼後的文件邊界為 500 頁。剛好達到任一邊界的檔案會被接受;更大的檔案或解碼後超過 500 頁的文件會被拒絕,而不是被縮短。輸出仍可能很大,因為所選頁面的資源(例如字型和內嵌影像)可能會被複製到新的 PDF 中,所以檔案大小不一定與頁數成正比。從資源密集的文件中擷取一頁,可能會保留該頁正確呈現所需的資料,這就是為什麼單頁輸出可能大於原始檔案的 1/N。瀏覽器記憶體也會因裝置與分頁工作量而異,因此在某個工作階段中處理得很順的檔案,在另一個可用資源較少的環境中可能會失敗。

邊界數值行為
最大來源大小50 MiB(52,428,800 位元組)在上限時可被接受;更大的檔案會被拒絕。
最大來源頁數500 頁在上限時可被接受;更長的文件會被拒絕。
最大選取長度4,000 個字元超過上限的輸入不會被截斷或部分套用。
加密不會繞過受密碼保護的 PDF 會被拒絕。
輸出格式新 PDF,採用向量頁面物件頁面是以複製方式處理,而非轉成螢幕截圖的光柵影像。

擷取會保留哪些內容、會捨棄哪些內容

每個被複製的頁面會將其旋轉、裁切框、媒體框、頁面圖形以及一般頁面資源帶入新文件。無法乾淨存留下來的,則是任何依賴於所選頁面以外物件的內容:當其支撐物件被留在原處時,AcroForm 欄位、註解、指令碼、內嵌檔案、圖層、頁面標籤、書籤、文件大綱、跨頁目的地與連結都可能會失效。建立新的 PDF 後,數位簽章將不再有效,因為位元組層級的雜湊值已經改變。在 pdf-lib 中,動態 XFA 表單並非支援的保留目標,因此任何基於 XFA 的表單都應在其原始編輯軟體中處理,而非交由擷取工具處理。受損或不支援的檔案也可能無法載入,且載入器不會繞過加密去窺探受保護的文件。

在使用前驗證輸出結果

由於擷取本質上會破壞整份文件的結構,花幾分鐘做一次快速驗證是值得的。將新 PDF 的頁數與您選取範圍中不重複的頁數進行比對;兩者應該完全相符,因為「首次出現」規則保證輸出頁面不會重複。抽樣檢查第一頁與最後一頁,然後捲動瀏覽以確認您所要求的順序。開啟任何跨頁連結以及您工作流程所依賴的任何表單欄位。如果原始檔案已簽署,新的 PDF 將不會處於已簽署狀態,因此若簽章有效性很重要,請從來源重新簽署。如果您的作業流程涉及受規範的歸檔符合性、無障礙結構或 XFA 行為,請將來源檔案交由適當的專業編輯器處理,並將本工具僅視為快速的擷取步驟。

對於已經擁有 Adobe Acrobat 授權且需要完整「組織頁面」保真度的團隊而言,桌面工具仍然是最安全的方式。對於其他人 —— 任何使用借用中的機器、身處嚴格防火牆後,或只是想要進行單次擷取的使用者 —— 上述瀏覽器工作流程可以產生一份新 PDF,順序依照您輸入的內容,且來源位元組在整個過程中都停留在裝置上。

若您正在權衡各種選項,如何在瀏覽器中從 PDF 擷取所有影像 對此有詳細說明。

若您正在權衡各種選項,如何在 Adobe Acrobat 中擷取 PDF 頁面 對此有詳細說明。