Extract PDF Pages 可處理上限 50 MiB 與 500 頁的 PDF,只將您指定的頁面複製到一個新的可下載檔案中,而且這個檔案絕不會離開您的瀏覽器。超過任一限制的檔案會直接被拒絕,而不是被靜悄悄地修剪,因此可萃取的最大檔案大小與頁數是硬性上限,而非彈性目標。讀取來源、解析您的選擇、複製相關的頁面物件、儲存結果、以及準備下載,整個流程都在本機完成 — 您的檔案、您的選擇、以及您的輸出都保留在目前的裝置上。如果您的 PDF 超過 50 MiB 或超過 500 頁,在這個工具能幫上忙之前,您需要採用其他作法。在這些限制之內,輸出順序由代碼順序控制,重複的頁面會保留第一次出現的版本,後續出現的則會被回報。

extract pages from pdf large file
從大型 PDF 萃取頁面:大小與頁數限制

「大型」對 PDF 通常代表什麼

PDF 變得「大型」有三種不同的方式,而每一種都會對萃取產生不同的影響。最常見的原因是頁數眾多:一本 200 頁的掃描書籍或一本 400 頁的參考手冊,每頁可能只有幾 MB,但當您只需要其中少數章節時,就會顯得笨重。第二個原因是頁數較少但嵌入了沉重的資源—— 高解析度照片、向量繪圖、自訂字型子集、或掃描圖層—— 這可能讓一份 30 頁的文件超過 100 MiB。第三個原因是重複:一堆幾乎相同的表單目錄、一包附件,或類似作品集的文件,其中大部分位元組存在於共用資源而非獨特的頁面中。了解您的檔案屬於哪一種「大型」很重要,因為工具的限制同時以檔案大小和頁數表示,而單一一頁 20 MiB 的內容就可能耗盡位元組預算,卻仍讓您遠在頁數預算之內。

Extract PDF Pages 如何處理大型檔案

Extract PDF Pages 在任何處理開始前套用兩個硬性上限:輸入檔案必須為 50 MiB 或更小(剛好 52,428,800 位元組),且解碼後的文件必須包含 1 到 500 頁之間。剛好位於任一邊界值的檔案會被接受;超過任一邊界的檔案會被直接拒絕,而不是被縮短。瀏覽器在 pdf-lib 的 PDFDocument API 載入來源之前,會先檢查 PDF 的 MIME 類型或副檔名以及位元組上限,並且不會略過加密,這表示受密碼保護的檔案即使您知道密碼,也無法在此開啟。由於每個步驟都在本機執行——讀取位元組、解析您的頁面運算式、將選取的頁面物件複製到新文件、儲存結果,並透過暫時的物件 URL 將其公開——因此不會上傳,這讓這個工具在處理您不想傳送到遠端伺服器的大型內部文件時特別實用。相關的萃取指南。

邊界數值在上限時的行為
輸入檔案大小上限50 MiB (52,428,800 位元組)接受;較大的檔案會被拒絕
頁數上限500 頁接受;較長的文件會被拒絕
選擇欄位長度4,000 字元超過上限的輸入會被拒絕,而非截斷
加密不會略過受密碼保護的檔案無法開啟
處理位置僅限瀏覽器不會上傳來源、選擇或輸出

從大型 PDF 萃取頁面(逐步操作)

依照下列步驟,從落在 50 MiB 與 500 頁範圍內的檔案萃取出特定頁面。

  1. 在您目前的瀏覽器中開啟 Extract PDF Pages,然後點擊檔案選擇器來選擇本機的 PDF。確認檔案未加密、大小為 50 MiB 或更小,且包含 500 頁或更少;否則瀏覽器會拒絕載入。
  2. 使用以 1 為起始的頁碼以及包含首尾的遞增範圍(以逗號或空白分隔),將您的選擇輸入到頁面欄位中。對於一本第七章從第 47 頁開始的大型手冊,像 47-58, 5, 1-3 這樣的輸入代表:依原順序取第 47 到 58 頁,然後是第 5 頁,再來是第 1 到 3 頁——總共 16 頁。
  3. 將您的運算式控制在 4,000 字元以內;較長的內容會被完整拒絕,而非悄悄截斷。如果您的選擇很龐大,請將其分成多次執行,然後再將產生的 PDF 串接起來。
  4. 執行萃取。工具會驗證每個代碼,捨棄像 5-3 這樣的遞減範圍,拒絕小數、負數以及格式錯誤的範圍,並對任何落在已載入文件範圍之外的頁面標示明確的錯誤。
  5. 如果出現重複通知,請閱讀其內容。解析器會保留每個頁面第一次出現的位置,因此 3, 1-3 會先產生第 3 頁,然後是第 1 頁,再來是第 2 頁——輸入中第二次出現的第 3 頁會被忽略,且該重複會在結果中被回報。
  6. 從暫時連結下載新的 PDF。載入不同的檔案或重新執行萃取會取代先前的輸出;關閉頁面則會完全釋放暫時的 URL。
  7. 在您目標的檢視器中開啟下載的檔案,逐頁檢查頁面順序,並確認您所依賴的字型、影像以及任何連結都能如您預期地呈現,再進行分享或列印。

輸出大小、記憶體與資源沉重的頁面

大型 PDF 一個常見的意外是,輸出大小並非與頁數成正比。選取的頁面物件會帶著它們自己的資源——字型、影像、色彩描述檔、表單 XObjects——而這些資源會連同頁面一起被複製到新文件中。因此,從一份嵌入了 30 MB 影像的型錄中萃取單一一頁,可能會產生一個只比來源略小一點的輸出,即使頁數減少了 99%。相反的情況也可能發生:從一份 400 頁的簡報中移除重複的資源,可以大幅縮減檔案大小,因為共用的字型和影像不再被參考。瀏覽器的可用記憶體會因裝置和分頁的工作量而異,因此一份在桌上型電腦上能順利載入的 50 MiB 檔案,在記憶體較少的筆記型電腦或較舊的手機上可能會卡住。如果萃取在中途失敗,暫時的結果連結會在下次執行時被取代,而不會懸置未清,指向原始本機檔案的來源連結則是您輸入檔案唯一持續存在的參考。關閉頁面會釋放所有暫時的 URL。

重複、範圍與解析器規則

由於解析器與在正式環境和測試中所使用的相同,因此其行為是確定性的,而非盡力而為。代碼會依照您輸入的順序處理,而該順序就成為輸出順序,因此 5, 2-3 會產生一個 PDF,其第一頁是原始的第 5 頁,第二頁和第三頁則是原始的第 2 和第 3 頁。重複規則是「以第一次出現為準」:如果您列出 3, 1-3, 3,結果會是第 3 頁、第 1 頁、第 2 頁——第三次出現的第 3 頁會被回報為重複並忽略。像 5-3 這樣的遞減範圍會被明確的錯誤拒絕,而不會被反轉為 3-5,小數值、負數、格式錯誤的範圍以及任何超過已載入文件的頁碼也是如此。這種嚴格是刻意的:它能避免那種會讓一個打字錯誤變成錯誤交付物的靜默重新排序。如果您真的需要在輸出中保留重複的頁面,請使用為此設計的工作流程——這個工具是為了去除重複而打造,而非複製。正式環境的萃取器會載入原始位元組、驗證以 0 為起始的唯一索引、建立新的 PDFDocument、依照解析順序複製頁面、儲存它,並透過暫時的本地物件 URL 公開新的位元組。

萃取後會保留與不會保留的內容

萃取頁面是對 PDF 的一種結構性變更,而非無損複製。工具會複製每個選取頁面的物件——包括其 90 度旋轉、裁切框、媒體框、頁面圖形以及一般的頁面資源——而不會將頁面點陣化為影像,因此視覺保真度得以保留。然而,有幾項功能依賴於跨文件的關聯性,這些關聯性無法隨著頁面子集乾淨地一起搬遷。數位簽章在不同的 PDF 中將不再有效,因此任何在此萃取的已簽署頁面都不再是已簽署狀態。AcroForm 欄位、註解、腳本、嵌入檔案、圖層、頁面標籤、書籤、文件大綱、跨頁目的地以及連結,可能會參考到所選頁面之外的物件,因此在輸出中的行為可能無法預期。動態 XFA 表單根本不在支援的保留範圍內,這是依據底層 pdf-lib 函式庫的 加密與 XFA 處理 方式。這個工具並不保證每一項互動、導覽、簽署或封存的特性都能保留——它會產生一個包含您所要求頁面的全新有效 PDF,而確認結果是否符合預期則是您的責任。對於需要符合規範、簽章或可存取性結構的相關文件,請保留原始 PDF,並使用專業編輯軟體進行驗證。

在您依賴結果之前進行檢查

由於這個工具會回報重複並拒絕錯誤的輸入,但不會驗證互動功能,最終的檢查責任在您身上。請在收件者將使用的檢視器中開啟新的 PDF,逐頁比對頁面順序與原始頁碼,並測試任何對您工作流程重要的連結、表單欄位或註解。使用工具為此目的所提供的本機來源連結,將尺寸和方向與來源進行比較。如果輸出比您預期的大,那是資源複製的效果,而非錯誤:新檔案只包含您選取的頁面,但這些頁面仍然帶著它們所需的字型和影像。在這個工具中一個真正的整合測試,會建立具有不同大小和識別碼的來源頁面,透過正式環境的函式進行萃取,儲存輸出,重新開啟它,並驗證頁數、輸出順序、尺寸和識別——以揪出那些只回傳正確頁數,卻複製錯誤頁面或排序錯誤使用者順序的實作。如果您所依賴的功能無法保留,原始 PDF 仍保留在您的裝置上;沒有任何內容被上傳,因此沒有遠端副本需要清理。

相關閱讀:在您的瀏覽器中免費、無限量地萃取 PDF 連結。