從 PDF 中提取純文字以便校對、編輯或重新排版以供印刷的最快方法是直接在瀏覽器中使用 PDF to Text Converter 擷取 PDF 的可選取文字圖層。此工具會讀取內嵌在每一頁中的文字指令,並將其組合成一個 UTF-8 文字檔案,您可以複製或下載,無需上傳文件。對於印刷工作流程來說,這讓您能取得純文字內容而不含視覺版面,因此您可以將其貼到文書處理器中、修正錯字、調整換行,或在將文件送印之前,將轉錄稿與印刷校樣進行比對。此轉換器遵循 PDF 實際儲存文字項目的順序,而非您在頁面上閱讀的順序,這意味著它最適合作為校對用的草稿,而非已完成排版的文件。它不會執行 OCR,因此一張僅含有頁面大小影像的掃描 PDF 將產生極少或沒有文字;對於這類文件,您需要先透過另一套 OCR 工作流程才能對結果進行任何處理。

印刷準備是將 PDF 轉換為純文字最實際的用途之一。大多數印刷問題——錯誤的邊距、斷裂的表格、重複的頁首、遺漏的頁碼——在純文字轉錄稿中都比在已渲染的 PDF 中更容易發現,而且文字傾印也是將文字內容送入不同排版工具、引報單或給同事的校樣的最乾淨方式。

pdf to text for printing
用於印刷的 PDF 轉文字:送印前先校對

為何要在印刷前先從 PDF 中提取文字

在數個印刷任務中,PDF 的純文字版本比 PDF 本身更實用:

  • 在耗費紙張與墨水前先進行校對。 長篇文件、合約以及翻譯內容,幾乎總是能在頁面從印表機輸出前,先在螢幕上快速讀過一遍而受益。
  • 校驗正文內容。 您可能需要確認字數、擷取特定條款,或為其他文件抽取一段文字作為引用。
  • 為不同版面重新排版。 新的印表機、新的紙張尺寸或小冊子版面,可能迫使您必須從文字而非原始 PDF 來重建頁面。裁切 PDF 以供印刷 通常會與此步驟搭配進行,以節省墨水並縮小邊距。
  • 編排頁碼。 一旦文字進入文書處理器,您就可以重新編上頁碼;若您希望頁碼出現在原始 PDF 上,請參閱 在印刷前為 PDF 加入頁碼。
  • 檢查檔案是否根本具有可用的文字圖層。 在將檔案送印之前,先執行一次擷取器是快速確認您面對的是文字 PDF 還是純影像掃描檔的方法。

所有這些任務都有一個共同的起點:把文字從 PDF 中取出,以便您能加以操作。PDF to Text Converter 正是專為這個起點所設計。

轉換器如何讀取您的 PDF

在底層,此工具會在您按下轉換按鈕的瞬間,向 Mozilla 請求 PDF.js 函式庫,然後依序向它索取每一頁的文字內容。PDF.js 會走訪頁面的繪製指令,並公開可見的文字項——原始排版軟體置入的字串、字體參考、位置以及行尾標記。轉換器會收集這些字串,遵循 PDF 本身所要求的換行,並在 PDF.js 未分隔的相鄰項目之間,插入一個保守的單一空格。

在處理完每一頁後,工具會在合併的輸出中寫入明確的分頁符號,以確保第一頁與第二頁之間的界線永遠不會模糊。空白頁仍會反映在頁數計數與分頁符號清單中,因此一份在第 7 頁含有空白頁的 12 頁 PDF,仍會回報 12 頁,並仍會在第 6 頁與第 7 頁之間顯示分頁符號。最終產出是一份 UTF-8 純文字文件,以 Blob 形式供下載,並以純文字形式呈現於頁面上的預覽區中供您複製。

所有這些解析作業都在您目前的瀏覽器分頁中進行。PDF 本身從不離開您的裝置,也沒有任何文件處理服務會接收到其中的文字。

哪些類型的 PDF 能提供可用於印刷的文字

並非每個 PDF 在您要求其文字時都會有相同的表現。下表總結了當您擷取文字以準備印刷時,從最常見的來源類型可以獲得什麼結果。

來源 PDF 類型 轉換器擷取到的內容 從印刷角度來看
數位建立(Word、InDesign、LaTeX 匯出) 完整可選取文字,包含頁首、頁尾及任何內嵌 Unicode 校對草稿或出版編的最佳來源;版面將是平面式的,而非排版完成
可搜尋的掃描檔(已執行過 OCR) 大部分文字,偶有辨識錯誤的字形,無視覺版面 足以進行內容審閱;請留意多餘字元、連字以及遺漏的空格
僅含影像的掃描檔(未套用 OCR) 極少或沒有文字——頁面僅是一張圖片 無法用於文字擷取;請先將其送入 OCR 工作流程
已填寫表單的 PDF 依 PDF.js 項目順序取得的文字,受相同版面限制 適用於校驗欄位內容;視覺版面會塌縮為平面清單
多欄或複雜版面 依 PDF.js 順序而非視覺閱讀順序取得的文字 可用於引用或搜尋,但不適合用於重建印刷頁面

共通點在於:轉換器會讀取 PDF 已經具備的文字圖層。若您能在一般 PDF 檢視器中用游標選取文字,那麼它就具有文字圖層,工具就能擷取它。若您能看見文字卻無法選取,那麼該檔案就是僅含影像的檔案,您需要先進行 OCR,此工具才會有用。

從 PDF 中擷取文字以供印刷

以下是從一份已儲存的 PDF 到一份可在印刷前編輯或貼入新版面的純文字檔案的精確步驟。

  1. 在瀏覽器中開啟 PDF to Text Converter。 此時尚未載入任何檔案——工具會在您按下轉換按鈕前保持閒置。
  2. 從您的電腦中選擇一份非空白的 PDF,檔案大小上限為 25 MiB。 若該檔案是純影像掃描檔,轉換器將僅回傳極少或沒有文字,您將需要另行執行 OCR 步驟。
  3. 點選 Convert to Text。 工具會載入 PDF.js,依序走訪每一頁,並讀取 PDF.js 能公開的有界文字項目。
  4. 閱讀預覽內容,包含頁數與字元數。 預覽會以清楚的分頁符號顯示合併後的結果,讓您能精確看到處理了幾頁、產出了多少文字。
  5. 複製文字或下載 UTF-8 TXT 檔案。 下載使用從來源 PDF 衍生的固定檔名,複製與下載都作用於同一份組裝完成的結果。選擇新的輸入會清除任何過期的輸出,因此計數永遠描述的是目前的擷取結果,而非先前的結果。

一旦文字進入您的文書處理器,您就可以修正錯字、收緊換行、為新的紙張尺寸設定邊距,並從一份已知乾淨的草稿重新列印,而非從原始 PDF 列印。

閱讀輸出並將其轉為可印刷的草稿

預覽窗格是惰性的純文字。工具不會將標題、連結或內嵌字體渲染為 HTML、不會追蹤超連結、也不會擷取外部資源——您所看到的每一個字,都正是 PDF 文字圖層中所包含的內容。這讓輸出可預期且複製時安全,但這也意味著您不會看到斜體、粗體或影像:那些屬於 PDF 的視覺圖層,而非文字串流。

分頁符號是印刷工作流程中最實用的功能。合併輸出的每一頁之間都會出現一個分頁符號,因此當您捲動草稿時,永遠都能知道每個區塊來自哪一實體頁面。若您發現段落遺漏、頁首重複,或出現不該有的頁尾,分頁符號會精確指出您應在來源 PDF 中的何處查看。

輸出中有一點值得注意,那就是項目的排列順序。PDF 是以文字在排版時被置入的順序來儲存,而非以人類閱讀的順序。一篇兩欄文章通常會輸出為第一欄的第一行,接著是第二欄的第一行,然後是第一欄的第二行,接著是第二欄的第二行,依此類推。對於引用或快速校對來說這沒問題;但對於需要重建以符合原始版面的輸出,您將必須手動重新排序,或使用更懂版面的工具。

限制、錯誤以及何時該選擇其他工具

此轉換器設有嚴格的界限,以維持瀏覽器分頁的回應速度。單一檔案上限為 25 MiB,上限為 40 頁。同時對文字項目數量設有每頁限制、對單一項目長度設有上限,並設有總輸出字元預算。若超過任何一項限制,工具會回傳錯誤,而非一份看起來完整但其實不完整的部分結果。

在您開始之前,以下情況也值得了解:

  • 已加密或有密碼保護的 PDF。 此工具不會繞過密碼。請先使用支援您已知密碼的工具移除保護,再進行擷取。
  • 損壞、格式錯誤或不支援的檔案。 解析器將會失敗而不會自行猜測。內建並無修復步驟。
  • 僅含影像的掃描檔。 此轉換器不會執行 OCR。若預覽為空或近乎為空,請先將文件送入 OCR 工作流程,然後再回到文字擷取器。
  • 需要保留視覺精緻度時。 若您需要印刷頁面看起來與 PDF 完全相同——包括表格、側邊欄與影像——請擷取文字作為參考,但將原始 PDF 送印,或使用頁面影像工具將 PDF 渲染為 JPG 或 PNG。
  • 書籤或大綱擷取。 此工具僅回報文字與頁面邊界。它不會列出連結、表單欄位或文件大綱項目。

對於大多數印刷準備工作——校對、引用、重建簡單版面,以及檢查 PDF 是否具有文字圖層——PDF to Text Converter 是正確的第一步。它在本機執行,不會上傳檔案,並能以可立即清理並重新列印的形式將文字提供給您。