從 PDF 中提取純文字以便校對、編輯或重新排版以供印刷的最快方法是直接在瀏覽器中使用 PDF to Text Converter 擷取 PDF 的可選取文字圖層。此工具會讀取內嵌在每一頁中的文字指令,並將其組合成一個 UTF-8 文字檔案,您可以複製或下載,無需上傳文件。對於印刷工作流程來說,這讓您能取得純文字內容而不含視覺版面,因此您可以將其貼到文書處理器中、修正錯字、調整換行,或在將文件送印之前,將轉錄稿與印刷校樣進行比對。此轉換器遵循 PDF 實際儲存文字項目的順序,而非您在頁面上閱讀的順序,這意味著它最適合作為校對用的草稿,而非已完成排版的文件。它不會執行 OCR,因此一張僅含有頁面大小影像的掃描 PDF 將產生極少或沒有文字;對於這類文件,您需要先透過另一套 OCR 工作流程才能對結果進行任何處理。
印刷準備是將 PDF 轉換為純文字最實際的用途之一。大多數印刷問題——錯誤的邊距、斷裂的表格、重複的頁首、遺漏的頁碼——在純文字轉錄稿中都比在已渲染的 PDF 中更容易發現,而且文字傾印也是將文字內容送入不同排版工具、引報單或給同事的校樣的最乾淨方式。

為何要在印刷前先從 PDF 中提取文字
在數個印刷任務中,PDF 的純文字版本比 PDF 本身更實用:
- 在耗費紙張與墨水前先進行校對。 長篇文件、合約以及翻譯內容,幾乎總是能在頁面從印表機輸出前,先在螢幕上快速讀過一遍而受益。
- 校驗正文內容。 您可能需要確認字數、擷取特定條款,或為其他文件抽取一段文字作為引用。
- 為不同版面重新排版。 新的印表機、新的紙張尺寸或小冊子版面,可能迫使您必須從文字而非原始 PDF 來重建頁面。裁切 PDF 以供印刷 通常會與此步驟搭配進行,以節省墨水並縮小邊距。
- 編排頁碼。 一旦文字進入文書處理器,您就可以重新編上頁碼;若您希望頁碼出現在原始 PDF 上,請參閱 在印刷前為 PDF 加入頁碼。
- 檢查檔案是否根本具有可用的文字圖層。 在將檔案送印之前,先執行一次擷取器是快速確認您面對的是文字 PDF 還是純影像掃描檔的方法。
所有這些任務都有一個共同的起點:把文字從 PDF 中取出,以便您能加以操作。PDF to Text Converter 正是專為這個起點所設計。
轉換器如何讀取您的 PDF
在底層,此工具會在您按下轉換按鈕的瞬間,向 Mozilla 請求 PDF.js 函式庫,然後依序向它索取每一頁的文字內容。PDF.js 會走訪頁面的繪製指令,並公開可見的文字項——原始排版軟體置入的字串、字體參考、位置以及行尾標記。轉換器會收集這些字串,遵循 PDF 本身所要求的換行,並在 PDF.js 未分隔的相鄰項目之間,插入一個保守的單一空格。
在處理完每一頁後,工具會在合併的輸出中寫入明確的分頁符號,以確保第一頁與第二頁之間的界線永遠不會模糊。空白頁仍會反映在頁數計數與分頁符號清單中,因此一份在第 7 頁含有空白頁的 12 頁 PDF,仍會回報 12 頁,並仍會在第 6 頁與第 7 頁之間顯示分頁符號。最終產出是一份 UTF-8 純文字文件,以 Blob 形式供下載,並以純文字形式呈現於頁面上的預覽區中供您複製。
所有這些解析作業都在您目前的瀏覽器分頁中進行。PDF 本身從不離開您的裝置,也沒有任何文件處理服務會接收到其中的文字。
哪些類型的 PDF 能提供可用於印刷的文字
並非每個 PDF 在您要求其文字時都會有相同的表現。下表總結了當您擷取文字以準備印刷時,從最常見的來源類型可以獲得什麼結果。
| 來源 PDF 類型 | 轉換器擷取到的內容 | 從印刷角度來看 |
|---|---|---|
| 數位建立(Word、InDesign、LaTeX 匯出) | 完整可選取文字,包含頁首、頁尾及任何內嵌 Unicode | 校對草稿或出版編的最佳來源;版面將是平面式的,而非排版完成 |
| 可搜尋的掃描檔(已執行過 OCR) | 大部分文字,偶有辨識錯誤的字形,無視覺版面 | 足以進行內容審閱;請留意多餘字元、連字以及遺漏的空格 |
| 僅含影像的掃描檔(未套用 OCR) | 極少或沒有文字——頁面僅是一張圖片 | 無法用於文字擷取;請先將其送入 OCR 工作流程 |
| 已填寫表單的 PDF | 依 PDF.js 項目順序取得的文字,受相同版面限制 | 適用於校驗欄位內容;視覺版面會塌縮為平面清單 |
| 多欄或複雜版面 | 依 PDF.js 順序而非視覺閱讀順序取得的文字 | 可用於引用或搜尋,但不適合用於重建印刷頁面 |
共通點在於:轉換器會讀取 PDF 已經具備的文字圖層。若您能在一般 PDF 檢視器中用游標選取文字,那麼它就具有文字圖層,工具就能擷取它。若您能看見文字卻無法選取,那麼該檔案就是僅含影像的檔案,您需要先進行 OCR,此工具才會有用。
從 PDF 中擷取文字以供印刷
以下是從一份已儲存的 PDF 到一份可在印刷前編輯或貼入新版面的純文字檔案的精確步驟。
- 在瀏覽器中開啟 PDF to Text Converter。 此時尚未載入任何檔案——工具會在您按下轉換按鈕前保持閒置。
- 從您的電腦中選擇一份非空白的 PDF,檔案大小上限為 25 MiB。 若該檔案是純影像掃描檔,轉換器將僅回傳極少或沒有文字,您將需要另行執行 OCR 步驟。
- 點選 Convert to Text。 工具會載入 PDF.js,依序走訪每一頁,並讀取 PDF.js 能公開的有界文字項目。
- 閱讀預覽內容,包含頁數與字元數。 預覽會以清楚的分頁符號顯示合併後的結果,讓您能精確看到處理了幾頁、產出了多少文字。
- 複製文字或下載 UTF-8 TXT 檔案。 下載使用從來源 PDF 衍生的固定檔名,複製與下載都作用於同一份組裝完成的結果。選擇新的輸入會清除任何過期的輸出,因此計數永遠描述的是目前的擷取結果,而非先前的結果。
一旦文字進入您的文書處理器,您就可以修正錯字、收緊換行、為新的紙張尺寸設定邊距,並從一份已知乾淨的草稿重新列印,而非從原始 PDF 列印。
閱讀輸出並將其轉為可印刷的草稿
預覽窗格是惰性的純文字。工具不會將標題、連結或內嵌字體渲染為 HTML、不會追蹤超連結、也不會擷取外部資源——您所看到的每一個字,都正是 PDF 文字圖層中所包含的內容。這讓輸出可預期且複製時安全,但這也意味著您不會看到斜體、粗體或影像:那些屬於 PDF 的視覺圖層,而非文字串流。
分頁符號是印刷工作流程中最實用的功能。合併輸出的每一頁之間都會出現一個分頁符號,因此當您捲動草稿時,永遠都能知道每個區塊來自哪一實體頁面。若您發現段落遺漏、頁首重複,或出現不該有的頁尾,分頁符號會精確指出您應在來源 PDF 中的何處查看。
輸出中有一點值得注意,那就是項目的排列順序。PDF 是以文字在排版時被置入的順序來儲存,而非以人類閱讀的順序。一篇兩欄文章通常會輸出為第一欄的第一行,接著是第二欄的第一行,然後是第一欄的第二行,接著是第二欄的第二行,依此類推。對於引用或快速校對來說這沒問題;但對於需要重建以符合原始版面的輸出,您將必須手動重新排序,或使用更懂版面的工具。
限制、錯誤以及何時該選擇其他工具
此轉換器設有嚴格的界限,以維持瀏覽器分頁的回應速度。單一檔案上限為 25 MiB,上限為 40 頁。同時對文字項目數量設有每頁限制、對單一項目長度設有上限,並設有總輸出字元預算。若超過任何一項限制,工具會回傳錯誤,而非一份看起來完整但其實不完整的部分結果。
在您開始之前,以下情況也值得了解:
- 已加密或有密碼保護的 PDF。 此工具不會繞過密碼。請先使用支援您已知密碼的工具移除保護,再進行擷取。
- 損壞、格式錯誤或不支援的檔案。 解析器將會失敗而不會自行猜測。內建並無修復步驟。
- 僅含影像的掃描檔。 此轉換器不會執行 OCR。若預覽為空或近乎為空,請先將文件送入 OCR 工作流程,然後再回到文字擷取器。
- 需要保留視覺精緻度時。 若您需要印刷頁面看起來與 PDF 完全相同——包括表格、側邊欄與影像——請擷取文字作為參考,但將原始 PDF 送印,或使用頁面影像工具將 PDF 渲染為 JPG 或 PNG。
- 書籤或大綱擷取。 此工具僅回報文字與頁面邊界。它不會列出連結、表單欄位或文件大綱項目。
對於大多數印刷準備工作——校對、引用、重建簡單版面,以及檢查 PDF 是否具有文字圖層——PDF to Text Converter 是正確的第一步。它在本機執行,不會上傳檔案,並能以可立即清理並重新列印的形式將文字提供給您。