若要在 Word 中將 PDF 轉換為文字,請將可選取的 PDF 文字擷取為 UTF-8 TXT 檔、檢視內容,然後貼到 Microsoft Word 中。 PDF to Text Converter 會在您目前的覽器分頁中執行取,並產生以頁面分隔的文字,供複製或下載。它僅會讀取 PDF.js 能存取到的文字圖層;不會建立 DOCX、辨識影像中的文字,也不會將 PDF 重新建構成可編輯的 Word 版面配置。對於以數位方式建立且含有可選取字元的 PDF,這個方法可提供可編輯的文字,讓您貼到空白或既有的 Word 文件中。可接受的檔案不得為空、不得超過 25 MiB,且不得超過 40 頁。該工具也會套用內部的項目與字元限制。若檔案超出處理上限,轉換會傳回錯誤,而非看似完整但其實不完整的部分結果。來源 PDF 絕不會被修改。若您在一般 PDF 檢視器中能看到文字卻無法選取,請改用獨立的 OCR 工作流程。貼上後,請先檢視頁面邊界、頁首、欄位、表格、符號與間距,再依賴 Word 中的文字。這個方法最適合用於引用可存取的文字、建立粗略的可搜尋草稿,或將簡單的頁面文字移入 Word。當視覺呈現的精確度比可編輯文字更重要時,請將頁面渲染為影像並與 PDF 進行比對。

轉換器為 Word 產生什麼內容
轉換器會建立一個純文字的中介檔,而非原生的 Word 檔案。其輸出包含 PDF.js 從每個頁面讀取到的可選取字元,並依照文件與擷取函式庫所提供的頁面順序排列。合併後的報告會為每個頁面提供明確的分隔符號,包括空白的來源頁面。頁數與字元計數可協助您在將結果移入 Word 之前先行檢查。
從預複製與下載 TXT 檔會產生相同的組裝結果。下載檔案以 UTF-8 編碼,並會以來源 PDF 衍生出固定的檔名。這讓文字易於儲存、重新開啟、搜尋,或貼到其他編輯器中。
| 輸出特性 | PDF to Text Converter 的處理方式 | 在 Word 中的預期結果 |
|---|---|---|
| 檔案格式 | 建立 UTF-8 純文字文件。 | 可編輯的文字,而非重建的 DOCX 版面配置。 |
| 頁面邊界 | 分隔每個來源頁面,並表示空白頁面。 | 在新增 Word 分頁符號之前,請將每個分隔符號作為檢視節點。 |
| 文字排列 | 遵循 PDF.js 的項目順序,保留明確的換行,並加入保守的空白。 | 純文字不保證具有段落、欄位或表格儲存格結構。 |
| 掃描頁面 | 僅擷取 PDF.js 能讀取的文字;不會執行 OCR。 | 純影像的掃描頁可能只貢獻少量文字或完全沒有文字。 |
將 PDF 轉換為 UTF-8 文字
首先請直接處理 PDF 本身。將檔案保留在本機並先檢查其文字圖層,可避免結果進入 Word 時出現意外。
- 選擇一個 PDF。 開啟 PDF to Text Converter,並選擇一個不為空、且不超過 25 MiB 的本機 PDF。文件最多可包含 40 頁。若檔案為純影像的掃描頁,請注意此轉換器僅擷取可選取的文字圖層,因此這類頁面幾乎不會回傳文字;需要獨立的 OCR 工作流程來辨識影像。
- 開始轉換。 點選 Convert to Text。接著工具會載入 PDF.js 及其共用 worker,在目前的瀏覽器分頁中讀取文件,並保留每個頁面可取得的字串文字項目。系統會以有界限的頁面順序處理這些項目,而不是嘗試將頁面解讀為文書處理文件。
- 檢視預覽結果。 檢查頁面分隔符號、頁數與字元計數。空白頁面在組裝後的報告中仍會顯示,因此頁面呈現會與來源保持一致。同時請留意重複的頁首、不尋常的間距,或可能以不同閱讀順序呈現的區段。
- 複製或下載結果。 可使用預覽的複製控制項,或下載組裝後的 UTF-8 TXT 檔。兩種動作都會針對同一個擷取結果進行操作。更換輸入檔會清除先前的輸出,避免將舊的頁數與字元計數誤認為新文件的結果。
若檔案觸發處理錯誤,請確認其是否符合檔案、頁數、項目或字元的限制。超出適用上限的文件不會以部分成功的方式回傳。加密、格式錯誤、不受支援或損毀的 PDF 也可能會失敗。
將擷取的文字放入 Microsoft Word
轉換器只處理到 TXT 階段,因此 Microsoft Word 仍是最終的編輯端。當您想立即貼上時請使用預覽;當您需要先儲存複本再繼續時,請下載 TXT 檔。
- 複製擷取的文字。 在轉換器的預中,點選複製控制項並選取所有可見的文字。在 Windows 上請按 Ctrl+C。在 macOS 上請按 Command+C。若您下載了 TXT 檔,請開啟該檔案、選取其內容,並以相同方式複製。
- 開啟目的地文件。 啟動 Microsoft Word,並開啟空白文件或擷取文字所要放入的文件。將插入點置於要開始貼上該段文字的位置。
- 將文字貼到 Word 中。 在 Windows 上按 Ctrl+V,或在 macOS 上按 Command+V。由於來源為純文字,Word 接收到的會是不含 PDF 版面配置的擷取文字。若 Word 提供多種貼上選項,請選擇僅貼上文字的選項。
- 檢視每個頁面邊界。 將每個轉換器的頁面分隔符號對應到相應的 PDF 頁面。檢查每個區段的開頭與結尾,然後檢查欄位、側邊欄、表單、表格、頁首、頁尾、科學記號,以及重複的間距。僅在需要呈現來源分頁的位置手動插入 Word 分頁符號。
- 儲存檢視過的文件。 使用 Word 的 另存新檔 指令,並選擇 Word 文件 或 .docx。最後產生的 Word 檔案是根據您所貼上並檢視過的文字;它並非 PDF 的精確視覺重建結果。
若是下載的檔案,另一個直接的做法是在 Word 中開啟 UTF-8 TXT 文件、於該處進行檢視,然後另存為 DOCX 複本。若 Word 詢問要使用的編碼,請選擇 UTF-8。無論採用哪種方式,最終都會得到相同的可編輯純文字起點。
檢視讀順序與視覺結構
PDF 文字是定位在頁面上的,而非像 Word 那樣以一般段落形式儲存。一個 PDF 也可能包含多個視覺區域的文字項目,包括欄位、側邊欄、表格、頁首與頁尾。轉換器會遵循 PDF.js 所公開的項目順序,並在相鄰項目之間以保守方式插入空白。它並不保證能重建複雜的視覺關係。
PDFPageProxy API 記錄了用於取得每頁文字內容的頁面層級 PDF.js 介面。以這種方式存取文字雖然能進行擷取,但並不提供 Word 樣式的段落語意。因此,逐字元繪製的文字、不尋常的字元間距,或不同的輔助功能順序,都可能產生缺漏或與視覺頁面不同的順序。
請特別留意每個分隔頁面的第一行與最後一行。重複的頁首與頁尾可能會依照 PDF 本身的結構出現。表格與多欄版面可能會失去視覺對齊,科學記號若未對照來源也較難判讀。預覽為惰性的純文字:它不會渲染 HTML、不會執行內嵌的 PDF 指令碼,也不會啟動連結。在引用或用於重要文件之前,請將結果與原始檔案進行核對。
將 OCR 用於純影像掃描
選取是最快速的測試方式。請在一般檢視器中開啟 PDF 並嘗試反白一段句子。若您能看到文字卻無法選取或複製,該檔案很可能為純影像。一個掃描頁面可能僅包含一個與頁面同大小的影像,讓轉換器只能取得極少或完全沒有可選取的文字。
本工具不會執行光學字元辨識,也不會為這些頁面影像虛構逐字稿。以數位方式建立的 PDF 較有可能包含 PDF.js 能公開的字元、字型參考、位置與文字顯示指令。若為掃描檔,請先使用專用的 OCR 工作流程、檢視辨識出的文字,然後再決定該可搜尋結果是否適合用於 Word。
處理限制與本機隱私
單一可接受的 PDF 最多可達 25 MiB 與 40 頁。有界限的處理也會限制每頁的文字項目、文字項目的總數、單一項目的長度,以及輸出字元的總數。由於在處理過程中會強制執行精確的預算,即使複雜文件符合檔案與頁數限制,仍可能回傳錯誤。在此情況下,轉換器絕不會宣稱部分完成。
PDF 解析、文字擷取、預覽、複製以及 TXT 產生皆在目前的瀏器分頁中執行。Lizely 不會上傳 PDF,也不會將其文字傳送至文件處理服務。PDF.js 僅會在您按下 Convert to Text 之後才會被載入。轉換器不會執行內嵌指令碼、追蹤連結、抓取外部資源、將擷取的內容解讀為 HTML、繞過 PDF 密碼、修復檔案、驗證數位簽章,或判斷內容是否準確或安全。
成功完成時,瀏覽器會產生一個 UTF-8 文字 Blob 供下載。若處理失敗、被取消,或元件關閉,其載入工作、頁面資源、暫存的下載 URL 與結果狀態都會被釋放。原始 PDF 絕不會被修改。轉換後,更換選取的檔案會清除過時的輸出,因此顯示的計數始終對應目前的擷取結果。
如需深入了解,請參 如何在 Word PDF 中新增頁首與頁尾。
如需深入了解,請參閱 一個保持在本機執行的 PDF 頁數計數器替代方案。