跳至主要內容
Lizely

PDF 至文字轉換器

從每個 PDF 頁面提取可選擇的文字層,並存為可讀取的 UTF-8 文字檔案於本機。

隱私權:你的檔案不會離開裝置,所有處理均在瀏覽器本機完成。

使用方式

  1. 1.選擇一個非空的 PDF,最多至 25 MiB,並請注意純圖片掃描需要 OCR 支援。
  2. 2.點選「轉換為文字」以依照頁面順序讀取有邊界限制的 PDF.js 文字項目。
  3. 3.確認頁面分隔與計數後,可複製文字或下載 UTF-8 TXT 檔案。

關於PDF 至文字轉換器

PDF 至文字轉換器會從每頁提取 PDF.js 可讀取的選擇性文字內容,並組合成 UTF-8 的純文字文件。選擇一個本機的 PDF,開始提取,預覽頁數與字元數量,複製輸出結果,或下載 TXT 文件。解析與文字組合會在當前瀏覽器分頁中執行。Lizely 不會上傳 PDF 或將其文字傳送至文件處理服務。

此轉換器讀取 PDF 的文字層,不會執行光學文字辨識(OCR)。數位生成的 PDF 通常儲存字元、字型參考、位置資訊與顯示指令,這些內容可被 PDF.js 顯示。若掃描檔僅包含頁面大小的圖片,則可能幾乎沒有文字內容。若你在正常 PDF 檢視器中可以看到文字但無法選擇,通常需要 OCR 工具,此轉換器不會自行生成文字轉譯。

PDF 的文字是按位置排列,而非像文書處理文件般以段落形式儲存。在多欄、側邊欄、表格、表單、標題、腳註或逐字書寫的文字中,讀取順序可能與視覺順序不同。轉換器會依照 PDF.js 提供的項目順序進行處理,尊重明確的換行標記,並在相鄰項目之間插入保守的空格。轉換器不會聲稱能完美重建複雜的視覺版式、欄位、表格單元或語義標題。

合併輸出中,每頁都會有明確的頁面分隔符號。這能確保當前頁的腳註與下一頁的標題原本可能合併在一起時,邊界依然清晰可辨。空白頁也會被保留,因此報告中的頁碼與來原始檔的頁碼對應一致。重複的標題、腳註、隱藏文字、連字規範化或可存取性順序,可能會根據 PDF 自身結構與 PDF.js 的解釋而顯示。

預覽僅為純文字,轉換器不會執行內嵌指令碼、點選連結、抓取外部資源,或將內容視為 HTML。下載會使用 UTF-8 文字 Blob 與由原始檔名匯出的確定性檔名。複製與下載操作皆基於同一組輸出結果,若更改輸入檔,舊結果將被清除,因此計數無法隱性反映先前的提取結果。

受限制的處理方式會保護分頁:一個文件最多可達 25 頁、MiB 頁以及 40 頁,並對每頁的文字項目數、總文字項目數、單一項目長度以及總輸出字元數設有上限。超過限制的文件會回傳錯誤,而非看起來完整的部分成功結果。加密、格式錯誤、不被支援或損毀的文件也可能導致失敗。這個工具不會繞過密碼、修復 PDF、驗證數位簽章或判斷文件內容是否準確或安全。

PDF.js 以及其共用工作者只在你按下「轉換為文字」後才會被請求。它們並非初始頁面捆綁的一部分,且使用與其他 PDF.js 工具相同的固定工作者 URL 以達到快取重用的效果。文字項目會以受限制的流式區塊從 PDF.js 中被消耗,並在被保留或合併至最終報告前進行上限檢查。頁面資源、流式讀取器、載入任務、臨時下載 以及結果狀態會在失敗、取消或元件解除安裝時被釋放。

此轉換器適用於引用可訪問文字、建立初步可搜尋草稿、檢查 PDF 是否具有可用文字層,或將簡單的頁面文字移至其他編輯器。使用前請務必與原始檔對照確認,特別是合約、表格、科學記數法或多欄檔案。若視覺品質重要,請使用 PDF 頁面圖片工具;若原始檔為純圖片,則建議使用專門的 OCR 流程。原始的 PDF 永遠不會被修改。

方法與來源

僅在使用者明確操作後才會載入有邊界限制的 PDF,為每頁請求 PDF.js 的文字內容,保留字串 TextItems,尊重有行尾標記,相鄰項目間加入保守空白,保留空頁與明確的頁面分隔符,執行項目與字元預算限制,生成一個 UTF-8 文字 Blob,並在工作更換時釋放載入任務與物件 URL。

常見問題

這工具會使用 OCR 嗎?
不會。它僅提取可選擇的 PDF 文字層。純圖片掃描可能無文字內容,需另設 OCR 流程。
欄位與表格會保留其視覺佈局嗎?
無法可靠保證。PDF 儲存的是位置文字,因此輸出會遵循 PDF.js 的項目順序與保守的空白,並不會重構複雜的佈局。
文件是否已上傳?
不會。PDF 的解析、文字提取、預覽、複製與 TXT 產生皆在你的瀏覽器中本機執行。
為何會出現標題或空白的重複?
轉換器會保留頁面邊界並遵循文件中暴露的文字項目;PDF 可能會以不尋常的方式編碼標頭、字形與間距。

PDF 工具 使用指南

查看全部