在 macOS 上將 PDF 轉換成純文字檔,只需要透過現代瀏覽器點擊幾下:Safari 或 Chrome 會在本機載入 PDF,讀取其中的可選取文字圖層,並組裝成一個 UTF-8 的 .txt 檔案,讓你可以複製或下載——無需上傳、無需帳號,也無需重新輸入。當你需要引用文件內容、貼到 TextEdit、在 Spotlight 中搜尋內容,或將乾淨的頁面文字移至其他編輯器時,這是將 PDF 文字轉換成 TXT 檔案最快的方式。它保留了文件的文字內容,同時讓你能完全掌控下一步要如何處理。唯一的限制在於這個方法讀取的是 PDF 內嵌的文字圖層——它並不會執行光學字元辨識。數位建立的 PDF 效果良好;純影像掃描則不行。在開始之前了解這個差異,能幫你節省時間,並選對適合工作的工具。

為什麼 Mac 使用者經常需要從 PDF �取文字
macOS 本身已內建 Preview,對於快速檢視與簡單標記來說已經足夠。不過,當目標是純文字時,Preview 的「複製」選項會輸出文字圖層所暴露的內容,結果常常以任意閱讀順序呈現,並夾帶多餘空格、斷行或合併的詞彙。將其貼到 TextEdit 或 Pages 之前,通常需要手動清理才能使用。
對許多日常任務而言,那個清理動作正是你想要避免的:
- 在電子郵件或訊息中引用研究論文的段落
- 將合約條款貼到筆記或對話串中
- 對一個已轉為文字的 PDF 資料夾執行 Spotlight 搜尋
- 將一章內容餵給翻譯、摘要或筆記工具
- 從多頁發票或報告中擷取文字到試算表
在管理 PDF 本身方面,Preview 也可能有所限制。如果你的目標是在擷取之前先修剪頁面,在 Mac 上用 Preview 刪除 PDF 頁面的操作流程是實用的配套步驟。一旦 PDF 修剪成你真正需要的頁面,就能轉換成文字,而不會把不相關的頁面一起拖著跑。
瀏覽器型轉換器實際上在做什麼
PDF to Text Converter 會擷取 PDF.js 能從每頁讀取到的可選取文字內容,並組裝成一份 UTF-8 純文字文件。PDF.js 是 Mozilla 開源的 PDF 渲染引擎;你可以從 GitHub 上的 PDF.js 專案 進一步了解其底層的文字內容 API。這個轉換器在你按下按鈕後才會載入你的 PDF,整個過程完全在你目前的分頁中執行,絕不會將文件送到伺服器。
它為你產出的內容:
- 一份組裝後純文字的預覽,以非作用中的文字呈現——不會執行任何指令碼、不會追蹤任何連結,內容也不會被解讀為 HTML。
- 頁數與總字元數,讓你一眼看出�取結果是否有用。
- 一個「複製」動作,會把同一份預覽放到你的剪貼簿。
- 一個「下載」動作,會以依據來源 PDF 衍生的固定檔名,將結果存成 UTF-8 文字檔。下載使用的是 Blob,這是瀏覽器封裝二進位或文字資料供下載的方式——請參考 MDN 上 Blob API 的說明文件。
它刻意不做的事:不執行 OCR、不繞過 PDF 密碼,也不修復、驗證或簽署 PDF。原始 PDF 永遠不會被修改——來源檔始終保持原樣。
如何在 Mac 上將 PDF 轉成文字檔
只要檔案準備好,macOS 上的完整流程一分鐘內就能完成。打開 Safari 或 Chrome,然後依照下列步驟:
- 在瀏覽器中開啟 PDF to Text Converter 頁面。你不需要安裝任何東西——工具會在當前分頁中執行。
- 點擊檔案選擇器,從你的 Mac 選擇一個非空白的 PDF。檔案大小必須在 25 MiB 以下,且至少要有一頁具有可用的文字圖層。純影像掃描無法透過此工具產生文字。
- 點擊 Convert to Text。瀏覽器會載入 PDF.js,在本機開啟 PDF,並依序逐頁讀取有邊界的文字項目。
- 等待預覽出現。介面上會顯示頁數與字元數,讓你能快速檢查結果是否合理。
- 檢視預覽,找出你需要的內容。頁面分隔符會標示每個分界,避免某一頁的頁尾與下一頁的標題連在一起。
- 點擊 Copy 將組裝後的文字放到剪貼簿,或點擊 Download 將 UTF-8 .txt 檔存到你的下載資料夾。
- 在 TextEdit 中開啟下載的 .txt 檔,或將複製的文字貼到任何接受純文字的 macOS 應用程式。
如果你需要用不同的檔案重新開始,請選擇新的 PDF。更換輸入會清除舊的輸出,因此顯示的計數永遠對應目前的擷取結果,而不是前一次的。
TXT 輸出會是什麼樣子
輸出檔是以 UTF-8 編碼的純文字,這代表它能在 TextEdit、BBEdit、VS Code 以及任何其他 macOS 編輯器中順利開啟。每個頁面之間都會以明確的分隔行隔開,因此即使有頁尾或重複頁首,頁面邊界依然清楚可見。空白頁面也會被保留,讓報告中的頁數能與來源 PDF 對齊。
檔案中的文字會依照 PDF.js 為每頁所暴露的順序排列。在大多數情況下,這就是自然的閱讀順序——由上而下、逐行排列。對於含有側邊欄、多欄排版、表格,或一次只繪製一個字符的文件,順序可能會與視覺排版不符。轉換器會保留 PDF 中明確的行尾標記,並在相鄰項目之間加入保守的空格,避免詞彙黏在一起;它不會自行產生段落斷行,也不會重建欄位。
以下是針對常見 PDF 類型的快速對照:
| PDF 類型 | 具有可選取文字 | 典型轉換器輸出 |
|---|---|---|
| 數位建立的報告,單欄 | 是 | 乾淨、由上而下的閱讀順序 |
| 數位建立,採多欄排版 | 是 | 文字依 PDF.js 項目順序,而非視覺欄位 |
| 含有可填寫欄位的表單 | 是 | 僅輸出純文字 |
| 純影像掃描(無文字圖層) | 否 | 預�為空或近乎空白;需要另外使用 OCR 流程 |
| 密碼未知的加密 PDF | 不適用 | 顯示錯誤訊息;此工具不會繞過密碼 |
如果預覽中你的檔案看起來是空的,最可能的原因是來源屬於純影像掃描。針對掃描檔請使用 OCR 工具,而具有真正可選取文字的檔案,則回到 PDF to Text Converter 處理。
何時這個轉換器幫不上忙
了解工具的限制,能避免你追尋 PDF 無法給出的結果。這個轉換器讀取的是 PDF 文字圖層——它並不會執行光學字元辨識。如果你用 Preview 開啟檔案,卻無法用文字工具反白個別詞彙,表示這份文件屬於純影像,這個轉換器將幾乎無法回傳任何文字。
閱讀順序是另一個容易落空的地方。PDF 儲存的是定位後的字符,而非像文書處理器那樣以段落方式儲存,因此輸出會依循 PDF.js 項目順序,而不會重建視覺排版。多欄的學術論文、雜誌、側邊欄與表格,常常會以文件中順序攤平為連續文字,而非整齊分隔的欄位。頁首、頁尾與隱藏文字是否出現或重複,取決於 PDF 本身的編碼方式——轉換器會保留文件所暴露的內容。
其他轉換器無法處理的情況:
- 有密碼保護但沒有密碼的 PDF:此工具無法繞過密碼。
- 損壞、格式錯誤或不支援的 PDF:此工具會回傳錯誤,而非看似完整但其實不完整的部分結果。
- 你需要保留視覺一致性的內容:請改用 PDF 頁面影像工具,因為這個轉換器只輸出無格式的純文字。
- 需要取得文字稿的純影像掃描:請先透過 OCR 流程處理,若仍需要乾淨的 TXT,再回到這個轉換器。
針對合約、表格、科學符號與多欄文件,務必在使用前將組裝後的文字與來源核對。
限制與錯誤訊息
轉換器強制執行多項硬性限制,以維持瀏覽器分頁的反應速度,並避免輸出失控:
- 每次執行只處理一個 PDF,大小上限為 25 MiB。
- 每份文件最多 40 頁。
- 每頁有邊界的文字項目、總文字項目、單一項目長度與總輸出字元數皆有限制。
若超出任何一項限制,工具會回傳錯誤而非部分成功。達到字元上限的文件不會默默截斷——它會直接失敗,讓你能調整後重試。加密、格式錯誤、不支援或損壞的檔案也適用相同原則:轉換器會誠實失敗,而不會產出看似完成卻不完整的結果。
由於處理流程有邊界並以串流區塊方式執行,大檔案也不會讓分頁卡住。載入任務、暫存下載網址與結果狀態,會在替換輸入、取消或關閉頁面時立即釋放,使記憶體使用量保持可預測。
本機處理與隱私
轉換的每一步都在你 Mac 上目前的瀏覽器分頁中執行。PDF 不會上傳到遠端服務,擷取出的文字也不會被送到任何地方,Lizely 並不會收到你文件的副本。唯一的網路請求,只有初次載入頁面所需的資源,以及在你按下 Convert to Text 之後的 PDF.js 程式庫與其共享 worker——這個固定的 worker 網址與本站其他 PDF.js 工具相同,因此後續轉換可受益於快取重用。
這使得這個工作流程可用於你不會上傳到線上轉換器的文件:內部報告、NDA 下的草稿、財務報表與個人紀錄。取捨在於一切都留在你的機器上——如果你清掉分頁,組裝後的文字也會消失,除非你已複製或下載。
如需更深入了解,請參閱 在 Mac 上刪除 PDF 頁面——無需軟體、無需上傳。