DOCX 轉 Markdown 轉換器本身並不會開啟 PDF 檔案,因此若要將 PDF 以可編輯的 Markdown 形式匯入 Obsidian,你需要先把 PDF 另存成 Word 的 .docx,再於瀏覽器中在本機轉換該檔案 —— 無需上傳、無需 Pandoc、無需命令列。這個工具會使用 JavaScript 的 ZIP 解讀器來讀取 .docx 中的 Office Open XML 套件,並透過瀏覽器內建的 XML 解析器來剖析主要文件,接著輸出一個依循你實際標題樣式與表格結構的 Markdown 檔案。Word 中的標題 1 到 6 會在輸出中變成 # 到 ######,一般段落則維持為一般文字,而簡單的矩形表格會被改寫為 Markdown 的管線表格,並以第一列作為標頭。任何 Word 能表達但 Markdown 無法表達的內容 —— 頁碼、欄位、形狀、圖片、註解、追蹤修訂、合併儲存格、自訂字型 —— 都會刻意被捨棄或降級為純文字,而不是被扭曲成假語法。由於每個步驟都在當前的分頁中執行,因此無論是原始的 PDF 或中間的 .docx,都不會離開你的裝置 —— 這在文件屬於私人日記、合約草稿或任何受保密協議(NDA)規範的內容時尤其重要。最終結果是一個 .md 檔案,你可以直接放入 Obsidian 的保管庫,並像其他筆記一樣進行編輯。

為什麼 PDF 在 Obsidian 保管庫中會變成死檔
Obsidian 會將每則筆記儲存成一個位於你所選資料夾中的純 Markdown 檔案,而這個應用程式著名的功能 —— 反向連結、圖譜檢視、全文搜尋、標籤自動完成、Dataview 外掛,以及一長串社群外掛 —— 都只會作用在那些 .md 檔案內部的文字上。你丟進同一個資料夾的 PDF 會被當成二進位附件處理。Obsidian 內建的閱讀器可以顯示頁面,但頁面上的文字永遠不會進入搜尋索引;圖譜也無法看到 PDF 與其他筆記之間的連結;而且在沒有切換到其他 PDF 閱讀器的情況下,你無法從附件中複製出任何一個句子。這就是為什麼希望 PDF 能真正「活在」自己知識庫中的人,會先將其轉檔。所面臨的挑戰是,市面上常見的轉換器要不是會把你的檔案上傳到遠端伺服器,就是要你同時具備可用的 Pandoc 安裝環境與 LaTeX 工具鏈,不然就是會回傳充滿破損表格與缺漏標題的 Markdown。
兩階段橋接:PDF → DOCX → Markdown
想在不犧牲隱私的前提下,從 PDF 取回一份乾淨的 Markdown 草稿,最可靠的做法就是一段簡短的兩階段橋接。在第一階段,你先用 Microsoft Word、LibreOffice Writer 或 Google Docs 開啟 PDF,然後使用「另存新檔」來產生一個 .docx。Word 與 Writer 會把 PDF 當作一份要重現的版面,這通常能保留文字順序,也讓你有機會在那些明顯的 OCR 錯誤進入保管庫之前先加以修正。在第二階段,你把 DOCX 轉 Markdown 轉換器指向那份 .docx,讓它直接讀取 Word 文件的結構,而不是試著從 PDF 去猜測字型與邊距。最終產生的 Markdown 檔案會忠實反映你在 Word 中實際撰寫的標題與表格,而不是某個 PDF 解析器「猜測它們可能是什麼」的結果。對於想深入了解「PDF → DOCX」這一半流程的讀者,透過 DOCX 將 PDF 內容轉成 Markdown這篇指南會更詳細地說明相同的工作流程,並列出在各種作業系統上處理第一段轉檔的免費工具。
事先整理 DOCX,讓標題得以保留
這個轉換器只會尊重結構上的意圖,而不會理會視覺上的格式設定。因此,一個手動被設定為粗體加上 18 級字級的段落,在 Markdown 檔案中會以一般段落的樣貌出現。這個工具絕對不會從字級大小或粗體文字去猜測標題層級,因為「猜測」會憑空生出原始文件本來沒有的結構。在轉換之前,請先開啟 .docx,並把 Word 內建的「標題 1」、「標題 2」、「標題 3」段落樣式套用到你想在 Obsidian 中以 #、##、### 呈現的標題與章節小標上。「樣式」窗格(在 Word 中按 Alt+Ctrl+Shift+S,或在 LibreOffice 中透過「檢視 > 樣式」開啟)能讓你快速地順過整份文件。對於任何只是段落的內容,請套用「內文」或「一般」。表格也要檢查:可以的話,把合併儲存格收合成單一標頭列;把巢狀表格攤平為各自獨立的並排表格;並移除任何只為了列印頁面而存在的裝飾性框線。Word 中複雜的清單編號無法在基礎 Markdown 中被忠實呈現,因此會改以可讀的 Tab 分隔純文字作為退路,而不是產生無效或誤導性的表格。
使用 DOCX 轉 Markdown 轉換器來轉換 DOCX
接下來就是正式的轉換。整個工作都會在你的瀏覽器分頁中執行,因此如果你的裝置記憶體較為吃緊,請先關閉其他吃資源的分頁。
- 在瀏覽器中開啟 DOCX 轉 Markdown 轉換器。
- 點擊檔案選擇器,從你的裝置中挑選準備好的 .docx。
- 稍等片刻,讓工具檢查 DOCX 套件的大小、ZIP 目錄結構、項目數量與宣告的展開大小,並由 XML 解析器逐步處理主要文件。
- 閱讀出現的唯讀 Markdown 預覽,捲動檢視以確認你的標題已正確對應為 #、##、###,而簡單的表格也呈現為乾淨的管線表格。
- 如果發現任何異常 —— 例如某個表格因含有合併儲存格而退成了 Tab 分隔文字,或是某個標題因為從未被套用樣式而消失 —— 請回到原始的 .docx 修正,然後重新執行轉換,而不是嘗試手動修補 Markdown。
- 點擊下載按鈕,將 .md 檔案儲存到你的裝置。
- 在任何純文字編輯器中,或直接於 Obsidian 內開啟 .md,並進行簡短的編輯校對,再將其視為一份完成的筆記。
下載得到的會是一個 .md 檔案,隨時可以搬入你的保管庫。
轉換器保留了什麼、捨棄了什麼
事先了解哪些內容能在這趟轉換中存活、哪些會被捨棄會很有幫助,因此下表列出轉換器依循 Microsoft Learn 上 WordprocessingML 文件參考文件所記載的 Office Open XML 結構所承諾的行為。
| Word 功能 | Markdown 檔案中包含的內容 | 原因 |
|---|---|---|
| 標題 1–6 段落樣式 | # 到 ###### 的標題行 | 明確的結構對應到明確的 Markdown 語法 |
| 未套用標題樣式的粗體或大字級文字 | 一般段落 | 此工具不會依外觀猜測標題 |
| 簡單的矩形表格 | 管線表格,第一列作為標頭 | 基礎 Markdown 只能支援單一種表格形狀 |
| 合併、巢狀或結構不齊的表格 | Tab 分隔的純文字 | 虛假的表格會誤導讀者與 Obsidian 外掛 |
| 一般段落 | 保留換行與 Tab 的文字 | 可見的空白會被保留,而不是被刪除 |
| 圖片、形狀、圖表、文字方塊 | 不包含 | Markdown 沒有原生對應;請使用專門的擷取工具 |
| 註解、追蹤修訂、欄位、引文 | 不包含 | 這些屬於審閱中繼資料,而非文件內容 |
| 自訂段落或字元樣式 | 視為一般文字 | 猜測會憑空生出原始文件本來沒有的結構 |
如果你的目標是擷取純文字內容、完全不要任何 Markdown 語法,那麼 DOCX 轉純文字轉換器能以同樣的本機、不上傳方式達成。如果你特別需要從 Word 檔案中取出超連結,Word 超連結擷取器可以乾淨俐落地完成這件事。把這些任務分散在各自獨立的工具中是刻意的設計 —— 任何宣稱能「什麼都做」的單一轉換器,勢必會在你看不到的地方悄悄犧牲保真度,而在轉換之後進行簡短的編輯校對,正是這份約定的一部分。
將 .md 放入 Obsidian 並加以潤飾
.md 檔案下載到裝置後,將其搬移或複製到 Obsidian 作為保管庫所監控的資料夾即可。應用程式會在下次重新整理時為其建立索引,標題會成為該則筆記的顯示名稱。從這裡開始,編輯就是一般的 Markdown 作業:加上 [[雙方括號]] 即可把匯入的筆記與現有筆記連結起來;加上 #標籤 來分門別類;若匯入的標題過長不便作為行內連結,可使用 [[note name|alias]] 的寫法。如果某個棘手的表格在轉換中退成了 Tab 分隔文字,就手動把它重建為管線表格 —— 一旦資料攤在螢幕上,Markdown 表格其實很簡單。可讀性分數檢查器能讓你快速掌握匯入筆記的密度;當你想判斷匯入的區塊是否值得再切分成更小的筆記、以維持圖譜檢視的實用性時,字數計數器也很方便。在 Obsidian 中儲存後,這則筆記就正式成為你保管庫中的一等公民,享有與你親手撰寫的任何內容相同的可搜尋性與可連結性。