若要移除 Word 中的重複句子,請將文字貼到一款瀏覽器式的詞彙層級去重工具,它會保留每個詞的首次出現,並精確回報移除了多少個重複項目——標準的「尋找和取代」對這項工作來說過於字面化。大多數被描述為含有「重複句子」的文件,其實是在原本唯一的句子裡出現重複的詞:匆忙編輯造成的 the the 打字錯誤、口述文字造成的 very very 強調詞、複製貼上時貼了兩次的重複段落標題,或在清單中輸入兩次的同一個關鍵字標籤。移除重複詞彙工具正是為這種詞彙層級的規律所設計。它在句子內部運作,而非橫跨整個句子,因此當一段文章中每個子句都讀起來通順,但同一個詞卻一再出現兩次時,它就能讓這段文章重新變成單一、乾淨的段落。標點符號位置不變、換行位置不變,而每個詞的首次出現就是保留下來的那一個——因此當大小寫敏感度關閉時,The 和 the 會被視為同一個詞,且以較早出現的格式為準。

「Word 中的重複句子」在實務上通常代表什麼

這個詞組在搜尋中不斷出現,但潛在的問題幾乎總是落在詞彙層級。Microsoft Word 沒有內建指令可以做到「移除文件中已經出現過的每個詞」——其內建的「尋找和取代」尋找的是字面字串,而其刪除工具則作用於整個段落或頁面。因此,當有人抱怨重複句子時,他們的檔案中通常隱藏著三種規律。

第一種規律是典型的重複詞打字錯誤:「the the」、「of of」、「and and」、「a a」——短小、快速、在最後一次通讀時容易漏掉。第二種規律是口述或謄寫的文字,因猶豫而讓詞出現兩次:「I I think we should」、「very very important」。第三種規律是複製貼上的意外,導致同一個段落標題、同一個標籤,或同一行關鍵字清單連續出現兩次,或在文件不同處各出現一次。

在這三種情況中,修正方式都相同:將文字逐詞走訪一次,保留每個詞的首次出現,悄悄丟掉重複的部分。這正是詞彙層級去重工具的契約,而且它與本站的「移除重複行」工具是不同的任務,後者比較的是整行,若你餵入這類輸入,它會毫不猶豫地刪掉整個重複行的第二份。

如何從 Word 文件中移除重複詞彙

  1. 開啟你的 Word 文件,選取含有重複詞的段落,然後用 Ctrl+C(在 macOS 上為 Cmd+C)將其複製到剪貼簿。
  2. 將選取的文字貼到「移除重複詞彙」工具的輸入框中。
  3. 選擇大小寫規則。將大小寫敏感度維持關閉,讓 The 和 the 視為同一個詞;只有當你的文件確實需要區分如 US(國家)與 us(代名詞)這類不同形式時,才將其開啟。
  4. 決定要使用全域去重,還是僅限連續模式。對於典型的 the-the 打字錯誤以及其他緊接著重複的詞,僅限連續是正確的選擇;全域模式則適合清理關鍵字清單與標籤集合,因為這類情況中同一個詞彙會出現在文本中相距甚遠的位置。
  5. 查看工具回報的移除數量。這就是本次執行中移除的重複項目數,因此輸出較短並非神秘現象,而是可稽查的。
  6. 從輸出框複製清理後的文字,將其貼回你的 Word 文件,取代原本的選取範圍。

你可以放心地將工具的輸出再次送回工具本身:在所有選項組合下都具等冪性,因此第二次執行不會產生進一步的變更。這個特性讓工具可以安全地放進重複清理的流程中,不必擔心它會悄悄吃掉你的文字。

全域模式 vs 僅限連續模式

有兩個開關控制何者算作重複,而兩者間的選擇是任何一次執行中最重要的決定。下表摘要說明兩種模式在相同輸入下的行為。

模式 會移除的內容 會保留的內容 最適合的用途
全域(預設) 整個文本中每個重複的詞,預設以不區分大小寫的方式進行比較。 標點符號、換行符,以及每個詞以原始大小寫出現的首次出現。 關鍵字清單、標籤集合、搜尋查詢批次,以及同一詞組貼了兩次的複製貼上意外。
僅限連續 僅限由單一空白分隔、緊接著重複的詞。 同一個詞的遠距重複,以及跨標點符號的有意強調式重複,例如「no, no.」。 修正原本乾淨的散文中的典型「the the」、「very very」或「of of」打字錯誤。

大小寫敏感度開關疊加在任一模式之上。當其關閉時,The、the 與 THE 都會合併為你所寫的第一個形式;當其開啟時,它們是三個獨立的詞,三者都會保留下來。最先寫下的形式永遠是存活下來的那一個,因此最終文件中的大小寫會精確保留在它首次出現的位置。

文字中保持不動的部分

這款工具刻意採保守作法。標點符號從來不是詞,也永遠不會被移除,因此逗號、句號、分號、破折號、引號與括號都會留在你原本放置的位置。僅限連續模式刻意不會跨越標點符號觸發,這正是為什麼強調式的「no, no」或帶有重複詞的引用詞組,即使你開啟該模式,也能完好無缺地保留下來。換行符也絕不會被吞掉;存活下來的版面配置在其他方面都會維持原狀。

當一個重複項目被移除時,恰好會有一個相鄰的空格或定位點一併被移除——優先移除詞彙之前的那一個(若有的話),否則就移除之後的那一個。這條單一分隔符規則是確定性的,並由測試所固定,包括其誠實的邊界情況:移除位於兩個空格之間的重複項目時,會留下一個空格,而不是悄悄重寫你的空白字元。此處的「詞」是指一串由字母、數字、撇號與連字號組成的序列,因此 don't 算是一個詞、well-known 算是一個詞,而不是兩個半截。

除了伴隨每個被移除重複項的那一個分隔符之外,存活下來的文字不會有任何變動。你複製回去的結果可以透過移除數量加以稽查,而且由於在任何選項組合下此操作都具有等冪性,你可以將其輸出再次送入工具,結果不會有任何改變。

Word 文件中重複詞彙實際出現的情境

這種規律相當普遍,因此已有其例行的清理作業。逐字稿與口述文字是最常見的來源:說話者猶豫、重複一個詞,而逐字稿保留了兩份副本。僅限連續模式會將「I I think」、「very very」、「the the」以及類似的重複規律折疊回單一詞,同時保持句子其他部分原封不動。

關鍵字清單、標籤集合與搜尋查詢批次是第二常見的來源。從多個來源拼貼而成的長篇 SEO 清單經常含有同一個詞彙兩次,而關閉大小寫敏感度的全域去重處理就是正確的修正方式。每個關鍵字最先寫下的形式會保留下來,因此你在清單頂端所精心安排的大小寫得以保留。

複製貼上意外是第三個來源。貼了兩次的段落標題、出現在兩個位置的標語,或從較早草稿重複出現的句子——僅限連續模式會捕捉行內的重複,而全域模式會捕捉遠距的重複。對於整個句子或整行重複,而非個別詞彙重複的文件而言,本站上的行級去重工具是更合適的選擇,因為它比較的是整行並依行移除重複項目。

隱私、檔案大小限制與處理速度

一切都在你的瀏覽器中以單一線性掃描執行,文字永遠不會被上傳、儲存或連結到任何帳戶。輸入上限為一百萬個字元,遠超過任何一般 Word 文件片段的長度,而多達五十萬個重複詞的洪水也能在不到一秒的時間內清除完畢。這款工具設計用來嵌入清理流程中——貼上、選擇選項、查看移除數量、複製結果——不會產生託管服務所帶來的任何副作用。

延伸閱讀:如何移除 Google Docs 中的空行(8 個步驟)

延伸閱讀:在 Java 中從字串移除標點符號