文字 AI 清理器是一種工具,用於移除大型語言模型在輸出內容中留下的排版痕跡——長破折號、彎引號、隱形的 Unicode 字元以及多餘的空白——同時不改寫任何實際的文字。輸出內容讀起來與輸入相同,但每一個智慧引號都會變成直引號,每一個長破折號都會收縮成你所選擇的單一字元,而每一個隱形的零寬空格、位元組順序標記和雙向嵌入字元,都會在文字送達你的編輯器或內容管理系統之前被移除。重點不在於偽裝文字或欺騙偵測器。重點在於標準化:相同的文字,以純鍵盤字元呈現,方便進行尋找與取代、字數統計以及發佈流程中的其他作業。一個好的文字 AI 清理器會以明確、可切換的規則來執行這項工作,並回報每條規則變更了多少字元,這樣就不會有任何操作在無聲中進行,你可以驗證執行的結果,而非信任一次無聲的改寫。

AI 草稿實際上帶有什麼
當你向大型語言模型請求一段文字並將結果貼到草稿中時,可見的文字通常沒有問題。問題出在你看不到的字元上,或是看起來與你自己輸入的字元一模一樣的字元上。長破折號 (U+2014) 出現在你原本會寫連字號或兩個短破折號的地方。彎曲的「智慧」引號包圍著詞組,而你的鍵盤會產生的是直的 ASCII 引號。單一字元的省略符號 U+2026 取代了三個輸入的句點。零寬空格、文字連接符、位元組順序標記或軟連字號可以夾在任意兩個字母之間而不改變螢幕上看到的內容,但它們會影響字數統計、破壞尋找與取代功能,並在複製貼上到新文件時依然存在。
這些字元中有些是風格性的,有些是結構性的。短破折號、長破折號和橫槓 (U+2013、U+2014、U+2015) 在 AI 書寫中充當句子破折號;U+2010、U+2011 和 U+2012 是視覺上相同的連字號,看起來像一般的鍵盤連字號,但實際上並非如此。U+2018 到 U+201F 區段包含彎曲引號、單引號和雙引號撇號,以及低階和反向的形式。一連串這類字元�雜著一些零寬空格,正是尋找與取代以及字數統計工具會忽略的模式,這也是為什麼會存在專門的文字 AI 清理器。
六條規則,每條都是一個開關
基於規則的文字 AI 清理器將工作拆分為具名類別,並讓你獨立開啟或關閉每一項。AI 文字清理器內建六條規則,每條規則所做的變更會分別計數,讓你可以稽核執行結果,而非信任一次無聲的改寫。
| 規則 | 目標字元 | 產生結果 |
|---|---|---|
| 破折號 | 短破折號 (U+2013)、長破折號 (U+2014)、橫槓 (U+2015);以及視覺相同的替代字元 U+2010、U+2011 和 U+2012 | 句子破折號變成連字號、逗號或單一空格(可自選);詞內的替代字元一律變成鍵盤連字號 |
| 智慧引號 | U+2018–U+201F 以及單引號和雙引號撇號 | 直式撇號和直式雙引號 |
| 省略符號 | U+2026 | 三個句點 |
| 隱形字元 | 零寬空格、文字連接符、位元組順序標記、軟連字號、組合字素連接符、由左至右與由右至左標記、隱形數學運算子、Unicode 標籤區段、輔助變體選擇器,以及特洛伊原始碼漏洞背後的雙向嵌入、覆寫和隔離字元 | 移除 |
| 空白 | 兩個或以上的空格或定位字元連續出現;每行尾端的尾部空白 | 收縮為一個普通空格 |
| 空白行 | 段落之間的多個空白行;文字開頭或結尾的空白行 | 段落之間至多一個空白行 |
破折號規則中有兩個細節比看起來更重要。首先,多個破折號連續出現時會收縮為一個替代字元,所以三個連續的長破折號會變成一個字元,而不是並排的三個連字號。其次,破折號周圍的空白會同時修復,因此你不會在之後出現雙重空格,也不會在逗號之前出現空格。減號 U+2212 會被保留,因為它是數學運算子,改寫它會改變數字的意義。法式引號和 CJK 括號也會被保留,因為改寫它們會損壞合法的非英文引號格式,而非移除 AI 痕跡。
如何逐步清理 AI 草稿
整個工作分為三個動作:貼上、選擇規則、執行。
- 將 AI 產生的文字貼到輸入框中。如果你手邊沒有草稿,請選擇載入範例以查看一個典型的範例,其中已包含長破折號、智慧引號、省略符號以及一兩個隱形字元。
- 勾選你要執行的規則。若要進行完整清理,請將六條規則全部開啟。若要進行精準處理,請關閉會影響你想保留之字元的規則——例如,當你已設定自己的段落節奏且不希望被收縮時,請關閉空白規則。選擇破折號規則要替換成什麼:連字號、逗號或單一空格。
- 選擇清理文字。輸出會出現在清理後的方塊中,下方會顯示工具回報的每條規則變更了多少字元。複製清理後的結果。
如果每條規則的計數未如你所預期地加總,那麼你關閉的規則就是會處理你仍看到之內容的規則。將其開啟後再執行一次,該規則的新計數應該就不為零。
隱形字元規則會移除哪些內容——以及保留哪些內容
隱形字元規則對於貼上的 AI 輸出最為重要,同時也是例外最多的規則。看起來空白的隱形字元可以存活於一般編輯流程的每一步,因此清理器會按名稱逐一移除——但僅限按名稱,而非按類別。有三個字元會刻意保留,因為移除它們會損壞有效的文字。
| 由隱形字元規則移除 | 刻意保留 |
|---|---|
| 零寬空格、文字連接符、位元組順序標記、軟連字號 | 零寬連接符(將多人表情符號序列保持在一起) |
| 組合字素連接符 | 零寬非連接符(波斯文、阿拉伯文和數種印度文字中語法上所需) |
| 由左至右與由右至左標記,以及特洛伊原始碼漏洞背後的雙向嵌入、覆寫和隔離字元 | 變體選擇器 U+FE00 到 U+FE0F(包括 VS-16,這是讓表情符號呈現為表情符號的關鍵) |
| 隱形數學運算子 | |
| Unicode 標籤區段(已記錄的隱形浮水印載體) | |
| 輔助變體選擇器 |
這些清單中的每一個碼位都已依據 Unicode 字元資料庫 (UnicodeData.txt) 進行核對,並與第二個權威來源交叉核對。特洛伊原始碼標記特別值得點名說明:它們是隱形的,能在複製貼上時存活下來,並能重新排列一行在螢幕上或程式碼審查中的呈現方式,這就是為什麼清理器會將其移除而非放行。
清理器的停止之處
僅標準化格式的文字 AI 清理器與改寫器或人性化工具並不相同,這項區別值得明確說明。清理器只改變文字周圍的字元,絕不更動文字本身。它不會改寫句子、不會改述、不會翻譯、不會改善文風,也不會偵測 AI 作者身分。它不會聲稱清理後的文字能通過任何 AI 偵測器,因為段落偵測器讀取的是排版以外的內容。
這項界線同時說明了為什麼每條規則都是一個開關。如果你只想移除隱形字元——例如,在將草稿交給翻譯人員或貼到程式碼審查之前先去除其危險性——請關閉其他五條規則。如果你只想將彎曲引號拉直,以免你的內容管理系統將其儲存為 HTML 實體,請關閉破折號規則並執行其餘規則。清理器是標準化工具,不是編輯器。
隱私、限制與行尾字元
有三個實際面向構成完整的合約。首先,所有處理都在你的瀏覽器中執行:文字永遠不會被上傳、永遠不會被儲存、永遠不會被傳送到 API,也永遠不會與帳戶綁定。當你正在清理的草稿是客戶工作、未出版的手稿或任何你不想貼到第三方服務的內容時,這點非常重要。其次,輸入上限為一百萬個字元,避免非常大的貼上內容使分頁卡住。第三,每個行分隔符號——Windows 歸位字元以及從 PDF、InDesign 和較舊的 Word 文件產生的 U+2028 和 U+2029 分隔符號——都會在規則執行之前折疊為換行字元,因此輸出永遠使用 LF 行尾字元,行為與從網路聊天複製的文字相同。
如果你想在清理之前查看文字中隱藏了哪些隱形字元,隱形字元工具可在本地顯示它們;如果你只想收縮水平空白而不更動其他內容,空白移除器提供三種明確的模式來處理這項較狹隘的工作。
如需更深入的瞭解,請參閱在瀏覽器中執行的免費 AI 文字清理器。
如需更深入的瞭解,請參閱在 Google 試算表中不使用公式變更文字大小寫。