一款用於圖片工作流程的 AI 文字清理工具,是一種瀏覽器工具,能接收 AI 產生的文字──無論它來自聊天回應、對圖片做 OCR 讀取的結果,或是圖片模型產生的說明文字──並一次性去除大型語言模型會留下的排版指紋。AI Text Cleaner 正是為這項工作而打造的:它會把長破折號、彎引號、刪節號字元、隱藏的 Unicode 標記、雙重空格與多餘的空白行都正規化,同時完全不動實際的文字內容。六項規則以固定順序執行,每一項都是獨立的開關,所以你可以只把引號拉直、不動破折號,或只去除隱藏字元、完全不動段落間距。每次執行都會回報每一項規則變更了多少個字元,所以你看到的總數會與輸出結果完全吻合。所有內容都不會離開你的瀏覽器,輸入上限為一百萬字元,避免一大段貼上內容凍結分頁。

AI Text Cleaner 會從貼上的草稿中去除什麼
無論是哪個模型寫出來的,大型語言模型往往都會產生同樣那幾種排版產物。在應該用鍵盤上的撇號的地方,用了智慧引號。在用逗號讀起來會更順的地方,用了長破折號。在三個普通句點就能乾淨複製的地方,用了刪節號字元。有一些編輯者看不見、但每一次尋找取代都會被誤算進去的隱形標記。還有會打亂字數統計、破壞後續搜尋功能的多餘間距。
AI Text Cleaner 把上述每一個問題,都當成一條獨立的規則來處理,每一條規則都是一個你可以自行切換的開關。破折號規則會一次涵蓋整組排版用的破折號:U+2013 短破折號、U+2014 長破折號與 U+2015 水平線都屬於句子破折號,你可以選擇要用什麼來取代它們──連字號、逗號,或單一個空格。U+2010 連字號、U+2011 不可斷行連字號與 U+2012 數字破折號,則是一般鍵盤連字號的替身,無論你選擇哪種取代方式,它們永遠會變成一個連字號,因為把單字內部的連字號換成逗號,只會破壞這個單字,而不是清理它。這三個字元比看起來更重要:它們在視覺上與一般連字號一模一樣,所以如果工具略過它們,就會留下一個在原始內容中看不出來、但一旦有人搜尋就會冒出來的問題。
六條規則,各自一個開關
這些規則以固定順序執行,讓總數可以重現。系統會先把換行字元統一摺疊成 LF,這代表 Windows 的歸位字元,以及來自 PDF 與較舊版 Word 文件的 U+2028 與 U+2029 分隔符,都會表現得像是從網頁聊天視窗複製出來的文字一樣。接著,這六條規則會依序套用到經過Unicode 字元資料庫驗證、並交叉核對第二個權威來源的 Unicode code point 上。
| 規則 | 鎖定目標 | 不會處理的內容 |
|---|---|---|
| 破折號 | U+2013、U+2014、U+2015 句子破折號;U+2010、U+2011、U+2012 連字號替身 | U+2212 減號(數學運算符號) |
| 引號 | U+2018–U+201F 智慧引號、單撇與雙撇符號 | 書名號與中日韓括號 |
| 刪節號 | U+2026 單一刪節號字元 | 文字中原本就存在的三個普通句點 |
| 隱形字元 | 零寬空格、詞連接符、位元組順序標記、軟連字號、組合字素連接符、LRM/RLM 標記、隱藏的數學運算符、Unicode Tags 區塊、輔助變體選擇符、雙向嵌入、覆寫與隔離字元 | 零寬連接符、零寬非連接符、變體選擇符 U+FE00–U+FE0F |
| 間距 | 連續兩個以上的空格或定位字元、行尾的尾隨空格 | 文件本身需要的單一空格與定位字元 |
| 空白行 | 段落之間多餘的空白行、開頭與結尾的空白行 | 段落之間最多保留一行空白 |
那些不會被處理的字元,並不是疏漏──它們是承重的。零寬連接符讓多人表情符號序列維持在一起。零寬非連接符在波斯語、阿拉伯語與多種印度語系文字中,在文法上是必要的。變體選擇符 16 正是讓表情符號能以表情符號形式顯示的關鍵。移除其中任何一個,都只會破壞原本有效的文字,而不是清理它。連續多個破折號會收斂成單一一個取代結果,而不是一排連字號,破折號周圍的間距也會一併修復,所以你不會得到雙重空格,或逗號前面多一個空格的結果。
如何逐步清理來自圖片來源的 AI 文字
- 把 AI 產生的文字貼進輸入框。如果你手邊沒有現成的草稿,可以選擇 Load sample,載入一個能展示這個工具鎖定目標的典型範例。
- 勾選你想要執行的規則。每一條規則都是獨立的,所以你可以只把引號拉直、完全不動間距,或只去除隱藏字元、不動破折號。
- 選擇句子破折號要變成什麼。破折號規則提供三種選擇:連字號、逗號,或單一個空格。連字號替身(U+2010、U+2011、U+2012)無論你怎麼選,永遠都會收斂成一個連字號,因為把它們改寫成其他任何內容,都會破壞它們所在的單字。
- 選擇 Clean text。這個工具會先把換行字元摺疊成 LF,接著依序套用這六條規則,並計算每一次取代。
- 閱讀各條規則的變更計數。每一條規則都會回報它變更了多少個字元,而總數會與輸出結果完全吻合,所以你可以親自驗證發生了什麼事,而不是盲目相信一次無聲的改寫。
- 複製清理後的結果。把它貼進你的編輯器、CMS、文件,或任何草稿需要送達的地方。
能在複製貼上後存活下來的隱藏字元
隱形字元規則,是對貼上的 AI 輸出內容最重要的一條規則,尤其是當文字來自圖片來源時,例如對截圖做 OCR 辨識,或是圖片產生器回傳的說明文字。它會移除零寬空格、詞連接符、位元組順序標記、軟連字號、組合字素連接符、由左至右與由右至左標記、隱藏的數學運算符,以及兩種隱藏浮水印載體:Unicode Tags 區塊與輔助變體選擇符。它也會移除隱藏在 Trojan Source 漏洞背後的雙向嵌入、覆寫與隔離字元,這些字元是隱形的、能在複製貼上後存活下來,還可能重新排列一行文字的顯示方式。
每一個固定寬度空格與不可斷行空格,都會被換成一般空格,所以之後的尋找取代與字數統計,才會依照你預期的方式運作。有三種字元被明確保留下來──零寬連接符、零寬非連接符,以及變體選擇符 U+FE00 到 U+FE0F──之所以排除在清理範圍之外,是因為移除它們只會破壞表情符號序列、非拉丁語系文字,以及表情符號的顯示效果,而不是清理它們。清單中的每一個 code point,都對照 Unicode 字元資料庫檢查過,並交叉核對了第二個權威來源,所以這項行為是一致的,而不是概略估計出來的。
為什麼「僅在瀏覽器端處理」對這個工作流程很重要
一切都在你的瀏覽器內執行。文字絕不會被上傳、絕不會被儲存、絕不會被送到任何 API,也絕不會被附加到任何帳號上。當你要清理的草稿是客戶的工作內容、一份尚未發表的手稿、一份法律文件,或任何你不想推送到第三方伺服器的內容時,這一點就很重要。同樣的保證,也是這個工具適合圖片來源工作流程的原因:從敏感文件用 OCR 工具擷取出來的文字、某個私有模型回傳的說明文字,或截圖的轉寫內容,都能在原始內容完全不離開這個分頁的情況下被清理乾淨。無論草稿是兩百個字元,還是接近一百萬字元的輸入上限,處理的位置都是一樣的。
限制、隱私與誠實的邊界
這個工具只變更格式。它不會改寫句子、偵測 AI 作者身分、改述、翻譯,或改善文筆,也不會宣稱清理過的文字能通過任何 AI 偵測工具。排版正規化可以移除偵測工具會尋找的部分表面訊號,但沒有任何格式化工具能保證特定偵測工具的結果──語言模型留下的訊號,遠比破折號與引號來得深,一個誠實的文字清理工具會如實說明這一點,而不是空口承諾做不到的事。
輸入上限是一百萬字元,避免一大段貼上內容凍結分頁。輸出結果一律使用 LF 換行字元,所以如果你的 Windows 應用程式需要 CRLF,之後會需要用一個換行轉換工具。範圍是整段處理,而不是抽樣處理,這代表不會出現某個位置的破折號被改寫、但幾個字元之後一模一樣的破折號卻沒被改寫的邊界情況。引號規則會把 U+2018 到 U+201F,加上單撇與雙撇符號,統一拉直成直式撇號與直式雙引號,而書名號與中日韓括號則被刻意保留不動,因為改寫它們只會破壞合法的非英語引用方式,而不是移除 AI 產物。
在你去除 AI 產物之後,若還有其他相關的清理工作要做──把殘留的空白行收斂成單一段落間距、移除重複的段落,或把清理過的文字換行到指定的欄寬──一個專用的空白行移除工具與換行工具,各自都能比一個合併式的格式化工具更透明地完成一件事。如果你想確切看出原始貼上內容與清理後輸出結果之間有什麼差異,一個文字差異比對工具可以並排顯示新增、刪除與未變動的內容,而且兩個版本都不需要上傳,全程維持同樣「僅在瀏覽器端處理」的保證。
若想進一步了解,請參閱產生類語音 Unicode 泡泡文字。
若想進一步了解,請參閱AI Text Cleaner Online:貼上前先去除 AI 產物。