跳至主要內容
Lizely

UTF-8 轉換器

將本機 UTF-8、UTF-16LE、UTF-16BE 或 Windows-1252 文字檔轉為已驗證的 UTF-8 位元組,並下載結果。

隱私權:你的檔案不會離開裝置,所有處理均在瀏覽器本機完成。

使用方式

  1. 1.先確認並選擇檔案真正的來源編碼,不要只憑顯示結果猜測。
  2. 2.選擇一個不超過 10 MB 的文字檔,轉換後在預覽中檢查非 ASCII 字元。
  3. 3.下載 UTF-8 檔案,在目標應用程式測試後再使用,並在驗證完成前保留原檔。

關於UTF-8 轉換器

UTF-8 轉換器會將本機文字檔從你選擇的來源編碼轉成標準 UTF-8。它支援 UTF-8 驗證與移除 BOM、UTF-16 小端序、UTF-16 大端序,以及 Windows-1252。瀏覽器會讀取檔案、預覽解碼文字,並建立可下載的 UTF-8 檔案,來源位元組不會上傳。

這個工具不會猜測編碼。你必須選擇實際產生檔案的編碼。相同的位元組序列可能在不只一種舊式編碼下都有效,卻代表不同的字元;自動猜測看似合理,仍可能破壞姓名、標點或符號。明確選擇可讓轉換過程保持可查驗。

UTF-8 模式會以嚴格錯誤處理驗證來源。無效的接續位元組、截斷序列與禁止的編碼都會清楚失敗,不會以替代字元蒙混過去。標準解碼器會讀取並移除開頭的 UTF-8 位元組順序標記(BOM),下載結果則由 UTF-8 編碼器輸出,且不會加入新的 BOM。

UTF-16LE 與 UTF-16BE 的差異在位元組順序。即使每一對位元組仍可讀取,若把端序顛倒,檔案中的文字仍可能變成亂碼。低位元組在前的格式應選小端序,高位元組在前的格式應選大端序;相符的 BOM 會被識別並移除。

像 emoji 這類補充平面字元在 UTF-16 中使用代理對。解碼器會在輸出 UTF-8 前,將有效的高、低代理對合併成一個 Unicode 純量值。未配對或格式錯誤的序列會在嚴格解碼下被拒絕,避免工具宣稱轉換成功卻悄悄輸出替代字元。

Windows-1252 是常見的西方舊式字碼頁,經常被誤標成 ISO-8859-1。80 到 9F 的位元組範圍包含可列印的標點與符號,例如歐元符號與彎引號。瀏覽器依標準定義的 Windows-1252 解碼器先提供這些對應,再重新編碼為 UTF-8。

輸出代表的是解碼後的字元,而不是逐位元組複製。Windows-1252 的歐元符號位元組 80,會變成 UTF-8 的三個位元組 E2 82 AC。頁面會同時顯示來源與輸出的位元組數,讓你看見擴張或縮減;數量不同是預期情況,本身不表示資料遺失。

檔案上限為 10 MB,因為此處的瀏覽器 File 與 Encoding 介面會在記憶體緩衝區中處理資料。工具會在讀取前檢查大小,避免意外載入過大的檔案。資料庫傾印或數 GB 的日誌,請使用可信賴的串流轉換工具,並明確指定來源與目標編碼。

預覽可在下載前幫你抓出明顯錯誤的選擇,但它未必能顯示每一個控制字元或正規化差異。請檢查具代表性的姓名、標點、貨幣符號與非 ASCII 行。若單一檔案混用了多種編碼,單一解碼器無法可靠修復。

更換檔案或來源編碼會取消目前結果,並使之前的下載網址失效。工作識別碼可防止較慢的舊檔讀取覆蓋較新的選擇,過期的 Object URL 也會被撤銷。下載檔名會加上 `-utf8`,並使用純文字 UTF-8 媒體類型。

八個外部測試夾具涵蓋 ASCII UTF-8、多位元組 UTF-8、UTF-8 BOM 處理、含 emoji 的兩種 UTF-16 位元組順序、兩種 UTF-16 BOM,以及 Windows-1252 標點。測試會比對完全相同的解碼文字與重新編碼後的 UTF-8 位元組;格式錯誤的 UTF-8 則必須失敗。

使用前,先從產生檔案的應用程式或可靠中繼資料確認來源編碼,再選擇檔案、進行轉換並檢查預覽。下載結果後,請先在目標應用程式中測試,再取代任何原始檔;在完整流程驗證前保留原檔。

此頁不同於文字轉 UTF-8 位元組檢視器:它處理真實檔案位元組、指定的舊式編碼與可下載的成品。它不會偵測編碼、不會以猜測方式修復亂碼、不會正規化 Unicode、不會翻譯語言,也不會修改解碼與 UTF-8 編碼結果以外的換行設定。

方法與來源

工具會依 WHATWG 指定的標籤與嚴格錯誤處理解碼所選位元組,再使用瀏覽器的 UTF-8 編碼器重新編碼。讀取前先檢查來源大小;輸出不會加入 BOM,並透過可撤銷的本機 Blob URL 提供下載。

常見問題

工具可以偵測我的檔案編碼嗎?
不可以。編碼偵測具有機率性;本工具要求明確指定來源編碼,讓轉換過程可查驗。
為什麼位元組數量改變了?
不同編碼會用不同長度的位元組表示同一個字元,因此正確的 UTF-8 轉換常會改變檔案大小。
輸出會包含 UTF-8 BOM 嗎?
不會。已識別的來源 BOM 會被讀取並移除,下載的 UTF-8 位元組不會再加入 BOM。

編碼與加密 使用指南

查看全部