跳至主要內容
Lizely

HTML 表格轉換為 JSON 工具

從第一個 HTML 表格中提取文字,並將行轉換為可預測的 JSON 物件,並安全處理標題欄位。

隱私權:你的檔案不會離開裝置,所有處理均在瀏覽器本機完成。

使用方式

  1. 1.貼入包含目標表格的 HTML,並選擇第一行是否包含標題。
  2. 2.選擇是否修剪單元格文字的周邊空白,然後轉換第一個表格。
  3. 3.檢視行與欄位數量,複製 JSON,並使用目標 schema 驗證資料型別。

關於HTML 表格轉換為 JSON 工具

HTML 表格轉換為 JSON 工具會從提供的 HTML 中提取第一個表格的單元格文字,並將結果行轉為 JSON 物件。預設情況下,第一行提供屬性名稱,之後的行則成為記錄。若關閉此選項,將保留每行內容,並產生 column_1、column_2 以及其後的欄位。可選的修剪功能會移除標題與單元格文字的周邊空白字元,同時保留內部空白與行內容。

瀏覽器將字串解析為無效的 HTML 文件,並揭露標準的表格行與單元格集合。轉換器僅讀取 textContent,不會複製標籤、屬性、連結、樣式、事件處理函式、註解或 dataset 值至 JSON。為減少資源消耗與活躍內容的意外,若輸入內容包含指令碼、樣式、圖片、影格、框架、音訊、影片、來源、連結、物件、嵌入、SVG 或 MathML 元素,將在解析前被拒絕。不會呈現預覽。

標題處理是確定性的。空標題會產生對應的欄位名稱。重複的標題會依照出現順序加上數字字尾,例如 A、A、A 會轉為 A、A_2、A_3,而非覆蓋資料。若後續行的單元格數量多於標題行,則會自動產生額外欄位以保留這些值。缺失的尾端單元格會轉為空字串,因此每筆輸出記錄的欄位數量都一致。僅含標題的表格會正確產生一個空的 JSON 陣列。

單元格值維持為字串。轉換器不會自動推測數字、日期、布林值、null、貨幣、百分比、地區設定或公式,因為文字顯示並非可靠的型別宣告。前導零、長識別碼、郵遞編碼與帳戶編號可能因自動數值轉換而損壞。若需要指定型別輸出,應在轉換後加入 schema 意識的驗證步驟。空單元格仍為空字串,而非 null,原因相同。

複雜的表格佈局超出範疇。瀏覽器的列與單元格集合能識別單元格,但此工具不會將rowspan或colspan擴充套件為矩形視覺網格。巢狀表格也可能造成權屬不明,應在轉換前移除。結果遵循遇到的單元格順序,而非螢幕閱讀器的完整可存取性解析或試算表匯入演算法。當視覺範圍具有意義時,應在其來源應用程式中規範複雜的原始表格。

第一個相符的表格會被有意識地轉換。標題、thead、tbody、tfoot以及普通行群組會透過瀏覽器的行順序參與,但後續的表格會被忽略。如果文件包含導航、價格、比較和資料表格,請先將目標標記隔離。格式錯誤的HTML可能會被瀏覽器解析器修復,因此提取的結構可能與原始文字不同。請檢查總結和JSON,不要假設原始標籤是正確的。

輸入僅限於 500,000 字元,以限制解析與序列化工作。所有解析、提取、JSON 格式化與剪貼簿寫入皆發生在當前標籤中;標記與結果不會上傳。HTML 可能包含個人或機密資料,因此在分享 JSON 前應先移除敏感行。瀏覽器擴充功能與本機裝置均不在此頁面的隱私範圍內。

八個獨立的測試專案會鎖定正常標題、缺少單元格、額外單元格、空白標題、重複標題、修剪、空記錄以及僅包含標題的表格。額外的測試會涵蓋產生的標題和空輸入。為確保可靠使用,請僅貼上目標表格,選擇標題策略,轉換後比較行數和列數,檢查代表性記錄,然後在將JSON匯入資料庫或API之前應用結構驗證器。

方法與來源

解析一個受限制的不活躍 HTML 文件,拒絕可執行或載入資源的元素,從第一個表格的標準行和單元格集合讀取 textContent,確定性地修復空白/重複的標題,填補缺失的單元格,並發出不進行型別推測的字串。

常見問題

重複或空白的欄位標題如何處理?
空白標題會產生產生的欄位名稱,後續重複會加上 _2、_3 以及進一步的字尾,以避免資料被覆蓋。
此轉換器是否理解 rowspan 與 colspan?
不。它僅讀取遇到的單元格,不會將視覺跨度擴充套件為矩形網格。建議在轉換前先標準化複雜表格。
數字與日期會轉換為 JSON 型別嗎?
不會。每個單元格都維持為字串,以保護識別碼、前導零、地區相關值與大數字。建議在後續加入明確的 schema 驗證。

開發者工具 使用指南

查看全部