跳至主要內容
Lizely

HTML 檔案體積分析器

測量你貼入的 UTF-8 的 HTML 位元組體積,區分內嵌程式碼與外部引用資料,並與 Googlebot 目前的 2 MB 取得邊界進行對比,但不會實際抓取網頁內容。

隱私權:你的檔案不會離開裝置,所有處理均在瀏覽器本機完成。

使用方式

  1. 1.貼入原始未壓縮的 HTML 響應體,最好來自 View Source 或合法的 curl 擷取,而非來自 Elements 視窗的變動版本。
  2. 2.執行分析並檢視總共的 UTF-8 位元組、2 MB 參考值、內嵌指令碼/樣式佔比、data URI 重量,以及受限制的外部資源清單。
  3. 3.修復最大的來源層熱點,然後重新測量部署的響應,並記得 HTTP 標頭與獨立抓取的資源不在此貼入體積的計算範圍內。

關於HTML 檔案體積分析器

HTML 頁重量分析器會測量你貼上的來源,而不是預估 URL 的即時重量。它會報告該文字的 UTF-8 位元組長度、其 Unicode 編碼點數量、內聯指令碼與樣式內容佔用的空間、內嵌資料 URI 位元組,以及外部資源參考的有限庫存。所有運算都在瀏覽器中執行。HTML 不會上傳、不會作為網頁取得或執行。

位元組大小與 JavaScript 字串長度不同。瀏覽器中的字串計數 UTF-16 個碼元單位,而 HTML 回應則通常以編碼後的位元組傳送。一般 ASCII 字元佔用一個 UTF-8 位元組,但帶重音字母、CJK 文字與表情符號則會佔用更多。分析器使用瀏覽器 TextEncoder API,因此標題總數反映的是 UTF-8 位元組,而非容易誤導的字元計數。

與 Googlebot 的對比僅作為參考,並非認證。Google 的當前檔案說明,Googlebot 會爬取支援檔案的第一個 2 MB,並在截止點停止抓取。Google 亦指出此限制適用於未壓縮的資料。後續技術說明補充,HTTP 標頭會消耗部分每 URL 的配額。由於本工具僅接收貼入的響應體,無法得知實際響應標頭的大小,也無法確證 Googlebot 恰好在哪個點停止。

為確保計算透明且保守,介面將 2 MB 作為一個十進位的 2,000,000 位元組體積參考。它會顯示該參考值以下的剩餘位元組或超出部分,同時保留標頭註解的提醒。Google 也提醒此限制可能變動,因此來源連結與參考日期比將數字視為永恆常數更重要。

連結資源不會將其位元組計入貼上的HTML總數。外部樣式表、指令碼、圖片、框架、預載或媒體參考僅會計入HTML回應中出現的字元。Googlebot與網頁渲染服務可能會分別取得參考資源,並各自有其限制。分析器會列出支援的參考資源,讓你區分厚重文件與僅指向厚重文件的文件,但它從不會下載這些文件或聲稱瞭解其大小。

內聯程式碼會計入文件主體。分析器會將每個內聯指令碼和樣式元素內的文字視為UTF-8,並同時報告總位元組數與完整來源的百分比。外部指令碼元素則是以src來列出。樣式表和預載連結會透過rel標籤識別;常見的直接圖片、媒體和框架屬性則會被納入清單。srcset值會被保留為一個宣告,因為資料網址讓簡單的逗號分割變得不安全。計數與顯示的值會被限制,因此貼上的巨大文件無法產生無限的結果檢視。

資料 URI 是 HTML 來源的一部分,可能會使回應異常龐大。分析器會找出資料:支援的直接資源屬性值,進行計數,並測量貼上來源中屬性值的完整顯示。它不會將任意標題或 data-* 屬性視為資源,也不會解碼 Base64 再次加入解碼後的載荷,因為這樣會導致 HTML 中已存在的位元組被雙重計數。

解析器使用分離的 template 片段和瀏覽器原生 HTML 詞法單元分析器。這對 textarea、title、script、style 和其他純文字邊界很重要,因為規則運算式可能會誤判這些邊界。巢狀 template 內容會維持非作用狀態,且不會納入資源清單。貼上的 script 元素不會執行、表單不會送出,圖片、iframe、stylesheet 或 script 網址也不會發出請求。結果會以文字呈現。嚴格的輸入上限、共用元素數量上限,以及有界限的 URL 顯示,可保護主執行緒與輸出,避免意外貼入整個網站的傾印內容或對抗性標記。

這不是網路水壩、壓縮計算器或核心網頁指標測試。它不知道 gzip 或 Brotli 轉移大小、伺服器標頭、快取行為、遲到的客戶端 DOM 變動、資源響應大小、執行成本、渲染成本,或 Google 其實索引了什麼內容。當這些事實重要時,請使用瀏覽器 DevTools 或 curl 對合法公開響應進行測試。

請盡可能貼上原始的 HTML 回應。在 JavaScript 執行後複製 Elements 面板,可能會包含回應中未出現的變異,並遺漏部分來源細節。檢視原始碼、儲存的回應主體或授權的 curl 捕獲,會是這個測量更好的輸入。若伺服器根據使用者端、語言、認證或裝置有所不同,請分別測試代表性回應。

將此分析結果視為除錯地圖。大型內嵌指令碼體積可能顯示為序列化的應用狀態、重複的水合資料或內嵌的套件。大型內嵌樣式體積可能顯示為重複的關鍵 CSS。大型 data URI 總計可能揭示 Base64 圖片或字型直接內嵌在標記中。過多的外部資源清單可能顯示重複標籤,但僅參考數量本身並非效能指標。

找到熱點後,做出最小且真實的調整,重新測量實際響應。將適當的程式碼移至可快取的外部檔案、移除重複的序列化資料、避免將大型二進位載體內嵌於 data URI 中,並將關鍵元資料與內容提前放入響應中。接著驗證部署的位元組、響應標頭、渲染頁面與索引證據,而不是假設較小的數字代表能被爬取、索引或排名。

方法與來源

分析器會以 TextEncoder UTF-8 位元組測量原始輸入,解析未附加至活頁簿文件的分離模板片段,歸類內聯指令碼/樣式文字與常見資源屬性,計算一次 data URI 屬性值,並限制提取與顯示範圍。2,000,000 位元組主體比較會明確標註為 Google 目前 2 MB 每 URL Googlebot 限制的保守十進位制參考;HTTP 頭部、壓縮、外部載入內容與索引結果仍不包含在結果中。

常見問題

這個工具會抓取我的 URL 或從貼入的 HTML 載入資源嗎?
不會。它會在分離的模板片段中解析貼入的文字內容,不會請求、執行、上傳或提交任何內容。
貼入的 2,000,000 位元組數量是否保證 Googlebot 會收到完整頁面?
不會。Google 目前的 2 MB 限制包含 HTTP 標頭,而本工具僅看到體積部分。結果僅提供一個透明的體積參考,並非爬取或索引保證。
外部圖片、CSS 與 JavaScript 檔案的大小是否包含在內?
僅包含其 URL 文字與標籤,這些會計入 HTML 位元組總計。外部檔案會被列出,但從未下載;Google 會分別抓取這些引用的資源。

SEO 與網站管理 使用指南

查看全部