一個 meta robots 產生器的替代方案,是一種瀏覽器端的工具,能從同一組爬蟲、索引與預覽控制項,同時產生經驗證的 HTML robots meta 元素,以及對應的 X-Robots-Tag HTTP 標頭,而不是貼上彼此矛盾的勾選組合。Meta Robots 產生器採用 Google 目前支援的 token——包括通用的 robots 目標、Googlebot 文字結果目標,以及 Googlebot News 目標——並拒絕輸出例如 nosnippet 與數值型 max-snippet 同時出現,或 indexifembedded 缺少必要的 noindex 搭檔這類組合。產生過程在本地執行,因此不會有任何爬蟲設定或頁面 URL 離開瀏覽器,輸出內容同時包含兩種部署管道的精確語法。HTML meta 元素會根據所選的爬蟲目標使用正確的 name 屬性,而標頭行則會以同樣的使用者代理作為前置詞,使伺服器設定不會在無聲中擴大規則的適用範圍。

meta robots generator alternative
meta robots generator alternative

一個現代的 Meta Robots 產生器替代方案必須涵蓋什麼

一個可靠的 meta robots 產生器替代方案,應該能從同一組選擇器產生標準語法,而不是兩種可能各自漂移的平行形式。現有的單一用途產生器常常只輸出 HTML meta 元素,讓發布者必須手動重建標頭,而這正是互相衝突的宣告最後被複製貼上到 CMS 範本、SEO 外掛、反向代理與 CDN 各處的原因。每一層都可能再加上自己的標籤,卻不會檢查另一層已經提供了什麼。搜尋查詢所暗示的替代方案需要具備三項特性。

第一,它必須將爬蟲目標作為輸入。Google 文件中記載了三個相關 token:適用於所有合作爬蟲的通用 robots 目標、適用於 Google 文字與搜尋結果的 googlebot,以及希望使用獨立規則集的發布新聞文章的發布者所使用的 googlebot-news。第二,它必須只將所選的索引與預覽限制序列化為有文件記載的 token。第三,它必須提供單一輸出,既能以 HTML 標記部署,也能以 HTTP 標頭部署,使同一選擇能產生兩種形式。

Meta Robots 產生器涵蓋了上述全部三項。它刻意省略 noarchive,因為 Google 現在已將該規則列為歷史性規則——快取連結功能已不存在——同時省略 unavailable_after,因為正確的日期時間格式與發布工作流程需要一般化表單不應自行猜測的脈絡資訊。納入熟悉但已無作用的勾選框會製造虛假的安全感。介面也僅限於 Google 為其文字與新聞產品所記載的兩種使用者代理,因此其他爬蟲名稱與各家廠商特有的行為不在其範圍內。

如何建立經驗證的標籤與標頭

  1. 開啟 Meta Robots 產生器並選擇爬蟲目標。若 HTML 頁面適用於所有合作爬蟲,請選擇通用 robots 目標;若規則僅適用於 Google 的文字與搜尋結果,請切換為 googlebot;若發布者發布新聞文章並希望使用獨立的規則集,則選擇 googlebot-news。
  2. 僅切換符合該頁面資源政策的索引、追蹤與預覽限制。介面列出 noindex、nofollow、nosnippet、notranslate、noimageindex、indexifembedded、max-snippet、max-video-preview,以及 max-image-preview。若某項控制項不適用,請保持未變動。
  3. 查看即時輸出面板。HTML meta 元素會根據目標使用 name="robots"、name="googlebot" 或 name="googlebot-news",而 X-Robots-Tag 標頭則會以同樣的使用者代理作為前置詞,確保伺服器端的規則不會在無聲中自行擴大範圍。
  4. 將 HTML 行複製到頁面的 區段,或將標頭行複製到控制該資源 HTTP 回應的網頁伺服器、應用程式或 CDN 設定中。將標頭文字貼到頁面內容中是無效的。
  5. 發布變更後,以所選爬蟲的方式擷取公開 URL,並同時檢查渲染後的原始碼與回應標頭。搜尋引擎會依照自身的檢索排程處理此變更,其他引擎則可能對 Google 專屬指令有不同的解讀。

HTML Meta 元素與 X-Robots-Tag 標頭的比較

管道所在位置適用情境爬蟲限定方式
HTML meta 元素頁面 <head>由發布者掌控標記的 HTML 頁面name 屬性設定為 robots、googlebot 或 googlebot-news
X-Robots-Tag 標頭HTTP 回應非 HTML 資源(PDF、圖片、影片檔案),或任何相較於範本編輯、以管理標頭更為可靠的部署環境標頭值內的使用者代理前置詞,與 meta 的 name 一致

當資源為 HTML,且發布系統已提供可編輯的 head 區塊時,請使用 meta 元素。針對 PDF、圖片與影片檔案,以及透過反向代理或 CDN 提供、以設定標頭比來源端範本更可靠的 HTML 頁面,請使用 X-Robots-Tag。由於 Meta Robots 產生器能從同一組選擇器同時產生兩種形式,發布者可在任一管道中擇一使用,而無需重新輸入選項,也無須承擔兩者之間產生漂移的風險。

預覽控制項與衝突的規則

控制項文件記載的值效果
nosnippet單一 token不出現文字摘要或影片預覽;Google 也指出,該頁面內容無法作為 AI Overviews 與 AI Mode 的直接輸入,但靜態縮圖仍可能顯示
max-snippet-1、0 或非負整數(字元數)-1 讓 Google 自行決定有效長度;0 等同於無摘要;任何其他非負整數則將文字摘要上限設為該字元數
max-video-preview-1、0 或非負整數(秒數)-1 表示沒有限制時長;0 僅允許在圖片規則下顯示靜態圖片;非負整數則設定最長時長
max-image-previewnone、standard、largeNone 表示不請求任何圖片預覽;standard 允許使用預設預覽;large 允許寬度可達視窗寬度的較大預覽

由於限制更嚴格的 nosnippet 會使數值設定失去意義,因此產生器拒絕同時輸出 nosnippet 與數值型 max-snippet。它會拒絕非整數或低於最小值的數值,而不是將其原樣複製到一條 Google 會默默忽略的規則中。indexifembedded 僅在同時選取 noindex 時才會輸出,因為 Google 明指該指令若無 noindex 則無效。當發布者已透過結構化資料、AMP 關聯或授權另行授予特定權限時,這些限制中的任何一項也可能被覆寫,因此產生的字串並非一個通用的內容使用開關。

部署、檢索存取與衝突的規則

爬蟲必須能夠擷取資源,才能讀取兩種形式中的任何一者。若 robots.txt 禁止檢索,Google 可能永遠看不到 noindex 規則,URL 仍可能因外部連結而被知悉,而頁面內容則持續未被處理。若要從結果中移除一個可存取的頁面,請允許檢索並持續提供該指令,直到搜尋引擎完成處理。對於互補性的檢索治理檔案,robots.txt 產生器能建立符合標準的 robots.txt,且不會將設定資料送往伺服器,讓兩種管道都維持相同的瀏覽器端基礎。

當同一個回應中同時出現多個 meta 標籤、HTTP 標頭或爬蟲專屬的宣告時,Google 會將其解讀為組合式的限制,並採用其中較嚴格的規則。在新增另一個標籤之前,請先盤點現有的輸出。CMS 範本、SEO 外掛、反向代理與 CDN 各自都可能加上自己的指令,因此僅憑編輯器中的設定並不具決定性——真正具決定性的是實際送出的 HTML 與實際的回應標頭。部署完成後,請以目標爬蟲可存取的方式擷取公開 URL,並確認回應中任何位置皆無矛盾的宣告。

關於本文所用 token 背後的已發布規格,請參閱 Google robots meta tag documentation 以及 WHATWG HTML meta element reference。產生器能輸出精確的語法,但無法保證實際除索引的結果、處理時程或特定的搜尋結果呈現方式。

若您正在權衡各種選項,How to Get Meta Tags From Facebook for Sharing 對此有詳細說明。

若您正在權衡各種選項,How to Generate Robots.txt in WordPress Without a Plugin 對此有詳細說明。