一個安全的 meta robots 產生器完全在您的瀏覽器中執行,只接受 Google 官方文件中列出的指令,拒絕產生互相矛盾的組合,並且絕不會將頁面資料傳送到遠端伺服器。這四項特性在同一個工作流程中涵蓋了技術、語法和隱私等安全面向。技術面指的是產生作業完全在瀏覽器中執行,因此您所編寫的指令不會離開頁面。語法面指的是產生器只會輸出 Google 和主要爬蟲實際能夠識別的值,且採用各解析器所預期的格式 — 要不就是頁面標記用的 HTML meta 元素,要不就是非 HTML 資源用的 X-Robots-Tag 回應標頭。組合面指的是工具會封鎖彼此衝突的規則,例如同時輸出 nosnippet 與一個數值型 max-snippet,或是只有 indexifembedded 卻沒有 noindex。隱私面指的是您所輸入的 URL、指令和頁面政策都不會離開瀏覽器分頁。在產生之前知道該檢查哪些項目,能將模糊的信任感轉化為可應用於任何工具的具體驗證流程。

meta robots generator safe
Meta Robots 產生器安全嗎?使用前必須檢查的重點

產生 robots 指令時「安全」的真正含義

詢問 meta robots 產生器是否安全的人,通常把三個疑慮混雜在一起:URL 的隱私、語法的正確性,以及意外破壞 SEO 的風險。將這些疑慮分開檢視,能把模糊的擔憂轉化為可套用於任何工具的檢查清單。

隱私涵蓋您所輸入的 URL、頁面名稱和政策選擇會如何被處理。最安全的工具會在分頁內部處理輸入和輸出,從不開啟網路連線將您的決策轉送到其他地方。一個具有 embargoed 名稱或內含合作夥伴名稱的頁面,絕不應該只是為了取得一個 meta 標籤範本就被傳送給第三方。

正確性涵蓋工具是否只輸出 Google 和 Bing 目前有文件記載的指令。一個現在還提供 noarchive 選項的產生器,其實是在提供一個 Google 已經列為歷史性且不再使用的指令,因為快取連結功能已經不存在。一個提供 unavailable_after 但沒有日期與時區選擇器的工具,則是在提供一個語法上很容易出錯的指令。把這些看起來熟悉但實際無效的規則納入其中,會製造出虛假的信心:標籤看起來很完整,卻什麼作用也沒有。

組合安全性涵蓋彼此矛盾的規則。nosnippet 要求不提供文字或影片預覽。一個數值型 max-snippet 則要求特定長度。同時要求這兩者並不合理,因此安全的產生器會拒絕輸出這個組合。indexifembedded 允許嵌入內容在有 noindex 的情況下仍被索引,因此它必須搭配 noindex 才會生效;安全的產生器會強制執行這個相依性。落在文件記載範圍之外的數值限制 — 非整數、低於 -1 的值、非整數秒數的影片長度 — 都會被拒絕,而不是默默寫進一條 Google 會忽略的規則中。

Meta Robots 產生器如何維持輸出正確且在本機執行

Meta Robots 產生器的設計圍繞著這四項特性。產生作業完全在瀏覽器中執行,因此您所編寫的指令不會離開頁面,而且輸出內容可以被複製而無需聯絡任何搜尋服務。介面只接受 Google 文件中記載的爬蟲目標和索引或預覽限制:適用於所有爬蟲的通用 robots token、用於 Google 文字結果的 googlebot token,以及用於 Google 新聞的 googlebot-news。其他爬蟲名稱刻意被排除在這個精簡介面之外,讓表單不會去猜測各廠商的行為。

輸出會以同一組選擇序列化為 HTML meta 元素和對等的 HTTP 標頭。通用 robots 目標會輸出一個 name 為 robots 的 meta 元素,以及一個未限定 user agent 的 X-Robots-Tag 標頭。指定 Google 的目標則使用 googlebot 或 googlebot-news 作為 meta 的 name,並在 HTTP 標頭值中將該 user agent 作為前綴。語法遵循 Google 在其 robots meta 標籤規格 中所記載的格式,因此您複製的內容就是搜尋解析器所預期的內容。產生器的指令清單也反映了 Google 對這些 token 的最新處理方式,包括 nosnippet 會要求 Google 不要提供文字摘要或影片預覽,並防止該頁面被直接用於 AI Overviews 和 AI Mode 的輸入,不過靜態圖片縮圖仍然可能出現。

組合檢查在任何輸出顯示之前就會強制執行。nosnippet 不能與數值型 max-snippet 搭配,因為限制更嚴格的 nosnippet 會讓數值選擇變得毫無意義。indexifembedded 必須搭配 noindex,因為 Google 說明它沒有 noindex 就沒有作用。數值輸入是具型別的選項集合:max-snippet 接受 -1 或非負整數,max-video-preview 接受 -1、0 或正整數秒數,max-image-preview 則接受文件中所記載的 none、standard 和 large 設定。任何超出這個範圍的內容都會被拒絕,而不是被複製成一條解析器會直接捨棄的規則。

逐步建立一個經過驗證的 robots meta 標籤

  1. 選擇爬蟲目標,並只挑選符合資源政策的索引、追蹤和預覽限制。決定您要對所有爬蟲使用 robots token、對 Google 文字結果使用 googlebot,還是對 Google 新聞使用 googlebot-news。只加入真正反映您希望頁面執行什麼動作的限制 — 例如 staging 網址使用 noindex,或付費牆文章使用 nosnippet。請抗拒加入那些意義已經改變的熟悉規則。
  2. 產生並複製 HTML meta 元素(用於頁面)或 X-Robots-Tag 標頭(用於伺服器回應)。工具會從同一組選擇同時輸出兩種表示形式。將 meta 元素複製到您能控制標記的 HTML 頁面的 <head> 中,並將標頭複製到您的伺服器、應用程式或 CDN 設定中,用於 PDF、圖片或影片等非 HTML 資源。將標頭文字貼到頁面內容中沒有作用,因為該標頭必須以真正的回應標頭形式傳送。
  3. 部署時允許爬取存取,然後檢查公開的原始碼和標頭中是否有重複或衝突的規則,直到重新爬取發生為止。必須先允許爬蟲擷取資源,它才能讀取任一種形式。如果 robots.txt 拒絕了該 URL,搜尋引擎可能永遠看不到 noindex 指令,使得該 URL 仍可能因為外部連結而存在,但頁面內容卻不會被處理。部署完成後,以預定爬蟲能夠存取的方式擷取公開 URL,檢查所服務的 HTML 原始碼或 HTTP 標頭,並確認您的技術堆疊中其他位置沒有矛盾的宣告。

HTML meta 元素或 X-Robots-Tag 標頭 — 選擇安全的管道

兩種形式都有文件記載,且 Google 都會讀取,但它們適用於不同的資源和部署模型。選錯管道是「我加了 noindex 但什麼都沒發生」這類回報最常見的原因。

管道最適用於設定位置安全提醒
HTML <meta name="robots">您能控制標記的 HTML 頁面頁面的 <head> 內CMS 或 SEO 外掛可能會加入指令。在新增標籤之前,請盤點現有的標籤。
X-Robots-Tag HTTP 標頭PDF、圖片、影片及其他非 HTML 資源網頁伺服器、應用程式或 CDN 設定貼到 HTML 中的標頭文字沒有作用;它必須以真正的回應標頭形式傳送。
限定爬蟲的變體在 Google 與其他引擎之間應有不同行為的頁面任一種管道,搭配 googlebot 或 googlebot-news其他引擎對 Google 專屬 token 的解讀方式不同,因此爬蟲專屬標籤並非通用開關。

產生器拒絕輸出的衝突

Google 說明跨多個 meta 標籤、HTTP 標頭或限定爬蟲的宣告所產生的衝突規則,會以限制更嚴格的規則為準。產生器將這項政策編碼為硬性拒絕,因此複製緩衝區永遠不會裝著解析器會默默覆寫的字串。

預定的組合產生器採取的動作原因
nosnippet 搭配數值型 max-snippet拒絕同時輸出nosnippet 限制更嚴格,會讓數值長度變得毫無意義。
indexifembedded 沒有 noindex拒絕輸出 indexifembeddedGoogle 說明 indexifembedded 必須搭配 noindex 才會生效。
max-snippet 為非整數或低於 -1拒絕輸入超出範圍的值會被默默忽略,造成虛假的信心。
max-video-preview 為非整數或低於 -1拒絕輸入原因相同:Google 會忽略格式錯誤的數字。
noarchive完全不提供Google 將其列為歷史性且不再使用,因為快取連結功能已經不存在。
unavailable_after完全不提供日期時間格式、時區和發佈工作流程需要比通用表單所能猜測的更多上下文。

驗證標籤已上線且部署後未被覆寫

部署階段才是大多數重大安全錯誤真正發生的地方。即使標籤有效、語法正確、組合一致,如果 CMS、反向代理或 CDN 在下游注入了競爭的指令,該頁面仍可能出現在搜尋結果中。請在假設已部署的標籤是唯一作用中的標籤之前,先盤點所有可以加入指令的位置。

以預定爬蟲能夠存取的方式擷取公開 URL,並檢查所服務的 HTML 原始碼中的 meta 元素,以及 HTTP 回應標頭中的 X-Robots-Tag 值。WHATWG HTML 規格說明了解析器應如何讀取 meta 元素,因此您在原始碼中看到的內容就是爬蟲讀取到的內容。如果您的技術堆疊在編輯器中顯示一個標籤,而在服務的 HTML 中顯示另一個,那麼以服務的 HTML 為準。

搜尋引擎會依照自身的爬取排程來處理變更。正確部署的 noindex 並不保證立即從索引中移除,也不保證在結果中會以特定方式呈現;它只是在下次造訪時提出一個請求。在重新爬取之前,請將該標籤視為一個請求,而不是一個移除動作。產生器只負責產生精確的語法;它無法保證時間點,也無法保證在任何特定搜尋結果中的呈現方式。

最後,請記住 noindex、nofollow 和預覽限制都是給爬蟲的指令,而不是存取控制。任何知道該 URL 的人仍然可以請求該內容,而忽略該規則的爬蟲仍然可以處理它。如果某個頁面包含必須保持私密的內容,請使用真正的身分驗證與授權機制來保護它,而不是 meta 元素。

如果您正在權衡各種選擇,Meta Tag 產生器完整解析:它會建立什麼以及為什麼對此有詳細說明。

如果您正在權衡各種選擇,Robots.txt 產生器範例:每種模式的輸出對此有詳細說明。