中繼資料 robots 產生器是一個專注的建構工具,能將您的索引、追蹤與預覽設定轉換為經過驗證的 HTML 中繼資料元素以及對應的 X-Robots-Tag 標頭,並內建檢查機制,在複製任何程式碼之前先阻擋相互矛盾的組合。與其手動輸入指令而承擔語法錯誤的風險,產生器會以一組經過驗證的選項為基礎運作,確保中繼標籤與 HTTP 標頭始終描述同一個意圖。它將同一組一致的選擇序列化為兩種格式,拒絕 Google 會忽略的組合,並讓您在同一介面中鎖定一般爬蟲、Googlebot 文字結果或 Googlebot 新聞。輸出內容為純文字,您可以複製到適當的管道中——用於頁面 head 的 HTML 標記,或伺服器、應用程式或 CDN 可以提供的標頭值。由於同一組選擇同時驅動兩種輸出,此工具能讓您的頁面層級指令與回應層級指令保持完全同步,避免因有人編輯其中之一而忘了另一個所造成的偏差。

中繼資料 Robots 產生器實際產出什麼
產生器從同一組核取方塊與數值欄位產出兩個產物:一個放置於頁面 head 區段的 HTML 中繼資料元素,以及一個用於非 HTML 資源或由伺服器控制部署的 HTTP 回應標頭。選擇一般 robots 目標會輸出一個帶有 name="robots" 的中繼元素,並附上未限定的 X-Robots-Tag 值。選擇 Google 專屬目標則會將中繼名稱替換為 googlebot 或 googlebot-news,並在 HTTP 標頭值中為該使用者代理加上前綴,以對應 Google 為其文字與新聞結果所記錄的兩個代號(請參閱 Google 的 robots meta tag specifications)。
其他部分在兩種輸出之間保持完全一致。抓取範圍、索引、連結追蹤、摘要長度、圖片預覽、影片預覽、翻譯以及圖片索引限制皆逐字元鏡像對應,這正是透過單一介面同時建構兩者,而非手動分兩處撰寫的實務理由。
這種區隔同時界定了工具涵蓋的範圍。它不處理 robots.txt、不產生 Google 已記錄清單以外爬蟲的使用者代理專屬規則,也不進行身分驗證或限制存取。中繼標籤與標頭仍屬於搜尋引擎指令,而非安全控制機制。
它處理的指令(以及拒絕的指令)
產生器接受的所有指令都對應到一份 Google 已記錄且具明確定義的代號。選擇錯誤的組合會產生 Google 會忽略的字串,因此介面會完全拒絕輸出這些組合。讀者通常挑選的指令彙整如下;如需更完整的語法導向參考,請參閱中繼資料 Robots 產生器速查表:指令與語法。
| 指令 | 所請求的內容 |
|---|---|
| index / noindex | 頁面或資源是否可出現在搜尋結果中 |
| follow / nofollow | 爬蟲是否可追蹤頁面上的連結 |
| nosnippet | 不顯示文字摘要且不顯示影片預;靜態圖片縮圖仍可能出現 |
| max-snippet | 文字摘要字元數的數值上限;接受 -1 或非負整數 |
| max-image-preview | none、standard 或 large 圖片預覽 |
| max-video-preview | 影片預覽秒數;-1 表示無限制,0 表示僅靜態圖片 |
| notranslate | 略過標題與摘要的翻譯 |
| noimageindex | 不要索引頁面上的圖片 |
| indexifembedded | 即使設有 noindex,仍允許透過 iframe 嵌入時被索引;需搭配 noindex |
產生器會拒絕將 nosnippet 與 max-snippet 結合使用,因為限制更嚴格的 nosnippet 會讓數值上限變得具有誤導性。它會拒絕未搭配 noindex 的 indexifembedded,因為 Google 表示否則該指令無效。它會拒絕非整數或低於最小值的數值,因為 Google 會忽略這些輸入。這些細節絕非小事——它們正是會產生搜尋引擎悄悄捨棄之字串的輸入類型,因此在表單層級予以阻擋,才能確保輸出內容值得信賴。
中繼資料元素 vs X-Robots-Tag 標頭
這兩種輸出不可互換。它們以不同方式觸及同一個爬蟲,並服務於不同類型的資源。HTML 中繼資料元素存在於文件 head 內,適用於任何您能控制標記的 HTML 頁面。X-Robots-Tag 標頭則作為 HTTP 回應的一部分傳送,並於網頁伺服器、應用程式或 CDN 層設定。將標頭文字貼到頁面內容中完全不會產生作用。
| 管道 | 適用情境 | 由誰設定 |
|---|---|---|
| HTML 中繼資料元素 | HTML 頁面、樣板驅動的 CMS、頁面層級規則 | 頁面編輯者或樣板 |
| X-Robots-Tag 標頭 | PDF、圖片、影片檔案以及其他非 HTML 資產 | 網頁伺服器、應用程式、反向代理或 CDN |
由於產生器從同一組選擇輸出兩種形式,實務上的決策就在於哪個管道能觸及您要控制的檔案。對於文章或產品頁面,請使用中繼資料元素。對於可下載的 PDF、圖片資產,或任何由基礎架構而非樣板處理的回應,請使用標頭。無論使用哪一種,用字與指令皆保持一致。
如何使用中繼資料 Robots 產生器
三個步驟即可從一個索引意圖不明確的資源,轉為一段語法正確、可貼到正確管道的指令字串。
- 選擇爬蟲目標,僅挑選符合資源政策的指令。請先決定該規則是針對所有爬蟲、Googlebot 文字結果,還是 Googlebot 新聞。接著挑選能反映實際應該出現內容的索引、追蹤與預覽限制——加入您不需要的指令,只是為爬蟲增加更多它會忽略的規則。
- 產生並複製 HTML 中繼資料元素(用於頁面)或 X-Robots-Tag 標頭(用於伺服器回應)。介面會同時產生兩者,您只需擷取部署管道所接受的那一個,另一個則留在畫面上。HTML 行放入頁面的 head;標頭值則放入您的伺服器、反向代理或 CDN 設定中。
- 部署時允許抓取存取,然後檢查公開的原始碼與標頭中是否有重複或衝突的規則,直到重新抓取發生為止。robots.txt 的封鎖會讓爬蟲根本無法擷取該指令,因此請允許該 URL。部署完成後,模擬爬擷取頁面,檢查所提供的原始碼與回應標頭,並確認沒有來自 CMS、SEO 外掛、反向代理或 CDN 的矛盾宣告。
像 中繼資料 Robots 產生器 這類工具會在一個表單中走完上述步驟,拒絕 Google 會忽略的組合,並以適用於您所選目標的正確語法回傳兩個產物。
在公開輸出中部署並驗證標籤
指令就定位後,有兩項檢查能決定它是否真的生效。首先,確認抓取路徑上沒有任何東西阻擋該資源——robots.txt 的 disallow 規則、上游頁面的 nofollow 連結模式,或伺服器層級的防火牆,都可能導致爬蟲根本無法觸及該指令。其次,擷取公開 URL 並檢視爬蟲實際會收到的內容。針對 HTML 頁面使用瀏覽器的檢視原始碼功能,針對非 HTML 檔案則使用 curl 搭配 -I(或您 CDN 的標頭檢查工具)。
您要尋找的是一致性。多個中繼標、HTTP 標頭與爬蟲專屬宣告會以最嚴格的規則為準進行合併,因此外掛多輸出的 noindex 可能會覆寫原本有效的 follow 決定。CMS 平台、SEO 外掛、反向代理與 CDN 各自有注入指令的位置,而編輯檢視畫面極少反映實際傳遞的內容。在所提供的原始碼與回應標頭中搜尋該指令字串,是確認輸出符合您預期最可靠的方式。
有一項重要的注意事項:搜尋引擎會依照自身的抓取排程處理變更,而其他引擎對 Google 專屬指令的解讀可能不同。產生器僅產生正確的語法,無法保證移除索引、時機或特定的搜尋結果呈現方式。
為何產生器省略 Noarchive 與 Unavailable_after
兩個常見的指令被刻意排除於介面之外,且這些省略並非疏漏。Noarchive 被省略,是因為 Google 現已將其列為歷史性且不再使用的指令——它過去控制的快取連結功能已不存在,因此設置核取方塊只會讓人對爬蟲將忽略的規則產生錯誤的信心。Unavailable_after 被省略,是因為該指令仰賴正確的日期時間格式、正確的時區處理,以及能預先知道預定下架日期的發布流程;通用表單不應猜測這些數值。
實務上的意義是,產生器僅輸出 Google 目前明確記錄並實際遵循的指令。任何較舊或特定廠商的指令皆刻意被排除在這個專注的介面之外,因此最終產生的字串必定是目前 Google 爬蟲能解讀的內容。
如需深入了解,請參Open Graph 產生器替代方案:瀏覽器端標籤。