robots meta 標籤或 X-Robots-Tag 標頭,是要求對某個頁面或資源,設定索引、追蹤與預覽限制的標準做法,不需要依賴外部 API。Meta Robots Generator 會依照同一組選擇,產生一個經過驗證的 HTML meta 元素,以及對應的 HTTP 標頭,確保不會出現互相矛盾的組合。這種做法,完全在你的瀏覽器內執行,因此你不需要把資料送到搜尋服務,也不需要等待任何 API 回應。你只需要選擇爬蟲目標——一般搜尋爬蟲、專門處理文字結果的 Googlebot,或 Googlebot News——接著只加上你打算設定的索引與呈現限制即可。這個工具,會強制遵守 Google 公開文件記載的規則,例如當選擇了 nosnippet 時,會拒絕數字型的摘要長度限制;或是要求必須同時選擇 noindex,indexifembedded 才會生效。

如果你以前用過以 API 為基礎的 robots meta 標籤工具,你可能遇過速率限制、延遲,或是預期之外的格式問題。一個在本機執行的產生器,能避免這些問題,直接產生你可以複製、立即部署的準確語法。舉例來說,如果你需要防止一份 PDF 出現在搜尋結果中,這個工具會產生像 X-Robots-Tag: googlebot: noindex 這樣的 X-Robots-Tag 標頭,你可以把它設定在你的網頁伺服器或 CDN 上。同樣地,對於一個 HTML 頁面,它會提供 <meta name="googlebot" content="noindex, nofollow"> 這樣的 meta 標籤。這兩種輸出,都是從同一組經過驗證的選擇推導出來的,因此你不需要去調和標記與標頭之間的差異。

這種做法,對於需要管理多個環境——開發、預備與正式環境——的團隊來說特別有用,因為在這些情境中,依賴 API 反而會讓工作流程變得複雜。由於這個產生器完全在本機執行,你可以在部署設定之前,先離線測試。它也能幫你避開一些常見的錯誤,例如把 nosnippet 和一個數字型的 max-snippet 數值混用,或是在使用 indexifembedded 時,忘記加上 noindex。這個工具的介面,刻意省略了像 noarchive 這種 Google 已不再支援的過時或已不再使用的指令,以及 unavailable_after 這種需要精確處理日期時間、超出一般表單範圍的指令。

meta robots generator api alternative
Meta Robots Generator API 替代方案

什麼時候該用 Robots Meta 標籤,什麼時候該用 X-Robots-Tag 標頭

Robots meta 標籤與 X-Robots-Tag 標頭,用途相同,但部署的情境不一樣。當你能直接控制標記內容時,請針對 HTML 頁面使用 meta 標籤。舉例來說,如果你正在 CMS 中編輯一篇部落格文章或產品頁面,你可以把產生出來的 meta 元素,貼進 <head> 區塊中。對大多數發布者來說,這種做法很直接,也能確保這項指令,出現在頁面原始碼中,看得見。

對於非 HTML 資源,例如 PDF、圖片或影片,或是回應標頭比標記更方便管理的情況,請使用 X-Robots-Tag 標頭。舉例來說,如果你正透過網頁伺服器提供一份 PDF,你可以設定伺服器,在回應中加入 X-Robots-Tag: noindex 這個標頭。這種做法,對於標頭比內嵌標記更容易管理的動態應用程式來說,也很有用。不過請注意,把標頭文字貼進頁面內容中並不會有任何效果——這個指令,必須由伺服器或 CDN 來設定。

下表整理了什麼時候該使用哪一種格式:

格式 最適合用於 範例使用情境 部署方式
Robots meta 標籤 HTML 頁面 部落格文章、產品頁面 貼進 <head> 區塊
X-Robots-Tag 標頭 非 HTML 資源,或由標頭控制的環境 PDF、圖片、影片,或動態應用程式 在網頁伺服器、應用程式,或 CDN 中設定

如何產生並部署 Robots 指令

  1. 選擇爬蟲目標與限制:打開 Meta Robots Generator,選擇這條規則要套用在一般搜尋爬蟲、Googlebot(文字結果)還是 Googlebot News 上。接著,只選擇符合你政策的索引、追蹤與預覽限制。舉例來說,如果你想防止某個頁面出現在搜尋結果中、但仍然允許連結被追蹤,就選擇 noindex,不要選 nofollow。如果你還想封鎖文字摘要,就加上 nosnippet
  2. 產生並複製輸出結果:選好選項之後,這個工具會顯示 HTML meta 元素,以及對應的 X-Robots-Tag 標頭。複製你需要的格式。針對 HTML 頁面,使用 meta 標籤;針對非 HTML 資源,則使用標頭。這個工具會強制遵守 Google 的規則,因此會拒絕無效的組合,例如 nosnippet 搭配一個數字型的 max-snippet 數值。
  3. 部署這條指令:對於 HTML 頁面,把 meta 標籤貼進頁面的 <head> 區塊。對於 X-Robots-Tag 標頭,請設定你的網頁伺服器、應用程式,或 CDN,在回應中加入這個標頭。舉例來說,在 Apache 中,你可能會在 .htaccess 檔案中加入 Header set X-Robots-Tag "noindex, nofollow"。在 Nginx 中,你則會使用 add_header X-Robots-Tag "noindex, nofollow";。
  4. 檢查公開的原始碼與標頭:部署完成之後,用預期爬蟲會使用的方式,去讀取這個公開的網址。對於 HTML 頁面,檢視頁面原始碼,確認 meta 標籤出現在 <head> 區塊中。對於 X-Robots-Tag 標頭,使用你瀏覽器的開發人員工具(Network 分頁),或是像 curl -I 這樣的命令列工具,來檢查回應標頭。確保沒有來自其他來源(例如 CMS、SEO 外掛,或 CDN)的重複或衝突指令。
  5. 觀察重新爬取的狀況:搜尋引擎會依照自己的時程處理變更,因此這個指令不會立即生效。使用 Google Search Console 的網址檢查工具,確認 Google 是否已經處理過更新後的頁面。如果這個指令沒有被遵守,請回頭檢查部署步驟,確認標籤或標頭放置的位置正確,而且可以被存取。

常見指令與它們的效果

Meta Robots Generator 支援一組聚焦、符合 Google 現行文件的指令。每一個指令,都控制著一個頁面或資源,在搜尋結果中呈現方式的特定面向。以下是各個可用選項及其效果的詳細說明:

指令 效果 範例使用情境 備註
noindex 要求這個頁面或資源,不要出現在搜尋結果中 防止一個感謝頁面,出現在搜尋結果中 不會封鎖爬取存取;只要知道網址的人,仍然可以請求該頁面
nofollow 要求頁面上的連結不要被追蹤 防止搜尋引擎,追蹤使用者生成內容頁面上的連結 不會阻止頁面本身被索引
nosnippet 要求 Google 不要顯示文字摘要或影片預覽 防止頁面內容,被用在 AI Overviews 中,或作為 AI Mode 的直接輸入內容 可能仍然會允許顯示靜態圖片縮圖
max-snippet:[number] 把文字摘要,限制在指定的字元數以內 把摘要限制在 20 個字元以內,做出簡短的預覽 使用 -1,讓 Google 自行決定長度;0 等同於沒有摘要
max-video-preview:[seconds] 把影片預覽的長度,限制在指定的秒數以內 把影片預覽限制在 10 秒以內 使用 -1 代表沒有長度限制;0 則只允許顯示靜態圖片
max-image-preview:[size] 控制圖片預覽的大小 為產品頁面,允許較大的圖片預覽 選項:none、standard 或 large
notranslate 要求 Google 不要提供翻譯後的標題與摘要 防止頁面的標題與摘要,在搜尋結果中被翻譯 不會影響頁面本身的內容或語言
noimageindex 要求 Google 不要為頁面上的圖片建立索引 防止頁面上的圖片,出現在 Google 圖片中 不會阻止頁面本身被索引
indexifembedded 即使設定了 noindex,仍允許透過 iframe 或類似元素內嵌時,讓內容被索引 允許一支影片,即使託管頁面是 noindex,在被嵌入到其他網站時,仍然被索引 只有在同時搭配 noindex 時,才會有效果

有些指令會彼此互動,或存在相依關係。舉例來說,indexifembedded 只有在同時選擇了 noindex 時,才會生效。同樣地,nosnippet 也不能和數字型的 max-snippet 數值一起使用,因為前者的限制範圍更嚴格。這個產生器,會強制遵守這些規則,避免出現 Google 會直接忽略的無效組合。

疑難排解部署問題

即使是已驗證過的指令,部署上的問題仍可能導致搜尋引擎無法遵守你的規則。以下是常見問題及其解決方法:

  • 爬取存取被 robots.txt 封鎖:如果你的 robots.txt 檔案禁止爬取該頁面或資源,搜尋引擎可能根本看不到 robots meta 標籤或 X-Robots-Tag 標頭。若要將頁面從搜尋結果中移除,請確保允許爬取存取,並持續提供 noindex 指令,直到搜尋引擎處理為止。你可以使用Robots.txt Generator或 Google Search Console 的 robots.txt 測試工具來檢查你的 robots.txt 檔案。
  • 重複或衝突的指令:多個來源,例如 CMS、SEO 外掛、反向代理伺服器或 CDN,都可能為頁面加上 robots 指令。舉例來說,CMS 可能加入一個 meta 標籤,而 CDN 又加入一個 X-Robots-Tag 標頭。衝突的規則會依合併限制來解讀,以較嚴格的規則為準。請檢查傳送的 HTML 與實際的回應標頭,以找出重複或衝突之處。可使用瀏覽器的開發人員工具,或像 curl -I 這類的命令列工具來檢查標頭。
  • X-Robots-Tag 部署不正確:X-Robots-Tag 標頭必須由網頁伺服器、應用程式或 CDN 設定。把標頭文字貼進頁面內容中不會有任何作用。例如,在 HTML 頁面的 body 中加入 X-Robots-Tag: noindex 是無效的。你應該改在伺服器設定檔中設定該標頭(例如 Apache 的 .htaccess 或 Nginx 的 nginx.conf)。
  • 其他爬蟲會忽略 Google 專屬指令:像googlebot: noindexgooglebot-news: nosnippet這類指令是 Google 專屬的。其他搜尋引擎可能會忽略它們,或以不同方式解讀。如果你需要控管其他爬蟲如何處理你的內容,請使用一般的robots目標,或查閱該爬蟲支援哪些指令的說明文件。
  • 搜尋引擎處理有延遲:搜尋引擎會依自身的爬取排程處理變更,這可能需要數小時到數週不等。可使用 Google Search Console 的網址檢查工具,確認 Google 是否已處理更新後的頁面。如果指令未被遵守,請重新檢視部署步驟,確認標籤或標頭是否放置正確且可被存取。

解決任何問題後,請在 Google Search Console 中持續監控該頁面,以確認指令確實被遵守。如果頁面在設有 noindex 指令的情況下仍出現在搜尋結果中,請檢查爬取存取權限、重複指令,以及標籤或標頭是否部署正確。

延伸閱讀:How to Get a Robots.txt File for Your Website

延伸閱讀:Generate Schema Markup Without an API: A Local JSON-LD Workflow