一個 meta robots 產生器的批次工作流程,會從同一組 Google 支援的索引與預覽控制選項中,產生經過驗證的 robots meta 元素,以及等價的 X-Robots-Tag HTTP 標頭,讓你可以把同一套政策套用於許多頁面而不產生衝突。這個工具會在你單次操作的工作階段中,把所選的爬蟲目標,加上索引、連結追蹤與呈現限制,一次轉換成兩個同步的輸出格式,使你能將同一條規則同時套用於 HTML 標記與伺服器回應標頭,而無需維護兩個各自獨立的字串。由於每一項限制都經過型別檢查並依序排列,產生器會拒絕那些 Google 會自行相互抵觸的組合(例如 nosnippet 與一個數值 max-snippet 配對),也會拒絕單獨使用 indexifembedded,除非同時搭配 noindex,因此你所複製的字串都能放心地大規模部署。產生過程在本地端完成,輸出內容可直接複製使用,使用前不需要呼叫搜尋服務、提交 sitemap,或註冊 API 金鑰。

meta robots generator bulk
meta robots generator bulk

批次作業對頁面層級指令產生器而言代表什麼

「批次 meta robots 產生器」這個詞對不同的人可能代表不同的意思。本工具Meta Robots 產生器並不會爬取你的網站,也不會從 sitemap 抓取 URL 清單;它一次處理一組經過驗證的選擇。它以「批次友善」方式提供的功能,是從同一組輸入同時產出兩種格式:用於頁面層級標記的 HTML meta 元素,以及用於 HTTP 回應標頭的 X-Robots-Tag 值。這代表單一決策工作階段,就能同時涵蓋你原本必須分開撰寫的兩種部署管道,而且同一條規則可以被帶入屬於該政策群組的每一個頁面。

若要將一條指令部署到許多 URL,請為每一個不同的政策重複使用本工具。典型的批次部署可能會包含三組規則:一組用於公開的行銷頁面(預設索引加上 20 字元的摘要上限與標準圖片預覽),第二組用於工具型頁面,例如搜尋結果或內部篩選器(noindex 與 nofollow),以及第三組用於可下載的 PDF(noindex 加上 nosnippet),透過 X-Robots-Tag 標頭提供。本工具可讓你輕鬆地組合每一組規則,並複製到 CMS 模板、反向代理伺服器設定,或靜態網站產生器的前言(front matter)中。由于兩種格式會一起輸出,你的工程與內容團隊可以共用同一個真實來源(single source of truth),而不必事後再去比對兩個手寫的字串。

產生一組經過驗證的指令

  1. 選擇爬蟲目標。如果要建立 meta name 為 robots、標頭值未限定的規則,請選擇「all crawlers」;如果要建立 meta name 為 googlebot、標頭前綴為 Googlebot 的規則,請選擇「Googlebot text results」;如果要使用 googlebot-news 並搭配對應的標頭前綴,請選擇「Googlebot News」。其他爬蟲名稱與各家廠商專屬的代碼,並未在這個聚焦介面中開放。
  2. 僅新增與資源政策相符的索引與追蹤限制。當頁面或檔案不應出現在搜尋結果中時,請選擇 noindex。當頁面上的連結不應被追蹤時,請選擇 nofollow。這些屬於爬蟲指令而非存取控制,因此任何知道該 URL 的人,仍然可以請求取得內容。
  3. 新增你真正打算套用的預覽限制。若不希望顯示任何文字或影片預覽,請啟用 nosnippet。若想將摘要長度限制為固定的字元數,請選擇一個數值 max-snippet,其中 -1 表示將長度決定權交還給 Google,而 0 依官方說明等同於不顯示摘要。請選擇 max-image-preview 為 none、standard 或 large。請以秒數選擇 max-video-preview,其中 -1 代表沒有限制,0 代表在圖片規則下最多僅顯示一張靜態圖片。
  4. 在適用時新增呈現方式的覆寫設定。啟用 notranslate 以要求 Google 不要提供翻譯後的標題與摘要。啟用 noimageindex 以要求 Google 不要索引頁面上的圖片。只有在希望該頁面在 iframe 或類似元素中仍被索引,儘管同時設有 noindex 時,才啟用 indexifembedded —— 產生器會強制執行這個配對規則,不會單獨輸出 indexifembedded。
  5. 產生、複製並部署兩種形式。將 HTML meta 元素複製到每一個應遵守該規則的頁面的 head 中。將 X-Robots-Tag 標頭值複製到提供該資源的網頁伺服器、應用程式或 CDN 中。將所顯示的標頭文字貼到 HTML 內容主體中是無作用的,因為該標頭必須以真正的 HTTP 回應標頭形式傳遞。

HTML meta 元素 vs X-Robots-Tag 標頭

兩種格式承載相同的基本指令字串;差異在於指令的傳遞位置。HTML meta 元素位於頁面標記之中,由抓取該頁面的爬蟲讀取;X-Robots-Tag 標頭則由伺服器設定,並在主體內容之前或同時由爬蟲讀取,因此它能套用於非 HTML 的資源。

特性HTML meta 元素X-Robots-Tag 標頭
傳遞位置位於頁面 head 之中,從 HTML 解析由伺服器、CDN 或應用程式送出的 HTTP 回應標頭
最適用於由你掌控標記的 HTML 頁面非 HTML 檔案(PDF、圖片、影片),以及任何以回應標頭作為受控管道的部署情境
設定方式編輯頁面模板或 CMS 欄位設定網頁伺服器、反向代理或 CDN 規則
放錯位置時的效果放在 head 以外則無作用貼到 HTML 內容主體中則無作用
通用爬蟲代碼name="robots" 搭配 content="..."未限定的標頭值
Google 專屬代碼name="googlebot" 或 name="googlebot-news"標頭值前綴為 Googlebot 或 googlebot-news

對大多數 HTML 頁面來說,meta 元素是較簡單的做法。對 PDF、圖片與影片檔案,或在應用層已經負責快取與標頭的情境下,X-Robots-Tag 標頭則是更可靠的管道。產生器會在同一個工作階段中同時輸出兩種格式,讓你能一起部署,而不必手動重新撰寫指令清單。

摘要與預覽指令的有效值

數值與列舉設定僅接受一小組有效的值,超出該範圍的值會被拒絕,而不會被複製到一條 Google 會忽略的規則中。依據Google 的 robots meta tag 規格,以下限制適用。

指令可接受的值備註
max-snippet-1 或一個非負整數的字元數0 依官方說明等同於不顯示摘要;-1 讓 Google 自行決定有效長度;非整數與小於 -1 的值會被拒絕
max-image-previewnone、standard、largenone 表示不要求預覽,standard 為預設大小,large 允許最大至檢視區寬度的預覽
max-video-preview以整數表示的秒數,-1 代表沒有限制0 在圖片規則下最多僅允許一張靜態圖片;非整數與小於 -1 的值會被拒絕
nosnippet存在旗標(不帶值)與數值 max-snippet 互斥;產生器不會同時輸出兩者,因為較嚴格的規則會使數值選擇產生誤導
indexifembedded存在旗標(不帶值)僅在搭配 noindex 時有效;產生器在顯示輸出前會強制執行這個配對
notranslate、noimageindex存在旗標(不帶值)獨立的呈現方式覆寫設定;彼此可組合,也可與其他指令組合使用

當發布方已透過結構化資料、AMP 關聯或授權另行授予權限時,這些預覽限制可能會被覆寫,因此所產生的字串並非通用的內容使用開關。若已存在此類協議,請將 meta robots 規則視為預設值而非硬性上限,並在發布前與你的授權資料進行比對。

部署後確認沒有重複或衝突的規則

批次部署並不會在將字串貼進 CMS 模板或標頭設定後就完成。必須先允許爬蟲抓取該資源,它才能讀取任一種格式。若 robots.txt 禁止爬取,Google 可能永遠看不到 noindex 規則,而該 URL 可能僅因外部連結而被知悉,但頁面內容卻不會被處理。若要從結果中移除一個可存取的頁面,請允許爬取並提供該指令,直到搜尋引擎在其自身的排程中自行處理。

在假設部署成功之前,請檢查 HTML 頁面的公開原始碼,以及非 HTML 檔案的實際回應標頭。多個層級都可能各自加上指令:CMS、SEO 外掛、反向代理與 CDN 都能各自貢獻 X-Robots-Tag 值或 meta 元素,僅靠編輯器中的設定是不夠的。當兩條規則衝突時,Google 表示會採用較嚴格的規則,因此一條寬鬆的頁面規則與一條嚴格的全局標頭,將會以較嚴格的解讀為準。在新增另一個標籤之前,請盤點現有的輸出,並移除任何只會增加雜訊的重複項目。

在確認伺服器實際輸出後,請等待搜尋引擎依其排程重新抓取。本產生器只會產生精確的語法;它無法保證去索引的結果、時間點,或特定的搜尋結果呈現方式,其他搜尋引擎也可能會以不同方式解讀 Google 專屬的指令。若要對許多頁面取得更廣泛的爬蟲覆蓋率,請在「all crawlers」目標下重複使用同一組選擇,使規則未限定,然後部署本產生器在該工作階段中輸出的 HTML meta 元素與 X-Robots-Tag 標頭。

若你正在權衡選項,如何用 JavaScript 取得 Meta Tag 值對此有詳細說明。

若你正在權衡選項,如何取得 Robots.txt 檔案:擷取或產生對此有詳細說明。