llms.txt 檔案是一份精簡且經過策展的 Markdown 網站概覽,其結構包含一個必要的 H1 標題、一段選擇性的 blockquote 摘要、選擇性的補充說明,以及零個或多個 H2 段落,用來將分組連結以可預期的順序排列。這個格式源自 llmstxt.org 的提案,目的是在語言模型深入檢視內容之前,先為專案提供一份簡短、人類可讀的摘要說明。重要的是,這份檔案是一項新興的提案,並非保證有效的探索機制、爬蟲指令,也不是 sitemap 的替代品。網站可以發布這份檔案,讓自身的權威資源更容易被找到,但並沒有任何爬蟲被迫讀取它,也無法保證排名或引用上的提升。這份檔案的真正價值在於傳達編輯意圖:哪些頁面最能代表產品、哪些參考屬於次要、哪些來源適合在推論階段引用。一份製作良好的 llms.txt 比 sitemap 更短、更精選,這正是它的重點所在——它是一份策展過的地圖,而非完整的索引。

how to create llms txt file
如何逐步建立 llms.txt 檔案

llms.txt 檔案包含哪些內容(以及不包含哪些)

這份提案規範了一套精簡的語法。唯一必要的元素是單獨一個 H1,其中包含專案或網站名稱。除此之外,檔案可以包含一段選擇性的 blockquote 摘要、選擇性的非標題說明文字,以及零個或多個 H2 段落,內含 Markdown 列表項目。每個列表項目的必要核心是一個連結;選擇性的冒號與註解可以用來說明該連結資源的內容。順序相當重要,因為這份檔案的設計是為了讓語言模型與一般解析器都能以可預期的方式讀取,因此產生器會強制依照文件規定的順序,而不是接受任意排列的 Markdown 片段,以避免產生重複的頂層標題或段落錯位。

文件中同時定義了一個名為 Optional 的特殊 H2 慣例。放在這個標題下的連結屬於次要資料,當消費者需要更精簡的脈絡時可以略過。哪些項目屬於選擇性屬於編輯判斷:作者自行決定哪些來源對於理解網站是不可或缺、哪些可以在資源有限時安全捨棄。工具並不會自動將資源標記為選擇性——這是一項策展決策,也是這份檔案中最關鍵的決定之一。

同樣重要的是了解這份檔案不會做什麼。llms.txt 既不是爬蟲指令,也不是安全控管機制,既不能取代 sitemap,也不是保證有效的探索機制。發布它無法讓被封鎖的頁面變得可存取、無法覆寫身分驗證、無法將內容從模型訓練資料中排除,也無法證明 AI 的回答一定會引用該網站。它是對現有網頁控管的補充,而不是取代任何一項。

如何逐步建立檔案

使用 llms.txt 產生器 作為起點,以透明的方式依照文件規定的順序組裝檔案。表單完全在瀏覽器中執行,僅接受提案所定義的輸入欄位,並會產生可預期的純文字輸出,讓你可以複製或下載,完全不需要將資料傳送至任何外部服務。

  1. 開啟 llms.txt 產生器,在必要的 H1 欄位中輸入網站或專案名稱。如果需要,可加入一段選擇性的 blockquote 摘要;如果有背景說明不適合列入清單,則可加入自由格式的細節內容。
  2. 僅在清楚的 H2 段落標題下,加入權威且高價值的連結。保留一個標示為 Optional 的段落,用來放置真正屬於次要、且可在精簡脈絡下略過的資料。
  3. 產生可預期的 Markdown 內容後,請閱讀 Optional 段落以及每一則註解,確認它們與連結的頁面一致。下載前,如果發現任何讀起來不通順之處,可在表單中直接編輯標籤與文字。
  4. 複製產生的文字,或下載名為 llms.txt 的檔案,接著開啟儲存的檔案並以內容視角再次檢視。確認標題與摘要與網站相符、每個連結都是權威版本、註解內容屬實、Optional 段落中的資源確實屬於次要,且未出現任何私密或測試環境的網址。
  5. 將最終編輯過的草稿貼入驗證模式,以檢查必要的 H1、標題順序、連結清單語法、重複的目標項目,以及是否有大小上限。請將驗證工具視為一份用於文件詮釋的 linter,而非判斷更廣泛廠商支援的權威來源。
  6. 將通過驗證的檔案發布到預定路徑,通常為 /llms.txt,並使用純文字或 Markdown 相容的內容類型來提供服務。
  7. 定期確認每個連結的頁面仍能回傳預期的內容,並在每次編輯後重新驗證檔案。在建立任何依賴精確語法的自動化流程之前,請再次確認提案的原始來源頁面。

驗證工具在草稿中會檢查哪些項目

驗證是與產生功能分開的模式。貼上現有的 llms.txt 草稿,即可檢查本工具對該提案所套用的結構詮釋。驗證功能會回報具體的逐行問題與警告,而不是靜默地重寫檔案。具體而言,它會檢查必要 H1 是否存在、標題順序是否正確、Markdown 連結清單語法是否有效、是否有經過標準化的重複網址,以及總大小是否符合上限。

網址會在序列化之前先行檢查。產生器接受 HTTP 與 HTTPS 連結,並拒絕帶有身分驗證資訊或屬於可執行/嵌入資料類型的網址配置。標籤、註解、標題與摘要會經過標準化處理,以避免控制字元或意外的 Markdown 分隔符破壞產生的結構。重複的網址會被回報,而非靜默地增加項目,這使策展地圖保持誠實。驗證工具絕不會存取任何列出的網址,也從不聲明連結的資源內容正確無誤——驗證目的地的責任屬於策展者,而 llms-txt 參考儲存庫(由 Answer.AI 維護)中收錄的權威範例,對於檢查自己的草檔是相當實用的參考依據。

驗證通過僅代表草稿符合本工具對現行提案的文件詮釋,並不代表更廣泛的廠商支援,因為相關生態系仍在演進中。請將它視為一套可靠的本地端 linter,並在每次調整工作流程或升級工具時重新驗證。

發布位置與維護方式

慣例上的位置是網站根目錄下的 /llms.txt,並使用純文字或 Markdown 相容的內容類型來提供服務。如果檔案範圍僅限於特定文件區段,使用子路徑也可接受,但根路徑是多數消費者預設的查找位置。發布之後,應將這份檔案視為持續維護的內容,而不是一次性部署的產物。

維護工作單純且屬於編輯層面。每個連結的網址都必須持續回傳預期的內容;一旦參考連結出現 404 或回傳錯誤的頁面,都會在不知不覺中削弱檔案的價值。Optional 段落應保持為次要資料中經過刻意挑選的子集合,而不是未進入主要清單的所有項目的集中地。每次編輯後請重新驗證檔案,以確保標題順序、連結語法與重複項目的處理維持正確。

有兩項限制值得明說。第一,發布 llms.txt 並不會強迫爬蟲或助理程式去請求它。第二,提案與生態系本身可能持續演進,而產生器所參考的方法論文件才是唯一權威的真相來源。在建立任何依賴精確語法的自動化流程之前,請再次確認這些資料;並在升級工作流程時重新驗證。

llms.txt 與其他網站檔案的比較

llms.txt 與數種常見的網頁控管機制僅有名字上的相似之處,實際角色明顯不同。一個運作良好的網站可以同時使用這些機制,彼此並不衝突。下表整理了每種檔案類型的文件規範範圍,協助你在標準的 SEO 架構中正確定位 llms.txt。

檔案或訊號 文件規範目的 讀取者 省略或缺少時的效果
llms.txt 依據 llmstxt.org 提案,提供策展式的 Markdown 概覽,內含選擇性摘要與 H2 連結段落。 自願加入的 AI 助理與工具。 沒有強制效果。模型與助理並非必須抓取或使用它。
robots.txt 依據 RFC 9309 及各家廠商擴充,表達參與式爬蟲的抓取偏好。 選擇遵守規範的網頁爬蟲。 爬蟲可能會對任何未受限制的路徑進行索引;所聲明的偏好並不具強制力。
sitemap.xml 提供可索引網址的清單,用於搜尋探索與新訊號。 搜尋引擎與 sitemap 通訊協定消費者。 可探索性仍可透過連結運作;只是缺少明確的網址清單。
結構化資料(JSON-LD、Microdata) 描述實體、屬性與頁面內容,以支援複合式結果與實體圖譜。 搜尋引擎與 schema.org 詞彙消費者。 複合式結果的曝光機會降低;實體理解僅能以隱含方式進行。

策展勝過長度

在 llms.txt 檔案中,最重要的設計決定其實是該排除哪些內容。一個列出所有頁面的檔案,只是重蹈大型 sitemap 的過載,並浪費消費者的脈絡長度。提案的意圖正好相反:提供一份精簡且帶有觀點的地圖,將模型指向少數應優先閱讀的頁面。優先納入權威版本的文件、產品說明、政策內容與穩定的參考頁面。如果你的網站能可靠地提供頁面的 Markdown 版本,請優先連結這些版本;若無法提供,請勿自行捏造會回傳錯誤的 .md 網址,因為失效的參考連結會削弱檔案的價值。

llms.txt 產生器絕不會掃描整個網域或 sitemap,這是有意為之的界線。純粹在用戶端運作的表單無法證明哪些動態頁面是權威版本、最新的、可存取的,或適合推薦的。作者仍須自行負責挑選來源,並確認每個公開的網址都能回傳預期的內容。下載完成後,請以模型視角再讀一次檔案:標題是否與網站相符、註解是否仍正確描述所連結的頁面、Optional 段落中的項目是否真的屬於可省略?如果答案皆為肯定,這份檔案便已發揮功能——此時也正是停止過度衡量它的最佳時機。

延伸閱讀:WordPress 最佳 robots.txt 檔案:安全設定指南

延伸閱讀:採用嚴格驗證的 Ads.txt 產生器替代方案