llms.txt 檔案是置於網站根目錄的純文字 Markdown 文件,其中列出網站名稱、選擇性摘要,以及依章節標題分組的精選標準連結,讓語言模型與 AI 助手能取得可預測的實用公開頁面地圖。llmstxt.org 提出的格式要求必須恰有一個包含專案或網站名稱的 H1,接著可加入區塊引言摘要、自由形式的詳細資訊,以及零個或多個 H2 章節;各章節的清單項目都必須包含連結,也可在冒號後加入選擇性附註。llms.txt 檔案不是 robots 指令、網站地圖或安全控制措施;它不會強制爬蟲抓取檔案、不會封鎖或授予任何頁面的存取權限,也不保證 AI 回答會引用該網站。它是一項編輯性產物,其價值來自審慎策展,而非自動化爬取。
由於這項提案仍在演進,實際做法是自行撰寫檔案、使用遵循文件所述順序的工具產生草稿、加以驗證,然後發布,且不要過度承諾它會發揮的作用。本指南其餘內容會逐步說明結構、策展決策,以及將 Markdown 草稿轉為可維護 llms.txt 的驗證與發布步驟。

llms.txt 檔案實際上會做什麼
llms.txt 是一項提案,建議為網站建立一份精簡且經過策展的 Markdown 概覽,供語言模型在推論期間閱讀。可將它視為閱讀清單,而非指令集:當使用者提出網站可能回答的問題時,檔案會告訴 AI 網站中哪些頁面值得閱讀。每個項目都是一個連結,並可選擇加入簡短附註,說明連結頁面的內容。這項提案特別提出「Optional」章節,其中的連結用於識別模型只需較短脈絡時可以略過的次要資料。
此檔案不會取代您已使用的控制措施。robots.txt 表達參與式爬蟲的抓取偏好。sitemap.xml 檔案列出可建立索引的 URL,供搜尋探索。結構化資料描述實體與頁面內容。llms.txt 與這些機制並列,提供不同的訊號:為推論期間使用而挑選的一組高價值參考資料。每種機制都有各自用途,此檔案應補充其餘 SEO 設定,而不是取代它們。
llms.txt 檔案的必要結構
這項提案定義嚴格的自上而下順序,而此格式的價值有賴於該順序維持可預測性。依序而言,必要元素如下:
- 一行 H1,包含專案或網站名稱。這是唯一必要的元素。
- 選擇性的區塊引言摘要,直接置於 H1 下方,以一段文字描述網站。
- 選擇性的自由形式詳細資訊,以純 Markdown 段落或清單撰寫,說明讀者在進入連結章節前需要知道的任何事項。
- 零個或多個 H2 章節,每個章節包含 Markdown 清單項目,其必要核心是連結。也可在冒號後加入附註,說明連結頁面的內容。
- 一個名稱確實為「Optional」的 H2 章節,其中的連結用於識別模型需要較短脈絡時可以略過的次要資料。
H1 必須位於最前方;如有摘要,則接在後面;自由形式詳細資訊必須出現在任何 H2 之前;H2 章節則依您選擇的順序置於最後。AnswerDotAI llms-txt 參考儲存庫以實際案例展示此配置。由於剖析器與語言模型都預期採用此順序,含有兩個頂層標題、摘要位置錯誤,或附註中含有 Markdown 分隔符號的 llms.txt 檔案,可能會在不知不覺間破壞結構。
以下是幾項值得注意的慣例:
- 這項提案只允許一個 H1,因此重複的頂層標題是錯誤,而非風格選擇。
- 「Optional」章節具有明確含義;產生器不會自動將資源標示為選擇性,因為這是編輯決策。
- 含有憑證或可執行配置的 URL 並不安全,完全不應出現在檔案中。
如何建立您的 llms.txt 檔案
llms.txt 產生器會根據您填寫的表單欄位在本機建立草稿,然後讓您依文件所述的 Markdown 順序驗證最終編輯完成的檔案。它不會進行任何爬取,表單值也不會傳送至外部服務。
- 輸入網站名稱、選擇性摘要與詳細資訊。 網站名稱會成為必要的 H1。如有加入選擇性摘要,則會直接包裝在 H1 下方的 Markdown 區塊引言中。任何額外段落或簡短清單都應位於摘要與第一個 H2 連結章節之間。
- 只在清楚的章節標題下加入標準且高價值的連結。 將資源歸入 H2 章節,例如 Docs、Products、Pricing 或 Policies。將名稱確實為「Optional」的章節用於較短脈絡可以略過的次要資料。每個清單項目都必須包含連結,也允許在冒號後加入簡短附註。
- 產生具確定性的 Markdown 並加以檢視。 此工具會依穩定順序產生純文字:H1、摘要、詳細資訊,以及依您輸入順序排列的 H2 章節。複製或下載前,請閱讀 Optional 章節、所有附註與標籤,確認它們符合網站內容。
- 複製或下載檔案。 下載檔案的名稱為 llms.txt。由於文字具有確定性,重新輸入相同內容會產生相同輸出;當您需要可供檢視的產物,而非不透明的抓取結果時,這項功能很實用。
- 驗證最終編輯完成的檔案。 將編輯後的草稿貼入驗證器,以檢查必要的 H1、標題順序、連結清單語法、重複目標及大小上限。驗證器會報告以行為單位的問題與警告,但不會重寫檔案。
- 在預定路徑發布檔案。 在 /llms.txt 或適當的子路徑提供檔案,並使用純文字或與 Markdown 相容的內容類型。
- 定期驗證所參照的頁面。 重新確認每個標準 URL 仍可解析、內容符合其附註,且未混入私人或預覽 URL。請勿僅因已發布,就假設爬蟲已採用此檔案。
實用 llms.txt 應包含哪些內容(以及不應包含哪些內容)
策展比長度更重要。列出每個頁面的檔案會重演大型網站地圖造成資訊超載的問題,也浪費使用者的脈絡窗口。請優先採用標準文件、產品說明、政策與穩定的參考頁面。網站能可靠提供 Markdown 版本時,可連結至該版本,但不要自行建立會傳回錯誤的 .md URL。
適合加入的實用項目:
- 說明網站提供哪些內容的頂層產品或服務頁面。
- AI 助手回答事實問題時會參照的文件中心與穩定參考頁面。
- 經常出現在使用者問題中的定價、條款與政策頁面。
- 網站希望在內容相關時提高曝光度的權威部落格文章或研究文章。
通常不應包含的項目:
- 需要驗證才能存取的頁面,因為此檔案無法授予存取權限。
- 預覽或內部 URL,因為它們會洩漏預覽內容,也會導致外部讀者無法使用。
- 網站上的每篇部落格文章;請選出與主題相關且具標準地位的少數文章。
- 搜尋結果、篩選或分頁 URL,這些 URL 只會增加雜訊,不會增加有效訊號。
此產生器絕不會掃描網域或網站地圖。這是有意為之:純用戶端表單無法證明哪些動態頁面具標準地位、為最新版本、可供存取或適合推薦。作者仍須負責挑選來源並檢查每個公開 URL。
llms.txt 與網站上的其他探索檔案
llms.txt 是補充,而不是取代您可能已維護的探索檔案。下表根據 llms.txt 提案的文件範圍與相鄰各檔案的標準用途,摘要說明其個別角色:
| 機制 | 主要角色 | 格式 | 對象 | 對存取的影響 |
|---|---|---|---|---|
| llms.txt | 用於推論期間的精選 Markdown 概覽與高價值參考資料簡表 | 純文字 Markdown | 選擇閱讀它的語言模型與 AI 助手 | 無;不會封鎖或授予存取權限 |
| robots.txt | 參與式爬蟲的抓取偏好 | 純文字指令 | 遵循 Robots Exclusion Protocol 的網頁爬蟲 | 可針對遵循規範的機器人,禁止抓取列出的路徑 |
| sitemap.xml | 列出可建立索引的 URL,供搜尋探索 | XML | 使用網站地圖的搜尋引擎 | 無;提供 URL 的建議清單 |
| 結構化資料 (JSON-LD、Microdata) | 描述實體與頁面內容,以產生豐富結果 | 內嵌標記 | 讀取結構化資料的搜尋引擎與剖析器 | 無;描述既有內容 |
由於各角色的功能不重疊,實際建議是讓每個檔案各自執行其任務。如果您也需要收緊抓取規則,請搭配本指南參考實用 robots.txt 指南,而不是將抓取指令併入 llms.txt。
驗證、發布與維護檔案
從產生器下載檔案後,請將它視為內容來檢視,而非機械式 SEO 產物。確認標題與摘要符合網站、每個連結均具標準地位、附註描述實際頁面、標示為選擇性的資源確實屬於次要資料,且未出現私人 URL。草稿驗證成功,表示此檔案符合本工具對目前提案的文件解讀;這並不保證更廣泛的供應商支援。
發布時:
- 在 /llms.txt 或適當的子路徑提供檔案,並使用純文字或與 Markdown 相容的內容類型。
- 讓檔案維持精簡。驗證器會檢查大小上限,過長的檔案反而有違策展目的。
- 每次手動編輯檔案後重新執行驗證,因為貼上的修改可能引入重複 URL、錯誤的清單語法或位置不當的標題。
- 定期抓取每個連結 URL,確認它仍可解析,且仍與其附註相符。
這項提案及其生態系統可能持續演進,因此在建置依賴精確語法的自動化功能前,請重新檢查方法與來源連結。請將 llms.txt 視為需要維護的產物:每季檢視、移除失效連結,並在網站定位改變時更新摘要。
Setting Realistic Expectations
Because the format is an emerging proposal, it is worth being explicit about what publishing llms.txt does and does not do. It does not force any crawler or assistant to request the file. It cannot grant access to blocked pages, override authentication, remove content from model training, or prove that an AI answer will cite the site. The file can complement existing web controls, but it is not a substitute for them.
The honest way to measure value is to track whether your own tools and workflows use the file. If a documentation assistant, an internal research tool, or an in-house retrieval pipeline ingests /llms.txt, that is direct evidence the file is doing its job. Treat publication alone as evidence of nothing more than a published file. Crawler adoption and citation improvements, if they happen, will show up in your existing analytics and answer-tracking, not in the file itself.
For a deeper look, see How to Get a Robots.txt File: Retrieve or Generate One.