30秒でわかる答え
robots.txt はクローラーに クロールしてはいけない場所を伝えます。 sitemap.xml はクローラーに 存在するURLの一覧を伝えます。llms.txt はAIシステムに、サイトが実際に何を扱っているかを AIが読みやすい形式で伝えます。
この3つは重複していません。役割が違い、読む相手も違います。 現代のサイトでは、3つすべてを公開する価値があります。
| robots.txt | sitemap.xml | llms.txt | |
|---|---|---|---|
| 役割 | クロール許可の設定 | 全URLの一覧 | AIへのサイト要約 |
| 読む相手 | すべてのクローラー | 検索エンジン | AIシステム |
| 形式 | プレーンテキスト | XML | Markdown |
| 公開年 | 1994年(慣習)、2022年(RFC) | 2005年 | 2024年 |
| 性質 | 命令的:“禁止” | 網羅的:“URLはこちら” | 編集的:“重要なのはここ” |
| 典型的なサイズ | < 1 KB | 10 KB 〜 50 MB | 1〜20 KB |
| 必須? | いいえ(推奨) | いいえ(推奨) | いいえ(標準化が進行中) |
1. robots.txt:門番
目的:クローラーに、取得を許可しないパスを伝えます。
場所:常に https://yoursite.com/robots.txt です。サブドメインには、 それぞれ専用の robots.txt が必要です。 サブディレクトリに置いても、クローラーは参照しません。
形式:プレーンテキストで、1行に1つのルールを書きます。Robots Exclusion Protocol が形式を定義しており、 このプロトコルは2022年9月にRFC 9309として標準化されました。
誰が読むか:Googlebot、Bingbot、GPTBot、ClaudeBot、 PerplexityBotなど、行儀の良いクローラーが読みます。悪意あるスクレイパーは 無視しますが、それは想定済みです。 robots.txt はお願いであり、強制力はありません。
User-agent: * Disallow: /admin Disallow: /cart User-agent: GPTBot Allow: / Sitemap: https://yoursite.com/sitemap.xml
よくある間違い:デフォルト拒否のルールで GPTBot、ClaudeBot、 PerplexityBot までブロックしてしまうことです。 ブロックされたクローラーは llms.txt も取得できないので、llms.txt を置いた意味がなくなります。 当サイトのチェッカー はこの問題を自動的に検出します。
2. sitemap.xml:索引カード
目的:クローラーにサイト内のURLの存在を伝えます。 最終更新日、更新頻度、優先度のメタデータも付けられます。
場所:慣習では /sitemap.xml に置きます。ただし、検索エンジンに場所を正式に 伝える手段は、Google Search Consoleへの登録か、robots.txt 内の Sitemap: ディレクティブです。大規模サイトはサイトマップを 複数に分割し、サイトマップインデックスでまとめます。
形式:XMLです。sitemaps.org がスキーマを定義しています(最終改訂は2008年で、現在も有効です)。
誰が読むか:Google、Bing、Yandexなど、サイトの全URLの一覧を 必要とする検索エンジンが読みます。今のところ、AIアシスタントは直接読みません。
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://yoursite.com/</loc>
<lastmod>2026-05-01</lastmod>
<priority>1.0</priority>
</url>
<url>
<loc>https://yoursite.com/pricing</loc>
<lastmod>2026-04-15</lastmod>
</url>
</urlset>よくある間違い:サイトマップを送ればGoogleが必ずインデックスする、 と思い込むことです。実際には、サイトマップはURLの存在と鮮度を伝える ヒントにすぎません。ランキングやインデックスの判断は検索エンジンが行います。
3. llms.txt:AIへの目次
目的:内容を厳選してMarkdownでまとめたサイトの要約を、 AIシステムに渡します。AIシステムは、HTML全体、ナビゲーション、スクリプト、 Cookieバナーを解析しなくても、サイトについての質問に答えられます。
場所:常に https://yoursite.com/llms.txt です。大規模サイトは、 主要記事の本文をMarkdownで連結した llms-full.txt も 公開することがあります。
形式:構造の決まったMarkdownです。H1のサイト名、 blockquoteの概要、## のセクション、- [名前](URL): 説明 形式のリンク一覧で構成します。 仕様はAnswer.AIのJeremy Howardが2024年9月に公開しました。
誰が読むか:AIエージェントやクローラーが、サイトの内容に 基づいて回答を作るときに読みます。Anthropic、Stripe、Cloudflare、Vercel、 Mintlifyをはじめ、主要なSaaSサイトが導入を進めています。 上位1,000サイトの導入率は、2025年6月の0.3%から2026年9月には約9%に増えました(Rankability調べ)。
# Acme Corp > Open-source database for full-text search across structured documents. ## Docs - [Quickstart](https://acme.example/docs/quickstart): Get a cluster running in 5 minutes. - [API reference](https://acme.example/docs/api): Full HTTP API. ## Optional - [Architecture](https://acme.example/blog/architecture): How the index is sharded.
よくある間違い:/.well-known/llms.txt やサブディレクトリだけに置いてしまうことです。仕様は /docs/llms.txt のようなサブパスのファイルも認めていますが、 基本の置き場所はルートの /llms.txt です。まずルートに置いてください。
3つがどう連携するか
3つの役割は、思っているほど重複していません。
robots.txtはアクセス権の境界、つまり そもそも取得してよいかどうかを決めますsitemap.xmlは全体の範囲、つまり 検索エンジンに知らせたいすべてのURLを示しますllms.txtは重要な部分だけを選び、 AIに「ここが大事」と案内します
典型的な小規模サイトでは、サイトマップには50〜500件のURLが載りますが、llms.txt に載せるのは5〜25件です。この少なさが狙いです。llms.txt は全ページを網羅するものではなく、 載せるページを選んで編集するものです。
1つ欠けているとどうなる?
robots.txt がない場合
クローラーは、すべてのパスにアクセスしてよいとみなします。 管理画面、ステージング環境、検索結果ページのような隠したいパスがなければ、 通常は問題ありません。ただし Sitemap: ディレクティブがないと、 検索エンジンはリンクをたどってURLを発見するしかなく、発見が遅くなります。
sitemap.xml がない場合
検索エンジンはリンクをたどってURLを発見します。内部リンクが充実した サイトなら、これで問題ありません。ただし、階層の深いコンテンツや ページネーションの多いコンテンツ(大型カタログやアーカイブ)は、 サイトマップがないとインデックスが遅くなります。
llms.txt がない場合
AIアシスタントは、ナビゲーション、スクリプト、Cookieバナーを含むHTML全体を 解析し、ノイズの中からサイトを要約しようとします。 うまくいくこともありますが、結果は運任せになります。 整った llms.txt を公開しているサイトでは、AIシステムが 引用するときのトークン使用量が最大10分の1になると、Mintlifyが報告しています。 トークン使用量が減れば、引用されやすくなる可能性があります。
設置チェックリスト
sitemap.xmlを公開する。WordPress、Webflow、Shopifyなど、多くのCMSが自動で生成します。/sitemap.xmlにアクセスできるか確認してください。robots.txtを公開する。最小限の内容(User-agent: */Allow: //Sitemap: https://yoursite.com/sitemap.xml)でも、 ないよりは良いです。AIクローラーを誤ってブロックしていないか確認してください。llms.txtを生成する。URLを当サイトのジェネレーターに貼り付ける と、ジェネレーターがドラフトを作ります。ドラフトを編集して アップロードしてください。- 検証する。公開する前にファイルを バリデーター にかけて、仕様に準拠しているか確認してください。
よくある質問
llms.txt は robots.txt や sitemap.xml の代わりになりますか?
なりません。3つは読む相手も目的も違います。検索エンジンは引き続きサイトマップを使い、クローラーは robots.txt に従います。llms.txt はこの2つに追加する、AI向けの新しい層です。
AIシステムは今すでに llms.txt を読んでいますか?
ChatGPT(ブラウジング機能)、Claude、Perplexity、Cursorはいずれも、回答の根拠にするサイトを取得するときに llms.txt を読むことが確認されています。2026年時点ですべてのAIが対応しているわけではありませんが、主要なサービスは対応しており、対応するサービスは増え続けています。
robots.txt でAIクローラーをブロックしても llms.txt は意味がありますか?
ありません。robots.txt と llms.txt は組み合わせて使うものです。robots.txt で GPTBot や ClaudeBot をブロックすると、それらのクローラーは llms.txt も取得できなくなります。AIにサイトを知ってもらいたいなら、AIクローラーのアクセスを許可してください。
llms.txt にはすべてのページを載せるべきですか?
いいえ。llms.txt はサイトマップではなく、厳選した目次です。ドキュメント、料金ページ、主要プロダクトページ、基礎記事など、最も重要なコンテンツ5〜25件に絞ってください。それ以外のページはサイトマップか llms-full.txt に任せてください。
llms-full.txt とは何ですか?
任意で公開するファイルで、最も重要なページの全文をMarkdownで連結したものです。StripeやAnthropicのような大規模ドキュメントサイトは、llms.txt と llms-full.txt の両方を公開しています。ほとんどのサイトは llms.txt だけで十分です。
llms.txt はGoogleの検索順位に影響しますか?
直接の影響はありません。GoogleはURLの発見に sitemap.xml を使っており、llms.txt は使っていません。llms.txt が影響するのは、ChatGPT、Claude、PerplexityなどのAI検索での見つかりやすさです。AI検索は、従来の検索とは別のチャネルになりつつあります。
次のステップ
- → AI クローラー一覧と robots.txt の書き方(文書化されている AI の User-Agent と、目的別のレシピ)
- → llms.txt 完全ガイド (サイト担当者向けのステップ・バイ・ステップ解説)
- → llms.txt と llms-full.txt の違い:どちらをいつ置くか
- → llms.txt と AI 検索の効果計測の仕方
- → AI 検索に拾われたかを確認する方法
- → llms.txt を生成する (URLを貼り付けるだけで30秒でドラフト完成)
- → 既存の llms.txt を検証する (仕様への準拠をチェック)
- → 解説記事の一覧へ戻る