じっくり読む · 8 分

llms.txt vs robots.txt vs sitemap.xml

それぞれのファイルが何をするのか、そして3つすべてが必要な理由。

ドメインのルートに置く小さなテキストファイルが3つあります。 2つは20年以上前からあります。3つ目は2024年に公開され、 2026年に入って普及し始めました。3つのファイルは、クローラーとAIシステムに それぞれまったく違うことを伝えます。それでも、この3つはよく混同されます。 この記事では3つの違いを整理します。

30秒でわかる答え

robots.txt はクローラーに クロールしてはいけない場所を伝えます。 sitemap.xml はクローラーに 存在するURLの一覧を伝えます。llms.txt はAIシステムに、サイトが実際に何を扱っているかを AIが読みやすい形式で伝えます。

この3つは重複していません。役割が違い、読む相手も違います。 現代のサイトでは、3つすべてを公開する価値があります。

robots.txtsitemap.xmlllms.txt
役割クロール許可の設定全URLの一覧AIへのサイト要約
読む相手すべてのクローラー検索エンジンAIシステム
形式プレーンテキストXMLMarkdown
公開年1994年(慣習)、2022年(RFC)2005年2024年
性質命令的:“禁止”網羅的:“URLはこちら”編集的:“重要なのはここ”
典型的なサイズ< 1 KB10 KB 〜 50 MB1〜20 KB
必須?いいえ(推奨)いいえ(推奨)いいえ(標準化が進行中)

1. robots.txt:門番

目的:クローラーに、取得を許可しないパスを伝えます。

場所:常に https://yoursite.com/robots.txt です。サブドメインには、 それぞれ専用の robots.txt が必要です。 サブディレクトリに置いても、クローラーは参照しません。

形式:プレーンテキストで、1行に1つのルールを書きます。Robots Exclusion Protocol が形式を定義しており、 このプロトコルは2022年9月にRFC 9309として標準化されました。

誰が読むか:Googlebot、Bingbot、GPTBot、ClaudeBot、 PerplexityBotなど、行儀の良いクローラーが読みます。悪意あるスクレイパーは 無視しますが、それは想定済みです。 robots.txt はお願いであり、強制力はありません。

User-agent: *
Disallow: /admin
Disallow: /cart

User-agent: GPTBot
Allow: /

Sitemap: https://yoursite.com/sitemap.xml

よくある間違い:デフォルト拒否のルールで GPTBot、ClaudeBot、 PerplexityBot までブロックしてしまうことです。 ブロックされたクローラーは llms.txt も取得できないので、llms.txt を置いた意味がなくなります。 当サイトのチェッカー はこの問題を自動的に検出します。

2. sitemap.xml:索引カード

目的:クローラーにサイト内のURLの存在を伝えます。 最終更新日、更新頻度、優先度のメタデータも付けられます。

場所:慣習では /sitemap.xml に置きます。ただし、検索エンジンに場所を正式に 伝える手段は、Google Search Consoleへの登録か、robots.txt 内の Sitemap: ディレクティブです。大規模サイトはサイトマップを 複数に分割し、サイトマップインデックスでまとめます。

形式:XMLです。sitemaps.org がスキーマを定義しています(最終改訂は2008年で、現在も有効です)。

誰が読むか:Google、Bing、Yandexなど、サイトの全URLの一覧を 必要とする検索エンジンが読みます。今のところ、AIアシスタントは直接読みません。

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://yoursite.com/</loc>
    <lastmod>2026-05-01</lastmod>
    <priority>1.0</priority>
  </url>
  <url>
    <loc>https://yoursite.com/pricing</loc>
    <lastmod>2026-04-15</lastmod>
  </url>
</urlset>

よくある間違い:サイトマップを送ればGoogleが必ずインデックスする、 と思い込むことです。実際には、サイトマップはURLの存在と鮮度を伝える ヒントにすぎません。ランキングやインデックスの判断は検索エンジンが行います。

3. llms.txt:AIへの目次

目的:内容を厳選してMarkdownでまとめたサイトの要約を、 AIシステムに渡します。AIシステムは、HTML全体、ナビゲーション、スクリプト、 Cookieバナーを解析しなくても、サイトについての質問に答えられます。

場所:常に https://yoursite.com/llms.txt です。大規模サイトは、 主要記事の本文をMarkdownで連結した llms-full.txt も 公開することがあります。

形式:構造の決まったMarkdownです。H1のサイト名、 blockquoteの概要、## のセクション、- [名前](URL): 説明 形式のリンク一覧で構成します。 仕様はAnswer.AIのJeremy Howardが2024年9月に公開しました。

誰が読むか:AIエージェントやクローラーが、サイトの内容に 基づいて回答を作るときに読みます。Anthropic、Stripe、Cloudflare、Vercel、 Mintlifyをはじめ、主要なSaaSサイトが導入を進めています。 上位1,000サイトの導入率は、2025年6月の0.3%から2026年9月には約9%に増えました(Rankability調べ)。

# Acme Corp

> Open-source database for full-text search across structured documents.

## Docs
- [Quickstart](https://acme.example/docs/quickstart): Get a cluster running in 5 minutes.
- [API reference](https://acme.example/docs/api): Full HTTP API.

## Optional
- [Architecture](https://acme.example/blog/architecture): How the index is sharded.

よくある間違い:/.well-known/llms.txt やサブディレクトリだけに置いてしまうことです。仕様は /docs/llms.txt のようなサブパスのファイルも認めていますが、 基本の置き場所はルートの /llms.txt です。まずルートに置いてください。

3つがどう連携するか

3つの役割は、思っているほど重複していません。

  • robots.txt はアクセス権の境界、つまり そもそも取得してよいかどうかを決めます
  • sitemap.xml は全体の範囲、つまり 検索エンジンに知らせたいすべてのURLを示します
  • llms.txt は重要な部分だけを選び、 AIに「ここが大事」と案内します

典型的な小規模サイトでは、サイトマップには50〜500件のURLが載りますが、llms.txt に載せるのは5〜25件です。この少なさが狙いです。llms.txt は全ページを網羅するものではなく、 載せるページを選んで編集するものです。

1つ欠けているとどうなる?

robots.txt がない場合

クローラーは、すべてのパスにアクセスしてよいとみなします。 管理画面、ステージング環境、検索結果ページのような隠したいパスがなければ、 通常は問題ありません。ただし Sitemap: ディレクティブがないと、 検索エンジンはリンクをたどってURLを発見するしかなく、発見が遅くなります。

sitemap.xml がない場合

検索エンジンはリンクをたどってURLを発見します。内部リンクが充実した サイトなら、これで問題ありません。ただし、階層の深いコンテンツや ページネーションの多いコンテンツ(大型カタログやアーカイブ)は、 サイトマップがないとインデックスが遅くなります。

llms.txt がない場合

AIアシスタントは、ナビゲーション、スクリプト、Cookieバナーを含むHTML全体を 解析し、ノイズの中からサイトを要約しようとします。 うまくいくこともありますが、結果は運任せになります。 整った llms.txt を公開しているサイトでは、AIシステムが 引用するときのトークン使用量が最大10分の1になると、Mintlifyが報告しています。 トークン使用量が減れば、引用されやすくなる可能性があります。

設置チェックリスト

  1. sitemap.xml を公開する。WordPress、Webflow、Shopifyなど、多くのCMSが自動で生成します。/sitemap.xml にアクセスできるか確認してください。
  2. robots.txt を公開する。最小限の内容(User-agent: * / Allow: / / Sitemap: https://yoursite.com/sitemap.xml)でも、 ないよりは良いです。AIクローラーを誤ってブロックしていないか確認してください。
  3. llms.txt を生成する。URLを当サイトのジェネレーターに貼り付ける と、ジェネレーターがドラフトを作ります。ドラフトを編集して アップロードしてください。
  4. 検証する。公開する前にファイルを バリデーター にかけて、仕様に準拠しているか確認してください。

よくある質問

llms.txt は robots.txt や sitemap.xml の代わりになりますか?

なりません。3つは読む相手も目的も違います。検索エンジンは引き続きサイトマップを使い、クローラーは robots.txt に従います。llms.txt はこの2つに追加する、AI向けの新しい層です。

AIシステムは今すでに llms.txt を読んでいますか?

ChatGPT(ブラウジング機能)、Claude、Perplexity、Cursorはいずれも、回答の根拠にするサイトを取得するときに llms.txt を読むことが確認されています。2026年時点ですべてのAIが対応しているわけではありませんが、主要なサービスは対応しており、対応するサービスは増え続けています。

robots.txt でAIクローラーをブロックしても llms.txt は意味がありますか?

ありません。robots.txt と llms.txt は組み合わせて使うものです。robots.txt で GPTBot や ClaudeBot をブロックすると、それらのクローラーは llms.txt も取得できなくなります。AIにサイトを知ってもらいたいなら、AIクローラーのアクセスを許可してください。

llms.txt にはすべてのページを載せるべきですか?

いいえ。llms.txt はサイトマップではなく、厳選した目次です。ドキュメント、料金ページ、主要プロダクトページ、基礎記事など、最も重要なコンテンツ5〜25件に絞ってください。それ以外のページはサイトマップか llms-full.txt に任せてください。

llms-full.txt とは何ですか?

任意で公開するファイルで、最も重要なページの全文をMarkdownで連結したものです。StripeやAnthropicのような大規模ドキュメントサイトは、llms.txt と llms-full.txt の両方を公開しています。ほとんどのサイトは llms.txt だけで十分です。

llms.txt はGoogleの検索順位に影響しますか?

直接の影響はありません。GoogleはURLの発見に sitemap.xml を使っており、llms.txt は使っていません。llms.txt が影響するのは、ChatGPT、Claude、PerplexityなどのAI検索での見つかりやすさです。AI検索は、従来の検索とは別のチャネルになりつつあります。

次のステップ