解説 · 読了 9 分

AI クローラーと Googlebot は何が違うのか

描画、タイミング、キャッシュ、robots.txt。Googlebot で覚えた 20 年分の常識が通じない 4 か所。

サイト運営者がクローラーについて知っていることの大半は Googlebot から学んだものです。ページを描画し、自分の予定で戻ってきて、索引を保ち、robots.txt を文書化された規則で読む。AI クローラーと共通しているのは「クローラー」という名前だけで、中身はほとんど別物です。

この記事では、各社が文書化している内容をもとに、Googlebot とサイトを読む 3 種類の AI エージェントを比べます。JavaScript の扱い、いつページを読むか、何を保持するか、robots.txt をどう読むか、そしてそれがコンテンツの配信に何を意味するかです。

30 秒で分かる結論:AI クローラーと Googlebot の違いは 1 つの比較ではなく 3 つの比較で、どの軸でも AI 側のほうが単純

Googlebot は 1 つの索引を作る 1 つのクローラーで、最新版の Chromium で JavaScript をキューに入った第 2 段階で描画し、自分でクロール頻度を決め、公開された規則で robots.txt を読みます。AI 側は役割の異なる 3 つの仕事で、それぞれ複数の会社が動かしています。文章を集める学習用クローラー、回答エンジンに供給する検索索引用クローラー、誰かが尋ねたから 1 ページを読みに来るユーザー起点の取得エージェントです。

JavaScript の描画を文書化している会社は 1 つもないので、配信された HTML をそのまま読むと考えてください。ユーザー起点の取得エージェントには予定も索引もなく、回答時にページを読みます。そのうち 2 社は、人が開始したリクエストなので robots.txt が適用されない場合があると述べています。配信について考えることは、この 2 つの事実から導けます。

1 つのクローラーではなく 3 つの仕事

各社の文書はエージェントを目的で分けていて、会社の違いよりその区別のほうが重要です。

  • 学習用クローラー(GPTBot、ClaudeBot)はモデルに入る可能性のある内容を集めます。OpenAI は GPTBot を拒否することはサイトの内容を学習に使うべきでないという意思表示だと述べ、Anthropic は ClaudeBot を学習に寄与しうるウェブの内容を集めるものと説明しています。
  • 検索索引用クローラー(OAI-SearchBot、Claude-SearchBot、PerplexityBot)は回答エンジンが引用元にする索引を作ります。OpenAI は ChatGPT の検索に出るには OAI-SearchBot を許可する必要があると述べ、Perplexity は PerplexityBot を基盤モデル向けの内容収集には使わないと述べています。
  • ユーザー起点の取得エージェント(ChatGPT-User、Claude-User、Perplexity-User)は人がそのページについて尋ねたときに読みに来ます。OpenAI は ChatGPT-User を自動的なウェブクロールには使わないと明記しています。

Google には AI による概要を含む検索全体のためのクローラーが 1 つと、制御用トークンの Google-Extended があります。後者は固有のユーザーエージェントを持たず、Google によれば検索への掲載にもランキングにも影響しません。各社のエージェントの全一覧はクローラー一覧の記事にあります。

比較表

GooglebotAI 学習用クローラーAI 検索用クローラーAI ユーザー起点の取得
供給先検索の索引。AI による概要と AI モードを含む学習用コーパス回答エンジンの索引その 1 回の回答
JavaScript最新版の Chromium で描画。クロール後にキュー文書なし。HTML のみと想定文書なし。HTML のみと想定文書なし。HTML のみと想定
ページを読む時点自分の予定で、質問の前に定期的に、質問の前に定期的に、質問の前に回答時に、ユーザーが尋ねたから
写しを保持する(索引)する(学習データ)する(索引)予定も索引も文書化されていない
クロール頻度Google のアルゴリズムが決定。429/500/503 でホスト全体が減速各社が制御。Anthropic は Crawl-delay を尊重各社が制御質問 1 回につき 1 リクエスト
robots.txt文書化された規則:最も具体的なグループ、最長パス、同点なら制限の緩い方尊重(各社の表明)尊重。引用されるには許可が必要適用されない場合あり(OpenAI)、一般に無視(Perplexity)、尊重(Anthropic)
遮断して失うもの検索での表示目に見えるものはないそのエンジンでの引用いま目の前のユーザーが得る回答

JavaScript:描画するのは 1 社だけで、ほかは沈黙

Google は JavaScript をクロール、描画、インデックスの 3 段階で処理し、検索は最新版の Chromium で JavaScript を実行すると述べています。描画はキューで行われ、ページは数秒で済むこともあればもっと長くかかることもあるとしています。クライアント側で描画するページが、遅れてではあれ全文で索引に入るのはこのためです。

OpenAI、Anthropic、Perplexity のボットのページは描画にまったく触れていません。サーバーログに見えるのは HTML への HTTP リクエスト 1 つだけで、ブラウザなら続いて読み込むスクリプトや JSON への追加リクエストはありません。安全な想定は、すべての AI エージェントは配信された HTML のレスポンスを読んでそこで止まる、です。スクリプト実行後にしか存在しない内容、クリックの先にある内容、読み込み後にページが取りに行く内容は、彼らにとって存在しません。

実務上の帰結は SEO で最も古い助言で、理由だけが鋭くなりました。重要な内容はサーバー側で描画する。料金表、商品説明、ドキュメントのページは最初の HTML に入れる。それが難しい場合は llms.txt の仕様が示す方法が使えます。同じ URL に .md を付けたクリーンな Markdown 版を用意し、llms.txt からそこを指すのです。

タイミングと頻度:予定と質問の違い

Googlebot は自分でレートを決めます。Google は、基盤がアルゴリズムでサイトに最適なクロール頻度を決めること、429、500、503 がかなりの数返るとホスト全体のクロール頻度を下げること、エラーが減れば自動で戻すことを述べています。同じ URL がそれらのコードを何日も返すと索引から落ちることがあるとも警告しています。索引が製品で、クロールはそれを最新に保つ手段です。

AI 各社の学習用・検索用クローラーも質問の前に動きますが、頻度を公表している会社はありません。文書化されているのは制御の変更が反映されるまでの時間です。Google は robots.txt を最長 24 時間キャッシュし、Perplexity は変更の反映に最長 24 時間かかるとし、Amazon は Amazonbot が robots.txt を最長 30 日キャッシュしうるとしています。robots.txt の変更は、誰に対しても即時ではありません。

ユーザー起点の取得エージェントに予定はありません。ChatGPT-User、Claude-User、Perplexity-User は、人があなたのページを必要とする質問をしたときに来て、読んで、答えます。背後に索引があるとは文書化されておらず、だから今朝変えたページが今日の午後には正しく引用され、読めないページは回答から単に消えます。llms.txt の仕様もこのファイルについて同じ読み方、つまりエージェントが必要としたときに必要に応じて使う情報、と説明しています。

robots.txt:文書化された規則と各社の表明

Google はファイルの読み方を文書化しています。1 つのクローラーに適用されるグループは 1 つだけで、ユーザーエージェントの一致が最も具体的なものです。グループ内ではパスの長さで最も具体的な規則が勝ち、同じ具体性の allow と disallow が衝突したら制限の緩い方を使います。429 以外の 4xx は robots.txt が存在しないものとして扱い、5xx は最初の 12 時間クロールを止めて再取得を試みます。Google は Crawl-delay をサポートしていません。

AI 各社が述べているのは解析規則ではなく意図です。OpenAI と Anthropic はクローラーが robots.txt を尊重すると述べ、Anthropic は非標準の Crawl-delay 拡張も尊重すると加えています。Perplexity は許可を求めています。ユーザー起点の取得エージェントでは表明が分かれます。OpenAI はユーザーが開始した操作なので ChatGPT-User には robots.txt の規則が適用されない場合があると述べ、Perplexity は同じ理由で Perplexity-User は一般に robots.txt を無視すると述べ、Anthropic は Claude-User は尊重すると述べています。Google-Extended と Applebot-Extended の 2 つのトークンはそもそもクローラーではなく、通常のクローラーがすでに取得したものの用途を制御します。

書くファイルへの帰結は 2 つです。グループは明示的に名指しすること。一致するものがないとき AI クローラーが拠り所にするのはワイルドカードのグループで、Google は最も具体的なグループを選んで残りを無視するからです。

User-agent: *
Allow: /

User-agent: GPTBot
User-agent: ClaudeBot
Disallow: /

User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /

そして、ユーザー起点の取得エージェントに対して robots.txt は鍵ではないと受け入れること。アシスタントがユーザーの代わりに読んではいけないページがあるなら、確実な制御はサーバー側だけです。認証か、ファイアウォールの規則か。その代償として、そのユーザーはあなたのサイトからの回答を得られません。

サイトの配信にとって何を意味するか

  1. 内容を HTML に入れる。Googlebot はいずれスクリプトを描画しますが、ほかにそうすると文書化しているものはありません。サーバー側描画、静的生成、ページの Markdown 版のどれかで、すべての読み手を一度にカバーできます。
  2. 会社単位ではなく役割単位で決める。学習用クローラーの遮断で目に見えて失うものはありません。検索用クローラーの遮断はそのエンジンでの引用を失います。ユーザー起点の取得エージェントの遮断は目の前の 1 人の回答を失い、しかも効かないかもしれません。
  3. ユーザーエージェント文字列でレート制限しない。Googlebot や GPTBot は誰でも名乗れます。公開された IP 範囲か逆引き DNS で確認し、アドレスと振る舞いで制限します。
  4. robots の変更は遅れて効くと想定する。Google と Perplexity は自社の表明で最長 1 日、Amazonbot は最長 1 か月。変更してから、判断するまで待ちます。
  5. 必要時に読む側に索引を渡す。ユーザー起点の取得エージェントが使えるのはリクエスト 1 回と数千トークンです。ルートに置いた llms.txt が、どの質問ならどのページを読めばよいかを伝えます。書き方の記事なら 30 分ほどで済みます。

誰が届くかを確かめる

上のユーザーエージェント文字列そのままで、自分のネットワークの外から robots.txt と主要ページを取得し、返ってきたものをブラウザの表示と比べます。診断ツールは主要なエージェントについて同じことを一度に行います。

どのボットがサイトに入れるかを確認する

URL を入れて診断を実行すると、robots.txt を取得して主要な AI User-Agent がどこまで読めるかを報告し、あわせて llms.txt の下書きを作ります。

診断を実行する →

よくある質問

AI クローラーは Googlebot のように JavaScript を描画しますか?

Google は、検索が最新版の Chromium で JavaScript を実行し、クロールの後にキューに入る描画段階があると文書化しています。OpenAI、Anthropic、Perplexity のボットの文書は描画について何も述べておらず、サーバーログに見える取得は HTML への素の HTTP リクエストです。AI のクローラーと取得エージェントは HTML のレスポンスだけを読むものとして扱い、スクリプト実行後に現れる内容は見えていない前提にしてください。

AI クローラーは 1 種類のものですか?

違います。各社は役割の異なるエージェントを最大 3 つ動かしています。学習用クローラー(GPTBot、ClaudeBot)、検索索引用クローラー(OAI-SearchBot、Claude-SearchBot、PerplexityBot)、ユーザー起点の取得エージェント(ChatGPT-User、Claude-User、Perplexity-User)です。タイミング、robots.txt の扱い、遮断したときに失うものがそれぞれ違います。Googlebot は 1 つの索引を作る 1 つのクローラーなので、比較は役割ごとにしか成り立ちません。

AI のボットは robots.txt を守りますか?

学習用と検索用のクローラーは守ると表明しています。例外はユーザー起点の取得エージェントです。OpenAI はユーザーが開始したリクエストなので ChatGPT-User には robots.txt の規則が適用されない場合があると述べ、Perplexity も同じ理由で Perplexity-User は一般に robots.txt を無視すると述べています。Anthropic は自社のボットが robots.txt を尊重すると表明しています。Google-Extended はクローラーではなく制御用のトークンで、検索には影響しません。

どのくらいの頻度で来ますか?

Googlebot はサーバーの反応を見るアルゴリズムで自分のレートを決めます。429、500、503 が多く返るとホスト全体のクロール頻度を下げ、収まれば戻します。AI クローラーの各社の文書は頻度を公表していません。ユーザー起点の取得エージェントにはそもそも予定がなく、誰かが質問したときに来て、ページを 1 回読みます。llms.txt の仕様も同じ「必要に応じて」の読み方を説明しています。

Crawl-delay は効きますか?

Google には効きません。Google はこの規則をサポートしていません。Anthropic は非標準の Crawl-delay 拡張をサポートし、適切な場面で尊重すると文書化しています。それ以外の各社については非対応とみなし、ボットが何を守ると主張していても機能するサーバー側のレート制限を使ってください。

本物の Googlebot や GPTBot と偽物はどう見分けますか?

ユーザーエージェント文字列ではなくネットワークで確かめます。Google はクローラーの IP 範囲を公開し、逆引き DNS による確認にも対応しています。OpenAI も自社ボットの IP 範囲を公開しています。公開範囲の外から来た GPTBot を名乗るリクエストは GPTBot ではありません。このサイトのクローラー一覧の記事に確認手順があります。

次に読む