30 秒で分かる結論:Perplexity に引用されるには、索引に入り、文字として読め、最初の段落で質問に答えること
Perplexity は、ウェブを検索し、見つけたページを読み、それを引用して質問に答えます。仕事をするエージェントは 2 つです。PerplexityBot が候補ページの元になる検索索引を作り、Perplexity-User が質問に必要なとき回答時にページを取得します。つまり効くのは検索エンジンが報いるものと同じで、ひとつだけ違いがあります。ページを読むのは引用するモデルなので、最初の段落に答えと数字と日付が入っていなければなりません。
手順は効果の順に 5 つ。PerplexityBot と公開 IP 範囲を許可する。重要な各ページが 1 つの質問に HTML の文字で答えるようにする。書き手の名前と日付のある、審査する人が信頼しそうな情報源に見えるようにする。事実をどこでも一致させる。ログ、流入、毎月の監査で測る。
Perplexity がページを見つけて引用する仕組み
Perplexity のヘルプセンターは、質問ごとにインターネットを検索し、記事、ウェブサイト、学術誌などの信頼できる情報源から情報を集め、使った情報源を表示する、と製品を説明しています。順位づけの方法は公開していません。ボットの文書のほうが仕組みについて具体的です。
- PerplexityBot は Perplexity の検索結果にウェブサイトを表示しリンクするためのもので、基盤モデル向けの内容収集には使われません。検索結果に出るために、Perplexity は robots.txt での許可と公開 IP 範囲からのリクエストの許可を推奨しています。
- Perplexity-Userはユーザーの操作を支えます。人が質問したとき、正確な回答のためにページを訪れ、回答にそのページへのリンクを含めることがあります。ユーザーが取得を求めたものなので、一般に robots.txt を無視します。
- IP 範囲は perplexity.com/perplexitybot.json と perplexity-user.json に JSON で公開されていて、作成時刻と IPv4 プレフィックスの一覧という形です。robots.txt の変更の反映には最長 24 時間かかることがあります。
サイト運営者にとっての帰結はこうです。入るべき索引があり、配信されたままのページを読む回答時の取得がある。どちらも HTML への素の HTTP リクエストです。文書のどこにも JavaScript の描画、サイトマップ、robots.txt 以外のファイルへの言及はありません。
手順 1. PerplexityBot を通し、本物かを確かめる
ボットを名前で許可し、未知のエージェント向けのファイアウォール規則でそれを打ち消さないようにします。
User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: /
CDN や WAF がブラウザ以外のリクエストにチャレンジを返すなら、公開プレフィックスを許可リストに加えます。Perplexity は WAF の変更の反映には時間がかかることがあるとしてログの監視を勧めています。リクエストの確認も同じ方法で行います。JSON にない住所から来た PerplexityBot を名乗るアクセスは PerplexityBot ではありません。各社の確認手順はクローラー一覧の記事にあります。
手順 2. 重要な各ページを引用しやすくする
回答時の取得は配信されたままの HTML を読み、モデルはそこから文を持ち上げます。持ち上げられるページにする習慣は 3 つです。
- 1 ページ 1 つの質問に、まず答える。見出しに質問を置き、最初の段落に数字と日付を含む 2 文の答えを書きます。説明はその後です。
- 文字を HTML に入れる。画像の中の価格、タブの奥の内容、ページ到着後にスクリプトで読み込む部分は、素の取得には見えません。
- 引用する価値のあるものを置く。出典つきの数字、引用文、日付つきの参照。生成回答を扱った唯一の対照実験では、これらが可視性をおよそ 3 割上げ、キーワード密度は何も生みませんでした。
手順 3. 審査する人が信頼しそうな情報源に見える
Perplexity のヘルプセンターはソースラベルを説明しています。個々のページではなくウェブサイト全体の審査に基づいて、政府系、学術系、信頼できるのいずれかを示す盾のアイコンです。審査では、サイトが誤りを訂正しているか、各記事の書き手を明示しているか、ニュースと意見を分けているか、といった点を見るとされています。提携や支払いなどの取引関係はラベルに影響しないと記事は述べています。
引用されるのにラベルは要りません。引用されるページの多くにラベルはありません。ただしこの基準は、人であれモデルであれ読み手が信頼できると扱うものの無料のチェックリストです。各ページに書き手の名前、見える公開日と更新日、誰が運営しているかを書いた「このサイトについて」のページ、直したときの訂正の注記。半日で済み、このアシスタントに限らずどこでも効きます。
手順 4. 事実を一致させ、llms.txt の位置づけを知る
リアルタイムのエンジンは、あなたが公開した事実の写しをすべて見つけます。料金ページがある数字を言い、2024 年のブログ記事が別の数字を言っていれば、回答はどちらを引用するか分かりません。現在のページに日付を入れ、古い記事に日付つきの注記を足し、構造化データを見える文章と一致させます。掃除の手順は料金ページの記事にあります。
llms.txt については現実的に。このサイトの ChatGPT の記事で紹介した 83 サイト・12 週間のパネルでは、Perplexity のこのファイルの取得は 0 回でした。読むエージェントやツールのために書き、Perplexity 向けの面はページだと考えてください。
手順 5. 測る
- ログ。PerplexityBot と Perplexity-User のリクエストを週ごとに数え、IP の JSON で検証します。索引用クローラーは自分の予定で現れ、ユーザー起点の取得は誰かが聞いたときに現れます。
- 流入。アクセス解析に出る perplexity.ai からの訪問。クリックにつながった引用です。
- 毎月の監査。ログアウトした状態で Perplexity に最重要の質問 10 個を聞きます。情報源の一覧に入っているか、何番目か、どのページが引用されたかを記録します。4 つの確認の全手順と、最初の 1 か月の「普通」の姿は引用確認の記事にあります。
引用されないとき
| 症状 | ありそうな原因 | 対処 |
|---|---|---|
| ログに PerplexityBot がまったく出ない | robots.txt か WAF の規則が遮断している | 名前と IP 範囲で許可し、最長 24 時間待つ |
| ボットは来るが引用されない | 質問に直接答えるページがない、または答えがページの下のほうにある | 1 質問 1 ページにし、最初の段落で答える |
| 引用されるが数字が違う | 古い写しの事実が現在のページより上に出ている | 現在のページに日付を入れ、古い写しに注記かリダイレクト |
| 自社名の質問で競合が引用される | 題名や最初の段落にその名前がない | 製品名と会社名を題名と冒頭に入れる |
| ChatGPT では引用されるのに Perplexity では引用されない | 仕組みが違う。Perplexity は最近の構造のよいページを好む | 日付を入れ、ページを更新し、別々に追跡を続ける |
| Perplexity-User は来るのに引用されない | 内容が配信された HTML に入っていない | 文字をサーバー側で描画し、画像だけの事実をやめる |
最初の手順は、気づかないまま失敗しているものです。診断ツールはボットと同じ方法で robots.txt とページを取得し、PerplexityBot と主要なエージェントがどこまで読めるかを報告します。
どのボットがサイトに入れるかを確認する
URL を入れて診断を実行すると、robots.txt を取得して主要な AI User-Agent がどこまで読めるかを報告し、あわせて llms.txt の下書きを作ります。
診断を実行する →よくある質問
Perplexity はどのページを引用するか、どう決めていますか?
Perplexity のヘルプセンターは、質問ごとにインターネットを検索し、記事、ウェブサイト、学術誌などの信頼できる情報源から情報を集め、使った情報源を表示する、と説明しています。順位づけの方法は公開していません。文書化されているのは仕組みのほうです。PerplexityBot が候補ページの元になる検索索引を作り、Perplexity-User が質問に必要なとき回答時にページを取得します。索引にあり、文字として読め、質問に直接答えるページが引用されます。
robots.txt で PerplexityBot を許可する必要がありますか?
あります。Perplexity のボット文書は、検索結果に出るためには robots.txt で PerplexityBot を許可し、公開されている IP 範囲からのリクエストも通すことを推奨しています。PerplexityBot は基盤モデル向けの内容収集には使わないとも述べているので、許可は学習に関する判断ではありません。robots.txt の変更が反映されるまで最長 24 時間かかることがあります。
Perplexity は llms.txt を読みますか?
観測されている限り、読みません。このサイトの ChatGPT の記事で紹介した 83 サイト・12 週間のパネルでは、Perplexity の llms.txt 取得は 0 回でした。Perplexity が読むのはページです。llms.txt は読むエージェントやツールのために書き、Perplexity 向けの労力はページそのものに使ってください。
一部の情報源についている盾のアイコンは何ですか?
Perplexity のヘルプセンターがソースラベルとして説明しているものです。個々のページではなくウェブサイト全体の審査に基づいて、政府系(Government)、学術系(Academic)、信頼できる(Trusted)のいずれかを示す盾です。審査では、そのサイトが誤りを訂正しているか、各記事の書き手を明示しているか、といった点を見るとされ、提携や支払いなどの取引関係はラベルに影響しないと記事は述べています。ラベルは引用の条件ではなく、引用の多くにはラベルがありません。
Perplexity では引用されるのに ChatGPT では引用されない(またはその逆)のはなぜですか?
仕組みが違うからです。Perplexity はリアルタイムの検索エンジンに最も近く、最近公開された構造のよいページを引用しやすい傾向があります。ChatGPT のブラウジング経路はより保守的です。アシスタントごとに別々に追跡し、揃うことを期待しないでください。各社が送るユーザーエージェントはこのサイトのクローラー記事で説明しています。
効いているかはどう分かりますか?
信号は 3 つです。サーバーログに現れる PerplexityBot と Perplexity-User(公開 IP 範囲で検証したもの)。アクセス解析に出る perplexity.ai からの流入。そして毎月、ログアウトした状態で Perplexity に最重要の質問 10 個を聞き、情報源の一覧に入っているか、何番目か、どのページが引用されたかを記録する監査です。
次に読む
- → AI 検索に拾われたかを確認する方法 (4 つの確認と毎月の監査)
- → AI クローラー一覧と robots.txt の書き方 (各社のユーザーエージェントと IP での確認)
- → llms.txt と AI 検索の効果計測の仕方
- → 解説記事の一覧へ戻る