Skip to main content

Last updated

アンサーエンジンはどのように情報源を選ぶのか

ChatGPT、Perplexity、Gemini、あるいは Google の AI Overviews が質問に答えるとき、少数のウェブページを引用します。その引用は飾りではありません。選定プロセスの出力であり、そのプロセスは説明できる程度には文書化されています。このページではその仕組みを扱います。コンテンツはどのように取得されるのか、情報源はどのように選ばれるのか、そもそも候補になる条件は何か、そしてなぜ自分の引用を測るのが見た目より難しいのか。

検索拡張生成

アンサーエンジンはモデルの記憶だけで答えるわけではありません。検索拡張生成(RAG)を使います。質問された時点で、システムはインデックスから関連する文書を取得し、取得したものに根拠づけた応答を生成します。参照したページが引用になります。そもそも AEO が成り立つのはこのためです。モデルの学習データは固定されていますが、取得のステップは生きたインデックスに対して走り、あなたのコンテンツはそこに入り、その中で立ち位置を高めることができます。

ランキングシステムに根拠づけられている

Google に限って言えば、Google の AI 機能に関するガイドは、AI Overviews と AI Mode が中核の検索ランキングシステムに根拠づけられた検索拡張生成を使ってコンテンツを選ぶと述べています。取得のステップは別の謎めいたアルゴリズムではありません。オーガニックの順位を決めるのと同じシステムが、生成のレイヤーが何を読めるのかを決めています。上位に表示されるコンテンツが、引用されうるコンテンツです。

query fan-out

Google は query fan-out(1 つの質問の背後で複数の関連クエリを同時に投げる仕組み)という手法を説明しています。システムは 1 つの質問について文脈を集めるため、関連する複数のクエリを同時に発行します。実務上の帰結は、ユーザーが一度も入力していないクエリであなたのページが取得されうる、ということです。料金についての質問が、機能、代替製品、初期設定に関するクエリへ fan-out することがあります。トピックの隣接するサブ質問まで扱っているページは、取得に見つけてもらえる面がそれだけ多くなります。

引用はどのように現れるのか

Google のガイドは、AI の応答が根拠となるページへの目立つクリック可能なリンクを示すと述べています。したがって情報源に選ばれることは、回答が示されるまさにその瞬間の可視的なブランド露出であり、読者が検証したりもっと深く知ろうとしたりするときにたどる経路でもあります。Google の Search Console には生成 AI のパフォーマンスレポートがあり、これがこのトラフィックを一次データとして見る方法です。

参加資格、インデックス登録と snippet の表示対象であること

そもそも候補になるには、ページがクロールでき、インデックスに登録され、snippet として表示される資格が必要です。参加要件はこれだけです。Google のガイドによれば、特別なマークアップや AI 向けファイルは不要で、llms.txt は Google Search に無視され、構造化データは生成 AI 機能には必須ではありません。Google は、コンテンツを断片に分割することや AI 向けの特別な形式で書くことを明確に推奨していません。通常の snippet として表示できないページは、AI の回答にも現れません。表示できるなら、技術的にそれ以上必要なものはありません。

Google 以外のエンジンはどう違うのか

ChatGPT、Perplexity、Claude は Google のインデックスの上に乗っていません。自前のクローラーと取得システムを動かしているため、ページの立ち位置はエンジンごとに異なりえます。新しいコンテンツへの意欲も、測れるほど違います。7,683 ページと 47,097 件の引用に関する調査によれば、Gemini は 78 パーセントの割合で過去 1 年以内に更新されたコンテンツを引用し、ChatGPT は 73 パーセント、Perplexity は 65 パーセントでした。引用されたコンテンツのうち最近公開されたものは 42 パーセントにとどまっており、エンジンが評価する鮮度は、新しいページからではなく既存ページの更新から主に生まれていることを意味します。Perplexity が重要なら、古くても手入れされたページはまだ戦えます。Gemini では、放置されたページは分が悪くなります。

なぜ引用の測定はノイズが多いのか

エンジンが自分を引用しているかを確かめるのは簡単そうに聞こえます。聞いて、見ればいい。実際には出力が不安定です。同一の ChatGPT の実行を 3 回行うと、引用元のうち安定して残るのはおよそ 2.2 パーセントです。LLM のブランド応答の測定では、クエリの言語が測定のばらつきの 26.5 から 32.0 パーセントを説明し、ブランドそのものが説明するのは 1.5 パーセントでした。どう尋ねるかの方が、あなたが誰であるかよりはるかに結果を動かします。

ここから 2 つの結論が出ます。第 1 に、1 回のクエリ確認では信頼できるシグナルは得られません。言い回しと時間をまたいで繰り返しサンプリングして初めて傾向が見えます。第 2 に、ベンダーのダッシュボードは慎重に扱ってください。Google の内部システムにアクセスできるサードパーティのツールは存在しないため、外部から出てくる引用の数字は台帳ではなくサンプルです。これがコンテンツ戦略にとって何を意味するかは、AEO とは何かをご覧ください。

自動運転にまかせる

Vupie はこのガイドの内容をすべて実行します。月に 8 本のプレミアム記事。

ベータに参加