AI 検索の可視性を正直に測る
AI の回答におけるブランドの位置を追跡すると約束するツールが増えており、多くは 1 つのプロンプトから日次のスコアを出します。ばらつきのデータは、その数字がノイズだと告げています。このページでは、ばらつきが実際にどう見えるのか、妥当な測定に何が必要なのか、そしてどのツールも正当には主張できないことを扱います。
なぜ 1 回の確認はノイズなのか
生成エンジンはサンプリングを行うシステムです。同じ質問が二度同じ回答を返すことはありません。検証では、同一の ChatGPT の実行を 3 回行ったとき、3 回すべてで安定して残った引用元はおよそ 2.2 パーセントでした。同じ質問を 3 回すれば、引用リストはほぼ全面的に入れ替わります。1 つのプロンプトの上に作られた日次チェックは、あなたの可視性を測っているのではありません。サイコロを測っているのです。
LLM のブランド応答におけるばらつきの分析は、その動きが実際どこから来ているのかを示しています。
| 要因 | 応答のばらつきに占める割合 |
|---|---|
| 同じ言い回しを繰り返すこと | 34.8 パーセント |
| クエリの言語 | 26.5 から 32.0 パーセント |
| ブランドそのもの | 1.5 パーセント |
この表を注意深く読んでください。質問がどう言い回されるか、どの言語で尋ねられるかが結果を支配しています。どのブランドについて尋ねられているかが説明するのは 1.5 パーセントです。1 つの言い回しを、1 つの言語で、1 つのモデルに、1 日 1 回投げるツールは、あなたが気にしていること以外のほぼすべてをサンプリングしています。昨日のスコアと今日のスコアが違うとき、それはサンプリングを行うシステムの期待される挙動であって、コンテンツについて何かが変わったというシグナルではありません。
妥当な測定とは
これらは AI 可視性が測定不能だという話ではありません。統計の問題だという話であり、必要なものはごく普通のものです。
- 固定したプロンプトセットを、複数の言い回しで実行する。各質問について複数の言い方を用意し、測定ラウンドの間はそれを固定します。そうすれば言い回しによるばらつきは平均化され、変化と取り違えられません。
- 複数の言語。クエリの言語はばらつきの 26.5 から 32.0 パーセントを説明します。顧客が複数の言語で尋ねるなら、1 言語での測定は全体像のほとんどを取りこぼします。
- 複数のモデル。エンジンによって引用の仕方は異なり、あるエンジンでの変化はほかのエンジンについて何も語りません。
- 信頼区間つきの反復実行。点ではなく範囲を報告してください。区間のない可視性の数値は、事実として提示されたくじ引きです。
- 月次のリズム。日々の動きはサンプリングのノイズに支配されます。1 か月分の実行を集計して前月と比べることが、本当の変化がノイズから分離できる最短の期間です。
Google 自身のレポートがある場面ではそれを使う
Google の AI 機能に限って言えば、Search Console に生成 AI のパフォーマンスレポートがあります。このデータはサンプリングされたプロンプトではなく Google 自身のシステムから来るため、額面どおりに受け取れる唯一の AI 可視性の数字になります。一次データのレポートを提供していないエンジンについては、信頼区間つきのサンプリング測定が正直な上限であり、推定値として明示すべきです。
どのツールも主張できないこと
Google は、自社のシステムの内側にアクセスできるサードパーティのツールは存在しないと述べています。外部のツールはどれも、ダッシュボードが何をほのめかしていようと、外側からプロンプトを投げて結果をサンプリングしているだけです。あなた自身にもできることと同じです。この方法は、誤差つきのサンプリングとして提示される限り正当です。内部状態の読み取りとして提示されるなら正当ではありません。次のものは危険信号として扱ってください。
- 1 回ずつのプロンプト実行から作られた日次のトレンドライン。
- 信頼区間の添えられていない精密なスコア。
- 多言語市場に対して 1 言語で測られた順位。
- エンジンの内部データへの特別なアクセスを主張するもの。
正直な測定は日次スコアより遅く、劇的でもありません。そして意思決定を支えられるのはそれだけです。Google 自身が何を最適化するよう推奨しているかは、Google が AI 検索最適化について実際に述べていることをご覧ください。