Skip to main content

Last updated

Mesurer honnêtement la visibilité en recherche par IA

Un nombre croissant d'outils promettent de suivre la position de votre marque dans les réponses d'IA, souvent sous forme de score quotidien issu d'un seul prompt. Les données de variance disent que ce chiffre est du bruit. Cette page couvre à quoi ressemble réellement cette variance, ce qu'exige une mesure défendable, et ce qu'aucun outil ne peut légitimement affirmer.

Pourquoi les vérifications isolées sont du bruit

Les moteurs génératifs sont des systèmes d'échantillonnage : la même question ne renvoie pas deux fois la même réponse. Lors de tests, trois exécutions identiques de ChatGPT ont laissé environ 2,2 pour cent des sources citées stables sur les trois exécutions. Posez trois fois la même question et la quasi-totalité de la liste des citations change. Une vérification quotidienne bâtie sur un seul prompt ne mesure pas votre visibilité ; elle mesure le dé.

L'analyse de la variance dans les réponses de LLM portant sur des marques montre d'où vient réellement le mouvement :

FacteurPart de la variance des réponses
Répéter la même formulation34,8 pour cent
Langue de la requête26,5 à 32,0 pour cent
Identité de la marque1,5 pour cent

Lisez ce tableau attentivement. La façon dont la question est formulée et la langue dans laquelle elle est posée dominent le résultat. La marque sur laquelle porte la question compte pour 1,5 pour cent. Un outil qui vérifie une formulation, dans une langue, sur un modèle, une fois par jour, échantillonne presque tout sauf ce qui vous intéresse. Quand le score d'hier diffère de celui d'aujourd'hui, c'est le comportement attendu d'un système d'échantillonnage, pas le signe que quoi que ce soit ait changé dans votre contenu.

À quoi ressemble une mesure défendable

Rien de tout cela ne rend la visibilité IA non mesurable. Cela en fait un problème de statistiques, et les exigences sont les exigences ordinaires :

  • Un jeu de prompts figé, exécuté sur plusieurs formulations. Plusieurs libellés de chaque question, maintenus constants entre les campagnes de mesure, pour que la variance de formulation soit moyennée plutôt que prise pour un changement.
  • Plusieurs langues. La langue de la requête explique 26,5 à 32,0 pour cent de la variance. Si vos clients posent leurs questions dans plusieurs langues, une mesure dans une seule langue passe à côté de l'essentiel du tableau.
  • Plusieurs modèles. Les moteurs citent différemment, et un mouvement sur un moteur ne dit rien des autres.
  • Des exécutions répétées avec intervalles de confiance. Rapportez une fourchette, pas un point. Un chiffre de visibilité sans intervalle est un tirage aléatoire présenté comme un fait.
  • Une cadence mensuelle. Les mouvements au jour le jour sont dominés par le bruit d'échantillonnage. Agréger un mois d'exécutions et comparer d'un mois sur l'autre est la fenêtre la plus courte dans laquelle un changement réel se distingue du bruit.

Utilisez le rapport de Google là où il existe

Pour les fonctionnalités d'IA de Google en particulier, Search Console inclut un rapport de performance pour l'IA générative. Ces données proviennent des propres systèmes de Google plutôt que de prompts échantillonnés, ce qui en fait le seul chiffre de visibilité IA que vous pouvez prendre pour argent comptant. Pour les moteurs qui n'offrent aucun reporting de première main, une mesure échantillonnée avec intervalles de confiance est le plafond honnête, et elle devrait être étiquetée comme une estimation.

Ce qu'aucun outil ne peut affirmer

Google déclare qu'aucun outil tiers n'a accès à l'intérieur de ses systèmes. Tout outil externe, quoi que son tableau de bord laisse entendre, exécute des prompts depuis l'extérieur et échantillonne les résultats, exactement comme vous pourriez le faire vous-même. Cette approche est légitime quand elle est présentée comme un échantillonnage avec barres d'erreur. Elle ne l'est pas quand elle est présentée comme une lecture d'un état interne. Considérez ces éléments comme des signaux d'alerte :

  • Une courbe de tendance quotidienne construite à partir d'exécutions de prompts isolées.
  • Un score précis sans aucun intervalle de confiance associé.
  • Des classements mesurés dans une seule langue pour un marché multilingue.
  • Toute revendication d'un accès privilégié aux données internes d'un moteur.

Une mesure honnête est plus lente et moins spectaculaire qu'un score quotidien, et c'est la seule qui permette de décider. Pour ce que Google recommande lui-même d'optimiser, voyez ce que Google dit réellement sur l'optimisation pour la recherche par IA.

Passez en pilote automatique

Vupie applique tout ce guide, huit articles premium par mois.

Rejoindre la bêta