Skip to main content

Last updated

Misurare la visibilità nella ricerca AI in modo onesto

Un numero crescente di strumenti promette di tracciare la posizione del tuo brand nelle risposte AI, spesso come punteggio giornaliero ricavato da un singolo prompt. I dati sulla varianza dicono che quel numero è rumore. Questa pagina spiega che aspetto ha davvero la varianza, cosa richiede una misurazione difendibile e cosa nessuno strumento può legittimamente affermare.

Perché i controlli singoli sono rumore

I motori generativi sono sistemi campionatori: la stessa domanda non restituisce due volte la stessa risposta. Nei test, tre esecuzioni identiche di ChatGPT hanno lasciato stabile su tutte e tre circa il 2,2 per cento delle fonti citate. Fai la stessa domanda tre volte e quasi tutto l'elenco delle citazioni cambia. Un controllo quotidiano costruito su un solo prompt non sta misurando la tua visibilità; sta misurando il lancio dei dadi.

L'analisi della varianza nelle risposte degli LLM sui brand mostra da dove arriva davvero il movimento:

FattoreQuota di varianza nelle risposte
Ripetere la stessa formulazione34,8 per cento
Lingua della querydal 26,5 al 32,0 per cento
Identità del brand1,5 per cento

Leggi la tabella con attenzione. Come viene formulata la domanda e in che lingua viene posta dominano il risultato. Di quale brand si sta parlando pesa per l'1,5 per cento. Uno strumento che controlla una formulazione, in una lingua, su un modello, una volta al giorno, sta campionando quasi tutto tranne la cosa che ti interessa. Quando il punteggio di ieri differisce da quello di oggi, è il comportamento atteso di un sistema campionatore, non il segnale che qualcosa nei tuoi contenuti sia cambiato.

Che aspetto ha una misurazione difendibile

Niente di tutto questo rende la visibilità AI non misurabile. La rende un problema di statistica, e i requisiti sono quelli di sempre:

  • Un set di prompt fisso, eseguito su più formulazioni. Più formulazioni per ogni domanda, tenute costanti tra un ciclo di misurazione e l'altro, così che la varianza da formulazione si medi invece di essere scambiata per un cambiamento.
  • Più lingue. La lingua della query spiega dal 26,5 al 32,0 per cento della varianza. Se i tuoi clienti chiedono in più di una lingua, misurare in una sola lingua perde gran parte del quadro.
  • Più modelli. I motori citano in modo diverso, e uno spostamento su un motore non dice nulla sugli altri.
  • Esecuzioni ripetute con intervalli di confidenza. Riporta un intervallo, non un punto. Un dato di visibilità senza intervallo è un'estrazione casuale presentata come un fatto.
  • Una cadenza mensile. Il movimento giorno per giorno è dominato dal rumore di campionamento. Aggregare un mese di esecuzioni e confrontare mese su mese è la finestra più breve in cui il cambiamento reale si separa dal rumore.

Usa il report di Google dove esiste

Per le funzionalità AI di Google in particolare, Search Console include un report sulle prestazioni nell'AI generativa. Quei dati vengono dai sistemi di Google stessa invece che da prompt campionati, il che ne fa l'unico numero di visibilità AI che puoi prendere per buono. Per i motori che non offrono alcun report di prima parte, la misurazione campionaria con intervalli di confidenza è il tetto onesto, e va etichettata come stima.

Cosa nessuno strumento può affermare

Google dichiara che nessuno strumento di terze parti ha accesso all'interno dei suoi sistemi. Ogni strumento esterno, qualunque cosa lasci intendere la sua dashboard, sta lanciando prompt dall'esterno e campionando i risultati, esattamente come potresti fare tu. Questo approccio è legittimo quando viene presentato come campionamento con barre di errore. Non è legittimo quando viene presentato come una lettura dello stato interno. Considera questi segnali d'allarme:

  • Una linea di tendenza quotidiana costruita su singole esecuzioni di un prompt.
  • Un punteggio preciso senza alcun intervallo di confidenza allegato.
  • Classifiche misurate in una sola lingua per un mercato multilingue.
  • Qualsiasi rivendicazione di accesso speciale ai dati interni di un motore.

La misurazione onesta è più lenta e meno spettacolare di un punteggio giornaliero, ed è l'unica che sostiene delle decisioni. Per sapere cosa Google stessa raccomanda di ottimizzare, vedi cosa dice davvero Google sull'ottimizzazione per la ricerca AI.

Mettilo in pilota automatico

Vupie applica tutto quello che trovi in questa guida, otto articoli premium al mese.

Entra nella beta