AI-zoekzichtbaarheid eerlijk meten
Steeds meer tools beloven de positie van je merk in AI-antwoorden te volgen, vaak als een dagelijkse score uit één prompt. De data over variantie zeggen dat dat cijfer ruis is. Deze pagina behandelt hoe die variantie er echt uitziet, wat verdedigbaar meten vraagt, en wat geen enkele tool legitiem kan beweren.
Waarom losse steekproeven ruis zijn
Generatieve engines zijn steekproefsystemen: dezelfde vraag levert geen twee keer hetzelfde antwoord op. In tests bleef over drie identieke ChatGPT-runs ongeveer 2,2 procent van de geciteerde bronnen in alle drie de runs stabiel. Stel dezelfde vraag drie keer en bijna de hele citatielijst verandert. Een dagelijkse controle op basis van één prompt meet niet je zichtbaarheid; die meet de dobbelsteen.
Variantieanalyse van merkantwoorden van LLM's laat zien waar de beweging echt vandaan komt:
| Factor | Aandeel in de variantie van antwoorden |
|---|---|
| Dezelfde formulering herhalen | 34,8 procent |
| Taal van de zoekopdracht | 26,5 tot 32,0 procent |
| Merkidentiteit | 1,5 procent |
Lees die tabel goed. Hoe de vraag is geformuleerd en in welke taal die wordt gesteld, domineren de uitkomst. Om welk merk het gaat, verklaart 1,5 procent. Een tool die één formulering, in één taal, op één model, één keer per dag controleert, meet vrijwel alles behalve datgene waar het je om gaat. Als de score van gisteren afwijkt van die van vandaag, is dat het verwachte gedrag van een steekproefsysteem, geen signaal dat er iets aan je content is veranderd.
Hoe verdedigbaar meten eruitziet
Dit alles maakt AI-zichtbaarheid niet onmeetbaar. Het maakt er een statistiekvraagstuk van, en de eisen zijn de gewone:
- Een vaste set prompts, gedraaid over meerdere formuleringen. Meerdere bewoordingen per vraag, constant gehouden tussen meetrondes, zodat variantie in formulering wordt uitgemiddeld in plaats van aangezien voor verandering.
- Meerdere talen. De taal van de zoekopdracht verklaart 26,5 tot 32,0 procent van de variantie. Als je klanten in meer dan één taal vragen stellen, mist meten in één taal het grootste deel van het beeld.
- Meerdere modellen. Engines citeren verschillend, en een verschuiving bij de ene engine zegt niets over de andere.
- Herhaalde runs met betrouwbaarheidsintervallen. Rapporteer een bandbreedte, geen punt. Een zichtbaarheidscijfer zonder interval is een willekeurige trekking die als feit wordt gepresenteerd.
- Een maandelijkse cadans. Beweging van dag tot dag wordt gedomineerd door steekproefruis. Een maand aan runs samenvoegen en maand op maand vergelijken is het kortste venster waarin echte verandering zich van ruis laat scheiden.
Gebruik het rapport van Google zelf waar dat bestaat
Specifiek voor de AI-functies van Google bevat Search Console een prestatierapport voor generatieve AI. Die data komt uit de systemen van Google zelf en niet uit steekproeven met prompts, waardoor het het enige cijfer over AI-zichtbaarheid is dat je voor waar kunt aannemen. Voor engines die geen rapportage uit de eerste hand bieden, is meten via steekproeven met betrouwbaarheidsintervallen het eerlijke plafond, en dat hoort als schatting te worden gelabeld.
Wat geen enkele tool kan beweren
Google stelt dat geen enkele tool van derden toegang heeft tot zijn systemen. Elke externe tool draait, wat het dashboard ook suggereert, prompts van buitenaf en neemt steekproeven van de resultaten, precies zoals je dat zelf zou kunnen. Die aanpak is legitiem zolang die wordt gepresenteerd als steekproef met foutmarges. Die is niet legitiem als die wordt gepresenteerd als een aflezing van de interne toestand. Zie deze zaken als rode vlaggen:
- Een dagelijkse trendlijn opgebouwd uit losse prompt-runs.
- Een precieze score zonder betrouwbaarheidsinterval erbij.
- Posities gemeten in één taal voor een meertalige markt.
- Elke claim over speciale toegang tot de interne data van een engine.
Eerlijk meten is trager en minder spectaculair dan een dagelijkse score, en het is de enige vorm die beslissingen kan dragen. Waar Google zelf op aanraadt te optimaliseren, lees je in wat Google echt zegt over optimaliseren voor AI-zoeken.