Att mäta AI-söksynlighet ärligt
Ett växande antal verktyg lovar att spåra ditt varumärkes position i AI-svar, ofta som en daglig poäng från en enda prompt. Variansdatan säger att den siffran är brus. Den här sidan täcker hur variansen faktiskt ser ut, vad försvarbar mätning kräver och vad inget verktyg legitimt kan påstå.
Varför enstaka kontroller är brus
Generativa motorer är samplande system: samma fråga returnerar inte samma svar två gånger. I tester lämnade tre identiska ChatGPT-körningar ungefär 2.2 till 2.3 procent av de citerade källorna stabila över alla tre körningarna. Ställ samma fråga tre gånger och nästan hela citeringslistan ändras. En daglig kontroll byggd på en prompt mäter inte din synlighet; den mäter tärningarna.
Variansanalys av LLM-varumärkessvar visar var rörelsen faktiskt kommer ifrån:
| Faktor | Andel av variansen i svaren |
|---|---|
| Upprepning av samma formulering | 35 procent |
| Frågans språk | 26.5 till 32.0 procent |
| Varumärkesidentitet | 1.5 procent |
Läs den tabellen noga. Hur frågan formuleras och vilket språk den ställs på dominerar utfallet. Vilket varumärke det frågas om står för 1.5 procent. Ett verktyg som kontrollerar en formulering, på ett språk, i en modell, en gång om dagen, samplar nästan allt utom det du bryr dig om. När gårdagens poäng skiljer sig från dagens är det förväntat beteende hos ett samplande system, inte en signal om att något i ditt innehåll har ändrats.
Hur försvarbar mätning ser ut
Inget av detta gör AI-synlighet omätbar. Det gör den till ett statistikproblem, och kraven är de vanliga:
- En fast promptuppsättning, körd över formuleringar. Flera ordalydelser av varje fråga, hållna konstanta mellan mätrundor, så att formuleringsvarians medlas bort i stället för att misstas för förändring.
- Flera språk. Frågespråket står för 26.5 till 32.0 procent av variansen. Om dina kunder frågar på mer än ett språk missar mätning på ett språk det mesta av bilden.
- Flera modeller. Motorer citerar olika, och en förändring i en motor säger inget om de andra.
- Upprepade körningar med konfidensintervall. Rapportera ett intervall, inte en punkt. En synlighetssiffra utan intervall är en slumpdragning presenterad som fakta.
- Månatlig kadens. Rörelse dag för dag domineras av samplingsbrus. Att aggregera en månads körningar och jämföra månad mot månad är det kortaste fönstret där verklig förändring skiljer ut sig från brus.
Använd Googles egen rapport där en finns
För Googles AI-funktioner specifikt innehåller Search Console en resultatrapport för generativ AI. Den datan kommer från Googles egna system snarare än från samplade prompter, vilket gör den till den enda AI-synlighetssiffra du kan ta för vad den är. För motorer utan förstapartsrapportering är samplad mätning med konfidensintervall det ärliga taket, och den bör märkas som en uppskattning.
Vad inget verktyg kan påstå
Google anger att inget tredjepartsverktyg har tillgång in i dess system. Varje externt verktyg, vad dess instrumentpanel än antyder, kör prompter utifrån och samplar resultaten, precis som du själv skulle kunna. Det angreppssättet är legitimt när det presenteras som sampling med felmarginaler. Det är inte legitimt när det presenteras som en avläsning av internt tillstånd. Se dessa som varningsflaggor:
- En daglig trendlinje byggd på enstaka promptkörningar.
- En exakt poäng utan konfidensintervall.
- Rankningar mätta på ett språk för en flerspråkig marknad.
- Varje påstående om särskild tillgång till en motors interna data.
Ärlig mätning är långsammare och mindre dramatisk än en daglig poäng, och den är den enda sorten som stödjer beslut. För vad Google självt rekommenderar att optimera, se vad Google faktiskt säger om AI-sökoptimering.