AI visibility scores: how to tell a real change from noise
A visibility score is not a fact, it is an estimate made from a sample of answers. On 30 answers, a score of 23% could really be anywhere between 12% and 41%. On 300 answers, the same 23% narrows to 19–28%. So before asking whether your score went up, ask how many answers it was built on — because a move from 23% to 28% on 300 answers means nothing at all, while a move to 31% does.
This guide explains how to read those numbers, and how to tell, week after week, whether something actually changed.
Why AI answers move on their own
Four different things make the same question return different names, none of which has anything to do with your marketing.
- The models sample. A language model draws its words rather than looking them up. Ask three times, get three lists.
- The live web moves. Assistants with search quote pages that are reindexed, reranked and republished constantly.
- Personalisation. Account history, memory and location change the answer for the same question.
- The question set. Twenty questions are a sample of the thousands your customers could ask. Change the twenty and you change the score.
A serious measurement cannot remove this variation. It can only measure it and tell you how big it is.
What your score actually is
If you appear in 7 answers out of 30, your score is 23%. That figure is an estimate of an invisible true value, and its precision depends almost entirely on how many answers you counted.
Here is what a 23% score is really worth, at 95% confidence:
| Answers counted | Score | Plausible range | Precision |
|---|
| 18 | 23% | 9 – 45% | ±18 points |
|---|
| 30 | 23% | 12 – 41% | ±15 points |
|---|
| 72 | 23% | 15 – 35% | ±10 points |
|---|
| 100 | 23% | 16 – 32% | ±8 points |
|---|
| 300 | 23% | 19 – 28% | ±5 points |
|---|
| 720 | 23% | 20 – 26% | ±3 points |
|---|
Two practical rules follow. To reach a precision of ±10 points, you need about 66 answers. To reach ±5 points, about 270. Below thirty answers, you are not measuring, you are sampling a rumour.
And the extreme case from everyday life: ask one question three times, get named once. That is 33% — with a plausible range of 6% to 79%. That single number is worthless, and it is exactly what someone does when they type their own brand into ChatGPT and draw a conclusion.
Why we use the Wilson interval
The formula most people remember from school breaks down precisely where AI visibility lives: small samples, and proportions close to zero. Most brands start at 0, 3 or 7%, and the textbook formula happily returns a lower bound below zero, which is meaningless.
The Wilson interval is built for that case. It stays inside 0–100%, stays honest on small samples, and it is what we use for every figure we publish. The full formula is in our methodology, and you are welcome to check our arithmetic.
Daily tracking is not more precision
This is the most common misunderstanding in our market, and it is worth being precise about, because several tools measure daily and it sounds better.
Take twenty questions on four engines. Measured once a day, that is 80 answers a day — a precision of about ±9 points. Measured three times a week, that is 240 answers a week — about ±6 points. The daily chart looks alive, with a number moving every morning. Most of that movement is the sampling noise of ±9, not your market.
There is a real case for daily: catching an incident, a competitor's campaign, a sudden change in an engine. But for the question "is my visibility improving?", a noisier number delivered more often answers it worse, not better. We chose weekly with three passes for that reason, and we say so openly — if you need daily signals, tools that do it exist, and we name them on our comparison page.
How to tell a real change from noise
Week over week, compare the ranges, not the numbers.
On 300 answers a week, starting from 23%:
- 26% next week — inside the margin, no conclusion.
- 28% — still inside, no conclusion, even though it looks like a five-point gain.
- 29% — not conclusive either, though it is starting to be interesting.
- 31% — now the difference is larger than the noise. Something changed.
So on this sample size, you need roughly eight points of movement before you can claim anything. If you want to detect a three-point improvement, you need three to four times more answers. That is a cost, and it is the honest trade-off nobody in this market puts on the table.
The other way to see a real change earlier is the trend: four consecutive weeks moving in the same direction mean more than one large jump, even when each individual week is inside its margin.
What the margin does not cover
The confidence interval only covers sampling. Three other things can move your score without any statistics warning you.
- The question list. Add or remove questions and you are measuring something else. Keep the list stable, and when you do change it, restart the history rather than pretending it continues.
- Model updates. A new version of an engine can redraw the whole landscape overnight. This is real change, not noise, but it is not your doing either.
- The engine mix. A score averaged over four engines drops if one of them stops answering. Always read the per-engine breakdown before concluding anything about the average.
Five questions to ask any vendor
Whatever tool you use, ours included, these five answers tell you whether you are buying a measurement or a decoration.
- How many answers is my score computed from, per week? If the answer is vague, everything else is decoration.
- How many times is each question asked? One pass per day is one draw, not a measurement.
- Is a margin of error shown next to the score? If not, ask why. There always is one; the only question is whether you are shown it.
- Which engines are included in the plan I am buying, and what happens to the average when one fails?
- Is the methodology published? Not a marketing page — the formulas, the sample sizes, and the limits.
We publish all five, including the places where our own figures are weak. Our free check runs eighteen answers, which is ±18 points: enough to see whether you are near zero or clearly present, not enough to settle a discussion. We would rather write that than let you quote a number that cannot support the weight.
Our full method, including the Wilson formula, the number of passes and what we do not measure, is published in our methodology. You can run a free check on your own brand from our homepage, with no account and no credit card — and now you know exactly how much to trust the number it gives you.
Score de visibilité IA : distinguer un vrai changement du bruit
Un score de visibilité n'est pas un fait, c'est une estimation calculée sur un échantillon de réponses. Sur 30 réponses, un score de 23 % peut en réalité se situer n'importe où entre 12 % et 41 %. Sur 300 réponses, ce même 23 % se resserre entre 19 et 28 %. Avant de demander si votre score a monté, demandez donc sur combien de réponses il a été calculé — parce qu'un passage de 23 % à 28 % sur 300 réponses ne veut strictement rien dire, alors qu'un passage à 31 %, si.
Ce guide explique comment lire ces chiffres, et comment savoir, semaine après semaine, si quelque chose a réellement changé.
Pourquoi les réponses des IA bougent toutes seules
Quatre choses différentes font qu'une même question renvoie des noms différents, et aucune n'a de rapport avec votre marketing.
- Les modèles tirent au sort. Un modèle de langage tire ses mots au lieu de les consulter. Posez trois fois, obtenez trois listes.
- Le web vit. Les assistants qui font de la recherche citent des pages réindexées, reclassées et republiées en permanence.
- La personnalisation. L'historique du compte, la mémoire et la localisation modifient la réponse à une même question.
- Le jeu de questions. Vingt questions sont un échantillon des milliers que vos clients pourraient poser. Changez les vingt, vous changez le score.
Une mesure sérieuse ne peut pas supprimer cette variation. Elle peut seulement la mesurer et vous dire de combien elle est.
Ce que votre score est réellement
Si vous apparaissez dans 7 réponses sur 30, votre score est de 23 %. Ce chiffre est l'estimation d'une valeur vraie invisible, et sa précision dépend presque uniquement du nombre de réponses comptées.
Voici ce que vaut réellement un score de 23 %, avec une confiance de 95 % :
| Réponses comptées | Score | Fourchette plausible | Précision |
|---|
| 18 | 23 % | 9 – 45 % | ±18 points |
|---|
| 30 | 23 % | 12 – 41 % | ±15 points |
|---|
| 72 | 23 % | 15 – 35 % | ±10 points |
|---|
| 100 | 23 % | 16 – 32 % | ±8 points |
|---|
| 300 | 23 % | 19 – 28 % | ±5 points |
|---|
| 720 | 23 % | 20 – 26 % | ±3 points |
|---|
Deux règles pratiques en découlent. Pour atteindre une précision de ±10 points, il faut environ 66 réponses. Pour ±5 points, environ 270. En dessous de trente réponses, vous ne mesurez pas, vous échantillonnez une rumeur.
Et le cas extrême, celui de la vie courante : posez une question trois fois, soyez cité une fois. Cela fait 33 % — avec une fourchette plausible de 6 % à 79 %. Ce chiffre ne vaut rien, et c'est exactement ce que fait quelqu'un qui tape le nom de sa marque dans ChatGPT et en tire une conclusion.
Pourquoi nous utilisons l'intervalle de Wilson
La formule que tout le monde retient de l'école s'effondre précisément là où vit la visibilité IA : petits échantillons et proportions proches de zéro. La plupart des marques démarrent à 0, 3 ou 7 %, et la formule scolaire renvoie alors tranquillement une borne basse négative, ce qui n'a aucun sens.
L'intervalle de Wilson est fait pour ce cas. Il reste à l'intérieur de 0–100 %, reste honnête sur les petits échantillons, et c'est celui que nous utilisons pour chaque chiffre que nous publions. La formule complète est dans notre méthodologie, et vous êtes invité à vérifier nos calculs.
Le suivi quotidien n'apporte pas plus de précision
C'est le malentendu le plus répandu de notre marché, et il mérite d'être posé clairement, parce que plusieurs outils mesurent chaque jour et que cela sonne mieux.
Prenez vingt questions sur quatre moteurs. Mesurées une fois par jour, cela fait 80 réponses par jour, soit une précision d'environ ±9 points. Mesurées trois fois par semaine, cela fait 240 réponses par semaine, soit environ ±6 points. La courbe quotidienne a l'air vivante, avec un chiffre qui bouge chaque matin. L'essentiel de ce mouvement est le bruit d'échantillonnage de ±9, pas votre marché.
Le quotidien a un vrai intérêt : repérer un incident, la campagne d'un concurrent, un changement brutal chez un moteur. Mais pour la question « est-ce que ma visibilité progresse ? », un chiffre plus bruité livré plus souvent répond moins bien, pas mieux. Nous avons choisi l'hebdomadaire à trois passages pour cette raison, et nous le disons franchement : si vous avez besoin d'un signal quotidien, des outils le font, et nous les nommons sur notre page comparatif.
Comment reconnaître un vrai changement
D'une semaine à l'autre, comparez les fourchettes, pas les chiffres.
Sur 300 réponses par semaine, en partant de 23 % :
- 26 % la semaine suivante : dans la marge, aucune conclusion.
- 28 % : toujours dans la marge, aucune conclusion, même si cela ressemble à cinq points gagnés.
- 29 % : toujours pas concluant, même si cela commence à être intéressant.
- 31 % : là, l'écart dépasse le bruit. Quelque chose a changé.
Sur cette taille d'échantillon, il faut donc environ huit points de mouvement avant de pouvoir affirmer quoi que ce soit. Pour détecter une amélioration de trois points, il faut trois à quatre fois plus de réponses. C'est un coût, et c'est l'arbitrage honnête que personne dans ce marché ne met sur la table.
L'autre façon de voir un vrai changement plus tôt, c'est la tendance : quatre semaines consécutives dans le même sens valent plus qu'un seul grand saut, même si chaque semaine prise isolément reste dans sa marge.
Ce que la marge ne couvre pas
L'intervalle de confiance ne couvre que l'échantillonnage. Trois autres phénomènes peuvent déplacer votre score sans qu'aucune statistique ne vous avertisse.
- La liste de questions. Ajoutez ou retirez des questions et vous mesurez autre chose. Gardez la liste stable, et quand vous la changez, repartez d'un nouvel historique plutôt que de faire semblant qu'il continue.
- Les mises à jour des modèles. Une nouvelle version d'un moteur peut redessiner tout le paysage du jour au lendemain. C'est un vrai changement, pas du bruit, mais il n'est pas de votre fait non plus.
- La composition des moteurs. Un score moyenné sur quatre moteurs chute si l'un d'eux cesse de répondre. Lisez toujours le détail par moteur avant de conclure quoi que ce soit sur la moyenne.
Cinq questions à poser à n'importe quel vendeur
Quel que soit l'outil que vous utilisez, le nôtre compris, ces cinq réponses vous disent si vous achetez une mesure ou une décoration.
- Sur combien de réponses mon score est-il calculé, par semaine ? Si la réponse est floue, tout le reste est de la décoration.
- Combien de fois chaque question est-elle posée ? Un passage par jour, c'est un tirage, pas une mesure.
- Une marge d'erreur est-elle affichée à côté du score ? Sinon, demandez pourquoi. Il y en a toujours une ; la seule question est de savoir si on vous la montre.
- Quels moteurs sont inclus dans l'offre que j'achète, et que devient la moyenne quand l'un d'eux tombe ?
- La méthodologie est-elle publiée ? Pas une page marketing : les formules, les tailles d'échantillon et les limites.
Nous publions les cinq, y compris là où nos propres chiffres sont faibles. Notre test gratuit tourne sur dix-huit réponses, soit ±18 points : assez pour voir si vous êtes proche de zéro ou nettement présent, pas assez pour trancher un débat. Nous préférons l'écrire plutôt que de vous laisser citer un chiffre qui ne peut pas porter ce poids.
Notre méthode complète, avec la formule de Wilson, le nombre de passages et ce que nous ne mesurons pas, est publiée dans notre méthodologie. Vous pouvez lancer un test gratuit sur votre marque depuis notre page d'accueil, sans compte et sans carte bancaire — et vous savez désormais exactement quelle confiance accorder au chiffre qu'il vous donnera.