AI visibility scores: how to tell a real change from noise

A visibility score is not a fact, it is an estimate made from a sample of answers. On 30 answers, a score of 23% could really be anywhere between 12% and 41%. On 300 answers, the same 23% narrows to 19–28%. So before asking whether your score went up, ask how many answers it was built on — because a move from 23% to 28% on 300 answers means nothing at all, while a move to 31% does.

This guide explains how to read those numbers, and how to tell, week after week, whether something actually changed.

Why AI answers move on their own

Four different things make the same question return different names, none of which has anything to do with your marketing.

A serious measurement cannot remove this variation. It can only measure it and tell you how big it is.

What your score actually is

If you appear in 7 answers out of 30, your score is 23%. That figure is an estimate of an invisible true value, and its precision depends almost entirely on how many answers you counted.

Here is what a 23% score is really worth, at 95% confidence:

Answers countedScorePlausible rangePrecision
1823%9 – 45%±18 points
3023%12 – 41%±15 points
7223%15 – 35%±10 points
10023%16 – 32%±8 points
30023%19 – 28%±5 points
72023%20 – 26%±3 points

Two practical rules follow. To reach a precision of ±10 points, you need about 66 answers. To reach ±5 points, about 270. Below thirty answers, you are not measuring, you are sampling a rumour.

And the extreme case from everyday life: ask one question three times, get named once. That is 33% — with a plausible range of 6% to 79%. That single number is worthless, and it is exactly what someone does when they type their own brand into ChatGPT and draw a conclusion.

Why we use the Wilson interval

The formula most people remember from school breaks down precisely where AI visibility lives: small samples, and proportions close to zero. Most brands start at 0, 3 or 7%, and the textbook formula happily returns a lower bound below zero, which is meaningless.

The Wilson interval is built for that case. It stays inside 0–100%, stays honest on small samples, and it is what we use for every figure we publish. The full formula is in our methodology, and you are welcome to check our arithmetic.

Daily tracking is not more precision

This is the most common misunderstanding in our market, and it is worth being precise about, because several tools measure daily and it sounds better.

Take twenty questions on four engines. Measured once a day, that is 80 answers a day — a precision of about ±9 points. Measured three times a week, that is 240 answers a week — about ±6 points. The daily chart looks alive, with a number moving every morning. Most of that movement is the sampling noise of ±9, not your market.

There is a real case for daily: catching an incident, a competitor's campaign, a sudden change in an engine. But for the question "is my visibility improving?", a noisier number delivered more often answers it worse, not better. We chose weekly with three passes for that reason, and we say so openly — if you need daily signals, tools that do it exist, and we name them on our comparison page.

How to tell a real change from noise

Week over week, compare the ranges, not the numbers.

On 300 answers a week, starting from 23%:

So on this sample size, you need roughly eight points of movement before you can claim anything. If you want to detect a three-point improvement, you need three to four times more answers. That is a cost, and it is the honest trade-off nobody in this market puts on the table.

The other way to see a real change earlier is the trend: four consecutive weeks moving in the same direction mean more than one large jump, even when each individual week is inside its margin.

What the margin does not cover

The confidence interval only covers sampling. Three other things can move your score without any statistics warning you.

Five questions to ask any vendor

Whatever tool you use, ours included, these five answers tell you whether you are buying a measurement or a decoration.

  1. How many answers is my score computed from, per week? If the answer is vague, everything else is decoration.
  2. How many times is each question asked? One pass per day is one draw, not a measurement.
  3. Is a margin of error shown next to the score? If not, ask why. There always is one; the only question is whether you are shown it.
  4. Which engines are included in the plan I am buying, and what happens to the average when one fails?
  5. Is the methodology published? Not a marketing page — the formulas, the sample sizes, and the limits.

We publish all five, including the places where our own figures are weak. Our free check runs eighteen answers, which is ±18 points: enough to see whether you are near zero or clearly present, not enough to settle a discussion. We would rather write that than let you quote a number that cannot support the weight.


Our full method, including the Wilson formula, the number of passes and what we do not measure, is published in our methodology. You can run a free check on your own brand from our homepage, with no account and no credit card — and now you know exactly how much to trust the number it gives you.

Score de visibilité IA : distinguer un vrai changement du bruit

Un score de visibilité n'est pas un fait, c'est une estimation calculée sur un échantillon de réponses. Sur 30 réponses, un score de 23 % peut en réalité se situer n'importe où entre 12 % et 41 %. Sur 300 réponses, ce même 23 % se resserre entre 19 et 28 %. Avant de demander si votre score a monté, demandez donc sur combien de réponses il a été calculé — parce qu'un passage de 23 % à 28 % sur 300 réponses ne veut strictement rien dire, alors qu'un passage à 31 %, si.

Ce guide explique comment lire ces chiffres, et comment savoir, semaine après semaine, si quelque chose a réellement changé.

Pourquoi les réponses des IA bougent toutes seules

Quatre choses différentes font qu'une même question renvoie des noms différents, et aucune n'a de rapport avec votre marketing.

Une mesure sérieuse ne peut pas supprimer cette variation. Elle peut seulement la mesurer et vous dire de combien elle est.

Ce que votre score est réellement

Si vous apparaissez dans 7 réponses sur 30, votre score est de 23 %. Ce chiffre est l'estimation d'une valeur vraie invisible, et sa précision dépend presque uniquement du nombre de réponses comptées.

Voici ce que vaut réellement un score de 23 %, avec une confiance de 95 % :

Réponses comptéesScoreFourchette plausiblePrécision
1823 %9 – 45 %±18 points
3023 %12 – 41 %±15 points
7223 %15 – 35 %±10 points
10023 %16 – 32 %±8 points
30023 %19 – 28 %±5 points
72023 %20 – 26 %±3 points

Deux règles pratiques en découlent. Pour atteindre une précision de ±10 points, il faut environ 66 réponses. Pour ±5 points, environ 270. En dessous de trente réponses, vous ne mesurez pas, vous échantillonnez une rumeur.

Et le cas extrême, celui de la vie courante : posez une question trois fois, soyez cité une fois. Cela fait 33 % — avec une fourchette plausible de 6 % à 79 %. Ce chiffre ne vaut rien, et c'est exactement ce que fait quelqu'un qui tape le nom de sa marque dans ChatGPT et en tire une conclusion.

Pourquoi nous utilisons l'intervalle de Wilson

La formule que tout le monde retient de l'école s'effondre précisément là où vit la visibilité IA : petits échantillons et proportions proches de zéro. La plupart des marques démarrent à 0, 3 ou 7 %, et la formule scolaire renvoie alors tranquillement une borne basse négative, ce qui n'a aucun sens.

L'intervalle de Wilson est fait pour ce cas. Il reste à l'intérieur de 0–100 %, reste honnête sur les petits échantillons, et c'est celui que nous utilisons pour chaque chiffre que nous publions. La formule complète est dans notre méthodologie, et vous êtes invité à vérifier nos calculs.

Le suivi quotidien n'apporte pas plus de précision

C'est le malentendu le plus répandu de notre marché, et il mérite d'être posé clairement, parce que plusieurs outils mesurent chaque jour et que cela sonne mieux.

Prenez vingt questions sur quatre moteurs. Mesurées une fois par jour, cela fait 80 réponses par jour, soit une précision d'environ ±9 points. Mesurées trois fois par semaine, cela fait 240 réponses par semaine, soit environ ±6 points. La courbe quotidienne a l'air vivante, avec un chiffre qui bouge chaque matin. L'essentiel de ce mouvement est le bruit d'échantillonnage de ±9, pas votre marché.

Le quotidien a un vrai intérêt : repérer un incident, la campagne d'un concurrent, un changement brutal chez un moteur. Mais pour la question « est-ce que ma visibilité progresse ? », un chiffre plus bruité livré plus souvent répond moins bien, pas mieux. Nous avons choisi l'hebdomadaire à trois passages pour cette raison, et nous le disons franchement : si vous avez besoin d'un signal quotidien, des outils le font, et nous les nommons sur notre page comparatif.

Comment reconnaître un vrai changement

D'une semaine à l'autre, comparez les fourchettes, pas les chiffres.

Sur 300 réponses par semaine, en partant de 23 % :

Sur cette taille d'échantillon, il faut donc environ huit points de mouvement avant de pouvoir affirmer quoi que ce soit. Pour détecter une amélioration de trois points, il faut trois à quatre fois plus de réponses. C'est un coût, et c'est l'arbitrage honnête que personne dans ce marché ne met sur la table.

L'autre façon de voir un vrai changement plus tôt, c'est la tendance : quatre semaines consécutives dans le même sens valent plus qu'un seul grand saut, même si chaque semaine prise isolément reste dans sa marge.

Ce que la marge ne couvre pas

L'intervalle de confiance ne couvre que l'échantillonnage. Trois autres phénomènes peuvent déplacer votre score sans qu'aucune statistique ne vous avertisse.

Cinq questions à poser à n'importe quel vendeur

Quel que soit l'outil que vous utilisez, le nôtre compris, ces cinq réponses vous disent si vous achetez une mesure ou une décoration.

  1. Sur combien de réponses mon score est-il calculé, par semaine ? Si la réponse est floue, tout le reste est de la décoration.
  2. Combien de fois chaque question est-elle posée ? Un passage par jour, c'est un tirage, pas une mesure.
  3. Une marge d'erreur est-elle affichée à côté du score ? Sinon, demandez pourquoi. Il y en a toujours une ; la seule question est de savoir si on vous la montre.
  4. Quels moteurs sont inclus dans l'offre que j'achète, et que devient la moyenne quand l'un d'eux tombe ?
  5. La méthodologie est-elle publiée ? Pas une page marketing : les formules, les tailles d'échantillon et les limites.

Nous publions les cinq, y compris là où nos propres chiffres sont faibles. Notre test gratuit tourne sur dix-huit réponses, soit ±18 points : assez pour voir si vous êtes proche de zéro ou nettement présent, pas assez pour trancher un débat. Nous préférons l'écrire plutôt que de vous laisser citer un chiffre qui ne peut pas porter ce poids.


Notre méthode complète, avec la formule de Wilson, le nombre de passages et ce que nous ne mesurons pas, est publiée dans notre méthodologie. Vous pouvez lancer un test gratuit sur votre marque depuis notre page d'accueil, sans compte et sans carte bancaire — et vous savez désormais exactement quelle confiance accorder au chiffre qu'il vous donnera.