Methodology

AIVisib measures whether ChatGPT, Gemini, Perplexity and Claude recommend your business. We publish this page so you can judge our numbers on their merits, not on our word.

1. The questions

How questions are generated

Questions are generated for each brand from three inputs: its sector, its city and its languages. The list is built in several steps.

  1. Neighbourhoods. GPT-4o proposes neighbourhoods of the city. Each one is verified against OpenStreetMap (Nominatim, bounded to the city). Unverified places are dropped.
  2. Drafts. GPT-4o-mini (temperature 0.9) writes candidate questions, with 40% more than needed. The set mixes broad, city-level questions and long-tail questions naming a real neighbourhood or a precise need.
  3. Alphabet guard. Arabic questions contain no Latin letters, and Latin-script questions contain no Arabic letters.
  4. Review. GPT-4o (temperature 0) rejects questions that are unrealistic, outside the sector or that name a place not in the verified list.
  5. De-duplication. Each question is embedded with text-embedding-3-small. Two questions with cosine similarity above 0.85 are treated as paraphrases, and one is removed.

Your control

You can edit or delete every question before saving. Nothing is measured without your approval of the list.

Head and long-tail

Each question is tagged "head" (broad, city-level) or "long-tail" (specific neighbourhood or need). Metrics are reported for both scopes.

2. The engines and how we ask

Engines and settings

EngineModel and configuration
ChatGPTOpenAI Responses API with web search, search context size "low", approximate user location set to your city and country
GeminiGemini 2.5 Flash with Google Search grounding, temperature 0.6
PerplexitySonar, live web search, temperature 0.6
ClaudeClaude Haiku 4.5 with web search (at most 2 searches), temperature 0.6, 1024 output tokens

The same instruction for every engine

All four engines receive the same neutral system prompt: answer naturally, name real businesses, reply in the language of the question.

Neutral state

There is no memory, no personalisation and no logged-in account. Each question starts from a clean state, close to what a new user would see.

Passes and schedule

Every question is asked 3 times per engine, every week. For a typical brand, 16 questions × 4 engines × 3 passes give 192 answers per report.

Calls run in parallel (pool of 6), with 3 retries on temporary errors.

When we refuse to report

If fewer than 50% of calls succeed, no report is issued. We never publish a false 0%. An engine with zero successful answers is shown as "not measured", never as 0%.

3. How we count a mention

The analyser

Each answer is read by GPT-4o-mini at temperature 0. It returns structured JSON: brand mentioned (yes/no), rank from 1 to 10 among named businesses, tracked competitors mentioned, other brands, cited sources, and sentiment (positive, neutral, negative).

Two deterministic guards

The analyser's output is never trusted alone. Two rules apply after it.

  1. Literal presence. The brand name must appear literally in the answer text. If it does not, the mention is discarded.
  2. Homonym guard. The analyser receives the business identity: sector, city, country, and website if provided. A mention that clearly refers to a different business with the same name elsewhere is not counted.

Competitors

A tracked competitor counts at most once per answer, however many times it is named.

4. The metrics and their formulas

Visibility

Visibility = answers mentioning the brand ÷ measured answers × 100.

It is computed overall, per engine, per question and per scope (head / long-tail). Visibility per language is the mean of the visibilities of the questions in that language.

Share of AI recommendations

Share = answers citing the brand ÷ total citations of the brand and its tracked competitors × 100.

This share is computed only among the competitors you track. It is not a share of the whole market.

Average position

Average position = mean rank of the brand in the answers where it is cited. 1 means the brand is named first. If the brand is never cited, the value is null, not 0.

Sentiment

Sentiment = mean of 100 (positive), 50 (neutral) and 0 (negative), over the answers where the brand is cited.

Top sources

Top sources = frequency of the domains cited by the engines. Only URLs actually cited count. Redirect URLs are resolved to their final domain.

5. Precision and confidence

Why answers vary

The same question asked twice can produce different answers. This is normal for these engines. That is why we ask each question 3 times and attach a confidence interval to the results.

Per question: Wilson interval

For each question, we compute a Wilson 95% interval (z = 1.96) on its mention rate. Confidence = 100 × (1 − interval width). A narrow interval means a stable result.

Per report: bootstrap

For the overall score, we resample the questions 1,000 times with replacement (bootstrap, fixed seed 20260830, so the result is reproducible). We compute the score for each resample.

Width = 2 × 1.96 × standard deviation of the resampled scores. Confidence = 100 × (1 − width).

Why ± is shown at report level

The ± shown in the dashboard describes the report score, not a single question. A single question has too few answers for a meaningful ± on its own. The report-level interval reflects how much the score would move if the question set had been slightly different.

6. Texts of the report and anti-hallucination

Insights

Insights are written by GPT-4o-mini (temperature 0.4). They are written only from the computed numbers, and only about measured engines.

Verification

A second pass (temperature 0) checks every engine name and figure in the text against the data. If something is wrong, the text is regenerated once.

Action plan

The action plan (temperature 0.5) is anchored on your sector, your city and the top sources observed.

Deterministic filters

After generation, deterministic filters remove any mention of an engine that was not measured in the report.

Executive summary

The 5-line executive summary is computed directly from the data, not by a language model.

7. What we do not measure (yet)

We prefer to state limits plainly.

8. Data and security

History

Every report and every raw answer is stored. The dashboard compares each report to the previous one (change threshold: 1 point; 0.2 for position) and shows trends over the last 12 reports.

Free audit

The free audit on the website asks 3 template questions to 2 engines (ChatGPT, Gemini), once each. A city is required. It is an indication, not a report.

Security

9. Versions

Version dated 12 September 2026. This page changes when the method changes.


Method validated by the AIVisib team.

Méthodologie

AIVisib mesure si ChatGPT, Gemini, Perplexity et Claude recommandent votre entreprise. Nous publions cette page pour que vous puissiez juger nos chiffres sur pièces, pas sur parole.

1. Les questions

Comment les questions sont générées

Les questions sont générées pour chaque marque à partir de trois éléments : son secteur, sa ville et ses langues. La liste se construit en plusieurs étapes.

  1. Quartiers. GPT-4o propose des quartiers de la ville. Chacun est vérifié dans OpenStreetMap (Nominatim, recherche limitée à la ville). Les lieux non vérifiés sont écartés.
  2. Brouillons. GPT-4o-mini (température 0,9) rédige des questions candidates, avec 40 % de plus que nécessaire. L'ensemble mélange des questions larges à l'échelle de la ville et des questions de longue traîne citant un vrai quartier ou un besoin précis.
  3. Garde-fou d'alphabet. Les questions en arabe ne contiennent aucune lettre latine, et les questions en alphabet latin aucune lettre arabe.
  4. Relecture. GPT-4o (température 0) rejette les questions irréalistes, hors secteur, ou citant un lieu absent de la liste vérifiée.
  5. Dédoublonnage. Chaque question est encodée avec text-embedding-3-small. Deux questions dont la similarité cosinus dépasse 0,85 sont considérées comme des paraphrases, et l'une est supprimée.

Votre contrôle

Vous pouvez modifier ou supprimer chaque question avant l'enregistrement. Rien n'est mesuré sans votre validation de la liste.

Head et longue traîne

Chaque question est étiquetée « head » (large, échelle de la ville) ou « longue traîne » (quartier ou besoin précis). Les métriques sont fournies pour les deux périmètres.

2. Les moteurs et la façon d'interroger

Moteurs et réglages

MoteurModèle et configuration
ChatGPTOpenAI Responses API avec recherche web, taille de contexte de recherche « low », localisation approximative réglée sur votre ville et votre pays
GeminiGemini 2.5 Flash avec ancrage Google Search, température 0,6
PerplexitySonar, recherche web en direct, température 0,6
ClaudeClaude Haiku 4.5 avec recherche web (2 recherches au maximum), température 0,6, 1024 tokens de sortie

La même consigne pour tous les moteurs

Les quatre moteurs reçoivent le même prompt système neutre : répondre naturellement, nommer des entreprises réelles, répondre dans la langue de la question.

État neutre

Il n'y a ni mémoire, ni personnalisation, ni compte connecté. Chaque question part d'un état vierge, proche de ce que verrait un nouvel utilisateur.

Passes et rythme

Chaque question est posée 3 fois par moteur, chaque semaine. Pour une marque type, 16 questions × 4 moteurs × 3 passes donnent 192 réponses par rapport.

Les appels sont exécutés en parallèle (6 à la fois), avec 3 nouvelles tentatives en cas d'erreur temporaire.

Quand nous refusons de publier

Si moins de 50 % des appels réussissent, aucun rapport n'est émis. Nous ne publions jamais un faux 0 %. Un moteur sans aucune réponse réussie est affiché « non mesuré », jamais 0 %.

3. Comment nous comptons une mention

L'analyseur

Chaque réponse est lue par GPT-4o-mini à température 0. Il renvoie un JSON structuré : marque mentionnée (oui/non), rang de 1 à 10 parmi les entreprises nommées, concurrents suivis mentionnés, autres marques, sources citées, et sentiment (positif, neutre, négatif).

Deux garde-fous déterministes

La sortie de l'analyseur n'est jamais prise seule. Deux règles s'appliquent ensuite.

  1. Présence littérale. Le nom de la marque doit apparaître littéralement dans le texte de la réponse. Sinon, la mention est écartée.
  2. Garde-fou des homonymes. L'analyseur reçoit l'identité de l'entreprise : secteur, ville, pays, et site web s'il est fourni. Une mention qui désigne clairement une autre entreprise du même nom, ailleurs, n'est pas comptée.

Concurrents

Un concurrent suivi compte au plus une fois par réponse, quel que soit le nombre de fois où il est nommé.

4. Les métriques et leurs formules

Visibilité

Visibilité = réponses mentionnant la marque ÷ réponses mesurées × 100.

Elle est calculée globalement, par moteur, par question et par périmètre (head / longue traîne). La visibilité par langue est la moyenne des visibilités des questions de cette langue.

Part des recommandations IA

Part = réponses citant la marque ÷ total des citations de la marque et de ses concurrents suivis × 100.

Cette part est calculée uniquement parmi les concurrents que vous suivez. Ce n'est pas une part de l'ensemble du marché.

Position moyenne

Position moyenne = rang moyen de la marque dans les réponses où elle est citée. 1 signifie que la marque est nommée en premier. Si la marque n'est jamais citée, la valeur est vide, pas 0.

Sentiment

Sentiment = moyenne de 100 (positif), 50 (neutre) et 0 (négatif), sur les réponses où la marque est citée.

Sources principales

Sources principales = fréquence des domaines cités par les moteurs. Seules les URL réellement citées comptent. Les URL de redirection sont résolues vers leur domaine final.

5. Précision et confiance

Pourquoi les réponses varient

La même question posée deux fois peut produire deux réponses différentes. C'est normal pour ces moteurs. C'est pourquoi nous posons chaque question 3 fois et associons un intervalle de confiance aux résultats.

Par question : intervalle de Wilson

Pour chaque question, nous calculons un intervalle de Wilson à 95 % (z = 1,96) sur son taux de mention. Confiance = 100 × (1 − largeur de l'intervalle). Un intervalle étroit signifie un résultat stable.

Par rapport : bootstrap

Pour le score global, nous rééchantillonnons les questions 1 000 fois avec remise (bootstrap, graine fixe 20260830, donc résultat reproductible). Nous calculons le score pour chaque rééchantillon.

Largeur = 2 × 1,96 × écart-type des scores rééchantillonnés. Confiance = 100 × (1 − largeur).

Pourquoi le ± est affiché au niveau du rapport

Le ± affiché dans le tableau de bord décrit le score du rapport, pas une question isolée. Une question seule a trop peu de réponses pour un ± significatif. L'intervalle au niveau du rapport indique de combien le score bougerait si le jeu de questions avait été légèrement différent.

6. Textes du rapport et anti-hallucination

Analyses

Les analyses sont rédigées par GPT-4o-mini (température 0,4). Elles sont écrites uniquement à partir des chiffres calculés, et uniquement sur les moteurs mesurés.

Vérification

Une seconde passe (température 0) contrôle chaque nom de moteur et chaque chiffre du texte par rapport aux données. En cas d'erreur, le texte est régénéré une fois.

Plan d'action

Le plan d'action (température 0,5) s'appuie sur votre secteur, votre ville et les sources principales observées.

Filtres déterministes

Après génération, des filtres déterministes suppriment toute mention d'un moteur non mesuré dans le rapport.

Résumé exécutif

Le résumé exécutif en 5 lignes est calculé directement à partir des données, pas par un modèle de langage.

7. Ce que nous ne mesurons pas (encore)

Nous préférons énoncer nos limites clairement.

8. Données et sécurité

Historique

Chaque rapport et chaque réponse brute sont conservés. Le tableau de bord compare chaque rapport au précédent (seuil de variation : 1 point ; 0,2 pour la position) et affiche les tendances sur les 12 derniers rapports.

Audit gratuit

L'audit gratuit du site pose 3 questions types à 2 moteurs (ChatGPT, Gemini), une fois chacune. La ville est obligatoire. C'est une indication, pas un rapport.

Sécurité

9. Versions

Version du 12 septembre 2026. Cette page change quand la méthode change.


Méthode validée par l'équipe AIVisib.

المنهجية

يقيس AIVisib ما إذا كانت محركات ChatGPT، Gemini، Perplexity، Claude توصي بمؤسستك. ننشر هذه الصفحة لتحكموا على أرقامنا بالدليل، لا بالكلام.

1. الأسئلة

كيف تُولَّد الأسئلة

تُولَّد الأسئلة لكل علامة تجارية من ثلاثة عناصر: قطاعها، مدينتها، لغاتها. وتُبنى القائمة على عدة مراحل.

  1. الأحياء. يقترح GPT-4o أحياء المدينة. يُتحقق من كل حي في OpenStreetMap (خدمة Nominatim، مع حصر البحث داخل المدينة). تُستبعد الأماكن غير المتحقق منها.
  2. المسودات. يكتب GPT-4o-mini (درجة الحرارة 0.9) أسئلة مرشحة، بزيادة 40 % عن الحاجة. تمزج المجموعة أسئلة عامة على مستوى المدينة مع أسئلة الذيل الطويل التي تذكر حيًا حقيقيًا أو حاجة محددة.
  3. حارس الأبجدية. لا تحتوي الأسئلة العربية على أي حرف لاتيني، ولا تحتوي الأسئلة اللاتينية على أي حرف عربي.
  4. المراجعة. يرفض GPT-4o (درجة الحرارة 0) الأسئلة غير الواقعية، أو الخارجة عن القطاع، أو التي تذكر مكانًا غير موجود في القائمة المتحقق منها.
  5. إزالة التكرار. يُرمَّز كل سؤال بنموذج text-embedding-3-small. إذا تجاوز تشابه جيب التمام بين سؤالين 0.85 عُدّا صياغتين لمعنى واحد، ويُحذف أحدهما.

تحكمكم

يمكنكم تعديل كل سؤال أو حذفه قبل الحفظ. لا يُقاس شيء دون موافقتكم على القائمة.

الأسئلة العامة وأسئلة الذيل الطويل

يوسم كل سؤال بـ«عام» (head، على مستوى المدينة) أو «ذيل طويل» (حي أو حاجة محددة). تُعرض المقاييس للنطاقين معًا.

2. المحركات وطريقة السؤال

المحركات والإعدادات

المحركالنموذج والإعدادات
ChatGPTواجهة OpenAI Responses API مع بحث الويب، حجم سياق البحث «low»، موقع تقريبي مضبوط على مدينتكم وبلدكم
Geminiنموذج Gemini 2.5 Flash مع تأريض Google Search، درجة الحرارة 0.6
Perplexityنموذج Sonar، بحث ويب مباشر، درجة الحرارة 0.6
Claudeنموذج Claude Haiku 4.5 مع بحث الويب (بحثان على الأكثر)، درجة الحرارة 0.6، سقف الإخراج 1024 رمزًا

التعليمة نفسها لكل المحركات

تتلقى المحركات الأربعة موجه النظام المحايد نفسه: أجب بشكل طبيعي، اذكر مؤسسات حقيقية، أجب بلغة السؤال.

الحالة المحايدة

لا توجد ذاكرة، ولا تخصيص، ولا حساب مسجل الدخول. يبدأ كل سؤال من حالة نظيفة، قريبة مما يراه مستخدم جديد.

الجولات والوتيرة

يُطرح كل سؤال 3 مرات على كل محرك، كل أسبوع. لعلامة تجارية نموذجية، تعطي 16 سؤالًا × 4 محركات × 3 جولات 192 إجابة لكل تقرير.

تُنفذ الطلبات بالتوازي (6 في الوقت نفسه)، مع 3 محاولات إضافية عند الأخطاء المؤقتة.

متى نرفض إصدار التقرير

إذا نجح أقل من 50 % من الطلبات، لا يصدر أي تقرير. لا ننشر أبدًا نسبة 0 % زائفة. يُعرض المحرك الذي لم تنجح له أي إجابة بعبارة «غير مقيس»، لا بنسبة 0 %.

3. كيف نحتسب الذكر

المحلل

يقرأ GPT-4o-mini كل إجابة بدرجة حرارة 0. ويعيد JSON منظمًا: ذُكرت العلامة (نعم/لا)، الرتبة من 1 إلى 10 بين المؤسسات المذكورة، المنافسون المتابَعون المذكورون، علامات أخرى، المصادر المستشهد بها، والانطباع (إيجابي، محايد، سلبي).

حارسان حتميان

لا يُعتمد على مخرجات المحلل وحدها. تُطبق بعده قاعدتان.

  1. الوجود الحرفي. يجب أن يظهر اسم العلامة حرفيًا في نص الإجابة. وإلا يُستبعد الذكر.
  2. حارس الأسماء المتشابهة. يتلقى المحلل هوية المؤسسة: القطاع، المدينة، البلد، والموقع الإلكتروني إن قُدّم. الذكر الذي يشير بوضوح إلى مؤسسة أخرى تحمل الاسم نفسه في مكان آخر لا يُحتسب.

المنافسون

يُحتسب المنافس المتابَع مرة واحدة على الأكثر في كل إجابة، مهما تكرر ذكره.

4. المقاييس وصيغها

الظهور

الظهور = الإجابات التي تذكر العلامة ÷ الإجابات المقيسة × 100.

يُحسب إجمالًا، ولكل محرك، ولكل سؤال، ولكل نطاق (عام / ذيل طويل). الظهور لكل لغة هو متوسط ظهور أسئلة تلك اللغة.

حصة توصيات الذكاء الاصطناعي

الحصة = الإجابات التي تستشهد بالعلامة ÷ مجموع الاستشهادات بالعلامة ومنافسيها المتابَعين × 100.

تُحسب هذه الحصة فقط بين المنافسين الذين تتابعونهم. وهي ليست حصة من السوق كله.

الموضع المتوسط

الموضع المتوسط = متوسط رتبة العلامة في الإجابات التي تُذكر فيها. الرقم 1 يعني أن العلامة ذُكرت أولًا. إذا لم تُذكر العلامة أبدًا، تكون القيمة فارغة، لا 0.

الانطباع

الانطباع = متوسط 100 (إيجابي)، 50 (محايد)، 0 (سلبي)، على الإجابات التي تُذكر فيها العلامة.

أهم المصادر

أهم المصادر = تكرار النطاقات التي تستشهد بها المحركات. تُحتسب الروابط المستشهد بها فعلًا فقط. تُحل روابط إعادة التوجيه إلى نطاقها النهائي.

5. الدقة والثقة

لماذا تتغير الإجابات

قد ينتج السؤال نفسه، إذا طُرح مرتين، إجابتين مختلفتين. هذا طبيعي في هذه المحركات. لذلك نطرح كل سؤال 3 مرات ونرفق النتائج بفاصل ثقة.

لكل سؤال: فاصل Wilson

لكل سؤال، نحسب فاصل Wilson بمستوى 95 % (z = 1.96) على معدل الذكر. الثقة = 100 × (1 − عرض الفاصل). الفاصل الضيق يعني نتيجة مستقرة.

لكل تقرير: إعادة المعاينة (bootstrap)

للنتيجة الإجمالية، نعيد معاينة الأسئلة 1000 مرة مع الإرجاع (bootstrap، ببذرة ثابتة 20260830، فتكون النتيجة قابلة لإعادة الإنتاج). ونحسب النتيجة لكل عينة.

العرض = 2 × 1.96 × الانحراف المعياري للنتائج المعاد معاينتها. الثقة = 100 × (1 − العرض).

لماذا يُعرض ± على مستوى التقرير

يصف الرمز ± المعروض في لوحة التحكم نتيجة التقرير، لا سؤالًا واحدًا. السؤال الواحد يحوي إجابات أقل من أن تعطي ± ذا معنى وحده. يعكس الفاصل على مستوى التقرير مقدار تحرك النتيجة لو كانت مجموعة الأسئلة مختلفة قليلًا.

6. نصوص التقرير ومنع الهلوسة

التحليلات

يكتب التحليلات GPT-4o-mini (درجة الحرارة 0.4). تُكتب فقط من الأرقام المحسوبة، وفقط عن المحركات المقيسة.

التحقق

تراجع جولة ثانية (درجة الحرارة 0) كل اسم محرك وكل رقم في النص مقابل البيانات. عند وجود خطأ، يُعاد توليد النص مرة واحدة.

خطة العمل

ترتكز خطة العمل (درجة الحرارة 0.5) على قطاعكم، ومدينتكم، وأهم المصادر الملاحَظة.

مرشحات حتمية

بعد التوليد، تحذف مرشحات حتمية أي ذكر لمحرك لم يُقَس في التقرير.

الملخص التنفيذي

يُحسب الملخص التنفيذي المكون من 5 أسطر مباشرة من البيانات، لا بواسطة نموذج لغوي.

7. ما لا نقيسه (بعد)

نفضل ذكر حدودنا بوضوح.

8. البيانات والأمان

السجل

يُحفظ كل تقرير وكل إجابة خام. تقارن لوحة التحكم كل تقرير بالسابق (عتبة التغير: نقطة واحدة؛ 0.2 للموضع) وتعرض الاتجاهات على آخر 12 تقريرًا.

التدقيق المجاني

يطرح التدقيق المجاني على الموقع 3 أسئلة نموذجية على محركين (ChatGPT، Gemini)، مرة واحدة لكل منهما. المدينة إلزامية. وهو مؤشر، لا تقرير.

الأمان

9. الإصدارات

إصدار 12 سبتمبر 2026. تتغير هذه الصفحة عندما تتغير المنهجية.


المنهجية معتمدة من فريق AIVisib.