Il est facile de faire dire ce que l’on veut aux chiffres de « visibilité IA » (AI visibility) : interroger un modèle une fois, tomber sur une réponse favorable et la mettre dans un rapport. Nous ne travaillons pas ainsi. Cette page explique comment Brandometer mesure ce que les assistants IA disent des marques, pourquoi nous publions des taux de mention plutôt que des « classements », et ce que nous refusons de promettre.
Une seule réponse d’une IA ne prouve rien
Un modèle de langage génère du texte de façon probabiliste. À chaque étape, il choisit le mot suivant dans une distribution ; il ne va pas chercher une réponse toute faite. Posez deux fois la même question dans les mêmes conditions et vous obtiendrez deux réponses différentes. Aujourd’hui, le modèle nomme votre marque ; demain, il énumère trois concurrents et vous laisse de côté. Et pour le modèle, les deux réponses sont tout aussi « correctes ».
Un test unique est un tirage au hasard dans la distribution des réponses possibles. En tirer des conclusions revient à juger si une pièce est équilibrée sur un seul lancer. Tout outil qui annonce la « position sur ChatGPT » d’une marque à partir d’une seule question ne mesure que du bruit.
Des séries d’exécutions indépendantes en sessions vierges
Au lieu de poser la question une seule fois, nous lançons une série : chaque prompt est soumis plusieurs fois à chaque moteur. Chaque exécution doit être une observation indépendante ; elle se déroule donc dans une session vierge :
- Une nouvelle conversation sans historique, pour que les réponses précédentes n’influencent pas les suivantes.
- Ni personnalisation, ni mémoire, ni profil utilisateur, pour que le modèle ne s’adapte pas à la personne qui pose la question.
- La même formulation du prompt et les mêmes réglages d’une mesure à l’autre. Sans cela, les semaines ne sont pas comparables entre elles.
C’est une simplification délibérée. Les utilisateurs réels reçoivent des réponses personnalisées, que nous ne pouvons pas reproduire. Une session vierge fournit une base de référence reproductible, identique pour tous : ce que le modèle dit par défaut, lorsqu’il ne sait rien de la personne qui l’interroge.
D’où viennent les réponses
Nous envoyons chaque prompt à l’interface développeur officielle (API) du moteur, recherche web activée. L’appel utilise la même famille de modèles que l’application grand public, sans historique de conversation ni personnalisation.
DeepSeek fait exception. Son interface développeur ne propose pas de recherche web : pour DeepSeek, nous mesurons donc ce que le modèle sait lui-même de votre marque.
Google AI Overviews (Aperçus IA) ne dispose pas d’interface développeur. Nous lisons ces aperçus sur la page de résultats publique de Google, pour le pays et la langue de votre projet. Google n’affiche pas d’aperçu IA pour toutes les requêtes. Lorsqu’il n’y en a pas, l’observation est enregistrée comme « sans réponse IA » : elle est exclue des taux, et les crédits correspondants sont remboursés.
Chaque projet a une langue et, en option, un pays. Les prompts sont posés dans la langue du projet. Lorsque l’interface d’un moteur accepte la localisation approximative de l’utilisateur pour la recherche web, nous lui transmettons le pays du projet. Certains moteurs ne proposent pas ce réglage. Pour ceux-là, la localisation passe par le prompt : elle repose sur la langue du prompt et sur une courte instruction neutre, et non sur une localisation réelle.
Les moteurs que nous suivons actuellement, ainsi que le prix d’un test sur chacun d’eux, figurent sur la page des tarifs.
Des taux de mention plutôt que des « classements »
Une réponse IA n’a pas de positions au sens du SEO. Une marque figure dans le texte généré ou n’y figure pas, et cela change d’une exécution à l’autre. Notre indicateur principal est donc un taux : la part des réponses d’une série qui mentionnent la marque, et la part qui la recommandent explicitement. « La marque est mentionnée dans 60 % des réponses de ChatGPT à cette question » est une affirmation qui a du sens et que vous pouvez vérifier. « La marque est classée deuxième sur ChatGPT » n’en est pas une.
Intervalles de confiance de Wilson à 95 %
Un taux calculé sur une courte série est lui-même soumis au hasard : 6 mentions sur 10 exécutions ne signifient pas exactement 60 %. Chaque taux est donc accompagné d’un intervalle de confiance à 95 %, calculé selon la méthode de Wilson. En clair, c’est la fourchette dans laquelle le taux réel se situe très probablement. Pour 6 sur 10, cette fourchette va d’environ 31 % à 83 %.
Nous n’avons pas choisi la méthode de Wilson par hasard. Contrairement à l’approximation normale naïve, elle se comporte correctement sur les séries courtes et pour les taux proches de 0 % et de 100 %, deux cas fréquents dans le suivi de marque, où une marque n’apparaît dans presque aucune réponse ou dans presque toutes.
En pratique : une hausse de 40 % à 50 % avec des intervalles qui se chevauchent n’est pas encore une progression. C’est du bruit. Nous affichons les intervalles pour que vous ne fondiez pas vos décisions sur des fluctuations aléatoires.
« Recommandée » ne veut pas dire « mentionnée »
« Le modèle a nommé la marque » et « le modèle a conseillé de choisir la marque » sont deux événements distincts, de valeur différente. Une mention qui ne fait que compléter une liste, une énumération neutre et une recommandation explicite (« Je choisirais X parce que… ») n’influencent pas de la même façon la décision d’un acheteur. Une simple recherche textuelle du nom de la marque ne permet pas de distinguer ces cas. Elle bute aussi sur les formes fléchies, les variantes orthographiques, la translittération et les entreprises homonymes sans aucun rapport.
C’est pourquoi chaque réponse est étiquetée, dans une étape distincte, par un classifieur LLM : la marque est-elle mentionnée, est-elle explicitement recommandée, et quels concurrents sont nommés à ses côtés.
La même étape enregistre la tonalité : la réponse parle-t-elle de votre marque de façon positive, neutre ou négative. La tonalité est évaluée pour votre marque en particulier, et non pour la réponse dans son ensemble.
Le classifieur est lui aussi un modèle, et il peut se tromper. Chaque étiquette peut donc être vérifiée dans le texte brut de la réponse (voir ci-dessous), et nous contrôlons régulièrement à la main des échantillons de l’étiquetage.
Le modèle à l’origine de chaque réponse est consigné
« ChatGPT » ou « Gemini » n’est pas un modèle unique. C’est un nom de produit, et les modèles qui se trouvent derrière changent régulièrement. Un changement de modèle peut faire bouger vos indicateurs du jour au lendemain, sans aucune action de votre part. Pour chaque réponse, nous conservons donc le moteur et la version exacte du modèle qui l’a générée, et nous l’affichons à côté de la réponse. Si votre taux de mention bondit le jour d’une mise à jour du modèle, le mérite en revient à la mise à jour, et non à votre dernière publication : cette trace évite de confondre les deux.
Les réponses brutes complètes comme preuve
Chaque chiffre de Brandometer peut être retracé jusqu’aux données primaires. Nous conservons le texte intégral de chaque réponse, avec sa date, le moteur, la version du modèle et les sources citées. Tout taux, toute étiquette de tonalité, toute mention d’un concurrent peut être vérifié en ouvrant les réponses précises à partir desquelles il a été calculé. Ne vous fiez pas aux agrégats fournis sans données primaires, les nôtres compris.
Ce que nous ne promettons pas
Personne ne peut contrôler directement les réponses IA. Nous ne promettons donc pas, et ne promettrons jamais :
- « Un meilleur classement sur ChatGPT ». Il n’y a aucun classement sur ChatGPT, et personne ne peut garantir qu’une marque apparaîtra dans un texte généré de façon probabiliste. Quiconque donne une telle garantie n’est pas honnête avec vous.
- « Une présence garantie dans les réponses IA ». Personne n’a accès à l’intérieur du modèle d’un tiers.
- Des résultats immédiats. Les changements dans les sources se répercutent sur les réponses avec un délai de quelques jours à plusieurs mois, selon le moteur.
Ce que nous faisons : mesurer honnêtement l’état actuel, montrer les sources sur lesquelles les modèles s’appuient, et consigner ce qui change après vos actions, d’une manière qui distingue un effet réel du bruit et d’un changement de modèle. La visibilité ne peut être influencée qu’indirectement, par les sources, et le résultat est toujours probabiliste.
Limites de la méthodologie
Pour que le tableau soit complet, voici où s’arrête la méthode :
- Nous mesurons les réponses à votre jeu de prompts. C’est un échantillon, et non l’ensemble des formulations qu’imaginent les utilisateurs réels.
- Les sessions vierges écartent la personnalisation : un utilisateur donné peut obtenir une réponse différente.
- Les réponses proviennent des interfaces développeur, et non des applications grand public. La famille de modèles est la même, mais une application ajoute ses propres réglages, votre historique et votre localisation : la réponse affichée sur votre écran peut donc différer légèrement.
- Pour les moteurs sans réglage de localisation, celle-ci repose uniquement sur le prompt, un signal plus faible qu’une localisation réelle.
- Les taux issus d’une série d’exécutions sont des estimations statistiques assorties d’un intervalle, et non un recensement de tout ce que dit un moteur.
Nous pensons que des chiffres honnêtes assortis de réserves sont plus utiles que des chiffres flatteurs sans réserves. Si vous avez des questions sur la méthodologie, écrivez à support@brandometer.ai et nous en examinerons les détails avec vous.