Zahlen zur „KI-Sichtbarkeit“ (AI Visibility) lassen sich leicht so hinbiegen, dass sie zeigen, was man gerade sehen möchte: ein Modell einmal fragen, eine vorteilhafte Antwort erwischen und sie in einen Bericht setzen. So arbeiten wir nicht. Diese Seite erklärt, wie Brandometer misst, was KI-Assistenten über Marken sagen, warum wir Erwähnungsraten statt „Rankings“ ausweisen und was wir ausdrücklich nicht versprechen.
Eine einzelne KI-Antwort beweist nichts
Ein Sprachmodell erzeugt Text probabilistisch. Bei jedem Schritt wählt es das nächste Wort aus einer Wahrscheinlichkeitsverteilung; es ruft keine fertige Antwort ab. Stellen Sie dieselbe Frage zweimal unter denselben Bedingungen, und Sie erhalten zwei verschiedene Antworten. Heute nennt das Modell Ihre Marke, morgen zählt es drei Wettbewerber auf und lässt Sie weg – und für das Modell sind beide Antworten gleichermaßen „richtig“.
Ein einzelner Check ist eine zufällige Ziehung aus der Verteilung möglicher Antworten. Daraus Schlüsse zu ziehen ist, als wollte man nach einem einzigen Wurf beurteilen, ob eine Münze fair ist. Jedes Tool, das aus einer einzigen Abfrage die „Position in ChatGPT“ einer Marke ableitet, liefert Rauschen.
Serien unabhängiger Durchläufe in sauberen Sitzungen
Statt einmal zu fragen, führen wir eine Serie aus: Jeder Prompt (die Frage an die KI) wird jedem KI-System mehrfach gestellt. Jeder Durchlauf muss eine unabhängige Beobachtung sein und findet deshalb in einer sauberen Sitzung statt:
- Eine neue Unterhaltung ohne Verlauf, damit frühere Antworten spätere nicht beeinflussen.
- Keine Personalisierung, kein Gedächtnis, kein Nutzerprofil, damit sich das Modell nicht an die fragende Person anpasst.
- Derselbe Wortlaut des Prompts und dieselben Einstellungen von Messung zu Messung. Sonst lassen sich die Wochen nicht miteinander vergleichen.
Das ist eine bewusste Vereinfachung. Echte Nutzer erhalten personalisierte Antworten, und die können wir nicht nachbilden. Eine saubere Sitzung liefert eine reproduzierbare Ausgangsbasis, die für alle gleich ist: das, was das Modell standardmäßig sagt, wenn es nichts über die fragende Person weiß.
Woher die Antworten stammen
Wir senden jeden Prompt an die offizielle Entwicklerschnittstelle (API) des KI-Systems, mit eingeschalteter Websuche. Die Anfrage nutzt dieselbe Modellfamilie wie die Endnutzer-App, ohne Chatverlauf und ohne Personalisierung.
Eine Ausnahme ist DeepSeek. Dessen Entwicklerschnittstelle bietet keine Websuche; bei DeepSeek messen wir daher, was das Modell selbst über Ihre Marke weiß.
Für Google AI Overviews (KI-Übersichten) gibt es keine Entwicklerschnittstelle. Wir lesen sie von der öffentlichen Google-Ergebnisseite für das Land und die Sprache Ihres Projekts aus. Google zeigt nicht zu jeder Suchanfrage ein AI Overview an. Fehlt es, wird die Beobachtung als „keine KI-Antwort“ erfasst: Sie fließt nicht in die Raten ein, und die Credits dafür werden erstattet.
Jedes Projekt hat eine Sprache und optional ein Land. Prompts werden in der Projektsprache gestellt. Wo die Schnittstelle eines KI-Systems den ungefähren Standort des Nutzers für die Websuche entgegennimmt, übergeben wir das Projektland. Manche KI-Systeme bieten keine solche Einstellung. Bei ihnen erfolgt die Lokalisierung über den Prompt: Sie stützt sich auf die Sprache des Prompts und eine kurze neutrale Anweisung statt auf einen echten Standort.
Welche KI-Systeme wir derzeit erfassen und was ein Check bei jedem von ihnen kostet, steht auf der Preisseite.
Erwähnungsraten statt „Rankings“
Eine KI-Antwort kennt keine Positionen im Sinne von SEO. Eine Marke schafft es in den generierten Text oder eben nicht, und das ändert sich von Durchlauf zu Durchlauf. Unsere wichtigste Kennzahl ist deshalb eine Rate: der Anteil der Antworten einer Serie, die die Marke erwähnen, und der Anteil, der sie ausdrücklich empfiehlt. „Die Marke wird in 60 % der Antworten von ChatGPT auf diese Frage erwähnt“ ist eine sinnvolle Aussage, die sich überprüfen lässt. „Die Marke steht bei ChatGPT auf Platz zwei“ ist es nicht.
Wilson-Konfidenzintervalle (95 %)
Eine Rate, die aus einer kurzen Serie berechnet wird, unterliegt selbst dem Zufall: 6 Erwähnungen in 10 Durchläufen bedeuten nicht exakt 60 %. Deshalb geben wir zu jeder Rate ein 95 %-Konfidenzintervall an, berechnet nach der Wilson-Methode. Einfach gesagt ist das der Bereich, in dem die wahre Rate mit hoher Wahrscheinlichkeit liegt. Bei 6 von 10 reicht dieser Bereich von etwa 31 % bis 83 %.
Die Wilson-Methode haben wir aus gutem Grund gewählt. Anders als die naive Normalapproximation verhält sie sich auch bei kurzen Serien und bei Raten nahe 0 % und 100 % korrekt – beides ist im Marken-Monitoring häufig, wo eine Marke in fast keiner oder in fast jeder Antwort auftaucht.
In der Praxis: Ein Anstieg von 40 % auf 50 % bei überlappenden Intervallen ist noch kein Wachstum. Es ist Rauschen. Wir zeigen die Intervalle, damit Sie Ihre Entscheidungen nicht auf zufällige Schwankungen stützen.
„Empfohlen“ ist nicht dasselbe wie „erwähnt“
„Das Modell hat die Marke genannt“ und „das Modell hat geraten, die Marke zu wählen“ sind unterschiedliche Ereignisse von unterschiedlichem Wert. Eine Erwähnung, die nur eine Liste vervollständigt, eine neutrale Aufzählung und eine ausdrückliche Empfehlung („Ich würde X wählen, weil …“) beeinflussen die Kaufentscheidung auf unterschiedliche Weise. Eine einfache Textsuche nach dem Markennamen kann diese Fälle nicht auseinanderhalten. Sie stolpert außerdem über flektierte Formen, Schreibvarianten, Transliterationen und über gleichnamige Unternehmen, die nichts mit Ihnen zu tun haben.
Deshalb wird jede Antwort in einem separaten Schritt von einem Klassifikator auf Basis eines Sprachmodells (LLM) gekennzeichnet: ob die Marke überhaupt erwähnt wird, ob sie ausdrücklich empfohlen wird und welche Wettbewerber neben ihr genannt werden.
Im selben Schritt wird die Tonalität erfasst: ob die Antwort positiv, neutral oder negativ über Ihre Marke spricht. Die Tonalität wird gezielt für Ihre Marke bewertet, nicht für die Antwort als Ganzes.
Auch der Klassifikator ist ein Modell und kann sich irren. Deshalb lässt sich jede Kennzeichnung am Rohtext der Antwort überprüfen (siehe unten), und wir kontrollieren regelmäßig Stichproben der Kennzeichnung von Hand.
Das Modell hinter jeder Antwort ist dokumentiert
„ChatGPT“ oder „Gemini“ ist kein einzelnes Modell. Es ist ein Produktname, und die Modelle dahinter wechseln regelmäßig. Ein Modellwechsel kann Ihre Kennzahlen über Nacht verschieben, ohne dass Sie etwas getan haben. Deshalb speichern wir zu jeder Antwort das KI-System und die genaue Modellversion, die sie erzeugt hat, und zeigen beides neben der Antwort an. Springt Ihre Erwähnungsrate an dem Tag, an dem ein Modell aktualisiert wurde, dann geht das auf das Update zurück und nicht auf Ihre jüngste Veröffentlichung – und dank dieser Aufzeichnung wird beides nicht verwechselt.
Vollständige Rohantworten als Beleg
Jede Zahl in Brandometer lässt sich auf Primärdaten zurückführen. Wir speichern den vollständigen Text jeder Antwort zusammen mit Datum, KI-System, Modellversion und zitierten Quellen. Jede Rate, jede Tonalitätsbewertung und jede Erwähnung eines Wettbewerbers lässt sich überprüfen, indem Sie die konkreten Antworten öffnen, aus denen sie berechnet wurde. Vertrauen Sie keinen Aggregaten, die ohne Primärdaten daherkommen – auch unseren nicht.
Was wir nicht versprechen
Niemand kann KI-Antworten direkt steuern. Deshalb versprechen wir Folgendes nicht und werden es auch nie tun:
- „Bessere Rankings in ChatGPT“. Dort gibt es keine Rankings, und niemand kann garantieren, dass eine Marke in einem probabilistisch erzeugten Text auftaucht. Wer eine solche Garantie gibt, ist nicht ehrlich zu Ihnen.
- „Garantierte Platzierung in KI-Antworten“. Niemand hat Zugriff auf das Innere eines fremden Modells.
- Sofortige Ergebnisse. Änderungen in den Quellen erreichen die Antworten mit einer Verzögerung von Tagen bis Monaten, je nach KI-System.
Was wir tun: den aktuellen Stand ehrlich messen, die Quellen zeigen, auf die sich die Modelle stützen, und festhalten, was sich nach Ihren Maßnahmen ändert – und zwar so, dass sich ein echter Effekt von Rauschen und von einem Modellwechsel unterscheiden lässt. Sichtbarkeit lässt sich nur indirekt beeinflussen, über die Quellen, und das Ergebnis ist immer probabilistisch.
Grenzen der Methodik
Zum vollständigen Bild gehört auch, wo die Methode an ihre Grenzen stößt:
- Wir messen Antworten auf Ihr Prompt-Set. Es ist eine Stichprobe, nicht jede Formulierung, die echten Nutzern einfällt.
- Saubere Sitzungen blenden die Personalisierung aus: Ein einzelner Nutzer kann eine andere Antwort erhalten.
- Die Antworten kommen über Entwicklerschnittstellen, nicht über die Endnutzer-Apps. Die Modellfamilie ist dieselbe, aber eine App bringt eigene Einstellungen, Ihren Verlauf und Ihren Standort ein; die Antwort auf Ihrem eigenen Bildschirm kann daher leicht abweichen.
- Bei KI-Systemen ohne Standorteinstellung beruht die Lokalisierung allein auf dem Prompt – ein schwächeres Signal als ein echter Standort.
- Raten aus einer Serie von Durchläufen sind statistische Schätzungen mit einem Intervall, keine Vollerhebung all dessen, was ein KI-System sagt.
Wir sind überzeugt, dass ehrliche Zahlen mit Einschränkungen nützlicher sind als geschönte Zahlen ohne. Wenn Sie Fragen zur Methodik haben, schreiben Sie an support@brandometer.ai – wir gehen die Details mit Ihnen durch.