Transparenz
So messen wir
Kaum ein Anbieter legt offen, wie seine Zahlen entstehen. Wir schon, auch da, wo unsere Messung Grenzen hat. Hier liest du, wie CiteKit misst, was die Zahlen bedeuten und wo du sie mit Vorsicht lesen solltest.
1. Warum wir jede Frage mehrmals stellen
KI-Programme antworten nicht jedes Mal gleich, selbst auf dieselbe Frage. Würden wir nur einmal fragen und deine Marke käme in dieser einen Antwort zufällig nicht vor, sähe das nach einem Problem aus — dabei wäre es nur eine Momentaufnahme. Deshalb stellen wir jede Frage mehrmals: bei wöchentlicher Messung dreimal. Bei täglicher Messung fragen wir ChatGPT und die Google-KI-Übersicht jeden Tag, was über die Woche noch mehr Durchgänge ergibt. So verzerrt ein einzelner Ausreißer nicht gleich das ganze Bild.
2. Was der Vertrauensbereich bedeutet
Zu jeder Sichtbarkeits-Zahl zeigen wir dir eine Bandbreite, den sogenannten Vertrauensbereich (statistisch: das Wilson-Intervall). Wenn wir schreiben „28 % (24–33 %)", heißt das: Der wahre Wert liegt sehr wahrscheinlich in diesem Bereich. Die Zahl wird mit der Zeit also genauer, nicht schöner gerechnet.
Antworten auf dieselbe Frage ähneln sich stark. Die KI findet dafür meist dieselben Seiten im Internet. Wie breit die Bandbreite ist, hängt deshalb vor allem davon ab, wie viele verschiedene Fragen du stellst. Mehr verschiedene Fragen machen die Zahl genauer als mehr Wiederholungen derselben Frage. Unsere Bandbreite rechnet das ehrlich mit ein. Sie ist deshalb breiter als bei einer Rechnung, die jede Antwort für sich zählt.
3. Wir messen an der Schnittstelle der KI-Dienste — nicht in ihrer App
Wir stellen unsere Fragen über die technische Schnittstelle der KI-Dienste, nicht in der App, die du auf deinem Handy oder im Browser nutzt. Antworten über die Schnittstelle können kürzer ausfallen und seltener Quellen nennen als in der App. Das betrifft jeden Anbieter, der KI-Sichtbarkeit auf diese Weise misst. „Die eine richtige Antwort" der KI können wir deshalb nicht abbilden. Wir vergleichen stattdessen deinen Verlauf über die Zeit und deine Werte mit denen deiner Wettbewerber — immer unter denselben Bedingungen, damit der Vergleich fair bleibt.
4. Wir messen mit eingeschalteter Websuche
KI-Dienste beantworten Fragen nach Anbietern und Empfehlungen mit einer Suche im Netz. Deshalb stellen wir jede Frage mit eingeschalteter Websuche — so entstehen die Antworten aus dem aktuellen Netz, nicht aus dem älteren Gedächtnis der KI. Nur so lässt sich auch messen, welche Seiten die KI als Quelle nennt — und ob deine dabei ist.
Dabei nutzt jeder Dienst eine eigene Suche und findet andere Seiten. Dieselbe Frage kann bei ChatGPT ganz andere Quellen liefern als in der Google-KI-Übersicht. Deshalb messen wir jeden Dienst einzeln, statt die Ergebnisse in einen Topf zu werfen.
5. Die zwei KI-Dienste und unsere deutschen Einstellungen
Wir fragen bei zwei KI-Diensten nach: ChatGPT und der Google-KI-Übersicht, also der KI-Antwort, die Google über den Suchergebnissen zeigt. Wir stellen alle Fragen auf Deutsch und sagen den Diensten, aus welchem Land wir fragen: Deutschland, Österreich oder die Schweiz, je nachdem, welchen Markt du für deine Marke gewählt hast. So sind die Antworten möglichst nah an dem, was auch deine Kundinnen und Kunden in Deutschland, Österreich oder der Schweiz zu sehen bekommen.
6. Wie sich der Umfang deiner Messung ergibt
Der Umfang einer Messung ergibt sich aus deinen Fragen, mal den zwei KI-Diensten, mal der Anzahl der Wiederholungen. Mehr Fragen bedeuten also mehr Einzelmessungen. Deshalb zählen unsere Tarife Fragen, nicht KI-Dienste: Beide sind in jedem Tarif enthalten, ohne Aufpreis.
7. Drei Arten von Fragen — und was wir wo mitzählen
Deine Fragen gehören zu drei Arten: Marken-Fragen enthalten deinen Namen. Kategorie-Fragen fragen nach den besten Anbietern deiner Branche, Problem-Fragen nach der Lösung eines Problems — beide ohne deinen Namen. Diese beiden nennen wir neutrale Fragen.
In die Sichtbarkeit, die Prominenz und den Wettbewerbs-Vergleich zählen nur neutrale Fragen. Denn wer die KI nach deinem Namen fragt, bekommt fast immer eine Antwort mit deinem Namen. Marken-Fragen würden deine Sichtbarkeit künstlich erhöhen — und im Vergleich mit deinen Wettbewerbern hättest du immer einen Heimvorteil.
Marken-Fragen werten wir getrennt aus, unter „Was die KI über dich sagt": mit welcher Tonalität die KI über dich spricht und ob sie deine Seiten dabei als Quelle verlinkt.
Zu jeder Einordnung halten wir fest, warum sie so ausfällt: einen kurzen Satz dazu, was die Antwort über dich sagt, und die wörtliche Stelle aus der Antwort, auf der die Einordnung beruht. Findet sich diese Stelle nicht wörtlich in der Antwort wieder, verwerfen wir sie — lieber keine Fundstelle als eine, die du nicht nachlesen kannst.
„Kritisch" heißt dabei nicht „schlechte Kritik". Es heißt: die KI nennt einen Nachteil oder eine Einschränkung. Und es bleibt die Einschätzung einer einzelnen Antwort, kein Urteil über deine Marke — deshalb zeigen wir dir immer die Stelle dazu.
8. Wie wir unsere Einschätzungen benennen
Damit du eine Zahl nicht selbst einordnen musst, geben wir dir zu jeder Kennzahl eine Einschätzung in Worten. Die Schwellenwerte dafür sind fest und für alle Marken gleich:
| Kennzahl | Sehr gut | Solide | Ausbaufähig | Schwach |
|---|---|---|---|---|
| Sichtbarkeit (wie oft die KI dich nennt) | ab 50 % | ab 25 % | ab 10 % | darunter |
| Zitate (wie oft deine Seiten als Quelle auftauchen) | ab 30 % | ab 10 % | darunter | – |
| Prominenz (wie weit vorne du in der Antwort stehst) | ab 80 von 100 | ab 50 von 100 | darunter | – |
| Tonalität (Anteil kritischer Antworten) | unter 5 % | unter 15 % | unter 30 % | ab 30 % |
Auch deinen Platz im Vergleich mit deinen Wettbewerbern ordnen wir nach festen Regeln ein: Platz 1 ist sehr gut, die vordere Hälfte solide, dahinter ausbaufähig, der letzte Platz schwach.
Bei weniger als 20 Messungen oder weniger als 5 Fragen ohne deinen Namen bekommst du zu deiner Sichtbarkeit noch keine Einschätzung. Lieber keine Aussage als eine, die aus zu wenigen Daten Verlässlichkeit vorgaukelt.
9. Wo unsere Messung an Grenzen stößt
- Wir fragen die KI-Dienste über ihre Schnittstelle, nicht in ihrer App. Die Antworten können deshalb leicht von dem abweichen, was einzelne Nutzerinnen und Nutzer dort sehen.
- Schwankungen zwischen einzelnen Tagen sind normal, kein Fehler in der Messung. Deshalb zeigen wir dir immer eine Bandbreite (den Vertrauensbereich) statt einer einzelnen Zahl.
- Zwei fast gleiche Fragen zählen für die Genauigkeit fast wie eine. Die KI beantwortet sie nahezu gleich. Wenn du eine solche Frage anlegst, weisen wir dich darauf hin.
- Wir können dir nicht garantieren, wie oft eine KI dich künftig nennt — oder ob überhaupt. Unsere Zahlen sind Messwerte, keine Versprechen.