KI-Sichtbarkeit·23. September 2026·10 Min. Lesezeit
Wir haben dieselbe Studie zweimal gemessen. Acht von 19 Agenturen wechselten den Rang – bewegt hat sich keine.
Am 8. September haben wir ein Ranking US-amerikanischer GEO-Agenturen veröffentlicht, gebaut aus 198 KI-Antworten. Die naheliegende Frage bei so einem Ranking ist, ob es stillhält. Also haben wir dieselbe Messung ein zweites Mal durchgeführt, über einen späteren Zeitraum, der sich mit dem ersten an keinem einzigen Tag überschneidet, und beide nebeneinandergelegt. Acht der neunzehn Agenturen haben die Position gewechselt, Platz eins und zwei haben getauscht. Und keine einzige hat sich um einen Betrag verschoben, den Stichproben von 168 und 90 Antworten vom Zufall unterscheiden können. Wer Kunden KI-Sichtbarkeit reportet, hat genau hier sein Problem: im Abstand zwischen dem, was das Diagramm zeigt, und dem, was die Daten tragen.
Von Philipp Enders·Gründer, CrunchJunkie·LinkedInEntwickelt die Reporting- und KI-Sichtbarkeits-Tools, mit denen diese Analyse erstellt wurde.
Kurz gefasst
Zwei Zeiträume ohne gemeinsame Tage: 4. bis 8. September und 14. bis 23. September. Dieselben sechs Einkäuferfragen, dieselben zwei Engines, dieselben neunzehn Agenturen. Jede Agentur wurde in einem Teil von 168 Antworten im ersten Zeitraum genannt und in einem Teil von 90 im zweiten.
Acht Agenturen wechselten dazwischen den Rang. iPullRank fiel von eins auf zwei und hatte dabei 0,2 Prozentpunkte verloren. Siege Media übernahm Platz eins mit einem Plus von 4,4. First Page Sage stieg von neun auf sechs. Yes Optimist rutschte von dreizehn auf vierzehn.
Keine dieser Bewegungen lässt sich vom Rauschen der Stichprobe trennen. Bei allen neunzehn Agenturen überschneidet sich die 95-%-Spanne des ersten Zeitraums mit der des zweiten. Die größte rohe Veränderung der Tabelle, die 6,5 Punkte von Directive, liegt bequem in dem Bereich, den eine Stichprobe dieser Größe auch dann produziert, wenn überhaupt nichts passiert ist.
Dieselben neunzehn Agenturen, zweimal gemessen
Lesen Sie die Tabelle als zwei voneinander unabhängige Schätzungen derselben Größe, nicht als Vorher und Nachher. Die Spannen sind 95-%-Wilson-Intervalle: der Bereich, in dem der wahre Wert plausibel liegt, gemessen an der Zahl der Antworten, die dahinterstehen. Überschneiden sich die beiden Spannen einer Agentur, ist der Unterschied zwischen ihren Zeiträumen nicht belegt.
Der zweite Zeitraum ist kleiner, 90 Antworten gegen 168, seine Spannen sind deshalb breiter. Das ist kein Mangel des zweiten Zeitraums, sondern schlicht das, was weniger Antworten hergeben. PP steht für Prozentpunkte.
Anteil der KI-Antworten, die die jeweilige Agentur nennen, gemessen in zwei Zeiträumen ohne gemeinsame Tage. ChatGPT und Claude zusammengefasst, sechs Einkäuferfragen, Markt USA.
Anteil der KI-Antworten, die die jeweilige Agentur nennen, gemessen in zwei Zeiträumen ohne gemeinsame Tage. ChatGPT und Claude zusammengefasst, sechs Einkäuferfragen, Markt USA.
Acht Rangwechsel – und den Rang liest jeder zuerst
Niemand schlägt ein Kundenreporting auf und studiert ein Konfidenzintervall. Man schaut auf die Reihenfolge, und die Reihenfolge ist das Instabilste auf der Seite, weil sie aus einem stetigen Wert eine Position macht und den Abstand dabei wegwirft.
Am oberen Ende der Tabelle: Im ersten Zeitraum führte iPullRank mit 62 von 168 Antworten, Siege Media folgte mit 58. Im zweiten führte Siege Media mit 35 von 90, iPullRank folgte mit 33. Vier Antworten trennten sie beim ersten Mal, zwei beim zweiten. Eine einzige Antwort, die an einem Tag anders ausfällt, hätte es wieder gedreht.
Das ist keine Geschichte darüber, wie Siege Media iPullRank die Führung abnimmt. Es ist ein Abstand von zwei Antworten, der als Wechsel der Marktführerschaft berichtet wird. Weiter unten gilt dasselbe: Der Dreisprung von First Page Sage besteht darin, dass aus 27 von 168 nun 19 von 90 geworden sind – zwei Schätzungen, deren Spannen einander fast vollständig überdecken.
Wirklich auseinander liegen nur die, die schon vorher weit auseinanderlagen. iPullRank gegen Foundation Marketing ist in beiden Zeiträumen ein echter Abstand. iPullRank gegen Siege Media in keinem von beiden.
Wie groß eine Veränderung sein muss, damit sie etwas bedeutet
Nützlich wird dieser Befund als Zahl, die Sie auf Ihr eigenes Reporting anwenden können. Für eine Marke bei etwa 30 % Sichtbarkeit steht hier, wie viele Antworten jeder Zeitraum braucht, damit sich eine Veränderung einer bestimmten Größe vom Zufall trennen lässt – bei den üblichen 95 % Konfidenz und 80 % Teststärke.
Die erste Zeile ist die entscheidende. Fünf Punkte nachzuweisen verlangt rund 1.377 Antworten je Zeitraum. Bei der Taktung dieses Projekts – sieben Fragen, zweimal täglich, auf zwei Engines, also 28 Antworten pro Tag – sind das etwa sieben Wochen je Zeitraum und vierzehn Wochen für einen Vergleich. In dieser Taktung berichtet niemand in diesem Markt. Wir auch nicht.
Die praktische Lesart ist nicht, dass Sie vierzehn Wochen brauchen. Sie lautet: Die Bewegung in einem wöchentlichen KI-Sichtbarkeitsreport ist fast vollständig Rauschen, und sie als Leistung auszuweisen ist eine Behauptung, die die Daten nicht tragen.
Antworten, die jeder Zeitraum braucht, um eine Veränderung ausgehend von 30 % nachzuweisen. Zwei-Stichproben-Test, 95 % Konfidenz, 80 % Teststärke. Die Tage unterstellen 28 Antworten pro Tag.
Um eine Veränderung von … nachzuweisen
… braucht jeder Zeitraum
… das sind etwa
5 Punkte, 30 % auf 35 %
1.377 Antworten
7 Wochen
10 Punkte, 30 % auf 40 %
356 Antworten
13 Tage
15 Punkte, 30 % auf 45 %
163 Antworten
6 Tage
20 Punkte, 30 % auf 50 %
93 Antworten
3 Tage
Antworten, die jeder Zeitraum braucht, um eine Veränderung ausgehend von 30 % nachzuweisen. Zwei-Stichproben-Test, 95 % Konfidenz, 80 % Teststärke. Die Tage unterstellen 28 Antworten pro Tag.
Die Engines sind sich uneiniger als die Wochen
Über den zusammengefassten Zeitraum vom 4. bis 23. September lieferte jede Engine 129 Antworten je Agentur. Teilt man dieselben Antworten nach Engine auf, entstehen Unterschiede, gegen die alles verblasst, was der Kalender hergegeben hat.
Seer Interactive wurde in 5 von Claudes 129 Antworten genannt und in 36 von ChatGPTs. NoGood: 11 gegen 38. Omniscient Digital läuft andersherum, 50 gegen 28. Diese Abstände sind groß genug, um den Stichprobenumfang zu überstehen – was für keine der Bewegungen von Woche zu Woche galt.
Wenn sich also eine Zahl zur KI-Sichtbarkeit bewegt und Sie wissen wollen, warum, ist die Zusammensetzung der Engines der bessere erste Verdächtige als der Markt. Eine Engine dazuzunehmen oder wegzulassen, oder ein Anbieter, der das Modell hinter einem Produktnamen austauscht, verschiebt einen gemischten Wert weiter als jede realistische Veränderung daran, wie oft jemand tatsächlich empfohlen wird. Warum sich die Engines unterscheiden, haben wir an anderer Stelle ausführlich beschrieben; hier ist derselbe Effekt einmal gegen das Grundrauschen vermessen.
Antworten, die die jeweilige Agentur nennen, nach Engine, 4. bis 23. September 2026. Jede Engine lieferte 129 Antworten je Agentur. Die acht größten Unterschiede.
Agentur
Claude (von 129)
ChatGPT (von 129)
Unterschied
Seer Interactive
5 (3,9 %)
36 (27,9 %)
24,0 PP Richtung ChatGPT
NoGood
11 (8,5 %)
38 (29,5 %)
21,0 PP Richtung ChatGPT
iPullRank
35 (27,1 %)
60 (46,5 %)
19,4 PP Richtung ChatGPT
Omniscient Digital
50 (38,8 %)
28 (21,7 %)
17,1 PP Richtung Claude
Go Fish Digital
18 (14,0 %)
30 (23,3 %)
9,3 PP Richtung ChatGPT
Yes Optimist
15 (11,6 %)
4 (3,1 %)
8,5 PP Richtung Claude
First Page Sage
27 (20,9 %)
19 (14,7 %)
6,2 PP Richtung Claude
Bay Leaf Digital
9 (7,0 %)
1 (0,8 %)
6,2 PP Richtung Claude
Antworten, die die jeweilige Agentur nennen, nach Engine, 4. bis 23. September 2026. Jede Engine lieferte 129 Antworten je Agentur. Die acht größten Unterschiede.
Was wir in ein Kundenreporting schreiben würden
Drei Änderungen, von denen keine ein anderes Tool verlangt.
Nennen Sie die absolute Zahl neben der Quote. „Genannt in 33 von 90 Antworten“ lädt zur richtigen Rückfrage ein, „36,7 %“ nicht. Wer den Nenner sieht, kann sich selbst ausrechnen, dass ein Ausschlag von zwei Antworten kein Trend ist.
Zeichnen Sie die Unsicherheit ins Diagramm. Ein Balken mit Spanne lässt sich schwerer überinterpretieren als einer ohne, und wenn sich die Spannen zweier Wettbewerber überschneiden, ist die ehrliche Aussage, dass sie gleichauf liegen – nicht, dass einer vorn ist.
Berichten Sie keine Rangwechsel von Woche zu Woche. Berichten Sie Quote, Anzahl und Spanne, und lassen Sie die Reihenfolge sein, was sie ist. Fragt ein Kunde, warum sich die Reihenfolge geändert hat, lautet die Antwort meistens: Sie hat sich in keinem Sinn geändert, auf den man reagieren sollte.
Nichts davon macht die Zahl weniger nützlich. Es macht die Aussagen, die an ihr hängen, überprüfbar – und das ist über die Laufzeit eines Retainers mehr wert.
Was hier nicht steht
Hier steht nicht, dass KI-Sichtbarkeit nicht messbar wäre. Die Unterschiede zwischen den Engines weiter oben sind bei diesem Stichprobenumfang real und groß, und ebenso real ist der Abstand zwischen einer Agentur, die in einem Drittel der Antworten genannt wird, und einer, die gar nicht vorkommt. Grobe Befunde kommen auf ein paar hundert Antworten sauber durch. Feine nicht.
Hier steht auch nicht, dass das September-Ranking falsch war. Beide Zeiträume setzen im Großen und Ganzen dieselben fünf Agenturen nach oben und dieselben sieben nach unten. Die Struktur hielt. Bewegt hat sich nur die Reihenfolge darin.
Und es lässt sich nicht über diesen Aufbau hinaus verallgemeinern. Neunzehn Agenturen, sechs Fragen, zwei Engines, ein Markt, zwanzig Tage. Eine Kategorie mit mehr Kandidaten oder mit Berichterstattung, die sich wirklich bewegt, kann sich anders verhalten. Die Rechnung zum Stichprobenumfang ist allerdings nicht agenturspezifisch. Sie gilt für jede Marke, deren Sichtbarkeit als Anteil an Antworten gemessen wird – also für alle.
Häufige Fragen
Bei den Stichprobengrößen, auf denen die meisten Reports zur KI-Sichtbarkeit beruhen – ein paar hundert Antworten oder weniger – sind es grob 13 bis 20 Prozentpunkte. Für eine Marke bei etwa 30 % Sichtbarkeit braucht der Nachweis einer Veränderung von 5 Punkten bei 95 % Konfidenz und 80 % Teststärke rund 1.377 Antworten in jedem der beiden verglichenen Zeiträume. Bei 198 Antworten liegt die kleinste nachweisbare Veränderung bei etwa 13,5 Punkten, bei 90 Antworten bei etwa 20.
Weil der Rang eine Ordinalsicht auf einen stetigen Wert ist und den Abstand wegwirft. Zwei Agenturen, die zwei Antworten von neunzig trennen, tauschen die Plätze regelmäßig, ohne dass eine von beiden etwas gewonnen oder verloren hätte. In dieser Studie wechselten acht von neunzehn Agenturen den Rang zwischen zwei Zeiträumen, in denen sich keine einzige Agentur nachweisbar verändert hat.
Nur wenn dadurch mehr Antworten in den verglichenen Zeitraum fallen. Täglich zu scannen und dann einen Tag mit dem nächsten zu vergleichen liefert eine kleinere Stichprobe und einen unruhigeren Wert, keinen besseren. Es helfen mehr Fragen, mehr Durchläufe je Frage und der Vergleich längerer Zeiträume statt zweier kurzer nebeneinander.
Das Niveau gern wöchentlich, wenn der Kunde es sehen möchte. Die Veränderung zur Vorwoche aber nicht als Leistung ausweisen, denn bei einem wöchentlichen Stichprobenumfang ist davon fast nichts echt. Ein monatlicher oder quartalsweiser Vergleich über einen zusammengefassten Zeitraum trägt sehr viel mehr Information und sehr viel weniger Rauschen.
Beide, jeweils für ihre eigenen Nutzer. Über je 129 Antworten wurde Seer Interactive von ChatGPT in 36 Antworten genannt und von Claude in 5, während Omniscient Digital von Claude in 50 und von ChatGPT in 28 genannt wurde. Keines davon ist ein Fehler. Ein gemischter Wert verdeckt diese Aufteilung, deshalb lohnt es sich, die Zahlen je Engine daneben sichtbar zu lassen.