Laut iPullRank braucht ein Prompt im AI-Visibility-Tracking rund 100 Läufe, damit seine Erscheinungsrate auf ±10 Prozentpunkte genau ist, mit 5 Läufen sind es nur ±44 Punkte (bei einer Rate um 50 %). Nach einer KKP-Rechnung grenzt ein Promptset aus 20 Prompts mit je 20 Läufen die Gesamtrate auf rund ±4,9 Punkte ein, allerdings nur gegen die Streuung zwischen Läufen. Einen wahren Wert gibt es für KI-Sichtbarkeit laut iPullRank nicht, messbar ist die Precision, also wie eng wiederholte Messungen beieinanderliegen. Im Test auf Search Engine Land (02/2026) nannte das ausgeloggte ChatGPT über 100 Läufe desselben Prompts im Schnitt 44 Brands, in einer einzelnen Antwort rund 10. Läufe, Spanne, Erhebungsweg, Modus, Login-Status, Markt und Zeitraum gehören deshalb zu jeder Rate im Reporting.
Lässt sich KI-Sichtbarkeit überhaupt genau messen?
Präzise ja, im Sinne eines wahren Werts nicht. So argumentiert die US-Agentur iPullRank in einem Essay vom 17. September 2026: Es gibt weder den einen Nutzer noch die eine Antwort. Was ein KI-System antwortet, hängt von Modell, Modus, Retrieval (dem Abruf von Quellen), Zeitpunkt und Nutzer ab, und Systeme der generativen KI erzeugen jede Antwort neu. Jede Messung ist deshalb eine Stichprobe aus einer Verteilung möglicher Antworten.
Accuracy (Genauigkeit) beschreibt die Nähe einer Messung zum wahren Wert, Precision (Präzision) die Nähe wiederholter Messungen zueinander. Ohne wahren Wert bleibt laut Essay nur Precision: gleiche Bedingungen, gleiche Ablesung, bekannte Schwankung.
Der Essay vergleicht AI-Visibility-Tracking mit Wahlumfragen, deren Aussagekraft aus konstanter Methodik entsteht. Unter festen Bedingungen, etwa ausgeloggt, im selben Modus, Markt und Zeitraum, gibt es durchaus eine Erscheinungswahrscheinlichkeit. Sie lässt sich mit wiederholten Läufen samt Spanne schätzen.
Wie viele Läufe braucht ein Prompt für eine belastbare Rate?
Ein Prompt braucht rund 100 Läufe, damit seine Erscheinungsrate auf ±10 Prozentpunkte genau ist, für ±5 Punkte rechnerisch rund 384, jeweils bei einer Rate um 50 %. Laut iPullRank erheben die meisten Tracking-Setups aber nur einen Lauf je Prompt und Messzyklus und melden Ja oder Nein. Der Essay rechnet mit dem Standardfehler der Binomialverteilung. Das 95-%-Konfidenzintervall, im Folgenden kurz Spanne, schließt die tatsächliche Erscheinungswahrscheinlichkeit bei 95 von 100 Messungen ein. Bei einer Rate um 50 % ist sie je Prompt so breit: 5 Läufe ±44 Prozentpunkte (kurz: Punkte), 10 Läufe ±31, 20 Läufe ±22, 50 Läufe ±14, 100 Läufe ±10.
- 5 Läufe±44
- 20 Läufe±22
- 50 Läufe±14
- 100 Läufe±10
Erscheinungsrate der Brand · Balken = 95-%-Konfidenzintervall in Prozentpunkten
- je Prompt
- Näherung mit Standardformel
- unabhängige Läufe
Die Werte sind eine Näherung für unabhängige Läufe, am breitesten ist die Spanne bei einer Rate von 50 %. Bei 20 oder 80 % Erscheinungsrate sinkt sie mit 20 Läufen nach KKP-Rechnung auf rund ±17,5 statt ±22 Punkte. Bei 5 Läufen liegt das für kleine Stichproben genauere Wilson-Intervall rechnerisch bei rund ±33 Punkten. An der Größenordnung ändert das nichts.
Wie wenig ein einzelner Lauf sagt, zeigt ein Beispiel aus dem Essay: Erscheint eine Brand in 60 % der Antworten, kann ein Tracker mit einem Lauf je Tag am Montag „ja“ und am Dienstag „nein“ melden. Rechnerisch liefern zwei solche Einzelmessungen in 48 % der Fälle unterschiedliche Ergebnisse.
Wie stark schwanken ChatGPT-Antworten zwischen Läufen?
So stark, dass ein einzelner Lauf wenig über die Sichtbarkeit einer Brand sagt. iPullRank stützt sich auf einen Test, der im Februar 2026 auf Search Engine Land erschien. Der Autor schickte 12 Prompts zu B2B-Software je 100-mal durch das ausgeloggte, kostenlose ChatGPT auf chatgpt.com, nicht über die API. Jede der 1.200 Interaktionen lief mit eigener IP-Adresse in einer neuen Unterhaltung. 6 Prompts stammen aus umkämpften Kategorien wie Buchhaltungssoftware, 6 aus Nischen, jeweils halb einfach, halb mit Persona und Anwendungsfall formuliert.
rund 5 Brands erscheinen in mindestens 80 % der Antworten
- 12 Prompts × 100 Läufe
- ChatGPT ausgeloggt
- nur B2B-Software
Alle Werte sind Durchschnitte über 12 Prompts. Bei einem Prompt kamen über 100 Läufe 95 Brands zusammen.
Von den im Schnitt 44 Brands erscheinen nur rund 5, also 11 %, in mindestens 80 % der Antworten. Prompts mit Persona und Anwendungsfall verkleinern den Pool kaum: rund 42 statt 46 Brands je 100 Antworten. Der Autor des Tests empfiehlt rund 5 Läufe je Prompt mit Kaufabsicht, aber nur für eine grobe Einordnung in drei Stufen (unter 20 %, 20 bis unter 80 %, ab 80 %). Für belastbare Werte nennt er Dutzende bis über 100 Läufe. Auch die grobe Einordnung ist bei 5 Läufen unsicher, wie die Spanne von ±44 Punkten zeigt.
Wie sich die Nennungen verteilen, hängt von der Kategorie ab. In umkämpften Kategorien kommen je 100 Antworten rund doppelt so viele Brands zusammen wie in Nischen:
Dort erscheinen 72 % der genannten Brands in weniger als 20 % der Antworten. Dominant, also in mindestens 80 % der Antworten, sind nur 7 %, in Nischen 21 %. SparkToro fand dasselbe Grundmuster mit zwölf anderen Prompts über drei KI-Systeme: 600 Freiwillige fragten im November und Dezember 2025 ChatGPT, Claude und Googles KI-Antworten ab, also AI Overviews oder, wo keine erschien, AI Mode. Sie nutzten ihre eigenen, teils personalisierten Einstellungen und kamen auf 2.961 Läufe. Die Chance, dass ChatGPT oder Google (AI Overviews, AI Mode) bei 100 Anfragen zweimal dieselbe Brand-Liste liefert, lag unter 1 zu 100.
Zitiert ChatGPT im Thinking-Modus andere Quellen als im Instant-Modus?
Laut Semrush zitiert ChatGPT je nach Reasoning-Modus überwiegend andere Quellen. Wie viel davon auf den Modus selbst zurückgeht, lässt die Analyse offen. Minimales Reasoning setzt Semrush mit dem Instant-Modus der ChatGPT-Oberfläche gleich, hohes mit dem Thinking-Modus. In einer Analyse vom Juni 2026 schickte Semrush 100 Prompts aus 20 Buyer Journeys je einmal mit minimalem und mit hohem Reasoning durch GPT-5.2. Für denselben Prompt tauchten nur 25,6 % der zitierten Domains in beiden Modi auf:
Hohes Reasoning sucht und zitiert mehr. Der Anteil der Antworten mit mindestens einer externen Quelle stieg von 50 % auf 68 %, und Semrush zählt 4,6-mal so viele Fan-out-Queries, also Teilsuchen, die das Modell selbst absetzt. Komplexe Prompts wie Vergleiche leitet ChatGPT laut Semrush auch in der kostenlosen Version automatisch ins hohe Reasoning. Einen Test in der Oberfläche beschreibt die Analyse allerdings nicht. Wie unterschiedlich die Modi Quellen abrufen, zeigt auch die Analyse zu ChatGPTs eigenem Suchindex.
Semrush hat je Prompt und Modus nur einmal gemessen. Ein Teil der übrigen rund 74 % kann deshalb normale Streuung zwischen Läufen sein. Wie Semrush die 25,6 % berechnet, etwa bei Antworten ohne Quelle, legt die Analyse nicht offen.
Welche Methodik-Entscheidungen stecken in jeder AI-Visibility-Zahl?
Laut iPullRank verschieben mindestens fünf Entscheidungen den Messwert:
- Erhebungsweg: Die Entwickler-API ist ein anderes System als die Chat-Oberfläche. Für Google AI Overviews und AI Mode gibt es gar keine Entwickler-API.
- Login-Status: Ausgeloggte Sitzungen laufen oft auf eingeschränkteren Konfigurationen, eingeloggte sind personalisiert. Ein Tracking-Account mit tausenden Prompts verunreinigt sich über Memory und Chatverlauf selbst.
- Zahl der Läufe: Ein Lauf liefert Ja oder Nein, erst mehrere Läufe liefern eine Rate mit berechenbarer Spanne.
- Standort, Oberfläche, Zeitpunkt: IP- und Account-Standort, App oder Web, Index-Aktualisierungen und stille Modell-Updates.
- Definition einer Nennung: Name im Text, zitierte URL, Listenplatz oder Shopping-Modul.
Auch die Formulierung der Prompts ist laut Essay eine Methodik-Entscheidung mit eigener Varianz. Weil jedes Tool diese Entscheidungen anders trifft, weichen zwei Tools immer voneinander ab. Im Einstiegsbeispiel des Essays zeigt ein Tool für dieselbe Brand 41 %, ein anderes 23 %. Welches besser misst, sagt die Abweichung nicht. Prüfbar ist nur die Precision eines Tools: wie stark seine Werte schwanken, wenn es dasselbe Set zweimal unter gleichen Bedingungen erhebt. Jeder Methodikwechsel, etwa von der API auf automatisierte Abfragen der Oberfläche, bricht zudem die Zeitreihe.
Wird eine AI-Visibility-Rate auf Ebene des Promptsets belastbar?
Für den Einzelwert rechnerisch ja: Die Gesamtrate eines Promptsets ist deutlich genauer als die Rate eines einzelnen Prompts. Das zeigt eine KKP-Rechnung mit derselben Standardformel, die iPullRank nutzt. Bei 50 % Erscheinungsrate bräuchte ein einzelner Prompt für ±5 Punkte rund 384 Läufe, ein Set aus 20 Prompts mit je 20 Läufen liefert 400 Antworten. Die Gesamtrate ist damit auf rund ±4,9 Punkte genau, jeder einzelne Prompt bleibt bei ±22.
- 1 Prompt20 Läufe±22
- 1 Promptrund 384 Läufe±5
- Promptset20 × 20 = 400 Antworten±4,9
- Annahme: Erscheinungsrate 50 %
- Näherung
- unabhängige Läufe
Die ±4,9 Punkte decken die Streuung zwischen Läufen ab, nicht die Auswahl der Prompts.
Die Rechnung setzt ein festes Set und unabhängige Läufe voraus, also keine gemeinsame Session und kein Memory.
Jedes Messinstrument hat laut iPullRank einen Minimum Detectable Effect: die kleinste Veränderung, die es noch vom Rauschen trennen kann. Wenn du auf eine Bewegung von 5 Punkten reagieren willst, sind 20 Läufe laut Essay kein Luxus. Je Prompt reichen sie dafür rechnerisch nicht (±22 Punkte), und auch 20 × 20 grenzt nur den Einzelwert der Gesamtrate auf ±4,9 Punkte ein. Beim Vergleich zweier Monate fließt die Unsicherheit beider Messungen ein, die Spanne der Differenz ist breiter als ±4,9 Punkte. Eine Bewegung von 5 Punkten kann deshalb auch auf Set-Ebene noch im Rauschen liegen.
Wie belastbar sind die Zahlen?
Die Rechnung ist belastbar, die Messdaten gelten nur in engeren Grenzen. Die Intervalle lassen sich mit der Standardformel nachrechnen und gelten unabhängig von Markt und Branche: exakt 43,8 Punkte bei 5 Läufen, 21,9 bei 20, 13,9 bei 50 und 9,8 bei 100.
- iPullRank · Essay 09/2026
- ✓ StärkeRechnung mit Standardformel nachrechenbar
- ✕ Grenzealle Messdaten stammen von Dritten
- 100-Läufe-Test · Search Engine Land 02/2026
- ✓ Stärke12 Prompts × 100 Läufe
- ✕ Grenzenur ChatGPT ausgeloggt, nur B2B-Software
- Semrush · 06/2026
- ✓ Stärke100 Prompts, 2 Reasoning-Modi
- ✕ Grenze1 Lauf je Modus, Modus und Streuung nicht getrennt
- SparkToro · 01/2026
- ✓ Stärke600 Freiwillige, 3 KI-Systeme, 2.961 Läufe
- ✕ GrenzeBedingungen nicht kontrolliert (Login, Verlauf, Land, Gerät frei), kein Peer Review
Alle Quellen, bei SparkToro ein Co-Autor, verkaufen AI-Search-Messung oder arbeiten für einen Anbieter davon.
Keine der Erhebungen weist Daten für den deutschen Markt oder deutsche Prompts aus. Semrush verteilt seine Prompts auf vier Kategorien, darunter Finance, nennt aber weder Erhebungsdatum noch Markt, Sprache oder die Zahl der Prompts je Kategorie. Der 100-Läufe-Test nennt weder Modellversion noch Erhebungszeitraum. Sein Autor hält die Befunde nach eigener Aussage wahrscheinlich nur in der Richtung auf andere KI-Systeme übertragbar, nicht in den absoluten Werten.
Alle vier Quellen stehen der AI-Search-Messung wirtschaftlich nahe. iPullRank verkauft AI-Search-Beratung und -Messung. Der Autor des 100-Läufe-Tests hat ein AI-Search-Intelligence-Tool gegründet, Search Engine Land gehört zu Semrush. Semrush verkauft das Toolkit, aus dem seine Daten stammen, und ein Co-Autor der SparkToro-Studie arbeitet bei einem Start-up für AI-Tracking.
Was heißt das für dein AI-Visibility-Reporting?
Eine Rate ohne Angaben zur Methodik lässt sich weder einordnen noch über die Zeit vergleichen. Eine einzelne Zahl ohne Spanne nennt iPullRank eine „Lüge durch Weglassen“ und zeigt an einem Formulierungsbeispiel, wie eine Angabe mit Spanne und Methodik aussieht:
- 20 Läufe je Prompt
- ausgeloggt
- USA
- Thinking-Modus
- Woche ab 25. August
Die ±9 Punkte gehen rechnerisch nur auf, wenn die Rate über mehrere Prompts gebildet wird. Für einen einzelnen Prompt mit 20 Läufen wären es rund ±22 Punkte. Die Zahl der Prompts nennt iPullRank nicht.
- Läufe und Spanne ausweisen
- Erhebungsweg, Modus, Login-Status, Markt und Zeitraum nennen
- Rate für das gesamte Promptset ausweisen
Dazu kommen vier der Hebel, die iPullRank für den Einkauf und den Eigenbau von Tracking nennt:
Visibility-Metriken sind laut Essay Näherungswerte für einen Kanal. Bewegen sie sich nicht im Gleichlauf mit den Ist-Werten, messen sie etwas, das nicht mit dem Geschäft verbunden ist. Wie AI Visibility und klassische SEO-Kennzahlen zusammenspielen, zeigt der Artikel zu den SEO-KPIs im KI-Zeitalter.
Braucht AI-Visibility-Tracking ein größeres Promptset oder mehr Läufe je Prompt?
Das hängt davon ab, welche Frage das Reporting beantworten soll: Für die Gesamtrate zählt die Summe aller Antworten im Set, für die Diagnose einzelner Prompts zählen die Läufe je Prompt. Rund 384 Läufe je Prompt sind bei einem großen Set kaum zu finanzieren. Belastbar wird eine AI-Visibility-Rate aus meiner Sicht deshalb erst auf Ebene des Promptsets, wo 20 Prompts mit je 20 Läufen schon rund ±4,9 Punkte erreichen. Für Bewegungen über die Zeit braucht auch das Set genug Antworten.
Einzelne Prompts bleiben als Diagnose wichtig: Wo fehlt die Brand, welcher Wettbewerber steht stattdessen in der Antwort? Als Kennzahl im Reporting taugt ihre Rate nicht. Das Set selbst ist dabei eine Methodik-Entscheidung. Wer Prompts austauscht, bricht die Zeitreihe.
Mit ausgewiesener Methodik wird eine Rate über die Zeit vergleichbar, das betont auch iPullRank. Sie zeigt allerdings nur, ob eine Brand genannt wird, nicht, ob sie empfohlen wird oder stattdessen ein Wettbewerber. Wie wir bei KKP Messung und Optimierung verbinden, zeigt unsere AI-Search-Beratung.
FAQ: Häufige Fragen zum AI-Visibility-Tracking
Wie viele Läufe braucht ein Prompt im AI-Visibility-Tracking?
Laut iPullRank (09/2026) braucht ein Prompt rund 100 Läufe, damit seine Erscheinungsrate auf ±10 Prozentpunkte genau ist, wenn die Brand in etwa der Hälfte der Antworten erscheint. Mit 5 Läufen sind es nur rund ±44 Punkte, mit 20 Läufen ±22. Ein Promptset aus 20 Prompts mit je 20 Läufen kommt für die Gesamtrate laut einer KKP-Rechnung auf rund ±4,9 Punkte, allerdings nur gegen die Streuung zwischen Läufen.
Warum nennt ChatGPT bei derselben Frage jedes Mal andere Brands?
Weil ChatGPT jede Antwort neu erzeugt und dabei je Lauf andere Teilsuchen und Quellen nutzen kann. In einem Test auf Search Engine Land (02/2026) mit 12 Prompts zu B2B-Software nannte das ausgeloggte ChatGPT über 100 Läufe desselben Prompts im Schnitt 44 Brands, in einer Antwort rund 10. SparkToro (01/2026) fand in 2.961 Läufen eine Chance unter 1 zu 100, dass ChatGPT oder Google (AI Overviews, AI Mode) bei 100 Anfragen zweimal dieselbe Brand-Liste liefert.
Warum zeigen zwei AI-Visibility-Tools für dieselbe Brand unterschiedliche Werte?
Weil jedes Tool mit eigener Methodik misst: API oder Oberfläche, Login-Status, Modus, Standort, Zahl der Läufe und Definition einer Nennung. iPullRank (09/2026) beschreibt eine Brand mit 41 % in einem und 23 % in einem anderen Tool; welches besser misst, sagt die Abweichung nicht. Prüfbar ist nur die Precision eines Tools, also wie stark seine Werte schwanken, wenn es dasselbe Set zweimal unter gleichen Bedingungen erhebt.
Macht es einen Unterschied, ob ChatGPT im Instant- oder im Thinking-Modus antwortet?
Laut Semrush deutlich, der Anteil des Modus selbst ist aber offen. In einer Semrush-Analyse (06/2026) liefen 100 Prompts je einmal mit minimalem und hohem Reasoning durch GPT-5.2, was Semrush mit Instant und Thinking gleichsetzt, ohne die Oberfläche selbst zu testen. Nur 25,6 % der zitierten Domains tauchten für denselben Prompt in beiden Modi auf. Weil je Modus nur einmal gemessen wurde, kann ein Teil der Differenz normale Streuung sein.
Welche Fragen sollte ich einem Anbieter von AI-Visibility-Tracking stellen?
iPullRank (09/2026) rät, acht Dinge zu erfragen: den Erhebungsweg je Plattform, den Login-Status samt Memory, ob Modell und Modus fixiert sind, die Läufe je Prompt samt Rate mit Spanne, die geografische Herkunft der Abfragen, die Definition einer Nennung samt Rohantworten, das Methodik-Changelog und einen vollständigen Export. Ohne diese Angaben lässt sich eine Rate weder einordnen noch über die Zeit vergleichen.



