RedClawLabs

Guides · Guide · Veröffentlicht 2026-09-20 · ca. 13 Min. Lesezeit · Eric Yu

KI-Sichtbarkeit messen: eine Anleitung in vier Schritten

Wie Sie auszählen, ob ChatGPT Ihre Marke nennt: Fragen ohne Markennamen, ein definierter Nenner, ein Konfidenzintervall und eine echte Messung aus dem deutschen Markt.

Kurz gefasst

  • KI-Sichtbarkeit ist der Anteil der Antworten, in dem eine Marke bei Kauffragen ohne Markennamen genannt wird.
  • Eine Antwort ist eine Anekdote, keine Messung; dieselbe Frage zweimal gestellt liefert nicht zwangsläufig dieselbe Liste.
  • Zu jeder Erwähnungsrate gehört ein Wilson-Intervall; drei Treffer aus drei Versuchen sind mit einer wahren Rate von 44 Prozent vereinbar.
  • Überlappt das Intervall dieser Woche mit dem der letzten Woche, ist die Veränderung noch kein Beleg für irgendetwas.
Auf dieser Seite
  1. Was KI-Sichtbarkeit nicht ist
  2. Schritt 1: Fragen formulieren, in denen Ihr Name nicht vorkommt
  3. Schritt 2: Wie oft fragen, und warum eine Antwort nichts beweist
  4. Schritt 3: Vier Dinge notieren
  5. Schritt 4: Erwähnungsrate und Konfidenzintervall
  6. Brauche ich ein KI-Sichtbarkeits-Tool?
  7. Typische Fehler
  8. Und wenn die Rate zu niedrig ist?
  9. Was diese Methode nicht abdeckt
  10. Häufige Fragen

KI-Sichtbarkeit ist der Anteil der Antworten eines KI-Assistenten, in dem eine Marke genannt wird, wenn man ihm typische Kauffragen ihrer Kategorie stellt, ohne den Markennamen selbst zu erwähnen. Gemessen wird sie, indem man eine feste Fragenliste an ChatGPT, Gemini oder Perplexity schickt und auszählt, wie oft die Marke vorkommt.

Das klingt simpel, und die Auszählung ist es auch. Schwierig sind die drei Entscheidungen davor: Welche Fragen stellen Sie, wie oft stellen Sie sie, und was genau steht im Nenner Ihrer Rate. Dieser Text geht die vier Schritte durch, zeigt eine Messung, die wir am 2026-09-20 im deutschen Markt tatsächlich laufen lassen haben, und rechnet ein Konfidenzintervall vor. Was wir kommerziell daraus machen, steht auf KI-Sichtbarkeit; die vollständige Methode mit allen Formeln steht auf unserer englischen Methodenseite.

Was KI-Sichtbarkeit nicht ist

Zwei Dinge laufen in deutschen Übersichten zu diesem Thema regelmäßig zusammen, obwohl sie aus verschiedenen Quellen stammen:

Besucher aus KI-Systemen. Sitzungen, die laut Analytics von chatgpt.com oder perplexity.ai kommen. Diese Zahl steht in GA4 und in der Search Console. Sie misst die Klicks, die eine Antwort übrig gelassen hat.

Erwähnungen in Antworten. Ob Ihr Name überhaupt in der Antwort steht, ob mit oder ohne Link. Diese Zahl steht nirgendwo. Sie entsteht erst, wenn jemand fragt und mitzählt.

Der zweite Wert ist der eigentliche Gegenstand. Ein großer Teil der KI-Antworten führt zu keinem Klick, und die Empfehlung wirkt trotzdem. Wer nur den ersten Wert verfolgt, misst den Rest einer Entscheidung, die anderswo gefallen ist. Dieser Text handelt ausschließlich vom zweiten.

Schritt 1: Fragen formulieren, in denen Ihr Name nicht vorkommt

Eine Messung ist nie besser als ihre Fragenliste. Vier Regeln entscheiden fast alles:

  1. Kein Markenname in der Frage. Wenn die Frage Sie nennt, nennt die Antwort Sie auch. Die Rate misst dann die Frage, nicht den Markt.
  2. Käufersicht, nicht Redaktionssicht. Person, Aufgabe, Einschränkung. Nicht "Was ist Buchhaltungssoftware", sondern "Welche Software für einen Soloselbstständigen mit DATEV-Export".
  3. Überwiegend Empfehlungs- und Vergleichsfragen. Unsere Pipeline verlangt mindestens 80 Prozent in dieser Absicht und lässt höchstens eine Preisfrage pro Thema zu.
  4. Keine Zwillinge. Zwei Fragen, die sich nur in einem Wort unterscheiden, liefern zwei fast identische Antworten und täuschen eine Stichprobe vor, die es nicht gibt.

Die vollständigen Prüfregeln, an denen eine Fragenliste bei uns scheitert, stehen auf der Methodenseite.

So sieht das aus. Am 2026-09-20 haben wir unsere Pipeline über die offizielle ChatGPT-API auf die Marke Lexware in der Kategorie Buchhaltungssoftware für Selbstständige (Markt DE, Sprache Deutsch) angesetzt. Diese drei Fragen wurden erzeugt und gestellt, im Wortlaut:

  1. "Welche Buchhaltungssoftware für Selbstständige in Deutschland können Sie empfehlen, die besonders benutzerfreundlich ist und sich für Einsteiger eignet?"
  2. "Können Sie verschiedene Buchhaltungssoftwares für Selbstständige vergleichen, die eine automatische Belegerkennung bieten und innerhalb von zwei Wochen einsatzbereit sind?"
  3. "Wie viel kostet eine Buchhaltungssoftware für Selbstständige mit Funktionen zur Umsatzsteuervoranmeldung und DATEV-Export im deutschen Markt?"

Eine Empfehlungsfrage, eine Vergleichsfrage, eine Preisfrage. In keiner steht "Lexware". Genau das macht die Antwort zu einer Messung.

Schritt 2: Wie oft fragen, und warum eine Antwort nichts beweist

KI-Antworten schwanken. Dieselbe Frage zweimal gestellt liefert nicht zwangsläufig dieselbe Liste. Daraus folgt die unbequemste Regel dieses Fachs: eine Antwort ist eine Anekdote, keine Messung.

Unsere kostenpflichtige Überwachung stellt deshalb jede vereinbarte Frage dreimal pro Engine und Woche. Drei ist eine Kostenentscheidung, keine statistische. Drei Wiederholungen reichen, um zu zeigen, dass eine Antwort schwankt. Sie reichen nicht, um eine kleine Veränderung von Woche zu Woche für echt zu erklären. Dafür gibt es Schritt 4.

Eine Käuferfrage — ohne MarkennamenChatGPTAntwort 1Antwort 2Antwort 3GeminiAntwort 1Antwort 2Antwort 3PerplexityAntwort 1Antwort 2Antwort 39 Antworten pro FrageErwähnungsrate = Antworten mit Ihrer Marke ÷ gültige Antworten
Eine Frage, drei Engines, je drei getrennte Durchläufe.

Der Lauf oben ist der kostenlose Pfad: drei verschiedene Fragen, jede einmal gestellt. Er wiederholt also nichts, und trotzdem zeigt er, wie wenig stabil das Bild ist. Diese Namen hat die Auswertung neben der gemessenen Marke aus den drei Antworten gezogen:

Genannte Marke In wie vielen der 3 Antworten
sevDesk 3
Debitoor 3
FastBill 3
Lexoffice 2
BuchhaltungsButler 2

Drei Namen standen in jeder Antwort, zwei nur in zweien. Das ist keine Aussage über diese Anbieter, sondern eine über die Messung: Schon der Wechsel der Frage verschiebt das Feld. Wer eine Frage stellt und das Ergebnis als Marktbild nimmt, hat nicht den Markt gemessen, sondern eine Frage. Wie oft Sie fragen müssen, ist damit keine Geschmacksfrage mehr, sondern eine Frage der Genauigkeit, die Sie brauchen, und die lässt sich ausrechnen.

Schritt 3: Vier Dinge notieren

Pro Antwort werden vier Beobachtungen festgehalten. Aus jeder wird genau eine Kennzahl, und jede Kennzahl hat einen eigenen Nenner. Das Fehlen dieser Nennerspalte ist der häufigste Mangel in den Anleitungen, die es zu diesem Thema gibt.

Was Sie notieren Kennzahl Nenner Beantwortet die Frage
Steht Ihr Name im Antworttext (ja/nein) Erwähnungsrate gültige Antworten Kennt die Engine mich überhaupt?
An welcher Position der Liste er steht durchschnittliche Platzierung Antworten, die Sie in einer Liste nennen Bin ich erste Wahl oder Nachtrag?
Welche Seiten die Antwort zitiert Zitierrate und Zitatanteil gültige Antworten bzw. alle zitierten URLs Liest die Engine meine Seiten oder die anderer?
Welche anderen Marken genannt werden Share of Voice eigene Nennungen plus alle Wettbewerbernennungen Wie viel Platz bleibt neben den anderen?

Gültige Antworten sind Antworten, die weder mit einem Fehler abgebrochen sind noch die Auskunft verweigert haben. Verweigerungen werden getrennt gezählt. Sonst sieht eine Engine, die grundsätzlich keine Anbieter empfiehlt, in Ihrem Report genauso aus wie ein Markt, in dem Sie niemand kennt, und das sind zwei völlig verschiedene Befunde.

Zwei weitere Details entscheiden darüber, ob die Zahlen etwas bedeuten: Linkziele und nackte URLs werden vor dem Abgleich aus dem Text entfernt, damit eine Domain innerhalb eines Links nicht als Nennung im Fließtext durchgeht. Und Schreibvarianten desselben Namens werden nach dem Maximum gezählt, nicht addiert, damit eine Nennung nicht dreimal zählt, weil drei Schreibweisen hinterlegt sind. Beides ist auf der Methodenseite ausgeschrieben.

Schritt 4: Erwähnungsrate und Konfidenzintervall

Die Erwähnungsrate ist eine Division: gültige Antworten mit Ihrer Marke, geteilt durch gültige Antworten. Bei drei Antworten hat diese Zahl allerdings nur vier mögliche Werte, und keiner davon ist besonders belastbar. Deshalb gehört zu jeder Rate ein Intervall.

Erwähnungsrate95-%-Konfidenzintervall0%100%wenige Antwortenbreites Bandviele Antwortenschmales Band
So liest man ein Ergebnis. Die Positionen sind illustrativ, kein Messwert.

Wir verwenden das Wilson-Score-Intervall (E. B. Wilson, 1927) bei 95 Prozent, z = 1,96. Das übliche Normalapproximations-Intervall versagt genau in unserem Anwendungsfall: Es wird bei Raten nahe 0 oder 1 beliebig schmal und "narrows to zero width (falsely implying certainty)" (Wikipedia, Binomial proportion confidence interval, abgerufen am 2026-09-20), und es kann Grenzen unterhalb von 0 oder oberhalb von 1 ausgeben. Wilsons Intervall hat beide Probleme nicht und ist für kleine Stichproben und schiefe Beobachtungen geeignet.

In Mittelpunkt-und-Halbbreite-Form:

Mittelpunkt = (p + z² / 2n) / (1 + z² / n)
Halbbreite  = z · √( p(1 − p)/n + z² / 4n² ) / (1 + z² / n)

Rechenbeispiel (kein Messergebnis): Angenommen, Ihre Marke steht in 2 von 3 gültigen Antworten. Dann ist p = 0,667 und n = 3.

  • Mittelpunkt = (0,667 + 3,8416 / 6) / (1 + 3,8416 / 3) = 1,307 / 2,281 = 0,573
  • Halbbreite = 1,96 · √(0,0741 + 0,1067) / 2,281 = 0,833 / 2,281 = 0,365
  • Intervall = 0,573 ± 0,365, also 20,8 % bis 93,9 %

Der Punktschätzer sagt "67 Prozent". Das Intervall sagt: irgendwo zwischen einem Fünftel und fast allem. Beide Angaben stammen aus derselben Messung.

Dieselbe beobachtete Rate bei wachsender Stichprobe, ebenfalls als Rechenbeispiel:

Nennungen / gültige Antworten Punktschätzer Wilson 95 %
2 / 3 66,7 % 20,8 % bis 93,9 %
6 / 9 66,7 % 35,4 % bis 87,9 %
24 / 36 66,7 % 50,3 % bis 79,8 %
3 / 3 100 % 43,9 % bis 100 %
0 / 3 0 % 0 % bis 56,2 %

Die letzten beiden Zeilen sind die wichtigsten. Drei Treffer aus drei Versuchen sind mit einer wahren Rate von 44 Prozent vereinbar, und null aus drei mit einer wahren Rate von 56 Prozent. Ein einzelner kostenloser Check ist damit ein Rauchmelder, keine Ausgangsmessung.

Und so fällt das bei unserem Lauf vom 2026-09-20 aus: Die gemessene Marke wurde in 3 von 3 gültigen Antworten genannt. Punktschätzer 100 Prozent, Wilson-Intervall 43,9 % bis 100 %. Die ehrliche Formulierung dieses Ergebnisses lautet nicht "die Marke ist zu 100 Prozent sichtbar", sondern: bei drei Fragen an einem Tag auf einer Engine ist sie jedes Mal vorgekommen, und die wahre Rate liegt vermutlich oberhalb von 44 Prozent. Das ist deutlich weniger, als eine runde Zahl verspricht, und es ist alles, was drei Antworten hergeben.

Die praktische Regel, die wir auf unsere eigenen Reports anwenden: Überlappt das Intervall dieser Woche mit dem der letzten Woche, ist die Veränderung noch kein Beleg für irgendetwas.

Brauche ich ein KI-Sichtbarkeits-Tool?

Für den ersten Durchgang nicht. Eine Tabelle mit den Spalten aus Schritt 3, zehn Fragen und ein API-Zugang reichen. Ein Tool kauft Ihnen Wiederholung, mehrere Engines und die Historie ab, also genau die Teile, die von Hand schnell nervig werden.

In den deutschsprachigen Übersichten, die wir am 2026-09-20 für diesen Text gelesen haben, tauchen dabei zwei Kategorien auf: spezialisierte Anbieter wie Peec AI, Otterly.AI oder Rankscale und etablierte SEO-Suiten wie Sistrix oder SE Ranking, die ein Modul dafür ergänzt haben. Welches davon zu Ihnen passt, können wir nicht beurteilen, ohne es zu testen. Was Sie jedes davon fragen können, bevor Sie zahlen:

  • Was steht im Nenner? Wenn ein Anbieter nicht sagen kann, durch welche Zahl er teilt, ist die Prozentzahl auf dem Dashboard nicht überprüfbar.
  • Wie oft wird gefragt? Eine Abfrage pro Frage und Woche ergibt eine Kurve, die überwiegend Rauschen zeigt.
  • Sehe ich die Fragen im Wortlaut? Wenn nicht, können Sie nicht prüfen, ob Ihr Markenname in der Frage steht, und dann ist die Rate wertlos.

Unser kostenloser Check stellt drei erzeugte Fragen einmal an ChatGPT und zeigt Ihnen Fragen und Antworten vollständig: kostenlose Messung. Die wöchentliche Variante über drei Engines steht auf der Seite zum Monitoring.

Typische Fehler

Der Markenname steht in der Frage. Woran Sie es merken: Die Erwähnungsrate liegt bei 100 Prozent und bewegt sich nie, und die Antwort greift Ihren Namen im ersten Satz auf. Prüfen Sie die Fragen im Wortlaut, nicht die Zusammenfassung.

Der Nenner ist nicht definiert. Woran Sie es merken: Der Report zeigt einen Prozentwert, aber nirgends die Anzahl der Antworten. Ohne "x von y" ist die Rate nicht nachrechenbar.

Verweigerungen zählen als Nicht-Nennung. Woran Sie es merken: Die Rate fällt in einer Woche deutlich, obwohl sich am Inhalt nichts geändert hat, und die Antworten enthalten Sätze, in denen die Engine grundsätzlich keine Anbieter empfiehlt.

Eine einzige Abfrage wird zur Ausgangsmessung erklärt. Woran Sie es merken: Die Zahl ist rund (0, 33, 67, 100 Prozent) und steht ohne Intervall da. Das sind die einzigen möglichen Werte bei n = 3.

Die Liste der Schreibvarianten ist unvollständig. Woran Sie es merken: Die Rate bleibt konstant bei null, oder ein zweiter eigener Name taucht in der Wettbewerberliste auf. In unserem Lauf ist genau das sichtbar: Die erste Antwort führt den Anbieter als "Lexoffice (früher: Lexware/Lexoffice)", und in der Auswertung erscheint "Lexoffice" zugleich als eigener Name in der Tabelle oben. Bei Marken mit Namenswechsel müssen alte und neue Schreibweise beide hinterlegt sein, sonst messen Sie zwei Firmen statt einer.

Analytics-Zahlen werden als Erwähnungen ausgegeben. Woran Sie es merken: Die Quelle der Zahl ist GA4 oder die Search Console. Beide können nicht wissen, ob Ihr Name in einer Antwort stand, die zu keinem Klick geführt hat.

Der Modellwechsel wird nicht protokolliert. Woran Sie es merken: Ein Sprung in der Kurve ohne jede Änderung an Inhalten oder Fragen. Anbieter tauschen Modelle aus. Ein neues Modell ist ein Bruch in der Zeitreihe und gehört in den Report, nicht geglättet.

Und wenn die Rate zu niedrig ist?

Hier endet das, was wir belegen können, und beginnt das, was Sie selbst prüfen müssen. Die Messung sagt Ihnen zuverlässig, ob Sie genannt werden. Warum nicht, steht in zwei Spalten, die die meisten Dashboards nebenbei mitliefern:

  • Die zitierten Quellen. Welche Seiten hat die Engine gelesen, um diese Antwort zu bauen? Wenn dort durchgehend Vergleichsportale und Fachmedien stehen und Ihre eigene Domain nie, ist Ihr Problem nicht Ihre Website.
  • Die Wettbewerberspalte. Wer wird statt Ihnen genannt, und in welchem Kontext? Wenn dieselben drei Namen in jeder Antwort auftauchen, ist deren Erwähnung in den zitierten Quellen der Unterschied, nicht deren Produkt.

Jede Maßnahme, die Sie daraus ableiten, ist zunächst eine Hypothese. Behandeln Sie sie auch so: Ändern Sie eine Sache, messen Sie mit derselben Fragenliste noch einmal, und vergleichen Sie die Intervalle statt der Punktschätzer. Wenn sie sich überlappen, wissen Sie es noch nicht. Wer Ihnen an dieser Stelle einen prozentualen Zuwachs zusichert, verkauft Ihnen eine Zahl, die niemand kontrollieren kann. Wie wir den Ablauf kommerziell umsetzen, steht auf der Seite zur KI-Sichtbarkeit.

Was diese Methode nicht abdeckt

Google AI Overviews und der AI-Modus liegen außerhalb unseres Messbereichs. Wir messen ChatGPT, Gemini und Perplexity über deren offizielle APIs. Eine Zahl von uns sagt nichts über AI Overviews aus, und wenn genau diese Oberfläche Ihr Thema ist, sind wir dafür nicht der richtige Anbieter.

Personalisierung ist ausgeschlossen. Wir fragen ohne angemeldeten Nutzer und ohne Gesprächsverlauf. Das Ergebnis beschreibt, was eine Engine einem anonymen Aufruf antwortet, nicht was sie in der Sitzung einer bestimmten Person sagt.

Kleine Stichproben bleiben unscharf. Keine Rechnung repariert das. Eine kurze Fragenliste kann kleine Veränderungen nicht nachweisen, und das Ergebnis heißt dann "nicht entscheidbar".

Tabellenantworten liefern keine Platzierung. Die Positionserkennung liest nummerierte Listen, Aufzählungen, Zwischenüberschriften und fett gesetzte Einleitungen. Antwortet eine Engine mit einer Vergleichstabelle, gilt die Marke als genannt, trägt aber keine Position bei.

Share of Voice ist asymmetrisch. Die eigene Seite zählt eine Nennung pro Antwort, die Gegenseite summiert alle genannten Wettbewerber. Eine Antwort mit Ihnen und fünf Konkurrenten ergibt 1/6, nicht 1/2. Der Wert ist über Wochen hinweg vergleichbar, solange die Wettbewerberliste gleich bleibt, aber nicht zwischen Marken mit unterschiedlich langen Listen.

Für Deutsch ist bisher ChatGPT verifiziert. Am 2026-09-20 lief die Pipeline auf Deutsch vollständig durch: idiomatische Kauffragen, kein Markenname in den Fragen, Markenabgleich 3 von 3, plausible Wettbewerberliste. Die deutschen Antworten von Gemini und Perplexity haben wir noch nicht überprüft, weil der kostenlose Pfad nur ChatGPT anspricht.

Häufige Fragen

Was ist KI-Sichtbarkeit? Der Anteil der Antworten eines KI-Assistenten, in dem Ihre Marke genannt wird, wenn man ihm typische Kauffragen Ihrer Kategorie stellt, ohne Ihren Namen zu nennen. Gemessen als Erwähnungsrate über gültige Antworten, üblicherweise mit Konfidenzintervall.

Wie messe ich meine Sichtbarkeit in der KI-Suche? In vier Schritten: eine Fragenliste in Käufersprache ohne Ihren Markennamen aufstellen, jede Frage mehrfach über die offizielle API einer Engine stellen, pro Antwort Nennung, Position, zitierte Quellen und Wettbewerber notieren, daraus die Erwähnungsrate mit Wilson-Intervall berechnen.

Wie generiere ich KI-Sichtbarkeit? Zuerst messen, dann eine Sache ändern, dann mit derselben Fragenliste nachmessen. Die Diagnose steckt in den zitierten Quellen: Wenn die Engine durchgehend Dritte liest und Sie nie, entsteht Sichtbarkeit dort, wo sie liest, nicht allein auf Ihrer eigenen Seite. Alles Weitere ist eine Hypothese, bis die zweite Messung sie stützt.

Wie oft muss ich fragen, damit das Ergebnis etwas bedeutet? So oft, dass das Konfidenzintervall schmal genug für Ihre Entscheidung ist. In der Tabelle oben sind die Intervalle bei drei Antworten je nach Ergebnis 56 bis 73 Prozentpunkte breit, bei 36 Antworten rund 30. Bei uns läuft es wöchentlich mit drei Wiederholungen pro Frage und Engine, und eine Frage geht erst nach vier Wochen in die Trendlinie ein.

Brauche ich dafür ein KI-Sichtbarkeits-Tool? Für den Anfang reicht eine Tabelle und ein API-Zugang. Ein Tool lohnt sich, sobald Sie mehrere Engines wöchentlich verfolgen wollen. Fragen Sie jeden Anbieter nach dem Nenner, nach der Anzahl der Wiederholungen und danach, ob Sie die gestellten Fragen im Wortlaut sehen.

Warum darf mein Markenname nicht in der Frage stehen? Weil eine Frage, die Sie nennt, eine Antwort erzeugt, die Sie nennt. Die Rate misst dann die Formulierung der Frage. Die Ausnahme sind bewusste Nachfragen zu einem Anbieter; die gehören in eine eigene Zeile und nicht in die Gesamtrate.

Messen Sie auch Google AI Overviews? Nein. AI Overviews und der AI-Modus von Google liegen außerhalb unseres Messbereichs. Wir messen ChatGPT, Gemini und Perplexity über deren offizielle APIs.

Warum steht hinter der Erwähnungsrate eine Spanne? Weil der Punktschätzer bei diesen Stichprobengrößen in die Irre führt. Das Wilson-Intervall bei 95 Prozent sagt Ihnen, wie viel von der Zahl Signal ist und wie viel daran liegt, dass die Stichprobe klein war.


Alle Zahlen in diesem Text stammen entweder aus dem oben beschriebenen Lauf vom 2026-09-20 (drei Fragen, ChatGPT über die offizielle API, Markt DE) oder sind als Rechenbeispiel gekennzeichnet. Die Formeln und die vollständige Liste der bekannten Grenzen stehen auf der Methodenseite.


Anmeldung nötig · 1× pro Konto und Monat