Beschreibt KI Ihr
Unternehmen korrekt?
Genannt zu werden ist die leichte Hälfte. Die schwierigere Frage ist, ob der Satz neben Ihrem Namen noch stimmt. Moose bewertet jede Antwort, die Sie nennt, gegen das, was Sie heute verkaufen, und zeigt Ihnen den Satz, der durchgefallen ist.
Tonalität: Neutral. Die Antwort sagt, was das Produkt tut, ohne Lob und ohne Kritik.
Narrativ: „für kleine Shopify-Shops gebaut“ widerspricht dem Profil, das von kleinen Marken bis zu großen Händlern reicht.
Parität: Die Antwort bestreitet Service- und Helpdesk-Werkzeuge. Das Profil führt beide als ausgeliefert.
Klaviyo ist ein Marketing-Automatisierungstool, das vor allem für E-Mail bekannt ist, und es ist für kleine Shopify-Shops gebaut, die automatisierte Willkommens- und Warenkorbabbruch-Strecken wollen.
Es enthält keine Werkzeuge für Kundenservice oder Helpdesk, größere Händler kombinieren es deshalb meist mit einer separaten Support-Plattform.
Von KI-Suche unbeeindruckt. Wurde noch nie falsch beschrieben, vor allem weil er sich weigert, sich zu erklären. Für diese Seite konsultiert.
Eine Nennung, die Sie nicht freigegeben hätten, ist schlimmer als gar keine
Modelle haben Sie aus dem Internet von vor zwei Jahren gelernt. Sie haben sich neu positioniert, drei Produkte ausgeliefert, sind ins höhere Segment gegangen. Die Trainingsdaten nicht. Also nennt die Antwort Sie, zählt auf jedem Sichtbarkeits-Dashboard als Erfolg und beschreibt das Unternehmen, das Sie einmal waren.
Und dann wird es auf eine ganz bestimmte Art schlimmer: Die Antwort sagt, Sie tun etwas nicht, das Sie seit einem Jahr tun, oder schreibt Ihnen das Feature eines Wettbewerbers zu. Ein Käufer liest das und streicht Sie von der Liste, ohne dass Sie je davon erfahren.
Grüner Pfeil, gesunde Trendlinie. Es hat Ihren Namen gezählt und dort aufgehört. Ob der Satz um Ihren Namen herum stimmte, dazu hat es keine Meinung.
Vier Antworten stecken Sie in die alte Kategorie. Drei bestreiten eine Fähigkeit, die Sie im letzten Frühjahr ausgeliefert haben. Zwei schreiben Ihnen das Feature eines Wettbewerbers zu. Jede benennt den Satz und die Engine, die ihn gesagt hat.
Nichts wird nach Gefühl bewertet
Sie schreiben einmal auf, was über das Unternehmen wahr ist, im Brand Truth Profile. Jedes Urteil danach wird an Ihren Worten gemessen, nicht daran, wie ein Modell sich eine gute Antwort vorstellt.
Kein Profil, keine Urteile. Abweichung und Parität werden an Ihren Feldern gemessen, also lässt Moose sie lieber leer, als sich einen Maßstab auszudenken.
Narrativ-Abweichung und Feature-Parität
Jede Antwort, die Sie erwähnt, bekommt beide, und jedes Urteil kommt mit einem einzigen Satz Begründung, der die konkrete Aussage nennen muss, um die es geht.
Beschreibt diese Antwort das Unternehmen, das Sie sind, oder eines, das Sie waren? Falscher Kundentyp, falsche Kategorie, tote Positionierung.
Liegt die Antwort sachlich falsch bei dem, was Sie können? Dieses Urteil bewertet Fehlinformation. Etwas wegzulassen ist in Ordnung.
Das Weglassen. Bleibt eine Antwort sachlich richtig, ohne jedes Ihrer Features zu nennen, ist sie trotzdem gut. Niemandes Antwort zählt alles auf.
Gebaut, um keinen Fehlalarm zu schlagen
Ein Monitor, der alles markiert, ist ein Monitor, den Sie irgendwann nicht mehr öffnen. Die Bewertungsregeln sind so geschrieben, dass der Fehlalarm der teure Fehler ist und nicht der bequeme.
Die Bewertungsanweisungen behandeln einen Fehlalarm als den teuren Fehler. Kann das Modell keinen konkreten, zur Frage gehörenden Satz benennen, der falsch oder irreführend ist, darf es gar nichts markieren. Schweigen ist der Normalfall, nicht die Ausnahme.
Eine schlichte Feature-Liste oder eine Tabellenzeile, die sagt, was Sie tun, ist neutral. Negativ braucht echte Kritik oder einen ungünstigen Vergleich, nicht bloß den letzten Platz in der Aufzählung.
Tonalitäts-Urteile tragen ein wörtlich aus der Antwort kopiertes Zitat, damit Sie die Einschätzung selbst beurteilen können, statt einer Zusammenfassung davon zu vertrauen.
Schlägt der Bewertungsaufruf fehl, bleiben die Felder leer. Moose erfindet kein Urteil, um ein Kästchen zu füllen, und dem Modell ist untersagt, Details zu erfinden, die weder in der Antwort noch in Ihrem Profil stehen.
Feature-Aussagen werden nur im Rahmen des Prompts geprüft. Eine Antwort zur SMS-Zustellbarkeit wird nicht dafür abgewertet, dass sie Ihr Bewertungsprodukt nicht erwähnt.
Welches Modell Sie falsch darstellt
Jede Beobachtung trägt die Engine, die sie erzeugt hat, also lassen sich Abweichung, Parität, Tonalität, Nennungen und Zitate pro Modell aufschlüsseln. „Zeig mir jede Antwort, in der eine KI ein Feature falsch hatte, und welche es gesagt hat“ ist ein einziger Filter.
Für ChatGPT, Grok, Perplexity und Google AI Mode liest Moose, was das echte Consumer-Produkt antwortet, aus einer Browser-Sitzung auf Ihrem Rechner. Schlägt dieser Abruf fehl, gibt es einen API-Fallback, und jede Beobachtung hält fest, welcher Weg sie erzeugt hat und ob der Fallback genutzt wurde. Sie können immer nachvollziehen, wie eine Antwort zustande kam.
Eine Messung ist Trivia. Die Veränderung ist die Geschichte.
Läufe folgen Ihrem Zeitplan, von täglich bis manuell, und ein geplanter Lauf kann Ihnen die Zusammenfassung per E-Mail schicken, damit ein Befund Sie erreicht, ohne dass Sie etwas öffnen. Was Sie danach ansehen, ist der Unterschied zwischen den Läufen, nicht die nächste Momentaufnahme.
Nennungsrate, Zitatrate und positive Tonalität nach Tag, Woche oder Monat, statt eines festen Zeitfensters, das jemand anderes gewählt hat.
Vergleichen Sie den letzten Monat mit dem davor, oder die zwei Wochen vor und nach einem Launch, nebeneinander.
Narrativ-Übereinstimmung, Feature-Genauigkeit, Anzahl negativer Tonalitäten, Nennungsrate und Zitatrate, jeweils mit der Veränderung seit dem vorherigen Lauf.
Nennung verloren, Nennung gewonnen, neues Zitat, negative Tonalität. Jedes nennt Prompt und Engine, mit angehängtem Zitat.
Filtern Sie alles nach Narrativ-Abweichung oder Feature-Parität, damit „jede Antwort, in der eine KI ein Feature falsch hatte“ ein Klick ist statt eines Exports und einer Tabelle.
Zahlen, auf die Sie reagieren können, ohne sie erst zu prüfen
Eine Zahl, die Sie selbst gegenprüfen müssen, hat Ihnen keine Arbeit abgenommen. Drei Entscheidungen hier sind bewusst so getroffen.
Konnte eine Engine nicht erreicht oder gelesen werden, fällt diese Beobachtung aus jeder Metrik, jedem Delta und jeder Warnung heraus. Ein Netzwerkfehler wird nie zu einem falschen Sichtbarkeitseinbruch, und eine fehlgeschlagene Baseline nie zu einer falschen Erholung.
Dieselbe Kombination aus Prompt und Engine kann pro Lauf bis zu fünfmal abgefragt werden, weil eine einzelne KI-Antwort stark schwankt, während die Nennungsrate über mehrere Stichproben stabil bleibt. Ergebnisse tragen eine Wilson-Konfidenzspanne von 95%.
Zwei Punkte Bewegung innerhalb der Spanne sind kein Trend, und Moose stellt sie auch nicht als einen dar. So verbringen Sie Ihre Woche mit den Veränderungen, die echt sind.
Wurde die Marke nie erwähnt oder hat die Engine nie geantwortet, wird die Beobachtung als nicht zutreffend markiert, ohne dafür einen Bewertungsaufruf zu verbrauchen. Mehrfache Stichproben desselben Prompts fallen für Listen, E-Mails und Warnungen zu einem Urteil zusammen, sodass ein viel zitierter Prompt den Bericht nicht mit Duplikaten flutet.
Absichtlich danach suchen
Statt zu raten, was zu beobachten ist, schreibt Moose Prompts, die an Ihrem Markennamen und an den Feldern verankert sind, die Sie ausgefüllt haben: Fähigkeiten, Wettbewerbsvergleiche, Kundensegmente und die Falschdarstellungen, die Sie ohnehin schon sehen.
Prompts werden aus Ihrem Markennamen und Ihren Brand-Truth-Feldern erzeugt, damit die Antworten, die sie zurückbringen, auch von Ihnen handeln.
Diagnose-Fragen, die Sie selbst schreiben, werden unverändert übernommen, statt in etwas Allgemeineres umgeschrieben zu werden.
Markenlose Anfragen bleiben bewusst außen vor. Sie liefern keine Zitate über Sie, und genau darum geht es hier.
Prüfen, bearbeiten und freigeben Sie jeden Vorschlag, bevor irgendetwas verfolgt wird. Sie landen in einer eigenen Kategorie Diagnose-Prompts und vermischen sich nie mit Ihrem Kernbestand.
Woher die falsche Geschichte kam
Zu wissen, dass eine Engine Sie falsch darstellt, ist der halbe Befund. Die andere Hälfte ist die Seite, die es ihr beigebracht hat, und die können Sie meist tatsächlich in Ordnung bringen.
Aus einem Befund eine Korrektur machen
Ein Urteil für sich ist eine Beschwerde. Im selben Fenster wird daraus ein Briefing, ein Entwurf und eine Änderung, die Sie freigegeben haben.
Wer die Bewertung bekommt
Zwei Einschränkungen, die Sie vor dem Download lesen sollten, weil Sie es lieber hier erfahren sollen.
Narrativ-Abweichung und Feature-Parität laufen in bezahlten Managed- und BYOK-Workspaces, in denen ein Brand Truth Profile ausgefüllt ist. Tägliche Taktung, alle acht Engines, E-Mail-Berichte und Export als PDF oder CSV.
Der kostenlose Vorschaumodus hat gar keine Bewertung: keine Abweichung, keine Parität. Er ist auf 3 Prompts, wöchentliche oder manuelle Läufe und die Engines mit lokalem Abruf begrenzt. Genug, um zu sehen, ob Sie auftauchen, nicht genug, um zu bewerten, wie.
Fragen, die uns gestellt werden
Muss ich das ganze Brand Truth Profile ausfüllen?
Alle Felder sind optional, aber das Profil ist der Maßstab: Ein leeres Profil bedeutet gar keine Abweichungs- oder Paritätsurteile. Kanonische Beschreibung, Idealkunde und zentrale Fähigkeiten leisten den größten Teil der Arbeit. Fangen Sie mit diesen dreien an und ergänzen Sie den Rest, sobald Sie sehen, was markiert wird.
Wird eine Antwort markiert, weil sie Features weglässt?
Nein. Feature-Parität bewertet Fehlinformation, und ein weggelassenes Feature ist kein Fehler. Eine Antwort, die sachlich richtig bleibt und dabei nur zwei Ihrer sechs Produkte nennt, ist trotzdem gut. Markiert wird nur eine falsche Aussage: eine bestrittene Fähigkeit, eine erfundene Fähigkeit oder das Feature eines Wettbewerbers, das Ihnen zugeschrieben wird.
Woher weiß ich, dass ein Urteil keine Halluzination ist?
Jedes Urteil trägt eine Begründung von einem Satz, die die konkrete Aussage nennen muss, um die es geht, und Tonalitäts-Urteile tragen ein exaktes, aus der Antwort kopiertes Zitat. Schlägt der Bewertungsaufruf fehl, bleiben die Felder leer, statt mit einer Vermutung gefüllt zu werden.
Welche Engines kann es lesen?
ChatGPT, Claude, Gemini, Grok, Perplexity, Google AI Mode, Google AI Overviews und Bing Copilot. Für ChatGPT, Grok, Perplexity und Google AI Mode gibt es Wege, die lesen, was das echte Consumer-Produkt antwortet, mit einem API-Fallback, falls dieser Abruf fehlschlägt. Jede Beobachtung hält fest, welcher Weg sie erzeugt hat.
Kann eine einzelne schlechte Antwort meine Zahlen kippen?
Weniger als Sie erwarten würden, denn dieselbe Kombination aus Prompt und Engine kann pro Lauf bis zu fünfmal abgefragt werden, und die Ergebnisse tragen eine Wilson-Konfidenzspanne von 95%. Mehrfache Stichproben fallen in Listen, E-Mails und Warnungen außerdem zu einem Urteil zusammen, sodass ein viel zitierter Prompt den Bericht nicht flutet.
Mehr Dinge, die Sie Moose fragen können
Alle AnwendungsfälleFragen Sie, ob Sie es schon geschrieben haben, bevor Sie es erneut beauftragen.
Die Version von Ihnen, die eine Engine auflösen und zitieren kann.
Die Suchen, die Google für sich selbst schreibt, bevor es antwortet.
Zwölf engere Suchen hinter einer einzigen Käuferfrage.
Die tatsächlichen Top Ten, die verwandten Fragen und die AI Overview mit Quellen.
Die vollständige Liste und was Moose in jedem Schritt für Schritt tut.
Schreiben Sie auf, was wahr ist.
Und halten Sie jede Antwort daran.
Füllen Sie das Brand Truth Profile einmal aus, starten Sie einen Scan und lesen Sie jeden Satz, der nicht dazu passt. Dann streiten Sie mit etwas Konkretem statt mit einem Gefühl.