Caso de uso Precisión

¿La IA describe bien
tu negocio?

Que te mencionen es la mitad fácil. La pregunta difícil es si la frase que va junto a tu nombre sigue siendo cierta. Moose evalúa cada respuesta que te nombra contra lo que vendes hoy y te enseña la frase que falló.

Mira cómo Moose evalúa una respuesta Empieza por el patrón de medida
Chat Flujos de trabajo
Klaviyohttps://klaviyo.com
Nuevo chat
Inicio Bandeja de entrada Contexto Visibilidad Flujos de trabajo Audio Chats Biblioteca de artefactos Conexiones
Recientes
¿Dónde nos describen mal?Chat · 2 min Escaneo de visibilidad · 11 promptsEscaneo de visibilidad · 20 h Perfil de Verdad de Marca actualizadoContexto · 1 d Capturar consultas derivadas de Ch…Chat · 2 d
Sam SamPremium
Observar
Visibilidad
Klaviyo  |  visibilidad gestionada de pago  |  última ejecución 1 ago, 22:02
Gestor de prompts Ejecutar ahora
Cuota de menciones
74%
Cuota de citas
61%
Sentimiento
58% positivo
Desviación narrativa
82% alineado
Paridad de características
71% correcto
Tema: todos Motor de IA: todos Sentimiento: todos Narrativa: desviada o parcial Paridad: imprecisión detectada
Respuestas que te describen mal 9 de 51 observaciones
¿Qué es Klaviyo y para quién es? Gemini (consulta local) · “creado para tiendas pequeñas de Shopify” Desviada Imprecisión
Mejor CRM para una marca de consumo de 40 M$ ChatGPT (consulta local) · “sin capa nativa de servicio ni de soporte” Parcial Imprecisión
Klaviyo frente a Mailchimp para una marca en crecimiento Perplexity (consulta local) · “ambas son herramientas de email marketing” Parcial Requiere revisión
¿Qué plataformas usan los grandes minoristas? Grok (consulta local) · “más una herramienta para pymes que para grandes empresas” Desviada Buena
Respuesta de Gemini (consulta local)
¿Qué es Klaviyo y para quién es?
2026-08-01·Marca y categoría·Mencionada
Investigar en el chat Cerrar
Posición n.º 3 Sentimiento Neutral Narrativa Desviada Paridad Imprecisión detectada
Por qué esta puntuación

Sentimiento: Neutral. La respuesta dice qué hace el producto, sin elogios ni críticas.

Narrativa: «creado para tiendas pequeñas de Shopify» contradice el perfil, que abarca desde marcas pequeñas hasta grandes minoristas.

Paridad: La respuesta niega que haya herramientas de servicio y soporte. El perfil las incluye como ya lanzadas.

Respuesta, tal como llegó

Klaviyo es una herramienta de automatización de marketing conocida sobre todo por el email, y está creada para tiendas pequeñas de Shopify que quieren flujos automáticos de bienvenida y de carrito abandonado.

No incluye herramientas de atención al cliente ni de soporte, así que los minoristas más grandes suelen combinarla con una plataforma de soporte aparte.

Fuentes citadas  a-review-blog.com/klaviyo-review (2023)
Hi, Moose 0.3.281 Beta ¿Necesita ayuda?
Moose, un perro, tan tranquilo

A Moose la búsqueda con IA no le quita el sueño. Nunca lo han descrito mal, sobre todo porque se niega a explicarse. Consultado para esta página.

El problema

Una mención que no habrías aprobado es peor que ninguna mención

Los modelos te aprendieron de la internet de hace dos años. Cambiaste el posicionamiento, lanzaste tres productos, subiste de segmento. Los datos de entrenamiento no. Así que la respuesta te nombra, cuenta como victoria en cualquier panel de visibilidad y describe la empresa que eras antes.

Y luego empeora de una forma concreta: la respuesta dice que no haces algo que llevas un año haciendo, o te atribuye la función de un competidor. Un comprador lo lee y te descarta sin que tú te enteres nunca.

Lo que te dice una herramienta de visibilidad
Mencionado en el 74%

Flecha verde, línea de tendencia sana. Ha contado tu nombre y ahí se ha quedado. No tiene ninguna opinión sobre si la frase que rodeaba tu nombre era cierta.

Lo que te dice Moose
Mencionado, y mal en 9 de ellas

Cuatro respuestas te colocan en la categoría antigua. Tres niegan una capacidad que lanzaste la primavera pasada. Dos te atribuyen la función de un competidor. Cada una señala la frase y el motor que la dijo.

Paso uno

Nada se evalúa a ojo

Escribes una vez lo que es cierto sobre la empresa, en el Perfil de Verdad de Marca. Todos los veredictos posteriores se miden contra tus palabras, no contra la idea que tenga un modelo de cómo es una buena respuesta.

Contexto · Perfil de Verdad de Marca
¿Cómo debería describir la IA tu empresa hoy?
Un CRM B2C para marcas de consumo: email, SMS, push y reseñas sobre un perfil de cliente unificado, con servicio y analítica en la misma plataforma. Lo usan desde marcas pequeñas hasta grandes minoristas.
Escribe la versión que te gustaría ver en ChatGPT, Perplexity, Gemini o las respuestas de Google con IA.
¿Qué suele equivocarse la IA sobre tu empresa?
Nos sitúa ante el tipo de cliente equivocado Demasiado centrados en pequeñas empresas Demasiado centrados en grandes empresas Categoría de producto equivocada Productos o posicionamiento antiguos Omite productos o funciones nuevos Dice que nos faltan funciones que ofrecemos Nos compara con los competidores equivocados Información obsoleta de la empresa Exagera lo que hacemos Minimiza lo que hacemos Nos confunde con otra empresa
Descripción canónica y ofertaUn párrafo sobre qué es la empresa, más cada producto o categoría con su propia descripción. Esta es la frase que quieres que te devuelvan citada.
Cliente ideal, en una lista y en tus palabrasSegmentos de una lista fija, más texto libre para la parte que no cabe en una casilla. La mayoría de los veredictos de desviación salen de este campo.
Capacidades y funciones claveLo que la IA debería saber que puedes hacer. La paridad se juzga contra esto, así que una capacidad ya lanzada que figure aquí se convierte en un hecho que una respuesta puede equivocar.
Relatos y vocabulario que has dejado atrásLa historia que ya has superado, las palabras que prefieres y las palabras que no quieres cerca de tu nombre.
Competidores, con dominios y notasCon quién compites, más las comparaciones que quieres vigilar de cerca. Esto es lo que pilla que se te atribuya la función de un competidor.
Afirmaciones delicadas que matizar o evitarLenguaje regulado, cifras sin demostrar, cualquier cosa que a legal no le haría gracia oír repetir a un motor en tu nombre.
Fuentes autorizadas y obsoletasURLs que cuentan la historia actual y URLs que siguen contando la antigua. Cuando una respuesta cita la segunda lista, sabes exactamente por qué se desvió.
Los errores más dañinos que vigilarElige los que te costarían una venta: categoría equivocada, cliente equivocado, precios incorrectos, confusión de marca. Esos pesan más que el resto.

Sin perfil no hay veredictos. La desviación y la paridad se miden contra tus campos, así que Moose los deja en blanco antes que inventarse un patrón de medida.

Los dos veredictos

Desviación narrativa y paridad de características

Cada respuesta que te menciona recibe los dos, y cada uno viene con una sola frase de razonamiento que tiene que nombrar la afirmación concreta de la que habla.

Desviación narrativa

¿Esta respuesta describe la empresa que eres o una que fuiste? Tipo de cliente equivocado, categoría equivocada, posicionamiento muerto.

La respuesta describe la marca de una forma que contradice el perfil de manera relevante. Tipo de cliente equivocado, categoría equivocada o un posicionamiento que retiraste.
Parcial Algunas afirmaciones encajan y otras se desvían. Es habitual cuando una respuesta acierta la categoría pero se equivoca de cliente.
No La descripción coincide con lo que escribiste. Nada que hacer, que es lo que ocurre con la mayoría de respuestas casi todos los días.
Paridad de características

¿La respuesta se equivoca de hecho sobre lo que puedes hacer? Esto evalúa información incorrecta. Dejarse cosas fuera no cuenta.

Buena Nada en la respuesta es objetivamente falso sobre tus capacidades, aunque no las haya enumerado todas.
Requiere revisión Una afirmación es lo bastante ambigua o dudosa como para que la mire una persona, en vez de marcarla como error.
Imprecisión detectada Una afirmación concreta y citable sobre lo que haces o no haces es falsa. El motivo nombra la frase.
Qué marca la paridad
Decir que no tienes una capacidad que sí tienes.
Atribuirte una capacidad, integración o límite que no tienes.
Adjudicarte la función de un competidor.
Qué no penaliza

La omisión. Si una respuesta es correcta pero no enumera todas tus funciones, sigue siendo buena. Ninguna respuesta lo enumera todo.

Contención

Hecho para no dar falsas alarmas

Un monitor que lo marca todo es un monitor que dejas de abrir. Las reglas de puntuación están escritas para que la falsa alarma sea el error caro y no el error seguro.

La regla
La falsa alarma se trata como el fallo

Las instrucciones de puntuación tratan la falsa alarma como el error caro. Si el modelo no puede señalar una frase concreta y dentro del alcance que sea falsa o engañosa, no tiene permitido marcar nada. El silencio es lo normal, no la excepción.

Sentimiento
Neutral hasta que alguien critica

Una lista simple de funciones, o una fila de tabla que dice lo que haces, es neutral. Para que sea negativo hace falta una crítica real o un contraste desfavorable, no basta con aparecer el último.

Pruebas
Una cita exacta, copiada palabra por palabra

Los veredictos de sentimiento llevan una cita copiada de la respuesta palabra por palabra, para que juzgues tú la decisión en lugar de fiarte de un resumen de ella.

Fallo
Un campo vacío es mejor que una suposición

Si la llamada de puntuación falla, los campos se quedan vacíos. Moose no fabrica un veredicto para rellenar una casilla, y al modelo se le prohíbe inventar detalles que no estén en la respuesta o en tu perfil.

Alcance
Se juzga sobre lo que se preguntó

Las afirmaciones sobre funciones solo se evalúan dentro del alcance del prompt. Una respuesta sobre entregabilidad de SMS no se penaliza por no mencionar tu producto de reseñas.

Por motor

Qué modelo se equivoca contigo

Cada observación lleva sellado el motor que la produjo, así que desviación, paridad, sentimiento, menciones y citas se desglosan por modelo. «Enséñame cada respuesta en la que una IA se equivocó sobre una función, y cuál lo dijo» es un solo filtro.

ChatGPT
78%alineado
Dos respuestas te siguen colocando en la categoría antigua.
Consulta local
Claude
96%alineado
Cita tu propia documentación en cuatro de cada cinco respuestas.
Gestionado / clave
Gemini
61%alineado
La peor desviación. Se apoya en un blog de reseñas de 2023.
Consulta local
Grok
74%alineado
Te lee como solo para pymes en los prompts de gran empresa.
Consulta local
Perplexity
89%alineado
Precisa, pero te compara con los dos competidores equivocados.
Consulta local
Google AI Mode
84%alineado
Categoría correcta, segmento de cliente difuso.
Consulta local
AI Overviews
80%alineado
Respuestas cortas, así que una cláusula errónea pesa mucho.
Consulta local
Bing Copilot
92%alineado
Refleja lo último que diga tu sitio.
Gestionado / clave
Leído del propio producto de consumo

Para ChatGPT, Grok, Perplexity y Google AI Mode, Moose lee lo que responde el producto de consumo real desde una sesión de navegador en tu ordenador. Si esa consulta falla hay una alternativa por API, y cada observación registra qué ruta la produjo y si se usó la alternativa. Siempre puedes saber cómo se obtuvo una respuesta.

Con el tiempo

Una lectura suelta es anécdota. El cambio es la historia.

Las ejecuciones van en tu calendario, de diarias a manuales, y una ejecución programada puede enviarte el resumen por email para que un hallazgo te llegue sin abrir nada. Lo que miras después es la diferencia entre ejecuciones, no otra foto fija.

Tendencia, agrupada como tú piensas

Tasa de menciones, tasa de citas y sentimiento positivo por día, semana o mes, en lugar de una ventana fija que eligió otro.

Cualquier periodo contra cualquier periodo

Compara el mes pasado con el anterior, o las dos semanas anteriores y posteriores a un lanzamiento, una al lado de la otra.

Ejecución a ejecución, con variaciones

Alineación narrativa, precisión de funciones, recuento de sentimiento negativo, tasa de menciones y tasa de citas, cada una con el cambio desde la ejecución anterior.

Cambios destacados por prompt

Mención perdida, mención ganada, cita nueva, sentimiento negativo. Cada uno nombra el prompt y el motor, con la cita adjunta.

Filtra el informe entero

Filtra todo por desviación narrativa o paridad de características, para que «cada respuesta en la que una IA se equivocó sobre una función» sea un clic y no una exportación y una hoja de cálculo.

Las cuentas

Números sobre los que puedes actuar sin comprobarlos antes

Un número que tienes que verificar tú no te ha ahorrado ningún trabajo. Aquí hay tres decisiones deliberadas.

01
Las comprobaciones fallidas se descartan en vez de contarse como pérdidas

Si no se pudo alcanzar o leer un motor, esa observación queda excluida de cada métrica, variación y alerta. Un fallo de red nunca se convierte en una caída falsa de visibilidad, y una referencia fallida nunca se convierte en una recuperación falsa.

02
Muestreo repetido, con margen de error

El mismo prompt y motor se pueden muestrear hasta cinco veces por ejecución, porque una sola respuesta de IA oscila muchísimo mientras que la tasa de menciones entre muestras se mantiene estable. Los resultados llevan un margen de confianza Wilson del 95%.

03
Un margen te permite distinguir el ruido de la noticia

Dos puntos de movimiento dentro del margen no son una tendencia, y Moose no te los va a presentar como tal. Así dedicas la semana a los cambios que son reales.

Tu asignación de puntuación se gasta en las respuestas que importan

Si la marca no se mencionó, o el motor no respondió, la observación se marca como no aplicable sin gastar una llamada de puntuación. Las muestras repetidas del mismo prompt se agrupan en un solo veredicto para listas, emails y alertas, así que un prompt muy citado no inunda el informe de duplicados.

Prompts de diagnóstico

Pillarlo a propósito

En vez de adivinar qué seguir, Moose escribe prompts anclados en el nombre de tu marca y en los campos que rellenaste: capacidades, comparaciones con competidores, segmentos de cliente y las tergiversaciones que ya estás viendo.

Sugeridos para revisar 6 de 11 · apruebas uno a uno
¿Klaviyo es solo para tiendas pequeñas de Shopify?Anclado en: tergiversación: demasiado centrados en pequeñas empresas
¿Klaviyo incluye herramientas de atención al cliente o de soporte?Anclado en: capacidad clave: servicio y soporte
¿Cuál es el mejor CRM B2C para una marca de consumo?Anclado en: descripción canónica y categoría
Klaviyo frente a Attentive para SMS y email juntosAnclado en: comparación que vigilar de cerca
¿Qué plataforma unifica email, SMS, push y reseñas?Anclado en: capacidades clave
¿Los grandes minoristas usan Klaviyo?Anclado en: segmentos de cliente ideal
Anclados en tu marca, a propósito

Los prompts se generan a partir del nombre de tu marca y de tus campos de Verdad de Marca, así que las respuestas que devuelven hablan de ti.

Tus preguntas, palabra por palabra

Las preguntas de diagnóstico que escribes tú pasan sin cambios, en vez de reescribirse en algo más genérico.

Consultas genéricas excluidas

Las consultas sin marca se dejan fuera a propósito. No devuelven citas sobre ti, que es justo el objetivo del ejercicio.

Los apruebas uno a uno

Revisa, edita y aprueba cada sugerencia antes de que se siga nada. Van a su propia categoría de Prompts de diagnóstico, así que nunca se mezclan con tu conjunto principal.

Procedencia

De dónde salió la historia equivocada

Saber que un motor se equivoca contigo es medio hallazgo. La otra mitad es la página que se lo enseñó, y eso normalmente sí lo puedes arreglar.

01 Se guarda la respuesta enteraTexto completo de la respuesta, el fragmento que te mencionó y las fuentes que citó el motor, incluido si alguna era uno de tus propios dominios.
02 Cruzado con tus fuentes obsoletasTú listaste las páginas que siguen contando la historia antigua. Cuando una respuesta desviada cita una, la línea entre la causa y el síntoma está ahí mismo.
03 Historial de citas por URLSi una página se cita ahora, se citaba antes o la ha sustituido un competidor. Ese historial alimenta las auditorías AEO, así que una página se audita conociendo su situación.

Convertir un hallazgo en un arreglo

Un veredicto por sí solo es una queja. En la misma ventana se convierte en un brief, un borrador y un cambio que has aprobado.

¿Por qué Gemini sigue diciendo que no tenemos herramientas de servicio?
Tres de sus cuatro respuestas a ese prompt citan la misma reseña de 2023, escrita antes de que se lanzara el soporte. Tu propia página de documentación sobre eso todavía no la cita ningún motor. En seis prompts de hueco se nombra a competidores y a ti no.
Arregla la página y vigílala.
Brief redactado a partir de los resultados en vivo de esa pregunta, preparado en tu CMS y a la espera de tu aprobación. También he dejado un flujo de trabajo: si la precisión de funciones en los prompts de servicio vuelve a caer, produce el brief sin que se lo pidas. La exportación de esta vista filtrada está lista en PDF o CSV.
Dicho claramente

Quién tiene puntuación

Dos advertencias que conviene leer antes de descargar, porque preferimos que te enteres aquí.

Gestionado de pago y BYOK
Puntuación de desviación y paridad, todos los motores

La desviación narrativa y la paridad de características funcionan en los espacios de trabajo gestionados de pago y BYOK que tengan el Perfil de Verdad de Marca relleno. Cadencia diaria, los ocho motores, informes por email y exportación a PDF o CSV.

Vista previa gratuita
Solo menciones y citas

El modo de vista previa gratuita no tiene puntuación de ningún tipo: ni desviación, ni paridad. Está limitado a 3 prompts, ejecuciones semanales o manuales y los motores de consulta local. Suficiente para ver si apareces, no para evaluar cómo.

Preguntas que nos hacen

¿Tengo que rellenar todo el Perfil de Verdad de Marca?

Todos los campos son opcionales, pero el perfil es el patrón de medida, así que uno vacío significa cero veredictos de desviación o paridad. La descripción canónica, el cliente ideal y las capacidades clave hacen casi todo el trabajo. Empieza por esos tres y añade el resto según veas qué se marca.

¿Se marca una respuesta por dejarse funciones fuera?

No. La paridad de características evalúa información incorrecta, y omitir una función no es un fallo. Una respuesta que es correcta pero solo menciona dos de tus seis productos sigue siendo buena. Solo se marca una afirmación falsa: una capacidad negada, una capacidad inventada o la función de un competidor atribuida a ti.

¿Cómo sé que un veredicto no es una alucinación?

Cada veredicto lleva un motivo de una frase que tiene que nombrar la afirmación concreta de la que habla, y los veredictos de sentimiento llevan una cita exacta copiada de la respuesta. Si la llamada de puntuación falla, los campos se quedan vacíos en vez de rellenarse con una suposición.

¿Qué motores puede leer?

ChatGPT, Claude, Gemini, Grok, Perplexity, Google AI Mode, Google AI Overviews y Bing Copilot. Para ChatGPT, Grok, Perplexity y Google AI Mode hay rutas que leen lo que responde el producto de consumo real, con una alternativa por API si esa consulta falla. Cada observación registra qué ruta la produjo.

¿Una sola respuesta mala puede mover mis números?

Menos de lo que te imaginas, porque el mismo prompt y motor se pueden muestrear hasta cinco veces por ejecución y los resultados llevan un margen de confianza Wilson del 95%. Las muestras repetidas también se agrupan en un solo veredicto en listas, emails y alertas, así que un prompt muy citado no inunda el informe.

Más cosas que preguntarle a Moose

Todos los casos de uso
Evaluado contra tus propias palabras

Escribe lo que es cierto.
Y luego exígeselo a cada respuesta.

Rellena el Perfil de Verdad de Marca una vez, lanza un escaneo y lee cada frase que no cuadre con él. Así discutes con algo concreto en vez de con una sensación.