Es fácil hacer que las cifras de “visibilidad en IA” (AI visibility) muestren lo que uno quiera: se le pregunta al modelo una vez, se captura una respuesta favorable y se pone en un informe. Nosotros no trabajamos así. En esta página explicamos cómo mide Brandometer lo que los asistentes de IA dicen de las marcas, por qué indicamos tasas de mención en lugar de “posiciones” y qué nos negamos a prometer.

Una sola respuesta de la IA no demuestra nada

Un modelo de lenguaje genera texto de forma probabilística. En cada paso elige la siguiente palabra a partir de una distribución; no recupera una respuesta ya hecha. Haz la misma pregunta dos veces en las mismas condiciones y obtendrás dos respuestas distintas. Hoy el modelo nombra tu marca; mañana enumera a tres competidores y te deja fuera, y para el modelo ambas respuestas son igual de “correctas”.

Una comprobación aislada es una única extracción al azar de la distribución de respuestas posibles. Sacar conclusiones de ella es como juzgar si una moneda está equilibrada con un solo lanzamiento. Cualquier herramienta que indique la “posición en ChatGPT” de una marca a partir de una sola consulta está mostrando ruido.

Series de ejecuciones independientes en sesiones limpias

En lugar de preguntar una vez, ejecutamos una serie: cada prompt (la pregunta que se le hace a la IA) se plantea varias veces a cada motor. Cada ejecución debe ser una observación independiente, por eso se realiza en una sesión limpia:

  • Una conversación nueva y sin historial, para que las respuestas anteriores no influyan en las siguientes.
  • Sin personalización, memoria ni perfil de usuario, para que el modelo no se adapte a quien pregunta.
  • La misma redacción del prompt y la misma configuración de una medición a otra. De lo contrario, las semanas no se pueden comparar entre sí.

Es una simplificación deliberada. Los usuarios reales reciben respuestas personalizadas, y esas no podemos reproducirlas. Una sesión limpia ofrece una base reproducible e igual para todos: lo que el modelo dice por defecto, cuando no sabe nada de quien pregunta.

De dónde salen las respuestas

Enviamos cada prompt a la interfaz oficial para desarrolladores (API) del motor, con la búsqueda web activada. La solicitud usa la misma familia de modelos que la aplicación para el público general, sin historial de chat ni personalización.

DeepSeek es una excepción. Su interfaz para desarrolladores no tiene búsqueda web, así que en DeepSeek medimos lo que el propio modelo sabe de tu marca.

Google AI Overviews (los resúmenes de IA de Google) no tiene interfaz para desarrolladores. Leemos esos resúmenes en la página pública de resultados de Google para el país y el idioma de tu proyecto. Google no muestra un AI Overview para todas las consultas. Cuando no lo hay, la observación se registra como “sin respuesta de IA”: queda fuera de las tasas y los créditos correspondientes se reembolsan.

Cada proyecto tiene un idioma y, opcionalmente, un país. Los prompts se formulan en el idioma del proyecto. Cuando la interfaz de un motor acepta la ubicación aproximada del usuario para la búsqueda web, le pasamos el país del proyecto. Algunos motores no ofrecen esa opción. En ellos, la localización se basa en el prompt: depende del idioma del prompt y de una instrucción breve y neutral, no de una ubicación real.

Los motores que seguimos actualmente, y el precio de una comprobación en cada uno, figuran en la página de precios.

Tasas de mención en lugar de “posiciones”

Una respuesta de IA no tiene posiciones en el sentido del SEO. Una marca entra en el texto generado o no entra, y eso cambia de una ejecución a otra. Por eso nuestra métrica principal es una tasa: la proporción de respuestas de una serie que mencionan la marca y la proporción que la recomiendan de forma explícita. “La marca se menciona en el 60 % de las respuestas de ChatGPT a esta pregunta” es una afirmación con sentido y que se puede verificar. “La marca ocupa la segunda posición en ChatGPT” no lo es.

Intervalos de confianza de Wilson del 95 %

Una tasa calculada a partir de una serie corta también está sujeta al azar: 6 menciones en 10 ejecuciones no significan exactamente un 60 %. Por eso cada tasa va acompañada de un intervalo de confianza del 95 %, calculado con el método de Wilson. Dicho de forma sencilla, es el rango en el que muy probablemente se encuentra la tasa real. Para 6 de 10, ese rango va aproximadamente del 31 % al 83 %.

Elegimos el método de Wilson por un motivo. A diferencia de la aproximación normal simple, se comporta correctamente con series cortas y con tasas cercanas al 0 % y al 100 %, dos situaciones habituales en el seguimiento de marcas, donde una marca no aparece en casi ninguna respuesta o aparece en casi todas.

En la práctica: una subida del 40 % al 50 % con intervalos que se solapan todavía no es crecimiento. Es ruido. Mostramos los intervalos para que no bases tus decisiones en fluctuaciones aleatorias.

“El modelo nombró la marca” y “el modelo aconsejó elegir la marca” son hechos distintos y con distinto valor. Una mención que solo completa una lista, una enumeración neutral y una recomendación explícita (“yo elegiría X porque…”) influyen de forma diferente en la decisión de compra. Una simple búsqueda del nombre de la marca en el texto no distingue estos casos. Además, tropieza con las formas flexionadas, las variantes ortográficas, la transliteración y las empresas homónimas que no tienen nada que ver.

Por eso un clasificador basado en un modelo de lenguaje (LLM) etiqueta cada respuesta en un paso aparte: si la marca se menciona, si se recomienda de forma explícita y qué competidores se nombran junto a ella.

En ese mismo paso se registra el sentimiento: si la respuesta habla de tu marca en tono positivo, neutral o negativo. El sentimiento se evalúa específicamente para tu marca, no para la respuesta en su conjunto.

El clasificador también es un modelo y puede equivocarse. Por eso cada etiqueta se puede contrastar con el texto original de la respuesta (véase más abajo), y revisamos a mano muestras del etiquetado con regularidad.

El modelo que hay detrás de cada respuesta queda registrado

“ChatGPT” o “Gemini” no son un único modelo. Son nombres de producto, y los modelos que hay detrás cambian con regularidad. Un cambio de modelo puede mover tus métricas de un día para otro sin que hayas hecho nada. Por eso guardamos, para cada respuesta, el motor y la versión exacta del modelo que la generó, y los mostramos junto a ella. Si tu tasa de mención da un salto el día en que se actualizó un modelo, el mérito es de la actualización y no de tu última publicación; el registro evita que se confundan.

Respuestas íntegras y sin procesar como prueba

Cada cifra de Brandometer se puede rastrear hasta los datos primarios. Guardamos el texto completo de cada respuesta junto con su fecha, el motor, la versión del modelo y las fuentes citadas. Cualquier tasa, etiqueta de sentimiento o mención de un competidor se puede verificar abriendo las respuestas concretas a partir de las cuales se calculó. No te fíes de los agregados que llegan sin datos primarios, tampoco de los nuestros.

Lo que no prometemos

Nadie puede controlar directamente las respuestas de la IA. Por eso no prometemos, ni prometeremos nunca:

  • “Mejores posiciones en ChatGPT”. Ahí no hay posiciones, y nadie puede garantizar que una marca aparezca en un texto que se genera de forma probabilística. Quien ofrece esa garantía no está siendo sincero contigo.
  • “Presencia garantizada en las respuestas de IA”. Nadie tiene acceso al interior de un modelo ajeno.
  • Resultados inmediatos. Los cambios en las fuentes llegan a las respuestas con un retraso que va de días a meses, según el motor.

Lo que sí hacemos: medir con honestidad el estado actual, mostrar las fuentes en las que se apoyan los modelos y registrar qué cambia después de que actúes, de una forma que separa el efecto real del ruido y de un cambio de modelo. En la visibilidad solo se puede influir de forma indirecta, a través de las fuentes, y el resultado siempre es probabilístico.

Limitaciones de la metodología

Para que el panorama sea completo, estos son los límites del método:

  • Medimos las respuestas a tu conjunto de prompts. Es una muestra, no todas las formulaciones que se les ocurren a los usuarios reales.
  • Las sesiones limpias dejan fuera la personalización: un usuario concreto puede recibir una respuesta distinta.
  • Las respuestas llegan a través de las interfaces para desarrolladores, no de las aplicaciones para el público general. La familia de modelos es la misma, pero cada aplicación añade su propia configuración, tu historial y tu ubicación, por lo que la respuesta en tu pantalla puede variar ligeramente.
  • En los motores sin opción de ubicación, la localización depende únicamente del prompt, que es una señal más débil que una ubicación real.
  • Las tasas obtenidas de una serie de ejecuciones son estimaciones estadísticas con un intervalo, no un censo de todo lo que dice un motor.

Creemos que unas cifras honestas con salvedades son más útiles que unas cifras pulidas sin ellas. Si tienes preguntas sobre la metodología, escribe a support@brandometer.ai y repasaremos los detalles.