É fácil fazer os números de “visibilidade em IA” mostrarem o que se quiser: basta perguntar a um modelo uma vez, pegar uma resposta favorável e colocá-la em um relatório. Nós não trabalhamos assim. Esta página explica como o Brandometer mede o que os assistentes de IA dizem sobre as marcas, por que informamos taxas de menção em vez de “posições” e o que nos recusamos a prometer.

Uma única resposta de IA não prova nada

Um modelo de linguagem gera texto de forma probabilística. A cada passo, ele escolhe a próxima palavra a partir de uma distribuição; não recupera uma resposta pronta. Faça a mesma pergunta duas vezes, nas mesmas condições, e você receberá duas respostas diferentes. Hoje o modelo menciona sua marca; amanhã, lista três concorrentes e deixa você de fora. E, para o modelo, as duas respostas são igualmente “corretas”.

Uma análise isolada é um único sorteio na distribuição de respostas possíveis. Tirar conclusões dela é como julgar se uma moeda é honesta com um único lançamento. Qualquer ferramenta que informe a “posição no ChatGPT” de uma marca a partir de uma única consulta está informando ruído.

Séries de execuções independentes em sessões limpas

Em vez de perguntar uma vez, executamos uma série: cada prompt (a pergunta feita à IA) é enviado a cada motor várias vezes. Cada execução precisa ser uma observação independente; por isso, acontece em uma sessão limpa:

  • Uma conversa nova, sem histórico, para que as respostas anteriores não influenciem as seguintes.
  • Sem personalização, memória ou perfil de usuário, para que o modelo não se adapte a quem pergunta.
  • A mesma redação do prompt e as mesmas configurações de uma medição para a outra. Do contrário, não é possível comparar as semanas entre si.

É uma simplificação deliberada. Usuários reais recebem respostas personalizadas, e não temos como reproduzi-las. A sessão limpa fornece uma linha de base reproduzível, igual para todos: o que o modelo diz por padrão, quando não sabe nada sobre quem pergunta.

De onde vêm as respostas

Enviamos cada prompt à interface oficial para desenvolvedores (API) do motor, com a busca na web ativada. A solicitação usa a mesma família de modelos do aplicativo voltado ao consumidor, sem histórico de conversas e sem personalização.

Uma exceção é o DeepSeek. Sua interface para desenvolvedores não tem busca na web; por isso, no caso do DeepSeek, medimos o que o próprio modelo sabe sobre sua marca.

O Google AI Overviews (Visão Geral de IA) não tem interface para desenvolvedores. Nós o lemos na página pública de resultados do Google, para o país e o idioma do seu projeto. O Google não exibe um AI Overview para todas as consultas. Quando não há nenhum, a observação é registrada como “sem resposta de IA”: ela fica fora das taxas, e os créditos correspondentes são devolvidos.

Todo projeto tem um idioma e, opcionalmente, um país. Os prompts são enviados no idioma do projeto. Quando a interface de um motor aceita a localização aproximada do usuário para a busca na web, informamos o país do projeto. Alguns motores não oferecem essa configuração. Para eles, a adaptação ao país é feita pelo prompt: ela se apoia no idioma do prompt e em uma instrução curta e neutra, e não em uma localização real.

Os motores que acompanhamos atualmente e o preço de uma análise em cada um deles estão na página de preços.

Taxas de menção em vez de “posições”

Uma resposta de IA não tem posições no sentido do SEO. Uma marca entra ou não no texto gerado, e isso muda de uma execução para outra. Por isso, nossa métrica principal é uma taxa: a parcela das respostas de uma série que mencionam a marca e a parcela que a recomenda explicitamente. “A marca é mencionada em 60% das respostas do ChatGPT a esta pergunta” é uma afirmação que faz sentido e pode ser verificada. “A marca está em segundo lugar no ChatGPT” não é.

Intervalos de confiança de Wilson de 95%

Uma taxa calculada a partir de uma série curta também está sujeita ao acaso: 6 menções em 10 execuções não significam exatamente 60%. Por isso, toda taxa vem acompanhada de um intervalo de confiança de 95%, calculado pelo método de Wilson. Em termos simples, é a faixa em que a taxa verdadeira muito provavelmente está. Para 6 em 10, essa faixa vai de cerca de 31% a 83%.

Escolhemos o método de Wilson por um motivo. Ao contrário da aproximação normal ingênua, ele se comporta corretamente em séries curtas e em taxas próximas de 0% e de 100%, duas situações comuns no monitoramento de marcas, em que uma marca aparece em quase nenhuma resposta ou em quase todas.

Na prática: uma alta de 40% para 50% com intervalos que se sobrepõem ainda não é crescimento. É ruído. Mostramos os intervalos para que você não baseie decisões em flutuações aleatórias.

“O modelo mencionou a marca” e “o modelo aconselhou escolher a marca” são eventos diferentes, com valores diferentes. Uma menção que apenas completa uma lista, uma enumeração neutra e uma recomendação explícita (“eu escolheria X porque…”) influenciam a decisão do comprador de maneiras diferentes. Uma simples busca textual pelo nome da marca não distingue esses casos. Ela também tropeça em formas flexionadas, variantes de grafia, transliterações e empresas homônimas sem nenhuma relação com a sua.

É por isso que cada resposta é rotulada, em uma etapa separada, por um classificador baseado em LLM (large language model, grande modelo de linguagem): se a marca é mencionada, se é recomendada explicitamente e quais concorrentes aparecem ao lado dela.

A mesma etapa registra o sentimento: se a resposta fala da sua marca de forma positiva, neutra ou negativa. O sentimento é avaliado especificamente em relação à sua marca, e não à resposta como um todo.

O classificador também é um modelo e pode errar. Por isso, cada rótulo pode ser conferido no texto bruto da resposta (veja abaixo), e revisamos manualmente, com regularidade, amostras da rotulagem.

O modelo por trás de cada resposta fica registrado

“ChatGPT” ou “Gemini” não é um único modelo. É um nome de produto, e os modelos por trás dele mudam regularmente. Uma troca de modelo pode alterar suas métricas da noite para o dia, sem nenhuma ação da sua parte. Por isso, para cada resposta armazenamos o motor e a versão exata do modelo que a gerou, e mostramos essa informação ao lado da resposta. Se sua taxa de menção der um salto no dia em que um modelo foi atualizado, o mérito é da atualização, e não da sua publicação mais recente. O registro evita que as duas coisas sejam confundidas.

Respostas brutas completas como evidência

Todo número no Brandometer pode ser rastreado até os dados primários. Armazenamos o texto completo de cada resposta, com data, motor, versão do modelo e fontes citadas. Qualquer taxa, rótulo de sentimento ou menção a concorrente pode ser verificado abrindo as respostas específicas a partir das quais foi calculado. Não confie em dados agregados que vêm sem os dados primários, nem mesmo nos nossos.

O que não prometemos

Ninguém controla diretamente as respostas de IA. Por isso, não prometemos, nem vamos prometer:

  • “Posições mais altas no ChatGPT”. Lá não existem posições, e ninguém pode garantir que uma marca apareça em um texto gerado de forma probabilística. Quem dá essa garantia não está sendo honesto com você.
  • “Presença garantida nas respostas de IA”. Ninguém tem acesso ao interior do modelo de outra empresa.
  • Resultados instantâneos. As mudanças nas fontes chegam às respostas com um atraso de dias a meses, dependendo do motor.

O que fazemos: medimos com honestidade o estado atual, mostramos as fontes em que os modelos se baseiam e registramos o que muda depois que você age, de um modo que separa o efeito real do ruído e de uma troca de modelo. A visibilidade só pode ser influenciada de forma indireta, por meio das fontes, e o resultado é sempre probabilístico.

Limitações da metodologia

Para que o quadro fique completo, é aqui que o método chega ao limite:

  • Medimos as respostas ao seu conjunto de prompts. É uma amostra, e não todas as formulações que os usuários reais inventam.
  • As sessões limpas deixam de fora a personalização: um usuário específico pode receber uma resposta diferente.
  • As respostas vêm das interfaces para desenvolvedores, e não dos aplicativos voltados ao consumidor. A família de modelos é a mesma, mas o aplicativo acrescenta suas próprias configurações, o seu histórico e a sua localização; por isso, a resposta na sua tela pode ser um pouco diferente.
  • Nos motores sem configuração de localização, a adaptação ao país depende apenas do prompt, um sinal mais fraco do que uma localização real.
  • As taxas obtidas em uma série de execuções são estimativas estatísticas com um intervalo, e não um censo de tudo o que um motor diz.

Acreditamos que números honestos com ressalvas são mais úteis do que números polidos sem elas. Se tiver dúvidas sobre a metodologia, escreva para support@brandometer.ai e explicaremos os detalhes.