Antropus
IA & GEO

Prompt Tracker

Prompt Tracker (antes Baseline GEO) es la herramienta de medición de visibilidad en IA de Antropus.

Un baseline GEO es la radiografía de tu visibilidad en los motores de IA generativa: ChatGPT, Claude, Gemini, Perplexity y Google AI (AI Mode y AI Overview). Mide, prompt a prompt y motor a motor, si te mencionan, si te citan como fuente, qué URL tuya citan, en qué posición apareces y con cuánta fuerza te recomiendan.

A diferencia del SEO clásico, en la IA no existe un ranking visible. Una marca puede dominar Google y ser invisible en ChatGPT, o al revés. El baseline convierte esa "caja negra" en métricas accionables.


Qué es y para qué sirve

La IA se ha convertido, para muchas búsquedas, en la primera (y a veces única) fuente de información del usuario. El baseline responde preguntas como:

  • ¿Aparece mi marca cuando la IA habla de mi sector?
  • Cuando aparezco, ¿me recomienda o solo me nombra de pasada?
  • ¿La IA cita mi web como fuente, o atribuye mi mérito a terceros?
  • ¿Me lleva a la página correcta?
  • ¿La IA me confunde con otra marca o inventa datos sobre mí?

El resultado es un punto de partida ("baseline") medible que luego puedes comparar en el tiempo para saber si tu estrategia GEO funciona.


La metodología: protocolo HSA y cuatro fuentes

El baseline no es un conteo simple de "sales o no sales". Operacionaliza el protocolo HSA (Human · Search · AI): combina contenido útil para personas, optimización para buscadores y señales orientadas a los motores de IA generativa. Sobre esa base, cada respuesta se evalúa cruzando cuatro fuentes de información:

FuentePara qué se usa
La respuesta real del motorDetectar mención, posición, Top 3, sentimiento y alucinaciones.
Las fuentes que el motor citaCalcular citación, citación de marca, fuentes totales y de marca, Share of Sources y Share of Answer.
Tu ficha de entidadSaber qué marca, dominio oficial, alias y homónimos cuentan como "tú" — y cuáles NO.
Tu mapa intención → URLValidar si la URL de marca citada es la correcta para ese prompt.

En una frase: la ficha de entidad responde "¿esta fuente o URL es mía?" y el mapa intención → URL responde "¿es la página correcta para esta pregunta?". Sin esas dos referencias, el baseline mide presencia, pero no la calidad de la atribución.


Cómo funciona, paso a paso

  1. Defines los prompts: las preguntas que un usuario real le haría a la IA sobre tu sector ("mejores agencias de X", "¿qué es tu marca?", "alternativas a tu competidor"…).
  2. Eliges los motores contra los que medir.
  3. Antropus lanza cada prompt contra cada motor con búsqueda web activa: medimos lo que la IA responde hoy, en producción (con acceso a internet en tiempo real), no lo que "recuerda" de su entrenamiento.
  4. Cada respuesta pasa por un análisis automático que detecta: mención de marca, fuentes citadas, URL concreta, posición en listas, tono, confusión de entidad y alucinaciones.
  5. Con todo eso se calculan las métricas y se construye el informe.

El baseline se ejecuta en segundo plano. Puedes cerrar la pestaña y volver más tarde: verás el progreso en tiempo real ("48 de 100 mediciones completadas") y el resultado se guarda solo al terminar. Si lo necesitas, puedes cancelarlo a mitad.


Qué necesitas antes de empezar

RequisitoPara qué sirve
Un proyectoDefine tu marca, sector, dominio y país.
Ficha de entidad (muy recomendado)Tu dominio oficial + los nombres con los que NO debes confundirte (homónimos). Sin ella, una respuesta sobre otra empresa parecida podría contarse como tuya.
Mapa intención → URL (opcional)Qué página debería citar la IA para cada tipo de pregunta. Es lo que habilita la métrica URL correcta.
PromptsGenerados automáticamente, cargados de tu biblioteca o escritos a mano.

Las tres formas de trabajar con baselines

1. Crear baseline (/baseline)

El flujo principal. Tienes tres maneras de aportar los prompts:

  • Automático: indicas cuántos prompts quieres y Antropus los genera repartidos en categorías metodológicas (marca directa, atributos, competitivos, segmentados, transaccionales y long-tail), para que la medición sea representativa y no sesgada.
  • Biblioteca: reutilizas un conjunto de prompts que ya tenías guardado.
  • Manual: escribes tú cada prompt, uno a uno.

2. Importar baseline (/baseline/import)

Para cuando ya capturaste las respuestas por tu cuenta (en una hoja de cálculo, por ejemplo) y quieres analizarlas dentro de Antropus. Subes un Excel con el prompt, el motor, la respuesta y las fuentes citadas, y Antropus aplica el mismo análisis que en un baseline normal. No genera prompts ni consulta a la IA (ya traes las respuestas).

3. Comparar baselines (/baseline/compare)

El "antes vs. después". Eliges dos baselines del mismo proyecto y Antropus calcula la evolución de cada métrica (SoR, citación, URL correcta, Top 3) sobre los motores comunes a ambos, y emite un veredicto del tipo:

  • Mejora consolidada — subes en recomendación sin retrocesos.
  • Mejora parcial / superficial — avanzas, pero con tensiones (p. ej. te recomiendan más pero sin citar tus fuentes).
  • Debilidad persistente o regresión peligrosa — caes en varias métricas.
  • Sin cambios — todo plano.

Modos de medición

Web vs. memoria

  • Web (modo estándar): el motor busca en internet al responder. Mide tu visibilidad real en producción. Es el modo por defecto porque es el que importa: refleja lo que un usuario ve hoy.
  • Memoria: el motor responde solo con su conocimiento de entrenamiento, sin buscar. Útil solo en análisis de laboratorio; poco fiable para decidir (penaliza a marcas nuevas o de poca cobertura histórica).

Modo fiabilidad (repetición)

La IA no siempre responde igual a la misma pregunta. El modo fiabilidad repite cada medición para medir esa consistencia:

  • Off — 1 ejecución por medición. Rápido y económico.
  • Lite — 3 ejecuciones. Detecta si la IA es inestable contigo.
  • Full — 5 ejecuciones. Para decisiones críticas (rebranding, inversiones).

Cuantas más repeticiones, más fiable es el dato (y más créditos y tiempo consume, proporcionalmente).


Los motores de IA

Se dividen en dos familias:

  • Conversacionales: ChatGPT, Claude, Gemini y Perplexity. Dan respuestas largas y narrativas, con búsqueda integrada.
  • Google AI: Google AI Mode y Google AI Overview. Respuestas más concisas que aparecen en el propio Google. Nota: AI Overview solo se mide cuando Google decide mostrarlo para ese prompt (no siempre se dispara); AI Mode responde de forma más consistente.

Cada prompt se mide contra cada motor seleccionado, así que el total de mediciones es: prompts × motores × repeticiones del modo fiabilidad.


Las métricas, en detalle

Todas se calculan solo sobre respuestas aplicables: aquellas donde la entidad es correcta (la IA habla de ti, no de un homónimo) y la medición no falló. Una respuesta que confunde tu marca con otra parecida no suma ni resta — se descarta.

Las cuatro titulares del dashboard

MétricaQué mideCómo se calcula
SoR · Share of RecommendationLa fuerza media con la que la IA te recomienda. Es la métrica titular.Cada mención recibe una puntuación de recomendación de 0 a 1 (1 = eres la opción principal o líder; 0,75 = recomendada; 0,5 = neutra/descriptiva; 0,25 = con crítica o duda; 0 = negativa). SoR es la media de esas puntuaciones sobre las respuestas en las que se pudo medir. Si en ninguna se pudo medir, el dashboard muestra "—" (no inventa un 0).
Citación de marca · BCR% de respuestas con al menos una fuente de tu dominio oficial.Respuestas con fuente de marca ÷ respuestas aplicables × 100.
URL correcta · RDe las respuestas con mapa intención→URL, % donde la IA cita la página correcta para esa pregunta.URLs de marca correctas ÷ respuestas con URL mapeada × 100.
Top 3En respuestas que son listas o rankings, % donde apareces en posiciones 1–3.Apariciones en Top 3 ÷ respuestas con ranking × 100.

SoR vs. SoM: una marca puede aparecer en todas las respuestas (SoM alto) y aun así tener SoR bajo, porque la IA solo la nombra de pasada sin recomendarla. SoR es lo que mueve negocio; SoM es el diagnóstico de presencia.

Presencia y reconocimiento

  • Mención (P) — la marca aparece nombrada explícitamente en la respuesta. Es la unidad base.
  • SoM · Share of Mentions — % de respuestas que te mencionan. Presencia binaria, sin ponderar fuerza. Diagnóstica (sub-texto del dashboard).
  • Entidad correcta (ENT) — la respuesta habla de ti y no de otra empresa con nombre parecido. Es el filtro antifalsos-positivos: si la IA te confunde con un homónimo, la respuesta no cuenta como tuya.

Citación y fuentes

  • Citación (Q) — la respuesta atribuye a alguna fuente: un enlace/panel de fuentes o una cita textual en el cuerpo ("según X", "fuente: …"). No mira si la fuente es tuya. Diagnóstico del motor.
  • Fuentes totales — número de fuentes detectadas en la respuesta, tuyas o ajenas.
  • Fuentes de marca — cuántas de esas fuentes son de tu dominio oficial.
  • SoS · Share of Sources — fuentes de marca ÷ fuentes totales × 100. Tu peso dentro de las fuentes que muestra el motor.
  • SoA · Share of Answer — URLs visibles de marca ÷ URLs visibles totales en el cuerpo × 100. Distingue aparecer en el panel de fuentes de aparecer dentro del texto.

Atribución de URL

  • URL de marca detectada — si entre las URLs citadas hay alguna de tu dominio oficial.
  • URL citada de marca — la página concreta tuya que el motor mostró.
  • URL canónica esperada — la página que TÚ definiste como correcta para ese prompt en el mapa intención→URL.
  • URL correcta (R) — la URL citada de marca coincide con la esperada (o con otra aceptable del mismo clúster). No basta con que te citen: deben llevar a la página adecuada.

Prominencia competitiva

  • Top 3 (T3) — apareces en posiciones 1–3 de una lista, ranking o comparativa.
  • Posición detectada — la posición concreta en la que sales, para interpretar el Top 3.

Calidad de la respuesta

Sentimiento — el tono con el que la IA te trata cuando apareces:

ValorEtiquetaCuándo
0Sin menciónNo apareces.
0,25NegativoApareces con crítica, duda o advertencia.
0,5NeutroApareces de forma descriptiva.
0,75PositivoApareces recomendada o bien valorada.
1Muy positivoApareces como opción principal, líder o referencia.

Si hay confusión de entidad, no se asigna sentimiento positivo aunque el tono parezca favorable.

Alucinación — si la respuesta contiene un error que afecta a la validez del dato, y de qué tipo:

TipoCuándo se marca
Confusión de entidadTe confunde con otra empresa o marca.
Atribución erróneaAsigna una fuente, URL, servicio o mérito a quien no es.
Confusión de siglasInterpreta mal siglas como GEO, HSA o AEO.
Factual inventadaInventa un dato concreto, no verificable o falso.
Topic driftSe desvía del tema o no responde a la intención del prompt.
NingunaSin error relevante.

El informe calcula y registra todas estas métricas, respuesta a respuesta. Tienes la fórmula exacta de cada una en el Glosario de métricas.


Cómo leer el informe

El informe de un baseline se organiza así:

  • Cabecera: los 4 gauges grandes (SoR, Citación de marca, URL correcta, Top 3), con SoM y Citación como sub-texto diagnóstico.
  • Por motor: tabla con cada métrica desglosada por motor. Detecta dónde eres fuerte y dónde débil (p. ej. "Claude me recomienda al 80%, Gemini al 35%").
  • Por categoría: las mismas métricas por tipo de prompt (marca directa, competitivos…). Detecta qué tipo de pregunta es tu punto flojo.
  • Registro: una fila por cada respuesta, con todos los indicadores (mención, citación, URL correcta, posición, sentimiento, alucinación). Clic en una fila para ver la respuesta completa y las fuentes.
  • Inteligencia: análisis automático de debilidades y oportunidades, con notas accionables.
  • Alucinaciones: filtra las respuestas donde la IA se equivocó sobre ti, con el tipo de error.

Puedes exportar el informe a Excel (métricas + registro completo + resumen) o PDF (con la marca del proyecto en los planes que incluyen white-label).


Cuánto suele tardar

Cada medición tarda unos segundos. Un baseline típico de 25 prompts × 4 motores conversacionales (unas 100 mediciones) suele estar listo en 10–20 minutos. Activar el modo fiabilidad multiplica el tiempo (×3 en Lite, ×5 en Full). Como corre en segundo plano, no tienes que esperar mirando la pantalla.


Cuánto consume (créditos)

El coste en créditos de un baseline depende de tres factores:

  1. Número de prompts.
  2. Número de motores (cada motor añadido multiplica las mediciones).
  3. Modo fiabilidad (Off ×1 · Lite ×3 · Full ×5).

Antes de lanzar, Antropus te muestra el coste exacto estimado y bloquea el lanzamiento si no te llega el saldo. Como orientación: las mediciones en motores conversacionales consumen del orden de 1–2 créditos cada una, mientras que las de Google AI cuestan una fracción. Un baseline de 25 prompts × 4 motores conversacionales ronda los 150 créditos.


Disponibilidad y límites por plan

FreeLiteStarterProAgency
Prompts por baseline58102025
Baselines1 de por vida12/mes16/mes32/mes48/mes
Motores2 (Google IA)4466
Modo fiabilidad×3×3×5
Baselines en paralelo11123

Los 6 motores (ChatGPT, Claude, Gemini, Perplexity, Google AI Mode y Google AI Overview) están disponibles desde Pro. Lite y Starter miden en 4 (ChatGPT, Gemini y los dos de Google AI); el plan Free mide solo en Google AI (Mode y Overview) y permite un único baseline de por vida (sin renovación). El modo fiabilidad ×3 llega desde Starter y el ×5 es exclusivo de Agency.

Existen además cuotas de prompts por día, semana y mes (para proteger la calidad del servicio). Si lanzas un baseline que excede tu cuota diaria, se bloquea aunque te quede cuota mensual; basta con esperar o reducir el tamaño.


Errores y casos frecuentes

  • "Créditos insuficientes" — reduce el nº de prompts o de motores antes de lanzar (verás cómo baja el coste estimado en tiempo real).
  • "Motor no disponible en tu plan" — algunos motores (Claude, Perplexity) requieren Pro o superior.
  • "Has superado tu cuota de prompts" — espera al reinicio del periodo o reduce el tamaño del baseline.
  • Una medición sale como fallida — el motor pudo estar caído puntualmente. Aparece marcada en el Registro; puedes relanzar el baseline más tarde.
  • "Entidad incorrecta" en una respuesta — la IA habló de otra marca parecida a la tuya. Refuerza tu ficha de entidad añadiendo ese homónimo a la lista de "no confundir".
  • Google AI Overview no devuelve nada — es normal: Google no siempre dispara AI Overview. Si necesitas cobertura constante en Google, apóyate en AI Mode.

Conceptos clave (códigos del registro)

CódigoMétricaQué mide
SoRShare of RecommendationFuerza media de recomendación (titular).
SoMShare of Mentions% de respuestas que te mencionan.
PMenciónApareces nombrada en la respuesta.
QCitaciónLa respuesta atribuye a alguna fuente.
BCRCitación de marcaHay una fuente de tu dominio (titular).
RURL correctaLa URL citada coincide con el mapa intención→URL.
T3Top 3Apareces en posiciones 1–3 de un ranking.
ENTEntidad correctaLa respuesta habla de ti, no de un homónimo.
SoSShare of SourcesTu peso dentro de las fuentes citadas.
SoAShare of AnswerTu peso dentro de las URLs visibles del cuerpo.

¿Quieres aprender a montar tu primer baseline paso a paso? Eso lo verás en la Academia. Esta documentación es la referencia técnica: el "qué" y el "cómo se mide".

#prompt tracker#baseline#geo#visibilidad#ia#chatgpt#gemini#claude#perplexity#google ai overview#sor#citación#métricas#informe#fiabilidad