Saltar al contenido
Investigación GEO · Baseline T3 2026

De la medición manual a Antropus

Tres formas de medir el mismo baseline: manual (Protocolo HSA), importada y nativa.

15 prompts × 3 motores (ChatGPT · Gemini · Perplexity) = 45 tests · España · modo web

Publicado24/07/2026
01 · Contexto y objetivo

De baselines manuales a un sistema automático

Durante aproximadamente nueve meses se ha medido la visibilidad de la marca Elevam en los motores de IA generativa mediante baselines manuales (T1, T2 y T3), conforme al Protocolo HSA (Human · Search · AI). Dicha medición es rigurosa y trazable, pero se ejecuta de forma artesanal: los prompts se lanzan uno a uno en las aplicaciones oficiales, las respuestas se copian manualmente y cada test se codifica a mano.

Este informe documenta la evolución de ese trabajo hacia Antropus, la herramienta que operacionaliza el Protocolo HSA y lo convierte en un sistema automático, consistente y auditable. Para hacerlo con transparencia, un mismo baseline —el T3— se ha medido de tres formas distintas y se han comparado entre sí:

Vía manual

Medición humana original, sobre las respuestas capturadas en las aplicaciones oficiales.

Vía importada

Esas mismas respuestas, analizadas por Antropus en lugar de por una persona.

Vía nativa

Antropus midiendo de principio a fin por su cuenta, con los mismos prompts.

Objetivo

No se pretende determinar «quién acierta» —la medición manual tampoco constituye una verdad absoluta—, sino responder a una pregunta más útil: en qué grado concuerda Antropus con una medición manual rigurosa y qué aporta allí donde difiere. Cuando dos métodos independientes miden lo mismo y coinciden, la medición gana solidez; donde no coinciden, se documenta el motivo.

02 · Metodología de la comparación

Mismo material, tres vías

Las tres vías parten del mismo material —los mismos quince prompts sobre la marca, sus servicios y su formación, distribuidos en seis tipos de intención de búsqueda— y se diferencian en dos variables: quién puntúa las respuestas y por qué canal se obtienen.

VíaCómo se obtienen las respuestasQuién las puntúa
ManualAplicaciones oficiales (ChatGPT, Gemini, Perplexity), con navegación activadaUna persona, conforme al Protocolo HSA
ImportadaLas mismas respuestas de las aplicaciones, importadas a AntropusAntropus (automático)
NativaAntropus consulta los motores por su cuenta, a través de la APIAntropus (automático)
Aislamiento de variables

Esta separación en tres vías permite atribuir cada diferencia a una causa concreta. La comparación entre la vía manual y la importada mantiene constantes los datos y cambia únicamente el evaluador (humano frente a Antropus), por lo que aísla el método de puntuación. La comparación entre la importada y la nativa mantiene constante el evaluador y cambia el canal de obtención, por lo que aísla el canal de medición.

2.1 · Datos de origen

El conjunto de datos está formado por 45 respuestas reales capturadas en las aplicaciones oficiales de ChatGPT, Gemini y Perplexity, en modo web con navegación activada, sesión nueva e incógnito por prompt. De cada test se conservó el prompt exacto, la respuesta íntegra, las URLs del panel de fuentes, la URL canónica esperada y la categoría de intención. Ese mismo material es el que se importó a Antropus para la vía importada. La vía nativa reutilizó únicamente los quince prompts; las respuestas las obtuvo Antropus por su cuenta. Ambos conjuntos de datos se publican íntegros como anexo de este informe.

2.2 · La vía nativa: la aplicación frente a la API

A diferencia de las vías manual e importada —que parten de respuestas obtenidas en las aplicaciones oficiales—, la vía nativa no utiliza dichas aplicaciones: consulta los motores a través de su API. La API es la conexión técnica por la que los programas, y no las personas, acceden de forma automática a un modelo de IA. Dicho de forma sencilla, la aplicación es la puerta por la que entra un usuario y la API es la puerta por la que entran las herramientas y el software.

Conviene precisar que los resultados obtenidos por aplicación y por API nunca serán idénticos. La aplicación oficial es un producto terminado, con sus propios mecanismos para buscar en la web, ordenar las fuentes y adaptar la respuesta; la API ofrece un acceso más directo y con menos capas. Ante la misma pregunta, cada canal puede mostrar fuentes distintas: no se trata de que uno mida bien y otro mal, sino de dos vías diferentes del mismo modelo.

Esto tiene una consecuencia práctica. La mayoría de herramientas de análisis GEO miden por API, dado que automatizar las aplicaciones a gran escala no resulta viable; y la API tiende a mostrar las páginas propias de la marca con menos frecuencia, como se observa en este estudio. Por ello, la forma más fiel a lo que percibe un usuario real es importar las respuestas de la propia aplicación. Antropus admite ambas vías, de modo que la elección no se realiza a ciegas: lo relevante es saber qué mide cada una.

2.3 · Diferencias de diseño declaradas de antemano

Antes de comparar, se declararon las diferencias de definición entre ambos sistemas, con el fin de no presentar como «error» aquello que responde a un criterio distinto:

  • Validez metodológica. Antropus excluye de las métricas los tests contaminados —por ejemplo, cuando la respuesta se desvía del tema—; la medición manual los contabilizaba.

  • Citación. Antropus contabiliza también las citas textuales sin enlace; la medición manual exigía una fuente mostrada.

  • URL correcta. Con URL canónica declarada, Antropus exige la página exacta esperada; la medición manual aceptaba cualquier página del dominio.

  • Top 3. Antropus solo contabiliza rankings ordenados; la medición manual admitía listas no ordenadas.

  • Deduplicación de URLs. La medición manual computa una sola vez la misma URL repetida. En este caso la diferencia no afecta, puesto que se importó el panel de fuentes ya depurado.

2.4 · El denominador canónico

Conforme a la documentación metodológica de Antropus, antes de calcular ninguna métrica los tests se filtran en tres pasos anidados: producidos (sin fallo técnico), aplicables (el motor respondió) y visibles (sin invalidación metodológica). Las métricas se calculan sobre los tests visibles, que constituyen el denominador canónico. Un fallo de proveedor o una respuesta inválida no se contabilizan como «la marca no apareció»: se excluyen, no se penalizan.

En este baseline, de los 45 tests ejecutados, la vía importada deja 42 visibles (validez del 93,3%) y la nativa también 42 visibles, en su caso sobre 44 aplicables, lo que sitúa su validez en el 95,5%. Los tests excluidos por la vía nativa son dos confusiones de entidad —una en ChatGPT y otra en Gemini— más un fallo de proveedor en el propio Gemini, que queda fuera del denominador de aplicables. Por ese motivo el SoM manual (27/45) y el de Antropus (27/42) emplean denominadores distintos, pese a coincidir el número de menciones.

Precisión: la documentación de Antropus describe un flujo general que puede repetir cada test para promediar variabilidad. En esta importación, cada test incorporó la única respuesta capturada manualmente, sin repetición.

Texto del panel Antropus que explica cómo se mide.
Panel Antropus · «Cómo se mide»: el denominador canónico son los tests visibles.
Texto del panel Antropus con los principios de lo que no se hace.
Panel Antropus · «Lo que NO hacemos»: null ≠ 0, el modo no se infiere, sin histórico inventado.
Ver Protocolo HSA (Human · Search · AI)
03 · Las métricas de cada versión

Correspondencia entre las métricas HSA y Antropus

Por transparencia, se deja constancia de que la medición manual y Antropus no emplean exactamente las mismas métricas. Antropus parte de las definidas en el Protocolo HSA e incorpora capas adicionales. La correspondencia es la siguiente:

Métrica manual (HSA)Métrica AntropusQué cambia
Mención (SoM)SoM · MencionesIgual concepto; Antropus verifica además que la mención corresponda a la marca correcta y no a una homónima
Citación (Q)CR · CitaciónAntropus contabiliza también las citas de texto sin enlace («según…»), no solo los enlaces mostrados
¿Hay URL propia citada?CS · Citación de marcaEquivalentes: si aparece alguna página del dominio propio como fuente
URL correcta (R)URL correcta (R)Antropus exige la página canónica esperada para esa intención (criterio más estricto)
Top 3Top 3Antropus solo contabiliza cuando existe una lista realmente ordenada
SoS / SoASoS / SoAMisma definición: cuota de fuentes propias sobre el total
— (no existía)SoR · RecomendaciónNueva: mide con qué fuerza recomienda la IA, no solo si la marca aparece
— (no existía)ValidezNueva: descarta las respuestas no medibles en lugar de contabilizarlas como ausencia
(juicio humano)Verificación de dudasNueva: señala como «sin verificar» aquello que no puede confirmar y lo consulta

Denominadores declarados por Antropus: SoM, CS y CR se calculan sobre tests visibles; Top 3, sobre respuestas con ranking ordenado; URL correcta, sobre respuestas con URL canónica esperada.

04 · Resultados: comparativa de métricas

Las cifras finales de las tres vías

La tabla siguiente recoge las cifras finales de las tres vías sobre el mismo baseline T3. Las columnas manual e importada operan sobre las respuestas capturadas en las aplicaciones entre el 23 y el 25 de junio de 2026; la columna nativa, sobre respuestas obtenidas por API el 23 de julio de 2026. Las cifras de la vía nativa se presentan redondeadas a números enteros, igual que el panel de Antropus; su detalle con decimales figura en el Excel anexo.

MétricaManualImportadaNativaDenominador
Tests ejecutados454545
Tests válidos454242tras validez
Menciones válidas (nº)272723absoluto
SoM60,0%64,3%55%tests válidos
Citación (CR)91,1%100%93%tests válidos
Citación de marca (CS)66,7%*67%41%tests válidos
URL correcta (estricta)60%31%con canónica
Top 3 (base comparable)24,4%≈10%≈7%tests válidos
SoS (cuota de fuentes)14,8%15%17%total fuentes
SoR (recomendación)57,1%45%con RSW medido
Validez93,3%96%tests ejecutados

* La métrica «URL correcta» del método manual equivale funcionalmente a la «Citación de marca» de Antropus, según se explica en «Por qué no coinciden». Las menciones se contabilizan sobre los tests válidos de cada vía: 27 sobre 45 en la manual, 27 sobre 42 en la importada y 23 sobre 42 en la nativa. Las dos primeras columnas no comparten denominador con la tercera, de modo que la comparación pertinente es la de porcentajes, no la de valores absolutos.

Distribución de la validez. En la vía nativa, los 42 tests válidos se reparten en 14 de ChatGPT (93,3% de validez), 13 de Gemini (92,9%) y 15 de Perplexity (100%). El Top 3 se expresa sobre base comparable —el total de tests válidos—, dado que el panel de Antropus lo calcula sobre las respuestas que contienen un ranking ordenado y arroja un 44% en la vía importada y un 27% en la nativa sobre ese denominador restringido.

Captura del panel Antropus con la visión general de la vía importada y un SoR del 57,1%.
Panel Antropus · visión general de la vía importada: SoR 57,1%, «recomendación razonable».
Captura del panel Antropus con la visión general de la vía nativa y un SoR del 45%.
Panel Antropus · visión general de la vía nativa: SoR 45%, «recomendación irregular».
05 · ¿Cuánto concuerda Antropus con la medición manual?

Manual frente a importada: concordancia casi total

La comparación pertinente para responder a esta pregunta es la que enfrenta la vía manual con la importada, dado que ambas operan sobre exactamente las mismas 45 respuestas y solo difieren en el evaluador. En las métricas que miden lo mismo, la concordancia resulta prácticamente total.

Métrica de mismo conceptoManualImportadaConcordancia
Menciones válidas (nº absoluto)2727100%
Menciones · ChatGPT1010100%
Menciones · Gemini88100%
Menciones · Perplexity99100%
Cuota de fuentes propias (SoS)14,8%15%≈99%
Citación de marca66,7%67%≈99,5%

Ambos porcentajes se calculan sobre denominadores distintos —45 tests en la vía manual y 42 en la importada—, por lo que corresponden a treinta y veintiocho casos respectivamente. La coincidencia de los porcentajes es, en parte, efecto de esa diferencia de base. La concordancia plenamente robusta es la del recuento de menciones, que se compara sobre cifras absolutas idénticas y coincide tanto en el total como en el reparto por motor.

Lectura del resultado

La coincidencia no se limita al agregado: el número de menciones es idéntico y su reparto por motor también lo es (10, 8 y 9). Que dos métodos independientes converjan de este modo sobre los mismos datos constituye la forma más sólida de acreditar la fiabilidad de una medición —validez convergente—. La fiabilidad, entendida como consistencia y reproducibilidad, no se afirma: se evidencia.

Alcance de la afirmación

De este resultado no se deduce que Antropus sea «más veraz» en términos absolutos que la medición manual: esta última tampoco constituye un patrón de referencia infalible. Lo que se acredita es que ambos métodos, aplicados a los mismos datos, arrojan el mismo resultado allí donde miden lo mismo. Donde las cifras difieren —URL correcta, Top 3 y validez— no existe desacuerdo, sino una definición más exigente o una métrica nueva, según se detalla a continuación.

06 · Por qué determinadas cifras no coinciden

Cada divergencia tiene una causa identificable

En ningún caso Antropus mide con menor rigor: mide sobre datos más limpios, con criterios más exigentes o incorpora dimensiones que la medición manual no contemplaba.

6.1 · La mención asciende del 60,0% al 64,3%

Antropus detecta el mismo número de menciones que la medición manual: 27. La diferencia porcentual procede exclusivamente del denominador, ya que Antropus excluye tres respuestas que se desvían del tema y no evalúan realmente a la marca. El cálculo no se contamina, por tanto, con casos no válidos. No se mide más: se mide sobre datos más limpios.

6.2 · La citación asciende del 91,1% al 100%

En la medición manual solo se contabilizaba como cita la presencia de un enlace mostrado por el motor. Antropus contabiliza además las citas de texto —del tipo «según determinada fuente»— aunque no se acompañen de enlace. De ahí que su cifra resulte superior: se detectan atribuciones que la revisión visual no registraba.

6.3 · La URL correcta desciende

La medición manual consideraba correcta cualquier URL del dominio propio. Antropus aplica un criterio más estricto: solo se contabiliza como correcta la página canónica esperada para esa intención concreta. Si ante una consulta comparativa el motor enlaza la página de contacto en lugar de la de servicio, la medición manual lo daba por válido y Antropus no. La cifra resultante es menor, pero también más exigente con la calidad de la atribución. Esta distinción explica igualmente por qué la «URL correcta» del método manual equivale, en la práctica, a la «Citación de marca» de Antropus: ambas responden a la pregunta de si el motor cita alguna página propia. La «URL correcta» de Antropus constituye una métrica nueva y más severa.

6.4 · El Top 3 desciende

La medición manual contabilizaba el Top 3 con un criterio flexible. Antropus únicamente lo contabiliza cuando existe una lista realmente ordenada —primera, segunda y tercera posición— y la marca figura en ella; una enumeración sin orden no computa. Se trata, por tanto, de un criterio más estricto sobre qué constituye un ranking.

6.5 · Métricas sin equivalente en la medición manual

Tres dimensiones carecen de contrapartida en el método manual y explican por sí solas parte del valor añadido: el SoR, que pondera la fuerza de la recomendación en lugar de limitarse a registrar la presencia; la validez, que cuantifica qué proporción de la medición es metodológicamente aprovechable; y la verificación de dudas, mediante la cual el sistema señala como «sin verificar» aquellas afirmaciones que no puede confirmar y las somete a consulta en lugar de darlas por buenas.

07 · El canal de medición condiciona el resultado

Importada frente a nativa: aplicación vs API

La comparación entre la vía importada y la nativa mantiene constante el evaluador —en ambas puntúa Antropus— y modifica únicamente el canal por el que se obtienen las respuestas: la aplicación oficial frente a la conexión técnica empleada por las herramientas de análisis. El efecto sobre las métricas de citación resulta acusado.

  • Citación de marca: del 67% al 41%. La marca aparece como fuente en un número sensiblemente menor de respuestas.

  • URL correcta: del 60% al 31%. Y cuando aparece, con menor frecuencia se trata de la página adecuada.

  • Recomendación (SoR): del 57,1% al 45%. La fuerza media con que el motor recomienda la marca también se reduce.

Interpretación

Se trata del mismo modelo consultado por canales distintos. A través de la aplicación —como en la medición manual—, el motor cita con mayor frecuencia las páginas propias de la marca; a través de la API, las cita menos. La conclusión resulta relevante para cualquier marca: la visibilidad en IA depende del canal desde el que se mida. La aplicación refleja lo que percibe un usuario real; la API, lo que perciben las integraciones y herramientas. Ambas son legítimas y responden a preguntas distintas.

Nota metodológica: la vía nativa se ejecutó en fecha posterior a la manual, por lo que una parte de la diferencia es atribuible al transcurso del tiempo. No obstante, la magnitud de la caída —del orden de veintisiete puntos en citación de marca— apunta principalmente al canal.

Panel de fuentes citadas de la vía importada.
Panel Antropus · fuentes citadas (importada): CR 100%, CS 67%, SoS 15%; 16 dominios (8 propios, 8 de terceros).
Panel de fuentes citadas de la vía nativa.
Panel Antropus · fuentes citadas (nativa): CR 93%, CS 41%, SoS 17%; 5 dominios (1 propio, 4 de terceros).
08 · Radiografía por motor y por tipo de búsqueda

Donde reside la información accionable

La medición aporta un nivel de detalle que el promedio global oculta: el comportamiento de cada motor y de cada tipo de pregunta. Las cifras de este apartado proceden de la vía nativa (medición por API). Conviene leerlas a la luz de lo anterior: la conexión técnica atribuye menos citación de marca que la aplicación oficial, por lo que estos porcentajes representan el suelo de visibilidad —lo que perciben las integraciones y las herramientas de análisis—, no el techo. El diagnóstico relativo entre motores y entre intenciones se mantiene válido, dado que todas las cifras se han obtenido por el mismo canal.

8.1 · Por motor

MotorSoRCitación marcaURL correctaValidez
Perplexity63%60%53%100%
ChatGPT41%57%36%93%
Gemini29%0%0%93%
  • Perplexity constituye el punto fuerte: cita páginas del dominio propio en tres de cada cinco respuestas y, en más de la mitad, la página correcta.

  • ChatGPT cita, pero se equivoca de página: referencia el dominio propio en más de la mitad de las respuestas, si bien en la mayoría de los casos no enlaza la página adecuada para la intención consultada.

  • Gemini menciona la marca pero no cita sus páginas: la recomienda en cierta medida, aunque no cita el dominio propio en ninguna respuesta; las fuentes que muestra son de terceros que hablan de la marca.

Tabla del panel Antropus con el rendimiento por motor de la vía importada.
Panel Antropus · rendimiento por motor (importada): ChatGPT 63% SoR, Gemini 55%, Perplexity 54%.
Tabla del panel Antropus con el rendimiento por motor de la vía nativa.
Panel Antropus · rendimiento por motor (nativa): Perplexity 63% SoR, ChatGPT 41%, Gemini 29%.

8.2 · Por tipo de búsqueda

Al desagregar por intención del usuario emerge el patrón de mayor relevancia comercial: la marca obtiene buenos resultados cuando la consulta versa sobre sí misma o sobre su formación, y pierde presencia cuando el usuario compara o decide sin conocerla previamente.

Tipo de búsquedaSoRMenciónCita marca
Marca69%100%75%
Producto (formación)56%67%42%
Descubrimiento34%38%38%
Comparación38%25%13%
Decisión17%33%33%
Confianza17%33%33%
Diagnóstico

Cuando el usuario ya conoce la marca o busca su formación, esta aparece con solidez (SoM del 100% y del 67%, respectivamente). Cuando compara agencias sin conocerla previamente, en cambio, cae al punto más bajo del recorrido: se menciona en apenas uno de cada cuatro casos (SoM 25%) y rara vez cita el dominio propio (13%). Es precisamente «Comparación» —el tramo en el que el usuario evalúa opciones antes de contratar— donde se concentra la mayor pérdida de presencia.

Gráfico radar y tabla de rendimiento por intención de la vía importada.
Panel Antropus · rendimiento por intención (importada): Marca 89% SoR, Producto 69%; Decisión invisible.
Gráfico radar y tabla de rendimiento por intención de la vía nativa.
Panel Antropus · rendimiento por intención (nativa): Marca 69% SoR, Producto 56%.
09 · De la medición a la acción

El mismo plan, generado automáticamente

Antropus no se limita a medir: a partir de los resultados genera un diagnóstico priorizado. Sobre este baseline se identificaron 44 incidencias agrupadas en 7 patrones, encabezados por la ausencia de fuentes propias —la marca se cita, pero ninguna URL propia la respalda— (8 casos), la falta de activación de la marca en su categoría (8 casos) y la exclusión del shortlist comparativo (6 casos), seguidos de la desviación canónica (4 casos) y la confusión de entidad (2 casos). De ese diagnóstico se deriva un plan de ocho acciones con métrica objetivo y criterios de éxito cuantificados para la siguiente medición: la primera, de carácter operativo, consiste en repetir el único test que Gemini no completó por un fallo técnico de proveedor; las siete restantes son estratégicas.

El dato de mayor relevancia del estudio es que ese plan, generado de forma automática, coincide con las acciones que se derivaron manualmente tras el análisis humano del baseline T3.

PrioridadManual (T3)ImportadaNativa
Crear contenido comparativo
Generar evidencia propia citable
Reforzar las páginas canónicas correctas
Investigar a los competidores que ocupan la recomendación
Construir una hoja de ruta / próxima medición
Clarificar las siglas y la entidad de la marca

El detalle táctico varía en función de lo detectado por cada medición: el estudio manual incidía en la expansión literal «GEO = Generative Engine Optimization» y en la desambiguación de HSA; la vía importada prioriza el marcado schema.org; la nativa, resolver la ambigüedad de siglas surgida en sus respuestas. La dirección estratégica, sin embargo, es idéntica en las tres.

Triple confirmación

La correspondencia no constituye un caso aislado. Los planes de la vía importada y de la nativa —ambos generados por Antropus, pero sobre datos distintos— coinciden a su vez en sus prioridades principales. El mismo plan estratégico emerge, por tanto, de la medición manual, de la importada y de la nativa. No se trata de una recomendación fruto del azar ni de una única medición, sino de una dirección estable que se sostiene con independencia de cómo se mida.

9.1 · El coste de obtener ese diagnóstico

La diferencia operativa entre ambos métodos resulta sustancial. La medición manual exige abrir cada aplicación, lanzar los quince prompts uno a uno en sesión nueva, copiar las respuestas íntegras, registrar las URLs del panel, deduplicarlas y codificar a mano las métricas de cada uno de los 45 tests; a lo que el propio protocolo añade una doble revisión de alucinaciones, URL correcta y casos de cita sin mención antes de dar por cerrada la medición. En la práctica, completar un baseline por este procedimiento requiere aproximadamente tres jornadas de trabajo, a razón de un motor por jornada.

La vía nativa completó esos mismos 45 tests, sobre los tres motores, en aproximadamente 45 minutos y sin intervención humana, entregando además el desglose por motor y por intención y el plan de acción priorizado.

Conviene precisar el alcance del ahorro en cada vía. La vía importada mantiene la captura manual de las respuestas —puesto que su valor reside precisamente en recoger lo que muestra la aplicación al usuario— y automatiza únicamente la codificación y el análisis. La vía nativa automatiza el proceso completo, captura incluida. En ambos casos se elimina la variabilidad del codificado humano y el trabajo de control metodológico que el método manual debe incorporar como tarea adicional.

Expresado en términos operativos, una medición que ocupaba tres jornadas de trabajo especializado se resuelve en menos de una hora. Ese salto no solo reduce coste: habilita una frecuencia de medición que el método manual hace materialmente inviable, y que es precisamente la que permite construir series temporales fiables.

Lista de acciones recomendadas de la vía importada.
Panel Antropus · plan de acción priorizado (importada): 8 acciones, todas de prioridad alta.
Lista de acciones recomendadas de la vía nativa.
Panel Antropus · plan de acción priorizado (nativa): 8 acciones, una crítica (repetir el test que Gemini no completó).
Captura del panel Antropus con un baseline nativo en ejecución al 60%.
Panel Antropus · baseline nativo en ejecución: 27 de 45 tests (60%), tres motores por API.
10 · Cuándo conviene cada vía

Dos vías legítimas para preguntas distintas

Ambas vías son legítimas y responden a preguntas distintas. La elección no debe realizarse por defecto, sino en función del objetivo de la medición.

10.1 · Cuándo conviene la vía importada

  • Cuando el objetivo es conocer lo que percibe un usuario real. Las respuestas proceden de la aplicación oficial, el entorno en el que el cliente potencial realiza sus consultas.

  • Cuando la fidelidad prevalece sobre la frecuencia. Auditorías, informes de dirección o presentaciones a cliente en los que resulta determinante reflejar la experiencia real.

  • Cuando ya se dispone de respuestas capturadas. Permite aprovechar mediciones previas —incluidas las manuales— y puntuarlas con criterio homogéneo y auditable.

  • Cuando se desea evitar el sesgo del canal técnico. Dado que la API tiende a mostrar menos las páginas propias, la vía importada evita infravalorar la visibilidad real.

Limitación: requiere captura manual de las respuestas, por lo que no escala a mediciones frecuentes o con gran volumen de prompts.

10.2 · Cuándo conviene la vía nativa

  • Cuando se requiere frecuencia y escala. Seguimiento periódico, volúmenes elevados de prompts o monitorización continua sin intervención humana.

  • Cuando se analiza la evolución en el tiempo. Al mantener siempre el mismo canal y los mismos criterios, las series temporales resultan comparables entre sí.

  • Cuando se necesita diagnóstico y plan de acción con rapidez. El desglose por motor e intención y el plan priorizado se obtienen en minutos.

  • Cuando interesa el canal que emplean las herramientas e integraciones. Es la superficie que consumen los sistemas automáticos, y también merece ser medida.

Limitación: mide el canal API, que puede arrojar una citación del dominio propio inferior a la que percibe un usuario en la aplicación.

10.3 · Criterio recomendado: uso combinado

El planteamiento más sólido no consiste en elegir una vía, sino en combinarlas con funciones diferenciadas: la vía nativa como medición periódica de seguimiento —por su capacidad de repetirse con frecuencia y en condiciones homogéneas, lo que permite construir tendencia— y la vía importada como validación puntual en los hitos relevantes, para contrastar esa tendencia con la experiencia real del usuario en la aplicación.

Aplicado a un ciclo de trabajo habitual: seguimiento nativo con la periodicidad que requiera el proyecto, y una medición importada por trimestre —coincidiendo con el cierre del baseline— que actúe como punto de calibración. De este modo se obtiene simultáneamente escala y fidelidad, y se conoce en todo momento qué mide cada cifra.

11 · Conclusión

Tres conclusiones sobre un mismo baseline

El estudio acredita, sobre un mismo baseline medido de tres formas distintas, tres conclusiones:

01

Antropus es fiable

Allí donde mide lo mismo que la medición manual, coincide de forma prácticamente total: idéntico número de menciones, idéntico reparto por motor y cuota de fuentes equivalente. Se trata de validez convergente entre dos métodos independientes.

02

Antropus mide con mayor rigor y mayor detalle

Descarta las respuestas no válidas, exige la página canónica correcta, distingue el comportamiento de cada motor y de cada tipo de búsqueda, y pondera la fuerza de la recomendación además de la mera presencia.

03

Antropus traduce la medición en acción, de forma automática

El plan de mejora que genera coincide con el que un equipo humano derivó tras días de análisis, y se obtiene en minutos.

Antropus mide la visibilidad de una marca en la IA con el mismo criterio que un analista humano riguroso —de forma automática, consistente y auditable— y no se detiene en el dato: señala qué debe hacerse para mejorarlo.

Alcance y límites

La medición manual no constituye una verdad absoluta, por lo que no se afirma que Antropus sea «más veraz» en términos absolutos, sino que concuerda con ella allí donde miden lo mismo y la supera en rigor y detalle allí donde difieren. El propio sistema explicita sus límites —señala lo que no puede verificar, distingue lo no medible de lo medido en cero y no infiere aquello que no se ha declarado—. Esa transparencia es la que sostiene su credibilidad como herramienta de analítica GEO.

Tabla de registro de respuestas de la vía nativa.
Panel Antropus · registro de respuestas (nativa): 45 tests; 15 recomendadas; 23 entidades correctas, 2 incorrectas y 1 ambigua.
Anexo · Conjuntos de datos

Datos para la verificación íntegra

Con el fin de permitir la verificación íntegra de los resultados, se publican los dos conjuntos de datos empleados en este informe:

Datos de origen importados

Respuestas reales capturadas en ChatGPT, Gemini y Perplexity e importadas a Antropus, con el prompt, la respuesta completa, las URLs citadas, la URL canónica esperada y la categoría de intención de cada test.

baseline-manual-T3-import-antropus.xlsx· 123 KB

El archivo de la vía nativa contiene la codificación completa por test, de modo que permite recalcular íntegramente las cifras de esa columna. El archivo de importación recoge los datos de entrada —prompt, respuesta, URLs citadas, URL canónica y categoría—, esto es, el material exacto que se sometió a evaluación, pero no la codificación resultante; las columnas manual e importada no son, por tanto, recalculables desde este anexo.

Licencia del dataset: Creative Commons Atribución 4.0 Internacional (CC BY 4.0). Se permite compartir y adaptar los datos, incluso con fines comerciales, citando a Elevam y enlazando el estudio original. Ver los términos de la licencia