Nuestro sitio web utiliza cookies para mejorar y personalizar su experiencia y para mostrar anuncios (si los hay). Nuestro sitio web también puede incluir cookies de terceros como Google Adsense, Google Analytics o YouTube. Al utilizar el sitio web, usted acepta el uso de cookies. Hemos actualizado nuestra Política de Privacidad. Haga clic en el botón para consultar nuestra Política de Privacidad.

Investigadores de seis instituciones crean el primer mapa científico de las métricas utilizadas para medir el GEO

Investigadores de seis instituciones crean el primer mapa científico de las métricas utilizadas para medir el GEO


La publicación científica Latitude: Multidisciplinary Research Journal, dirigida por Quality Leadership University (QLU) en Ciudad de Panamá, dio a conocer dentro de su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual fue elaborado por Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el producto inicial de la línea de estudio centrada en Generative Engine Optimization (GEO) que impulsa Centria Group en colaboración con diversas entidades académicas y universitarias de cuatro naciones.

El artículo responde a una pregunta que el marketing digital todavía no sabe contestar con rigor: cuando un asistente de inteligencia artificial recomienda un banco, un seguro o un hotel, ¿cómo se mide si una marca está presente en esa respuesta, con qué prominencia y con qué fiabilidad? Para responderla, el equipo realizó una revisión de alcance (scoping review) siguiendo la metodología del Joanna Briggs Institute (JBI) y reportada conforme a la extensión PRISMA-ScR, que mapea de forma sistemática cómo la literatura emergente mide la presencia, la visibilidad y la citación de fuentes y marcas en los motores generativos.

«Casi veinte años atrás, la presencia en el entorno digital dependía de una destreza muy específica: figurar, y recibir clics, en un índice de resultados. En la actualidad, el internauta ya no se topa con diez vínculos azules, sino que obtiene una contestación elaborada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o desequilibrada. El dilema central ya no radica en si nuestro hipervínculo sale y es accionado, sino en si la información se integra en la contestación que la persona efectivamente visualiza», señala Néstor Romero, investigador firmante del informe y COO de Centria Group.

Del clic a la respuesta: por qué las métricas del SEO dejan de servir

El artículo parte de una constatación que el propio corpus revisado respalda con evidencia empírica: las fuentes que cita un motor generativo se solapan poco con las que posicionan en la búsqueda tradicional, y la lógica de selección varía de un motor a otro. Dicho de otro modo, la visibilidad en Google no predice la visibilidad en un asistente generativo, lo que invalida la transferencia directa de indicadores y obliga a repensar qué se mide y cómo. A ello se suma el fenómeno «cero clics», acelerado por los resúmenes generativos integrados en los buscadores: una parte sustancial de las consultas se resuelve hoy sin que el usuario visite ningún sitio web.

«La cuota de citación es la métrica que la práctica profesional trata como central, y en la literatura académica está formalizada en un único estudio. Esa brecha entre industria y academia es en sí misma un hallazgo», dijo Néstor Romero.

 Las cinco preguntas de investigación y sus respuestas

RQ

Pregunta

Respuesta del estudio

RQ1

¿Qué familias de métricas se emplean?

Se utilizan siete conjuntos de indicadores que se superponen parcialmente —aparición/citación, relevancia/ubicación, absorción/impacto, posición en clasificaciones, consistencia, tono/encuadre y proporción de citas—, careciendo de un marco unificador común.

RQ2

¿Sobre qué unidad de análisis se operacionalizan?

Falta unanimidad: el objeto de estudio se desplaza desde el origen o URL —herencia clásica del SEO— hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, el recorrido de navegación de los agentes. Aquellos análisis con elementos distintos no resultan directamente comparables.

RQ3

¿Cómo se controla la variabilidad estocástica de los motores?

Tan solo una pequeña parte implementa réplicas o un tratamiento formal de la aleatoriedad. La mayor parte recurre a una única consulta o limita un periodo de tiempo, omitiendo la medición del margen de error.

RQ4

¿Qué evidencia de fiabilidad y validez se reporta?

Ninguna investigación de la muestra somete su herramienta a contrastación psicométrica. Se observan supervisiones colaterales y fragmentadas (consistencia, precisión en la autoría, triangulación metodológica, resistencia frente al orden). El grado de acuerdo entre evaluadores rara vez se documenta.

RQ5

¿Existe un instrumento integrado y validado de presencia generativa?

Negativo. Las pruebas estándar miden el rendimiento de estrategias o variaciones de posición, mas no la validez conceptual de un índice; los trabajos originales desarrollan parámetros prácticos pero incompletos y carentes de fiabilidad comprobada.

Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints

Para contrarrestar las limitaciones individuales de cada estrategia, la búsqueda integró cuatro vías complementarias: un buscador impulsado por inteligencia artificial, consultas multilingües y replicables en OpenAlex, seguimiento de referencias a partir de nodos clave, y cotejo en un repositorio indexado (Web of Science; Scopus quedó fuera de alcance). Una vez eliminados los duplicados mediante el DOI —evitando el título debido a la elevada coincidencia de denominaciones genéricas en esta disciplina—, dos evaluadores examinaron los resúmenes por separado, zanjando los desacuerdos de común acuerdo. En total, se analizaron 36 documentos íntegros, seleccionándose 23 investigaciones originales junto a un par de revisiones catalogadas de manera independiente a modo de marco teórico.

«Buena parte del conocimiento generado en español sobre esta materia no llega a los circuitos internacionales. Recuperarlo no es una cuestión de exhaustividad: revela un sesgo lingüístico latente en el campo», recalcó Néstor Romero.

Siete grupos de indicadores y ningún modelo que los unifique

En el mapeo se distinguen siete grupos de métricas con ciertos solapamientos —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— que operan careciendo de un esquema unificador común. Asimismo, la investigación subraya que el límite conceptual más productivo dentro de esta disciplina radica en separar la citación (el hecho de que se elija una fuente) de la absorción (la asimilación real de su contenido en el texto resultante), dividiendo de este modo en dos planos lo que anteriormente se evaluaba como una simple dicotomía.

La unidad de análisis cambia de enfoque: pasa de la URL a la marca y a la trayectoria de los actores

No existe consenso sobre qué se mide exactamente. El corpus revela un desplazamiento progresivo desde la fuente o la URL (herencia directa del SEO) hacia la marca o entidad, el documento, el producto y, en los trabajos más recientes, hacia unidades de orden superior como la trayectoria de navegación de los agentes. Ese desplazamiento refleja la migración de la pregunta del campo, pero tiene un coste: los estudios con unidades distintas no son directamente comparables, lo que refuerza la imposibilidad de realizar un metaanálisis.

Tipología de la evidencia disponible

Grado de evidencia

Casos de estudio

Relevancia en el corpus

Benchmark de evaluación

GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025)

Predominante

Medición primaria (motores reales)

How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026)

Escasa

Estudio aplicado / comercial

GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026)

Reducida

Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.

La Inteligencia Artificial no contesta de forma idéntica todo el tiempo, y prácticamente nadie evalúa este fenómeno

Debido a que los motores generativos funcionan de manera estocástica, son capaces de arrojar contestaciones diferentes frente a una idónea consulta idéntica. Por consiguiente, lograr una evaluación confiable demanda replicar las mediciones o representar formalmente la incertidumbre. Pese a ello, tan solo una minoría de las investigaciones adopta este enfoque de modo metódico. Entre los pocos que lo implementan sobresalen proyectos que realizan cinco corridas por cada consulta, que efectúan doscientos exámenes junto con permutaciones de orden, que llevan a cabo análisis de sensibilidad orientados al idioma y a las paráfrasis, o bien aquellos que abordan la visibilidad en calidad de distribución en vez de un número estático. El resto de los trabajos, en su mayor parte, confía en una sola ejecución.

«En este ámbito, evaluar un único intento resulta epistemológicamente frágil. Todo instrumento sólido debe integrar la repetición y el cálculo de la incertidumbre desde el inicio, y no como un simple añadido», apunta Romero.

El hallazgo central: un campo que mide mucho y valida poco

El hallazgo definitivo del análisis indica que ningún artículo del corpus somete su herramienta de medición a un proceso de validación psicométrica rigurosa. En su lugar, se implementan revisiones accesorias y fragmentadas (como índices de estabilidad, certeza en la atribución, contraste metodológico por diseño o solidez frente al orden), mientras que la concordancia entre evaluadores, que constituye una condición elemental para cualquier instrumento, rara vez se documenta. Por otra parte, la validez, cuando se defiende, se apoya en la consistencia interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos de medición propiamente dichos. De este modo, se desprende la premisa fundamental del mapeo: todavía carecemos de un mecanismo unificado y contrastado capaz de cuantificar la huella generativa de marca.

Requisitos para participar

Parámetro

Adisión

Descarte

Enfoque

Cuantificación u operacionalización del impacto, la presencia, las menciones o la visibilidad dentro de los motores generativos

Posicionamiento tradicional en buscadores, diseño asistido por computadora (CAD), redes generativas antagónicas (GAN), motores de recomendación y aplicaciones ajenas a este ámbito

Rango temporal

2023-2026 (ámbito de nacimiento digital)

Precedente al año 2023

Lengua

Castellano e inglés

Idiomas restantes que carezcan de traducción accesible

Clasificación

Investigación empírica de medición, evaluación comparativa o trabajo práctico dotado de métricas

Artículos de opinión, editoriales y material comercial o publicitario

Condición

Preprints aceptados conforme a los criterios de sensibilidad

Documentación informal difundida sin supervisión editorial

Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.

«Hallamos un sector donde abunda la medición y escasea la validación. Las propuestas de evaluación no escasean —de hecho, sobran—; lo que realmente escasea es la fiabilidad documentada y la validez de constructo. Y es preciso señalarlo con rigor, pues equiparar un simple benchmark con un instrumento debidamente validado eleva artificialmente la supuesta madurez metodológica de la disciplina. Precisamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.

Existe una separación entre la enseñanza académica y la labor profesional

El texto expone una discrepancia notable entre aquello que el sector valora como prioritario y lo que la investigación académica ha consolidado. La participación en citas (citation share) —un indicador al que la actividad industrial otorga un peso determinante y presupone como idóneo para una validez convergente— se sustenta, en la práctica, sobre un único trabajo de investigación. Por otra parte, las categorías de tono y perspectiva presentan una escasez similar, a pesar de que la investigación más amplia del conjunto, centrada en el análisis de más de cien marcas, las señala como el indicador más volátil de todo el grupo.

«La visibilidad en Google no garantiza la presencia en un asistente generativo, lo que invalida la transferencia directa de métricas y exige replantear tanto qué evaluamos como la manera de hacerlo».

«La visibilidad generativa es manipulable, y eso traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».

La ciencia en español, invisible: una lección metodológica

Asimismo, este análisis arroja una aportación metodológica de suma relevancia para los investigadores de habla hispana. Hay un corpus de estudios en español, divulgado en publicaciones de Documentación y Biblioteconomía, que examina la exposición ante la inteligencia artificial generativa desde perspectivas diversas —tales como la inestabilidad de las marcas dentro de las sugerencias turísticas elaboradas por IA, o bien el ajuste de los repositorios académicos para facilitar su indexación por parte de plataformas generativas—, aspectos que los textos anglosajones hegemónicos suelen soslayar. Su rescate únicamente se logró por medio de consultas en varios idiomas, lo cual pone de manifiesto un sesgo idiomático subyacente en esta disciplina.

A esto se añade una segunda enseñanza derivada del propio procedimiento: el cotejo en una base indexada arrojó 360 entradas en bruto, de las cuales se examinaron las 136 disponibles en abierto —en su gran mayoría interferencias temáticas debidas a la coincidencia de palabras—, sin que se sumara ninguna nueva investigación válida de medición. En resumen, el ámbito se caracteriza por priorizar los preprints y sufrir una cobertura insuficiente en los índices convencionales; de hecho, el 64 % de los textos preliminares se divulga mediante arXiv o SSRN, mientras que el 98 % carece de un cuartil catalogado.

«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.

Flujo de selección de estudios (PRISMA-ScR, dos ramas)

Fase

Resultado

Rama de descubrimiento (Consensus)

Se identificaron 70 registros; 23 se descartaron antes del filtrado (duplicados por DOI, depuración y falsos positivos debidos a colisión de siglas); 47 se sometieron a cribado por resumen; 26 se desecharon; 21 avanzaron a texto completo

Rama de otros métodos

Se sumaron 18 registros adicionales (mediante rastreo de citas, OpenAlex y comprobación en base indexada); se obtuvieron 15 candidatos para análisis de texto completo

Verificación en Web of Science

Arrojó 360 registros brutos; se revisaron 136 (por acceso abierto); no se halló ningún estudio de medición elegible nuevo

Evaluación a texto completo

Se analizaron 36 informes; 13 se descartaron por quedar fuera del alcance o carecer de medición directa de la presencia

Inclusión final

Se integraron 23 investigaciones primarias en la síntesis, además de 2 revisiones incorporadas como marco conceptual

Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los autores detallan que las cifras correspondientes a la identificación y el cribado son definitivas, mientras que aquellas relativas a la evaluación del texto íntegro y la incorporación siguen siendo provisionales.

Se puede manipular la visibilidad generativa

Una parte de las investigaciones analizadas evidencia que la presencia en motores generativos resulta alterable mediante tácticas adversarias, ya sea a través de técnicas de manipulación del posicionamiento en buscadores conversacionales o por medio de una optimización discreta de prompts. La investigación traslada dicha conclusión al ámbito de la métrica: la solidez ante cualquier alteración tendría que integrarse entre las cualidades indispensables de cualquier herramienta de visibilidad.

«Una prueba de rendimiento comprueba si una estrategia da resultado o si un elemento varía de posición, pero no determina si un indicador mide con validez un concepto. Mezclar ambos planos exagera la falsa sensación de madurez de la disciplina».

«Evaluar una única ejecución resulta, en este ámbito, epistemológicamente frágil, ya que los motores generativos son capaces de ofrecer respuestas diferentes ante una misma consulta».

Próximos pasos: del diagnóstico a la herramienta

Los creadores del estudio deducen que el déficit hallado, concretamente en la fiabilidad documentada y en la validez de constructo, representa el hueco idóneo que legitima la creación y validación formal de un indicador propio centrado en la presencia generativa. Del mismo modo, consideran esta labor como el paso lógico que sucede al artículo difundido, descartando que se trate de un hecho ya comprobado. Precisamente, este es el camino que el grupo investiga en la etapa venidera.

«El propósito que perseguimos consiste en transitar desde el diagnóstico hasta la herramienta práctica: diseñar y contrastar un indicador accesible para cualquier tipo de empresa, sin importar su dimensión, permitiéndole medir con rigor científico el impacto de su marca en las respuestas generadas por la inteligencia artificial», señala Néstor Romero.

Limitaciones declaradas por los autores

El artículo reconoce abiertamente sus propias fronteras: la precariedad de los cimientos empíricos en una disciplina tan novísima y copada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo original —atenuada, sin desaparecer por completo, gracias a OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotamiento idiomático a inglés y castellano junto con la carencia de acceso institucional para validar en Scopus; un etiquetado ejecutado en parte sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo inminente de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propio desempeño; y la caducidad temporal intrínseca a cualquier radiografía de un sector que se sustenta sobre herramientas propietarias en mutación permanente.

Estas limitaciones son fundamentales para interpretar adecuadamente los resultados y comprender el alcance de la evidencia disponible. Para consultar en profundidad la metodología, los datos analizados y las conclusiones de la investigación, descarga el informe completo «La banca panameña ante la inteligencia artificial».

Por Carlos Urrutia