Cómo puntuar E-E-A-T de forma reproducible en herramientas de análisis GEO

E-E-A-T no es una puntuación oficial proporcionada por Google ni una fórmula pública de citación de la IA generativa. En las herramientas de análisis GEO, no se debe permitir que el LLM determine arbitrariamente la puntuación; deben extraerse señales verificables de una misma instantánea web y calcularse la puntuación y el nivel de confianza mediante código con reglas y versiones fijas.

GEO (Generative Engine Optimization) es un concepto práctico destinado a mejorar y analizar la probabilidad de que el contenido sea descubierto y utilizado como fundamento de las respuestas en entornos de IA generativa como ChatGPT y Gemini. Sin embargo, los servicios de IA generativa no han revelado una fórmula completa para seleccionar fuentes, y tampoco existe una puntuación estándar única de GEO aceptada de forma general.

El E-E-A-T de Google significa Experience, Expertise, Authoritativeness y Trustworthiness, pero no es una cifra oficial que Google publique para cada página web. Por lo tanto, debe aclararse que una «puntuación E-E-A-T de 78» mostrada por una herramienta de análisis no es una valoración de Google, sino una métrica de observación definida por dicha herramienta.

Por qué no se debe dejar la puntuación directamente en manos de un LLM

Introducir una página web completa en un LLM y pedirle que valore la experiencia, la especialización, la autoridad y la confiabilidad con 100 puntos cada una permite crear rápidamente un prototipo. Sin embargo, como sistema de medición operativo presenta los siguientes problemas.

La estructura recomendada es la siguiente.

Sitio web
  → Recopilación de una instantánea de un único momento
  → Extracción de cuerpo, metadatos, entidades y afirmaciones
  → Verificación cruzada con fuentes externas
  → Cálculo de puntuaciones mediante reglas con versión fija
  → Almacenamiento de puntuaciones, evidencias y confianza
  → El LLM explica los resultados en lenguaje natural

Esto no significa que no deba utilizarse ningún LLM. Puede aprovecharse para clasificar frases, extraer posibles afirmaciones y buscar variantes de nombres, pero los resultados deben vincularse con la evidencia del texto original y almacenarse en caché. Encargar al código el cálculo aritmético final y las reglas de límites máximos y penalizaciones mejora la reproducibilidad y la auditabilidad.

Objetivo y alcance de la evaluación que deben definirse primero

Antes de calcular una puntuación, debe fijarse qué se evalúa. Las señales del sitio completo, la organización, el autor y cada documento no son intercambiables.

Unidad de evaluación Pregunta principal Evidencia representativa
Documento ¿Son confiables las afirmaciones y el proceso de elaboración de este artículo? Cuerpo, citas, fecha de autoría, fecha de modificación, datos experimentales
Autor ¿Puede confirmarse que posee experiencia o especialización para tratar este tema? Página del autor, credenciales, trayectoria, historial de investigación y publicaciones
Organización ¿Puede identificarse la entidad editora y existe una estructura de responsabilidad? Información de la empresa, contacto, política editorial, datos de Organization
Dominio ¿Está reconocido externamente como fuente sobre ese tema? Citas de instituciones independientes, backlinks pertinentes, materiales periodísticos y académicos
Superficie técnica ¿Pueden los crawlers leer el contenido y la información de las fuentes? Códigos de estado, políticas de robots, canonical, HTML, datos estructurados

También debe clasificarse el tema. Los ámbitos en los que la información errónea puede causar graves daños, como medicina, finanzas y derecho, requieren pruebas de especialización y confiabilidad distintas de las reseñas sobre aficiones personales. Aplicar una única ponderación fija a todos los ámbitos debilita el significado de la puntuación.

Cómo recopilar una misma instantánea web

Los analizadores deben compartir una instantánea guardada una sola vez. Si el cuerpo se solicita de nuevo a las 10:00, JSON-LD a las 10:05 y la página del autor a las 10:10, pueden mezclarse estados modificados.

Siempre que sea posible, deben guardarse los siguientes elementos en la instantánea.

Al explorar varias páginas, no debe dependerse únicamente de la página de inicio. Mediante sitemap.xml y enlaces internos, se exploran con una profundidad limitada candidatos como About, Company, Team, Author, Profile, Editorial Policy, Contact, Privacy y Terms. No deben recopilarse de manera forzada páginas con información personal o restricciones de uso, y también deben revisarse las políticas de robots, los términos del servicio y la legislación aplicable.

Separación de evidencias onsite y offsite

Los datos onsite son información publicada directamente por el sitio correspondiente. Entre ellos se incluyen la presentación del autor, la descripción del producto, los casos de clientes, la política editorial, los datos de contacto y los datos estructurados de Person y Organization.

Los datos offsite muestran cómo fuentes externas independientes confirman al autor o a la organización. Entre ellos se incluyen materiales de organismos gubernamentales y públicos, instituciones académicas, asociaciones profesionales, medios confiables, fuentes del sector, perfiles externos, backlinks pertinentes y citas.

Ambos tipos de evidencia deben distinguirse en la puntuación.

Experience: convertir la experiencia directa en evidencia

Experience evalúa la experiencia directa de un autor al utilizar un producto, visitar un lugar, ejecutar un procedimiento o realizar un experimento. Es independiente de Expertise. Un comprador que haya utilizado un portátil durante mucho tiempo puede tener una amplia experiencia real de uso, pero no ser especialista en ingeniería de baterías.

Señales que deben detectarse

Otorgar una puntuación alta solo por una frase como «lo probé personalmente» facilita la manipulación. Las cifras concretas tampoco demuestran por sí solas que algo sea cierto. Deben tratarse como evidencia más sólida cuando el método de medición, el periodo, los datos originales y el contexto sean coherentes entre sí.

La puntuación de experiencia puede organizarse por niveles de la siguiente manera.

Nivel Ejemplo Principio de tratamiento
Débil Solo existe una declaración de haberlo utilizado Puntuación base baja
Medio El periodo, el entorno y el procedimiento son concretos Añadir puntuación por especificidad
Fuerte Se proporcionan datos originales, fotografías, registros y criterios comparativos Añadir puntuación por verificabilidad
Verificado Coincide con materiales independientes o pruebas de reproducción Aplicar ponderación de verificación cruzada

Expertise: evaluación de una especialización verificable

Expertise examina si se poseen los conocimientos y las capacidades necesarios para tratar correctamente el tema correspondiente. No basta con indicar «especialista» junto al nombre.

Los posibles elementos de análisis son los siguientes.

Si el valor del autor es un nombre de función como admin, administrator, 관리자, 운영자, 운영팀 o editor, no debe confirmarse como una persona real. Aunque existan datos estructurados de Person, debe comprobarse que coincidan con la información del autor mostrada en pantalla.

La especialización debe reflejar la adecuación temática. Una licencia de abogado puede ser una señal sólida para contenido jurídico, pero no demuestra automáticamente especialización en todos los temas médicos o técnicos. En los ámbitos donde sea necesario verificar las credenciales, el nivel de verificación aumenta cuando pueden vincularse con el organismo emisor o con datos oficiales de consulta.

Authoritativeness: reconocimiento externo y coincidencia de entidades

Authoritativeness evalúa en qué medida una persona, organización o sitio recibe reconocimiento externo dentro de un tema concreto. Más que el simple volumen de menciones, importan la calidad de las fuentes, la pertinencia temática, la independencia y la diversidad.

Un analizador de autoridad puede seguir el siguiente procedimiento.

  1. Crear entidades canónicas para el nombre de la organización, el nombre del autor, el dominio y la marca.
  2. Vincular alias confirmados, como nombres anteriores, nombres en inglés y abreviaturas.
  3. Determinar si se trata de la misma entidad en documentos externos.
  4. Evaluar la independencia, calidad, pertinencia temática y actualidad de la fuente.
  5. Agrupar las republicaciones de comunicados de prensa y las copias de un mismo documento.
  6. Distinguir si una cita o mención supone un reconocimiento positivo, una simple enumeración o una crítica.

Si al analizar la web en coreano solo se utilizan Wikipedia, Wikidata, Reddit y medios anglófonos, puede subestimarse la autoridad de instituciones y empresas nacionales. Según el mercado evaluado, el registro de fuentes debe incluir organismos gubernamentales y públicos, datos públicos, bases de datos académicas, asociaciones profesionales, medios importantes y publicaciones especializadas del sector. Por el contrario, tampoco debe afirmarse una autoridad mundial basándose únicamente en la visibilidad de un portal de un país concreto.

Conviene registrar en el registro de fuentes la jurisdicción, la entidad editora, el alcance temático, la independencia, si se trata de la fuente original, el ciclo de actualización y las condiciones de acceso. Aunque se añadan fuentes de distintos países, las reglas de puntuación y los criterios de selección deben hacerse públicos.

Trustworthiness: el eje de seguridad más amplio e importante

Trustworthiness sustenta los otros tres factores. Aunque exista experiencia directa y se posean credenciales, si se confirman afirmaciones falsas, ocultación de conflictos de interés o manipulación de fuentes, puede aplicarse un límite máximo a la evaluación total.

El módulo de confiabilidad debe comprobar los siguientes elementos.

Entidad editora y responsabilidad

Afirmaciones y evidencias

Transacciones y seguridad

La mera existencia de HTTPS o de una política de privacidad no hace que el contenido sea exacto. Son señales básicas de seguridad; la confiabilidad de las afirmaciones debe verificarse por separado.

Datos estructurados y verificación de entidades

Los datos estructurados de Person y Organization proporcionan nombres, afiliaciones, cargos, URL oficiales y relaciones con perfiles externos de una forma comprensible para las máquinas. Los campos author, publisher, datePublished y dateModified de Article también son útiles para representar la estructura de procedencia de un documento.

Sin embargo, el marcado Schema debe evaluarse según los siguientes principios.

Los datos estructurados son una capa de representación que facilita la comprensión y la extracción. No garantizan una posición alta en las búsquedas ni que la IA generativa los cite.

Diseño de una fórmula de puntuación reproducible

Si cada señal se trata únicamente como «presente o ausente», se pierden las diferencias de calidad. Separar los valores de la siguiente manera facilita el seguimiento de la evidencia.

Una fórmula de ejemplo es la siguiente.

Contribución de la señal = weight × presence × verification × relevance × source_quality × freshness
Puntuación de la dimensión = 100 × suma de contribuciones ÷ suma de weight aplicables

Esta fórmula es un ejemplo de diseño, no una fórmula oficial de E-E-A-T. Cada coeficiente puede normalizarse entre 0 y 1. Solo se excluyen como N/A los elementos que no sean aplicables desde un punto de vista lógico, mientras que la falta de evidencia necesaria debe guardarse como missing, diferenciándola de una puntuación de 0.

Mostrar la confianza por separado de la puntuación

Incluso un resultado de 78 puntos es difícil de creer si no se pudo recopilar la mitad de las páginas esenciales. Por tanto, la confianza de la evaluación o la cobertura de la evidencia debe calcularse por separado.

Confianza de la evaluación = cobertura de recopilación × coincidencia de entidades × proporción de evidencia verificable

La pantalla de resultados debe mostrar, como mínimo, los siguientes elementos.

Separar la puntuación total de GEO y E-E-A-T

Un E-E-A-T alto no implica necesariamente que el contenido vaya a citarse en una respuesta de IA. Los sistemas de respuesta también pueden considerar la adecuación a la pregunta, la facilidad de extracción de la información, la actualidad, la posibilidad de crawling y el formato del documento, y el método concreto de selección difiere entre servicios.

Es preferible que una herramienta de GEO separe los siguientes módulos.

Módulo Objeto de análisis
E-E-A-T del contenido Experiencia, especialización, autoridad externa y confiabilidad
Preparación para citas de IA Frases comprensibles de forma independiente, adecuación a la pregunta, conexión con evidencias y posibilidad de resumen
Autoridad de marca Reconocimiento independiente de instituciones externas y coincidencia de entidades
Accesibilidad técnica Crawling, códigos de estado, canonical, renderizado y acceso al cuerpo
Calidad de Schema Sintaxis, coincidencia con el contenido visible y relaciones entre entidades

Por ejemplo, puede configurarse con un 30% de preparación para citas de IA, un 20% de autoridad de marca, un 20% de E-E-A-T del contenido, un 20% de accesibilidad técnica y un 10% de Schema. Estas proporciones son únicamente un ejemplo de política de producto. Las ponderaciones reales deben ajustarse con datos de validación específicos para cada tema y mostrar su versión.

En la preparación para citas de IA no deben preferirse incondicionalmente las frases cortas. Debe evaluarse si la afirmación principal se entiende de forma independiente, si las evidencias y condiciones se encuentran cerca, y si la estructura de tablas, listas y títulos conserva el significado. Los textos ocultos destinados a engañar a motores de búsqueda o a la IA, las frases repetitivas y las páginas masivas sin fundamento deben tratarse como penalizaciones o señales de riesgo.

Estructura para impedir la propagación de errores entre módulos

Si cada analizador recibe directamente las conclusiones de otro analizador, los errores iniciales pueden amplificarse. Lo que debe compartirse no son tanto las conclusiones como la instantánea original y la evidencia normalizada.

Snapshot Store
 ├─ Content / Claim Analyzer
 ├─ Author / Expertise Analyzer
 ├─ Entity / Authority Analyzer
 ├─ Trust Analyzer
 ├─ Technical Analyzer
 └─ Schema Analyzer
 Evidence Store → Deterministic Scorer → Explanation LLM

Conviene que todos los registros de decisión incluyan claim_id, evidence_id, la ubicación en el texto original, la regla de decisión y la versión del módulo. Al LLM solo deben proporcionársele el JSON calculado y las frases de evidencia permitidas, imponiendo la restricción de no añadir nuevas credenciales ni reputación externa.

Problemas que suelen pasarse por alto: incertidumbre y manipulación adversaria

Muchos análisis de GEO se centran en encontrar señales, pero no tratan suficientemente las situaciones en las que un sitio intenta engañar al analizador. Este problema debe gestionarse mediante una capa independiente de calidad y seguridad.

Entre las medidas de respuesta se encuentran la comparación del contenido visible con el marcado, la agrupación de fuentes originales, la verificación de organismos emisores de credenciales, la detección de cambios mediante hashes del contenido, la comprobación cruzada de atributos de entidades y la detección de patrones anómalos de enlaces. Si se detecta una inconsistencia grave, es más seguro aplicar un límite máximo a la puntuación total o un estado de revisión manual que una simple penalización.

Cómo validar el modelo de evaluación

Aunque la fórmula de puntuación sea determinista, eso no garantiza automáticamente la validez de la evaluación. Se necesitan las siguientes pruebas.

  1. Prueba de repetibilidad: comprobar que la misma instantánea y versión producen exactamente el mismo resultado a nivel de bits.
  2. Conjunto de referencia de expertos: comparar la evidencia marcada independientemente por especialistas del ámbito con los resultados del sistema.
  3. Concordancia entre evaluadores: identificar los elementos sobre los que incluso los evaluadores humanos tienen dificultades para llegar a un acuerdo y modificar las reglas.
  4. Prueba de perturbación: comprobar si el resultado cambia en la dirección esperada al eliminar el nombre del autor, la fecha, Schema o los enlaces de evidencia.
  5. Prueba de resistencia a la manipulación: comprobar que los textos ocultos, perfiles falsos y comunicados de prensa duplicados no aumenten excesivamente la puntuación.
  6. Prueba de sesgo regional: medir si las entidades de calidad equivalente se ven perjudicadas sistemáticamente según el idioma o el país.
  7. Calibración de resultados: si se utilizan datos reales de observación de citas, registrar conjuntamente la pregunta, el momento, el modelo y la ubicación.

Los resultados de las citas de la IA generativa pueden variar según la formulación de la pregunta y las actualizaciones del servicio. Por tanto, en lugar de utilizar la tasa real de citas como una verdad absoluta, conviene tratarla como una métrica de validación externa con un momento claramente especificado.

Especificación de datos que deben incluirse en los resultados operativos

Para que las personas y otros sistemas puedan volver a verificar los resultados, puede proporcionarse la siguiente estructura.

{
  "snapshot_id": "sha256:...",
  "collected_at": "ISO-8601 timestamp",
  "scoring_version": "eeat-1.3.0",
  "scope": "document",
  "topic_class": "software-review",
  "scores": {
    "experience": 72,
    "expertise": 61,
    "authoritativeness": 54,
    "trustworthiness": 80
  },
  "confidence": 0.74,
  "evidence": [
    {
      "dimension": "experience",
      "status": "verified",
      "source_url": "https://example.invalid/page",
      "rule_id": "EXP-METHOD-02"
    }
  ],
  "missing": ["independent_author_profile"]
}

La URL anterior es una cadena de ejemplo no válida destinada a mostrar la estructura de los datos. En los resultados reales deben incluirse la URL de la evidencia recopilada y su ubicación en el texto original. Si no existe el derecho a redistribuir el texto original completo, deben guardarse únicamente fragmentos breves de evidencia dentro del alcance necesario, junto con el hash y la información de ubicación.

Lista de comprobación para la implementación

La clave consiste en no comprimir E-E-A-T en una única puntuación de impresión ambigua. Deben proporcionarse conjuntamente evidencias verificables, las reglas aplicadas, la incertidumbre y el linaje de las fuentes para que los resultados del análisis de GEO se conviertan en datos útiles para la toma de decisiones operativas y las comparaciones a largo plazo.

FAQ

¿La puntuación E-E-A-T es una métrica oficial proporcionada por Google?

No. Google describe E-E-A-T como un concepto para comprender la calidad del contenido, pero no publica una puntuación oficial para cada página web. La puntuación E-E-A-T de una herramienta de análisis es una métrica propia basada en las señales, las ponderaciones y el alcance de los datos definidos por dicha herramienta.

Si se establece la temperature del LLM en 0, ¿se le puede encargar directamente la puntuación?

Puede reducir la variabilidad, pero no garantiza una reproducibilidad ni una veracidad completas. La versión del modelo, el truncamiento de la entrada y la configuración del sistema pueden variar, y también existe el riesgo de inferir hechos que no aparecen en la página, por lo que es más seguro realizar el cálculo final mediante código con una versión fija.

¿Por qué deben evaluarse Experience y Expertise por separado?

Experience es la experiencia de haber usado, visitado, probado u operado algo directamente, mientras que Expertise son los conocimientos, la trayectoria profesional, las cualificaciones y la capacidad de investigación pertinentes. Un reseñador con amplia experiencia de uso real no es necesariamente un experto técnico, y alguien con una cualificación profesional puede no haber usado directamente el producto en cuestión.

Si el autor afirma que lo ha usado directamente, ¿se puede aumentar la puntuación de Experience?

Es recomendable tratar una mera declaración propia como una señal débil. Debe aplicarse una ponderación mayor cuando vaya acompañada de pruebas concretas y verificables, como el período, el entorno, el procedimiento seguido, el método de medición, los datos originales o materiales de elaboración propia.

Si no hay artículos de Wikipedia o de prensa, ¿la Authority es baja?

No necesariamente. Las fuentes externas importantes varían según el país y el sector. También deben evaluarse fuentes independientes adecuadas para la región y el ámbito, como organismos gubernamentales y públicos, instituciones académicas, asociaciones profesionales y medios sectoriales, y deben eliminarse los duplicados de las republicaciones de comunicados de prensa.

¿Añadir mucho Schema aumenta la puntuación GEO?

La precisión y la concordancia con el contenido mostrado son más importantes que la cantidad de Schema. Los datos estructurados ayudan a comprender las relaciones entre las entidades y los documentos, pero no garantizan la aparición en los resultados de búsqueda ni las citas de la IA, y un marcado falso o irrelevante puede suponer un riesgo para la confianza.

Si el E-E-A-T es alto, ¿se citará necesariamente en ChatGPT o Gemini?

No. Los métodos de selección de fuentes de cada servicio no se han divulgado por completo, y pueden influir diversos factores, como la adecuación a la pregunta, la actualidad, la accesibilidad y la estructura de la expresión. El E-E-A-T y el grado de preparación para las citas de la IA pueden estar relacionados, pero deben gestionarse como puntuaciones independientes.

Si las puntuaciones son iguales, ¿puede considerarse que los resultados del análisis tienen la misma calidad?

No. Una puntuación de 80 obtenida tras recopilar suficientes páginas y otra de 80 con la mitad de los datos ausentes tienen significados distintos. Junto con la puntuación, debe mostrarse la fiabilidad de la evaluación teniendo en cuenta la cobertura de recopilación, el grado de coincidencia de las entidades y la proporción de pruebas verificadas.

¿Cómo deben determinarse las ponderaciones de la puntuación GEO?

Las ponderaciones iniciales deben establecerse como una política explícita del producto, pero deben calibrarse mediante conjuntos de referencia de expertos, pruebas de factores de confusión, pruebas de resistencia a la manipulación y datos de observación reales. Se necesitan perfiles diferentes para ámbitos con distintos riesgos temáticos e intenciones de los usuarios, como la medicina, las finanzas y las reseñas de productos.

¿Qué función es adecuada para el LLM en un sistema de análisis GEO?

Puede utilizarse para extraer posibles afirmaciones, clasificar oraciones, buscar variantes de nombres y explicar en lenguaje natural los resultados calculados por el código. Sin embargo, es recomendable vincular todos los resultados con pruebas del texto original y dejar que el código determinista se encargue del cálculo de la puntuación final y de las reglas de límites máximos y penalizaciones.

Sources

Images

Mujer usando un panel analítico táctil de gran tamaño en una oficina
Mujer usando un panel analítico táctil de gran tamaño en una oficina
Diagrama del paso de datos web por un servidor seguro y cuatro módulos hasta paneles de puntuación
Diagrama del paso de datos web por un servidor seguro y cuatro módulos hasta paneles de puntuación