Qué necesita una web para que un asistente de IA pueda citarla

PRIMERO, QUE LOS SISTEMAS PUEDAN ACCEDER Y ENTENDER

No existe una forma de conseguir una cita, y quien la venda está vendiendo algo que no controla. Lo que sí existe es una base documentada sin la cual es imposible: que el rastreador correcto pueda acceder, que la página esté indexada y pueda mostrarse con un fragmento, y que el contenido aporte algo comprobable. Cada sistema publica sus propios requisitos, y los de Google no son los de OpenAI. Mezclarlos es el error más caro.

Dos sistemas, dos conjuntos de requisitos

Lo primero es dejar de hablar de «la IA» como si fuera una sola cosa. Estos son los requisitos que cada empresa publica en su documentación:

Funciones generativas de Google Búsqueda de ChatGPT
Qué acceso hace falta El de Googlebot, el rastreador de la Búsqueda El de OAI-SearchBot, un rastreador propio
Condición para entrar Página indexada y que pueda mostrarse con un fragmento, cumpliendo los requisitos técnicos de la Búsqueda No estar excluido de OAI-SearchBot en robots.txt
Qué ocurre si bloqueas La página queda fuera Los sitios excluidos no se muestran en las respuestas de búsqueda de ChatGPT, aunque pueden seguir apareciendo como enlaces de navegación
Garantía Ninguna: cumplir los requisitos no asegura rastreo, indexación ni publicación Ninguna

La consecuencia práctica es que el trabajo técnico no se duplica —la base es la misma web— pero sí hay que revisar dos configuraciones distintas, y una de ellas no tiene nada que ver con Google.

Los rastreadores de OpenAI no hacen lo mismo

Y confundirlos produce decisiones que van justo en contra de lo que se buscaba. OpenAI documenta cuatro agentes con funciones distintas:

Agente Para qué sirve robots.txt
OAI-SearchBot Mostrar webs en los resultados de las funciones de búsqueda de ChatGPT Se controla aquí; es el que conviene permitir si quieres aparecer
GPTBot Rastrear contenido que puede usarse para entrenar sus modelos Se controla aquí; bloquearlo indica que tu contenido no debe usarse para entrenar
ChatGPT-User Visitar una página cuando un usuario lo pide en ChatGPT o en un GPT personalizado Al ser una acción iniciada por una persona, las reglas pueden no aplicarse
OAI-AdsBot Validar páginas de destino enviadas como anuncios en ChatGPT Solo visita páginas enviadas como anuncios

Tres detalles de esa documentación que cambian decisiones reales:

  1. Los ajustes son independientes. OpenAI pone justo ese ejemplo: puedes permitir OAI-SearchBot para aparecer en resultados y a la vez bloquear GPTBot para que tu contenido no se use en el entrenamiento. No hay que elegir entre todo o nada.
  2. ChatGPT-User no decide si apareces en la búsqueda. OpenAI lo dice expresamente y remite a OAI-SearchBot para gestionar exclusiones y rastreo automático. Bloquear el agente equivocado no te saca de donde creías.
  3. Un cambio en robots.txt tarda en notarse. OpenAI indica que sus sistemas pueden necesitar alrededor de 24 horas para ajustarse a la nueva configuración en lo que afecta a resultados de búsqueda.

OpenAI recomienda además permitir las peticiones procedentes de sus rangos de IP publicados, que mantiene accesibles para cada agente. Ese detalle importa en el apartado siguiente.

El bloqueo accidental es más frecuente que el deliberado

Porque casi nunca está en el sitio donde se mira. Un robots.txt puede permitir el acceso mientras otra capa lo impide, y el resultado desde fuera es el mismo: el rastreador no llega.

Los cuatro puntos donde conviene mirar, y esto es criterio de trabajo propio:

  • Reglas heredadas. Muchos robots.txt incorporan bloqueos añadidos en su día «para que la IA no se lleve el contenido», a veces con patrones amplios que alcanzan al rastreador de búsqueda además del de entrenamiento.
  • Cortafuegos, CDN y protección antibots. Pueden responder con un error a agentes que no reconocen, sin que nadie se entere.
  • Límites de peticiones. Un sistema que considera agresivo a un rastreador puede empezar a rechazarlo.
  • Contenido tras registro o muros. Si hay que iniciar sesión, no hay acceso.

La comprobación honesta no es leer el robots.txt: es mirar en los registros del servidor qué respuesta recibieron esos agentes la última vez que pasaron. Un 200 significa acceso; un 403 o un 429 repetidos significan que la puerta está cerrada aunque el cartel diga lo contrario.

Lo que exige Google para sus funciones generativas

La condición está publicada y es corta: para poder mostrarse en sus funciones generativas, una página tiene que estar indexada y ser apta para mostrarse con un fragmento en la Búsqueda, cumpliendo sus requisitos técnicos. Además, el sitio debe estar incluido en esas funciones dentro de Search Console.

Sobre esa base, Google enumera prácticas conocidas: contenido rastreable, buenas prácticas de JavaScript si la web lo usa, una experiencia de página cuidada y reducir el contenido duplicado. Y añade su matiz habitual, que conviene no perder de vista: cumplir todos los requisitos no significa que Google vaya a rastrear, indexar o mostrar la página.

Hay una implicación que suele pasarse por alto. Si una página bloquea los fragmentos, deja de cumplir esa condición. Lo mismo ocurre con un noindex heredado de una versión de pruebas y nunca retirado: no es un problema de IA, es un problema de indexación, y se detecta con las mismas comprobaciones que cualquier otro fallo de rastreo. Ese recorrido está en la checklist de por qué una web no posiciona.

Qué hace que una página sea utilizable como fuente

Que diga algo que no dicen las demás y se pueda comprobar. Google es inusualmente claro en esto: crear contenido único, útil y valioso influirá probablemente en la presencia dentro de la búsqueda generativa más que cualquier otra recomendación de su guía. Su ejemplo contrapone un contenido genérico —del tipo «siete consejos para compradores de primera vivienda»— con uno que aporta experiencia real y va más allá del conocimiento común.

A partir de ahí, cuatro criterios de trabajo propios que hacen una página más fácil de usar como fuente:

  1. Responder al principio. Si la respuesta está en el tercer scroll, el fragmento que alguien extraiga no la contendrá.
  2. Dar el dato con su origen. Una cifra sin fuente es una afirmación; con fuente y fecha, es algo que otro sistema puede repetir sin arriesgarse.
  3. Decir quién responde y cuándo se revisó. La autoría y la fecha visible permiten evaluar la información.
  4. Ser explícito con el alcance. Qué haces, para quién, dónde y qué no haces. Lo que se sobreentiende no se puede citar.

Esa misma coherencia debe mantenerse fuera de tu dominio: si tu web, tu ficha y los directorios dicen cosas distintas, cualquier sistema que reúna varias fuentes encontrará contradicciones. Es la parte del trabajo de GEO y visibilidad en IA que no ocurre dentro de tu web.

Lo que no hace falta

Menos de lo que se vende. Google publica una lista de prácticas que se pueden ignorar para su buscador: archivos llms.txt y marcados especiales, trocear el contenido, reescribirlo para la IA, buscar menciones artificiales y tratar los datos estructurados como obligatorios. Están desarrolladas, con su alcance exacto, en qué cambia entre SEO y GEO.

Conviene recordar el límite de esa lista: describe lo que Google Search no usa. No es una afirmación sobre cómo funcionan otros sistemas, y Google lo dice: mantener uno de esos archivos para otro servicio no ayuda ni perjudica en su buscador, porque lo ignora.

Una comprobación de base, en orden

  1. Abre tu robots.txt y localiza qué agentes están bloqueados, uno por uno.
  2. Decide por separado dos cosas: si quieres aparecer en búsquedas de asistentes y si quieres que tu contenido sirva para entrenar modelos.
  3. Revisa en los registros del servidor qué respuesta reciben esos agentes.
  4. Comprueba que las páginas importantes están indexadas y no llevan un noindex olvidado.
  5. Comprueba que no bloqueas los fragmentos en las páginas que quieres que se citen.
  6. Contrasta lo que dice tu web con lo que dicen tu ficha y los directorios donde apareces.
  7. Cuando la base esté en orden, empieza a observar. El método está en cómo saber si tu negocio aparece en ChatGPT.

El orden importa: medir antes de tener la base en condiciones produce una serie de datos que solo demuestra que la puerta estaba cerrada.

Lo que sigue sin poder prometerse

Ninguna de estas comprobaciones produce una cita. Google afirma que cumplir sus requisitos no garantiza rastreo, indexación ni publicación. Y el control tampoco es absoluto en la dirección contraria: OpenAI indica que un sitio excluido de OAI-SearchBot no se mostrará en sus respuestas de búsqueda, aunque puede seguir apareciendo como enlace de navegación.

Lo que estas comprobaciones sí hacen es eliminar los motivos por los que sería imposible. Es exactamente lo mismo que ocurre en el trabajo orgánico: la base no garantiza el resultado, pero su ausencia garantiza que no llegue.

Preguntas frecuentes

¿Tengo que permitir que entrenen con mi contenido para aparecer en ChatGPT?

No. OpenAI documenta que los ajustes son independientes y pone ese caso como ejemplo: se puede permitir OAI-SearchBot, que es el que sirve para aparecer en sus resultados de búsqueda, y a la vez bloquear GPTBot, que es el que rastrea contenido que puede usarse para entrenar sus modelos. Son dos decisiones distintas y se toman por separado en el mismo archivo.

¿Cuánto tarda en aplicarse un cambio en el robots.txt?

Para los resultados de búsqueda de ChatGPT, OpenAI indica que sus sistemas pueden necesitar alrededor de 24 horas desde la actualización del archivo. Para el resto de sistemas, cada uno tiene su propio ritmo y no todos publican un plazo, así que conviene anotar la fecha del cambio y no sacar conclusiones antes de que pase un tiempo razonable.

Mi web es un WordPress normal. ¿Hay algo concreto que mirar?

Tres cosas que aparecen con frecuencia. La primera, un robots.txt generado por una extensión, que puede incluir bloqueos que nadie recuerda haber añadido. La segunda, un noindex heredado de una instalación de pruebas y nunca retirado. La tercera, una extensión de seguridad o el propio proveedor de alojamiento rechazando agentes que no reconoce. Ninguna de las tres se ve mirando la web; las tres se ven mirando la configuración y los registros.

SIGUIENTE PASO, CON EL ALCANCE CLARO

Si quieres saber en qué estado está tu base

Casi todo lo de este artículo se puede comprobar. Lo que cuesta es saber qué hacer con lo que aparezca.

La revisión inicial cuesta 95 € + IGIC y evalúa tu web y, cuando corresponda, tu ficha de Google. No incluye consultas ni comprobaciones en asistentes: sirve para saber si la base está en condiciones antes de gastar horas en observar nada. No es gratuita y no se descuenta después.

El trabajo continuado sobre acceso, entidad, contenido y muestreo fechado está en el plan SEO + GEO: 495 € al mes + IGIC, hasta 7 horas mensuales no acumulables y sin permanencia.

Pedir mi revisión inicial