La mayoría de las empresas tratan a todos los bots de IA como si fueran uno solo, y por eso toman la decisión equivocada. Un rastreador que se lleva tus páginas a un conjunto de entrenamiento no es lo mismo que un bot que consulta tu página en el instante en que un usuario le hace una pregunta a ChatGPT. Meter a los dos en el mismo saco suele bloquear justo el tráfico que te haría visible.
Es el hallazgo técnico más frecuente que encontramos: un robots.txt que prohíbe en bloque a todos los user-agents de IA, escrito bajo la idea de que así se juega sobre seguro. No es así. Este artículo ordena qué hace cada bot y muestra cómo trazar la línea a conciencia.
¿Qué rastreadores de IA visitan mi web?
Son sobre todo cinco operadores: OpenAI, Anthropic, Perplexity, Google y ByteDance. Cada uno tiene varios bots con tareas distintas, y esa distinción es la que decide tu visibilidad.
Un bot recoge texto para entrenar modelos futuros. Otro indexa páginas para la búsqueda con IA. Un tercero consulta una página en directo porque un usuario acaba de preguntar algo cuya respuesta está en la web abierta. Estas tres tareas van con nombres distintos, y en robots.txt puedes dirigirte a cada nombre por separado.
Entrenamiento o recuperación: la diferencia que decide la visibilidad
Entrenamiento significa que tu contenido alimenta al modelo y puede aparecer más tarde como una mención de pasada, sin fuente. Recuperación significa que el modelo lee tu página en el momento de la pregunta y puede citarla con un enlace.
Esos dos casos dependen de bots distintos. Si bloqueas el entrenamiento, no desapareces de las respuestas mientras los bots de recuperación sigan permitidos. Si lo bloqueas todo, renuncias a la cita, la fase en la que el usuario ve tu fuente con un enlace al lado. Mención, cita y recomendación son tres cosas distintas, y el bot de recuperación es la condición previa para la del medio.
¿Qué hace cada bot?
Este es el mapa, agrupado por operador. Los nombres son los tokens exactos que escribes tras User-agent: en robots.txt.
- OpenAI:
GPTBotrecoge datos de entrenamiento.OAI-SearchBotindexa para la búsqueda con IA en ChatGPT.ChatGPT-Userconsulta una página cuando un usuario deja que ChatGPT navegue. - Anthropic:
ClaudeBotes el rastreador de entrenamiento.Claude-SearchBotindexa para la búsqueda.Claude-Userrecupera una página a petición directa del usuario. - Perplexity:
PerplexityBotindexa,Perplexity-Userconsulta en el momento de la pregunta. - Google:
Google-Extendedsolo controla si tu contenido se usa para entrenar Gemini y los modelos de Vertex AI. No tiene nada que ver con la búsqueda normal de Google, de la que sigue encargándoseGooglebot. Por eso un Disallow paraGoogle-Extendedno te saca de los resúmenes con IA en la búsqueda, porque esos se sirven a través deGooglebot. - ByteDance:
Bytespiderrecoge datos para la empresa detrás de TikTok. A este bot se le atribuye no respetar siempre robots.txt, así que con él no te fíes solo de la directiva.
Lo importante: un Disallow solo para GPTBot no bloquea a OAI-SearchBot ni a ChatGPT-User. Cada nombre necesita su propia línea.
robots.txt: bloquear entrenamiento, permitir recuperación
Si tu objetivo es "fuera del entrenamiento, pero localizable", bloquea los bots de entrenamiento y deja pasar a los de recuperación y búsqueda. Esta es una plantilla:
# No permitir el entrenamiento de modelos
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Permitir la recuperacion al responder y la busqueda con IA
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Perplexity-User
Allow: /
Si en cambio quieres la máxima localización, quita los bloqueos de entrenamiento. Si quieres cerrarlo todo, pon Disallow: / para cada uno de los nombres anteriores. La regla es decidir por tarea, no por proveedor.
El error más común: bloquear en bloque
Muchas webs bloquean a todos los bots de IA porque una plantilla de internet lo indicaba así. Según Cloudflare (agosto de 2025), más de 2,5 millones de webs bloquean por completo el entrenamiento de IA, y buena parte de ellas bloquea sin querer también a los bots de recuperación.
El resultado: la empresa ya no aparece como fuente citada en las respuestas con búsqueda web, aunque eso era justo lo que quería. Confundió entrenamiento con recuperación. Si quieres proteger tus datos del entrenamiento pero que te nombren y enlacen cuando un cliente pregunta, tienes que separar los dos casos, o tu propio robots.txt trabajará contra tu propio marketing.
Lo que robots.txt no puede hacer
robots.txt es una petición, no una valla. Operadores serios como OpenAI y Anthropic la respetan, pero el archivo no obliga a nada, y algunos rastreadores la ignoran.
Y ni siquiera un Allow perfectamente puesto garantiza la cita. Es la condición previa, nada más. Que un modelo acabe nombrándote, citándote o recomendándote depende de muchos más factores: la estructura de tu página, las fuentes ajenas que hablan de ti, la pregunta exacta del usuario. robots.txt despeja el primer obstáculo. Para el resto hacen falta contenidos que un modelo quiera citar.
De la configuración del rastreo a la visibilidad medida
Configurar bien robots.txt es la palanca más barata que hay, y aun así solo el principio. Si el cambio funciona lo verás solo cuando midas cuántas veces te nombran y te citan los grandes sistemas de IA antes y después.
Cómo se construye una medición limpia lo explicamos en nuestra página sobre visibilidad en IA. Antes de tocar robots.txt, conviene pasar el autotest que en un cuarto de hora te dice si hay problema siquiera.
Si quieres saber qué bots visitan tu web hoy y qué permite de verdad tu robots.txt ahora mismo, escríbenos desde la página de contacto. Revisamos tu archivo y tus registros y te decimos dónde te estás poniendo la zancadilla a ti mismo.