Cómo evitar que los bots de IA copien el contenido de tu web
Para controlar qué bots de inteligencia artificial acceden a tu web, el primer paso es declararlo en el fichero robots.txt indicando por su nombre los rastreadores que no quieres y bloquearlos después en el servidor o en tu CDN. El robots.txt es una petición que los rastreadores de las grandes empresas de IA dicen respetar, pero no es un muro: para los que lo ignoran hace falta bloqueo técnico. Y antes de bloquear nada conviene tomar una decisión de negocio, porque no todos los bots hacen lo mismo: unos se llevan tu contenido para entrenar modelos y otros lo consultan para citarte en una respuesta y enviarte visitas. Bloquear a todos por igual puede hacerte invisible justo donde cada vez más gente busca.
Primero decide: entrenamiento frente a respuesta con cita
Los rastreadores de IA se dividen en dos grupos con efectos opuestos para tu negocio.
Los de entrenamiento descargan tu contenido para incorporarlo a la base con la que se entrena un modelo. No te envían visitas ni te mencionan. El beneficio para ti es, en la práctica, nulo.
Los de búsqueda y respuesta consultan tu web para contestar la pregunta de un usuario en ese momento, y habitualmente incluyen el enlace a tu página. Ahí sí hay algo a cambio: visibilidad y clics. Si vendes servicios y alguien pregunta por tu especialidad, te interesa aparecer en esa respuesta.
La postura que más sentido tiene para la mayoría de las empresas es intermedia: bloquear el entrenamiento y permitir la búsqueda. Las excepciones son claras. Si tu negocio es el contenido (un medio, una base de datos, un catálogo de fichas propias), el entrenamiento te está canibalizando y conviene cerrarlo del todo. Si tu web es un escaparate comercial, lo que te interesa es justo lo contrario: que te encuentren.
Qué rastreadores existen y para qué sirve cada uno
Estos son los nombres que tendrás que escribir en el robots.txt. Cada empresa publica los suyos en su documentación técnica, y conviene revisarla de vez en cuando porque la lista cambia.
| Rastreador | Empresa | Para qué lo usa | ¿Te conviene permitirlo? |
|---|---|---|---|
| GPTBot | OpenAI | Entrenamiento de modelos | No aporta visitas |
| OAI-SearchBot | OpenAI | Búsqueda y citas en respuestas | Sí, si quieres aparecer citado |
| ChatGPT-User | OpenAI | Consulta puntual pedida por un usuario | Sí |
| ClaudeBot | Anthropic | Entrenamiento de modelos | No aporta visitas |
| Claude-User | Anthropic | Consulta pedida por un usuario | Sí |
| Google-Extended | Entrenamiento, separado del buscador | Bloquearlo no afecta a tu SEO | |
| CCBot | Common Crawl | Archivo público que alimenta a muchos modelos | No aporta visitas |
| PerplexityBot | Perplexity | Búsqueda con citas | Sí, si quieres aparecer citado |
| Meta-ExternalAgent | Meta | Entrenamiento de modelos | No aporta visitas |
El dato importante de esta tabla es la fila de Google: Google-Extended controla únicamente el uso de tu contenido para entrenar sus modelos y es independiente de Googlebot, el rastreador del buscador. Bloquear el primero no te saca de los resultados de búsqueda. Es la confusión que más veces frena a las empresas a la hora de tomar esta decisión.
Cómo se escribe en el robots.txt
El fichero vive en la raíz de tu dominio y es texto plano. Cada bloque son dos líneas: a quién va dirigido y qué le permites. Para bloquear el entrenamiento y dejar pasar la búsqueda, el contenido sería de esta forma, con un bloque por rastreador:
- Un bloque con User-agent: GPTBot seguido de Disallow: /, y lo mismo para ClaudeBot, CCBot, Google-Extended y Meta-ExternalAgent.
- Un bloque con User-agent: OAI-SearchBot seguido de Allow: /, y lo mismo para ChatGPT-User, Claude-User y PerplexityBot.
- Al final, tu bloque general para el resto de rastreadores y la línea que declara la ubicación de tu sitemap.
Tres cautelas al editarlo:
- Los nombres distinguen mayúsculas y hay que escribirlos exactos. Un «GPTbot» mal escrito no bloquea nada y no avisa de nada.
- No toques el bloque de Googlebot ni de Bingbot mientras haces esto. Un Disallow: / en el lugar equivocado te saca del buscador, y ese error sí tiene consecuencias inmediatas en tus visitas.
- Comprueba el resultado abriendo tu propio fichero en el navegador después de publicarlo y revisando que cada bloque está donde debe.
Si tu web está en un gestor de contenidos como Drupal o WordPress, el robots.txt puede estar generado por la plataforma o por un módulo. Conviene averiguar cuál manda antes de editarlo a mano, porque una actualización puede sobrescribir tus cambios sin avisar.
Por qué el robots.txt no es suficiente
Hay que tenerlo claro para no quedarse tranquilo con un falso remedio: el robots.txt es una convención voluntaria. Funciona porque las empresas grandes se han comprometido a respetarla y les interesa cumplirla, pero no impide técnicamente el acceso. Un rastreador que decida ignorarlo entra igual, y hay scrapers que se presentan directamente como si fueran un navegador normal.
Para esos casos, las medidas que de verdad bloquean están en la capa de servidor:
- Reglas en el CDN o el cortafuegos de aplicación. La mayoría de los proveedores de CDN incluyen hoy una opción para bloquear rastreadores de IA conocidos con un interruptor, actualizada por ellos. Es la vía más cómoda y la más eficaz.
- Límite de peticiones por tiempo. Un scraper agresivo se delata por el ritmo: cientos de páginas por minuto. Limitar las peticiones por dirección IP frena el raspado masivo sin molestar a los visitantes.
- Bloqueo por agente de usuario en el servidor. Devolver un código de rechazo a los agentes declarados. Útil, aunque fácil de esquivar falsificando el nombre.
- Protección de lo que de verdad importa. Si tienes un catálogo, una base de datos o fichas técnicas que son tu activo, ponlos detrás de un registro de usuario. Es la única medida que no se puede saltar: lo que no es público no se raspa.
Cuidado con el daño colateral
Un bloqueo demasiado agresivo por ritmo de peticiones puede afectar a servicios legítimos: tu herramienta de monitorización, la que comprueba enlaces rotos, la que genera las vistas previas cuando alguien comparte tu enlace. Después de aplicar reglas nuevas, revisa los registros del servidor unos días para ver qué estás rechazando.
Cómo saber si te están copiando y qué hacer
Dos comprobaciones sencillas y periódicas:
Mira los registros de tu servidor. Filtra por agente de usuario y verás qué rastreadores pasan, cuántas páginas se llevan y si respetan lo que has declarado. Es la única prueba objetiva de que tu configuración funciona.
Busca tus propias frases. Coge una frase literal y poco común de uno de tus textos, ponla entre comillas en un buscador y mira si aparece en webs que no son la tuya. Es la forma más rápida de detectar contenido duplicado.
Si encuentras tu contenido publicado en otro sitio, el camino es: documentarlo con capturas y fechas, reclamar al responsable de la web, y si no responde, dirigirse al proveedor de alojamiento, que suele tener un procedimiento de retirada. Tus textos y fotografías están protegidos por derechos de autor desde el momento en que los creas, sin necesidad de registrarlos.
En resumen: decide primero, configura después
Controlar los bots de IA no es un problema técnico complicado, es una decisión de negocio con una ejecución sencilla. Decide si tu contenido es tu producto o tu escaparate. Si es tu producto, cierra el entrenamiento y protege lo valioso detrás de un registro. Si es tu escaparate, bloquea el entrenamiento pero deja pasar a los rastreadores que citan, porque cada vez más clientes van a llegar por esa vía. Declara la decisión en el robots.txt, refuérzala en el CDN para quien no la respete y revisa los registros de tu servidor un par de veces al año, porque los nombres de los rastreadores cambian.
En Tangram Consulting dejamos esta configuración resuelta en los proyectos web que mantenemos, ajustada a si te interesa aparecer en las respuestas de los asistentes o proteger un contenido que es tu activo. Si no sabes qué está pasando hoy con tu web, escríbenos y lo revisamos juntos.