¿Puedes Impedir que la IA Entrene con tu Web?
← Divagaciones

¿Puedes Impedir que la IA Entrene con tu Web?

2026-08-25 · Clara F. & agents

Ahora mismo, algo está leyendo tu web. No es un cliente, y probablemente ni siquiera es una persona. Es un programa con un nombre como GPTBot o ClaudeBot, y no está ahí para reservar una mesa ni pedir un presupuesto. Está ahí para copiar tus palabras (las descripciones de tu carta, los textos de tu portafolio, ese "sobre nosotros" que escribiste a medianoche) y meterlas en un montón de texto que entrena el modelo de inteligencia artificial de otra empresa. Para siempre, y sin preguntar.

Nunca me había parado a pensarlo hasta que una clienta fotógrafa me hizo una pregunta sencilla: "si subo mi mejor trabajo a la web, ¿se lo estoy regalando a una máquina?". No tenía una respuesta segura. Así que fui a buscarla.

Qué significa realmente "entrenar"

Cuando se habla de que una IA "se entrena con tu web", se refiere a esto: las empresas que construyen modelos de IA envían rastreadores automáticos por internet, igual que hace Google, solo que en lugar de montar un índice de búsqueda, están montando un conjunto de datos: millones de páginas de texto e imágenes reales que enseñan al modelo cómo es el lenguaje humano y cómo son las fotos. Tu web es una página dentro de un conjunto de miles de millones.

El mecanismo en sí no tiene nada de siniestro. Se parece más a un lector muy rápido y muy minucioso que a un intruso. Lo que sí importa es si ese lector necesitaba tu permiso para entrar, y hasta este año nadie tenía una respuesta clara.

El juicio que (casi) lo respondió

En 2025, un juez federal de Estados Unidos, William Alsup, resolvió un caso presentado por varios autores contra Anthropic, la empresa detrás de Claude. El resultado sorprendió a mucha gente: dictaminó que entrenar una IA con libros con derechos de autor es, en sí mismo, legal. Lo comparó con cómo un escritor estudia la obra de otros escritores para aprender el oficio. Lo que no era legal era de dónde había sacado Anthropic parte de esos libros: copias piratas de bibliotecas ilegales. Anthropic pagó 1.500 millones de dólares por ese problema concreto de origen, no por el entrenamiento en sí.

Así que el estado legal actual, a día de hoy, es este: leer tu contenido público para entrenar una IA muy probablemente está permitido. Robarlo de donde nunca debió estar disponible, no. Es una distinción real, pero da poco consuelo si lo que de verdad quieres es un botón de "no entrenes con esto" (porque, legalmente, para el contenido que tú misma publicaste, ese botón todavía no existe del todo). Los tribunales siguen resolviendo los límites caso por caso, y nadie serio espera que esto quede zanjado en unos pocos años.

La única palanca que sí tienes

Aquí va la parte práctica. Tu web tiene un pequeño archivo de texto llamado `robots.txt` que le dice a los visitantes automáticos qué pueden hacer. La mayoría de los rastreadores de las empresas de IA (GPTBot, ClaudeBot, Google-Extended, CCBot, y una docena más) dicen que lo respetan. Tú (o quien te lleve la web) podéis añadir unas líneas diciéndoles a esos robots que no entren.

Es útil saber que existe, de verdad. Pero también conviene tener cuidado con lo que bloqueas, porque no todos los robots de IA hacen el mismo trabajo. Algunos, como GPTBot o ClaudeBot, existen solo para recopilar datos de entrenamiento. Otros, como OAI-SearchBot o PerplexityBot, existen para responder a la pregunta de alguien citando tu página en el momento (algo más parecido a cómo Google te envía una visita que a un conjunto de datos). Bloquear todo lo que suene a "IA" puede significar bloquear justo el tráfico que estaba a punto de convertirse en cliente. Bloquea los robots de entrenamiento si eso es lo que te preocupa; deja tranquilos a los de búsqueda si prefieres aparecer cuando alguien le pregunta a un asistente de IA "dónde puedo arreglar esto cerca de mí".

Lo que no puede hacer

Quiero ser honesta sobre el tamaño de esta palanca, porque es más pequeña de lo que parece. `robots.txt` es una petición, no un candado: solo funciona con los rastreadores que deciden respetarlo, y muchos scrapers más pequeños o menos escrupulosos simplemente lo ignoran. No hace nada con lo que ya se recopiló antes de que lo añadieras; no hay un botón de "olvida mi web" al otro lado. Y no protege nada que ya esté publicado en otros sitios (una web de reseñas, un anuncio en un marketplace, una foto que alguien más volvió a subir), porque ese contenido nunca fue tuyo para bloquear.

Así que esto no es una solución. Es algo pequeño y real que puedes hacer, junto a una verdad mucho más grande: en cuanto algo es público en internet, alguna versión de "alguien puede aprender de esto" ya forma parte de lo que significa publicar. Eso era cierto antes de la IA, a menor escala (buscadores, archivos, rastreadores de todo tipo), y el entrenamiento de IA lo ha hecho una pregunta más grande, no una pregunta nueva.

Hace un tiempo escribí sobre la otra mitad de esta misma preocupación: qué pasa cuando escribes los datos de tus propios clientes y proveedores en un chatbot, una decisión que tomas cada vez que abres ChatGPT. Esto es la mitad silenciosa: qué pasa con lo que ya publicaste, sin que tú hagas nada en absoluto.

Una cosa que hacer esta semana

Pregúntale a quien lleve tu web (o compruébalo tú misma, es un solo archivo) qué dice ahora mismo tu `robots.txt` sobre los rastreadores de IA. La mayoría de las webs creadas antes de este año no dicen nada, lo que significa que todos los robots de entrenamiento de IA importantes entran por defecto. Decidas bloquearlos, dejarlos pasar o permitir solo los de búsqueda, que sea una decisión que tomaste tú, no un ajuste que nadie tocó nunca.