Las empresas de inteligencia artificial están buscando algo que durante siglos ha permanecido en bibliotecas, librerías y estanterías: texto humano de alta calidad.
En los últimos meses, distintas investigaciones han revelado que compañías del sector han comprado grandes cantidades de libros físicos para digitalizarlos y utilizarlos como datos de entrenamiento. En algunos casos, los ejemplares son desmontados, escaneados y posteriormente destruidos. Los pedidos gestionados mediante intermediarios habrían oscilado entre 1.000 y hasta un millón de libros.
La noticia parece extraña, incluso paradójica: mientras el mundo avanza hacia lo digital, las empresas de IA están regresando al papel. Pero detrás de esta estrategia hay tres motivos principales: calidad de los datos, problemas legales y temor a entrenar modelos con contenido generado por otras inteligencias artificiales.
El motivo principal: conseguir mejores datos
Los modelos de lenguaje necesitan enormes cantidades de texto para aprender a responder, traducir, resumir, programar y generar contenido. Durante años, muchas empresas obtuvieron esos datos rastreando páginas públicas de internet.
Sin embargo, la web está cambiando rápidamente. Cada vez hay más textos, imágenes y vídeos producidos por IA. Esto plantea una preocupación: si los nuevos modelos se entrenan principalmente con material creado por otros modelos, su calidad podría deteriorarse.
Los libros publicados antes de la expansión masiva de la IA generativa ofrecen una fuente de contenido escrito por personas, con mayor diversidad de estilos, vocabulario y estructuras narrativas.
¿Qué aportan los libros?
- Textos extensos y bien estructurados.
- Vocabulario variado.
- Explicaciones profundas y contextualizadas.
- Ejemplos de razonamiento humano.
- Información especializada.
- Menor riesgo de contaminación por contenido sintético.
| Fuente de datos | Ventaja | Problema |
|---|---|---|
| Internet | Gran volumen y actualización constante | Calidad irregular y contenido duplicado |
| Libros | Profundidad, estructura y lenguaje humano | Coste de adquisición y derechos de autor |
| Contenido generado por IA | Fácil de producir y escalar | Riesgo de errores repetidos y degradación |
| Datos académicos | Alta especialización | Acceso limitado y licencias complejas |
| Datos propios | Mayor control y relevancia | Coste elevado de recopilación |
¿Qué significa “contaminación” de datos?
La llamada contaminación de datos ocurre cuando un conjunto de entrenamiento contiene información repetida, sintética, errónea o generada por modelos anteriores.
Esto puede generar el denominado model collapse o colapso del modelo: una degradación progresiva que aparece cuando una IA aprende de contenidos producidos por otras IA sin suficiente supervisión humana.
El resultado puede incluir:
- Respuestas más genéricas.
- Menor diversidad de ideas.
- Repetición de errores.
- Pérdida de matices culturales.
- Menor capacidad para interpretar contextos complejos.
- Mayor tendencia a reproducir patrones artificiales.
Por eso, los libros se han convertido en una especie de reserva de datos analógicos. No son perfectos, pero contienen un volumen considerable de lenguaje producido antes de que la IA comenzara a inundar internet.
¿Por qué comprarlos en formato físico?
A primera vista, podría parecer más sencillo comprar archivos digitales. Sin embargo, los libros físicos presentan algunas ventajas estratégicas.
1. Pueden obtenerse en grandes lotes
Las empresas pueden adquirir colecciones completas de librerías de segunda mano, distribuidores o intermediarios. Algunas operaciones habrían alcanzado cientos de miles de ejemplares.
2. Permiten crear copias digitales propias
La empresa obtiene el libro físico, lo escanea y construye un archivo digital que puede procesar internamente.
3. Son más fáciles de clasificar por fecha
Los libros impresos publicados antes de 2022 pueden identificarse como material creado antes de la explosión del contenido generativo.
4. Reducen la dependencia de plataformas online
Las compañías no necesitan confiar exclusivamente en archivos digitales de terceros ni en grandes repositorios de internet.
5. Facilitan el control de la calidad
Antes de escanear, pueden seleccionar títulos académicos, técnicos, literarios o especializados.
¿Qué es el escaneo destructivo?
El escaneo destructivo es un procedimiento industrial que permite digitalizar libros rápidamente. En lugar de pasar cada página manualmente, se corta el lomo del libro para separar sus hojas y después se introducen en escáneres de alta velocidad.
El proceso suele incluir:
- Compra de los ejemplares.
- Clasificación por temática o calidad.
- Corte o retirada del lomo.
- Digitalización de las páginas.
- Reconocimiento óptico de caracteres.
- Limpieza y estructuración del texto.
- Incorporación a una base de datos.
- Destrucción o reciclaje del ejemplar físico.
Esta técnica es rápida y eficiente, pero también ha despertado críticas porque convierte libros, incluidos ejemplares antiguos o difíciles de encontrar, en una fuente de datos de uso industrial.
El caso de Anthropic y el llamado Project Panama
Documentos judiciales revelados durante litigios sobre derechos de autor mostraron que Anthropic, la empresa responsable de Claude, compró millones de libros físicos para escanearlos y utilizarlos en el entrenamiento de sus modelos.
Según las informaciones publicadas, el proyecto habría contemplado escanear entre 500.000 y dos millones de libros en un periodo de seis meses.forbes
La operación habría requerido una inversión de decenas de millones de dólares y compras realizadas en lotes de decenas de miles de ejemplares.elobservador.com+1
El caso es especialmente relevante porque muestra que la adquisición de datos de entrenamiento ya no es una actividad secundaria. Se ha convertido en una operación industrial que implica:
- Compras masivas.
- Empresas intermediarias.
- Logística internacional.
- Escaneo especializado.
- Procesamiento de derechos de autor.
- Almacenamiento de grandes volúmenes de información.
¿Es legal escanear y destruir libros?
La respuesta depende del país, del tipo de uso, de las licencias y de las decisiones judiciales aplicables.
Las empresas de IA sostienen que la digitalización para entrenar modelos puede constituir un uso legítimo cuando poseen legalmente los ejemplares y utilizan las copias con fines internos. Autores y editoriales, en cambio, argumentan que entrenar modelos comerciales con obras protegidas requiere autorización o compensación.
El debate gira en torno a varias preguntas:
- ¿Comprar un libro permite digitalizarlo?
- ¿El entrenamiento de una IA es una transformación legítima?
- ¿Debe pagarse a los autores?
- ¿La destrucción del ejemplar cambia el análisis legal?
- ¿Puede utilizarse el texto para crear un producto comercial?
- ¿Cómo se demuestra que una obra no se reproduce literalmente?
Algunas informaciones de 2026 señalan que determinados tribunales han considerado legítimo un uso específico de copias compradas y escaneadas para entrenamiento interno. Sin embargo, esa conclusión no equivale automáticamente a una autorización universal para todas las empresas, países o finalidades.wwwhatsnew
La situación jurídica continúa siendo compleja y puede cambiar a medida que avancen los litigios y la legislación.
La gran batalla por los derechos de autor
La compra de libros refleja una disputa más amplia entre la industria tecnológica y el sector cultural.
Argumentos de las empresas de IA
- Los modelos aprenden patrones y no necesariamente almacenan una copia completa de cada obra.
- La formación de modelos puede considerarse una actividad transformadora.
- La innovación tecnológica necesita grandes volúmenes de datos.
- Comprar ejemplares físicos supone adquirirlos legalmente.
- La IA puede generar beneficios sociales y científicos.
Argumentos de autores y editoriales
- Las obras fueron creadas por personas y tienen valor económico.
- El entrenamiento puede producir herramientas que compiten con los creadores.
- Los autores no siempre han dado permiso para utilizar sus libros.
- Las empresas de IA obtienen beneficios a partir de contenido protegido.
- La compensación y la atribución siguen siendo insuficientes.
| Empresas de IA | Autores y editoriales |
|---|---|
| Hablan de aprendizaje estadístico | Hablan de explotación de obras |
| Defienden el uso transformador | Reclaman autorización |
| Destacan la innovación | Exigen compensación |
| Afirman que no reproducen todo el libro | Temen sustitución y competencia |
| Buscan grandes corpus de entrenamiento | Piden transparencia sobre los datos |
¿Por qué no basta con usar contenido de internet?
La internet ofrece una cantidad enorme de información, pero no todo ese contenido tiene el mismo valor.
Algunos problemas frecuentes son:
- Textos duplicados.
- Información sin verificar.
- Publicidad disfrazada de contenido.
- Páginas creadas automáticamente.
- Errores que se repiten entre sitios.
- Contenido superficial.
- Datos obsoletos.
- Material protegido por derechos de autor.
Los libros no están libres de errores, pero suelen tener procesos editoriales más rigurosos y ofrecen contenidos más extensos. Para una IA, un capítulo bien desarrollado puede aportar más contexto que cientos de fragmentos breves de páginas web.
La tendencia no significa que internet haya dejado de ser útil. Significa que las empresas están intentando combinar distintas fuentes para crear conjuntos de datos más fiables.
¿Qué tipos de libros interesan más?
No todos los títulos tienen la misma utilidad para entrenar modelos. Las empresas pueden mostrar interés en categorías como:
- Ciencia y tecnología.
- Medicina y biología.
- Ingeniería.
- Derecho.
- Economía.
- Historia.
- Filosofía.
- Literatura.
- Educación.
- Manuales especializados.
Los libros académicos y técnicos pueden aportar terminología y explicaciones que no siempre aparecen en publicaciones digitales. La literatura, por su parte, ofrece variedad de estilos, diálogos, narrativas y formas de expresar emociones.
La selección depende del objetivo del modelo. Una IA médica necesita datos distintos de una herramienta diseñada para redactar historias o programar software.
La paradoja: la IA necesita contenido humano
La inteligencia artificial puede producir textos en segundos, pero todavía depende de grandes cantidades de material humano para entrenarse y evaluar su calidad.
Esta paradoja es cada vez más evidente:
- La IA genera contenido.
- Ese contenido aumenta en internet.
- Los modelos necesitan datos nuevos.
- El material sintético puede introducir errores.
- Las empresas vuelven a buscar fuentes humanas.
- Los libros recuperan valor estratégico.
En otras palabras, la tecnología más avanzada está regresando a una fuente muy antigua: la escritura humana editada y publicada.
¿Qué impacto tiene en autores y lectores?
La compra masiva de libros puede tener efectos positivos y negativos.
Posibles beneficios
- Mayor interés por el patrimonio editorial.
- Nuevas oportunidades de licenciamiento.
- Creación de mercados para derechos digitales.
- Financiación para autores y editoriales.
- Reconocimiento del valor de los contenidos humanos.
Posibles riesgos
- Destrucción de ejemplares difíciles de reemplazar.
- Digitalización sin autorización.
- Falta de compensación a los autores.
- Concentración de conocimiento en pocas empresas.
- Uso opaco de obras protegidas.
- Reventa o reutilización no controlada de los datos.
El debate no debería limitarse a si una IA puede leer un libro. También debe preguntar quién controla la copia, para qué se utiliza y quién recibe los beneficios.
¿Qué puede cambiar en el futuro?
La presión legal y social probablemente impulsará nuevos modelos de relación entre creadores y empresas de IA.
Posibles escenarios
- Licencias colectivas para utilizar catálogos completos.
- Pagos por uso o por volumen de obras incorporadas.
- Bases de datos autorizadas por editoriales y autores.
- Sistemas de trazabilidad para registrar fuentes.
- Modelos entrenados exclusivamente con contenido permitido.
- Etiquetas de procedencia para identificar los datos utilizados.
- Acuerdos específicos por sector, como medicina o educación.
El reto será construir un sistema que permita innovar sin convertir la producción cultural en una materia prima gratuita.
Qué significa para los creadores de contenido
Para bloggers, periodistas, escritores y especialistas, esta tendencia confirma que el contenido original conserva un valor estratégico.
Algunas recomendaciones son:
- Documenta la autoría de tus textos.
- Conserva versiones y fechas de publicación.
- Revisa las condiciones de uso de las plataformas.
- Considera licencias claras para tus contenidos.
- Evita publicar información personal sensible.
- Diferencia el contenido propio del material generado por IA.
- Consulta las normas de derechos de autor aplicables a tu país.
La IA puede ayudarte a investigar, estructurar y editar, pero la experiencia, la perspectiva y la voz humana siguen siendo recursos valiosos.
Conclusión: los libros son el nuevo campo de batalla de la IA
Las empresas de inteligencia artificial están comprando millones de libros porque necesitan datos de alta calidad, escritos por personas y menos expuestos a la contaminación del contenido sintético. También buscan reducir la dependencia de internet y construir grandes repositorios propios de información.
El caso de Anthropic y Project Panama demuestra hasta qué punto esta estrategia puede alcanzar una escala industrial: compras masivas, escaneo acelerado y debates jurídicos sobre el uso de obras protegidas.
La cuestión central no es solo por qué la IA necesita libros. Es cómo se utilizarán esos libros, quién autoriza su digitalización y qué modelo de compensación recibirán quienes los escribieron.
La inteligencia artificial puede aprender de la cultura humana, pero esa cultura no debería tratarse como un recurso invisible y sin propietarios.
“Los libros publicados hace décadas ya anticipaban muchos de los dilemas actuales de la inteligencia artificial, desde la automatización del trabajo hasta la creación de máquinas capaces de igualar las capacidades humanas.” ¿Puede la inteligencia artificial superar a los humanos? Riesgos, oportunidades y escenarios para el empleo del futuro, según Alan Daitch,
“La carrera por liderar la inteligencia artificial no solo depende de los modelos, sino también del acceso a grandes cantidades de información y conocimiento para entrenarlos.” Anthropic ya está preparando justo lo único que le faltaba para reforzar su liderazgo IA: un chip propio,
“Los sistemas de inteligencia artificial necesitan grandes volúmenes de información para mejorar su capacidad de comprender el lenguaje, analizar ideas complejas y responder a los usuarios.” “Noticias de Inteligencia Artificial precios, agentes y ciberseguridad”
