Los libros como materia prima central de la IA: la disputa de las tecnológicas por el conocimiento humano

El agotamiento del material en internet empuja a buscar textos probados, mientras crecen las disputas por la propiedad intelectual y se reabre el debate sobre patrimonio y acceso libre

Durante años, buena parte de la inteligencia artificial actual se entrenó con contenidos disponibles en internet. Páginas web, foros, artículos, enciclopedias y repositorios digitales proporcionaron enormes cantidades de texto para enseñar a los grandes modelos de lenguaje. Pero la red empieza a mostrar sus límites. Algunas empresas tecnológicas han buscado otra fuente de conocimiento y han encontrado en los libros la solución.

A principios de 2026, The Washington Post reveló una de estas estrategias a partir de documentos judiciales relacionados con Anthropic, la empresa responsable del asistente de IA Claude. La investigación sacó a la luz “Project Panama”, un proyecto secreto iniciado en 2024 para adquirir libros impresos a gran escala. Los ejemplares se escaneaban y sus textos se incorporaban a los procesos de desarrollo de modelos de IA. Para acelerar el proceso, millones de libros fueron cortados, digitalizados y después enviados a reciclar.

El procedimiento muestra un cambio importante en la forma de valorar el libro. El objeto físico pierde importancia frente a su contenido. El texto puede extraerse, convertirse en datos y utilizarse para alimentar modelos de inteligencia artificial.

Anthropic no es la única compañía interesada en acceder a grandes colecciones de libros. En mayo de 2026, cinco grandes editoriales estadounidenses y el escritor Scott Turow demandaron a Meta y Mark Zuckerberg. Los acusaron de utilizar millones de libros y artículos procedentes de repositorios piratas para entrenar a su modelo Llama. Otros litigios contra empresas de IA apuntan en la misma dirección.

Infobae

CulturaAgregar Infobae enGoogle

Los libros como materia prima central de la IA: la disputa de las tecnológicas por el conocimiento humano

El agotamiento del material en internet empuja a buscar textos probados, mientras crecen las disputas por la propiedad intelectual y se reabre el debate sobre patrimonio y acceso libre

PorPaloma González DíazSeguirRobot con múltiples brazos y la inscripción LEXA sostiene varios libros abiertos sobre una mesa de madera rodeada de estanterías.¿Por qué las empresas de inteligencia artificial están comprando millones de libros? (Imagen Ilustrativa Infobae)

27 Ago, 2026 12:50 a. m. AR

Durante años, buena parte de la inteligencia artificial actual se entrenó con contenidos disponibles en internet. Páginas web, foros, artículos, enciclopedias y repositorios digitales proporcionaron enormes cantidades de texto para enseñar a los grandes modelos de lenguaje. Pero la red empieza a mostrar sus límites. Algunas empresas tecnológicas han buscado otra fuente de conocimiento y han encontrado en los libros la solución.

La difícil posición de Borges ante la Guerra de Malvinas

Te puede interesar:La difícil posición de Borges ante la Guerra de Malvinas

A principios de 2026, The Washington Post reveló una de estas estrategias a partir de documentos judiciales relacionados con Anthropic, la empresa responsable del asistente de IA Claude. La investigación sacó a la luz “Project Panama”, un proyecto secreto iniciado en 2024 para adquirir libros impresos a gran escala. Los ejemplares se escaneaban y sus textos se incorporaban a los procesos de desarrollo de modelos de IA. Para acelerar el proceso, millones de libros fueron cortados, digitalizados y después enviados a reciclar.

PUBLICIDAD

https://46410de262101912d4c01a01d30f29f8.safeframe.googlesyndication.com/safeframe/1-0-45/html/container.html

El procedimiento muestra un cambio importante en la forma de valorar el libro. El objeto físico pierde importancia frente a su contenido. El texto puede extraerse, convertirse en datos y utilizarse para alimentar modelos de inteligencia artificial.

Las alucinaciones que la guiaron, la vida en un hospital psiquiátrico y la fama tardía: Yayoi Kusama, reina de los lunares

Te puede interesar:Las alucinaciones que la guiaron, la vida en un hospital psiquiátrico y la fama tardía: Yayoi Kusama, reina de los lunares

Anthropic no es la única compañía interesada en acceder a grandes colecciones de libros. En mayo de 2026, cinco grandes editoriales estadounidenses y el escritor Scott Turow demandaron a Meta y Mark Zuckerberg. Los acusaron de utilizar millones de libros y artículos procedentes de repositorios piratas para entrenar a su modelo Llama. Otros litigios contra empresas de IA apuntan en la misma dirección.

PUBLICIDADAnthropic, la empresa responsable del asistente de IA Claude (REUTERS/Dado Ruvic/Illustration)Anthropic, la empresa responsable del asistente de IA Claude (REUTERS/Dado Ruvic/Illustration)

Los libros han adquirido así un nuevo valor estratégico. Ya no son solo objetos que contienen y transmiten conocimiento. También son grandes conjuntos de datos en la competición por desarrollar mejores modelos de inteligencia artificial.

Los grandes modelos de lenguaje necesitan enormes cantidades de texto. Sin embargo, cantidad y calidad no son necesariamente lo mismo. Internet ofrece una diversidad difícil de encontrar en otro lugar. Pero también contiene textos breves, repetidos o poco revisados.

Además, desde 2022, cada vez hay más contenidos creados con IA en internet. Un estudio publicado en 2026 analizó páginas web aparecidas entre 2022 y 2025. A mediados de 2025, alrededor del 35 % de las nuevas páginas estudiadas incluían textos generados o modificados con IA. Esto no significa que el 35 % de internet haya sido creado por máquinas, pero sí muestra que estos contenidos tienen cada vez más presencia en la red.

El problema no es solo distinguir quién ha escrito qué. Una investigación publicada en Nature ya mostró en 2024 que entrenar sucesivas nuevas generaciones de modelos con contenidos producidos por modelos anteriores puede provocar una degradación progresiva de los resultados.

En este contexto, los libros anteriores a la expansión de la IA generativa adquieren un nuevo valor. Ofrecen a las empresas tecnológicas contenidos extensos y estructurados que, en muchos casos, han pasado por procesos profesionales de edición y corrección. Además, han sido escritos por personas.Brazos robóticos manipulan libros en una cinta transportadora junto a maquinaria de triturado y fardos de papel en una nave.El “Project Panama”, un proyecto secreto iniciado en 2024 para adquirir libros impresos a gran escala. Los ejemplares se escaneaban y sus textos se incorporaban a los procesos de desarrollo de modelos de IA. Para acelerar el proceso, millones de libros fueron cortados, digitalizados y después enviados a reciclar (Imagen Ilustrativa Infobae)

Cuando el patrimonio se convierte en datos

Durante siglos hemos creado bibliotecas, archivos y universidades para conservar una parte de nuestra memoria colectiva. Estas instituciones no se limitan a almacenar sus fondos, también los catalogan, los preservan y los hacen accesibles.

La inteligencia artificial está dando un nuevo valor a ese patrimonio. No interesa el ejemplar físico; importa la información que contiene. Al digitalizarlo, el texto puede convertirse en datos y utilizarse para entrenar modelos de IA.

Desde la pasada primavera, libreros de España, Alemania, Australia y Nueva Zelanda han alertado de pedidos masivos y poco habituales realizados por la empresa canadiense Zoom Books. Esta compañía se dedica a la venta de libros de segunda mano por internet. Sus compras suelen realizarse a través de grandes plataformas como AbeBooks o Biblio. En ellas se pueden encontrar desde títulos baratos hasta ediciones raras y difíciles de conseguir.

Estos patrones de compra –y el precedente de Anthropic– han despertado sospechas. Sobre todo, por su volumen y por el interés en obras antiguas, descatalogadas o que no están disponibles en formato digital. Zoom Books niega que sea para alimentar a la IA y, por el momento, no existen pruebas concluyentes que permitan atribuirle ese fin.Pilas de libros antiguos sobre mesas de madera y estanterías repletas de tomos encuadernados.El pedido de libros antiguos y descatalogados ha despertado sospechas de los libreros (Imagen Ilustrativa Infobae)

Pero el fenómeno muestra hasta qué punto el contenido de los libros ha adquirido un nuevo valor. La información puede extraerse del objeto, convertirse en datos y circular de forma independiente. Muchos de estos textos nunca se han digitalizado, y algunos contienen conocimientos locales, especializados o publicados en lenguas con poca presencia en internet. Ofrecen información que todavía no está disponible en grandes bases de datos digitales.

Una nueva carrera por el conocimiento

Durante los últimos años hemos hablado de la carrera de la IA en términos de procesadores, energía, centros de datos y algoritmos. Pero la compra masiva de libros pone sobre la mesa otro recurso estratégico, mucho menos visible: el conocimiento humano.

Destruir un ejemplar puede parecer poco relevante cuando existen miles de copias. Pero no todos los libros están en esa situación. Muchos están descatalogados, tuvieron tiradas pequeñas o pertenecen a editoriales y ámbitos locales. Otros son difíciles de encontrar. En estos casos, cada ejemplar que desaparece dificulta el acceso a su contenido.

También importa qué libros se eligen. No todos los conocimientos están igual de representados en los datos que utilizan los modelos de IA. La selección puede reforzar desequilibrios que ya existen en internet.Un mazo judicial con las letras AI en el centro, apoyado sobre un libro abierto en una mesa de madera. Un patrón de circuito y luces azules lo rodean.Escritores, editoriales y otros creadores cuestionan que sus obras puedan utilizarse para entrenar sistemas comerciales de IA sin permiso ni compensación (Imagen Ilustrativa Infobae)

La lengua es un buen ejemplo. También lo son el origen geográfico, la época o el tipo de conocimiento. Algunas culturas, perspectivas y formas de entender el mundo pueden estar muy presentes. Otras, mucho menos. Y otras pueden quedar al margen.

A esto se suma el debate sobre los derechos de autor. Escritores, editoriales y otros creadores cuestionan que sus obras puedan utilizarse para entrenar sistemas comerciales de IA sin permiso ni compensación. En Europa, la normativa sobre inteligencia artificial intenta aportar algo más de transparencia. Entre otras medidas, exige a las empresas responsables de los grandes modelos informar sobre los contenidos utilizados para entrenarlos y adoptar medidas para respetar la legislación europea sobre derechos de autor.

La cuestión, en todo caso, no es solo qué pueden aprender las nuevas herramientas tecnológicas de nuestros libros. Debemos preguntarnos qué ocurre con ellos tras su digitalización y procesamiento masivo, qué se conserva, qué puede llegar a desaparecer y qué conocimientos quedan fuera. Porque seleccionar los contenidos con los que aprende una IA también significa decidir qué voces estarán más presentes en sus respuestas y qué sesgos puede reproducir.

Fuente: Infobae