Tengo una relación poco razonable con los libros. Con los nuevos, naturalmente, porque sigo comprándolos, acumulándolos a un ritmo bastante superior al de lectura y recomendando alguno de vez en cuando en este rincón de Internet. Pero siento una especial debilidad por los libros viejunos, esos ejemplares de lomo castigado, páginas amarillentas y olor a papel antiguo que uno encuentra revolviendo una caseta de la Cuesta de Moyano, una librería de viejo o cualquier estantería donde llevan treinta años esperando a que alguien vuelva a abrirlos. En septiembre de 2024 ya confesé esta pequeña enfermedad en Entre el polvo y las palabras: el arte de cazar libros viejunos, donde contaba ese placer bastante difícil de explicar a quien considera un libro únicamente un recipiente para palabras. A mí me gustan también como objetos. Me gusta pensar quién los compró, quién escribió aquella nota a lápiz, quién dobló aquella página o por qué demonios alguien subrayó justamente la frase más irrelevante de todo el capítulo. Cada ejemplar tiene algo de superviviente y quizá por eso, cuando hace unas semanas escuché hablar de empresas vinculadas a la inteligencia artificial que compraban libros de segunda mano, les cortaban el lomo, los escaneaban y después mandaban el cadáver a reciclar, mi primer impulso fue bastante poco tecnológico y muy humano: estos bárbaros vienen ahora también a por mis libros. Y casi por reflejo corrí a revisar una de mis crónicas de viaje más queridas, la de aquel mes que pasé en Rusia en 1992. Treinta páginas escritas en un viejo ordenador de la época, cuando Internet todavía no era esa presencia ubicua que hoy parece haber existido desde siempre, y en las que quedó fijada mi mirada sobre una Rusia recién salida de la Unión Soviética, desconcertada, contradictoria y fascinante. Aquellas páginas no están en Google, no forman parte de ningún gran corpus digital y, hasta donde yo sé, ninguna inteligencia artificial ha aprendido de ellas. Son apenas mi recuerdo de aquel país y de aquel momento, conservado en un archivo nacido antes de que comenzáramos a volcar nuestra vida en la Red. Y de pronto entendí algo: quizá el verdadero valor de esos libros viejunos no esté solo en lo que cuentan, sino precisamente en que cuentan cosas que Internet nunca llegó a conocer.
El segundo impulso fue más interesante. Consistió en quitarle un poco de sentimentalismo al asunto, buscar documentación y preguntar qué diablos estaba ocurriendo realmente. Y entonces descubrí que la historia era bastante mejor que el titular fácil de unos tecnólogos malévolos triturando bibliotecas. Porque aquí no estamos hablando solamente de papel, ni siquiera fundamentalmente de libros. Estamos hablando de datos, de quién controla el conocimiento que todavía permanece fuera de Internet y de una carrera silenciosa por apropiarse de uno de los pocos territorios que los grandes modelos de inteligencia artificial aún no han explotado completamente. Dicho de otra manera: llevamos años preocupados porque las máquinas están aprendiendo de Internet y quizá deberíamos empezar a preocuparnos también porque han descubierto nuestras estanterías.
El extraño caso de los libros que nadie quería y de repente todos querían
La pista española de esta historia comienza de una manera deliciosamente analógica: un librero de viejo observa que algo no encaja. Marçal Font Espí, profesor de la Universitat de Barcelona, poeta y responsable de la Llibreria Fènix de Badalona, empezó a recibir pedidos que no se parecían demasiado a los de un coleccionista normal. No eran primeras ediciones de Cervantes ni incunables que justificasen asegurar el paquete como si dentro viajara la corona de Isabel la Católica. Eran libros baratos, olvidados, a menudo muy específicos, que podían llevar años esperando comprador, pero por los que alguien estaba dispuesto a pagar portes hacia Estados Unidos que llegaban a superar ampliamente el precio del propio ejemplar. Font lo explicó después en RTVE: eran unas «comandes desgavellades», pedidos disparatados cuya lógica comercial resultaba difícil de entender.
Font comenzó a investigar junto a Xavier Vinaixa Roselló, especialista en inteligencia artificial y director técnico de Sorensen AI, y de ahí nació una investigación titulada The Silent Plunder, El expolio silencioso. Ambos describen un patrón de adquisiciones de libros de segunda mano, especialmente obras de no ficción, publicaciones técnicas, actas, diarios y otros materiales poco representados en Internet, y relacionan esa demanda con la necesidad de alimentar sistemas de inteligencia artificial con textos escritos por humanos y nunca digitalizados. Su investigación plantea además una cadena industrial en la que el libro viaja hasta una instalación de procesamiento, pierde la encuadernación, pasa por un escáner de alta velocidad y termina convertido en papel para reciclar mientras su contenido continúa viviendo como archivo digital.
Conviene introducir aquí el primer freno, porque Internet tiene una extraordinaria capacidad para transformar una investigación interesante en una conspiración mundial antes del desayuno. Que un librero reciba un pedido extraño no demuestra que detrás esté Anthropic, Amazon o el doctor Maligno acariciando un gato blanco desde un centro de datos. Tampoco puede afirmarse que todos esos ejemplares terminen destruidos. Algunas empresas señaladas en informaciones sobre estas cadenas han negado dedicarse a la digitalización destructiva. Zoom Books, por ejemplo, ha asegurado que compra libros usados para revenderlos intactos y Anthropic afirma que no ha comprado libros a esa compañía ni que sus programas estén dirigidos a ejemplares raros o antiguos. Es una precisión importante, porque la historia no necesita que rellenemos con imaginación lo que todavía no conocemos. Lo que sí sabemos es que existen los pedidos anómalos y que, por otro lado, existen procesos industriales de compra y escaneado destructivo de millones de libros. Ambas cosas están documentadas. Lo que no debemos hacer es dibujar flechas entre cada comprador y cada empresa tecnológica sin pruebas suficientes.
Anthropic y una operación digna de una novela distópica
Y aquí es donde la historia deja definitivamente de depender de sospechas, porque aparece Anthropic, creadora de Claude, y aparece además en documentos judiciales. En el caso Bartz et al. v. Anthropic PBC, resuelto en primera instancia por el juez federal estadounidense William Alsup en junio de 2025, se documentó que la compañía había adquirido millones de libros impresos, muchos de ellos usados. Sus proveedores retiraban la encuadernación, cortaban las páginas, las escaneaban y descartaban los originales de papel. Por cada ejemplar físico se generaba una copia digital con texto legible por máquina y la compañía construía además su propio catálogo bibliográfico. Todo ese material pasó a formar lo que la propia documentación del procedimiento denomina una biblioteca general de investigación o generalized data area.
No estamos, por tanto, ante alguien imaginando lo que quizá podrían hacer las empresas de inteligencia artificial dentro de cinco años. Ya se hizo. A escala industrial. Con millones de libros.
Y la historia se vuelve todavía más cinematográfica cuando aparecen los documentos de Project Panama, un proyecto iniciado por Anthropic en 2024 cuyo objetivo interno era extraordinariamente ambicioso: digitalizar destructivamente libros a una escala que la propia compañía describía en términos prácticamente universales. Según documentos judiciales desclasificados y analizados por THe Washington Post, Anthropic gastó decenas de millones de dólares comprando y procesando millones de ejemplares; llegó a adquirir lotes de decenas de miles y estudió diferentes vías para conseguir material, desde grandes distribuidores hasta librerías de segunda mano. Los documentos describen incluso máquinas hidráulicas cortando los lomos para que escáneres industriales pudieran procesar después las páginas rápidamente, antes de que los restos fueran enviados a reciclaje.
Hay algo casi poético en todo esto. Hace veinte años Google quería fotografiar las grandes bibliotecas del mundo sin destruirlas para construir Google Books. Ahora una compañía de inteligencia artificial compra el ejemplar, le pasa la guillotina por el lomo y conserva únicamente su fantasma digital. El progreso, como vemos, también sabe utilizar una cizalla hidráulica.
Pero Project Panama aporta una pista todavía más interesante sobre el verdadero valor de los libros. Documentos internos citados por The Washington Post muestran que en Anthropic se consideraba que los libros podían enseñar a los modelos a escribir mejor y evitar parte del lenguaje de baja calidad que abunda en Internet. Esa observación debería hacernos levantar una ceja. Después de veinte años proclamando que todo el conocimiento humano estaba en la Red, resulta que cuando queremos construir máquinas capaces de manejar el lenguaje con cierta profundidad volvemos a aquello que llevamos cinco siglos perfeccionando: el libro.
Comprar, cortar, escanear y reciclar: por qué destruir el original importa
En este asunto hay también una pirueta jurídica bastante fascinante. Anthropic no solamente había comprado libros. Antes había obtenido millones de archivos procedentes de bibliotecas digitales piratas como LibGen y Pirate Library Mirror, y esa forma de adquisición terminó convirtiéndose en uno de los grandes problemas del litigio. El juez Alsup separó ambas situaciones. Una cosa era descargar masivamente obras pirateadas y almacenarlas; otra, comprar legítimamente un ejemplar físico, destruirlo mientras se crea una única versión digital sustituta y mantener esa versión dentro de la biblioteca interna de la compañía.
En las circunstancias concretas del caso, el juez consideró que ese cambio de formato de papel a digital podía acogerse al fair use estadounidense. El razonamiento es más estrecho de lo que algunos titulares han querido vender. La sentencia no proclama que cualquier empresa pueda apropiarse alegremente de cualquier libro porque haya tenido la delicadeza de comprar primero un ejemplar. Considera relevante que Anthropic adquiriera legalmente aquellos volúmenes, que destruyera la copia física al crear la digital, que no añadiera de esa manera un segundo ejemplar utilizable y que no distribuyera externamente las versiones resultantes. De hecho, la propia resolución insiste en que la cuestión de los materiales obtenidos mediante piratería era jurídicamente diferente.
Por eso la destrucción del libro no es un detalle macabro añadido para conseguir clics. Tiene una explicación industrial —es mucho más rápido pasar hojas sueltas por un escáner de producción que fotografiar con cariño cada página—, pero también encaja perfectamente en el argumento de que una copia sustituye a otra. El papel desaparece y queda el archivo. El objeto se convierte en datos.
En eso consiste, literalmente, la alquimia del siglo XXI.
¿Por qué quieren precisamente nuestros libros viejunos?
Esta es para mí la pregunta fundamental, porque un viejo manual de mecánica del suelo de 1973 no parece a primera vista el material por el que una empresa valorada en miles de millones debería perder el sueño. Sin embargo, visto desde la inteligencia artificial, empieza a resultar extraordinariamente atractivo.
Durante años, los modelos lingüísticos se han alimentado de cantidades colosales de información procedente de Internet. Páginas web, artículos, foros, repositorios, documentos, Wikipedia y colecciones de textos han proporcionado buena parte del combustible necesario para entrenarlos. Pero existe un límite evidente: la cantidad de texto humano de calidad disponible públicamente y en formato digital no es infinita. Xavier Vinaixa habla en este contexto del data wall, el muro de los datos. Y hay un segundo problema que se vuelve más relevante conforme la inteligencia artificial generativa coloniza la Red: desde 2022 una proporción creciente de lo que encontramos en Internet puede haber sido escrito, reescrito, traducido, resumido o contaminado de alguna manera por otros modelos. Los sistemas futuros corren así el riesgo de aprender cada vez más de material producido por sus propios antecesores, un fenómeno relacionado con lo que la investigación denomina model collapse.
Y entonces alguien mira una estantería.
Un libro publicado en 1978 posee una cualidad maravillosa desde el punto de vista de una máquina que busca alimento lingüístico: sabemos que no lo escribió ChatGPT. Un manual técnico de 1965, unas actas de congreso de 1982, una historia local publicada por una diputación provincial, una memoria minera de los años setenta o un recetario de una pequeña comarca constituyen información humana original y, en multitud de casos, jamás digitalizada. Son pequeños depósitos de conocimiento fuera de la gran cantera de Internet.
RTVE recogía precisamente esta idea al entrevistar a Font y Vinaixa. Hablaban de diarios, actas de congresos y manuales técnicos, obras muy específicas cuya información puede no existir en ningún otro lugar digital. Y ahí encuentro la parte más inquietante de toda esta historia: durante años consideramos esos libros poco valiosos porque casi nadie quería comprarlos. Ahora descubrimos que precisamente aquello que los hacía comercialmente irrelevantes —su rareza, su especificidad, su ausencia de Internet— puede hacerlos extraordinariamente interesantes como datos de entrenamiento.
La próxima fiebre del oro quizá tenga las páginas amarillas.
Los libreros empiezan a ver el mismo patrón en otros países
Lo ocurrido en Badalona tampoco parece una anomalía aislada. Durante el verano de 2026, libreros de segunda mano del Reino Unido e Irlanda explicaron a The Guardian que estaban recibiendo pedidos masivos y sorprendentemente heterogéneos de compradores difíciles de identificar. Una misma adquisición podía mezclar tratados agrícolas antiguos, biografías deportivas, revistas, traducciones específicas y toda clase de títulos sin relación temática aparente. Algunos vendedores describían pedidos enviados al mismo destino utilizando identidades distintas; otros señalaban que los compradores parecían tener escasa sensibilidad al precio y ninguna necesidad de negociar descuentos, comportamiento poco habitual en un mercado donde regatear cinco libras forma parte casi del patrimonio inmaterial.
En Australia ocurrió algo parecido. Libreros entrevistados por The Guardian hablaron de oleadas de compras de títulos antiguos, baratos y aparentemente escogidos sin un criterio temático convencional. Entre los ejemplos aparecía, deliciosamente para quien escribe estas líneas, un manual de mecánica del suelo de los años setenta adquirido junto a libros de ciclismo, poesía australiana e historia local. El algoritmo comprador —si es que era un algoritmo— tenía unos gustos bastante más eclécticos que los míos.
Los propios libreros plantean ahí una cuestión que va más allá del copyright. Un libro común del que existen cien mil ejemplares puede sobrevivir perfectamente a que alguien sacrifique uno en el altar de la inteligencia artificial. Pero ¿qué ocurre cuando hablamos de una tirada pequeña, una publicación local o un ejemplar especialmente raro? Los libreros especializados recuerdan algo que cualquier cazador de libros viejunos comprende perfectamente: un libro es más que el texto impreso que contiene. La encuadernación, las anotaciones, las dedicatorias, los exlibris, el papel, la edición o su procedencia también son información. Un PDF conserva palabras. No conserva necesariamente el objeto histórico.
Y entonces un libro siguió viajando hasta Las Vegas
La historia ha ganado todavía otra capa en agosto de 2026. Una investigación de 404 Media utilizó un dispositivo de seguimiento escondido en uno de los libros de un gran pedido para averiguar dónde terminaba. El viaje acabó en una instalación de Amazon en Las Vegas. Trabajadores del centro describieron una operación dedicada a recibir grandes cantidades de ejemplares, retirar sus encuadernaciones y escanearlos. Amazon, preguntada por los periodistas, reconoció que compra libros a través de canales comerciales para ayudar a desarrollar y mejorar productos y servicios. La investigación ha sido reproducida y contrastada posteriormente por diversos medios tecnológicos.
Resulta difícil resistirse a la ironía. Amazon conquistó Internet vendiéndonos libros y ahora vuelve a comprarlos para convertirlos en datos. Es casi una economía circular, aunque los que no completan el círculo son precisamente los libros.
También aquí mantendría la prudencia. Que Amazon esté procesando libros para desarrollar productos relacionados con inteligencia artificial no demuestra que cada compra extraña detectada en una librería europea termine en ese almacén de Nevada. Pero sí confirma algo importante: Anthropic no fue una extravagancia aislada. Existe una demanda industrial de libros impresos como fuente de información digital y esa demanda ha alcanzado ya una escala suficientemente grande como para justificar instalaciones, cadenas logísticas y operaciones específicas.
No están borrando la historia
Llegados a este punto es donde resulta tentador colocar música ominosa de fondo y concluir que Silicon Valley está comprando los últimos libros para destruirlos, monopolizar la memoria y después reescribir nuestro pasado a conveniencia. He escuchado versiones de esa tesis durante estos días y admito que proporciona un magnífico argumento para una novela. Solo tiene un pequeño problema: no he encontrado pruebas suficientes para presentarla como un hecho.
Comprar y destruir un ejemplar no significa eliminar una obra del mundo. Pueden sobrevivir docenas, cientos o miles de copias en bibliotecas públicas, universidades, archivos, depósitos legales, librerías y colecciones particulares. Tampoco hay evidencia sólida de un plan generalizado para localizar deliberadamente el último ejemplar de cada título y mandarlo a la trituradora. Anthropic, de hecho, sostiene que sus programas no compran ni destruyen libros raros. Los testimonios recogidos entre libreros muestran preocupación legítima por lo que podría suceder con obras escasas, pero eso no equivale a demostrar una operación diseñada para borrar la memoria histórica.
Y me alegro de que sea así, porque la realidad me parece bastante más interesante que la conspiración.
El verdadero asunto no es que estén borrando el pasado.
Es que están digitalizando una parte del pasado para convertirla en infraestructura privada.
Nosotros conservamos los libros; ellos poseen los datos
Imaginemos un pequeño tratado español de hidrogeología publicado en 1969. Quizá existan doscientos ejemplares desperdigados por universidades, bibliotecas, despachos de geólogos jubilados y casas donde alguien lleva años preguntándose por qué su padre jamás tiraba nada. El libro no está en Internet. Google apenas sabe que existe. Ningún buscador puede consultar sus páginas y ningún gran corpus digital ha incorporado sus tablas, su terminología o las observaciones de campo del autor.
Una empresa compra un ejemplar por quince euros. Paga cuarenta de transporte. Lo lleva hasta un centro industrial, corta el lomo, escanea cuatrocientas páginas, aplica OCR, incorpora el texto a una base de datos y recicla el papel.
¿Ha desaparecido el libro? No. Puede que todavía queden 199 ejemplares.
Pero ha ocurrido algo fundamental: la empresa posee ahora una versión estructurada, searchable, combinable y procesable de ese conocimiento. Puede incorporarla a un corpus de millones de obras y utilizarla para mejorar modelos capaces de responder a cientos de millones de usuarios.
Nosotros seguimos teniendo los objetos.
Ellos tienen los datos.
Y en una economía gobernada crecientemente por sistemas capaces de procesar información a una escala que ningún ser humano puede igualar, quizá deberíamos preguntarnos cuál de las dos cosas constituye el verdadero poder.
De los chips a los libros: las materias primas de la inteligencia artificial
Durante estos últimos años hemos aprendido que la inteligencia artificial tiene una sorprendente cantidad de necesidades materiales. Necesita GPU, semiconductores avanzados, centros de datos, enormes cantidades de electricidad, redes de comunicaciones, agua para refrigeración, tierras raras, capital y una cantidad nada despreciable de ingenieros muy bien pagados. Hemos convertido NVIDIA en símbolo de una época y analizamos cada movimiento de TSMC como antiguamente observábamos el precio del petróleo.
Pero hay otra materia prima sin la cual ninguna de esas máquinas sirve de demasiado: el conocimiento humano.
Los grandes modelos necesitan lenguaje bien construido, relaciones entre conceptos, argumentos, hechos, estilos, conocimientos especializados y maneras diferentes de mirar el mundo. Y los libros concentran todo eso con una densidad que buena parte de Internet sencillamente no posee. No es extraño que documentos internos de Anthropic concedieran tanta importancia a los libros como herramienta para enseñar a sus sistemas a escribir mejor.
Aquí aparece además una dimensión que en Europa deberíamos tomarnos particularmente en serio. Buena parte del material que sigue sin digitalizar pertenece precisamente a culturas, lenguas y disciplinas con menor representación en los grandes corpus globales. No hablamos necesariamente de El Quijote, Shakespeare o Newton, que llevan décadas digitalizados hasta en el tostador. Hablamos de publicaciones técnicas, pequeñas editoriales, revistas profesionales, documentación local, tesis antiguas, obras regionales y miles de textos que jamás tuvieron suficiente demanda como para justificar su conversión comercial a formato electrónico.
Por eso Vinaixa y Font llevan el debate hacia la soberanía cultural y tecnológica. Si ese patrimonio acaba digitalizado únicamente dentro de los repositorios privados que alimentan modelos estadounidenses, chinos o de cualquier otra procedencia, Europa puede encontrarse en una situación bastante paradójica: haber producido durante generaciones el conocimiento, conservar incluso sus ejemplares físicos y, sin embargo, depender de infraestructuras ajenas para explotarlo digitalmente a gran escala. En su conversación con RTVE reclamaban precisamente una estrategia colectiva y europea de preservación y aprovechamiento de esos materiales.
Eso sí debería preocuparnos.
No porque mañana alguien vaya a entrar en la Biblioteca Nacional con una trituradora.
Sino porque quizá estemos vendiendo por veinte euros una materia prima cuyo verdadero valor todavía no hemos aprendido a calcular.
La geología de las palabras
Por mi relación con la geología, no puedo evitar ver todo esto con cierta deformación profesional. Durante siglos hemos prospectado territorios buscando materiales que la mayoría de la gente era incapaz de ver. Donde alguien veía una montaña, un geólogo veía estratos; donde otro contemplaba un secarral, alguien encontraba indicios de un recurso enterrado millones de años atrás.
Con los datos está pasando algo parecido.
Durante dos décadas perforamos el enorme yacimiento de Internet. Extraímos páginas web, Wikipedia, redes sociales, repositorios, código, fotografías, artículos y cualquier fragmento de información que pudiera convertirse en combustible para los algoritmos. Ahora algunos de los mejores estratos empiezan a mostrar síntomas de agotamiento y, al mismo tiempo, las capas superiores comienzan a contaminarse con productos generados por las propias máquinas.
Así que los prospectores han vuelto la vista hacia formaciones más antiguas. Nuestros libros.
Ese manual de geotecnia que lleva cuarenta años en una balda, aquellas actas de un congreso de aguas subterráneas de 1976, una guía industrial publicada por una diputación, las memorias de un ingeniero o una pequeña monografía sobre una mina agotada pueden contener precisamente aquello que los modelos todavía no conocen. Para nosotros son publicaciones viejas. Para una inteligencia artificial son reservas de datos humanos no explotadas.
No sé ustedes, pero nunca imaginé que acabaríamos utilizando terminología geológica para hablar de una librería de viejo.
Aunque, visto cómo funciona este mundo, tampoco debería sorprenderme.
Seguiré cazando libros viejunos
Después de todo esto seguiré entrando en librerías de viejo. Seguiré revolviendo estanterías, abriendo ejemplares que nadie ha tocado en años y comprando libros que probablemente no necesito. Y ahora lo haré además con la divertida sensación de estar compitiendo por la mercancía con compañías cuyo presupuesto supera ligeramente el mío.
Tengo pocas posibilidades.
Ellos cuentan con centros de datos, algoritmos de compra y miles de millones de dólares.
Yo cuento con paciencia, una estantería que todavía admite alguna fila doble y cierta tendencia patológica a pensar que cualquier libro que cuesta tres euros terminará resultándome imprescindible.
Veremos quién gana.
Pero después de investigar esta historia miro esos ejemplares de otra manera. Durante años pensé que salvar un libro viejo significaba impedir que acabara en un contenedor y darle otra oportunidad para ser leído. Ahora comprendo que existe una segunda batalla, menos romántica pero quizá bastante más importante: decidir quién digitaliza nuestro patrimonio, quién conserva esas copias, con qué condiciones pueden utilizarse y quién termina convirtiendo siglos de conocimiento humano en ventaja tecnológica.
No creo que las empresas de inteligencia artificial estén comprando libros para borrar la historia. No necesitan hacerlo. Han descubierto algo mucho más sencillo: que el pasado contiene una enorme cantidad de información todavía sin explotar, que se puede comprar sorprendentemente barata y que puede ayudarles a construir los sistemas que dominarán buena parte de nuestro futuro.
Por eso aquellos volúmenes que llevaban décadas olvidados han empezado a despertar. No porque de repente alguien haya aprendido a quererlos. Sino porque alguien ha aprendido a valorarlos como datos. Y esa diferencia importa. Mucho.
Porque quizá el gran negocio de los próximos años no consista solamente en construir la máquina más poderosa, comprar el mejor chip o levantar el centro de datos más grande.
Quizá consista también en controlar aquello con lo que alimentamos a la máquina.
Y, mientras discutíamos sobre el futuro, alguien empezó a comprar el pasado.
