Los laboratorios de IA están comprando libros de segunda mano al por mayor, y siempre con el mismo filtro: impresos antes de 2022. 404 Media destapó la práctica el 21 de julio. La razón es que un libro anterior a esa fecha es anterior a los grandes modelos de lenguaje, así que no puede llevar dentro texto escrito por una IA.
Puntos clave
- Los pedidos van de 1.000 ejemplares a un millón de libros en una sola operación, según el reportaje.
- Un librero profesional dijo a 404 Media que pasó de mover unos 20 libros por semana a cientos, y que la subida arrancó en abril.
- ISBNdb intermedia esas compras y las vende como conocimiento humano curado, revisado y libre de generación automática.
- La empresa impone acuerdos de confidencialidad estrictos en cada operación. Admite abiertamente que "una empresa de IA destruye dos millones de libros" no es un titular que le convenga a nadie.
- Anthropic pagó 1.500 millones de dólares para cerrar el acuerdo por haber entrenado con libros pirateados. Un juez había dictaminado antes que digitalizar libros comprados legalmente sí es uso legítimo.
Por qué 2022 es la frontera
El problema técnico se llama colapso del modelo. Cuando un modelo se entrena con texto que a su vez generó otro modelo, los errores se amplifican en cada vuelta y la calidad cae. El texto humano previo a la avalancha de contenido automático se ha convertido en el material escaso.
Y en internet ya no queda. Cualquier corpus grande extraído de la web después de 2022 lleva dentro una proporción desconocida de texto generado. El papel impreso, en cambio, trae la fecha estampada en la página de créditos. Es la única garantía barata que existe.
De ahí el criterio de compra: tirada corta, título raro, anterior a 2022. Cuanto menos circulado esté el libro, menos probable es que su contenido ya esté en el corpus de otro.
El precedente legal que abrió la puerta
Los papeles judiciales de 2025 destaparon que Anthropic había comprado y digitalizado millones de libros en un programa interno, escaneándolos y destruyendo los ejemplares en el proceso. El fallo fue que comprar el libro y digitalizarlo para entrenar entra dentro del uso legítimo. Lo que costó 1.500 millones fue la parte de libros pirateados.
Ese fallo dejó un camino marcado: comprar papel es legal, descargarlo no. Y explica que los laboratorios prefieran pagar por ejemplares físicos, escanearlos y quedarse el texto, en vez de arriesgarse otra vez con archivos de origen dudoso.
La mayor base de datos de libros del mundo retiró hace poco una página que ofrecía "libros impresos para las necesidades de tu dataset de LLM", diciendo que cambiaba de dirección. Nadie quiere aparecer en la foto.
Conviene marcar el límite de lo que se sabe: 404 Media documenta las compras masivas y el papel de ISBNdb, pero no está confirmado qué parte de los compradores actuales son laboratorios de IA y qué parte son intermediarios revendiendo.
Por qué importa
El texto humano fechado antes de 2022 acaba de tener precio de mercado. Eso no aplica solo a las editoriales.
Si tu empresa guarda diez años de informes internos, transcripciones de llamadas de venta, manuales de producto o documentación escrita por personas, tienes un activo que hasta ahora contabas como coste de almacenamiento. No para venderlo mañana, sino porque es exactamente el material con el que se afina un modelo propio que suene a tu casa y sepa de tu negocio.
La consecuencia práctica es más aburrida y más urgente: antes de firmar el próximo contrato con un proveedor de IA, mira qué dice la letra pequeña sobre lo que puede hacer con los documentos que le subes. El dato humano se ha vuelto escaso, y lo escaso se pelea en las cláusulas.
Relacionado


