El País Argentina

Amazon escanea libros raros para entrenar IA

Amazon escanea libros raros para entrenar IA
Imagen: xataka.com. Uso informativo; los derechos pertenecen a su titular.

El descubrimiento del AirTag en un envío de libros

Un periodista de investigación utilizó un AirTag de Apple para rastrear el destino de un envío de libros antiguos y raros, revelando que Amazon escanea libros para alimentar sus sistemas de inteligencia artificial. El experimento comenzó cuando múltiples libreros observaron un patrón inusual: recibían pedidos masivos de volúmenes inconexos sin sensibilidad al precio. Este comportamiento anómalo sugería que alguien diferente a los lectores tradicionales estaba comprando inventario de forma sistemática.

En julio, tras recibir una orden de aproximadamente mil libros a través del marketplace Biblio, un vendedor de ejemplares raros aceptó la propuesta de 404 Media: colocar un rastreador Apple dentro de un volumen. Lo que sucedió después mostró una ruta compleja que atravesaba Estados Unidos, desde California hasta Las Vegas, donde la pista se detenía en una instalación específica de Amazon.

Seguimiento de la ruta del cargamento

El trayecto del AirTag documentó un periplo de miles de kilómetros. El cargamento partió desde un aeropuerto californiano y reaparición en Milwaukee, Wisconsin, donde pasó por un almacén de Trifinity, una empresa logística asociada. Durante dos semanas permaneció en esta ubicación cercana a Kenosha antes de desplazarse hacia el oeste por carreteras estadounidenses.

Los investigadores localizaron el envío cerca de Colorado Springs, posteriormente en una estación de descanso para camioneros en Grand Junction, y finalmente en Las Vegas. El destino final resultó ser LAS8, una instalación de Amazon donde Amazon escanea libros y realiza operaciones de digitalización. Este almacén alberga una división interna denominada VGT3, identificada por su emblema particular: un tiranosaurio sujetando un libro abierto.

Operación VGT3: Digitalización destructiva

Según testimonios de empleados recopilados por la publicación investigadora, la operación VGT3 ejecuta un proceso específico con cada volumen que llega. Los trabajadores reciben los ejemplares, registran sus códigos ISBN y códigos de barras, y preparan los libros para la digitalización. El procedimiento implica remover o cortar la encuadernación para acelerar el escaneo de páginas.

El resultado es descarnado: el contenido queda digitalizado como archivo, mientras que el ejemplar físico se destruye irreversiblemente. Este método destructivo permite procesar volúmenes con rapidez, aunque implica la pérdida definitiva del objeto original. Los libros raros, algunos con tiradas limitadas o escritos en idiomas poco extendidos, terminan convertidos únicamente en archivos de datos.

Amazon entrena IA con libros comprados legalmente

Cuando 404 Media contactó a Amazon para obtener declaraciones sobre esta operación, la compañía confirmó que adquiere libros mediante canales comerciales convencionales para mejorar productos y servicios. Sin embargo, Amazon no especificó qué modelos de inteligencia artificial reciben estos textos procesados. La empresa desarrolla sistemas propios como la familia Nova, pero no declaró que estos volúmenes específicos alimenten dichos modelos.

El interés de Amazon en este material resulta comprensible al analizar su contenido. Muchos volúmenes contienen texto humano original no disponible fácilmente en internet. Si fueron publicados antes de la expansión de la IA generativa, sus contenidos preceden a la proliferación actual de datos sintéticos de baja calidad, lo que los convierte en fuentes de entrenamiento particularmente valiosas.

Precedentes legales: el caso Anthropic

Esta estrategia de Amazon escanea libros de forma similar a operaciones previas documentadas en el sector. Anthropic ejecutó el Proyecto Panamá, en el cual la empresa compró millones de libros impresos y los convirtió mediante un proceso destructivo idéntico al de Amazon: retiraban la encuadernación, cortaban páginas, escaneaban contenidos y descartaban los volúmenes originales.

Un juez consideró que la conversión uno a uno de ejemplares impresos legítimamente adquiridos a copias digitales constituía "fair use" o uso justo bajo la ley de derechos de autor estadounidense. Sin embargo, la misma corte no llegó a conclusiones similares respecto a millones de libros descargados de bibliotecas digitales sin autorización y conservados en repositorios centrales de Anthropic, indicando que el origen legal del material resulta determinante.

Valor intelectual versus valor como dato

El rastreo del AirTag subraya una paradoja fundamental. Los volúmenes en este envío eran raros por razones variadas: existían pocas copias disponibles, tuvieron tiradas reducidas originalmente, estaban escritos en idiomas minoritarios, o poseían valor histórico, intelectual o sentimental más allá del económico. Para libreros especializados, estos textos representaban patrimonio cultural y conocimiento irremplazable.

No obstante, en operaciones como la descubierta, lo determinante no radica en estas cualidades intrínsecas. Lo crucial es el contenido textual que contienen. Lo que inicialmente pareció una oportunidad comercial positiva para vendedores revela una realidad distinta: Amazon escanea libros raros extrayendo su valor como datos puros. Los textos se transforman en tokens de entrenamiento, desligados de su contexto original, formato físico y significado cultural para alimentar algoritmos de aprendizaje automático.

Implicaciones para el futuro del contenido

Este descubrimiento plantea preguntas significativas sobre cómo las compañías tecnológicas adquieren material de entrenamiento para sistemas de IA. Aunque Amazon operó dentro de marcos legales al comprar libros comercialmente, la práctica revela una asimetría: lectores, autores y editoriales desconocen que sus volúmenes terminarán destruidos en centros de digitalización corporativos.

La estrategia de Amazon escanea libros con eficiencia operativa pero sin transparencia hacia productores de contenido. A medida que la demanda de datos de entrenamiento para IA continúa aumentando, este modelo probablemente se expandirá, potencialmente consumiendo volúmenes crecientes de obras publicadas e históricas para alimentar sistemas cada vez más sofisticados de inteligencia artificial.

También en Tecnología

Criptomonedas

XRP $0.9912 ▼ 1.15%
Cardano (ADA) $0.1719 ▼ 2.73%
Dogecoin (DOGE) $0.0698 ▼ 0.65%
Bitcoin (BTC) $64,062 ▲ 1.08%

Divisas

EUR/USD1.1593
USD/JPY159.2300