La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Les textes antérieurs à 2022 sont présentés comme prisés pour l’entraînement des modèles, alors que l’usage de contenus générés par IA est associé à un risque d’« effondrement du modèle ». Dans ce contexte, Amazon est accusé d’acheter des livres rares, d’en couper les dos et de les numériser pour l’IA. Un ouvrage muni d’un traceur a été acheminé vers un site Amazon à Las Vegas, identifié comme VGT3. L’entreprise affirme acheter des livres par des canaux commerciaux pour améliorer des produits et services utilisés par les clients.
Les écrits d’avant 2022 restent prisés pour l’entraînement
Les textes publiés avant 2022 sont considérés comme particulièrement précieux pour l’entraînement des modèles de langage, car ils ne peuvent pas avoir été rédigés par une intelligence artificielle. L’entraînement sur des écrits générés par IA comporte un risque d’« effondrement du modèle », c’est-à-dire une dégradation de la qualité des sorties après ingestion de trop de contenus artificiels. Les livres rares, notamment ceux qui ne sont plus édités ou impossibles à trouver en ligne, constituent ainsi une nouvelle source de données recherchée.
Un livre piégé conduit à l’établissement Amazon VGT3
Un dispositif de suivi placé dans un livre rare a permis de retracer son parcours jusqu’à un établissement d’Amazon à Las Vegas, appelé VGT3. Ce lieu se distingue par un logo où figure un dinosaure avec un livre dans les mains. D’après 404 Media, Amazon acquiert un grand nombre d’ouvrages rares, retire leur reliure puis les scanne afin d’alimenter l’entraînement de ses modèles d’IA.
Amazon assure acheter via des canaux commerciaux
Amazon affirme acheter des livres par des canaux commerciaux pour améliorer les produits et services utilisés par ses clients. Les entreprises qui développent des modèles de langage ont besoin de quantités énormes de textes, et ces modèles auraient déjà absorbé tout ce qui était disponible sur Internet.






