5 000 livres commandés à Galway, la crainte qu’ils soient broyés pour entraîner l’IA
À Galway, une librairie indépendante a reçu une commande en ligne portant sur 5 000 livres. L’acheteur n’a pas seulement ciblé des best-sellers : des vendeurs britanniques et européens signalent aussi des achats groupés de titres parfois très spécifiques, alimentant le soupçon d’une nouvelle course aux textes humains destinés à entraîner des modèles d’IA.
Des commandes trop importantes pour relever du hasard
L’affaire a commencé à attirer l’attention après le signalement d’une librairie indépendante de Galway, en Irlande. Une commande passée en ligne réclamait plusieurs milliers d’ouvrages, un volume inhabituel pour un commerce de proximité et difficile à justifier par une simple opération de revente.
D’autres libraires au Royaume-Uni et en Europe auraient observé des comportements similaires : commandes de lots importants, sélection de titres anciens ou spécialisés, et achats réalisés auprès de plusieurs vendeurs. Les ouvrages concernés ne semblent pas toujours correspondre aux livres les plus populaires. Cette précision alimente l’hypothèse d’une collecte structurée, destinée à constituer un corpus de textes variés plutôt qu’un stock commercial.
Le lien avec les entreprises d’IA n’est toutefois pas établi. Aucun des vendeurs cités n’a, à ce stade, identifié publiquement le donneur d’ordre final. Les commandes peuvent passer par des intermédiaires, des sociétés de sourcing ou des plateformes spécialisées, ce qui rend leur traçabilité particulièrement difficile.
Pourquoi les livres imprimés redeviennent une ressource stratégique
Les modèles de langage ont été entraînés sur d’immenses volumes de textes issus du web, de livres numérisés, d’archives et de bases de données. Mais cette ressource rencontre plusieurs limites. Le web contient une proportion croissante de textes générés par des systèmes d’IA, souvent publiés sans vérification ou produits en série pour capter du trafic.
Cette contamination progressive réduit la valeur des données en ligne. Un modèle entraîné sur des textes produits par d’autres modèles risque d’amplifier leurs erreurs, leurs formulations stéréotypées et leurs biais statistiques. Dans ce contexte, les livres publiés avant l’essor massif de l’IA générative apparaissent comme une source plus stable de langage humain édité.
Les ouvrages imprimés peuvent également offrir une diversité difficile à reproduire à partir des seules pages les plus visibles du web : fiction, essais, manuels techniques, ouvrages universitaires, littérature régionale ou titres épuisés. Leur valeur ne tient donc pas uniquement à leur contenu, mais aussi à leur relative rareté dans les bases de données accessibles en ligne.
La stratégie supposée serait simple : acheter des livres physiques, les numériser grâce à des procédés d’OCR — reconnaissance optique de caractères — puis intégrer les textes dans des jeux de données d’entraînement. Le papier deviendrait alors une étape intermédiaire avant la constitution d’un corpus numérique.
ISBNdb montre qu’un marché existe déjà
Cette hypothèse n’est pas entièrement théorique. La société ISBNdb, qui exploite une vaste base de métadonnées bibliographiques, a commercialisé un service destiné à sourcer des livres imprimés pour l’entraînement de modèles. L’offre aurait permis de rechercher entre 1 000 et 1 million de livres, selon les besoins du client.
Ce service ne prouve pas que ISBNdb soit impliquée dans les commandes observées à Galway ou chez d’autres libraires. Aucun lien direct n’a été établi entre cette offre et les achats signalés en Europe. Il montre cependant qu’une infrastructure commerciale existe pour identifier et acquérir des ouvrages à grande échelle.
La frontière entre simple fourniture de métadonnées et approvisionnement physique devient ainsi plus floue. Une entreprise qui souhaite constituer un corpus peut rechercher des ISBN, localiser les exemplaires disponibles, répartir les achats entre plusieurs vendeurs et sous-traiter la numérisation. La chaîne peut fonctionner sans que la librairie connaisse l’utilisation finale des ouvrages.
Le risque de voir les livres détruits après numérisation
La crainte la plus sensible concerne le devenir des exemplaires acquis. Une fois leur contenu numérisé, les livres physiques pourraient être revendus, stockés ou détruits. Des informations relayées par plusieurs médias évoquent même le recours à des intermédiaires susceptibles de déchiqueter les ouvrages après extraction du texte.
Cette possibilité reste à documenter et ne doit pas être présentée comme une pratique démontrée dans le cas des commandes européennes. Elle soulève néanmoins une question très concrète : pourquoi conserver des milliers d’exemplaires papier si l’objectif réel consiste uniquement à produire des fichiers numériques ?
La destruction de livres n’aurait pas seulement une dimension symbolique. Certains titres anciens, épuisés ou difficilement remplaçables pourraient disparaître du marché secondaire. Une numérisation privée ne garantit pas non plus l’accès public au contenu. Le texte peut être intégré à un modèle propriétaire, sans être consultable, vérifiable ou redistribuable.
Pour les libraires indépendants, le phénomène crée également un problème de transparence. Une commande massive représente une opportunité commerciale bienvenue, mais elle peut aussi détourner des ouvrages rares du circuit traditionnel. Les vendeurs ignorent parfois si les acheteurs cherchent à alimenter une bibliothèque, un réseau de revente ou une opération de collecte de données.
Le droit d’auteur au centre de la prochaine bataille
L’acquisition d’un livre ne donne pas automatiquement le droit d’utiliser son contenu pour entraîner un modèle commercial. La numérisation, la reproduction et l’exploitation de textes protégés peuvent relever de régimes juridiques distincts, selon les pays et la finalité déclarée.
En Europe, les exceptions liées à la fouille de textes et de données autorisent certains usages, notamment dans la recherche, mais leur application à l’entraînement de modèles commerciaux fait l’objet de débats. Les ayants droit contestent régulièrement l’utilisation de leurs œuvres sans licence explicite ni rémunération. Les entreprises d’IA, de leur côté, soutiennent que l’analyse à grande échelle de contenus légalement accessibles peut relever de l’apprentissage automatique ou du text and data mining.
Les achats physiques ne dissipent pas cette controverse. Posséder un exemplaire ne signifie pas posséder les droits de reproduction de l’œuvre ni celui de l’intégrer dans un système commercial. La question centrale reste celle de la chaîne complète : qui achète, qui numérise, qui conserve les fichiers et quel modèle est entraîné sur ces données ?
Une pénurie de textes humains derrière la course aux livres
Le signal envoyé par ces commandes est moins celui d’une simple frénésie d’achat que celui d’une tension croissante sur les données de qualité. Les modèles disposent de volumes gigantesques de textes, mais la quantité ne garantit ni l’originalité, ni la fiabilité, ni la diversité.
Si les achats de livres imprimés se multiplient, les libraires pourraient devenir des fournisseurs indirects de données pour l’industrie de l’IA, sans contrat clair avec les auteurs ou les éditeurs. Le prochain jalon sera l’identification des intermédiaires et la publication de preuves documentées reliant ces commandes à une entreprise ou à un projet de numérisation précis. À défaut, les 5 000 livres de Galway resteront un signal d’alerte : la collecte de textes humains entre désormais dans le monde physique, avec des conséquences mesurables sur les stocks, les droits et la conservation du patrimoine imprimé.