Ce qu'il faut retenir.
- Le 21 juillet 2026, 404 Media révèle qu'ISBNdb, qui se présente comme éditeur de « la plus grande base de données de livres au monde », propose aux entreprises d'IA un service d'acquisition de livres imprimés en volume, garantis sans contenu généré par IA.
- ISBNdb argumente que les livres offrent un savoir « curé, évalué par des pairs, spécialisé » et structuré d'une façon qu'aucun crawl du web ne peut reproduire, contrairement aux contenus web de plus en plus pollués par le slop généré par IA.
- La société indique elle-même à ses clients que « le problème d'image est réel », signe que la provenance des données d'entraînement est devenue un enjeu de réputation autant que technique pour les géants de l'IA.
Résumé généré par IA
Le 21 juillet 2026, le média américain 404 Media révèle un symptôme révélateur de l'état du marché de la donnée pour l'intelligence artificielle. ISBNdb, société qui se présente comme éditrice de « la plus grande base de données de livres au monde », propose désormais aux entreprises d'IA un service d'acquisition de livres imprimés en volume. L'argument de vente ne tourne pas autour du prix ni du volume, mais d'une chose plus rare : la garantie que ce contenu n'a jamais été touché par une IA générative.
Sur son site, ISBNdb ne cache pas son positionnement. « Les meilleures données d'entraînement pour l'IA sont posées sur une étagère », affirme la société à ses clients. Et de préciser : « Les livres représentent un savoir humain organisé, évalué par des pairs, spécialisé, structuré d'une façon qu'aucun crawl du web ne peut reproduire. Dense, édité, digne de confiance. »
Le problème est le suivant : les entreprises d'IA elles-mêmes ont contribué à polluer la ressource qu'elles utilisaient jusqu'ici sans compter, le web ouvert.
Le « slop », en deux mots pour ceux qui découvrent
Le terme AI slop désigne le contenu de masse produit par des IA génératives (textes, images, vidéos) publié en ligne depuis l'explosion de ces outils, souvent de faible qualité et généré pour capter du trafic ou de l'engagement plutôt que pour informer. Ce contenu s'est mélangé aux pages que les IA scrapent pour construire leurs futurs corpus d'entraînement. Un modèle entraîné en partie sur les productions d'un autre modèle risque de dégrader progressivement la qualité de ses propres sorties, un phénomène que les chercheurs en apprentissage automatique appellent le model collapse. Le web, source quasi illimitée et gratuite jusqu'ici, devient donc une ressource de plus en plus incertaine à mesure que la part de contenu généré par IA y augmente.
Pourquoi les livres redeviennent un actif stratégique
Un livre imprimé publié avant l'explosion de l'IA générative offre une garantie que le texte scrapé sur une page web récente ne peut plus offrir : il a été écrit par un humain, revu par un éditeur, et sa date de publication atteste qu'il ne peut pas contenir de slop. C'est exactement l'argument qu'ISBNdb vend à ses clients.
Il y a un second volet, moins technique et plus révélateur. Selon 404 Media, ISBNdb dit directement à ses clients que « le problème d'image est réel ». Autrement dit, au-delà de la qualité technique du corpus, les entreprises d'IA ont désormais un problème de réputation à gérer : s'entraîner sur du contenu généré par IA, ou sur du contenu scrapé dans des conditions juridiquement contestées, expose à la critique publique autant qu'au risque de dégradation du modèle. Un livre acheté légalement et physiquement identifiable coche les deux cases à la fois.
Qui est concerné : pas seulement les géants
Cette tendance ne se limite pas aux grands laboratoires qui entraînent des modèles fondation depuis zéro. Elle concerne directement toute équipe qui fine-tune un modèle ouvert ou construit un système de RAG (retrieval-augmented generation) pour un usage métier. Le principe reste identique à toutes les échelles : la qualité et la provenance du corpus comptent davantage que son volume. Une PME française qui alimente son assistant IA interne en scrapant le web sans filtre prend le même risque, à sa mesure, que les géants qu'elle observe de loin.
Comment s'en prémunir concrètement
Trois réflexes simples permettent de limiter l'exposition au problème, quelle que soit la taille du projet.
- Auditer la provenance des données avant de les indexer. Une page web sans date, sans auteur identifiable ou publiée après 2023 sur un sujet générique mérite une vérification avant d'entrer dans un corpus d'entraînement ou de RAG.
- Prioriser les sources internes propriétaires. Documentation technique, contrats, comptes-rendus, référentiels métier rédigés par des humains dans l'entreprise constituent un corpus par nature protégé du slop, et souvent sous-exploité.
- Se méfier du contenu web récent et générique pour tout ce qui touche à un système de recherche documentaire. Les documents officiels, normes, PDF édités et publications vérifiées restent des sources plus fiables qu'une page web indexée au hasard.
Notre lecture chez CZSyn
Nous accompagnons des PME françaises sur des projets de RAG et de fine-tuning, et nous observons le même symptôme à une échelle différente. Le web n'est plus une source neutre par défaut, il faut désormais la traiter comme n'importe quelle source externe : avec une vérification de provenance.
Acheter des stocks de livres anciens est un pansement, pas une solution durable. Le nombre d'ouvrages publiés avant l'explosion de l'IA générative est fini, ce marché de la donnée garantie propre va donc lui aussi se raréfier avec le temps. La vraie leçon à en tirer pour une entreprise française n'est pas d'aller acheter des livres, mais de regarder ce qu'elle possède déjà. Une documentation technique bien tenue, des archives éditoriales, des comptes-rendus structurés depuis des années constituent un actif de données propres qui ne demande qu'à être correctement indexé plutôt que dilué dans un scraping massif et incontrôlé.
Vos données sont-elles vraiment exploitables par l'IA ?
CZSyn audite la qualité et la provenance de vos données avant tout projet de RAG ou de fine-tuning. Audit gratuit sous 24h, développement sur-mesure, accompagnement continu.
06 64 81 45 03ou programmez votre appel · devis gratuit en ligne
29 avis 5/5 · +200 projets livrés · réponse express
Sources primaires
- 404 Media, Emanuel Maiberg, « AI Companies Are Buying Tons of Old Books Because They're Free of AI Slop », 21 juillet 2026.
- ISBNdb, isbndb.com, site officiel de la société citée par 404 Media.
