ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Conformité de l’IA
La ligne rouge du droit d'auteur sur les données d'entraînement de l'IA se resserre : OpenAI aurait su que l'entraînement sur des livres piratés était illégal

La ligne rouge du droit d'auteur sur les données d'entraînement de l'IA se resserre : OpenAI aurait su que l'entraînement sur des livres piratés était illégal

Conformité de l’IA • Admin • • 2 vues

La ligne rouge du droit d'auteur sur les données d'entraînement de l'IA est en train de se resserrer. Le 21 septembre 2026, l'Authors Guild américaine a rendu publics des documents internes cités dans le dernier mémoire des plaignants dans l'affaire Alter v. OpenAI and Microsoft : les dirigeants d'OpenAI et de Microsoft savaient depuis des années que l'entraînement de modèles sur les livres du site pirate LibGen présentait un risque juridique — ils l'ont fait quand même, puis ont tenté d'effacer les traces à l'été 2022.

Cette action collective est jugée devant le tribunal fédéral du district sud de New York (n° 1:23-cv-08292), dans le cadre d'une procédure multidistrict visant les deux entreprises. Les plaignants comprennent l'Authors Guild et plus d'une douzaine d'auteurs, dont George R.R. Martin et John Grisham. Le 17 septembre 2026, les plaignants ont déposé une requête en jugement sommaire partiel (Docket 1982) accompagnée d'un exposé des faits de 162 pages (Docket 1987), que la Guild a ensuite rendus publics.

Ce qui s'est passé : du téléchargement de livres piratés au « Project Clear »

D'après les documents internes cités dans le mémoire des plaignants, la chronologie est à peu près la suivante :

En 2018, OpenAI a téléchargé environ 117 500 livres depuis LibGen, puis récupéré quelque 35 To de données en torrent — soit, selon le mémoire, l'intégralité du catalogue de LibGen à l'époque, 4,6 millions de livres. En avril 2019, lorsque Sam Altman a présenté une première version de GPT-3 à Bill Gates, le document indiquait que l'entreprise avait « ajouté environ 11 milliards de mots supplémentaires depuis Library Genesis (LibGen) » ; deux mois plus tard, Microsoft investissait un milliard de dollars dans OpenAI. Dans l'article sur GPT-3, ces données étaient baptisées « Books1 » et « Books2 ».

Plus décisives encore sont les preuves de la connaissance des faits. En mai 2020, le directeur des politiques d'OpenAI, Jack Clark, écrivait en interne que les modèles « allaient mettre des gens au chômage » et qu'« il viendrait un moment où des artistes exprimeraient leur inquiétude, et nous ignorerions probablement leurs préoccupations pour publier quand même ». Tarun Gogineni, arrivé chez OpenAI en 2022 pour améliorer la qualité d'écriture des modèles, a balayé les plaintes des auteurs selon lesquelles les « jeux de données étaient volés » comme une « perturbation économique acceptable » (acceptable economic disruption), imaginant même faire écrire à GPT les deux derniers tomes du Trône de fer.

Microsoft est également visée par les allégations de connaissance des faits : selon le mémoire, lors de la démonstration d'avril 2019, Altman et Dario Amodei — alors directeur de la recherche d'OpenAI — avaient révélé l'usage de LibGen à Gates et aux autres participants. Amodei qualifiait alors LibGen de « un peu douteux » (a bit sketchier) comme jeu d'entraînement ; le chercheur Sam McCandlish, lui, s'inquiétait de l'« image » — qu'« "OpenAI utilise des données sous droit d'auteur provenant d'un site russe douteux" apparaisse sur Hacker News serait fâcheux ».

À l'été 2022, OpenAI a lancé une opération de nettoyage baptisée « Project Clear » et supprimé ses fichiers LibGen. Les archives Slack du 15 juin 2022 montrent quelqu'un demandant que faire des mentions de « libgen », « présentes partout dans Google Docs/Slack/GitHub » ; le soir même, le vice-président de la recherche Bob McGrew répondait : « Vu l'attention dont OpenAI fait l'objet en ce moment, c'est le bon moment pour extirper LibGen de nos systèmes et de notre stockage. » Auparavant, la juge Ona Wang avait déjà rejeté les prétentions au secret professionnel d'OpenAI sur ces archives Slack et ordonné la remise des journaux des canaux « project-clear » et « excise-libgen ».

Qui est concerné : les développeurs d'IA en première ligne, les auteurs et éditeurs gagnent un levier

L'impact le plus direct frappe les développeurs de modèles d'IA et les responsables des données d'entraînement. Jusqu'ici, le débat sur le droit d'auteur des données d'entraînement portait surtout sur la question de savoir si le fair use couvrait l'entraînement ; ce mémoire déplace le champ de bataille vers la question de savoir si le téléchargement et le stockage de livres piratés constituent en soi une contrefaçon — et si les entreprises agissaient en connaissance de cause. Si cette connaissance est établie, l'espace d'une défense fondée sur le fair use se réduit considérablement. Dans une autre affaire de droit d'auteur liée à l'IA, la cour d'appel américaine du neuvième circuit s'est penchée sur la question de savoir si les contenus générés par l'IA supprimaient les informations sur la gestion du droit d'auteur ; ici, c'est la licéité des sources de données d'entraînement qui est en cause — un autre champ de bataille.

Les auteurs et les éditeurs sont de l'autre côté. L'Authors Guild compte 18 000 membres, et les plaignants incluent plusieurs auteurs de best-sellers. À noter : quelques jours avant cette divulgation, des documents similaires ont été rendus publics dans l'affaire New York Times contre Microsoft et OpenAI, montrant que l'entraînement sur des millions d'articles de presse faisait peser une « menace existentielle » sur la presse — les deux fronts commencent à se répondre.

Mais il faut tracer une frontière claire : tout ce qui précède provient du mémoire des plaignants et des documents internes qu'il cite — des allégations unilatérales. Le tribunal ne s'est prononcé ni sur l'existence d'une contrefaçon ni sur l'applicabilité du fair use. Le mémoire sollicite un jugement sommaire partiel ; les deux parties déposeront d'autres écritures dans les mois à venir, et une audience est attendue début 2027.

Que faire : auditer la traçabilité des données d'abord, pas effacer les traces d'abord

Pour les équipes qui ont entraîné ou entraînent des modèles, cette affaire suggère quatre actions concrètes :

Premièrement, vérifier si les jeux de données d'entraînement contiennent des sources piratées comme LibGen ou Z-Library. Mener un audit complet de la traçabilité des données, en documentant pour chaque lot la source, le mode d'acquisition et le statut de licence.

Deuxièmement, négocier des licences là où c'est possible — et vite. Anthropic a déjà payé 1,5 milliard de dollars pour transiger dans une affaire similaire de livres piratés utilisés pour l'entraînement (Bartz v. Anthropic) : la stratégie du « construire d'abord, licencier ensuite » peut coûter bien plus cher qu'une licence préalable.

Troisièmement, supprimer les données piratées découvertes en laissant une trace — mais sans copier le « Project Clear ». Si la suppression est interprétée comme une dissimulation de preuves, elle devient au contraire une preuve de la connaissance des faits. C'est précisément pour cette raison que la juge a ordonné ici la remise de l'intégralité des archives Slack concernées.

Quatrièmement, surveiller les communications internes. Les discussions sur les sources de données dans Slack, les documents et les brouillons d'articles sont toutes communicables en justice. La vraie solution, c'est la conformité en amont, pas la gestion de l'image en aval.

Où sont les risques : trois chiffres et une date

Premier chiffre : 150 000 dollars — le plafond des dommages-intérêts légaux par œuvre en cas de contrefaçon « délibérée » (willful infringement) selon le droit d'auteur américain. Si le mémoire des plaignants est tout entier construit autour de la connaissance des faits, c'est précisément pour atteindre ce palier : 117 500 livres multipliés par 150 000 dollars, un chiffre astronomique.

Deuxième chiffre : 1,5 milliard de dollars — la transaction Anthropic. Dans une affaire parallèle, un juge fédéral a déjà établi que le téléchargement illégal de livres piratés constituait une contrefaçon autonome, même si l'entreprise avait ensuite acheté des exemplaires légitimes. Si cette logique s'étend à la présente affaire, la défense d'OpenAI fondée sur le fair use deviendra bien plus difficile à tenir.

Troisième risque, le calendrier : l'audience est attendue début 2027, et les deux parties déposeront d'autres écritures dans les mois à venir. Pour les entreprises qui utilisent des API de modèles tiers, le risque est indirect mais réel — si les données d'entraînement sont jugées illicites, le défaut de conformité du fournisseur peut se propager le long de la chaîne d'approvisionnement.

Dernière précision sur le champ d'application : ce litige se joue sous l'empire du droit d'auteur américain, et LibGen figure depuis 2017 sur la liste des « marchés notoires » du représentant américain au commerce. Les règles relatives aux données d'entraînement varient selon les juridictions — on ne saurait transposer telle quelle la trajectoire d'un tribunal américain aux opérations mondiales.

Pour les entreprises d'IA, cette affaire fait passer la conformité des données d'entraînement du stade du « conseil juridique » à celui du risque « pièce à conviction » : d'où viennent les données, qui le savait, et quand — tout cela peut devenir une pièce à conviction au tribunal.

Outils Recommandés

Plus