Die urheberrechtliche rote Linie für KI-Trainingsdaten wird enger gezogen. Am 21. September 2026 veröffentlichte die amerikanische Authors Guild interne Dokumente, die im jüngsten Schriftsatz der Kläger im Verfahren Alter v. OpenAI and Microsoft zitiert werden: Führungskräfte von OpenAI und Microsoft wussten bereits vor Jahren, dass das Training von Modellen mit Büchern der Raubkopien-Website LibGen rechtlich riskant war – sie taten es trotzdem und versuchten im Sommer 2022, die Spuren zu beseitigen.
Die Sammelklage wird vor dem US-Bundesbezirksgericht für den südlichen Bezirk von New York verhandelt (Az. 1:23-cv-08292) und ist Teil eines Multidistrict-Verfahrens gegen beide Unternehmen. Zu den Klägern gehören die Authors Guild und mehr als ein Dutzend Autoren, darunter George R.R. Martin und John Grisham. Am 17. September 2026 reichten die Kläger einen Antrag auf teilweises summarisches Urteil (Docket 1982) sowie eine 162-seitige Tatsachendarstellung (Docket 1987) ein, die die Guild anschließend veröffentlichte.
Was geschah: vom Download raubkopierter Bücher bis zu „Project Clear"
Den im Klägerschriftsatz zitierten internen Dokumenten zufolge stellt sich die Chronologie grob wie folgt dar:
2018 lud OpenAI rund 117.500 Bücher von LibGen herunter und zog anschließend per Torrent etwa 35 TB an Daten – laut Schriftsatz entsprach das dem damaligen Gesamtbestand von LibGen von 4,6 Millionen Büchern. Im April 2019, als Sam Altman Bill Gates eine frühe Version von GPT-3 vorführte, hieß es in den Unterlagen, man habe „weitere ~11 Mrd. Wörter von Library Genesis (LibGen) hinzugefügt"; zwei Monate später investierte Microsoft eine Milliarde US-Dollar in OpenAI. Im GPT-3-Paper wurden diese Daten „Books1" und „Books2" genannt.
Entscheidender sind die Belege für das Wissen der Beteiligten. Im Mai 2020 schrieb OpenAI-Policy-Direktor Jack Clark intern, die Modelle würden „Menschen arbeitslos machen" und es werde „einen Punkt geben, an dem Künstler Bedenken äußern, und wir werden ihre Bedenken wahrscheinlich ignorieren und trotzdem veröffentlichen". Tarun Gogineni, der 2022 zu OpenAI kam, um die Schreibqualität der Modelle zu verbessern, tat die Beschwerden der Autoren, die „Datensätze seien gestohlen", als „hinnehmbare wirtschaftliche Kosten" (acceptable economic disruption) ab und phantasierte davon, GPT die letzten beiden Bände von „Das Lied von Eis und Feuer" schreiben zu lassen.
Auch Microsoft wird in die Wissensvorwürfe einbezogen: Dem Schriftsatz zufolge legten Altman und Dario Amodei – damals Forschungsdirektor bei OpenAI – die LibGen-Nutzung bereits bei der Demo im April 2019 gegenüber Gates und anderen offen. Amodei bezeichnete LibGen damals als „als Trainingsdatensatz etwas zwielichtig" (a bit sketchier); Forscher Sam McCandlish sorgte sich um die „Optik" – dass „‚OpenAI nutzt urheberrechtlich geschützte Daten von einer zwielichtigen russischen Website' auf Hacker News auftaucht, wäre unglücklich".
Im Sommer 2022 startete OpenAI unter dem Codenamen „Project Clear" eine Löschaktion und entfernte die LibGen-Dateien. Slack-Protokolle vom 15. Juni 2022 zeigen, dass jemand fragte, was man gegen die Erwähnungen von „libgen" tun solle, die „überall in Google Docs/Slack/GitHub" zu finden seien; Forschungs-Vizepräsident Bob McGrew antwortete noch am selben Abend: „Angesichts der Aufmerksamkeit, die OpenAI derzeit erhält, ist jetzt der richtige Zeitpunkt, LibGen aus unseren Systemen und Speichern zu entfernen." Zuvor hatte Richterin Ona Wang OpenAIs Privilegienbehauptungen über diese Slack-Protokolle bereits zurückgewiesen und die Herausgabe der Chatverläufe aus den Kanälen „project-clear" und „excise-libgen" angeordnet.
Wen es trifft: KI-Entwickler zuerst, Autoren und Verlage gewinnen Hebel
Am unmittelbarsten trifft es KI-Modellentwickler und Verantwortliche für Trainingsdaten. Die bisherige Debatte über Urheberrechte an Trainingsdaten kreiste meist um die Frage, ob Fair Use das Training abdeckt; dieser Schriftsatz verlagert das Schlachtfeld auf die Frage, ob das Herunterladen und Speichern raubkopierter Bücher an sich eine Verletzung darstellt – und ob die Unternehmen wissentlich handelten. Wird das Wissen festgestellt, schrumpft der Raum für eine Fair-Use-Verteidigung drastisch. Der 9. US-Berufungsgerichtshof befasste sich in einem anderen KI-Urheberrechtsfall mit der Frage, ob KI-generierte Ausgaben Urheberrechtsinformationen entfernen; hier geht es um die Rechtmäßigkeit der Trainingsdatenquellen – ein anderes Schlachtfeld.
Autoren und Verlage stehen auf der anderen Seite. Die Authors Guild hat 18.000 Mitglieder, und zu den Klägern zählen mehrere Bestsellerautoren. Bemerkenswert: Wenige Tage vor dieser Offenlegung wurden auch im Verfahren New York Times gegen Microsoft und OpenAI ähnliche Dokumente publik, wonach das Training mit Millionen von Nachrichtenartikeln eine „existenzielle Bedrohung" für das Zeitungsgeschäft darstellt – die beiden Fronten beginnen, sich zu ergänzen.
Doch die Grenzen müssen klar gezogen werden: All das stammt aus dem Klägerschriftsatz und den darin zitierten internen Dokumenten – einseitige Behauptungen. Das Gericht hat weder über das Vorliegen einer Verletzung noch über die Anwendbarkeit von Fair Use entschieden. Der Schriftsatz beantragt ein teilweises summarisches Urteil; in den kommenden Monaten werden beide Seiten weitere Schriftsätze einreichen, eine Anhörung wird für Anfang 2027 erwartet.
Was zu tun ist: erst Datenherkunft prüfen, nicht erst Datensätze löschen
Für Teams, die Modelle trainiert haben oder trainieren, nennt der Fall vier umsetzbare Maßnahmen:
Erstens: Prüfen, ob sich unter den Trainingsdatensätzen Raubkopien-Quellen wie LibGen oder Z-Library befinden. Eine vollständige Datenherkunftsprüfung (Data Lineage Audit) durchführen und Quelle, Beschaffungsmethode und Lizenzstatus jedes Datenbestands dokumentieren.
Zweitens: Lizenzen verhandeln, wo möglich – und bald. Anthropic zahlte in einem ähnlichen Verfahren über raubkopierte Trainingsbücher (Bartz v. Anthropic) bereits 1,5 Milliarden US-Dollar Vergleich. „Erst bauen, dann lizenzieren" kann weit teurer werden als eine vorherige Lizenzierung.
Drittens: Entdeckte Raubkopien-Daten nachvollziehbar entfernen – aber „Project Clear" nicht kopieren. Wird die Löschung als Vertuschung von Beweisen gelesen, wird sie zum Beleg des Wissens. Dass die Richterin hier die Herausgabe sämtlicher einschlägiger Slack-Protokolle anordnete, geschah genau aus diesem Grund.
Viertens: interne Kommunikation im Griff behalten. Diskussionen über Datenquellen in Slack, Dokumenten und Paper-Entwürfen sind sämtlich offenzulegen. Die wirkliche Lösung ist Compliance im Vorfeld, nicht Optik-Management im Nachhinein.
Wo die Risiken liegen: drei Zahlen und ein Zeitpunkt
Die erste Zahl: 150.000 US-Dollar – die Obergrenze des gesetzlichen Schadensersatzes pro Werk bei „vorsätzlicher" (willful) Verletzung nach US-Urheberrecht. Dass der Klägerschriftsatz durchgehend auf das Wissen abstellt, dient genau dazu, diese Schadensstufe zu erreichen: 117.500 Bücher mal 150.000 Dollar ergeben eine astronomische Summe.
Die zweite Zahl: 1,5 Milliarden US-Dollar – der Anthropic-Vergleich. In einem Parallelverfahren hat ein Bundesrichter bereits festgestellt: Das illegale Herunterladen raubkopierter Bücher ist eine eigenständige Verletzung, auch wenn das Unternehmen später legale Exemplare kaufte. Folgt dieser Fall derselben Logik, wird OpenAIs Fair-Use-Verteidigung deutlich schwerer.
Das dritte Risiko ist der Zeitpunkt: Die Anhörung wird für Anfang 2027 erwartet, in den kommenden Monaten reichen beide Seiten weitere Schriftsätze ein. Für Unternehmen, die Modelle fremder Anbieter per API nutzen, ist das Risiko indirekt, aber real – wird die Rechtmäßigkeit der Trainingsdaten verneint, kann sich der Compliance-Mangel des Lieferanten entlang der Lieferkette fortpflanzen.
Ein letzter Hinweis zum Anwendungsbereich: Dieser Rechtsstreit wird nach US-Urheberrecht geführt, und LibGen steht seit 2017 auf der „Notorious Markets"-Liste des US-Handelsbeauftragten. Die Regeln für Trainingsdaten unterscheiden sich von Rechtsordnung zu Rechtsordnung – der Kurs eines US-Gerichts lässt sich nicht eins zu eins auf das weltweite Geschäft übertragen.
Für KI-Unternehmen hebt dieser Fall die Trainingsdaten-Compliance von der Stufe „Rat der Rechtsabteilung" auf die Stufe „Beweismittelrisiko": Woher die Daten kamen, wer es wusste und wann – all das kann zum Beweisstück werden.