Kommentar von Dr. Susanne Grimm, Rödl KI-Training zwischen Recht und Datenmarkt

Von Dr. Susanne Grimm 7 min Lesedauer

Anbieter zum Thema

Der Wettlauf um die leistungsfähigste Künstliche Intelligenz (KI) ist längst auch ein Wettlauf um die Nutzung urheberrechtlich geschützter Werke. Leistungsfähige generative KI-Systeme benötigen große Mengen an Trainingsdaten, die vielfach aus urheberrechtlich geschützten Werken stammen. Während KI-Unternehmen umfassende Lizenzpflichten wegen der damit verbundenen Kosten und des administrativen Aufwands scheuen, fordern Urheber und andere Rechteinhaber eine angemessene Vergütung. Im Kern geht es damit um die Vereinbarkeit technischer Innovation mit dem Schutz geistigen Eigentums.

Die Autorin: Dr. Susanne Grimm ist Fachanwältin für gewerblichen Rechtsschutz und Leiterin der nationalen und internationalen Praxisgruppe IP & Media bei Rödl(Bild:  Rödl)
Die Autorin: Dr. Susanne Grimm ist Fachanwältin für gewerblichen Rechtsschutz und Leiterin der nationalen und internationalen Praxisgruppe IP & Media bei Rödl
(Bild: Rödl)

Neue Dynamik erhielt die Debatte durch den Rechtsstreit Bartz vs. Anthropic. Der United States District Court for the Northern District of California stufte die Nutzung rechtmäßig erworbener Bücher zum Training eines KI-Modells grundsätzlich als Fair Use und damit als rechtmäßig ein, nahm Raubkopien hiervon jedoch ausdrücklich aus. „Auf dieser Grundlage schlossen die Parteien einen Vergleich über 1,5 Milliarden US-Dollar. Das zuständige Bundesbezirksgericht erteilte am 20. Juli 2026 die endgültige Genehmigung; der Vergleich ist damit nach dem derzeit bekannten Verfahrensstand wirksam. Eine höchstrichterliche Klärung der zugrunde liegenden Fair-Use-Fragen enthält der Vergleich jedoch nicht.

Worum ging es in dem Verfahren?

Ausgangspunkt des Verfahrens war die Nutzung urheberrechtlich geschützter Bücher durch Anthropic, das Unternehmen hinter der generativen KI Claude. Mehrere Autoren warfen Anthropic vor, ihre Werke ohne Zustimmung zum Training von Large Language Models (LLMs) verwendet zu haben.

Die Werke wurden für das Training vervielfältigt und digital verarbeitet, damit das LLM daraus statistische Zusammenhänge für die Generierung neuer Texte erlernen konnte. Anthropic baute hierfür eine umfangreiche digitale Zentralbibliothek auf, deren Bücher aus unterschiedlichen Quellen stammten.

Neben rechtmäßig erworbenen physischen Büchern, die digitalisiert wurden, griff Anthropic auf Online-Bibliotheken zurück, die Raubkopien enthielten. Nach den Feststellungen des Gerichts betraf dies mehr als sieben Millionen rechtswidrig beschaffte Bücher.

Vervielfältigungen der Trainingsdaten als Fair Use?

Das Gericht differenzierte für seine Beurteilung zwischen den verschiedenen Nutzungshandlungen. Die Digitalisierung rechtmäßig erworbener Bücher und ihre anschließende Vervielfältigung zum Training der LLMs wurden als „Fair Use“ eingeordnet. Anders bewertete das Gericht dagegen das Herunterladen und dauerhafte Speichern der Raubkopien in der Zentralbibliothek.

Fair Use

Nach US-amerikanischem Recht bestimmt sich die Zulässigkeit der Nutzung urheberrechtlich geschützter Werke ohne Zustimmung der Rechteinhaber nach der sogenannten Fair-Use-Doktrin des § 107 Copyright Act. Maßgeblich ist danach eine Gesamtbetrachtung von vier Faktoren: (1) dem Zweck und Charakter der Nutzung, (2) der Art des geschützten Werkes, (3) dem Umfang der übernommenen Teile im Verhältnis zum Gesamtwerk und (4) der Auswirkung der Nutzung auf den tatsächlichen oder potenziellen Markt des geschützten Werkes.

Begründung des Gerichts

Im Verfahren gegen Anthropic standen insbesondere der erste und vierte Fair-Use-Faktor im Mittelpunkt. Nach Auffassung des Gerichts war die Vervielfältigung der Werke zum Training des LLM besonders transformativ. Die Bücher wurden nicht lediglich erneut zugänglich gemacht, sondern analysiert, um statistische Sprachzusammenhänge zu erfassen und daraus ein Modell zur Erzeugung neuer Texte zu entwickeln.

Das Gericht verglich das Training mit menschlichem Lernen. Autoren können grundsätzlich nicht verhindern, dass andere ihre Werke lesen, daraus lernen und sich von ihrem Stil inspirieren lassen. Der Vergleich ist allerdings nur eingeschränkt tragfähig: KI-Anbieter fertigen digitale Kopien an, speichern sie technisch und verarbeiten sie in einem kommerziellen Modell.

Besondere Bedeutung hatte zudem der vierte Fair-Use-Faktor, also die Auswirkung der Nutzung auf die relevanten Märkte. Das Gericht unterschied dabei zwischen dem Markt für einzelne Werkexemplare, dem allgemeinen Markt für literarische Werke und einem möglichen Lizenzmarkt für das Training von LLMs.

Jetzt Newsletter abonnieren

Täglich die wichtigsten Infos zu Big Data, Analytics & AI

Mit Klick auf „Newsletter abonnieren“ erkläre ich mich mit der Verarbeitung und Nutzung meiner Daten gemäß Einwilligungserklärung (bitte aufklappen für Details) einverstanden und akzeptiere die Nutzungsbedingungen. Weitere Informationen finde ich in unserer Datenschutzerklärung. Die Einwilligungserklärung bezieht sich u. a. auf die Zusendung von redaktionellen Newslettern per E-Mail und auf den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern (z. B. LinkedIn, Google, Meta).

Aufklappen für Details zu Ihrer Einwilligung

Hinsichtlich der Raubkopien bejahte das Gericht eine unmittelbare Marktbeeinträchtigung, da Anthropic die Werke rechtmäßig hätte erwerben können und dies teilweise später auch tat. Eine relevante Beeinträchtigung des allgemeinen Buchmarktes lehnte das Gericht ab. Dass KI-generierte Texte künftig mit Werken menschlicher Autoren konkurrieren könnten, stelle keinen urheberrechtlich relevanten Marktschaden im Sinne des Copyright Act dar.

Besonders relevant für die Frage nach der Zukunft des Lizenzmarktes ist schließlich die Behandlung möglicher Trainingslizenzen. Das Gericht unterstellte zugunsten der Kläger, dass sich ein solcher Markt entwickeln könnte. Es sah einen möglichen Verlust von Lizenzgebühren jedoch nicht als relevanten Marktschaden im Sinne des Copyright Act an.

Wie ist die Rechtslage in Europa?

Auch das europäische und deutsche Urheberrecht erlaubt unter bestimmten Voraussetzungen die Vervielfältigung geschützter Werke für das Training generativer KI. Maßgeblich ist insbesondere die Text-and-Data-Mining-Schranke des Art. 4 DSM-Richtlinie, umgesetzt in Deutschland durch § 44b UrhG. Sie erlaubt Vervielfältigungen für die automatisierte Analyse digitaler oder digitalisierter Werke zur Informationsgewinnung. Darunter kann das Training von LLMs fallen.

Voraussetzung ist zunächst, dass die Werke rechtmäßig zugänglich sind, etwa über ein Open-Access-Angebot. Zudem können Rechteinhaber die Nutzung ihrer Werke für Text and Data Mining ausdrücklich vorbehalten. Bei online zugänglichen Werken muss der Nutzungsvorbehalt maschinenlesbar sein. In diesem Fall wäre die Vervielfältigung der Werke für das KI-Training, vorbehaltlich anderer Schranken, eine Urheberrechtsverletzung. Für eine Nutzung zum Training bedarf das KI-Unternehmen dann grundsätzlich einer entsprechenden Lizenz.

Offen und umstritten ist, wie weit die Schranke reicht, wenn geschützte Inhalte nicht nur analysiert, sondern im Modell memoriert und später werkgetreu rekonstruiert werden können. Training und Output sind aus urheberrechtlicher Sicht getrennt zu prüfen. Eine möglicherweise zulässige Trainingskopie macht eine spätere Ausgabe geschützter Inhalte nicht automatisch rechtmäßig.

Sind Urheber die Verlierer auf dem Lizenzmarkt?

Wenn das Training mit urheberrechtlich geschützten Werken unter den dargestellten Voraussetzungen auch ohne Zustimmung der Rechteinhaber zulässig ist, stellt sich die Frage, welche wirtschaftliche Bedeutung Lizenzen künftig noch haben.

Die Interessenlage ist zunächst eindeutig: Rechteinhaber möchten für die Nutzung ihrer Werke angemessen vergütet werden. Vertreter der Technologiebranche sehen umfassende Lizenzpflichten dagegen als mögliches Innovationshemmnis. Angesichts der enormen Datenmengen, die für das Training moderner Sprachmodelle benötigt werden, könnten individuelle Lizenzierungen mit erheblichen Kosten und administrativem Aufwand verbunden sein.

Der Lizenzmarkt

Tatsächlich hat sich für die Nutzung urheberrechtlich geschützter Inhalte durch KI-Unternehmen bereits ein Lizenzmarkt herausgebildet. OpenAI hat beispielsweise Partnerschaften mit Axel Springer, Le Monde und der Financial Times geschlossen. Diese ermöglichen die Nutzung hochwertiger Inhalte für die Weiterentwicklung ihrer Modelle.

Auch der 2025 veröffentlichte Pre-Publication-Bericht des U.S. Copyright Office weist auf die zunehmende Bedeutung freiwilliger Lizenzierungen hin. Danach findet eine Lizenzierung bereits in einzelnen Sektoren statt und könnte sich auch in weiteren Bereichen entwickeln. Ein flächendeckender, branchenübergreifender Markt besteht bislang jedoch nicht.

Folgen des Anthropic-Vergleichs

Vor diesem Hintergrund entfaltet der Vergleich im Verfahren Bartz vs. Anthropic eine ambivalente Signalwirkung. Einerseits bestätigt er, dass das Training mit rechtmäßig erworbenen Werken nach US-amerikanischem Recht grundsätzlich als Fair Use zulässig sein kann. Eine Lizenz ist dann nicht erforderlich, um ein zulässiges Training ohne Zustimmung der Rechtinhaber zu ermöglichen. Damit sinkt der rechtliche Anreiz, umfassende Lizenzvereinbarungen für Trainingsdaten abzuschließen. Ein allgemeiner Preis oder Branchenstandard für Trainingsdaten folgt aus der Vergleichssumme jedoch nicht.

Die Summe von 1,5 Milliarden US-Dollar ist kein Preis pro Buch, Werk oder Datensatz. Sie kann ebenso Prozessrisiken, Beweisfragen, Kosten und das Interesse an Rechtssicherheit widerspiegeln.

Andererseits beseitigt der Vergleich nicht den wirtschaftlichen Wert von Trainingsdatenlizenzen. Unternehmen können weiterhin ein Interesse an hochwertigen, nicht frei zugänglichen Datensätzen haben, deren Herkunft rechtssicher geklärt ist. Denn eine rechtswidrige Herkunft der Trainingsdaten kann erhebliche rechtliche und wirtschaftliche Risiken begründen.

Der Anthropic-Fall bedeutet deshalb nicht das Ende des gerade erst erblühenden Lizenzmarktes. Er könnte vielmehr dessen Funktion verändern. Die Lizenz wird dort weniger zur rechtlichen Voraussetzung des Trainings als vielmehr zum Instrument, mit dem KI-Unternehmen Zugang zu besonders wertvollen Daten erhalten. Ihr Mehrwert kann in geprüfter Herkunft, Qualität, Aktualität, Exklusivität und besserer Produktintegration liegen.

Folgen für den europäischen Markt

Aufgrund der unterschiedlichen rechtlichen Ausgangslage dürfte der Vergleich auf den europäischen und insbesondere den deutschen Lizenzmarkt weniger unmittelbare Signalwirkung entfalten. Auch hier ist das Training urheberrechtlich geschützter Werke ohne Zustimmung der Rechte in den Grenzen des Urheberrechtsgesetzes möglich. Anders als in den USA können Rechteinhaber die Nutzung ihrer frei zugänglichen Werke jedoch durch einen wirksamen Nutzungsvorbehalt untersagen.

Für Unternehmen bedeutet dies insbesondere: Trainingsquellen, Zugangswege, Rechteketten und Nutzungsvorbehalte sollten dokumentiert werden. Zusätzlich braucht es Sperr- und Löschprozesse sowie Kontrollen gegen memorierte und werkgetreue Ausgaben. Training, Fine-Tuning, Retrieval und Output sollten getrennt geprüft werden.

Ob diese Regelungen in der Praxis tatsächlich zu einer Ausweitung des Lizenzmarktes führen werden, bleibt offen. Entscheidend wird sein, wie wirksam Rechtevorbehalte durchgesetzt und von den KI-Unternehmen tatsächlich beachtet werden.

Fazit

Der Anthropic-Vergleich schafft keinen allgemeinen Preis für Trainingsdaten und beendet die offenen urheberrechtlichen Fragen nicht. In den USA kann das Training rechtmäßig beschaffter Werke unter Umständen Fair Use sein; in Europa kann § 44b UrhG Training ohne Zustimmung der Rechteinhaber ermöglichen, allerdings nur unter seinen Voraussetzungen und unter Beachtung wirksamer Nutzungsvorbehalte.

Der Markt wird daher voraussichtlich weniger durch einen einheitlichen Lizenzpreis als durch geprüfte Herkunft, Datenqualität, Aktualität, Exklusivität und technische Compliance geprägt. Die Lizenz entwickelt sich vom vermeintlich zwingenden „Eintrittsticket“ zu einem möglichen Wettbewerbsvorteil.

Artikelfiles und Artikellinks

(ID:50947409)