cyberivy
OpenAIUniversity of OxfordBodleian LibraryAI Training DataLibrariesNextGenAIAI Transparency

Oxford ließ OpenAI mit Bodleian-Texten Modelle trainieren

26. September 2026

Ein Smartphone zeigt das OpenAI-Logo vor einer von DALL-E erzeugten Landschaft mit Bäumen und Wasser.

Interne Unterlagen zeigen: Digitalisierte Texte der Bodleian Library flossen in OpenAIs Trainingsbestand. Öffentlich war zunächst vor allem von Digitalisierung und Forschung die Rede.

Worum es geht

Die University of Oxford hat historische Texte aus ihrer Bodleian Library nicht nur mit Technik von OpenAI digitalisiert. Nach internen Universitätsunterlagen, die der Guardian per Informationsfreiheitsanfrage erhielt, wurde das Material auch genutzt, um den Trainingsbestand von OpenAI zu befüllen. Die Zeitung veröffentlichte ihre Recherche am 26. September 2026.

Als OpenAI und Oxford ihre Zusammenarbeit im März 2025 im Rahmen des Konsortiums NextGenAI ankündigten, stand ein anderes Bild im Vordergrund: seltene Texte sollten transkribiert und für Forschende durchsuchbar werden. Dass die Digitalisate zugleich Trainingsdaten liefern, war in der öffentlichen Darstellung weit weniger deutlich. Genau diese Lücke zwischen Digitalisierung und Modelltraining macht die Meldung relevant.

Was die Zusammenarbeit tatsächlich macht

OpenAI stellte Technik zur Verfügung, um gemeinfreie historische Bestände zu scannen und zu transkribieren. Laut Guardian waren bis Juni 2025 bereits 125.000 Bilder historischer Dissertationen weitergegeben worden. Hinzu kamen unter anderem 10.000 sogenannte Broadside Ballads aus dem 16. Jahrhundert. Interne Protokolle beschreiben, dass die digitalisierten Inhalte den OpenAI-Trainingsbestand ergänzen.

Oxford erklärt, das Material sei gemessen am Gesamtbestand von rund 23 Millionen Objekten überschaubar, nicht exklusiv und nicht urheberrechtlich geschützt. Die Bodleian Library behalte die Rechte an den Scans und wolle sie ebenfalls offen veröffentlichen. OpenAI argumentiert, historische Quellen könnten dafür sorgen, dass heutige Modelle unterschiedliche Kulturen, Zeiten und Perspektiven besser abbilden.

Warum das wichtig ist

Hochwertige, von Menschen kuratierte Texte werden für Modellanbieter wertvoller, weil das offene Web zunehmend auch maschinell erzeugte Inhalte enthält. Bibliotheken besitzen dagegen geprüfte Bestände, Metadaten und seltene Werke, die online bislang fehlen. Der Fall zeigt, wie sich die Rolle öffentlicher Wissensinstitutionen verändert: Aus einem Digitalisierungsprojekt kann zugleich ein Rohstofflieferant für ein kommerzielles Modell werden.

Für Studierende, Forschende und die Öffentlichkeit geht es deshalb nicht nur um Urheberrecht. Entscheidend sind Transparenz, Mitbestimmung, Zugangsrechte und die Frage, wer aus öffentlich oder gemeinnützig verwahrtem Wissen wirtschaftlichen Nutzen zieht. Interne Oxford-Protokolle hielten laut Guardian außerdem Sorgen über Reputationsrisiken und den Energieverbrauch fest. Eine offene Debatte darüber war beim Start der Kooperation kaum sichtbar.

Bibliotheken müssen bei solchen Verträgen künftig genauer erklären, welche Dateien ein Partner erhält, zu welchem Zweck er sie verarbeitet und ob spätere Modellversionen ebenfalls davon profitieren dürfen. Ebenso wichtig ist ein überprüfbarer Zeitplan für den freien Zugang, damit die Öffentlichkeit nicht nur das Ausgangsmaterial liefert, sondern auch einen greifbaren Nutzen erhält.

Einfach erklärt

Man kann sich die Bibliothek wie eine öffentliche Küche mit einem seltenen Rezeptarchiv vorstellen. Ein Unternehmen hilft, die handschriftlichen Rezepte zu fotografieren und durchsuchbar zu machen. Wenn es die Fotos gleichzeitig nutzt, um seinen eigenen Kochautomaten zu trainieren, ist das nicht automatisch falsch. Aber die Gäste der Küche sollten vorher klar erfahren, dass aus dem Digitalisierungsprojekt auch Trainingsmaterial entsteht.

Praktisches Beispiel

Angenommen, eine Bibliothek lässt 125.000 Seiten aus alten Dissertationen scannen. Forschende erhalten dadurch eine Volltextsuche und können Namen oder Begriffe in Minuten statt in Wochen finden. Derselbe Textbestand wird zusätzlich in das Training eines Sprachmodells aufgenommen. Das Modell kann historische Schreibweisen danach womöglich besser verarbeiten, doch Außenstehende können nicht prüfen, welchen Anteil genau diese 125.000 Seiten an seinem Verhalten haben oder ob einzelne Fehler aus den Scans weitergetragen werden.

Einordnung und Grenzen

  • Die Guardian-Recherche belegt die Verwendung für den Trainingsbestand, aber nicht, welchen messbaren Einfluss die Bodleian-Texte auf ein bestimmtes OpenAI-Modell haben.
  • Oxford zufolge geht es ausschließlich um gemeinfreie Werke und eine nicht exklusive Nutzung. Der Fall ist daher nicht mit dem unerlaubten Training auf geschützten Büchern gleichzusetzen.
  • Interne Sitzungsprotokolle zeigen Bedenken innerhalb der Universität, bilden aber nicht zwangsläufig die Position aller Beschäftigten, Studierenden oder Bibliotheksnutzer ab.

Offen bleibt zudem, wie detailliert Oxford künftig Datensätze, Auswahlkriterien, Scanfehler und konkrete Modellverwendungen dokumentiert. Ohne solche Angaben lässt sich der wissenschaftliche und gesellschaftliche Nutzen nur begrenzt gegen die Risiken abwägen.

SEO- und GEO-Schlüsselbegriffe

University of Oxford, Bodleian Library, OpenAI, Trainingsdaten, NextGenAI, historische Texte, Bibliotheksdigitalisierung, gemeinfreie Werke, KI-Transparenz, akademische Daten

💡 Im Klartext

Oxford ließ historische, gemeinfreie Bibliothekstexte digitalisieren und stellte die Ergebnisse OpenAI auch für das Modelltraining bereit. Die Texte sollen öffentlich zugänglich werden, doch der Trainingszweck war in der ursprünglichen Ankündigung wenig sichtbar.

Wichtigste Erkenntnisse

  • →Digitalisierte Bodleian-Texte wurden laut internen Unterlagen Teil von OpenAIs Trainingsbestand.
  • →Bis Juni 2025 waren unter anderem 125.000 Bilder historischer Dissertationen weitergegeben worden.
  • →Oxford betont, dass die Werke gemeinfrei, die Nutzung nicht exklusiv und die Sammlung im Verhältnis zum Gesamtbestand klein sei.
  • →Die Bibliothek behält die Rechte an den Scans und will die Digitalisate ebenfalls offen veröffentlichen.
  • →Unklar bleibt, welchen Einfluss das Material auf einzelne Modelle hat.

Häufige Fragen

Welche Texte wurden an OpenAI gegeben?

Genannt werden historische Dissertationen, Broadside Ballads aus dem 16. Jahrhundert und weitere gemeinfreie Bestände. Die vollständige Auswahl ist öffentlich nicht detailliert dokumentiert.

Sind die Werke urheberrechtlich geschützt?

Oxford erklärt, dass nur gemeinfreie Inhalte betroffen seien. Die Bodleian Library behalte außerdem die Rechte an den erzeugten Scans.

Werden die Digitalisate öffentlich zugänglich?

Nach Angaben der Universität sollen die Materialien in den kommenden Monaten offen veröffentlicht werden.

Ist bekannt, welches Modell damit trainiert wurde?

Nein. Die Unterlagen sprechen vom OpenAI-Trainingsbestand, nennen aber kein konkretes Modell und keinen messbaren Effekt.

Quellen & Kontext