Welches Modell dürfen Sie als Teacher nutzen? Die Distillations-Klauseln im Vergleich

Souveränität & Recht

Dominik Keller

Dominik Keller

Gründer, Kontinent

Titelbild „Welches Modell darf Ihr Teacher sein?“: Verschachtelte Rahmen: EBENE 1 · MODELLANBIETER, EBENE 2 · HOSTER, EBENE 3 · LIZENZ, im Kern TEACHER.

Anthropic, OpenAI und Google untersagen es vertraglich, ihre Ausgaben zum Training konkurrierender Modelle zu verwenden, und zwar auf jedem Bezugsweg, auch über Bedrock, Azure und Vertex. Mistral ist der einzige der vier ohne ausdrückliche Klausel für Textausgaben. Bei europäischen Hostern liegt die Hürde meist woanders: in der Lizenz des Modells.

Wer ein eigenes kleines Modell trainieren will, braucht Zielantworten. Der naheliegende Weg ist, sie von einem großen Modell erzeugen oder korrigieren zu lassen. Dieses Verfahren heißt Distillation, das große Modell ist der Teacher, das kleine der Student. Technisch ist das heute Routine. Vertraglich ist es das Gegenteil.

Wir haben die Frage vor unserem eigenen Trainingsprojekt klären müssen und dafür am 7. September 2026 die Nutzungsbedingungen von vier Frontier-Anbietern, zehn europäischen Hostern und gut zwanzig offenen Modellen im Volltext gelesen. Dieser Beitrag ist das Ergebnis. Er ersetzt keine Rechtsberatung, aber er sagt Ihnen, in welchem Dokument die Klausel steht, die Sie betrifft.

Das Wichtigste in Kürze

  • Drei Verträge gelten gleichzeitig: die Bedingungen des Anbieters, die des Hosters und die Lizenz des Modells. Alle drei müssen den Fall decken. Schweigen an einer Stelle hilft nicht, wenn eine andere verbietet.

  • Der Bezugsweg ändert nichts. Anthropics Verbot steht in der Bedrock-Fassung der Commercial Terms wortgleich. Bei Azure und Vertex gelten die Bedingungen des Hyperscalers zusätzlich zu denen des Modellherstellers.

  • Die meisten EU-Hoster schweigen zur Frage. Scaleway, OVHcloud, IONOS, TensorX und Regolo enthalten kein Verbot der Output-Nutzung fürs Training. Nebius, Nebul, Infercom, Inceptron und AKI.IO verbieten konkurrierende Modelle oder Dienste.

  • Zwei Hoster verbieten zusätzlich das Benchmarking. Bei Nebius und Nebul ist „competitive analysis or benchmarking" ausdrücklich untersagt. Das trifft nicht das Training, aber jeden Anbietervergleich.

  • Bei offenen Modellen ist Apache 2.0 oder MIT der ruhige Fall. Diese Lizenzen regeln Ausgaben gar nicht. Aufpassen muss man bei Llama (Namenspflicht für das Destillat), Gemma 3 (das Destillat erbt die Nutzungsbeschränkungen) und MiniMax M2.7 (kommerziell nur mit Genehmigung).

Inhaltsverzeichnis

  1. Worum es bei Distillation vertraglich geht

  2. Drei Vertragsebenen, die gleichzeitig gelten

  3. Ebene 1: Die Frontier-Anbieter

  4. Warum der Bezugsweg nichts ändert

  5. Ebene 2: Die europäischen Hoster

  6. Ebene 3: Die Lizenz des Modells

  7. Die Grauzone: Was heißt „konkurrierend"?

  8. Ein Prüfpfad in vier Schritten

  9. Wie wir selbst entschieden haben

  10. Häufige Fragen

Worum es bei Distillation vertraglich geht

Distillation heißt: Ein großes Modell liefert die Antworten, aus denen ein kleines lernt. In der Praxis gibt es zwei Spielarten. Entweder lässt man den Teacher die Trainingsbeispiele von Grund auf erzeugen, oder der Student antwortet zuerst selbst und der Teacher korrigiert ihn. In beiden Fällen landen Ausgaben eines fremden Modells in Ihren Trainingsdaten.

Genau daran hängt die vertragliche Frage. Sie lautet nicht „darf ich das Modell benutzen", sondern „darf ich das, was dabei herauskommt, zum Bau eines anderen Modells verwenden". Die meisten Nutzungsbedingungen beantworten die erste Frage großzügig und die zweite restriktiv.

Nicht zu verwechseln ist das mit der Frage, ob der Anbieter Ihre Daten für sein Training verwendet. Dort geht es um Ihre Eingaben und darum, was der Anbieter damit darf. Hier geht es um seine Ausgaben und darum, was Sie damit dürfen. Beide Fragen tauchen in denselben Dokumenten auf und werden regelmäßig verwechselt. Den ersten Teil ordnet der Beitrag zu Zero Data Retention bei OpenAI, Anthropic und Google ein.

Der Grund ist naheliegend. Wer die Ausgaben eines Spitzenmodells in großer Zahl abruft, kann daraus ein kleineres Modell bauen, das einen Teil derselben Arbeit erledigt, zu einem Bruchteil des Preises. Aus Sicht des Anbieters ist das der Bau eines Konkurrenzprodukts aus seinem eigenen Material.

Drei Vertragsebenen, die gleichzeitig gelten

Der häufigste Fehler in dieser Frage ist, nur ein Dokument zu lesen. Tatsächlich stapeln sich bei einem einzigen API-Aufruf bis zu drei Regelwerke:

  • Die Bedingungen des Modellanbieters. Bei Claude ist das Anthropic, auch dann, wenn Sie über AWS abrechnen.

  • Die Bedingungen des Hosters oder der Plattform. AWS, Microsoft, Google oder ein europäischer Anbieter. Diese gelten zusätzlich, nicht stattdessen.

  • Die Lizenz des Modells selbst. Bei offenen Modellen ist das die entscheidende Ebene, und fast jeder EU-Hoster reicht sie ausdrücklich an Sie durch.

Praktisch heißt das: Ein Hoster, dessen Bedingungen schweigen, erlaubt Ihnen nichts, was die Modell-Lizenz verbietet. Und eine großzügige Modell-Lizenz hilft nicht, wenn der Hoster konkurrierende Modelle untersagt. Sie brauchen auf allen drei Ebenen ein Ja oder ein Schweigen.

Ebene 1: Die Frontier-Anbieter

Bei den vier großen Anbietern ist das Bild eindeutig, mit einer Ausnahme.

Anbieter

Distillation laut Terms

Maßgebliche Klausel

Ausnahme

Anthropic

verboten ohne schriftliche Genehmigung

Commercial ToS D.4: kein Zugriff, um ein konkurrierendes Produkt zu bauen, „including to train competing AI models". Usage Policy: kein „model distillation" ohne „prior authorization"

laut Help Center erlaubt für nicht konkurrierende Modelle wie Klassifikatoren, Summarizer, Extraktion

OpenAI

verboten für konkurrierende Modelle

Services Agreement 3.3(e): kein Output, um Modelle zu entwickeln, die mit OpenAI-Produkten konkurrieren

„Permitted Exception": Klassifikatoren und Embeddings, die nicht an Dritte vertrieben werden, sowie Fine-Tuning innerhalb der OpenAI-Dienste

Google (Gemini API)

verboten für konkurrierende Modelle

Additional Terms, Use Restrictions: keine Entwicklung von Modellen, die mit den Diensten konkurrieren

keine ausdrückliche Ausnahme im Dokument

Mistral

nicht ausdrücklich verboten für Textausgaben

Commercial ToS 2.2(e) verbietet Reverse Engineering der Produkte; 3.3 verbietet nur bei Bildausgaben das Training konkurrierender Bildgeneratoren

entfällt, es gibt keine Textklausel. Restrisiko liegt in der Auslegung von „reverse engineer"

Bei Anthropic lohnt ein genauer Blick, weil zwei Dokumente unterschiedlich weit gehen. Die Commercial Terms verbieten nur konkurrierende Modelle. Die Usage Policy verbietet das Training eines KI-Modells auf Ein- und Ausgaben generell ohne vorherige Genehmigung. Da die Commercial Terms die Usage Policy ausdrücklich einbeziehen, gilt die strengere Fassung. Ein Help-Center-Artikel vom 16. März 2026 nennt als erlaubt unter anderem Sentiment-Analyse, Kategorisierung, Summarization und Information Extraction, als verboten „general purpose chatbots" und Modelle für offene Textgenerierung. Dieser Artikel ist allerdings kein Vertragsbestandteil.

Warum der Bezugsweg nichts ändert

Ein verbreiteter Irrtum ist, dass der Bezug über einen Hyperscaler die Frage entschärft, weil man ja mit AWS oder Microsoft einen Vertrag hat. Das Gegenteil ist der Fall: Es kommen Regeln dazu.

Bei Amazon Bedrock druckt AWS die Anthropic-Bedingungen im Volltext auf der eigenen Seite ab, samt Einleitung „Anthropic Services on Amazon Bedrock are sold by Anthropic". Abschnitt D.4 ist wortgleich mit der API-Fassung. Zusätzlich greifen die AWS Service Terms: Abschnitt 50.5 untersagt es, Inhalte zu generieren „for the express purpose of training an AI model or service or developing a substantially similar AI model or service", 50.11 verbietet das Extrahieren von Gewichten, und 50.12.1 stellt klar, dass die Bedingungen des Modellherstellers zusätzlich gelten.

Bei Microsoft Azure und Foundry gelten Microsofts Product Terms, nicht die von OpenAI. Die Universal License Terms verbieten Output „for the express purpose of creating synthetic training data to develop or train AI models or systems that have substantially similar functionality to a Microsoft AI service". Das ist enger gefasst als OpenAIs eigene Klausel, weil es auf Microsoft-Dienste abstellt. Für Foundry-Modelle erlaubt Microsoft synthetische Daten ausdrücklich zum Fine-Tuning innerhalb von Azure.

Bei Google Vertex AI regeln die Service Specific Terms in Abschnitt 17 zwei Dinge getrennt: 17(a) Competitive Use und 17(b) Model Restrictions, also keine Ausgaben verwenden, um „models similar to a Google Model" zu erstellen oder zu verbessern. Es gibt eine enge Ausnahme: Wenn der Dienst Fine-Tuning oder Distillation selbst als Funktion anbietet, darf daraus ein „Modified Google Model" entstehen. Das bleibt aber bei Google, samt Rechten daran.

Welcher Weg welche Vertragskette erzeugt, haben wir für Claude ausführlich im Beitrag Claude in der EU nutzen aufgeschlüsselt. Dieselbe Logik gilt hier.

Ebene 2: Die europäischen Hoster

Bei den EU-Hostern zerfällt das Feld in zwei Gruppen. Die eine schweigt zur Frage, die andere verbietet konkurrierende Produkte. Wichtig: Schweigen bedeutet hier tatsächlich, dass wir keine Klausel gefunden haben, nicht dass ausdrücklich erlaubt wird.

Hoster

Sitz

Output-Nutzung fürs Training

Anmerkung

Scaleway

Paris, FR

schweigt

Ein- und Ausgaben gehören laut Art. 4.4 dem Kunden. Art. 2.2 verweist auf die Modell-Lizenz

OVHcloud

Roubaix, FR

schweigt

Modelle sind „Third-Party Products", deren Bedingungen gelten. Code of Conduct verbietet nur Reverse Engineering der Modelle

IONOS

Montabaur, DE

schweigt

Das Trainingsverbot in 2.3 bindet IONOS, nicht Sie. Aber 2.5 und 2.6 setzen interaktive Nutzung als Regelfall und nennen skriptgesteuerte Abfragen als Missbrauch

TensorX

Dublin, IE

schweigt

AUP verpflichtet auf die Modell-Lizenzen

Regolo AI

Frosinone, IT

schweigt

5.3 verbietet ohne schriftliche Erlaubnis, API-Aufrufe für kommerzielle Zwecke durch Drittdienste zu leiten

Nebius

Schiphol, NL

verbietet eng

5(f): kein konkurrierendes Produkt, keine „competitive analysis or benchmarking". Modell-EULAs sind Vertragsbestandteil

Nebul

Leiden, NL

verbietet eng

5.5.5 wie oben, inklusive Benchmarking-Verbot

Infercom

Luxemburg, LU

verbietet eng

5.1: keine Entwicklung konkurrierender KI-Inferenzdienste

Inceptron

Lund, SE

verbietet

3.2(f): keine Ausgaben nutzen, um konkurrierende Foundation Models zu bauen

AKI.IO

Berlin, DE

verbietet

AUP §5: „training or replication of competing AI models using the Services" untersagt

Zwei Details sind es wert, hervorgehoben zu werden.

Das Benchmarking-Verbot bei Nebius und Nebul trifft nicht das Training, sondern etwas anderes: den Vergleich. Wer öffentlich Anbieter gegeneinander misst, sollte wissen, dass zwei davon das in ihren Bedingungen untersagen. Für uns ist das relevant, weil Anbietervergleiche zu unserer Arbeit gehören.

Die IONOS-Klauseln 2.5 und 2.6 sind die unauffälligste Stolperstelle der ganzen Recherche. Sie setzen als Regelfall „interaktive Nutzung durch eine natürliche Person" und nennen als Missbrauch unter anderem „automatisierte oder repetitive Abfragen" sowie „das Weiterleiten von KI-Output unmittelbar als neuen Input". Eine Trainingsdaten-Pipeline ist genau das. Ob die Leistungsbeschreibung des AI Model Hub als API-Produkt das ausnimmt, haben wir nicht abschließend geklärt. Wer dort in großem Stil Daten erzeugen will, sollte das vorher schriftlich bestätigen lassen.

Ebene 3: Die Lizenz des Modells

Bei offenen Modellen liegt die eigentliche Entscheidung hier. Fast jeder EU-Hoster reicht die Herstellerlizenz ausdrücklich durch, Scaleway in Art. 2.2, OVHcloud in Appendix 10 §2, IONOS in 1.6, TensorX in der AUP.

Die gute Nachricht: Der häufigste Fall ist der einfachste. Apache 2.0 und MIT regeln Ausgaben überhaupt nicht. Sie lizenzieren Gewichte und Code. Ausgaben sind kein Lizenzgegenstand, also gibt es dort keine Hürde für Distillation. Das gilt für die gesamte Qwen3-Familie, Gemma 4, GLM-5 bis 5.3 und DeepSeek V4.

Lizenztyp

Beispiele

Was Sie beachten müssen

Apache 2.0 oder MIT

Qwen3 und Qwen3.5, Gemma 4, GLM-5.1 bis 5.3, DeepSeek V4

nichts Besonderes. Lizenz- und Notice-Hinweis nur bei Weitergabe der Gewichte

Community-Lizenz mit Namenspflicht

Llama 3.1 und 3.3

Distillation ist ausdrücklich erlaubt, aber das Ergebnis muss „Llama" am Namensanfang tragen und „Built with Llama" sichtbar anzeigen, sobald Sie es weitergeben

Lizenz mit Vererbung

Gemma 3

Google beansprucht keine Rechte an Ausgaben. Ein damit trainiertes Modell gilt aber als „Model Derivative" und erbt die Prohibited Use Policy, die Sie vertraglich weitergeben müssen

Schwellenwert-Lizenz

Kimi K2.5 bis K3, MiniMax M2 und M3, GLM-5.3, Qwen3.8 Flash-Next

unterhalb der Schwelle wie MIT. Darüber greifen Anzeigepflichten im UI oder eine gesonderte Vereinbarung, meist ab 100 Mio. monatlichen Nutzern oder zweistelligen Millionenumsätzen

nicht kommerziell

MiniMax M2.7

jede kommerzielle Nutzung der Software oder ihrer Derivate braucht vorherige schriftliche Genehmigung. Für eine kommerzielle Pipeline nicht nutzbar

Ein Sonderfall verdient Erwähnung, weil er in die andere Richtung zeigt: DeepSeek erlaubt Distillation ausdrücklich. Die Open-Platform-Bedingungen nennen „training other models (such as model distillation)" als zulässige Verwendung der API-Ausgaben. Das betrifft DeepSeeks eigene API, nicht die europäischen Hoster, zeigt aber die Haltung des Herstellers. Die Gewichte stehen ohnehin unter MIT.

Die Grauzone: Was heißt „konkurrierend"?

Fast alle Verbote hängen am selben unbestimmten Begriff. Verboten ist nicht Distillation, verboten ist Distillation in ein konkurrierendes Modell. Was das bedeutet, definiert kein Vertrag präzise.

Die einzige halbwegs konkrete Auslegung liefert Anthropics Help Center, und sie zieht die Linie plausibel: Ein Klassifikator, ein Summarizer oder ein Extraktionsmodell konkurriert nicht mit einem Allzweckmodell. Ein Chatbot oder ein Modell für offene Textgenerierung schon. OpenAI zieht eine ähnliche Linie, indem die Permitted Exception Klassifikatoren und Embeddings nennt, solange sie nicht an Dritte vertrieben werden.

Für eine eng umrissene Aufgabe wie das Auslesen von acht Feldern aus einer E-Mail fiele das vermutlich unter die erlaubte Kategorie. Das Wort „vermutlich" ist hier aber das Problem. Es steht in einem Help-Center-Artikel, nicht im Vertrag, und es hängt an einer Abgrenzung, die der Anbieter im Streitfall selbst auslegt. Wer eine Produktionspipeline darauf baut, sollte sich die Genehmigung schriftlich geben lassen, und das ist bei Anthropic nicht trivial: Ein öffentliches Antragsformular oder einen benannten Kontaktweg dafür haben wir nicht gefunden.

Ein Prüfpfad in vier Schritten

Wenn Sie die Frage für Ihr eigenes Projekt klären müssen, ist das die kürzeste Reihenfolge:

  1. Benennen Sie, was Sie bauen. Ein Klassifikator oder ein Extraktionsmodell steht anders da als ein Assistent. Diese Einordnung entscheidet über fast jede Ausnahmeklausel, also schreiben Sie sie auf, bevor Sie Verträge lesen.

  2. Prüfen Sie den Modellhersteller, nicht die Rechnung. Wer Ihnen die Rechnung stellt, ist oft nicht der, dessen Bedingungen gelten. Bei Claude über Bedrock ist Anthropic der Verkäufer.

  3. Prüfen Sie den Hoster zusätzlich. Achten Sie dabei nicht nur auf Trainingsklauseln, sondern auch auf Nebenverbote: Benchmarking, Weiterleiten von Ausgaben als neue Eingaben, automatisierte Nutzung, Weiterverkauf.

  4. Prüfen Sie die Modell-Lizenz. Nicht die Modellkarte, sondern die LICENSE-Datei im offiziellen Repository. Bei mehreren Modellen derselben Familie kann die Lizenz von Version zu Version wechseln, Gemma 3 gegen Gemma 4 ist genau so ein Fall.

Wenn Sie ohnehin gerade Ihre Anbieterkette dokumentieren, lässt sich das mit der Prüfung verbinden, die Sie für den Auftragsverarbeitungsvertrag brauchen. Eine Vorlage dafür steht in unserer AVV-Checkliste für KI-Tools.

Wie wir selbst entschieden haben

Für unser eigenes Trainingsprojekt stand die Entscheidung nach dieser Recherche schnell fest. Wir brauchten einen Teacher, der deutsche Geschäftspost korrigiert. In Frage kamen ein Frontier-Modell mit vertretbarer Auslegungsfrage oder ein offenes Modell ohne Frage.

Wir haben das offene genommen: Qwen3.5-397B unter Apache 2.0, bezogen über Scaleway, dessen Bedingungen zur Output-Nutzung schweigen und dessen Art. 4.4 die Ein- und Ausgaben ausdrücklich dem Kunden zuordnet. Damit ist auf allen drei Ebenen kein Verbot im Weg. Der praktische Preis dieser Entscheidung war überschaubar: Der offene Teacher lieferte in unserer Messreihe Korrekturen, die zu 94 Prozent richtig waren.

Die Lehre daraus ist weniger juristisch als organisatorisch. Diese Prüfung kostet einen Tag, und sie kostet ihn vor dem Projekt. Danach ist sie teuer, weil die Trainingsdaten dann schon existieren und im Zweifel unbrauchbar sind.

Ihre Vertragskette, einmal durchgesprochen

Wenn Sie vor derselben Frage stehen, gehen wir Ihren Fall in 30 Minuten durch: welches Modell als Teacher in Frage kommt, welche Bedingungen an Ihrem Bezugsweg hängen und was das für Ihre Datenpipeline heißt. Engineering ist dabei, und wenn die Antwort lautet, dass Sie keinen externen Teacher brauchen, sagen wir das. Demo buchen.

Häufige Fragen

Darf ich GPT oder Claude nutzen, um Trainingsdaten für ein eigenes Modell zu erzeugen?

Für ein konkurrierendes Modell nicht. Anthropics Usage Policy verlangt sogar für jedes Modelltraining auf Ein- und Ausgaben eine vorherige Genehmigung. Für eng umrissene Aufgaben wie Klassifikation oder Extraktion nennen beide Anbieter Ausnahmen, bei Anthropic allerdings nur in einem Help-Center-Artikel, der nicht Vertragsbestandteil ist.

Ändert sich etwas, wenn ich über Bedrock, Azure oder Vertex beziehe?

Ja, aber nicht zu Ihren Gunsten. Es kommen Regeln dazu. Die Bedingungen des Modellherstellers gelten weiter, die des Hyperscalers zusätzlich. AWS untersagt in Service Terms 50.5 das Generieren von Inhalten zum Zweck des Modelltrainings, Microsoft stellt auf „substantially similar functionality to a Microsoft AI service" ab.

Welche europäischen Hoster erlauben Distillation?

Ausdrücklich erlaubt es keiner. Scaleway, OVHcloud, IONOS, TensorX und Regolo enthalten aber kein Verbot. Nebius, Nebul, Infercom, Inceptron und AKI.IO verbieten konkurrierende Modelle oder Dienste. Bei allen gilt zusätzlich die Lizenz des jeweiligen Modells, auf die die Hoster ausdrücklich verweisen.

Reicht es, wenn das Modell unter Apache 2.0 steht?

Für die Lizenzebene ja. Apache 2.0 und MIT lizenzieren Gewichte und Code und regeln Ausgaben nicht, also gibt es dort keine Hürde. Die Bedingungen des Hosters gelten trotzdem: Ein Apache-Modell bei einem Anbieter, der konkurrierende Modelle untersagt, hilft Ihnen nicht weiter.

Was ist mit Llama und Gemma?

Beide erlauben es, haben aber Folgepflichten. Bei Llama 3.1 und 3.3 muss ein weitergegebenes Destillat „Llama" am Namensanfang tragen und „Built with Llama" anzeigen. Bei Gemma 3 gilt das trainierte Modell als „Model Derivative" und erbt die Prohibited Use Policy, die Sie vertraglich weiterreichen müssen. Gemma 4 steht unter Apache 2.0.

Darf ich Anbieter öffentlich gegeneinander benchmarken?

Bei zwei der geprüften Hoster nicht. Nebius und Nebul untersagen in ihren Bedingungen ausdrücklich „competitive analysis or benchmarking". Das ist unabhängig von der Trainingsfrage und trifft jeden veröffentlichten Vergleich, auch einen wohlwollenden.

Wie verbindlich sind diese Angaben?

Es ist eine Momentaufnahme vom 7. September 2026, keine Rechtsberatung. Die Klauseln bei Google Cloud und AWS haben wir im Rohtext selbst gelesen, die übrigen über eine Extraktion aus dem Livedokument. Vor einer rechtlichen Entscheidung gehört jede zitierte Stelle Wort für Wort im Originaldokument gegengelesen, zumal mehrere Anbieter ihre Bedingungen im Prüfzeitraum aktualisiert haben.

Quellen

Stand: 21. September 2026 · kontinent.ai. Alle Dokumente am 7. September 2026 live abgerufen. Keine Rechtsberatung. Nutzungsbedingungen ändern sich häufig, prüfen Sie vor einer Entscheidung das Originaldokument.

  • Border Shape
  • Border Shape