KI-Modelle auf eigenen Daten trainieren, ohne gegen DSGVO und AI Act zu verstoßen

Souveränität & Recht

Image

Dominik Keller

Gründer, Kontinent

Wer ein KI-Modell auf Unternehmensdaten trainiert, muss drei Dinge klären: ob eine Rechtsgrundlage die Weiterverarbeitung trägt, ob das fertige Modell selbst noch Personenbezug hat, und ob das Training Sie vom Betreiber zum Anbieter macht. Eigene Daten erleichtern alle drei Fragen. Beantwortet ist damit keine.

Die verbreitete Kurzfassung lautet: eigene Daten statt gekaufter, minimieren, verschlüsseln, dokumentieren. Das ist richtig. Es hilft nur begrenzt weiter, weil es die Fragen auslässt, an denen ein Trainingsprojekt wirklich scheitert. Dieser Beitrag geht sie der Reihe nach durch.

Zu jeder Aussage steht die Fundstelle darunter, kursiv und in einer eigenen Zeile. Sie können sie überspringen und trotzdem alles verstehen. Grundlage sind die Gesetzestexte selbst, die Stellungnahme 28/2024 des Europäischen Datenschutzausschusses, eine Leitlinie der EU-Kommission, ein Urteil des Europäischen Gerichtshofs, eine begutachtete Forschungsarbeit und unsere eigene Auswertung der Nutzungsbedingungen großer Modellanbieter. Dies ist kein Rechtsrat.

Begriffe, die Sie brauchen. Die DSGVO ist die Datenschutz-Grundverordnung. Die KI-Verordnung ist dasselbe wie der EU AI Act, dieser Beitrag benutzt beide Namen. Der EDSA ist der Europäische Datenschutzausschuss, in dem die nationalen Aufsichtsbehörden sitzen; seine Stellungnahmen sind kein Gesetz, aber der Maßstab, an dem Behörden messen. Anbieter ist, wer ein KI-System baut und unter eigenem Namen anbietet, Betreiber, wer es einsetzt. GPAI sind Modelle für allgemeine Zwecke, etwa ein Sprachmodell. Fine-Tuning heißt, ein fertiges Modell mit eigenen Beispielen nachzutrainieren. Distillation heißt, ein kleines Modell auf den Antworten eines großen zu trainieren. Rn. steht für Randnummer, also den nummerierten Absatz in einem Dokument.

Das Wichtigste in Kürze

  • Eigene Daten verschieben die Rechtsfrage, sie lösen sie nicht. Ihre Bestandsdaten wurden für einen anderen Zweck erhoben. Training ist ein neuer Zweck, und dafür gibt es eine eigene Prüfung. Zu genau dieser Prüfung hat sich der EDSA bisher nicht festgelegt.

  • Ein trainiertes Modell ist nicht automatisch anonym. Der Maßstab ist streng: Für jede einzelne betroffene Person muss es unerheblich sein, dass sich ihre Daten aus dem Modell holen lassen. Nicht selten, nicht im Schnitt gering, sondern unerheblich.

  • Fehlende Dokumentation ist selbst ein Verstoß. Kann eine Behörde an Ihren Unterlagen nicht nachvollziehen, dass Sie das Modell anonymisiert haben, reicht ihr das für einen Vorwurf. Unabhängig davon, ob das Modell tatsächlich anonym ist.

  • Die Hochrisiko-Fristen sind verschoben, die Transparenzpflicht nicht. Anhang III gilt ab dem 2. Dezember 2027, Anhang I ab dem 2. August 2028. Die Kennzeichnungspflicht gilt dagegen schon seit dem 2. August 2026.

  • Die Schlagzeilen-Bußgeldhöhe trifft Sie fast sicher nicht. Die bekannten 35 Millionen Euro gelten nur für verbotene Praktiken. Für alles andere sind es 15 Millionen oder 3 Prozent vom Umsatz. Und bei kleinen und mittleren Unternehmen gilt immer der niedrigere der beiden Werte.

  • Fine-Tuning macht Sie meist nicht zum Modellanbieter. Dafür müsste Ihr Training mehr als ein Drittel der Rechenleistung verbrauchen, die im Ausgangsmodell steckt. Ein übliches Projekt liegt weit darunter.

  • Das eigentliche Risiko ist der neue Zweck. Wer ein allgemeines Modell auf eine heikle Aufgabe zuschneidet, wird zum Anbieter eines Hochrisiko-Systems. Auslöser ist der Zweck, nicht der Rechenaufwand.

  • Nach dem Training müssen Sie die Sicherheit neu messen. In einer Studie stieg der Anteil schädlicher Antworten nach einem einzigen harmlosen Trainingsdurchlauf von 5,5 auf 31,8 Prozent. Kein Angriff, keine Absicht, Standardeinstellungen.

Inhaltsverzeichnis

  1. Warum eigene Daten die bessere Grundlage sind, und wo das aufhört

  2. Die vier rechtlichen Kernfragen vor dem ersten Trainingslauf

  3. Was der EU AI Act für das Training bedeutet

  4. So trainieren Sie regelkonform: sechs Schritte

  5. Der Sonderfall: Ihr Lehrermodell ist eine Vertragsfrage

  6. Was sich gerade ändert und bis Ende Oktober offen ist

  7. Wie wir das mit Ihnen durchgehen

  8. Häufige Fragen

  9. Quellen

Warum eigene Daten die bessere Grundlage sind, und wo das aufhört

Eigene Daten helfen Ihnen wirklich, aber an einer anderen Stelle als meist behauptet.

Der Vorteil liegt in der Beziehung zur betroffenen Person. Ein Kunde, der Ihnen ein Support-Ticket schreibt, steht mit Ihnen in Kontakt. Ein Mensch, dessen Forumsbeitrag aus dem Netz gesammelt wurde, tut das nicht. Der EDSA bewertet diese beiden Fälle ausdrücklich unterschiedlich. In welche Richtung, legt er nicht fest, aber die direkte Beziehung ist der Anknüpfungspunkt.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 94

Dazu kommen die praktischen Vorteile. Sie kennen die Herkunft jedes Datensatzes. Sie haben eine Löschroutine. Sie können Betroffenenrechte tatsächlich bedienen. Bei zugekauften Daten scheitert oft schon der erste dieser drei Punkte.

Und jetzt die Stelle, an der der Vorteil endet. Ihre Daten wurden für einen bestimmten Zweck erhoben: Vertrag, Support, Buchhaltung. Training ist ein anderer Zweck. Die Frage lautet damit nicht mehr, ob Sie die Daten haben dürfen. Sie lautet, ob Sie sie dafür verwenden dürfen. Genau hier scheitern Projekte, nicht an der Verschlüsselung.

Ein häufiger Irrtum an dieser Stelle: Man schreibe den Trainingszweck einfach in die Datenschutzerklärung, dann sei die Sache erledigt. Das ist falsch. Der EDSA sagt dazu sinngemäß, die Erfüllung der Transparenzpflichten allein genüge nicht, um anzunehmen, dass eine Person mit einer Verarbeitung rechnen muss.

Transparenz ist eine Pflicht, kein Freibrief.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 92. Im Original: „the mere fulfilment of the transparency requirements set out in the GDPR is not sufficient in itself to consider that the data subjects can reasonably expect a certain processing“

Die vier rechtlichen Kernfragen vor dem ersten Trainingslauf

Eine Abgrenzung vorweg, weil sie oft durcheinandergeht. Es ist etwas anderes, ein fremdes Modell über eine Schnittstelle zu nutzen, als ein eigenes zu trainieren. Beim Nutzen geht es um Auftragsverarbeitung, Serverstandort und Datentransfer in Drittländer. Das haben wir im Beitrag zu OpenAI, Claude und Gemini in Europa behandelt.

Hier geht es um den anderen Fall: Ihre Daten gehen in das Modell selbst ein. Das ist der schwierigere Fall, weil die Wahl eines europäischen Rechenzentrums ihn nicht löst.

Eine Frage steht noch davor, und sie ist keine rechtliche: Ist Training überhaupt der richtige Hebel für Ihre Aufgabe? Oft lösen ein besserer Prompt oder ein Retrieval-System dasselbe Problem. Woran Sie das vorher erkennen, steht im Beitrag Wann es sich lohnt, ein Modell zu fine-tunen.

Frage 1: Trägt eine Rechtsgrundlage die Weiterverarbeitung?

In der Praxis kommt dafür meist nur das berechtigte Interesse infrage. Eine Einwilligung von allen Betroffenen einzuholen scheitert an der Menge. Die Vertragserfüllung trägt ein Training nur selten. Die französische Aufsichtsbehörde CNIL sieht das genauso.

Fundstelle: Art. 6 Abs. 1 lit. f DSGVO. CNIL, Empfehlungen zum berechtigten Interesse bei der KI-Entwicklung

Das berechtigte Interesse ist an drei Bedingungen geknüpft. Erstens muss ein berechtigtes Interesse überhaupt vorliegen. Zweitens muss die Verarbeitung dafür erforderlich sein. Drittens dürfen die Interessen und Grundrechte der betroffenen Person nicht überwiegen. Zwei Punkte daraus entscheiden in Projekten regelmäßig.

Das Interesse muss konkret sein. „Wir wollen KI einsetzen“ genügt nicht. Es muss rechtmäßig, klar benannt und gegenwärtig sein, nicht bloß möglich. Der EDSA nennt drei Beispiele, die ein berechtigtes Interesse begründen können, sofern die beiden anderen Stufen ebenfalls tragen: ein Assistent zur Unterstützung von Nutzern, ein System zur Erkennung betrügerischer Inhalte oder betrügerischen Verhaltens, eine verbesserte Bedrohungserkennung im eigenen Informationssystem.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 66, 68 und 69

Erforderlichkeit ist eine hohe Hürde. Für viele Projekte ist das der Knackpunkt. Die Regel lautet sinngemäß: Wenn sich Ihr Ziel auch mit einem Modell erreichen lässt, das keine personenbezogenen Daten verarbeitet, dann ist die Verarbeitung personenbezogener Daten nicht erforderlich.

Übersetzt für Ihr Projekt: Geht es auch mit pseudonymisierten oder künstlich erzeugten Daten? Dann dürfen Sie die echten nicht nehmen. Das ist kein Formalismus. Es ist eine Frage, die Ihr Team vorher technisch beantworten kann.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 73

Frage 2: Hält die Zweckänderung?

Wenn Sie Daten für einen neuen Zweck verwenden, verlangt das Gesetz eine Prüfung: Passt der neue Zweck noch zum ursprünglichen? Fünf Kriterien sind dabei zu berücksichtigen, und die Liste ist nicht abschließend.

Kriterium

Was das beim Training konkret heißt

Verbindung zwischen altem und neuem Zweck

Support-Daten für ein Support-Modell liegen nahe. Support-Daten für ein Vertriebs-Scoring liegen weit auseinander

Verhältnis zur betroffenen Person

Bestandskunde, Bewerber oder Beschäftigter sind drei sehr verschiedene Ausgangslagen

Art der Daten, besonders sensible Angaben

In Freitextfeldern landen sensible Angaben regelmäßig unbeabsichtigt

Mögliche Folgen für die betroffene Person

Ein internes Extraktionsmodell und ein Modell, das über Ansprüche entscheidet, sind nicht vergleichbar

Vorhandene Schutzmaßnahmen

Verschlüsselung und Pseudonymisierung. Der einzige Punkt, den Sie durch Technik direkt beeinflussen

Fundstelle: Art. 6 Abs. 4 DSGVO

Eine Falle, die selten genannt wird. Diese Prüfung steht Ihnen nur offen, wenn Sie die Daten nicht per Einwilligung erhoben haben. Wer mit Einwilligung gesammelt hat, kommt über die Zweckänderung nicht ins Training. Er braucht eine neue Einwilligung. Das trifft Newsletter- und Tracking-Bestände öfter, als den Beteiligten bewusst ist.

Und eine ehrliche Lücke. Der EDSA hat diese Frage bewusst offengelassen. In seiner Stellungnahme führt er die Vorschrift unter „nicht analysiert“ auf, mit dem Zusatz, sie könne beim Training relevant sein und die Aufsichtsbehörden müssten das bewerten. Es gibt also keine europäische Linie dazu, sondern nur nationale Praxis. Wer Ihnen hier eine eindeutige Antwort verspricht, verspricht zu viel.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 17

Frage 3: Stecken sensible Daten in Ihrem Bestand?

Das Gesetz schützt bestimmte Angaben besonders: Gesundheit, Herkunft, Religion, Gewerkschaftszugehörigkeit, Sexualleben, politische Meinung. Bei strukturierten Feldern können Sie das prüfen. Bei Freitext nicht.

Genau darauf laufen aber die meisten Trainingsprojekte hinaus: Tickets, Mails, Gesprächsnotizen, Reklamationen. Dort stehen Krankmeldungen und Herkunftsangaben, ohne dass es ein Feld dafür gäbe.

Der Europäische Gerichtshof hat dazu eine Aussage getroffen, die für Freitextbestände unangenehm klar ist. Sinngemäß: Wird ein Datensatz als Ganzes erhoben und lassen sich sensible und harmlose Angaben dabei nicht trennen, dann ist die Verarbeitung des gesamten Datensatzes verboten, sobald auch nur eine sensible Angabe darin steckt und keine Ausnahme greift.

Fundstelle: EuGH (Große Kammer), Urteil vom 04.07.2023, C-252/21 (Meta Platforms gegen Bundeskartellamt), ECLI:EU:C:2023:537, Rn. 89. Der EDSA verweist in Rn. 17 seiner Stellungnahme 28/2024 auf dieselbe Passage.

Welche Ausnahmen bleiben realistisch? Die ausdrückliche Einwilligung, und bei Beschäftigtendaten das Arbeits- und Sozialrecht. Verlassen Sie sich nicht darauf, dass jemand seine Daten „offensichtlich öffentlich gemacht“ hat. Der Gerichtshof verlangt dafür eine eindeutige Handlung mit genau dieser Absicht. Dass etwas im Netz auffindbar ist, genügt nicht.

Fundstelle: dieselbe Entscheidung, Rn. 77 sowie Rn. 82 bis 84

Es gibt einen Sonderweg über die KI-Verordnung. Sie erlaubt die Verarbeitung sensibler Daten, aber ausschließlich, um Verzerrungen im Modell zu erkennen und zu korrigieren. Unter strengen Auflagen, und die Daten sind danach zu löschen. Das ist eine Ausnahme für Fairness-Prüfungen, keine Trainingserlaubnis. Eine Pflicht, nach Verzerrungen zu suchen, folgt daraus ausdrücklich nicht.

Diese Erlaubnis stand bis Juli 2026 in Art. 10 Abs. 5 und galt nur für Anbieter von Hochrisiko-Systemen. Der Digital Omnibus hat sie herausgelöst und erweitert: Sie gilt jetzt auch für Betreiber und für Anbieter anderer KI-Systeme und Modelle. Der Sonderweg ist also breiter geworden, nicht enger.

Fundstelle: Art. 4a KI-Verordnung, eingefügt durch die Verordnung (EU) 2026/1744. Er ersetzt den zum 27.07.2026 aufgehobenen Art. 10 Abs. 5.

Der praktikable Weg führt deshalb über das Entfernen sensibler Angaben vor dem Training. Wie gut das gelingen muss und woran automatische Verfahren scheitern, steht in unserem Beitrag zum Schwärzen personenbezogener Daten.

Frage 4: Steckt in dem fertigen Modell noch etwas drin?

Diese Frage kommt in Ratgebertexten fast nie vor, und sie entscheidet über alles Weitere. Denn wenn die Modellgewichte personenbezogene Daten enthalten, gilt die DSGVO auch für jede spätere Weitergabe, jeden Export und jeden Betrieb des Modells.

Ein trainiertes Modell ist nicht automatisch anonym. Das muss für jeden Fall einzeln geprüft werden.

Der Grund: Beim Training wandern Informationen aus den Daten in die Gewichte des Modells. Sie liegen dort in anderer Form vor, als Zahlen, aber der Inhalt bleibt erhalten. Unter Umständen lässt er sich wieder herausholen.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 31 und 34

Der Maßstab für Anonymität ist streng. Zwei Wege müssen praktisch ausgeschlossen sein: dass jemand die Daten direkt aus dem Modell zieht, und dass das Modell sie in seinen Antworten preisgibt. Und zwar für jede betroffene Person, nicht im Durchschnitt.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 43

Ein Punkt fällt für die meisten Unternehmensprojekte günstig aus. Ein Modell, das nur intern erreichbar ist und das nur Beschäftigte abfragen können, wird anders bewertet als ein öffentliches Chat-Angebot. Das rettet viele Vorhaben.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 46

Ein offener Streit, den Sie kennen sollten. Die Hamburger Datenschutzbehörde vertrat 2024 die Auffassung, ein gespeichertes Sprachmodell enthalte gar keine personenbezogenen Daten. Der EDSA sieht das ein halbes Jahr später anders. Beide Papiere sind veröffentlicht, keines ist aufgehoben. Wenn Sie sich auf die Hamburger Linie stützen, tun Sie das bewusst und schreiben Sie es auf. Nicht aus Versehen.

Fundstellen: HmbBfDI, Diskussionspapier vom 15.07.2024 gegen EDSA-Stellungnahme 28/2024, Rn. 31, 34 und 43

Was der EU AI Act für das Training bedeutet

Welche Fristen wirklich gelten

An dieser Stelle steht in vielen Texten Falsches, auch in solchen aus dem Sommer 2026. Der sogenannte Digital Omnibus hat die Fristen für Hochrisiko-Systeme verschoben. Die Kennzeichnungspflicht hat er nicht verschoben.

Pflichtenkreis

Ursprünglich

Jetzt gültig

Verbotene Praktiken (Art. 5)

02.02.2025

unverändert; zwei neue Verbote ab 02.12.2026

KI-Kompetenz (Art. 4)

02.02.2025

Termin unverändert, Pflicht abgeschwächt von „sicherstellen“ auf „fördern“

Pflichten für Modellanbieter (Art. 53)

02.08.2025

unverändert, Übergang für Altmodelle bis 02.08.2027

Kennzeichnung (Art. 50)

02.08.2026

unverändert; nur für Systeme, die vor dem 02.08.2026 in Verkehr gebracht wurden, Karenz für Abs. 2 bis 02.12.2026

Hochrisiko Anhang III

02.08.2026

02.12.2027

Hochrisiko Anhang I

02.08.2027

02.08.2028

Fundstelle: Verordnung (EU) 2026/1744, veröffentlicht am 24.07.2026, in Kraft seit 27.07.2026

Die verbreitete Entwarnung „alles auf 2027 verschoben“ ist deshalb falsch. Die Kennzeichnungspflicht gilt seit dem 2. August 2026. Sie hängt nicht an der Risikoklasse, sondern an der Art des Systems. Wer einen Chatbot betreibt oder KI-erzeugte Inhalte ausspielt, ist in der Pflicht, auch bei minimalem Risiko. Was das konkret verlangt, steht in unserem Beitrag zur Kennzeichnungspflicht nach Art. 50.

Werden Sie durch Fine-Tuning zum Anbieter?

Das ist die teuerste Frage des ganzen Themas. Denn ein Anbieter muss deutlich mehr leisten als ein Betreiber: Konformitätsbewertung, technische Dokumentation, Risikomanagement, Registrierung.

Drei Dinge machen Sie zum Anbieter eines Hochrisiko-Systems.

Auslöser

Was gemeint ist

Beim Training relevant?

Eigener Name

Sie setzen Ihren Namen oder Ihre Marke auf ein fremdes Hochrisiko-System

Nur beim Weiterverkauf unter eigenem Label

Wesentliche Änderung

Sie ändern ein Hochrisiko-System wesentlich, und es bleibt eines

Ja, wenn das Ausgangssystem schon Hochrisiko war

Neuer Zweck

Sie geben einem harmlosen System, auch einem System mit allgemeinem Verwendungszweck, einen neuen Zweck, und dadurch wird es zum Hochrisiko-System

Der praktisch wichtigste Fall

Fundstelle: Art. 25 Abs. 1 KI-Verordnung

Der dritte Fall trifft die meisten Projekte. Er greift, ohne dass das Ausgangssystem je Hochrisiko war. Ein Beispiel: Wer ein allgemeines Sprachmodell auf die Vorauswahl von Bewerbungen zuschneidet, wird zum Anbieter eines Hochrisiko-Systems. Wie viel Rechenleistung das Training gekostet hat, spielt dabei keine Rolle.

Eine Verkürzung, die in mehreren Ratgebertexten steht und so nicht stimmt. Dort heißt es, Fine-Tuning sei „eine wesentliche Änderung“. Das ist zu grob. Eine wesentliche Änderung setzt zweierlei voraus: Sie war in der ursprünglichen Prüfung nicht vorgesehen, und sie berührt entweder die Anforderungen an Hochrisiko-Systeme oder ändert den Zweck. Ein Fine-Tuning, das den Zweck unverändert lässt und in der ursprünglichen Konformitätsbewertung des Herstellers vorgesehen war, ist gerade keine wesentliche Änderung. Ein Satz im Datenblatt genügt dafür nicht.

Fundstelle: Art. 3 Nr. 23 KI-Verordnung

Wenn Sie zum Anbieter werden, wird der ursprüngliche Hersteller von seinen Pflichten frei. Er muss aber mit Ihnen zusammenarbeiten, Ihnen die technische Dokumentation geben und bekannte Grenzen und Fehler offenlegen.

Und jetzt der Haken, der in der Praxis regelmäßig zuschlägt: Diese Pflicht entfällt vollständig, wenn der Hersteller ausdrücklich festgelegt hat, dass sein System nicht in ein Hochrisiko-System umgewandelt werden darf. Große Anbieter tun das in ihren Bedingungen. Genau deshalb gehört dieser Punkt in Ihren Vertrag, bevor Sie anfangen.

Fundstelle: Art. 25 Abs. 2 KI-Verordnung in der Fassung der Verordnung (EU) 2026/1744. Die Aufzählung der Mitwirkungspflichten kam erst mit dieser Änderung hinzu, in der Ursprungsfassung steht sie nicht.

Werden Sie zum Modellanbieter? Wahrscheinlich nicht

Hier ist die Nachricht besser, als der übliche Alarmton vermuten lässt.

Die KI-Verordnung sagt es selbst: Wer ein Modell nur verändert oder nachtrainiert, dessen Pflichten beschränken sich auf genau diese Änderung. Sinngemäß heißt es dort, man ergänze die vorhandene technische Dokumentation um Angaben zu den Änderungen, einschließlich neuer Trainingsdatenquellen.

Sie müssen also nicht die Trainingsdaten eines fremden Basismodells dokumentieren, die Sie nie gesehen haben.

Fundstelle: Erwägungsgrund 109 der KI-Verordnung

Die EU-Kommission hat das weiter eingegrenzt. Sie werden nur dann selbst Modellanbieter, wenn Ihre Änderung das Modell erheblich verändert. Als Richtwert nennt die Kommission: Ihr Training müsste mehr als ein Drittel der Rechenleistung verbrauchen, die im Ausgangsmodell steckt. Die Kommission geht selbst davon aus, dass derzeit nur sehr wenige Änderungen diese Schwelle erreichen.

Ein typisches Fine-Tuning im Mittelstand liegt weit darunter, nicht knapp. Der Richtwert ist keine harte Grenze, und die Kommission räumt ein, dass er schwer anzuwenden ist, wenn die Rechenleistung des Ausgangsmodells nicht bekannt ist. Als Orientierung taugt er trotzdem. Das reale Risiko für Ihr Projekt ist der neue Zweck, nicht die Rechenleistung.

Fundstelle: Europäische Kommission, Leitlinien zum Anwendungsbereich der Pflichten für Anbieter von KI-Modellen mit allgemeinem Verwendungszweck, C(2025) 7719 final vom 19.11.2025, Rn. 60 f. Ist die Rechenleistung des Ausgangsmodells unbekannt, nennt die Leitlinie hilfsweise ein Drittel von 10²³ FLOP als Bezugsgröße, bei Modellen mit systemischem Risiko stattdessen ein Drittel von 10²⁵ FLOP.

Was ein Verstoß tatsächlich kostet

Die Zahl 35 Millionen Euro steht in fast jedem Text zum Thema. Sie stimmt, und sie gilt für etwas anderes als das, worum es hier geht. Die Bußgelder sind gestaffelt.

Wofür

Obergrenze

Verbotene Praktiken

35 Mio. EUR oder 7 % des weltweiten Jahresumsatzes

Die dort aufgezählten übrigen Pflichten

15 Mio. EUR oder 3 %

Falsche Angaben gegenüber Behörden

7,5 Mio. EUR oder 1 %

Im Grundsatz gilt jeweils der höhere der beiden Werte. Und dann kommt die Regel, die kaum ein Ratgebertext nennt und die für den Mittelstand die eigentlich wichtige ist: Bei kleinen und mittleren Unternehmen einschließlich Start-ups gilt jeweils der niedrigere Wert.

Ein Rechenbeispiel für ein Unternehmen mit 10 Millionen Euro Jahresumsatz. Bei den Pflichten, um die es in diesem Beitrag geht, also Dokumentation, Daten-Governance und Anbieterpflichten, liegt die Obergrenze bei 3 Prozent, also 300.000 Euro. Selbst bei einer verbotenen Praktik wären es 7 Prozent, also 700.000 Euro. In keinem Fall 35 Millionen.

Das ist immer noch existenzbedrohend, aber eine andere Größenordnung als die Schlagzeile. Wer intern mit 35 Millionen argumentiert, um ein Budget zu bekommen, argumentiert mit einer Zahl, die für sein Unternehmen nicht gilt.

Fundstelle: Art. 99 Abs. 3 bis 6 KI-Verordnung

So trainieren Sie regelkonform: sechs Schritte

Die Schritte laufen in dieser Reihenfolge ab, und jeder erzeugt ein Dokument. Das ist kein Selbstzweck. Am Ende des Abschnitts steht die Liste dessen, was in Ihrer Akte liegen sollte. DSGVO und KI-Verordnung verlangen dabei weitgehend dieselben Unterlagen, nur unter anderen Namen.

1. Datenquellen erfassen, samt ursprünglichem Zweck

Die KI-Verordnung verlangt, dass Sie dokumentieren, woher Ihre Daten stammen, wie sie erhoben wurden und, bei personenbezogenen Daten, zu welchem Zweck sie ursprünglich erhoben wurden.

Dieser letzte Halbsatz ist unscheinbar und zugleich der nützlichste im ganzen Thema. Denn genau diese Angabe brauchen Sie auch für die Zweckänderungsprüfung aus Frage 2. Ein einziges Verzeichnis bedient damit beide Regelwerke. Wer eine der beiden Dokumentationen sauber führt, hat die Hälfte der anderen schon erledigt.

Führen Sie das Verzeichnis je Datenquelle, nicht je Projekt. Hinein gehören: Tabelle, Feld, Erhebungsgrund, Rechtsgrundlage, Aufbewahrungsfrist, Löschroutine.

Fundstelle: Art. 10 Abs. 2 lit. b KI-Verordnung, zusammen mit Art. 6 Abs. 4 DSGVO

Ein deutscher Sonderfall, der Projekte real stoppt. Sobald Beschäftigtendaten in den Trainingsbestand geraten, gelten zwei weitere Regelwerke. Und dafür genügt schon, dass Sachbearbeiter in Tickets namentlich auftauchen.

Das erste ist das Bundesdatenschutzgesetz, allerdings mit einer Einschränkung, die viele Checklisten noch nicht abbilden. Seine Generalklausel für Beschäftigtendaten, § 26 Abs. 1 Satz 1 BDSG, gilt seit einem Urteil des Europäischen Gerichtshofs von 2023 als unionsrechtswidrig und wird nicht mehr als Rechtsgrundlage herangezogen. Sie stützen sich stattdessen direkt auf die DSGVO. In Kraft bleiben die übrigen Absätze, vor allem der zu sensiblen Daten und der zu Betriebsvereinbarungen. Ein eigenes Beschäftigtendatengesetz ist seit Jahren angekündigt und bis heute nicht beschlossen.

Das zweite ist das Betriebsverfassungsgesetz. Es gibt dem Betriebsrat ein erzwingbares Mitbestimmungsrecht bei technischen Einrichtungen, die sich zur Überwachung von Verhalten oder Leistung eignen. Wichtig dabei: Es genügt, dass das System dazu geeignet ist. Sie müssen niemanden überwachen wollen.

Ein Modell, das aus Bearbeitungsverläufen lernt, erfüllt das schnell. Holen Sie den Betriebsrat vor dem ersten Trainingslauf dazu, nicht erst vor dem Rollout. Nachträgliche Zustimmung zu fertig trainierten Gewichten ist die unangenehmste Variante dieses Gesprächs.

Fundstellen: § 26 Abs. 3 und 4 BDSG; zur Unanwendbarkeit von § 26 Abs. 1 Satz 1 BDSG: EuGH, Urteil vom 30.03.2023, C-34/21. § 87 Abs. 1 Nr. 6 BetrVG; zur objektiven Eignung BAG, Beschluss vom 23.03.2021, 1 ABR 31/19.

2. Die Rechtsgrundlage prüfen und die Prüfung aufschreiben

Die dreistufige Prüfung aus Frage 1 gehört in ein Dokument, nicht in ein Meeting. Der EDSA verlangt ausdrücklich, dass Behörden nachsehen, ob Verantwortliche sie sorgfältig durchgeführt und aufgeschrieben haben.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 66

Ein Punkt wird dabei regelmäßig falsch gemacht. Maßnahmen, zu denen Sie ohnehin gesetzlich verpflichtet sind, zählen in der Abwägung nicht als Pluspunkt. Eine Datenminimierung, zu der Sie ohnehin verpflichtet sind, verbessert Ihre Position nicht. Was zählt, sind Maßnahmen, die über das Pflichtprogramm hinausgehen.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 97

Der EDSA nennt vier solcher freiwilligen Maßnahmen. Zwei davon sind besonders gut umsetzbar. Erstens: Lassen Sie Betroffene ihre Daten auch dann löschen, wenn sie keinen gesetzlichen Anspruch darauf haben. Zweitens: Geben Sie ihnen einen Weg zu melden, dass das Modell ihre Daten ausplaudert, samt der Umstände, unter denen sich das wiederholen lässt.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 102

In dasselbe Dokument gehört die Entscheidung über die Datenschutz-Folgenabschätzung, kurz DSFA. Sie ist Pflicht, wenn die Verarbeitung voraussichtlich ein hohes Risiko für die Rechte der Betroffenen bedeutet. Als Regelbeispiele nennt das Gesetz drei Fälle: die systematische und umfassende automatisierte Bewertung persönlicher Aspekte, wenn darauf Entscheidungen mit erheblicher Wirkung gestützt werden; die umfangreiche Verarbeitung sensibler Daten; und die systematische umfangreiche Überwachung öffentlich zugänglicher Bereiche.

Ein Trainingsvorhaben auf großen Bestandsdaten trifft mindestens eines davon regelmäßig. Entscheiden Sie sich gegen eine DSFA, gehört die Begründung ebenfalls in die Akte. Der EDSA verlangt ausdrücklich auch die Dokumentation der Entscheidung, warum keine nötig war.

Fundstellen: Art. 35 Abs. 1 und 3 DSGVO, EDSA-Stellungnahme 28/2024, Rn. 58 lit. a

3. Minimieren, und zwar bevor die GPU läuft

Die Erforderlichkeitsprüfung aus Frage 1 ist im Kern eine technische Frage: Geht es auch ohne personenbezogene Daten? Bei Extraktions-, Sortier- und Formataufgaben lautet die Antwort überraschend oft ja. Das Modell soll dort die Struktur lernen, nicht die Personen.

Der EDSA sieht sich vier Bereiche Ihres Modelldesigns an: die Auswahl der Datenquellen, die Aufbereitung und Reduzierung der Daten, die Trainingsentscheidungen selbst und die Maßnahmen an den Ausgaben des Modells.

Bei den Trainingsentscheidungen nennt er zwei Verfahren beim Namen. Regularisierung sorgt dafür, dass sich das Modell die Beispiele nicht auswendig merkt. Differential Privacy fügt beim Training gezielt Rauschen hinzu, sodass sich einzelne Datensätze nicht mehr herauslesen lassen.

Auswendiglernen ist damit nicht nur ein Qualitätsproblem. Ein Modell, das sich Trainingsbeispiele merkt, ist auch datenschutzrechtlich das schlechtere Modell.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 49 bis 53

4. Sicher verarbeiten, und das Modell selbst mitprüfen

Verschlüsselung, Zugriffskontrolle und ein Auftragsverarbeitungsvertrag sind Pflicht und unstrittig. Für die Vertragsseite haben wir eine Checkliste für AVV bei KI-Tools geschrieben, die auch für Trainingsdienstleister trägt.

Der Teil, der fast überall fehlt, ist die Prüfung des Modells selbst. Der EDSA nennt fünf Testfelder, in denen sechs Angriffsarten stecken, und sagt dazu ausdrücklich, die Liste sei nicht abschließend. Das ist die konkreteste Passage des ganzen Dokuments, und sie lässt sich direkt in einen Testplan übersetzen.

Angriff

Was er zeigt

Attribute Inference

ob sich aus dem Modell Eigenschaften einer Person ableiten lassen

Membership Inference

ob sich feststellen lässt, dass ein bestimmter Datensatz im Training war

Exfiltration

ob sich Daten gezielt aus dem Modell herausziehen lassen

Regurgitation

ob das Modell Trainingsdaten wörtlich wiedergibt

Model Inversion

ob sich aus den Modellzahlen die Eingaben rekonstruieren lassen

Reconstruction

ob sich ganze Trainingsbeispiele wiederherstellen lassen

Der EDSA schränkt selbst ein: Ein bestandener Test beweist nur, dass das Modell den getesteten, heute bekannten Angriffen standhält. Er beweist keine Anonymität für alle Zeiten. Das ist ein Argument dafür, den Test zu wiederholen. Keines dafür, ihn zu lassen.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 55

5. Dokumentieren, weil das Fehlen selbst der Verstoß ist

Das ist der schärfste Satz der ganzen Stellungnahme. Kann eine Behörde an Ihren Unterlagen nicht nachvollziehen, dass Sie wirksam anonymisiert haben, darf sie allein daraus einen Verstoß ableiten. Die fehlende Dokumentation ist also nicht nur ein Beweisproblem. Sie ist ein eigener Vorwurf.

Fundstelle: EDSA-Stellungnahme 28/2024, Rn. 57, in Verbindung mit Art. 5 Abs. 2 DSGVO

Was gehört hinein? Der EDSA hat eine Liste, die KI-Verordnung hat eine Liste, und beide überschneiden sich weitgehend. Zusammengeführt ergibt das die Akte, die am Ende eines Trainingslaufs vorliegen sollte.

Unterlage

Inhalt

Fundstelle

Datenherkunftsverzeichnis

Quellen, Herkunft, ursprünglicher Zweck, Auswahl und Bereinigung, Beschriftung der Daten

Art. 10 Abs. 2 lit. b und c KI-VO, Anhang IV Nr. 2 lit. d

Prüfung der Rechtsgrundlage

dreistufige Prüfung, Zweckänderungsprüfung, Ergebnis und Begründung

Art. 6 Abs. 1 lit. f und Abs. 4 DSGVO, EDSA Rn. 66

DSFA oder begründeter Verzicht

einschließlich der Stellungnahme des Datenschutzbeauftragten

Art. 35 DSGVO, EDSA Rn. 58 lit. a und b

Trainingsprotokoll

eingesetzte Rechenleistung (lit. c), Trainingsverfahren und Einstellungen (lit. d); Zeitpunkt und Verantwortliche sind eigene Empfehlung, keine Normpflicht

Anhang IV Nr. 2 lit. c und d KI-VO

Anonymitätsbewertung

Trainingsdatenmenge im Verhältnis zur Parameterzahl, Messwerte zur Re-Identifikation, wer wann wie getestet hat, Ergebnisse

EDSA Rn. 58 lit. e

Testbericht

Prüfverfahren, Messwerte für Genauigkeit und Robustheit, diskriminierende Effekte, datiert und unterzeichnet

Anhang IV Nr. 2 lit. g KI-VO

Modellkarte für nachgelagerte Anbieter und Betreiber

Zweck, Grenzen, bekannte Fehler, was die menschliche Aufsicht leisten muss

EDSA Rn. 58 lit. f (deckt auch die Information der betroffenen Personen), Art. 13 und Art. 25 Abs. 2 KI-VO, Anhang IV Nr. 2 lit. e

Das „datiert und unterzeichnet“ beim Testbericht ist wörtlich so gemeint. Ein Testbericht, der nur als Ausgabe in einem Notebook existiert, erfüllt das nicht. Das ist eine Anforderung an Ihre Werkzeugkette, keine juristische Formalie, und sie lässt sich automatisieren.

6. Nach dem Lauf neu messen, nicht nur laufend überwachen

„Compliance laufend überwachen“ steht in jedem Ratgeber und bleibt meist unkonkret. Ein Punkt wird dabei regelmäßig übersehen: Fine-Tuning beschädigt die Sicherheitseigenschaften des Basismodells. Auch dann, wenn Ihre Trainingsdaten völlig harmlos sind.

Eine Forschergruppe hat das gemessen. Ein einziger Durchlauf, die vom Anbieter empfohlenen Einstellungen, ein gewöhnlicher Übungsdatensatz.

Modell und Datensatz

vorher

nachher

GPT-3.5 Turbo auf Alpaca

5,5 %

31,8 %

GPT-3.5 Turbo auf Dolly

4,5 %

23,9 %

Llama-2-7b-Chat auf Alpaca

0,3 %

16,1 %

Llama-2-7b-Chat auf Dolly

0,6 %

12,1 %

Was die Zahlen bedeuten: Das Modell bekam 330 bewusst schädliche Aufforderungen vorgelegt. Angegeben ist der Anteil, den es in vollem Umfang schädlich beantwortete. Bewertet hat das ein Prüfmodell auf einer Skala von eins bis fünf, gezählt wurde nur die höchste Stufe. Bei GPT-3.5 Turbo hat sich dieser Anteil fast versechsfacht.

Die Studie zeigt außerdem, dass vor allem eine zu hohe Lernrate und zu kleine Stapelgrößen das Ergebnis weiter verschlechtern. Damit wird die Wahl dieser Einstellungen zu einem Risiko, das ins Trainingsprotokoll aus Schritt 5 gehört.

Zwei Einschränkungen gehören dazu. Die getesteten Modelle stammen aus dem Jahr 2023 und sind überholt. Und die Autoren weisen selbst darauf hin, dass der betroffene Anbieter die Ergebnisse vorab bekam und nachgebessert haben könnte.

Es gibt neuere Arbeiten, die den Befund bestätigen, und mindestens eine, die ihn relativiert. Diese Folgearbeiten sind Vorabveröffentlichungen ohne geprüfte Begutachtung. Der Grundbefund ist trotzdem zu deutlich, um ihn als Messrauschen abzutun.

Praktisch heißt das: Messen Sie die Sicherheit nach jedem Trainingslauf neu. Übernehmen Sie sie nicht vom Basismodell. Wie ein belastbares Testset dafür entsteht, steht in unserem Evals-Leitfaden.

Fundstelle: Qi et al., „Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!“, ICLR 2024

Der Sonderfall: Ihr Lehrermodell ist eine Vertragsfrage

Dieser Punkt steht weder in der DSGVO noch in der KI-Verordnung, und er stoppt trotzdem Projekte.

Viele Teams lassen ihre Trainingsdaten von einem großen Modell erzeugen oder korrigieren. Das ist technisch naheliegend. Rechtlich landen Sie damit im Vertragsrecht, nicht im Aufsichtsrecht.

Anthropic, OpenAI und Google verbieten in ihren Nutzungsbedingungen, ihre Ausgaben zum Training konkurrierender Modelle zu verwenden. Das gilt auf jedem Bezugsweg, auch über Bedrock, Azure und Vertex. OpenAI erlaubt eine eng umrissene Ausnahme für Klassifikatoren und Embeddings, die Sie nicht an Dritte weitergeben.

Die Bedingungen von vier großen Anbietern, zehn europäischen Hostern und gut zwanzig offenen Modellen sind dafür im Volltext ausgewertet. Das Ergebnis samt Zitaten steht im Beitrag zu den Distillations-Klauseln der Teacher-Modelle. Klären Sie die Frage vor dem ersten Testlauf, nicht danach.

Was sich gerade ändert und bis Ende Oktober offen ist

Zwei Entwürfe des EDSA betreffen dieses Thema direkt: Leitlinien zur Anonymisierung, die die Stellungnahme 05/2014 der Artikel-29-Datenschutzgruppe ablösen sollen, und Leitlinien zum Sammeln von Daten aus dem Netz für generative KI.

Beide laufen bis zum 30. Oktober 2026 in öffentlicher Konsultation. Sie sind damit noch kein geltender Maßstab, und es wäre falsch, sie hier als solchen darzustellen. Zwei Punkte sind trotzdem heute schon planungsrelevant.

Die Anonymisierungs-Leitlinien folgen drei Kriterien: Lässt sich ein einzelner Datensatz herausgreifen? Lassen sich Datensätze miteinander verknüpfen? Lässt sich aus ihnen etwas über eine Person ableiten? Wer seine Anonymitätsbewertung aus Schritt 5 an diesen drei Fragen ausrichtet, arbeitet schon in die Richtung, in die sich der Maßstab bewegt.

Zum Sammeln aus dem Netz stellt der EDSA klar: Sensible Daten zu verarbeiten ist grundsätzlich verboten, und es braucht zweierlei: eine Rechtsgrundlage nach Art. 6 und zusätzlich eine Ausnahme nach Art. 9 Abs. 2. Wer Trainingsdaten aus öffentlichen Quellen ergänzen will, sollte die Konsultation abwarten oder sehr vorsichtig planen.

Fundstelle: EDSA, Leitlinien 02/2026 (Anonymisierung) und 03/2026 (Web-Scraping), angenommen am 07.07.2026, Mitteilung vom 08.07.2026

Ein drittes Ereignis gehört hierher, weil es in vielen Texten noch falsch steht. Die italienische Aufsichtsbehörde hatte gegen OpenAI ein Bußgeld über 15 Millionen Euro verhängt. Ein Gericht in Rom hat es am 18. März 2026 aufgehoben, Aktenzeichen 4153/2026. Ein freier Volltext des Urteils ist nicht auffindbar, die Urteilsgründe sind aber seit Juni 2026 veröffentlicht und in der italienischen Fachliteratur ausgewertet.

Der Grund war die Zuständigkeit. OpenAI hat seit dem 15. Februar 2024 eine Hauptniederlassung in Irland. Damit hätte das Verfahren über die irische Behörde laufen müssen, nicht über die italienische.

Das Gericht hat ausdrücklich nicht in der Sache entschieden. Die inhaltlichen Vorwürfe zur Rechtsgrundlage des Trainings sind damit offen, nicht erledigt. Wer den Fall als Präzedenzfall für Trainingsverstöße zitiert, zitiert ihn falsch.

Wie wir das mit Ihnen durchgehen

Die sechs Schritte sind so beschrieben, dass Ihr Team sie selbst gehen kann. Alle Fundstellen stehen in diesem Beitrag.

Wenn Sie es nicht selbst machen wollen: Wir trainieren und betreiben Modelle auf dedizierten GPUs in EU-Rechenzentren, ohne US-Hyperscaler in der Kette. Den Auftragsverarbeitungsvertrag schließen wir vor dem ersten Datensatz. Daten und Zwischenstände sind versioniert und mit Protokoll hinterlegt. Die Dokumentation ist den Pflichten aus DSGVO, KI-Verordnung und DORA zugeordnet.

Weights, Eval-Set und Dokumentation gehören Ihnen, Export jederzeit. Und kein Modell geht ohne Eval-Gate in den Betrieb.

Der erste Schritt ist ein Gespräch über Ihre Aufgabe und Ihren Datenbestand: 30 Minuten, Engineering ist dabei, kein Pitch. Wenn dabei herauskommt, dass Ihre Aufgabe ohne personenbezogene Daten lösbar ist, sagen wir das im Gespräch. Das ist dann auch der technisch einfachere Weg. Die rechtliche Bewertung Ihres Einzelfalls bleibt bei Ihrer Rechtsabteilung oder Ihrem Datenschutzbeauftragten, wir liefern dafür die Unterlagen. Termin vereinbaren.

Häufige Fragen

Brauche ich eine Einwilligung, um auf Kundendaten zu trainieren?

In der Regel nicht. Meist trägt das berechtigte Interesse, wenn Sie die dreistufige Prüfung dokumentiert bestehen. Eine Ausnahme gilt, wenn Sie die Daten ursprünglich mit Einwilligung erhoben haben. Dann ist der Weg über die Zweckänderung versperrt, und Sie brauchen eine neue Einwilligung.

Ist Fine-Tuning nach DSGVO erlaubt?

Ja, wenn eine Rechtsgrundlage trägt. Bei Bestandsdaten ist das meist das berechtigte Interesse zusammen mit der Zweckänderungsprüfung, beides schriftlich festgehalten. Dazu kommt die Frage, ob das fertige Modell noch Personenbezug trägt. Verboten ist Fine-Tuning nicht.

Werde ich durch Fine-Tuning zum Anbieter nach dem EU AI Act?

Nicht durch das Fine-Tuning als solches. Entscheidend ist, ob Sie den Zweck so ändern, dass ein Hochrisiko-System entsteht. Ein Extraktionsmodell für interne Dokumente tut das nicht. Ein Modell für die Vorauswahl von Bewerbungen sehr wohl. Der Rechenaufwand spielt keine Rolle.

Sind meine Modellgewichte personenbezogene Daten?

Möglicherweise. Eine pauschale Anonymität gibt es nicht, es braucht eine Prüfung im Einzelfall. Zwei Wege müssen praktisch ausgeschlossen sein: dass jemand die Daten direkt aus dem Modell zieht und dass das Modell sie in Antworten preisgibt. Interne Modelle werden dabei milder bewertet.

Was passiert bei einem Löschantrag nach dem Training?

Einzelne Gewichte lassen sich nicht löschen. Die Aufsicht kann anordnen, Teile des Datensatzes zu löschen, und im äußersten Fall den ganzen Datensatz oder das Modell selbst. Ein Neutraining ist das Gegenmittel, das Sie anbieten können; die Behörde berücksichtigt es bei der Verhältnismäßigkeit. Rechnen Sie damit, nicht mit einer chirurgischen Löschung.

Gelten die Hochrisiko-Pflichten seit dem 2. August 2026?

Nein, das ist seit dem Digital Omnibus überholt. Anhang III gilt ab dem 2. Dezember 2027, Anhang I ab dem 2. August 2028. Nicht verschoben wurde die Kennzeichnungspflicht: Sie gilt seit dem 2. August 2026, unabhängig von der Risikoklasse.

Darf ich GPT oder Claude nutzen, um Trainingsdaten zu erzeugen?

Für ein konkurrierendes Modell nicht. Anthropic, OpenAI und Google verbieten das vertraglich, auf jedem Bezugsweg. OpenAI erlaubt eine enge Ausnahme für Klassifikatoren und Embeddings, die Sie nicht weitergeben. Das ist eine Vertragsfrage, keine Datenschutzfrage, und sie gehört vor den ersten Testlauf.

Wie hoch ist das Bußgeldrisiko für ein mittelständisches Unternehmen?

Deutlich niedriger als die übliche Schlagzeile. Die 35 Millionen Euro gelten nur für verbotene Praktiken. Für alles andere sind es 15 Millionen oder 3 Prozent. Bei kleinen und mittleren Unternehmen gilt jeweils der niedrigere der beiden Werte, also der Prozentsatz vom eigenen Umsatz.

Quellen

Stand: 21. September 2026 · kontinent.ai. Alle Fundstellen wurden am 16. September 2026 abgerufen und am 21. September 2026 einzeln gegengeprüft. Randnummern beziehen sich auf die englische Fassung der EDSA-Stellungnahme 28/2024. Die EDSA-Entwürfe vom 07.07.2026 befinden sich bis zum 30.10.2026 in Konsultation und sind kein geltender Maßstab. Die Messwerte von Qi et al. stammen aus Tabelle 3 der ICLR-Fassung und beziehen sich auf Modellgenerationen des Jahres 2023. Vertragsklauseln der Modellanbieter wurden am 07.09.2026 im Volltext geprüft und ändern sich häufig. Der Autor ist kein Rechtsanwalt, und dieser Beitrag wurde nicht anwaltlich gegengelesen. Er ersetzt keine Rechtsberatung.

  • Border Shape
  • Border Shape