Abgelegt unter — EU AI Act · Article 10 · Data Governance · High-Risk AI · Compliance
Diese Quelle bei Google bevorzugen →Artikel 10 der EU-KI-Verordnung: die Anforderungen an die Daten-Governance
Artikel 10 schreibt für Hochrisiko-KI die Governance von Trainings-, Validierungs- und Testdaten vor. Erfahren Sie, welche Dokumentation Sie brauchen und wie Sie die Konformität vor Dezember 2027 nachweisen.
Aktualisiert am 2. Oktober 2026 — Korrektur. Frühere Fassungen nannten die falschen Absätze des Artikels 10, behaupteten, die Verordnung verlange, Testdaten getrennt von Trainingsdaten zu halten, und erklärten, bereits im Produktivbetrieb befindliche Systeme müssten die Anforderungen bis zum 2. Dezember 2027 erfüllen. Der Leitfaden nennt nun Artikel 10 Absatz 2 für Governance und Prüfung auf Verzerrungen sowie Artikel 10 Absatz 3 für die Datenqualität und folgt für bereits in Verkehr gebrachte Systeme Artikel 111 Absatz 2 in der durch den Digital Omnibus geänderten Fassung.
Aktualisiert am 31. Juli 2026 — Frist geändert. Der Digital Omnibus (angenommen vom Europäischen Parlament am 16. Juni 2026 und vom Rat am 29. Juni 2026) hat die Hochrisiko-Pflichten aus Anhang III vom 2. August 2026 auf den 2. Dezember 2027 verschoben. Die Transparenzpflichten des Artikels 50 wurden nicht verschoben und gelten weiterhin ab dem 2. August 2026. Dieser Artikel wurde entsprechend korrigiert. Ist Ihr KI-System nach der EU-KI-Verordnung als hochriskant eingestuft, ist Artikel 10 nicht verhandelbar. Er schreibt konkrete Praktiken der Daten-Governance für Trainings-, Validierungs- und Testdatensätze vor — und diese Pflichten gelten ab dem 2. Dezember 2027. Der gesetzliche Höchstbetrag liegt bei 15 Millionen Euro oder 3 % des weltweiten Jahresumsatzes, je nachdem, welcher Betrag höher ist — bei KMU der jeweils niedrigere.
Die meisten Teams gehen davon aus, dass „wir haben eine Datenherkunft“ gleichbedeutend mit Konformität sei. Das ist es nicht. Artikel 10 verlangt dokumentierte Entwurfsentscheidungen, Schritte zur Minderung von Verzerrungen und die statistischen Eigenschaften jedes Datensatzes, mit dem ein Hochrisikosystem trainiert oder validiert wird.
Dieser Leitfaden zeigt, was Artikel 10 tatsächlich verlangt, für welche Systeme er gilt und wie Sie die Konformität vor Ablauf der Frist dokumentieren.
Was Artikel 10 verlangt
Artikel 10 gilt für Hochrisiko-KI-Systeme nach Anhang III (etwa Werkzeuge zur Bewerbervorauswahl, Kreditscoring, biometrische Identifizierung, Verwaltung kritischer Infrastruktur) sowie für jene, die über Anhang I als hochriskant eingestuft sind. Er schreibt vor, dass Trainings-, Validierungs- und Testdaten bestimmte Qualitätskriterien erfüllen (Verordnung (EU) 2024/1689, Artikel 10):
| Anforderung | Was das bedeutet | Erforderliche Dokumentation |
|---|---|---|
| Relevant, hinreichend repräsentativ, fehlerfrei und vollständig — die letzten beiden „so weit wie möglich“ (Artikel 10 Absatz 3) | Die Daten müssen den realen Anwendungsfall ohne systematische Lücken abbilden | Bericht zur Zusammensetzung des Datensatzes mit demografischer und geografischer Abdeckung |
| Geeignete statistische Eigenschaften (Artikel 10 Absatz 3) | Die Daten müssen für die Aufgabe hinreichenden Umfang, hinreichende Varianz und Ausgewogenheit aufweisen | Statistische Übersicht: Stichprobengröße, Klassenverteilung, Varianzkennzahlen |
| Prüfung auf Verzerrungen (Artikel 10 Absatz 2 Buchstaben f und g) | Sie müssen aktiv nach Verzerrungen suchen und sie dokumentieren, wenn sie zu diskriminierenden Ergebnissen führen können | Prüfbericht zu Verzerrungen mit Minderungsschritten (etwa erneutes Stichprobenziehen, Fairnessbedingungen) |
| Daten-Governance und -Management (Artikel 10 Absatz 2) | Formale Prozesse für Erhebung, Kennzeichnung, Speicherung und Versionierung von Daten | Dokument zur Daten-Governance-Richtlinie + Prüfpfad der Datensatzversionen |
Artikel 10 schreibt keine bestimmten statistischen Tests oder Verzerrungskennzahlen vor. Das ist Absicht — die Verordnung ist technologieneutral. Sie verlangt aber, dass Sie Ihre Entscheidungen dokumentieren und erläutern, warum sie zum Risikoprofil Ihres Systems passen.
Für wen Artikel 10 gilt
Die Pflichten aus Artikel 10 treffen die Anbieter von Hochrisiko-KI-Systemen — also die Stelle, die das System entwickelt oder entwickeln lässt und unter ihrem Namen oder ihrer Marke auf dem EU-Markt in Verkehr bringt.
Sind Sie Betreiber (eine Organisation, die ein von anderen entwickeltes Hochrisikosystem einsetzt), liegt die Erfüllung des Artikels 10 beim Anbieter. Ihre eigene Pflicht ist enger: Soweit die Eingabedaten Ihrer Kontrolle unterliegen, müssen Sie dafür sorgen, dass sie im Hinblick auf die Zweckbestimmung des Systems relevant und hinreichend repräsentativ sind (Artikel 26 Absatz 4). Es lohnt sich dennoch, vom Anbieter Nachweise über seine Arbeit nach Artikel 10 zu verlangen — besonders in einem regulierten Sektor (Finanzwesen, Gesundheit, öffentliche Dienste).
Sind Sie ein Start-up oder Scale-up, das eigene KI baut, sind Sie der Anbieter. Artikel 10 gilt in vollem Umfang.
Die fünf Daten-Governance-Praktiken, die Artikel 10 verlangt
1. Entwurfsentscheidungen zum Datensatz müssen dokumentiert sein
Warum haben Sie diesen Datensatz gewählt? Welche reale Population oder Situation bildet er ab? Welche Grenzen sind bekannt?
Beispiel: Bauen Sie ein KI-gestütztes Werkzeug zur Vorauswahl von Lebensläufen (Anhang III, Kategorie 4), müssen Ihre Trainingsdaten die Bewerberpopulation abbilden, der Sie tatsächlich begegnen. Besteht Ihr Datensatz zu 80 % aus Lebensläufen von Männern aus Technikberufen und setzen Sie das System zur Vorauswahl von Bewerbungen im Gesundheitswesen ein, scheint der Datensatz Artikel 10 Absätze 3 und 4 nicht zu erfüllen, die Daten verlangen, die hinreichend repräsentativ sind und die Rahmenbedingungen berücksichtigen, unter denen das System bestimmungsgemäß verwendet werden soll.
Was zu dokumentieren ist:
- Quelle und Erhebungsmethodik des Datensatzes
- Geografische, demografische und fachliche Abdeckung
- Bekannte Lücken oder unterrepräsentierte Gruppen
- Begründung der Datensatzauswahl
2. Die statistischen Eigenschaften müssen geeignet sein
„Geeignet“ heißt: ausreichend für Risikohöhe und Komplexität der Aufgabe. Ein hochriskantes Kreditscoring-Modell braucht eine strengere statistische Validierung als ein risikoarmer Empfehlungsdienst für Inhalte.
Was zu dokumentieren ist:
- Stichprobengröße und wie sie bestimmt wurde
- Klassenverteilung (etwa 60 % bewilligte Kredite, 40 % abgelehnte)
- Varianz- und Korrelationsanalyse der Merkmale
- Aufteilungsverhältnisse und -methodik für Training, Validierung und Test
Ist Ihr Datensatz unausgewogen (etwa 95 % negative Klasse), dokumentieren Sie, warum das die Realität abbildet, und welche Schritte Sie unternommen haben, damit das Modell die Minderheitsklasse nicht ignoriert (etwa geschichtete Stichproben, Klassengewichtung, SMOTE).
3. Die Prüfung auf Verzerrungen ist verpflichtend
Artikel 10 Absatz 2 Buchstabe f verlangt ausdrücklich „eine Untersuchung im Hinblick auf mögliche Verzerrungen (Bias)“ der Datensätze, die die Gesundheit und Sicherheit beeinträchtigen, sich negativ auf die Grundrechte auswirken oder zu einer nach dem Unionsrecht verbotenen Diskriminierung führen können (etwa aufgrund von ethnischer Herkunft, Geschlecht, Alter oder Behinderung). Artikel 10 Absatz 2 Buchstabe g verlangt sodann geeignete Maßnahmen, um die festgestellten Verzerrungen zu erkennen, zu verhindern und abzuschwächen.
Das ist nicht optional. Sie müssen aktiv nach Verzerrungen suchen, Ihre Befunde dokumentieren und Ihre Minderungsstrategie erläutern.
Praktische Schritte:
- Zerlegen Sie Ihren Datensatz nach geschützten Merkmalen (soweit vorhanden) und messen Sie Leistungsunterschiede
- Nutzen Sie Fairnesskennzahlen (etwa demografische Parität, ausgeglichene Fehlerquoten, Kalibrierung), die zu Ihrem Anwendungsfall passen
- Dokumentieren Sie festgestellte Unterschiede und die ergriffenen Abhilfemaßnahmen (etwa Neuausbalancierung, Fairnessbedingungen, Nachbearbeitung)
- Fehlen geschützte Merkmale in Ihrem Datensatz, dokumentieren Sie eine Analyse über Stellvertretermerkmale (etwa Postleitzahl als Stellvertreter für ethnische Herkunft in US-Kreditdaten)
- Erfordert das Erkennen und Korrigieren von Verzerrungen besondere Kategorien personenbezogener Daten (etwa zur ethnischen Herkunft oder zur Gesundheit), erlaubt die Verordnung deren Verarbeitung nur ausnahmsweise, soweit unbedingt erforderlich und unter strengen Bedingungen. Diese Regel stand in Artikel 10 Absatz 5; seit dem Digital Omnibus ist es Artikel 4a Absatz 1 (Verordnung (EU) 2026/1744)
Beispiel: Eine mit historischen Daten trainierte Einstellungs-KI kann lernen, dass „Lücken im Lebenslauf“ mit Ablehnung korrelieren — haben Frauen wegen Elternzeit häufiger solche Lücken, kodiert das Modell eine Geschlechterverzerrung. Artikel 10 verlangt, dies zu erkennen und zu mindern.
4. Daten-Governance-Prozesse müssen formalisiert sein
Artikel 10 Absatz 2 verlangt „Daten-Governance- und Datenverwaltungsverfahren“, die für die Zweckbestimmung des Systems geeignet sind — keine guten Absichten, sondern dokumentierte Prozesse. Er zählt auf, was sie abdecken müssen, von Entwurfsentscheidungen, Datenerhebung und Datenaufbereitung bis zur Ermittlung von Datenlücken.
Mindestdokumentation:
- Richtlinie zur Datenerhebung (wer darf unter welchen Bedingungen Daten hinzufügen)
- Kennzeichnungsvorgaben und Qualitätssicherung (Übereinstimmungswerte zwischen Annotierenden, Prüfungen der Kennzeichnungen)
- Datenversionierung und -herkunft (welche Modellversion wurde mit welcher Datensatzversion trainiert)
- Zugriffskontrollen und Prüfprotokolle (wer hat wann und warum auf Trainingsdaten zugegriffen)
Trainieren Sie Ihr Modell mit neuen Daten nach, müssen Sie die Analyse nach Artikel 10 für den aktualisierten Datensatz wiederholen. Einmalige Konformität genügt nicht.
5. Testdaten müssen repräsentativ sein — und sollten unabhängig sein
Die Qualitätskriterien des Artikels 10 Absatz 3 — relevant, hinreichend repräsentativ und so weit wie möglich fehlerfrei und vollständig — gelten für Testdatensätze ebenso wie für Trainings- und Validierungsdatensätze. Für ein System, das nicht mit Daten trainiert wird, wendet Artikel 10 Absatz 6 die Datenanforderungen nur auf die Testdatensätze an.
Artikel 10 selbst verlangt nicht, Testdaten getrennt von Trainingsdaten zu halten. Die Verordnung definiert Testdaten jedoch als Daten, die für eine „unabhängige Bewertung“ des Systems vor seinem Inverkehrbringen verwendet werden (Artikel 3 Nummer 32). Ein Modell, das mit den Daten bewertet wird, mit denen es trainiert wurde, hat diese unabhängige Bewertung nicht erhalten; beide getrennt zu halten, ist daher sowohl grundlegende ML-Hygiene als auch die Lesart, die die Definition stützt.
Was zu dokumentieren ist:
- Wie Sie die Unabhängigkeit der Testdaten sichergestellt haben (etwa zeitliche Trennung, geschichtete Rückhaltestichprobe)
- Warum Ihr Testdatensatz die realen Einsatzbedingungen abbildet
- Testergebnisse aufgeschlüsselt nach Untergruppen (um ungleiche Auswirkungen zu erkennen)
Häufige Konformitätslücken bei Artikel 10
Die meisten Teams, die Hochrisiko-KI bauen, haben einige Praktiken der Daten-Governance. Nur wenige haben die Dokumentation, die Artikel 10 verlangt. Das sind die häufigsten Lücken:
- Keine Dokumentation der Verzerrungsprüfung — Teams berechnen Fairnesskennzahlen, dokumentieren aber weder Befunde noch Minderungsschritte
- Keine Begründung des Datensatzentwurfs — Teams nutzen „die Daten, die da waren“, ohne zu dokumentieren, warum sie geeignet sind
- Keine Versionierung oder Herkunft — Teams trainieren Modelle nach, können aber nicht nachvollziehen, welche Datensatzversion welche Modellversion hervorgebracht hat
- Keine statistische Begründung — Teams dokumentieren nicht, warum Stichprobengröße, Klassenbalance oder Merkmalssatz für die Risikohöhe ausreichen
- Keine formale Governance-Richtlinie — Datenpraktiken bestehen informell, sind aber weder schriftlich festgehalten noch prüfbar
So dokumentieren Sie die Konformität mit Artikel 10
Die Konformität mit Artikel 10 wird über die technische Dokumentation (gefordert nach Artikel 11, mit den in Anhang IV Nummer 2 Buchstabe d aufgeführten Datenblättern) nachgewiesen. Mindestens benötigen Sie:
-
Ein Datensatz-Spezifikationsdokument — für jeden Datensatz (Training, Validierung, Test):
- Quelle, Erhebungsdatum und Methodik
- Umfang, Struktur und statistische Eigenschaften
- Bekannte Grenzen und Lücken
- Ergebnisse der Verzerrungsprüfung und Minderungsschritte
-
Eine Daten-Governance-Richtlinie — organisationsweit:
- Standards für Erhebung und Kennzeichnung von Daten
- Verfolgung von Versionen und Herkunft
- Zugriffskontrollen und Prüfverfahren
- Auslöser für Nachtraining und Neubewertung
-
Eine Modellkarte oder technische Dokumentation — je Modell:
- Welche Datensätze verwendet wurden (mit Versions-Hashes)
- Warum diese Datensätze für den Anwendungsfall geeignet sind
- Testergebnisse insgesamt und nach Untergruppen
- Restrisiken und Überwachungsplan
Diese Dokumente müssen über den gesamten Lebenszyklus des Systems gepflegt und aktualisiert werden. Trainieren Sie nach, aktualisieren Sie die Dokumentation. Entdecken Sie eine neue Verzerrung, dokumentieren Sie sie und Ihre Reaktion darauf.
Artikel 10 und die Frist im Dezember 2027
Die Pflichten aus Artikel 10 gelten für Hochrisiko-KI-Systeme nach Anhang III ab dem 2. Dezember 2027 und für jene, die über Anhang I als hochriskant eingestuft sind, ab dem 2. August 2028.
Ein System, das vor diesem Datum in Verkehr gebracht oder in Betrieb genommen wurde, unterliegt den Hochrisiko-Anforderungen nicht, es sei denn, sein Design wird ab diesem Datum erheblich verändert (Artikel 111 Absatz 2 in der durch den Digital Omnibus ersetzten Fassung). Eine erhebliche Designänderung zieht Artikel 10 nach sich. Ausgenommen sind Systeme, die bestimmungsgemäß von Behörden verwendet werden sollen: Ihre Anbieter und Betreiber müssen die Anforderungen bis zu einer gesonderten, in Artikel 111 Absatz 2 festgelegten Frist erfüllen, unabhängig davon, ob sich das Design ändert.
Bringen Sie nach dem 2. Dezember 2027 ein neues Hochrisikosystem auf den Markt, ist die Konformität mit Artikel 10 vor dem Inverkehrbringen erforderlich.
Maßgeblich ist der 2. Dezember 2027. Der gesetzliche Höchstbetrag bei Verstößen gegen die Pflichten von Akteuren im Hochrisikobereich liegt nach Artikel 99 Absatz 4 bei 15 Millionen Euro oder 3 % des weltweiten Umsatzes — bei KMU der jeweils niedrigere Betrag. Die Stufe von 35 Millionen Euro / 7 % nach Artikel 99 Absatz 3 gilt nur für die verbotenen Praktiken des Artikels 5, was etwas völlig anderes ist.
Dieser Artikel dient ausschließlich der Information und stellt keine Rechtsberatung dar. Für auf Ihr System zugeschnittene Konformitätsauskünfte wenden Sie sich an eine im Recht der EU-KI-Verordnung qualifizierte Anwältin oder einen qualifizierten Anwalt.
Verwandte Depeschen