Datenschutz
DSGVO und KI auf Unternehmens daten: Datenschutz ist kein Zusatz modul.
DSGVO-konforme KI auf Unternehmensdaten entscheidet sich nicht in einer Erklärung am Projektende, sondern an einer einzelnen Stelle im Ablauf: dort, wo ein Abfrageergebnis Ihre Infrastruktur verlassen würde. Was an dieser Stelle passiert, steht auf dieser Seite – zusammen mit dem, was es ausdrücklich nicht leistet.
Die Ausgangslage
Einen allgemeinen Assistenten daraufzusetzen beantwortet die Frage nicht.
Ein Assistent, der mit den Rechten seines Anwenders auf Postfächer, Dateien und Datenbanken zugreift, sieht alles, was dieser Anwender sehen darf – und übermittelt davon an sein Modell, was für die Antwort gerade nützlich scheint. Für Adressdaten ist das meist unkritisch. Für eine Tabelle, in der neben dem Umsatz eine Diagnose, eine Konfession oder eine Gewerkschaftszugehörigkeit steht, ist es der Punkt, an dem eine Freigabe scheitert.
Das Problem liegt nicht in der Absicht des Werkzeugs, sondern in der fehlenden Unterscheidung: Ein allgemeiner Assistent weiß nicht, welches Feld in Ihrem Haus eine besondere Kategorie personenbezogener Daten ist. Er kann es nicht wissen, weil diese Information nicht in der Datenbank steht – sie steht in der fachlichen Beschreibung, die es meist noch nicht gibt.
Die Frage ist nicht, ob eine KI Ihre Daten sehen darf. Sie ist, welche Felder das Haus überhaupt verlassen.
Deshalb ist die Kennzeichnung der Felder hier keine Einstellung in einem Administrationsbereich, sondern Teil des semantischen Modells – desselben Artefakts, das der KI die Bedeutung Ihrer Daten erklärt. Ein Feld wird nicht geschützt, weil es zufällig „diagnose“ heißt, sondern weil Ihr Fachbereich es als schützenswert beschrieben hat.
Umgesetzt
Was vor der Übermittlung aus einem Ergebnis entfernt wird.
Die Filterung läuft in Ihrem Netz, nicht beim Modellanbieter: Die Datenbank liefert das vollständige Ergebnis an die Vermittlungsschicht bei Ihnen, und erst danach wird gefiltert. Was dabei entfernt wird, hat das Unternehmen nicht verlassen – es wurde nicht nachträglich gelöscht, sondern nie übermittelt.
Kennzeichnung auf Feldebene
Besondere Kategorien nach Artikel 9 – Gesundheit, Religion, Weltanschauung, Gewerkschaftszugehörigkeit, Herkunft, politische Meinung, Sexualleben, biometrische Merkmale – sind im semantischen Modell als solche gekennzeichnet und werden aus ausgehenden Ergebnissen entfernt. Direkte Identifikatoren gehen nicht mit, wenn die Frage sie nicht verlangt hat; eine Summe braucht keinen Namen.
Auch die Bezeichnung, nicht nur der Wert
Bei einem als schützenswert gekennzeichneten Konzept wird zusätzlich sein Name maskiert. Eine Spalte „diagnose_code“ verrät die Kategorie schon in der Beschriftung – ein Filter, der nur Werte entfernt und Spaltennamen stehen lässt, übermittelt die Information trotzdem.
Freitext ist ausgeschlossen, nicht gefiltert
Notizen, Bemerkungen und Kommentare enthalten regelmäßig Inhalte, die dort niemand erwartet. Sie sind deshalb von Beginn an ausgeschlossen und werden nur dort freigegeben, wo Ihr Fachbereich das ausdrücklich entscheidet. Der Unterschied ist wesentlich: Ausschluss ist eine Regel, Erkennung im Freitext wäre eine Schätzung.
Gruppenschutz bei Aggregaten
Auch eine Summe kann eine Person zeigen, wenn die Gruppe klein genug ist. Für Auswertungen über besonders geschützte Merkmale gilt deshalb eine Mindestgruppengröße; maßgeblich ist die Menge, über die gerechnet wird, nicht die Form der Abfrage.
Die Liste der gekennzeichneten Felder ist Teil des semantischen Modells und damit lesbar und prüfbar. Sie ist eine Entscheidung Ihres Hauses, die im Protokoll festgehalten wird – keine Voreinstellung eines Anbieters.
Der Rahmen
Eine technische Maßnahme ist keine Rechtsauskunft.
Was hier beschrieben ist, sind technische Maßnahmen zur Datenminimierung. Sie ersetzen keine Rechtsgrundlage, keine Einwilligung, kein Verarbeitungsverzeichnis und keine Datenschutz-Folgenabschätzung – und diese Seite behauptet nicht, dass ein Einsatz mit ihnen automatisch rechtmäßig ist.
Was sie leisten, ist die Grundlage, auf der Ihr Datenschutzbeauftragter überhaupt bewerten kann: Er sieht, welche Felder gekennzeichnet sind, welche das Haus verlassen und was protokolliert wird. Die Bewertung selbst bleibt seine – und sie fällt leichter mit einer Aufstellung als mit einer Zusicherung.
Was ein Modellanbieter mit übermittelten Inhalten tun darf, regelt dessen Vertrag und nicht diese Seite. Dieser Punkt wird vor der Einführung geprüft und festgelegt, nicht vorausgesetzt.
Grenzen
Wo diese Maßnahmen heute aufhören.
Diese Angaben stehen hier, weil sie in einer Prüfung ohnehin auffallen – und weil eine Seite, die sie verschweigt, im ersten Sicherheitsgespräch widerlegt wird.
Freigegebener Freitext bleibt eine Abwägung
Wird ein Freitextfeld bewusst freigegeben, arbeitet die Prüfung auf Mustern und nicht auf Bedeutung: Nicht jede Formulierung, mit der jemand etwas Sensibles in eine Bemerkung schreibt, lässt sich erkennen. Deshalb ist der Ausschluss die Voreinstellung und die Freigabe eine bewusste, dokumentierte Entscheidung.
Der Gruppenschutz ist erprobt, aber nicht am laufenden Bestand belegt
Die Schranke bei gruppierten Abfragen und die Messung der Grundgesamtheit bei ungruppierten sind gebaut und durch Regressionstests auf synthetischen Beständen abgesichert. Der Nachweis am laufenden Kundenbestand über beide Zugänge steht aus – solange er fehlt, ist sie eine erprobte Maßnahme und keine Zusage für Ihren Bestand.
Die Protokollspur zeigt, was lief – nicht immer, wer entschied
Frage, geprüfter Plan und ausgeführte Abfrage werden protokolliert. Zwischen der Entscheidung eines Menschen und der eines KI-Agenten unterscheidet die Spur im aktuellen Stand nicht; beide erscheinen unter derselben Kennung. Für eine Zurechnung nach Person ist das heute zu wenig, und das ist so benannt.
Gekennzeichnet heißt nicht vollständig gekennzeichnet
Erkannt wird, dass ein Feld als schützenswert beschrieben ist. Nicht erkannt wird, dass ein Feld es hätte sein müssen und niemand es angegeben hat. Dagegen hilft keine Technik, sondern dass die Kennzeichnung lesbar ist und Ihr Fachbereich sie einmal gründlich durchgeht.
Betrieb
Wo die Verarbeitung stattfindet.
„Self-hosted“ und „EU-Datenresidenz“ sind zwei verschiedene Fragen, und sie werden regelmäßig als eine gestellt. Deshalb stehen sie hier getrennt.
- In Ihrer Infrastruktur
- Semantisches Modell, Prüfschicht, Datenbankzugang, Privacy Layer und Protokoll. Umgesetzt und für den Betrieb im eigenen Netz ausgelegt; Ihr Datenbestand wird dabei nicht kopiert.
- Beim Modellanbieter
- Das Sprachmodell für das Reasoning, solange es extern angebunden ist. Ein vollständig lokal betriebenes Modell ist in Arbeit und heute nicht Teil des Leistungsstands.
- EU-Datenresidenz
- Wird je Projekt über den Modellanbieter geklärt und hier nicht zugesagt. Was für Ihren Fall möglich ist, gehört in die technische Sichtung – ein Häkchen auf einer Website wäre an dieser Stelle die unehrlichere Antwort.
- Ohne externes Modell
- In der eigenen Oberfläche gehen keine Abfrageergebnisse an ein Sprachmodell. Umgesetzt – und der Weg, wenn Ergebnisse das Haus grundsätzlich nicht verlassen sollen.
Rollen, Rechte, Protokoll
Wer was sehen darf, und woran man es nachträglich sieht.
Die eigentliche Stellschraube ist nicht der Filter, sondern das Recht: Was eine Rolle nicht sehen darf, wird nicht abgefragt – und geht damit auch nicht an ein Modell.
Rechte werden bei Ihnen geprüft
Die Rollenprüfung findet in der Prüfschicht in Ihrem Netz statt, nicht im Modell und nicht beim Anbieter. Sie liegt damit in Ihrer Hand und ist von außen nicht beeinflussbar.
Rechte sind kein Schutz gegen berechtigte Neugier
Wer etwas sehen darf, sieht es auch dann, wenn er über einen Umweg danach fragt. Das ist keine Lücke des Systems, sondern die Eigenschaft von Rechten – und der Grund, warum der Rollenschnitt vor der Einführung besprochen wird.
Protokolle liegen bei Ihnen
Wer wann was gefragt hat und welche Abfrage lief, steht in Ihrer Infrastruktur. Für eine Prüfung ist das der Unterschied zwischen einem Nachweis und einer Anfrage beim Anbieter.
Umfang und Aufbewahrung werden festgelegt
Der Protokollumfang der Pilotphase ist bewusst weit gefasst – er dient der fachlichen Validierung der Antworten. Was protokolliert wird, wo es liegt und wie lange, wird pro Projekt festgelegt, bevor das System an echten Daten arbeitet.
Häufige Fragen
Fehlt Ihnen eine Frage? Ausführliche Antworten zu Betrieb und Datenzugriff stehen auf der Sicherheitsseite.
- Ist ein Einsatz mit diesen Maßnahmen automatisch DSGVO-konform?
Nein, und das wäre auch von keinem Produkt zu leisten. Rechtmäßig wird eine Verarbeitung durch eine Rechtsgrundlage, einen festgelegten Zweck, die Information der Betroffenen und die Dokumentation – nicht durch einen Filter.
Was die hier beschriebenen Maßnahmen beitragen, ist die Datenminimierung als technische Maßnahme und die Prüfbarkeit: Ihr Datenschutzbeauftragter kann lesen, welche Felder gekennzeichnet sind und was übermittelt wird. Diese Unterlage ist der Beitrag; die Bewertung bleibt bei Ihnen.
- Brauchen wir dafür eine Datenschutz-Folgenabschätzung?
Das hängt an Ihrer Verarbeitung und nicht an diesem Werkzeug – und die Einschätzung dazu trifft Ihr Datenschutzbeauftragter, nicht ein Anbieter. Sobald besondere Kategorien personenbezogener Daten im Spiel sind, wird die Frage in der Praxis regelmäßig bejaht.
Was wir dafür beisteuern, sind die technischen Angaben, die eine solche Abschätzung braucht: welche Komponenten wo laufen, welche Felder gekennzeichnet sind, was das Haus verlässt, was protokolliert wird – und die benannten Grenzen. Diese Angaben gehören in die technische Sichtung und nicht auf eine Website.
- Gilt das auch für Beschäftigtendaten und den Betriebsrat?
Technisch gilt die Kennzeichnung für jedes Feld, unabhängig davon, ob es Kunden oder Beschäftigte betrifft – eine Gewerkschaftszugehörigkeit ist eine besondere Kategorie, und der Gruppenschutz bei Auswertungen über kleine Abteilungen ist genau der Fall, für den die Mindestgruppengröße gedacht ist.
Mitbestimmungsrechtlich ist das eine eigene Frage, und sie wird nicht durch Technik entschieden. Eine Auswertung über Beschäftigte ist erfahrungsgemäß der Punkt, an dem ein Pilotprojekt eine Beteiligung braucht – besser vorher besprochen als nachträglich erklärt.
- Können wir nachweisen, was gefiltert wurde?
Die Kennzeichnung der Felder ist Teil des semantischen Modells und damit lesbar – Sie können jederzeit zeigen, welche Felder als schützenswert beschrieben sind und wer das entschieden hat. Änderungen daran werden im Protokoll festgehalten.
Für den einzelnen Abfragevorgang stehen Frage, geprüfter Plan und ausgeführte Abfrage im Protokoll. Die Grenze dieser Spur ist oben benannt: Sie belegt, was lief – nicht in jedem Fall, wer es angestoßen hat.
- Was regelt der Auftragsverarbeitungsvertrag?
Für den Betrieb in Ihrer Infrastruktur ist zu klären, welche Leistungen mit Zugriff auf personenbezogene Daten verbunden sind – Einrichtung, Pflege des semantischen Modells, Unterstützung im Fehlerfall. Diese werden vertraglich geregelt, bevor das System an echten Daten arbeitet.
Der zweite Vertrag ist der mit dem Modellanbieter, wenn ein externes Modell angebunden wird. Was dort mit übermittelten Inhalten geschieht, steht in seinen Bedingungen; wir prüfen sie im Projekt mit Ihnen, statt hier eine Aussage über einen Dritten zu treffen.
Verwandte Themen
Angrenzende Fragen, jeweils auf einer eigenen Seite beantwortet.
Privacy Layer
Was aus einem Abfrageergebnis entfernt wird, bevor es ein externes Modell sieht – und was der Filter nicht leistet.
k-Anonymität bei Aggregaten
Wann eine Summe über besonders geschützte Daten anonym ist – und wann ihre Differenz eine Einzelperson zeigt.
Self-hosted KI für Unternehmens daten
Welche Komponente wo läuft – und welcher Teil heute noch extern ist.
Sicherer KI-Datenbank zugriff
Warum das Sprachmodell keine Zugangsdaten erhält und die Grenze in der Architektur liegt.
Der schnellste Weg zu einer Einschätzung ist ein Feld aus Ihrem Haus, bei dem Sie sich unsicher sind. Daran lässt sich konkret zeigen, was gekennzeichnet würde und was hinausgeht.