← Nowl

Datenschutz

DSGVO und KI auf Unternehmensdaten: Datenschutz ist kein Zusatzmodul.

DSGVO-konforme KI auf Unternehmensdaten entscheidet sich nicht in einer Erklärung am Projektende, sondern an einer einzelnen Stelle im Ablauf: dort, wo ein Abfrageergebnis Ihre Infrastruktur verlassen würde. Was an dieser Stelle passiert, steht auf dieser Seite – zusammen mit dem, was es ausdrücklich nicht leistet.

Filterung vor der ÜbermittlungKennzeichnung im FachmodellGrenzen benannt
Frage
Prüfung gegen Modell & Rollenrechte
Lesende Datenbankabfrage, erzeugt vom System
Antwort mit Herleitung

Die Ausgangslage

Einen allgemeinen Assistenten daraufzusetzen beantwortet die Frage nicht.

Ein Assistent, der mit den Rechten seines Anwenders auf Postfächer, Dateien und Datenbanken zugreift, sieht alles, was dieser Anwender sehen darf – und übermittelt davon an sein Modell, was für die Antwort gerade nützlich scheint. Für Adressdaten ist das meist unkritisch. Für eine Tabelle, in der neben dem Umsatz eine Diagnose, eine Konfession oder eine Gewerkschaftszugehörigkeit steht, ist es der Punkt, an dem eine Freigabe scheitert.

Das Problem liegt nicht in der Absicht des Werkzeugs, sondern in der fehlenden Unterscheidung: Ein allgemeiner Assistent weiß nicht, welches Feld in Ihrem Haus eine besondere Kategorie personenbezogener Daten ist. Er kann es nicht wissen, weil diese Information nicht in der Datenbank steht – sie steht in der fachlichen Beschreibung, die es meist noch nicht gibt.

Die Frage ist nicht, ob eine KI Ihre Daten sehen darf. Sie ist, welche Felder das Haus überhaupt verlassen.

Deshalb ist die Kennzeichnung der Felder hier keine Einstellung in einem Administrationsbereich, sondern Teil des semantischen Modells – desselben Artefakts, das der KI die Bedeutung Ihrer Daten erklärt. Ein Feld wird nicht geschützt, weil es zufällig „diagnose“ heißt, sondern weil Ihr Fachbereich es als schützenswert beschrieben hat.

Umgesetzt

Was vor der Übermittlung aus einem Ergebnis entfernt wird.

Die Filterung läuft in Ihrem Netz, nicht beim Modellanbieter: Die Datenbank liefert das vollständige Ergebnis an die Vermittlungsschicht bei Ihnen, und erst danach wird gefiltert. Was dabei entfernt wird, hat das Unternehmen nicht verlassen – es wurde nicht nachträglich gelöscht, sondern nie übermittelt.

  • Kennzeichnung auf Feldebene

    Besondere Kategorien nach Artikel 9 – Gesundheit, Religion, Weltanschauung, Gewerkschaftszugehörigkeit, Herkunft, politische Meinung, Sexualleben, biometrische Merkmale – sind im semantischen Modell als solche gekennzeichnet und werden aus ausgehenden Ergebnissen entfernt. Direkte Identifikatoren gehen nicht mit, wenn die Frage sie nicht verlangt hat; eine Summe braucht keinen Namen.

  • Auch die Bezeichnung, nicht nur der Wert

    Bei einem als schützenswert gekennzeichneten Konzept wird zusätzlich sein Name maskiert. Eine Spalte „diagnose_code“ verrät die Kategorie schon in der Beschriftung – ein Filter, der nur Werte entfernt und Spaltennamen stehen lässt, übermittelt die Information trotzdem.

  • Freitext ist ausgeschlossen, nicht gefiltert

    Notizen, Bemerkungen und Kommentare enthalten regelmäßig Inhalte, die dort niemand erwartet. Sie sind deshalb von Beginn an ausgeschlossen und werden nur dort freigegeben, wo Ihr Fachbereich das ausdrücklich entscheidet. Der Unterschied ist wesentlich: Ausschluss ist eine Regel, Erkennung im Freitext wäre eine Schätzung.

  • Gruppenschutz bei Aggregaten

    Auch eine Summe kann eine Person zeigen, wenn die Gruppe klein genug ist. Für Auswertungen über besonders geschützte Merkmale gilt deshalb eine Mindestgruppengröße; maßgeblich ist die Menge, über die gerechnet wird, nicht die Form der Abfrage.

Die Liste der gekennzeichneten Felder ist Teil des semantischen Modells und damit lesbar und prüfbar. Sie ist eine Entscheidung Ihres Hauses, die im Protokoll festgehalten wird – keine Voreinstellung eines Anbieters.

Der Rahmen

Eine technische Maßnahme ist keine Rechtsauskunft.

Was hier beschrieben ist, sind technische Maßnahmen zur Datenminimierung. Sie ersetzen keine Rechtsgrundlage, keine Einwilligung, kein Verarbeitungsverzeichnis und keine Datenschutz-Folgenabschätzung – und diese Seite behauptet nicht, dass ein Einsatz mit ihnen automatisch rechtmäßig ist.

Was sie leisten, ist die Grundlage, auf der Ihr Datenschutzbeauftragter überhaupt bewerten kann: Er sieht, welche Felder gekennzeichnet sind, welche das Haus verlassen und was protokolliert wird. Die Bewertung selbst bleibt seine – und sie fällt leichter mit einer Aufstellung als mit einer Zusicherung.

Was ein Modellanbieter mit übermittelten Inhalten tun darf, regelt dessen Vertrag und nicht diese Seite. Dieser Punkt wird vor der Einführung geprüft und festgelegt, nicht vorausgesetzt.

Privacy Layer im Detail

Grenzen

Wo diese Maßnahmen heute aufhören.

Diese Angaben stehen hier, weil sie in einer Prüfung ohnehin auffallen – und weil eine Seite, die sie verschweigt, im ersten Sicherheitsgespräch widerlegt wird.

  • Freigegebener Freitext bleibt eine Abwägung

    Wird ein Freitextfeld bewusst freigegeben, arbeitet die Prüfung auf Mustern und nicht auf Bedeutung: Nicht jede Formulierung, mit der jemand etwas Sensibles in eine Bemerkung schreibt, lässt sich erkennen. Deshalb ist der Ausschluss die Voreinstellung und die Freigabe eine bewusste, dokumentierte Entscheidung.

  • Der Gruppenschutz ist erprobt, aber nicht am laufenden Bestand belegt

    Die Schranke bei gruppierten Abfragen und die Messung der Grundgesamtheit bei ungruppierten sind gebaut und durch Regressionstests auf synthetischen Beständen abgesichert. Der Nachweis am laufenden Kundenbestand über beide Zugänge steht aus – solange er fehlt, ist sie eine erprobte Maßnahme und keine Zusage für Ihren Bestand.

  • Die Protokollspur zeigt, was lief – nicht immer, wer entschied

    Frage, geprüfter Plan und ausgeführte Abfrage werden protokolliert. Zwischen der Entscheidung eines Menschen und der eines KI-Agenten unterscheidet die Spur im aktuellen Stand nicht; beide erscheinen unter derselben Kennung. Für eine Zurechnung nach Person ist das heute zu wenig, und das ist so benannt.

  • Gekennzeichnet heißt nicht vollständig gekennzeichnet

    Erkannt wird, dass ein Feld als schützenswert beschrieben ist. Nicht erkannt wird, dass ein Feld es hätte sein müssen und niemand es angegeben hat. Dagegen hilft keine Technik, sondern dass die Kennzeichnung lesbar ist und Ihr Fachbereich sie einmal gründlich durchgeht.

Betrieb

Wo die Verarbeitung stattfindet.

„Self-hosted“ und „EU-Datenresidenz“ sind zwei verschiedene Fragen, und sie werden regelmäßig als eine gestellt. Deshalb stehen sie hier getrennt.

In Ihrer Infrastruktur
Semantisches Modell, Prüfschicht, Datenbankzugang, Privacy Layer und Protokoll. Umgesetzt und für den Betrieb im eigenen Netz ausgelegt; Ihr Datenbestand wird dabei nicht kopiert.
Beim Modellanbieter
Das Sprachmodell für das Reasoning, solange es extern angebunden ist. Ein vollständig lokal betriebenes Modell ist in Arbeit und heute nicht Teil des Leistungsstands.
EU-Datenresidenz
Wird je Projekt über den Modellanbieter geklärt und hier nicht zugesagt. Was für Ihren Fall möglich ist, gehört in die technische Sichtung – ein Häkchen auf einer Website wäre an dieser Stelle die unehrlichere Antwort.
Ohne externes Modell
In der eigenen Oberfläche gehen keine Abfrageergebnisse an ein Sprachmodell. Umgesetzt – und der Weg, wenn Ergebnisse das Haus grundsätzlich nicht verlassen sollen.

Rollen, Rechte, Protokoll

Wer was sehen darf, und woran man es nachträglich sieht.

Die eigentliche Stellschraube ist nicht der Filter, sondern das Recht: Was eine Rolle nicht sehen darf, wird nicht abgefragt – und geht damit auch nicht an ein Modell.

  • Rechte werden bei Ihnen geprüft

    Die Rollenprüfung findet in der Prüfschicht in Ihrem Netz statt, nicht im Modell und nicht beim Anbieter. Sie liegt damit in Ihrer Hand und ist von außen nicht beeinflussbar.

  • Rechte sind kein Schutz gegen berechtigte Neugier

    Wer etwas sehen darf, sieht es auch dann, wenn er über einen Umweg danach fragt. Das ist keine Lücke des Systems, sondern die Eigenschaft von Rechten – und der Grund, warum der Rollenschnitt vor der Einführung besprochen wird.

  • Protokolle liegen bei Ihnen

    Wer wann was gefragt hat und welche Abfrage lief, steht in Ihrer Infrastruktur. Für eine Prüfung ist das der Unterschied zwischen einem Nachweis und einer Anfrage beim Anbieter.

  • Umfang und Aufbewahrung werden festgelegt

    Der Protokollumfang der Pilotphase ist bewusst weit gefasst – er dient der fachlichen Validierung der Antworten. Was protokolliert wird, wo es liegt und wie lange, wird pro Projekt festgelegt, bevor das System an echten Daten arbeitet.

Häufige Fragen

Fehlt Ihnen eine Frage? Ausführliche Antworten zu Betrieb und Datenzugriff stehen auf der Sicherheitsseite.

Ist ein Einsatz mit diesen Maßnahmen automatisch DSGVO-konform?

Nein, und das wäre auch von keinem Produkt zu leisten. Rechtmäßig wird eine Verarbeitung durch eine Rechtsgrundlage, einen festgelegten Zweck, die Information der Betroffenen und die Dokumentation – nicht durch einen Filter.

Was die hier beschriebenen Maßnahmen beitragen, ist die Datenminimierung als technische Maßnahme und die Prüfbarkeit: Ihr Datenschutzbeauftragter kann lesen, welche Felder gekennzeichnet sind und was übermittelt wird. Diese Unterlage ist der Beitrag; die Bewertung bleibt bei Ihnen.

Brauchen wir dafür eine Datenschutz-Folgenabschätzung?

Das hängt an Ihrer Verarbeitung und nicht an diesem Werkzeug – und die Einschätzung dazu trifft Ihr Datenschutzbeauftragter, nicht ein Anbieter. Sobald besondere Kategorien personenbezogener Daten im Spiel sind, wird die Frage in der Praxis regelmäßig bejaht.

Was wir dafür beisteuern, sind die technischen Angaben, die eine solche Abschätzung braucht: welche Komponenten wo laufen, welche Felder gekennzeichnet sind, was das Haus verlässt, was protokolliert wird – und die benannten Grenzen. Diese Angaben gehören in die technische Sichtung und nicht auf eine Website.

Gilt das auch für Beschäftigtendaten und den Betriebsrat?

Technisch gilt die Kennzeichnung für jedes Feld, unabhängig davon, ob es Kunden oder Beschäftigte betrifft – eine Gewerkschaftszugehörigkeit ist eine besondere Kategorie, und der Gruppenschutz bei Auswertungen über kleine Abteilungen ist genau der Fall, für den die Mindestgruppengröße gedacht ist.

Mitbestimmungsrechtlich ist das eine eigene Frage, und sie wird nicht durch Technik entschieden. Eine Auswertung über Beschäftigte ist erfahrungsgemäß der Punkt, an dem ein Pilotprojekt eine Beteiligung braucht – besser vorher besprochen als nachträglich erklärt.

Können wir nachweisen, was gefiltert wurde?

Die Kennzeichnung der Felder ist Teil des semantischen Modells und damit lesbar – Sie können jederzeit zeigen, welche Felder als schützenswert beschrieben sind und wer das entschieden hat. Änderungen daran werden im Protokoll festgehalten.

Für den einzelnen Abfragevorgang stehen Frage, geprüfter Plan und ausgeführte Abfrage im Protokoll. Die Grenze dieser Spur ist oben benannt: Sie belegt, was lief – nicht in jedem Fall, wer es angestoßen hat.

Was regelt der Auftragsverarbeitungsvertrag?

Für den Betrieb in Ihrer Infrastruktur ist zu klären, welche Leistungen mit Zugriff auf personenbezogene Daten verbunden sind – Einrichtung, Pflege des semantischen Modells, Unterstützung im Fehlerfall. Diese werden vertraglich geregelt, bevor das System an echten Daten arbeitet.

Der zweite Vertrag ist der mit dem Modellanbieter, wenn ein externes Modell angebunden wird. Was dort mit übermittelten Inhalten geschieht, steht in seinen Bedingungen; wir prüfen sie im Projekt mit Ihnen, statt hier eine Aussage über einen Dritten zu treffen.

Verwandte Themen

Angrenzende Fragen, jeweils auf einer eigenen Seite beantwortet.

Der schnellste Weg zu einer Einschätzung ist ein Feld aus Ihrem Haus, bei dem Sie sich unsicher sind. Daran lässt sich konkret zeigen, was gekennzeichnet würde und was hinausgeht.

Lieber direkt eine E-Mail schreiben