← Nowl

RAG & strukturierte Daten

Warum RAG bei strukturierten Unternehmensdaten nicht reicht.

Das Handbuch ist eingelesen, die Verträge liegen im Index, Fragen an Dokumente werden zuverlässig beantwortet. Dann kommt die erste Frage nach einer Zahl – und das Verfahren, das eben noch überzeugt hat, findet nichts Passendes. Das ist kein Fehler in der Umsetzung. Es ist die Grenze zwischen Abrufen und Berechnen.

RAG bleibt richtig für DokumenteBerechnet statt abgerufenBeides parallel betreibbar
Unstrukturiert · Dokumente
Frage
Embedding
Ähnliche Textpassagen
Kontext
Sprachmodell
Antwort mit Fundstelle
Strukturiert · Datensätze
Frage
Fachliche Interpretation
Datenmodell & Beziehungen
Geschäftsregeln
Exakte Abfrage
Ergebnis mit Herleitung

Zuerst das Naheliegende

Für Dokumente ist ein Abrufverfahren das richtige Mittel.

Handbücher, Arbeitsanweisungen, Wiki-Seiten, Verträge, Protokolle, Supportfälle: Wissen, das jemand als Text aufgeschrieben hat. Die Antwort auf eine Frage steht dort bereits – sie muss nur gefunden, zitiert und in verständliche Worte gefasst werden. Genau das leistet ein Abrufverfahren, und es leistet es gut.

Der Reiz liegt im Verhältnis von Aufwand und Wirkung: Die Inhalte müssen nicht modelliert werden. Es genügt, sie zu zerlegen, zu indexieren und zu einer Frage die ähnlichsten Passagen zu finden. Wer damit gute Erfahrungen gemacht hat, überträgt den Gedanken naheliegenderweise auf die Datenbank.

An dieser Stelle wechselt die Aufgabe – und mit ihr das Verfahren, das sie lösen kann.

Der strukturelle Unterschied

Eine Kennzahl steht nirgends. Sie entsteht erst.

Ein Abrufverfahren setzt voraus, dass die Antwort als Text existiert und nur gefunden werden muss. Bei einer Frage an operative Daten ist diese Voraussetzung nicht erfüllt: Kein Datensatz enthält den Satz, den der Fragende hören will. Die Antwort entsteht erst aus einer Rechnung über viele Zeilen – durch Verknüpfen, Filtern, Gruppieren und Zählen.

Ähnlichkeit ist dafür das falsche Kriterium. Ein Vektorindex findet, was einer Frage ähnlich klingt. Eine Auswertung braucht das Gegenteil: eine exakte, vollständige und wiederholbare Menge von Datensätzen. Ungefähr die richtigen Zeilen ergeben keine ungefähr richtige Summe, sondern eine falsche.

Beim Dokument ist die Antwort ein Fundstück. Beim Datensatz ist sie ein Rechenergebnis.

Dazu kommt die Vollständigkeit. Ein Abruf liefert die besten Treffer – meist eine festgelegte Anzahl davon. Für eine Frage an ein Dokument ist das genau richtig. Für „wie viele“ ist eine Auswahl der besten Treffer die Garantie, dass die Zahl zu klein ausfällt, ohne dass es jemandem auffällt.

Beispiel

Sechs Festlegungen, bevor überhaupt gerechnet werden kann.

„Wie viele Neukunden haben im vergangenen Jahr mindestens zwei Bestellungen aufgegeben?“ – diese Frage lässt sich nicht finden. Sie lässt sich nur rechnen, und zwar erst, nachdem einige fachliche Festlegungen getroffen sind. Genau diese Festlegungen sind der Inhalt einer semantischen Schicht.

Beispielhafte Definitionen · keine Kundendaten. In Ihrem System stehen an dieser Stelle Ihre eigenen Regeln – und sie sehen mit einiger Wahrscheinlichkeit anders aus.

Was geklärt sein muss, bevor gerechnet wird
Frage
Wie viele Neukunden haben im vergangenen Jahr mindestens zwei Bestellungen aufgegeben?
Antwort
Die Antwort ist eine Anzahl. Sie entsteht aus Datensätzen und nicht aus einer Textstelle – deshalb muss zuerst feststehen, was überhaupt gezählt wird.
Herkunft der Antwort
Zeitraum
„Vergangenes Jahr“ – Kalenderjahr oder Geschäftsjahr? Beides ist üblich, und die beiden Zahlen unterscheiden sich.
Beteiligte Daten
Kunde und Bestellung, verbunden über die fachliche Zuordnung – nicht zwingend über einen Fremdschlüssel.
Angewandtes Regelset4 von 4
Neukunde
Erste Bestellung im Betrachtungszeitraum, keine frühere Geschäftsbeziehung. Berechnet, nicht gespeichert – in keiner Spalte steht „Neukunde“.
Gültige Bestellung
Welche Statuswerte zählen? Storniert, retourniert, in Bearbeitung, nicht bezahlt – jede dieser Entscheidungen verändert das Ergebnis.
Aggregation
Gezählt werden Kunden, nicht Bestellungen. „Mindestens zwei“ ist eine Bedingung auf der Gruppe, nicht auf der einzelnen Zeile.
Historisierung
Enthält der Kundenbereich Änderungsstände statt aktueller Zustände, zählt eine technisch korrekte Abfrage Änderungen statt Kunden.

Einordnung

Welche Frage zu welchem Verfahren gehört.

Die Trennlinie verläuft nicht zwischen guten und schlechten Werkzeugen, sondern zwischen zwei Arten von Fragen. Die dritte Spalte ist der Fall, in dem beide gebraucht werden.

Richtlinienfrage

Beispiel
„Was steht in unserer Reisekostenrichtlinie zu Mietwagen?“
Wo die Antwort liegt
Wörtlich in einem Text
Passendes Verfahren
Abrufverfahren über Dokumente
Was der Beleg ist
Die zitierte Fundstelle

Kennzahlfrage

Beispiel
„Wie viele Aufträge sind länger als 30 Tage offen?“
Wo die Antwort liegt
Nirgends – sie entsteht aus Datensätzen
Passendes Verfahren
Semantische Schicht über die Datenbank
Was der Beleg ist
Das Regelwerk und die ausgeführte Abfrage

Gemischte Frage

Beispiel
„Welche offenen Aufträge verstoßen gegen die neue Freigaberegel?“
Wo die Antwort liegt
Die Regel im Text, die Vorgänge in der Datenbank
Passendes Verfahren
Beides, nacheinander
Was der Beleg ist
Fundstelle für die Regel, Abfrage für die Liste

Die dritte Spalte beschreibt eine Architektur und nicht den heutigen Funktionsumfang von Nowl: Die Dokumentenanbindung ist in Arbeit und derzeit nicht Teil des Produkts.

Nebeneinander

Zwei Verfahren, zwei Vorstellungen davon, was eine Antwort ist.

Beide Spalten beschreiben ein funktionierendes Verfahren. Sie unterscheiden sich darin, woher die Antwort kommt und woran sich erkennen lässt, dass sie stimmt.

Abruf über Dokumente
Auswertung über Datensätze
Die Antwort existiert bereits als Text
Die Antwort entsteht durch eine Rechnung
Gesucht wird nach Ähnlichkeit
Ausgewertet wird nach exakten Bedingungen
Geliefert werden die besten Treffer
Geliefert wird die vollständige Menge
Beleg ist die zitierte Fundstelle
Beleg ist das Regelwerk und die Abfrage
Inhalte müssen nicht modelliert werden
Begriffe und Regeln müssen beschrieben sein
Ein neues Dokument wirkt sofort
Ein neuer Fachbegriff ist Pflegeaufwand

RAG oder Semantic Layer?

Die Frage ist als Entweder-oder falsch gestellt.

In einem Unternehmen gibt es beide Sorten Wissen, und sie liegen an verschiedenen Orten. Das eine ist aufgeschrieben – in Richtlinien, Verträgen, Protokollen. Das andere ist gebucht – in Aufträgen, Rechnungen, Beständen, Vorgängen. Ein Verfahren, das für das eine gebaut ist, ist für das andere kein schwächerer Kandidat, sondern gar keiner.

Sinnvoll ist deshalb die Zuordnung nach Wissensart: Dokumentenwissen über ein Abrufverfahren, strukturierte operative Daten über eine semantische Datenschicht. Wer beides braucht, betreibt beides – und das ist keine doppelte Investition, sondern sind zwei verschiedene Aufgaben.

Nowl bearbeitet die zweite Seite. Es ersetzt kein Abrufverfahren und will keines sein.

Damit ist Nowl auch nicht die KI-Architektur eines Unternehmens, sondern ein Teil davon. In einer größeren Landschaft steht es neben der Dokumentensuche und neben dem Assistenten am Arbeitsplatz – angebunden über MCP, damit ein Assistent es als Werkzeug nutzen kann, statt es zu ersetzen.

Claude Desktop
Fragt nach · plant · wertet Zwischenergebnisse aus
MCP
MCP-Server · Nowl
Semantisches Modell · Prüfschicht · Rollenrechte
Lesende Datenbankabfrage
Ergebnis

Naheliegende Abkürzung

Tabellen als Text in den Index zu legen, löst das nicht.

Der Gedanke ist verständlich: Wenn das Abrufverfahren funktioniert, exportiert man die Datensätze eben als Text und legt sie dazu. Für Nachschlagefragen nach einem einzelnen Vorgang kann das sogar tragen.

Für jede Frage, die rechnet, trägt es nicht. Eine Summe über hunderttausend Zeilen entsteht nicht dadurch, dass die zwanzig ähnlichsten davon im Kontext stehen – und welche zwanzig es waren, steht in keinem Beleg. Dazu kommt der Punkt, den auch mehr Kontext nicht löst: Regeln wie „gilt als offen“ oder „zählt als Neukunde“ stehen in keiner Zeile der Tabelle. Sie stehen im Sourcecode.

Und es entsteht eine zweite Datenhaltung mit allem, was daran hängt: Aktualisierung, Zeitversatz, Berechtigungen. Die Rollenrechte Ihres Systems kennt ein Index nicht.

Was stattdessen beschrieben wird

Grenzen

Was diese Seite ausdrücklich nicht behauptet.

Nowl beantwortet heute Fragen an strukturierte Datenbestände. Eine Dokumentenanbindung ist in Arbeit und derzeit nicht Teil des Produkts – wer beides braucht, betreibt heute zwei Systeme nebeneinander.

Die semantische Schicht entsteht nicht von selbst. Datenmodell und – soweit verfügbar – Sourcecode werden analysiert; die fachlichen Definitionen entstehen daraus im Pilotprojekt gemeinsam mit dem Fachbereich. Das ist Arbeit, und sie fällt vor der ersten belastbaren Antwort an.

Und die Zuordnung nach Wissensart ist eine Faustregel, kein Naturgesetz. Es gibt Fragen, die auf beiden Seiten liegen – die dritte Spalte der Tabelle oben ist so ein Fall. Welche Ihrer Fragen wo liegen, zeigt sich am schnellsten an einer Liste echter Fragen aus Ihrem Haus.

Welche Fragen heute beantwortbar sind

Häufige Fragen

Fehlt Ihnen eine Frage? Ausführliche Antworten zu Betrieb und Datenzugriff stehen auf der Sicherheitsseite.

Müssen wir unser bestehendes RAG-System ablösen?

Nein, und in aller Regel wäre das ein Rückschritt. Für Dokumente ist ein Abrufverfahren das passende Werkzeug – was Sie dort aufgebaut haben, bleibt sinnvoll und wird von einer semantischen Schicht nicht berührt.

Die beiden Systeme teilen sich weder Daten noch Infrastruktur. Sie beantworten unterschiedliche Fragen und lassen sich unabhängig voneinander betreiben.

Lässt sich Vektorsuche nicht direkt auf eine relationale Datenbank anwenden?

Technisch ja – mehrere Datenbanksysteme bringen inzwischen einen Vektortyp mit. Das löst aber eine andere Aufgabe: Ähnlichkeitssuche über Textinhalte, etwa in Freitextfeldern oder Beschreibungen. Dafür ist sie nützlich.

Die Frage, wie viele Kunden eine Bedingung erfüllen, bleibt davon unberührt. Sie verlangt eine exakte Auswertung mit Verknüpfung, Gruppierung und Filterung – und die entsteht nicht aus Ähnlichkeit, sondern aus einer Abfrage gegen ein beschriebenes Fachmodell.

Wir haben unsere Schemadokumentation in den Index gelegt. Reicht das nicht?

Damit findet ein Sprachmodell die richtigen Tabellen leichter – ein echter Gewinn gegenüber gar keiner Beschreibung. Was es nicht liefert, ist die Bedeutung: Welcher der sieben Statuswerte „offen“ meint, ob ein Bereich Historie statt Gegenwart enthält und wie Ihr Haus „Neukunde“ rechnet, steht in einer Schemadokumentation selten und im Schema nie.

Der Unterschied ist auch einer der Verbindlichkeit. Ein abgerufener Kontext ist ein Vorschlag an das Modell; ein beschriebenes Fachmodell ist die Menge dessen, was überhaupt zur Ausführung kommen kann.

Arbeitet Nowl selbst mit Ähnlichkeitssuche über Ihre Datensätze?

Für die Beantwortung einer Frage an Ihre Daten ist Ähnlichkeit nicht das Kriterium: Der Weg führt über das beschriebene Fachmodell, einen geprüften Abfrageplan und eine lesende Datenbankabfrage – nicht über einen Index über Ihre Datensätze.

Welche Verfahren intern bei der Erschließung eines Systems zum Einsatz kommen, gehört ins technische Gespräch. Für die Bewertung des Ergebnisses zählt eine andere Zusage: Jede Antwort führt ihr Regelwerk und die ausgeführte Abfrage mit, und beides ist nachrechenbar.

Können Dokumentensuche und semantische Schicht im selben Chat zusammenarbeiten?

Über MCP ist genau das der vorgesehene Weg: Ein Assistent, der das Protokoll unterstützt, kann mehrere Werkzeuge nutzen und je Teilfrage entscheiden, welches er anspricht. Die Dokumentenseite bringen Sie dabei heute selbst mit.

Was dabei nicht passiert: Die beiden Quellen werden nicht zu einem gemeinsamen Index verschmolzen. Jede Antwort behält die Herkunft ihrer Seite – Fundstelle beim Dokument, Regelwerk und Abfrage bei der Kennzahl.

Verwandte Themen

Angrenzende Fragen, jeweils auf einer eigenen Seite beantwortet.

Nennen Sie uns fünf Fragen aus Ihrem Haus. Welche davon ein Dokument beantwortet und welche eine Auswertung braucht, ist in einem Gespräch geklärt.