Dass Sprachmodelle "halluzinieren" ist eine Folge der Funktionsweise von Sprachmodellen. Um den Effekt zu verringern, kann Retrieval-Augmented Generation helfen, die Antwortqualität und die Belastbarkeit der Antwort sichtbar zu machen. Retrieval-Augmented Generation (RAG) hat sich von einem akademischen Konzept zu einem der meistgenutzten Muster in produktiven KI-Anwendungen entwickelt. In diesem Executive Breakfast zeigten wir anhand eines Legal-Tech-Projekts, wie RAG-Pipelines robust, wartbar und sicher aufgebaut werden können.
Das Problem mit reinen LLM-Antworten
Große Sprachmodelle haben ein grundsätzliches Problem für unternehmenskritische Anwendungen: ihr Wissen ist auf den Trainingsdatensatz beschränkt und veraltet. Für eine Kanzlei, die aktuelle Rechtsprechung und interne Dokumente abfragen möchte, ist ein Modell, dessen Wissen im Jahr 2023 endet, schlicht nicht ausreichend.
RAG löst dieses Problem, indem es das Sprachmodell mit einem Retrieval-System kombiniert. Vor jeder Antwortgenerierung werden relevante Dokumente aus einer Vektordatenbank abgerufen und dem Modell als Kontext mitgegeben. Das Modell generiert eine Antwort basierend auf echten, aktuellen Dokumenten – und kann Quellen zitieren.
Architektur der RAG-Pipeline
Der erste Schritt ist die Indexierung: Dokumente werden in Chunks aufgeteilt, in Embeddings umgewandelt und in pgvector gespeichert. Die Qualität der Chunks ist entscheidend – zu groß, und der Kontext wird unspezifisch; zu klein, und wichtige Zusammenhänge gehen verloren.
Bei der Abfragezeit wird die Nutzerfrage ebenfalls in ein Embedding umgewandelt und semantisch ähnliche Chunks aus der Datenbank abgerufen. Diese werden zusammen mit der ursprünglichen Frage an das Sprachmodell übergeben, das eine präzise, quellengestützte Antwort generiert.
Authentifizierung und Datenzugriff
Für eine Kanzlei ist Datentrennung keine Kür – sie ist rechtliche Notwendigkeit. Keycloak steuerte den Zugriff auf Dokumente auf Basis von Mandanten-Rollen. Jede Abfrage wird mit dem Token des anfragenden Nutzers durchgeführt, sodass nur autorisierte Dokumente in den Kontext einfließen.
Qualitätssicherung und Evaluation
Ohne systematische Evaluation ist eine RAG-Pipeline ein Black-Box-System. Wir implementierten ein automatisiertes Test-Framework, das täglich eine Stichprobe von Abfragen ausführt und die Antwortqualität anhand definierter Kriterien bewertet. Regression wurde damit frühzeitig erkannt.
Das Ergebnis: eine produktionsreife KI-Anwendung, der Anwälte vertrauen – weil sie die Quellen sehen und überprüfen können.