RAG (Retrieval-Augmented Generation)
KI-Architektur, bei der ein Sprachmodell relevante Passagen aus einem eigenen Bestand zieht, bevor es antwortet — jede Aussage lässt sich mit einer Quelle belegen.
RAG kombiniert klassisches Retrieval (Suche) mit generativer KI. Statt das Sprachmodell frei antworten zu lassen, wird zuerst der eigene Dokumentenbestand nach relevanten Passagen durchsucht — die gefundenen Textstellen werden dem Modell als Kontext mitgegeben, das Modell antwortet nur auf dieser Grundlage. Der große Unterschied zum reinen LLM-Chat: Jede Aussage lässt sich zu einer konkreten Fundstelle in einem Dokument zurückverfolgen.
Im DMS ist RAG interessant, weil es die Halluzinations-Rate senkt (das Modell darf nur nachvollziehbar antworten) und die Datenhoheit erhält (das Modell braucht nur die passenden Passagen, nicht den ganzen Bestand). Bei RecordTailor läuft der RAG-Chat gegen lokale Embeddings pro Tenant und ein lokales LLM — kein Cloud-Egress.
Ein Sonderfall ist versionsbewusstes RAG: Der Chat kennt die Historie der Dokumente (Branches, Versionen) und kann Fragen wie „Was hat sich in Klausel 7 zwischen den letzten drei Vertragsständen geändert?“ beantworten — nur möglich, wenn Dokumente ein Git-artiges Modell haben.