Lektion 6 von 6
Embeddings und RAG: wenn KI Ihr Wissen nutzt
Die Grenze, die RAG überwindet
Bis hierher haben Sie gesehen: Ein LLM hat nicht automatisch Zugriff auf Ihre aktuellen internen Dokumente. Auch ein Modell mit aktuellen allgemeinen Fähigkeiten kennt neue Produktkataloge, Prozessdokumente oder Preise nur, wenn die Anwendung diese Informationen bereitstellt.
Es gibt zwei Lösungswege:
- Fine-Tuning: Zusätzliche Beispiele passen Verhalten oder Aufgabenleistung an. Für laufend veränderliche Fakten ist ein externer Wissenszugriff meist leichter aktuell zu halten.
- Retrieval-Augmented Generation (RAG): Das Modell bleibt, wie es ist. Die relevanten Informationen werden bei jeder Anfrage aus einer externen Datenbank gezogen und in den Prompt geladen.
RAG ist ein verbreitetes Architekturmuster für KI-Assistenten mit unternehmensspezifischem Wissen, etwa für interne Suche oder Support.
Der Baustein darunter: Embeddings
Um zu verstehen, wie RAG funktioniert, müssen Sie zuerst Embeddings verstehen.
Ein Embedding ist die Abbildung eines Inhalts auf einen Zahlenvektor. Dimension und Eigenschaften hängen vom eingesetzten Embedding-Modell ab. Der Vektor ist so gelernt, dass semantisch ähnliche Inhalte für den vorgesehenen Aufgabentyp vergleichbar werden.
Technikstand prüfen: Modellgrenzen, Dimensionen und empfohlene Eingabeformate ändern sich. Ein aktuelles Primärbeispiel bietet die Dokumentation der Gemini Embeddings. Für eine Umsetzung ist immer die Dokumentation des tatsächlich gewählten Embedding-Modells maßgeblich.
Ein paar Beispiele, veranschaulicht:
- "Der Kunde möchte stornieren" und "Wie setze ich einen Auftrag zurück?" liegen im Vektorraum nahe beieinander, obwohl sie kein einziges Wort teilen.
- "Python-Code debuggen" und "Fehler im Python-Script finden" ebenso.
- "Kaffee bestellen" und "Flug buchen" liegen weit auseinander.
Embeddings werden typischerweise über ein dafür vorgesehenes Modell oder einen Embedding-Endpunkt erzeugt. Dieses Modell und das generierende Antwortmodell erfüllen unterschiedliche Aufgaben.
Eine Vektor-Datenbank: das Gedächtnis der RAG
Damit die Ähnlichkeits-Suche schnell ist, werden Embeddings in einer Vektor-Datenbank gespeichert. Bekannte Lösungen sind Qdrant, Pinecone, Weaviate und PostgreSQL mit der Erweiterung pgvector.
Der Prozess sieht so aus:
- Vorbereitung. Unternehmensdokumente werden in sinnvolle Abschnitte zerlegt (Chunking). Die passende Länge hängt von Dokumentstruktur, Embedding-Modell und Fragen ab.
- Embedding. Jeder Chunk wird durch ein Embedding-Modell geschickt. Das Ergebnis ist ein Vektor.
- Indexierung. Die Vektoren werden in der Vektor-Datenbank abgelegt, gemeinsam mit Metadaten (Quelle, Datum, Autor, Kategorie).
Diese Vorbereitung läuft einmal und wird bei Änderungen aktualisiert.
Der RAG-Flow in einer Anfrage
Wenn eine Nutzeranfrage kommt, passiert Folgendes:
- Embedding der Anfrage. Die Frage des Nutzers wird ebenfalls in einen Vektor übersetzt.
- Similarity Search. Die Vektor-Datenbank liefert eine konfigurierbare Zahl ähnlicher Abschnitte zurück.
- Prompt-Montage. Das eigentliche LLM bekommt einen Prompt in etwa dieser Form: "Beantworte die folgende Frage nur auf Basis der angegebenen Quellen. [Frage des Nutzers]. Quellen: [Top-k Chunks]."
- Antwortgenerierung. Das LLM produziert die Antwort auf Basis des bereitgestellten Kontexts. Es kann Quellen dennoch falsch interpretieren oder unbelegte Ergänzungen erzeugen.
Diese Architektur ist eine mögliche Grundlage für wissensgestützte Anwendungen. Ob sie passt, hängt von Datenart, Aktualität, Berechtigungen und Qualitätsanforderungen ab.
Typische Anwendungsfälle
Interne Wissensdatenbank. Mitarbeitende fragen eine KI zu Unternehmensrichtlinien, Prozessen oder Produktinformationen. Die Antworten stammen aus den tatsächlichen Unterlagen, nicht aus dem generischen Training.
Kundenservice und FAQ. Ein Bot beantwortet Kundenanfragen auf Basis des aktuellen Support-Wissens. Neue FAQ-Einträge werden automatisch verfügbar, sobald sie in der Datenbank indexiert sind.
Vertriebsunterstützung. Ein Vertriebler fragt nach Argumenten gegen einen bestimmten Wettbewerber. Die Antwort zieht auf tatsächliche Battle Cards und Win-Loss-Analysen zurück.
Fachberatung. Eine technische Fachkraft fragt nach der Lösung eines Problems. Die KI zieht historische Tickets, Handbücher und interne Anleitungen als Quellen heran.
Die Stellen, an denen RAG schiefgeht
RAG ist mächtig, aber nicht trivial. Drei Schwachstellen treten in der Praxis häufig auf:
1. Schlechtes Chunking
Wenn Dokumente an ungünstigen Stellen zerschnitten werden, fehlt dem Retrieval der Kontext. Tabellen, Listen und mehrseitige Prozessbeschreibungen brauchen sorgfältige Chunking-Regeln.
2. Semantische Lücken
Eine Vektorsuche kann bei Produktcodes, exakten Fachbegriffen, mehrdeutigen Fragen oder fehlenden Metadaten ungeeignete Treffer liefern. Hybride Ansätze aus Stichwort- und Vektorsuche sind eine mögliche Gegenmaßnahme.
3. Zu viele oder zu wenige Quellen
Liefert die Suche zu wenig, fehlt möglicherweise die Antwortgrundlage. Liefert sie zu viel oder irrelevantes Material, steigt das Risiko von Widersprüchen. Trefferzahl, Filter und Re-Ranking sollten deshalb mit einem Testset abgestimmt werden.
Was RAG nicht kann
RAG ist keine Lizenz zum Abschalten der kritischen Prüfung. Wenn die Quelle falsch ist, wird auch die Antwort falsch. Wenn die Suche die falsche Quelle findet, trifft das Modell eine korrekte Antwort auf Basis des falschen Materials. Die Qualität einer RAG-Anwendung steht und fällt mit der Qualität der zugrundeliegenden Dokumente und der Kuratierung des Index.
Was Sie aus dieser Lektion mitnehmen
Embeddings machen Inhalte für bestimmte Ähnlichkeitsaufgaben mathematisch vergleichbar. RAG kombiniert Retrieval mit einem LLM, das die gefundenen Informationen zu einer Antwort formt. RAG und Fine-Tuning lösen unterschiedliche Probleme. Die Entscheidung sollte anhand von Aktualität, Verhalten, Kosten und gemessener Ergebnisqualität fallen.
Kursabschluss
Nach diesen sechs Lektionen haben Sie ein belastbares Bild davon, wie moderne KI-Systeme funktionieren: vom Training über die Antwortgenerierung bis zur Architektur unternehmensspezifischer Anwendungen. Dieses technische Verständnis ist die Grundlage für alle weiteren Entscheidungen — ob es um den Kauf von Werkzeugen, die Planung eigener Projekte oder die Bewertung fremder Lösungen geht.
Die Abschlussprüfung wartet auf Sie.
Wissenscheck
Was ist ein Embedding?
Was ist der Kernvorteil von RAG gegenüber einem reinen LLM?