Halluzinationen entstehen, wenn ein Large Language Model (LLM) raten muss. Die Praxis hat gezeigt: Retrieval‑Augmented Generation (RAG) koppelt das Modell an eine geprüfte Wissensquelle – typischerweise eine Vektor‑Datenbank oder ein klassisches SQL‑Backend – und senkt die Fehlerquote massiv. Wichtig ist aber nicht nur die Anbindung, sondern ein enges Zusammenspiel aus:
Wenn eines dieser Glieder wackelt, halluziniert das System – egal, wie gut das Modell ist.
| Aufgabe | Best‑Practice | Warum es Halluzinationen bremst |
|---|---|---|
| Embeddings erzeugen | Konsistente Pipeline (z. B. text-embedding-3-small) und Versionierung der Modelle |
Unterschiedliche embedding‑Spaces mischen sich nicht und liefern konsistente Suchräume |
| Speichern | ACID‑fähige Vector‑DB wie pgvector in Postgres oder Milvus/Zilliz | Gleiche Transaktionsgarantien wie bei SQL, einfache JOINs mit Fakten‑Tabellen GitHub |
| Indexieren | Hybrid‑Suche: HNSW + BM25‑Lexikal | Fängt sowohl semantische als auch exakte Keywords ab, minimiert „verfehlen der Quelle“ LinkedIn |
Der neue Model Context Protocol (MCP) definiert, wie Agenten Werkzeuge (Tools) aufrufen. Ein MCP‑Server für Datenbanken (z. B. MSSQL MCP, Zilliz MCP, Supabase MCP) stellt einheitliche Endpunkte bereit.
Vorteile: