Blog RAG – Retrieval Augmented Generation: Warum LLMs Nachschlagewerke benötigen, bevor sie antworten Geschrieben von Adam Muiz 27 Jul 2026 Aktualisiert: 06 Aug 2026 7 Min. gelesen Vor ein paar Monaten war ich stolz, einen lokalen KI-Assistenten zu haben, der alltägliche Fragen beantworten konnte. Fragen Sie nach Nginx, antwortet er. Fragen Sie nach Python, antwortet er. Fragen Sie nach dem Rezept, antwortete er auch. Aber mit der Zeit wurde mir klar, dass es ein ärgerliches Problem gab: Die Antworten waren manchmal zu allgemein, manchmal veraltet oder sogar erfundene Fakten, die ich nie wirklich gegeben hatte. Ein LLM ist wie dieser Freund, der sehr fließend spricht, viele Muster auswendig kennt, aber nicht immer die richtigen Nachschlagewerke dabei hat. Hier begann ich, die Fragen zu lernenAugmented Generation abrufenoder was oft abgekürzt wirdLAPPEN. LLM ohne RAG: Wie ein Freund, der auswendig lernt, aber keine Notizen hat Versuchen Sie sich vorzustellen, dass Sie eine Prüfung ablegen. Neben dir sitzen zwei Freunde. Der erste Freund ist sehr intelligent und weiß viele Dinge auswendig, verlässt sich aber nur auf sein Gedächtnis. Der zweite Freund ist nicht so nett wie der erste, aber er hat ein ordentliches Notizbuch mit Unterrichtsmaterial, Dozentenfolien und persönlichen Zusammenfassungen. Wenn die Prüfungsfragen herauskommen, kann der erste Freund schnell antworten, versteht aber manchmal die Details falsch. Der zweite Freund antwortete etwas langsamer, aber präziser, weil er die Frage zuerst anhand seiner Notizen überprüfte. LLM ohne RAG ist wie erste Freunde. Er wurde anhand von Milliarden Texten im Internet geschult, daher ist sein Wissen umfangreich, aber statisch. Es kennt Ihre neuesten Dokumente, Ihre persönlichen Notizen oder Ihre Serverkonfiguration nicht. RAG macht es zu einem zweiten Freund: Bevor es antwortet, sucht es zunächst nach relevanten Quellen in Ihrer persönlichen Datenbank und antwortet dann auf der Grundlage dieser Quellen. Was ist RAG? RAG ist ein KI-Architekturmuster, das zwei Dinge kombiniert:Abruf(Informationssuche) undGenerationen(Textgenerierung). Vereinfacht ausgedrückt sieht der Ablauf so aus: Benutzer stellen Fragen. Das System sucht in der von uns erstellten Datenbank nach den relevantesten Dokumenten oder Textstücken. Die entsprechenden Dokumente werden eingefügtpromptLLM als Kontext. LLM beantwortet Fragen basierend auf diesem Kontext. Auf diese Weise stammten LLMs Antworten nicht mehr nur aus seiner eigenen Erinnerung. Er verfügt nun über ein „Nachschlagewerk“, das er vor dem Sprechen aufschlagen kann. Drei Hauptkomponenten von RAG Die RAG-Implementierung besteht normalerweise aus drei Hauptkomponenten. Jeder hat eine andere Rolle, unterstützt sich aber gegenseitig. 1. Quelldokumente Dies können PDF-Dateien, Markdown-Notizen, Dokumentationsseiten, Serverprotokolle oder sogar Blog-Artikel selbst sein. Je hochwertiger und strukturierter Ihr Dokument ist, desto besser sind die RAG-Ergebnisse. Müll rein, Müll raus – dieses Sprichwort gilt auch hier. 2. Vektordatenbank Vektordatenbanken speichern numerische Darstellungen von Text, sogenannteEinbettung. Stellen Sie sich vor, dass jeder Satz in eine Reihe von Zahlen umgewandelt wird, die seine Bedeutung erfassen. Wenn Benutzer Fragen stellen, werden die Fragen auch in ähnliche Zahlen umgewandelt. Das System sucht dann nach Dokumenten, deren Nummern der Frage am nächsten kommen. Beliebte Beispiele: ChromaDB, Qdrant, Milvus und Weaviate. 3. LLM als Generator Sobald die relevanten Dokumente gefunden sind, erstellt das LLM eine menschliche Antwort. Sie können über Ollama lokale Modelle wie Qwen oder Llama verwenden oder APIs wie Gemini und OpenAI verwenden. Das Gute daran ist, dass RAG selbst ein kleines LLM nützlicher macht, weil er sich nicht alles merken muss – sondern nur klug sein muss, wenn es darum geht, den Kontext zu lesen. Einfache Implementierung mit Python und ChromaDB Um RAG zu verstehen, schaue ich mir lieber gleich ein kleines Beispiel an. Hier ist ein einfaches Python-Skript, das ein paar Sätze liest, sie in ChromaDB speichert und dann Fragen basierend auf diesen Daten beantwortet. # install dulu: pip install chromadb sentence-transformers import chromadb from chromadb.utils.embedding_functions import SentenceTransformerEmbeddingFunction # 1. Siapkan dokumen sumber documents = [ "Nginx adalah web server yang populer dan ringan.", "Docker memungkinkan aplikasi berjalan dalam container yang terisolasi.", "RAG membantu LLM menjawab berdasarkan data pribadi pengguna.", "fail2ban melindungi server dari brute-force attack dengan memblokir IP." ] # 2. Buat koleksi di ChromaDB client = chromadb.Client() ef = SentenceTransformerEmbeddingFunction(model_name="all-MiniLM-L6-v2") collection = client.create_collection(name="catatan-server", embedding_function=ef) # 3. Masukkan dokumen collection.add(documents=documents, ids=["d1", "d2", "d3", "d4"]) # 4. Tanya dan ambil konteks relevan query = "Cara melindungi server dari serangan password?" results = collection.query(query_texts=[query], n_results=2) context = "\n".join(results["documents"][0]) print("Konteks yang ditemukan:") print(context) Wenn das obige Skript ausgeführt wird, gibt ChromaDB die Dokumente zurück, die für die Frage am relevantesten sind. Es ist wahrscheinlich, dass Dokumente zu fail2ban und Docker erscheinen, da sich beide mit der Serversicherheit befassen. Die Suchergebnisse können dann zu einer Eingabeaufforderung wie dieser für LLM zusammengestellt werden: Kamu adalah asisten teknis. Jawab pertanyaan berikut berdasarkan konteks di bawah. Konteks: - fail2ban melindungi server dari brute-force attack dengan memblokir IP. - Docker memungkinkan aplikasi berjalan dalam container yang terisolasi. Pertanyaan: Cara melindungi server dari serangan password? LLM wird fokussierter antworten, da es einen spezifischen Kontext hat. Er errät nicht mehr und gibt keine allgemeinen Antworten mehr aus seinem alten Wissen heraus. Wann wird RAG wirklich benötigt? RAG ist nicht eine Lösung für alle Probleme. Es gibt Situationen, in denen RAG sehr nützlich ist, und es gibt Situationen, in denen es das System ohne erkennbaren Nutzen komplizierter macht. RAG eignet sich für den Einsatz, wenn Sie über personenbezogene Daten verfügen, die LLM nicht direkt zur Verfügung gestellt werden können, wie z. B. Serverdatensätze, interne Dokumente oder Blog-Archive. RAG ist auch nützlich, wenn LLM-Antworten immer auf eine bestimmte Quelle verweisen sollen, beispielsweise auf die offizielle Dokumentation des von Ihnen entwickelten Produkts. Darüber hinaus trägt RAG zur Reduzierung beiHalluzination, nämlich die Tendenz von LLMs, Antworten zu geben, die überzeugend klingen, aber falsch sind. RAG wird jedoch nicht wirklich benötigt, wenn die Frage des Benutzers allgemein ist und keine spezifischen Daten erfordert. Fragen Sie nach Weltgeschichte oder Schreibtipps, LLM ohne RAG reicht aus. Fragen Sie nach der Serverkonfiguration, die Sie letzte Woche geändert haben, dann wird RAG wichtig. Zu beachtende Einschränkungen RAG klingt perfekt, hat aber tatsächlich seine Grenzen. Erstens hängt die Qualität der Antwort stark von der Qualität des Quelldokuments ab. Wenn das Dokument unübersichtlich ist, sind auch die Suchergebnisse unübersichtlich. Zweitens findet RAG nicht immer den am besten geeigneten Kontext, insbesondere wenn die Frage mit anderen Schlüsselwörtern formuliert ist als der Inhalt des Dokuments. Drittens erhöht RAG die Komplexität: Sie müssen darüber nachdenken, wie Sie Dokumente zuschneiden, Einbettungen speichern, Daten aktualisieren und Vektordatenbanken verwalten. RAG ist also wie der Aufbau einer persönlichen Bibliothek. Es reicht nicht aus, nur ein Bücherregal zu haben, sondern man braucht auch ein übersichtliches Katalogsystem, Mitarbeiter, die wissen, wo sich die Bücher befinden, und die Angewohnheit, sie nach Gebrauch aufzuräumen. Abschluss RAG eröffnet eine neue Möglichkeit, LLM zu nutzen: von einer Maschine, die sich Muster merkt, zu einem Assistenten, der unsere eigenen Daten lesen und darauf verweisen kann. Für mich, der einen Heimserver und viele Konfigurationshinweise hat, ist RAG so, als würde man dem AI Assistant ein persönliches Nachschlagewerk geben. Er muss nicht alles wissen, solange er weiß, wo er suchen muss. Wenn Sie bereits über ein lokales LLM oder einen eigenen KI-Assistenten verfügen, ist der Versuch von RAG ein ziemlich unterhaltsamer nächster Schritt. Ausgehend von einem kleinen Dokument, einer Sammlung, einer Frage. Mit der Zeit werden Sie über eine digitale Bibliothek verfügen, mit der Sie chatten können.