Retrieval-Augmented Generation ergänzt ein Modell zur Laufzeit mit relevanten Passagen aus einer eigenen Wissensbasis. Die Gewichte werden dabei nicht verändert. RAG eignet sich besonders für aktuelles oder internes Wissen und kann mit Open-Weight-Modellen vollständig auf eigener Infrastruktur betrieben werden.
Der RAG-Ablauf
Dokumente werden zunächst eingelesen, in Abschnitte zerlegt und häufig als Embeddings indexiert. Bei einer Nutzerfrage sucht das Retrieval relevante Passagen und übergibt sie gemeinsam mit der Frage an das Sprachmodell.
Warum RAG nicht Fine-Tuning ist
RAG ändert die Modellgewichte nicht. Neue Dokumente können sofort indexiert oder entfernt werden. Das ist besonders praktisch für Wissensbestände, die sich häufig ändern oder bei denen Quellen angezeigt werden sollen.
Retrieval-Qualität ist entscheidend
Selbst ein starkes Modell kann keine korrekte Antwort aus einer Passage ableiten, die das Retrieval nicht gefunden hat. Chunking, Embeddings, Metadaten, Hybrid Search und Re-Ranking beeinflussen deshalb die Qualität des Gesamtsystems stark.
Lokales RAG
Modell, Embeddings, Vektordatenbank und Dokumente können vollständig selbst gehostet werden. Nur wenn alle diese Komponenten kontrolliert betrieben werden, bleibt der gesamte Wissenspfad lokal.
Sicherheit
Externe Dokumente können Prompt-Injection-artige Anweisungen enthalten. RAG reduziert dieses Risiko nicht automatisch. Quellen sollten als Daten behandelt werden, nicht als vertrauenswürdige Systeminstruktionen.
Was bedeutet das in der Praxis?
Open-Weight-Modelle sollten nie nur nach einem einzelnen Merkmal ausgewählt werden. Modellgröße, Architektur, Quantisierung, Lizenz, Kontext und Hardware greifen ineinander. Für eine konkrete Entscheidung sind eigene Testaufgaben deshalb wichtiger als eine einzelne Rangliste.
Mit dem Modellfinder kannst du passende Modelle zunächst nach Einsatz und Infrastruktur eingrenzen. Auf den Modellprofilen findest du anschließend Hardware-, Lizenz- und Quellenhinweise.
Primärquellen und Dokumentation
Häufige Fragen
Gilt diese Einordnung für alle Open-Weight-Modelle?
Die technischen Grundprinzipien sind allgemein, konkrete Details unterscheiden sich aber je nach Modellfamilie, Lizenz und Runtime. Maßgeblich sind deshalb immer die Primärquellen der jeweiligen Modellversion.
Wo finde ich konkrete Modelle?
Im Modellindex von OpenWeightModelle kannst du die dokumentierten Modelle nach Anbieter, Einsatzgebiet und Lizenz filtern.