Quantisierung reduziert die numerische Präzision der Modellgewichte. Dadurch benötigt ein LLM weniger Speicher und kann häufig auf kleinerer Hardware laufen. 8-Bit- und 4-Bit-Verfahren sind besonders verbreitet. Je stärker die Kompression, desto größer kann der Qualitätsverlust sein.
Warum Quantisierung so wichtig ist
Große Sprachmodelle werden häufig in FP16 oder BF16 trainiert. Für reine Inferenz ist diese Präzision nicht immer erforderlich. Werden Gewichte mit weniger Bits dargestellt, sinken Dateigröße und Speicherbedarf erheblich.
Damit wird lokale KI überhaupt erst für viele Consumer-Systeme praktikabel.
8 Bit und 4 Bit
8-Bit-Quantisierung reduziert den Speicher ungefähr auf die Hälfte von FP16. 4-Bit-Varianten gehen noch weiter. Moderne Verfahren versuchen, besonders empfindliche Werte mit höherer Präzision zu behandeln oder Quantisierung blockweise anzuwenden.
Bei GGUF begegnen Nutzern häufig Namen wie Q4, Q5 oder Q8 sowie Varianten wie K-Quants. Diese Bezeichnungen beschreiben unterschiedliche Quantisierungsschemata – nicht nur eine einzelne Bitzahl.
Qualität gegen Speicher abwägen
Eine gute 4-Bit-Quantisierung kann für Chat oder RAG erstaunlich nah an höherer Präzision liegen. Bei anspruchsvollem Reasoning, Coding oder sehr feinen Aufgaben können Unterschiede sichtbarer werden.
Deshalb sollte dieselbe Modellfamilie in zwei bis drei sinnvollen Quantisierungen mit eigenen Testfragen verglichen werden.
Quantisierung beim Training
QLoRA kombiniert ein quantisiertes Basismodell mit LoRA-Adaptern. Dadurch kann Fine-Tuning großer Modelle mit deutlich weniger Speicher durchgeführt werden als beim vollständigen Training aller Gewichte.
Was bedeutet das in der Praxis?
Open-Weight-Modelle sollten nie nur nach einem einzelnen Merkmal ausgewählt werden. Modellgröße, Architektur, Quantisierung, Lizenz, Kontext und Hardware greifen ineinander. Für eine konkrete Entscheidung sind eigene Testaufgaben deshalb wichtiger als eine einzelne Rangliste.
Mit dem Modellfinder kannst du passende Modelle zunächst nach Einsatz und Infrastruktur eingrenzen. Auf den Modellprofilen findest du anschließend Hardware-, Lizenz- und Quellenhinweise.
Primärquellen und Dokumentation
Häufige Fragen
Gilt diese Einordnung für alle Open-Weight-Modelle?
Die technischen Grundprinzipien sind allgemein, konkrete Details unterscheiden sich aber je nach Modellfamilie, Lizenz und Runtime. Maßgeblich sind deshalb immer die Primärquellen der jeweiligen Modellversion.
Wo finde ich konkrete Modelle?
Im Modellindex von OpenWeightModelle kannst du die dokumentierten Modelle nach Anbieter, Einsatzgebiet und Lizenz filtern.