Stand: 30. September 2026 · Source-first Referenz50 dokumentierte Open-Weight-Modelle · Keine bezahlten Rankings
OpenWeightModelle.de Passendes Modell finden
Hardware

RAM und VRAM für lokale KI: Wie viel Speicher brauchen Open-Weight-Modelle?

Wie viel RAM oder VRAM braucht ein lokales LLM? Speicherbedarf, Quantisierung, KV-Cache, Kontextlänge und GPU-Offloading verständlich erklärt.

Stand: 30. September 2026Open-Weight-WissenPrimärquellen verlinkt
Kurzantwort

Der Speicherbedarf eines Open-Weight-Modells hängt von Parameterzahl, Präzision, Kontextlänge und Runtime ab. Bei 4 Bit benötigen die reinen Gewichte grob mindestens 0,5 Byte pro Parameter zuzüglich Overhead. KV-Cache, Betriebssystem und weitere Puffer erhöhen den tatsächlichen Bedarf.

RAM und VRAM sind unterschiedliche Ressourcen

VRAM ist der schnelle Speicher einer diskreten GPU. Normaler RAM wird von CPU und Betriebssystem genutzt. Bei GPU-Inferenz sollten möglichst viele Modellteile im VRAM liegen; reicht dieser nicht, können einige Runtimes Teile in den RAM auslagern.

Unified Memory auf Apple Silicon

Bei Apple Silicon greifen CPU und GPU auf einen gemeinsamen Speicherpool zu. MLX ist speziell auf dieses Modell ausgelegt. Dadurch sind große lokale Modelle auf Macs mit viel Unified Memory möglich, ohne klassische Kopien zwischen CPU- und GPU-Speicher.

Faustregel für Modellgewichte

FP16 benötigt grob zwei Byte pro Parameter, 8 Bit ungefähr ein Byte, 4 Bit ungefähr ein halbes Byte. Diese Rechnung ist nur eine Untergrenze. Runtime-Overhead, zusätzliche Tensoren und Quantisierungsmetadaten kommen hinzu.

KV-Cache und Kontext

Lange Eingaben benötigen zusätzlichen Speicher für Attention-Zwischenzustände. Wer 64K oder 128K Kontext nutzen möchte, sollte deshalb deutlich mehr Reserve einplanen als die Größe der Modelldatei allein vermuten lässt.

Bei mehreren gleichzeitigen Nutzern vervielfacht sich dieser Effekt je nach Serving-Strategie.

Was bedeutet das in der Praxis?

Open-Weight-Modelle sollten nie nur nach einem einzelnen Merkmal ausgewählt werden. Modellgröße, Architektur, Quantisierung, Lizenz, Kontext und Hardware greifen ineinander. Für eine konkrete Entscheidung sind eigene Testaufgaben deshalb wichtiger als eine einzelne Rangliste.

Mit dem Modellfinder kannst du passende Modelle zunächst nach Einsatz und Infrastruktur eingrenzen. Auf den Modellprofilen findest du anschließend Hardware-, Lizenz- und Quellenhinweise.

Primärquellen und Dokumentation

Häufige Fragen

Gilt diese Einordnung für alle Open-Weight-Modelle?

Die technischen Grundprinzipien sind allgemein, konkrete Details unterscheiden sich aber je nach Modellfamilie, Lizenz und Runtime. Maßgeblich sind deshalb immer die Primärquellen der jeweiligen Modellversion.

Wo finde ich konkrete Modelle?

Im Modellindex von OpenWeightModelle kannst du die dokumentierten Modelle nach Anbieter, Einsatzgebiet und Lizenz filtern.