Ein Mixture-of-Experts-Modell besitzt mehrere Experten und aktiviert pro Token nur einen Teil davon. So kann es eine große Gesamtkapazität mit geringerer aktiver Rechenlast kombinieren. Die gesamten Expertengewichte müssen aber häufig weiterhin im Speicher verfügbar sein, weshalb MoE nicht automatisch wenig RAM oder VRAM benötigt.
Dense und MoE
Bei einem Dense-Modell werden für jeden Token im Wesentlichen dieselben Modellblöcke genutzt. Bei MoE enthält das Netzwerk mehrere Experten und einen Router, der auswählt, welche Experten für einen Token aktiv werden.
Gesamtparameter vs. aktive Parameter
Eine Bezeichnung wie „30B gesamt, 3B aktiv“ bedeutet nicht, dass das Modell nur so viel Speicher wie ein 3B-Modell braucht. Die Gewichte aller Experten bilden weiterhin eine große Modelldatei.
Vorteil: Recheneffizienz
Nur einen Teil der Experten pro Token zu berechnen kann die Rechenlast relativ zur Gesamtkapazität reduzieren. Das ist ein Grund, warum MoE bei sehr großen Modellen attraktiv ist.
Herausforderung: Speicher und Routing
Speicherbandbreite, GPU-Verteilung und Runtime-Unterstützung werden wichtiger. Ein Modell kann rechnerisch effizient sein und trotzdem eine Server- oder Multi-GPU-Klasse erfordern.
Für lokale Nutzer ist deshalb die Gesamtgröße der Gewichte mindestens so wichtig wie die aktive Parameterzahl.
Was bedeutet das in der Praxis?
Open-Weight-Modelle sollten nie nur nach einem einzelnen Merkmal ausgewählt werden. Modellgröße, Architektur, Quantisierung, Lizenz, Kontext und Hardware greifen ineinander. Für eine konkrete Entscheidung sind eigene Testaufgaben deshalb wichtiger als eine einzelne Rangliste.
Mit dem Modellfinder kannst du passende Modelle zunächst nach Einsatz und Infrastruktur eingrenzen. Auf den Modellprofilen findest du anschließend Hardware-, Lizenz- und Quellenhinweise.
Primärquellen und Dokumentation
Häufige Fragen
Gilt diese Einordnung für alle Open-Weight-Modelle?
Die technischen Grundprinzipien sind allgemein, konkrete Details unterscheiden sich aber je nach Modellfamilie, Lizenz und Runtime. Maßgeblich sind deshalb immer die Primärquellen der jeweiligen Modellversion.
Wo finde ich konkrete Modelle?
Im Modellindex von OpenWeightModelle kannst du die dokumentierten Modelle nach Anbieter, Einsatzgebiet und Lizenz filtern.