Unternehmens-Self-Hosting bedeutet mehr als einen Modellserver zu starten. Zu einer produktiven Plattform gehören Inferenzruntime, GPU-Kapazität, Authentifizierung, Netzwerkgrenzen, Monitoring, Modellversionierung, Kostenkontrolle und ein klarer Updateprozess. Der Nutzen liegt in Kontrolle; der Preis ist eigener Betriebsaufwand.
Architektur eines typischen Stacks
Ein produktiver Aufbau besteht häufig aus API-Gateway oder Reverse Proxy, Inferenzserver, Modell-Storage, Monitoring und gegebenenfalls RAG-Komponenten. Anwendungen greifen nicht direkt auf die GPU zu, sondern auf eine kontrollierte Service-Schicht.
GPU-Kapazität und Parallelität
Die entscheidende Frage ist nicht nur, ob ein Modell auf eine GPU passt. Unternehmen müssen wissen, wie viele gleichzeitige Nutzer, Tokens pro Sekunde und maximale Latenz erforderlich sind. Kontextlänge und Batch-Größe beeinflussen den Speicher stark.
Betrieb und Versionierung
Modell, Quantisierung, Runtime und Systemprompt sollten versioniert werden. Ein Modellupdate kann Qualität, Latenz oder Lizenzbedingungen verändern und sollte deshalb wie ein Software-Release getestet werden.
Kosten
Zur Total Cost of Ownership gehören GPU-Miete oder Anschaffung, Strom, Storage, Netzwerk, Monitoring und Personal. Bei geringer Auslastung kann eine API günstiger sein; bei hoher konstanter Nutzung kann Self-Hosting wirtschaftlich werden.
Klein starten
Ein Pilot mit einem konkreten Use Case liefert bessere Erkenntnisse als der sofortige Aufbau einer universellen KI-Plattform. Erst wenn Qualität und Nutzung klar sind, sollte Serving skaliert werden.
Was bedeutet das in der Praxis?
Open-Weight-Modelle sollten nie nur nach einem einzelnen Merkmal ausgewählt werden. Modellgröße, Architektur, Quantisierung, Lizenz, Kontext und Hardware greifen ineinander. Für eine konkrete Entscheidung sind eigene Testaufgaben deshalb wichtiger als eine einzelne Rangliste.
Mit dem Modellfinder kannst du passende Modelle zunächst nach Einsatz und Infrastruktur eingrenzen. Auf den Modellprofilen findest du anschließend Hardware-, Lizenz- und Quellenhinweise.
Primärquellen und Dokumentation
Häufige Fragen
Gilt diese Einordnung für alle Open-Weight-Modelle?
Die technischen Grundprinzipien sind allgemein, konkrete Details unterscheiden sich aber je nach Modellfamilie, Lizenz und Runtime. Maßgeblich sind deshalb immer die Primärquellen der jeweiligen Modellversion.
Wo finde ich konkrete Modelle?
Im Modellindex von OpenWeightModelle kannst du die dokumentierten Modelle nach Anbieter, Einsatzgebiet und Lizenz filtern.