Self-Hosting beseitigt LLM-Risiken nicht. Modellartefakte, Inferenzserver, RAG-Quellen und Tool-Berechtigungen müssen abgesichert werden. Prompt Injection bleibt auch bei lokalen Modellen relevant. Wichtige Maßnahmen sind vertrauenswürdige Modellquellen, minimale Rechte, Netzwerkgrenzen und nachvollziehbare Logs.
Modellquellen prüfen
Gewichte sollten aus offiziellen oder nachvollziehbaren Repositories stammen. Safetensors reduziert Risiken gegenüber pickle-basierten Gewichtsdateien, schützt aber nicht vor unsicherem Custom Code oder kompromittierten Abhängigkeiten.
Prompt Injection bleibt lokal relevant
Ein lokales Modell kann durch manipulierte Nutzertexte oder RAG-Dokumente beeinflusst werden. RAG und Fine-Tuning beseitigen Prompt Injection nicht zuverlässig. Besonders kritisch wird das Problem, wenn das Modell Werkzeuge oder schreibende Zugriffe erhält.
Minimale Tool-Rechte
Ein Modell sollte nur die Aktionen ausführen dürfen, die für den Use Case wirklich nötig sind. Lesende und schreibende Rechte sollten getrennt werden. Kritische Aktionen benötigen idealerweise zusätzliche Validierung oder menschliche Freigabe.
Inferenzserver absichern
vLLM, llama-server und andere lokale APIs sind normale Netzwerkdienste. Sie benötigen Authentifizierung, TLS oder Reverse Proxy, Firewall-Regeln, Rate Limits und Monitoring. Ein vermeintlich „lokaler“ Server darf nicht versehentlich öffentlich erreichbar sein.
Logging mit Augenmaß
Logs helfen bei Fehleranalyse und Audit, können aber selbst sensible Prompts oder Dokumentinhalte enthalten. Deshalb sollten Log-Inhalte, Zugriffe und Aufbewahrungsfristen bewusst definiert werden.
Was bedeutet das in der Praxis?
Open-Weight-Modelle sollten nie nur nach einem einzelnen Merkmal ausgewählt werden. Modellgröße, Architektur, Quantisierung, Lizenz, Kontext und Hardware greifen ineinander. Für eine konkrete Entscheidung sind eigene Testaufgaben deshalb wichtiger als eine einzelne Rangliste.
Mit dem Modellfinder kannst du passende Modelle zunächst nach Einsatz und Infrastruktur eingrenzen. Auf den Modellprofilen findest du anschließend Hardware-, Lizenz- und Quellenhinweise.
Primärquellen und Dokumentation
Häufige Fragen
Gilt diese Einordnung für alle Open-Weight-Modelle?
Die technischen Grundprinzipien sind allgemein, konkrete Details unterscheiden sich aber je nach Modellfamilie, Lizenz und Runtime. Maßgeblich sind deshalb immer die Primärquellen der jeweiligen Modellversion.
Wo finde ich konkrete Modelle?
Im Modellindex von OpenWeightModelle kannst du die dokumentierten Modelle nach Anbieter, Einsatzgebiet und Lizenz filtern.