Inferenz-Runtime
SGLang, Kernel, Treiber und Startparameter reproduzierbar bereitstellen.
WZ-IT plant SGLang als Inferenzschicht für lokale KI, benchmarked Modelle und dimensioniert GPU, Parallelität, Kontext und Verfügbarkeit für den realen Workload.
Unternehmen weltweit vertrauen WZ-IT
Die genannten Namen sind Marken ihrer jeweiligen Inhaber: SGLang (the SGLang project contributors). WZ-IT ist ein unabhängiger Dienstleister und steht in keiner geschäftlichen, partnerschaftlichen oder vertraglichen Beziehung zu diesen Unternehmen. Wir bieten unabhängige Migrations-, Installations-, Hosting- und Betriebsdienstleistungen an.
Antwortzeit und Durchsatz hängen von Modell, Quantisierung, Kontextlänge, Batch-Größe, Parallelität und GPU-Architektur ab. Ein einzelner Token-Wert beschreibt keinen Unternehmensbetrieb.
Wir testen Zielmodelle mit repräsentativen Eingaben und planen Routing, Modell-Cache, Metriken, API-Schutz und Skalierung als Teil der Plattform.
Benutzeroberfläche, RAG, Identitäten, Governance und fachliche Evaluation werden durch weitere Komponenten ergänzt. SGLang stellt primär Modelle über APIs bereit.
GPU-Typ, Anzahl der Instanzen und Zielwerte werden im Assessment festgelegt; deshalb gibt es keinen pauschalen Standardpreis.
Modell, Quantisierung, Runtime, GPU, Kontext und Scheduling bilden eine Einheit. Verlässliche Kapazitätsaussagen entstehen erst durch Benchmarks mit realistischen Anfragen.
SGLang, Kernel, Treiber und Startparameter reproduzierbar bereitstellen.
Gewichte, Quantisierung, Kontext und API-Kompatibilität versioniert verwalten.
KV-Cache, Batching, Parallelität und Speichergrenzen passend zur Last optimieren.
Latenz, Durchsatz, Fehler, GPU-Auslastung und Updates kontinuierlich kontrollieren.
WZ-IT betreibt die technische Runtime. Modellwahl, fachliche Qualität und zulässige Nutzung werden gemeinsam beziehungsweise kundenseitig verantwortet.
| Bereich | Verantwortung | Leistung und Abgrenzung |
|---|---|---|
| SGLang-Runtime | WZ-IT | Deployment, Treiber, Container, Parameter, Monitoring und Updates. |
| Modellartefakte | WZ-IT | Kontrollierter Download, Versionierung, Speicher und Startkonfiguration. |
| Lastprofil und Benchmarks | Gemeinsam | Wir messen technisch; der Kunde liefert typische Prompts, Kontext und Parallelität. |
| API-Integration | Gemeinsam | Authentifizierung, Limits und Clients werden gemeinsam getestet. |
| Modellfreigabe und Inhalte | Kunde | Eignung, Lizenzen, Ausgaben und fachliche Grenzen verantwortet der Kunde. |
| Routing und Skalierung | Optional durch WZ-IT | Mehrere Modelle, GPUs, Gateways und Autoscaling werden separat geplant. |
Unterstützte Sprach- und multimodale Modelle mit optimiertem Scheduling und Caching bereitstellen.
Latenz, Time to First Token, Token-Durchsatz und Parallelität mit realistischen Lastprofilen benchmarken.
OpenAI-kompatible Endpunkte für freigegebene Anwendungen und interne Plattformen verfügbar machen.
Versionen, Quantisierungen, Startparameter und Rollout-Pfade nachvollziehbar dokumentieren.
API-Authentifizierung, Netzwerkpfade, Mandantengrenzen und administrative Zugänge schützen.
Open WebUI, LiteLLM, Agents, RAG-Dienste und eigene Anwendungen mit der Inferenzschicht verbinden.
Bestehende Daten und Konfigurationen prüfen, testweise übernehmen und mit einem kontrollierten Cutover in den Betrieb überführen.
SSO, Rollen, administrative Wege und externe Zugriffe passend zu Anwendung und vorhandener Infrastruktur absichern.
Alle zustandsbehafteten Komponenten konsistent sichern und den Wiederherstellungsweg für den vereinbarten Umfang dokumentieren.
Anwendung und technische Abhängigkeiten überwachen, kontrolliert aktualisieren und nach vereinbartem Service Level betreiben.
Ein klarer Betriebsumfang statt einer unübersichtlichen Hosting-Pauschale.
Wir richten eine Testinstanz für Sie ein, in der Regel am nächsten Werktag. Ohne Zahlungsdaten. Nach sieben Tagen wird sie gelöscht, sofern Sie nicht übernehmen.
Wir verbinden die passende Compute-Größe mit laufendem Betrieb, Backups, Monitoring und einem Service Level, das zur Kritikalität von SGLang passt. Hochverfügbarkeit und Recovery-Ziele werden bei Bedarf separat geplant.
Wir planen auch individuelle Hosting-Architekturen, Integrationen und Migrationen rund um SGLang. Kontaktieren Sie uns für ein technisches Assessment.
Eine verwaltete SGLang-Standardanwendung ist im Starter-Workload enthalten. Ab Business kommt ein flexibel nutzbares Betriebsbudget für planbare Leistungen innerhalb der regulären Servicezeit hinzu. Wählen Sie Compute, weitere Anwendungen, Speicher und das passende Service Level.
Ein Workload ist eine Compute-Instanz mit den darauf vereinbarten Anwendungen.
Ein Standard-App je Workload ist bereits enthalten. Zusätzliche dedizierte Server zählen als weitere Workloads.
79,90 € je angefangenem TB und Monat, inklusive täglichem verschlüsseltem Offsite-Backup mit 7 Tagen Aufbewahrung.
Anfrage
Nennen Sie kurz Ausgangslage und Ziel für SGLang. Wir ordnen Infrastruktur, Integration und laufenden Betrieb ein.
Parameterzahl allein genügt nicht. Gewichtsspeicher, KV-Cache, Kontext, Batch-Größe, GPUs und Zielwerte für TTFT und Tokenrate müssen zusammen betrachtet werden.
| Nutzungsszenario | Technischer Startpunkt | Wichtige Einflussfaktoren |
|---|---|---|
| Ein Modell und wenige parallele Chats | Modell- und GPU-Benchmark | Quantisierung, Kontext und gewünschte Interaktivität werden praktisch gemessen. |
| Mehrere Teams oder API-Clients | Concurrency-Test | Durchsatz, Warteschlange und Antwortzeit werden bei realistischer Parallelität geprüft. |
| Lange Kontexte oder Agenten | Speicher- und Prefill-Assessment | KV-Cache, Prefix-Caching und Input-Last bestimmen die Kapazität. |
| Mehrere GPUs oder Modelle | Cluster- und Routing-Architektur | Parallelisierung, Verteilung, Failover und Modellrouting werden separat geplant. |
Ein Preis folgt erst nach Auswahl von Modell, Hardware, Kontext, Parallelität und Zielwerten.
Die Runtime wird auf dedizierter GPU-Hardware nahe an den aufrufenden Anwendungen betrieben.
Geplanter Inferenzdienst auf europäischer Infrastruktur nach Benchmark.
Deployment in Ihrem Account mit passender GPU- und Netzwerkklasse.
Betrieb auf vorhandenen GPU-Servern oder einer individuell geplanten Plattform.
Lokale und externe Inferenzendpunkte über ein kontrolliertes Gateway kombinieren.
Clients greifen nicht direkt auf GPUs zu, sondern über einen authentifizierten und messbaren API-Pfad.
OpenAI-kompatible oder projektspezifische Clients.
TLS, Authentifizierung, Quoten, Timeouts und Request-Limits.
Getrennte Schlüssel, Modelle und Nutzungsgrenzen.
Scheduling, Batching, Cache und Modellserving auf GPU-Ressourcen.
Passende Beschleuniger, Runtime und Kernel für das gewählte Modell.
Versionierte Gewichte, Quantisierungen und kontrollierte Artefakte.
TTFT, Tokenrate, Queue, Speicher, Fehler und Kapazitätsgrenzen.
Benchmarkwerte gelten nur für die getestete Kombination aus Modell, Runtime, Hardware, Kontext und Lastprofil.
Antworten zu Modellen, GPUs, Benchmarks und Betrieb.
SGLang ist für leistungsorientiertes Serving von Sprach- und multimodalen Modellen interessant, besonders wenn Caching, Parallelität und strukturierte Ausführung wichtig sind.
Nicht ohne Lastprofil. Wir messen Kontextlänge, Input- und Outputmenge, Parallelität und Zielantwortzeit und leiten daraus belastbare Kapazitätsgrenzen ab.
Nein. GPU-Typ, Anzahl und Betriebsmodell werden nach Modell- und Last-Assessment separat angeboten.
Ja. Wir installieren die Runtime auf geeigneter lokaler GPU-Hardware und binden API, Monitoring, Updates und Modellverwaltung ein.
Ja. Für ein konkretes Modell können wir beide Runtimes mit identischen Prompts, Kontexten und Concurrency-Stufen benchmarken.
Als Alternative zum Managed Hosting im Rechenzentrum stellt WZ-IT die Hardware bereit, richtet SGLang ein und übernimmt Absicherung, Monitoring, Updates, Backup und technischen Support. Der Zugriff kann auf das interne Netz begrenzt oder über VPN und vorhandene Identitäten freigegeben werden.
ab 349 € netto / Monat · zzgl. einmalig Bereitstellung und Ersteinrichtung

01.06.2026
Ein eigenes ChatGPT, das vollständig im eigenen Haus läuft: eine vertraute Chat-Oberfläche, dahinter ein großes Sprachmodell auf eigener Hardware, ohne dass ein einziger Prompt an...
24.11.2025
OpenAI hat GPT-OSS 120B am 5. August 2025 als Open-Weight-Reasoning-Modell veröffentlicht. Durch die ab Werk verwendete MXFP4-Quantisierung positioniert OpenAI das Modell für eine einzelne GPU...
09.11.2025
Lokale KI-Inferenz bedeutet, dass ein Sprach- oder Multimodalmodell auf eigener Hardware statt über eine öffentliche API ausgeführt wird. Unternehmen gewinnen damit Kontrolle über Datenwege, Modellwahl...
Diese Lösungen werden oft zusammen mit SGLang eingesetzt
Diese Lösungen bieten ähnliche Funktionalitäten und können gemeinsam evaluiert werden
Diese Lösungen sind direkte Alternativen mit ähnlichen Einsatzgebieten
Kein Risiko: Im schlechtesten Fall gehen Sie mit mehr Klarheit über Ihr Projekt heraus als vorher.


„Die Beratung von WZ-IT zu unserer Azure-Migration war schon im Erstgespräch fachlich sehr fundiert und völlig unverbindlich - wir haben eine Menge mitgenommen.“
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.