WZ-IT Logo
gpt-oss Hosting

gpt-oss Hosting in Deutschland: OpenAIs Open-Weight-Modelle auf dedizierter GPU

Sie möchten ein Reasoning-Modell von OpenAI nutzen, ohne Daten an die OpenAI-API zu senden. Wir betreiben gpt-oss-120b oder gpt-oss-20b auf einem dedizierten GPU-Server in einem deutschen Rechenzentrum.

Betrieb in deutschem RechenzentrumBetrieb mit AVVvLLM und OpenAI-kompatible API

Unternehmen weltweit vertrauen WZ-IT

Bewertungen

Unternehmen weltweit vertrauen WZ-IT

Stadtwerke BrühlDGHO e.V.ABCO Water SystemsGolem.deEVADXBnextGYMAInergyml&sOdiseo SolutionsAnnotaARGESweetConnect GmbH
Ausgangslage

Warum gpt-oss selbst betreiben

gpt-oss sind die Open-Weight-Modelle von OpenAI. Beide Varianten sind Mixture-of-Experts-Modelle mit einstellbarem Reasoning-Aufwand und Tool Calling. Die Expertengewichte sind bereits im Format MXFP4 trainiert, deshalb sind die Checkpoints für ihre Parameterzahl klein.

Wer gpt-oss selbst betreibt, nutzt das Modell ohne Verbindung zu OpenAI. Die Kosten richten sich nach dem Server, nicht nach verbrauchten Tokens, und die Daten verlassen das deutsche Rechenzentrum nicht über eine Modell-API.

  • Daten bleiben in Deutschland

    Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum. Mit Auftragsverarbeitungsvertrag, ohne Datenweg zu einer Modell-API.

  • Planbare Kosten

    Fester Monatspreis je Serverstufe statt Abrechnung nach verbrauchten Tokens. Mehr Anfragen erhöhen die Rechnung nicht.

  • Modellversion unter Kontrolle

    Checkpoint und Quantisierung bleiben, bis Sie einem Wechsel zustimmen. Kein stilles Modell-Update durch einen Anbieter.

Modellfakten

gpt-oss-Checkpoints im Überblick

Herstellerangaben und Größe der Gewichtsdateien je Format, mit Quelle.

CheckpointVeröffentlichtParameterKontext laut HerstellerGewichte je Format
openai/gpt-oss-120b08/2025117 Mrd. gesamt / 5,1 Mrd. aktiv (MoE)131.072 Tokens
openai/gpt-oss-20b08/202521 Mrd. gesamt / 3,6 Mrd. aktiv (MoE)131.072 Tokens

GB = 10⁹ Bytes, Summe der Gewichtsdateien im genannten Hugging-Face-Repository. Zusätzlich braucht der Betrieb Speicher für KV-Cache, Runtime und gegebenenfalls Bildverarbeitung. Stand Oktober 2026.

Lizenz

gpt-oss: Lizenz und kommerzielle Nutzung

Lizenz
Apache License 2.0 + gpt-oss Usage Policy (Lizenztext, Usage Policy)
Kommerzielle Nutzung
Ja, ohne Umsatz- oder Nutzerschwelle.
Pflichten und Schwellen
Lizenztext und Hinweise bei Weitergabe beilegen. Die mitgelieferte Usage Policy verlangt die Einhaltung des geltenden Rechts bei der Nutzung.
Prüfstand
Stand Oktober 2026

Technische Einordnung, keine Rechtsberatung. Maßgeblich ist der Lizenztext der eingesetzten Modellversion.

Open-Source-LLM-Lizenzen im Vergleich
Serverstufe

Mindestens empfohlene Serverstufe für gpt-oss

Die Empfehlung folgt aus der Größe der Gewichte plus Reserve für Kontext und Runtime.

ModellFormatGewichteMindestens empfohlenHinweis
gpt-oss-120bMXFP465,3 GBManaged GPU Server 96vor Ort: AI Cube (128 GB Unified Memory)Für den Betrieb vor Ort ist der AI Cube mit 128 GB Unified Memory die Alternative.
gpt-oss-20bMXFP413,8 GBManaged GPU Server 24

Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Die Stufen des Managed GPU Servers

Für diese Familie relevant

Managed GPU Server 24

1 × RTX PRO 4000 Blackwell, 24 GB GPU-Speicher

699 € netto / Monat, monatlich kündbar

499 € netto Einrichtung einmalig

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 96

1 × RTX PRO 6000 Blackwell Max-Q, 96 GB GPU-Speicher

1.799 € netto / Monat, monatlich kündbar

999 € netto Einrichtung einmalig

Konfiguration ansehen

Managed GPU Server 192

2 × RTX PRO 6000 Blackwell Max-Q, 192 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Managed GPU Server 384

4 × RTX PRO 6000 Blackwell Max-Q, 384 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Der Managed GPU Server 288 mit drei GPUs ist für mehrere Modelle nebeneinander gedacht, weil vLLM ein Modell nur bei durch die GPU-Zahl teilbaren Attention-Heads verteilt.

vLLM

gpt-oss mit vLLM betreiben

Architektur, Quantisierung und Verteilung auf mehrere GPUs.

Architektur

Beide Modelle nutzen GptOssForCausalLM, eine von vLLM unterstützte Architektur. gpt-oss-120b hat 128 Experten, gpt-oss-20b 32, jeweils 4 aktiv pro Token.

MXFP4

Die Expertengewichte liegen in MXFP4 vor, Attention und Einbettungen in BF16. Welcher Kernel auf der RTX PRO 6000 Blackwell genutzt wird, legen wir mit der eingesetzten vLLM-Version fest und prüfen ihn vor dem Angebot.

Tensor-Parallelität

Mit 64 Attention-Heads und 8 KV-Heads lässt sich gpt-oss auf zwei oder vier GPUs verteilen. Für gpt-oss-120b reicht in der Regel eine GPU mit 96 GB, mehr GPUs ergeben Raum für längere Kontexte und mehr parallele Anfragen.

Reasoning und Format

gpt-oss nutzt das Harmony-Antwortformat mit getrenntem Reasoning-Kanal. vLLM gibt das über die OpenAI-kompatible API aus. Den Reasoning-Aufwand (low, medium, high) wählen Sie je Anfrage.

Betrieb durch WZ-IT

Was im Betrieb enthalten ist

Der Managed GPU Server ist eine betriebene Modellumgebung, kein leerer Server.

Modell und vLLM

Ein abgestimmtes Modell in der vereinbarten Quantisierung, bereitgestellt über eine gemanagte vLLM-Inferenzschicht.

OpenAI-kompatible API

Anwendungen und Coding-Clients binden den Server über Basis-URL und API-Schlüssel an.

Open WebUI

Gemanagte Chat-Oberfläche für Teams, die das Modell ohne eigene Anwendung nutzen.

24/7 Monitoring

Host, GPU, vLLM und Open WebUI werden proaktiv überwacht, Störungen nach Service Level bearbeitet.

Updates mit CVE-Einordnung

Betriebssystem, Treiber, vLLM und Open WebUI werden geprüft und kontrolliert aktualisiert. Modellwechsel nur nach Absprache.

AVV und Dokumentation

Auftragsverarbeitungsvertrag, dokumentierte Konfiguration und ein persönlicher Ansprechpartner.

Leistungsumfang, Preise und Mehr-GPU-Server stehen auf der Produktseite.

Managed GPU Server ansehen

Modell prüfen lassen

Modell und Serverstufe prüfen lassen

Nennen Sie Modell, Kontextlänge und gleichzeitige Anfragen. Wir prüfen Checkpoint, Lizenz und Serverstufe vor dem Angebot.

Welche Serverstufe soll geprüft werden?

Die Auswahl ist unverbindlich. Wir bestätigen Modell-Fit, Lizenz und Laufzeit vor einem Angebot.

Wie sollen wir antworten?

Antwort in der Regel innerhalb eines Werktags. Bitte senden Sie noch keine Zugangsdaten.

Häufige Fragen zu gpt-oss Hosting

Lizenz, Serverstufe, Datenweg und Betrieb

gpt-oss-120b ist das größere Modell für anspruchsvolle Reasoning- und Agentenaufgaben, mindestens empfohlen ist der Managed GPU Server 96. gpt-oss-20b ist für einfachere Aufgaben, Klassifizierung und schnelle Antworten gedacht, mindestens empfohlen ist der Managed GPU Server 24.

Nein. gpt-oss sind eigenständige Open-Weight-Modelle, die OpenAI zum Selbstbetrieb veröffentlicht hat. Beim Hosting gibt es keine Verbindung zu OpenAI. Funktionsumfang und Antwortqualität entsprechen nicht automatisch den Modellen in ChatGPT.

Ja. Die Modelle stehen unter Apache 2.0, ergänzt um eine kurze Usage Policy, die die Einhaltung des geltenden Rechts verlangt. Eine Umsatz- oder Nutzerschwelle gibt es nicht.

In vielen Fällen ja. vLLM stellt eine OpenAI-kompatible API bereit, Anwendungen wechseln über Basis-URL, API-Schlüssel und Modellname. Funktionen, die nur die OpenAI-Plattform anbietet, etwa gehostete Werkzeuge, prüfen wir im Einzelfall.

Ja, als Alternative zum gehosteten Server kommt der AI Cube mit 128 GB Unified Memory in Frage. Ob Ihr Einsatz damit abgedeckt ist, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Das prüfen wir vor dem Angebot.

gpt-oss unterstützt bis zu 131.072 Tokens. Die eingestellte Kontextlänge richtet sich nach Serverstufe und Parallelität und steht im Angebot.

Der Einstieg für gpt-oss ist der Managed GPU Server 24, mindestens empfohlen für gpt-oss-20b: 699 € netto / Monat plus 499 € netto Einrichtung einmalig, mit dediziertem Server, vLLM, Open WebUI und Managed-Betrieb durch WZ-IT. Für den Betrieb vor Ort im eigenen Netz gibt es den AI Cube. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Kontakt

Lassen Sie uns über Ihre Idee sprechen

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

E-Mail
[email protected]
Rückruf vereinbaren

Rückruf

Rückruf vereinbaren

Nummer hinterlassen, wir rufen zurück, spätestens am nächsten Werktag.

Für ein ausführliches Gespräch können Sie alternativ einen Termin buchen.

Unternehmen weltweit vertrauen WZ-IT

  • ml&s
  • Rekorder
  • Keymate
  • Führerscheinmacher
  • SolidProof
  • ARGE
  • Boese VA
  • nextGYM
  • SweetConnect GmbH
  • Golem.de
  • Millenium
  • Paritel
  • Yonju
  • EVADXB
  • Mr. Clipart
  • Aphy AG
  • Negosh
  • ABCO Water Systems
1/3 - Themenauswahl33%

Worum geht es bei Ihrer Anfrage?

Wählen Sie zuerst den Leistungsbereich, der am besten zu Ihrem Vorhaben passt.