Sie möchten ein Reasoning-Modell von OpenAI nutzen, ohne Daten an die OpenAI-API zu senden. Wir betreiben gpt-oss-120b oder gpt-oss-20b auf einem dedizierten GPU-Server in einem deutschen Rechenzentrum.
Unternehmen weltweit vertrauen WZ-IT
gpt-oss sind die Open-Weight-Modelle von OpenAI. Beide Varianten sind Mixture-of-Experts-Modelle mit einstellbarem Reasoning-Aufwand und Tool Calling. Die Expertengewichte sind bereits im Format MXFP4 trainiert, deshalb sind die Checkpoints für ihre Parameterzahl klein.
Wer gpt-oss selbst betreibt, nutzt das Modell ohne Verbindung zu OpenAI. Die Kosten richten sich nach dem Server, nicht nach verbrauchten Tokens, und die Daten verlassen das deutsche Rechenzentrum nicht über eine Modell-API.
Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum. Mit Auftragsverarbeitungsvertrag, ohne Datenweg zu einer Modell-API.
Fester Monatspreis je Serverstufe statt Abrechnung nach verbrauchten Tokens. Mehr Anfragen erhöhen die Rechnung nicht.
Checkpoint und Quantisierung bleiben, bis Sie einem Wechsel zustimmen. Kein stilles Modell-Update durch einen Anbieter.
Herstellerangaben und Größe der Gewichtsdateien je Format, mit Quelle.
| Checkpoint | Veröffentlicht | Parameter | Kontext laut Hersteller | Gewichte je Format |
|---|---|---|---|---|
| openai/gpt-oss-120b | 08/2025 | 117 Mrd. gesamt / 5,1 Mrd. aktiv (MoE) | 131.072 Tokens |
|
| openai/gpt-oss-20b | 08/2025 | 21 Mrd. gesamt / 3,6 Mrd. aktiv (MoE) | 131.072 Tokens |
|
GB = 10⁹ Bytes, Summe der Gewichtsdateien im genannten Hugging-Face-Repository. Zusätzlich braucht der Betrieb Speicher für KV-Cache, Runtime und gegebenenfalls Bildverarbeitung. Stand Oktober 2026.
Technische Einordnung, keine Rechtsberatung. Maßgeblich ist der Lizenztext der eingesetzten Modellversion.
Open-Source-LLM-Lizenzen im VergleichDie Empfehlung folgt aus der Größe der Gewichte plus Reserve für Kontext und Runtime.
| Modell | Format | Gewichte | Mindestens empfohlen | Hinweis |
|---|---|---|---|---|
| gpt-oss-120b | MXFP4 | 65,3 GB | Managed GPU Server 96vor Ort: AI Cube (128 GB Unified Memory) | Für den Betrieb vor Ort ist der AI Cube mit 128 GB Unified Memory die Alternative. |
| gpt-oss-20b | MXFP4 | 13,8 GB | Managed GPU Server 24 |
Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.
Für diese Familie relevant
1 × RTX PRO 4000 Blackwell, 24 GB GPU-Speicher
699 € netto / Monat, monatlich kündbar
499 € netto Einrichtung einmalig
Konfiguration ansehenFür diese Familie relevant
1 × RTX PRO 6000 Blackwell Max-Q, 96 GB GPU-Speicher
1.799 € netto / Monat, monatlich kündbar
999 € netto Einrichtung einmalig
Konfiguration ansehen2 × RTX PRO 6000 Blackwell Max-Q, 192 GB GPU-Speicher
Preis und Laufzeit auf Anfrage
Konfiguration ansehen4 × RTX PRO 6000 Blackwell Max-Q, 384 GB GPU-Speicher
Preis und Laufzeit auf Anfrage
Konfiguration ansehenDer Managed GPU Server 288 mit drei GPUs ist für mehrere Modelle nebeneinander gedacht, weil vLLM ein Modell nur bei durch die GPU-Zahl teilbaren Attention-Heads verteilt.
Architektur, Quantisierung und Verteilung auf mehrere GPUs.
Beide Modelle nutzen GptOssForCausalLM, eine von vLLM unterstützte Architektur. gpt-oss-120b hat 128 Experten, gpt-oss-20b 32, jeweils 4 aktiv pro Token.
Die Expertengewichte liegen in MXFP4 vor, Attention und Einbettungen in BF16. Welcher Kernel auf der RTX PRO 6000 Blackwell genutzt wird, legen wir mit der eingesetzten vLLM-Version fest und prüfen ihn vor dem Angebot.
Mit 64 Attention-Heads und 8 KV-Heads lässt sich gpt-oss auf zwei oder vier GPUs verteilen. Für gpt-oss-120b reicht in der Regel eine GPU mit 96 GB, mehr GPUs ergeben Raum für längere Kontexte und mehr parallele Anfragen.
gpt-oss nutzt das Harmony-Antwortformat mit getrenntem Reasoning-Kanal. vLLM gibt das über die OpenAI-kompatible API aus. Den Reasoning-Aufwand (low, medium, high) wählen Sie je Anfrage.
Der Managed GPU Server ist eine betriebene Modellumgebung, kein leerer Server.
Ein abgestimmtes Modell in der vereinbarten Quantisierung, bereitgestellt über eine gemanagte vLLM-Inferenzschicht.
Anwendungen und Coding-Clients binden den Server über Basis-URL und API-Schlüssel an.
Gemanagte Chat-Oberfläche für Teams, die das Modell ohne eigene Anwendung nutzen.
Host, GPU, vLLM und Open WebUI werden proaktiv überwacht, Störungen nach Service Level bearbeitet.
Betriebssystem, Treiber, vLLM und Open WebUI werden geprüft und kontrolliert aktualisiert. Modellwechsel nur nach Absprache.
Auftragsverarbeitungsvertrag, dokumentierte Konfiguration und ein persönlicher Ansprechpartner.
Leistungsumfang, Preise und Mehr-GPU-Server stehen auf der Produktseite.
Managed GPU Server ansehenQwen Hosting
Qwen Hosting in Deutschland: Qwen3.8-27B, Qwen3.5-122B und Qwen3-Coder-Next auf dedizierter GPU, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehenGemma Hosting
Gemma Hosting in Deutschland: Gemma 4 31B, 26B A4B und 12B von Google auf dedizierter GPU, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehenMistral Hosting
Mistral Hosting in Deutschland: Mistral Small 4, Devstral Small 2 und Mistral Medium 3.5 auf dedizierter GPU, mit vLLM, Lizenzprüfung und Betrieb mit AVV.
Familie ansehenDevstral Hosting
Devstral Hosting in Deutschland: Devstral Small 2 und Devstral 2 von Mistral AI für Coding-Agenten, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehenDeepSeek Hosting
DeepSeek Hosting in Deutschland: DeepSeek-V4-Flash auf einem dedizierten Server mit vier GPUs, mit vLLM, MIT-Lizenz und ohne Datenweg zur DeepSeek-API.
Familie ansehenLlama Hosting
Llama Hosting in Deutschland: warum Llama 4 für EU-Unternehmen lizenzrechtlich ausscheidet, wie Llama 3.3 70B läuft und welche Alternativen es gibt.
Familie ansehenModell prüfen lassen
Nennen Sie Modell, Kontextlänge und gleichzeitige Anfragen. Wir prüfen Checkpoint, Lizenz und Serverstufe vor dem Angebot.
Lizenz, Serverstufe, Datenweg und Betrieb
gpt-oss-120b ist das größere Modell für anspruchsvolle Reasoning- und Agentenaufgaben, mindestens empfohlen ist der Managed GPU Server 96. gpt-oss-20b ist für einfachere Aufgaben, Klassifizierung und schnelle Antworten gedacht, mindestens empfohlen ist der Managed GPU Server 24.
Nein. gpt-oss sind eigenständige Open-Weight-Modelle, die OpenAI zum Selbstbetrieb veröffentlicht hat. Beim Hosting gibt es keine Verbindung zu OpenAI. Funktionsumfang und Antwortqualität entsprechen nicht automatisch den Modellen in ChatGPT.
Ja. Die Modelle stehen unter Apache 2.0, ergänzt um eine kurze Usage Policy, die die Einhaltung des geltenden Rechts verlangt. Eine Umsatz- oder Nutzerschwelle gibt es nicht.
In vielen Fällen ja. vLLM stellt eine OpenAI-kompatible API bereit, Anwendungen wechseln über Basis-URL, API-Schlüssel und Modellname. Funktionen, die nur die OpenAI-Plattform anbietet, etwa gehostete Werkzeuge, prüfen wir im Einzelfall.
Ja, als Alternative zum gehosteten Server kommt der AI Cube mit 128 GB Unified Memory in Frage. Ob Ihr Einsatz damit abgedeckt ist, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Das prüfen wir vor dem Angebot.
gpt-oss unterstützt bis zu 131.072 Tokens. Die eingestellte Kontextlänge richtet sich nach Serverstufe und Parallelität und steht im Angebot.
Der Einstieg für gpt-oss ist der Managed GPU Server 24, mindestens empfohlen für gpt-oss-20b: 699 € netto / Monat plus 499 € netto Einrichtung einmalig, mit dediziertem Server, vLLM, Open WebUI und Managed-Betrieb durch WZ-IT. Für den Betrieb vor Ort im eigenen Netz gibt es den AI Cube. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.