Upgrade-Announcement: Unsere Cloud GPU Server laufen jetzt auf NVIDIA RTX 6000 Blackwell

Hinweis zum Inhalt: Die Informationen in diesem Artikel wurden nach bestem Wissen zum Zeitpunkt der Veröffentlichung zusammengestellt. Technische Details, Preise, Versionen, Lizenzmodelle und externe Inhalte können sich ändern. Bitte prüfen Sie die genannten Angaben eigenständig, insbesondere vor geschäftskritischen oder sicherheitsrelevanten Entscheidungen. Dieser Artikel ersetzt keine individuelle Fach-, Rechts- oder Steuerberatung.

Ihr Modell braucht mehr GPU-Speicher, als eine 48-GB-Karte bietet? Der Managed GPU Server 96 stellt eine dedizierte NVIDIA RTX PRO 6000 Blackwell Max-Q mit 96 GB bereit, inklusive abgestimmtem Modell, vLLM, Open WebUI und 24/7 Monitoring im deutschen Rechenzentrum. 1.799 € netto pro Monat zuzüglich 999 € einmaliger Einrichtung. Managed GPU Server ansehen · Termin vereinbaren
Stand Oktober 2026: Das Angebot hieß zum Zeitpunkt dieser Umstellung AI Server Pro und heißt heute Managed GPU Server 96. Preis und Leistungsumfang in diesem Beitrag sind auf den aktuellen Stand gebracht.
Im Managed GPU Server 96 setzen wir nicht mehr auf die RTX 6000 Ada, sondern auf die NVIDIA RTX PRO 6000 Blackwell Max-Q. Damit steht deutlich mehr Headroom für große Modelle, längere Kontexte und höhere Durchsatzanforderungen bereit.
Inhaltsverzeichnis
- Die Kernänderungen auf einen Blick
- Warum dieser Schritt
- Performance: Blackwell vs. Ada
- Was 96 GB VRAM konkret ermöglichen
- Was bleibt gleich
- Verfügbarkeit
Die Kernänderungen auf einen Blick
1) Deutlich mehr VRAM: 96 GB statt 48 GB
Der Managed GPU Server 96 kommt mit 96 GB GDDR7 VRAM (ECC) in der Blackwell-Generation; die RTX 6000 Ada lag bei 48 GB GDDR6 (ECC). Das ist die wichtigste Änderung für LLMs, weil VRAM in der Praxis über Modellgröße, Kontextlänge, Batch-Größe und Parallelität entscheidet.
2) Neue Architektur (Blackwell) und neue Core-Generationen
Die RTX PRO 6000 Blackwell Serie bringt Blackwell-Architektur, 5th-Gen Tensor Cores und 4th-Gen RT Cores. Die RTX 6000 Ada basiert auf Ada Lovelace mit 4th-Gen Tensor Cores und 3rd-Gen RT Cores. Für AI-Workloads ist vor allem der Sprung bei den Tensor Cores relevant.
3) Plattform-Modernisierung: PCIe Gen 5 vs. PCIe Gen 4
Die RTX PRO 6000 Blackwell Varianten sind auf PCIe Gen 5 x16 ausgelegt, die RTX 6000 Ada auf PCIe Gen 4 x16. Das kann je nach Workload (z. B. Daten-Streaming, Multi-Node Pipelines) zusätzliche Reserven bringen.
4) Max-Q: Dichte & Effizienz für skalierbare Setups
Im Managed GPU Server 96 kommt die Max-Q-Variante zum Einsatz. NVIDIA positioniert diese explizit für dichte Konfigurationen und als Balance aus Performance und Energieeffizienz, also für Setups, die Performance pro Rack und Server optimieren.
Warum dieser Schritt: größere Modelle, längere Kontexte, mehr gleichzeitige Nutzer
In der Praxis sehen wir bei produktiven LLM-Anwendungen drei typische Engpässe:
- VRAM-Limit – Modell passt nicht vollständig in die GPU
- Time-to-First-Token – Prompt Processing / Prefill ist zu langsam
- Durchsatz – Token-Generierung unter Last zu niedrig
Mit Blackwell adressieren wir genau diese Punkte: mehr VRAM für große Modelle/Long Context und spürbar mehr Performance sowohl im Prompt Processing als auch bei der Token-Generierung.
Performance: Blackwell vs. Ada (LLM-Inference Benchmarks)
Für eine externe, nachvollziehbare Einordnung nutzen wir die Messwerte von Hardware Corner. Dort wird mit llama.cpp / llama-bench auf Ubuntu 24.04 und CUDA 12.8 getestet; die Token-Generation ist in Tokens/Sekunde, bei 4-bit Quantisierung (Q4_K_XL).
Token-Generierung bei 16K Kontext
| Modell (16K Kontext, 4-bit) | RTX 6000 Ada (t/s) | RTX 6000 Blackwell (t/s) | Vorteil Blackwell |
|---|---|---|---|
| Qwen3 8B | 98,68 | 140,62 | +42,5% |
| Qwen3 14B | 58,51 | 96,86 | +65,5% |
| Qwen3 30B | 120,12 | 139,76 | +16,4% |
| Qwen3 32B | 25,08 | 45,72 | +82,3% |
| gpt-oss 20B | 137,10 | 237,92 | +73,5% |
| Llama 70B | 13,65 | 28,24 | +106,9% |
Quelle: Hardware Corner Token-Generation Tabelle (16K Kontext)
Wichtig für die Praxis: Je größer Modell und Kontext, desto eher zahlt sich Blackwell aus. Bei 65K Kontext sieht man in mehreren Fällen nahezu eine Verdopplung (oder mehr) der Token-Generierung – z. B. Qwen3 14B +123%, Qwen3 32B +173%.
Prompt Processing (Time-to-First-Token)
Das Prefill/Prompt-Processing ist oft der unterschätzte Faktor. Bei 16K Kontext:
| Modell | RTX 6000 Ada (tok/s) | RTX 6000 Blackwell (tok/s) | Vorteil |
|---|---|---|---|
| Qwen3 8B | 4.096 | 7.588 | +85% |
| Llama 3.3 70B | 526 | 1.355 | +158% |
Das ist besonders relevant bei RAG (lange Prompts), Tool-Use oder Multi-Turn Chats – weil es direkt die gefühlte Responsiveness beeinflusst.
Was Ihnen 96 GB VRAM konkret ermöglichen
Der größte Sprung ist nicht „nur" schneller – sondern mehr machbar auf einer einzelnen GPU:
- 100B+-Klasse ohne Offloading / ohne Multi-GPU als Zwang: Die 96-GB-Klasse ist die praktikable Single-GPU-Option, wenn Modelle im 100B+ Parameterbereich ohne System-RAM-Offloading laufen sollen.
- Mit Blackwell laufen auch große Modelle wie GPT-OSS 120B (~150 t/s) oder Mistral Large 123B direkt auf einer GPU.
Vergleich: Was passt auf welche GPU?
| Modell | RTX 6000 Ada (48 GB) | RTX 6000 Blackwell (96 GB) |
|---|---|---|
| Llama 3.1 8B (Q4) | ✅ | ✅ |
| Llama 3.1 70B (Q4) | ⚠️ knapp | ✅ |
| Qwen3 32B (Q4) | ✅ | ✅ |
| GPT-OSS 120B (MXFP4) | ❌ | ✅ |
| Mistral Large 123B (Q4) | ❌ | ✅ |
Was bleibt gleich: Ihr Stack, Ihre Kontrolle, Ihr Standort
Der GPU-Wechsel ändert nichts am Grundprinzip unserer Managed GPU Server:
- Serverstandort Deutschland: dedizierter Server in einem deutschen Rechenzentrum. Externe APIs, Telemetrie und Backupziele werden als eigene Datenwege abgestimmt.
- Dedizierte GPU-Ressourcen ohne Sharing: eine dedizierte NVIDIA GPU pro Server
- Abgestimmtes Modell, vLLM und Open WebUI sind im Monatspreis enthalten
- Managed-Betrieb: proaktives 24/7 Monitoring, OS-, Treiber-, vLLM- und Open-WebUI-Updates mit CVE-Einordnung, Incident-Bearbeitung nach Service Level
- Die 96 GB schaffen Spielraum für ausgewählte Fine-Tuning-Verfahren; Umfang und Architektur stimmen wir je Vorhaben ab
Hinweis zur Übertragbarkeit der Benchmarks
Die oben zitierten Werte stammen aus einem klar definierten Test-Setup (llama.cpp/llama-bench, CUDA 12.8, 4-bit Quantisierung). In produktiven Umgebungen (z. B. vLLM, andere Quantisierungen, Batch-Settings, KV-Cache-Strategien) können absolute Zahlen abweichen. Die Max-Q-Variante arbeitet zudem mit einer niedrigeren Leistungsaufnahme als die Workstation Edition. Die Richtung (mehr VRAM und deutlicher Performance-Sprung) bleibt konsistent.
Verfügbarkeit & nächster Schritt
Der Managed GPU Server 96 mit NVIDIA RTX PRO 6000 Blackwell Max-Q (96 GB GDDR7 ECC) kostet 1.799 € netto pro Monat zuzüglich 999 € netto einmaliger Einrichtung. Für kompaktere Modelle gibt es den Managed GPU Server 24 mit NVIDIA RTX PRO 4000 Blackwell SFF Edition (24 GB GDDR7 ECC) für 699 € netto pro Monat zuzüglich 499 € Einrichtung. Hostsystem, Laufzeit und Bereitstellung werden im Angebot bestätigt.
Wenn Sie bereits ein konkretes Ziel haben (z. B. „70B-Chat mit 32K Kontext und X parallelen Nutzern" oder „RAG mit großem Dokumentenkorpus"), prüfen wir vor der Bereitstellung, ob 24 GB, 96 GB oder eine individuelle Architektur passt.
Managed GPU Server ansehen · Termin vereinbaren
Weiterführende Guides
Blackwell-GPU-Kapazität für Ihren Workload anfragen
Wir prüfen Modell, Kontext und Parallelität und stellen einen passend konfigurierten Managed GPU Server 96 mit RTX PRO 6000 Blackwell bereit.
Häufig gestellte Fragen
Antworten auf wichtige Fragen zu diesem Thema
Die GPU wechselte von der RTX 6000 Ada (48 GB VRAM) auf die RTX PRO 6000 Blackwell Max-Q (96 GB GDDR7 ECC). Das ist doppelt so viel VRAM auf einer neuen Architektur. Das Angebot hieß zum Zeitpunkt der Umstellung AI Server Pro und heißt heute Managed GPU Server 96.
In den zitierten Messwerten von Hardware Corner liegt die Token-Generierung je nach Modell und Kontext zwischen rund 16 % und 173 % höher. Bei großen Modellen wie Llama 70B verdoppelt sie sich bei 16K Kontext etwa.
Mit 96 GB VRAM laufen auch 100B+ Modelle wie GPT-OSS 120B oder Mistral Large 123B auf einer einzelnen GPU ohne Offloading.
Der Managed GPU Server 96 enthält ein abgestimmtes Modell, eine gemanagte vLLM-Inferenzschicht und Open WebUI. Bestehende Ollama- oder vLLM-Setups lassen sich übertragen; weitere Modelle, RAG, SSO und eigene Integrationen werden separat eingeordnet.
1.799 € netto pro Monat zuzüglich 999 € netto einmaliger Einrichtung. Enthalten sind dedizierter Server mit dedizierter GPU, abgestimmtes Modell, vLLM, Open WebUI, 24/7 Monitoring, Updates und technischer Betrieb. Für kleinere Modelle gibt es den Managed GPU Server 24 mit RTX PRO 4000 Blackwell SFF Edition (24 GB) für 699 € netto pro Monat zuzüglich 499 € Einrichtung.
Zuerst ordnen wir Modell, Quantisierung, Kontext und Parallelität gegen 24 oder 96 GB GPU-Speicher ein. Hostsystem, RAM, Speicher, Netzwerk, Laufzeit und Bereitstellung werden im Angebot bestätigt.

Geschrieben von
Timo Wevelsiep
Co-Founder & CEO
Co-Founder von WZ-IT. Spezialisiert auf Cloud-Infrastruktur, Open-Source-Plattformen und Managed Services für KMUs und Enterprise-Kunden weltweit.
LinkedInLassen Sie uns über Ihre Idee sprechen
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.





