WZ-IT Logo

Upgrade-Announcement: Unsere Cloud GPU Server laufen jetzt auf NVIDIA RTX 6000 Blackwell

Timo Wevelsiep
Timo Wevelsiep
••Aktualisiert: 02.10.2026
#AI #GPU #NVIDIA #Blackwell #LLM #Inferenz #CloudServer #DSGVO #AIServer

Hinweis zum Inhalt: Die Informationen in diesem Artikel wurden nach bestem Wissen zum Zeitpunkt der Veröffentlichung zusammengestellt. Technische Details, Preise, Versionen, Lizenzmodelle und externe Inhalte können sich ändern. Bitte prüfen Sie die genannten Angaben eigenständig, insbesondere vor geschäftskritischen oder sicherheitsrelevanten Entscheidungen. Dieser Artikel ersetzt keine individuelle Fach-, Rechts- oder Steuerberatung.

Upgrade-Announcement: Unsere Cloud GPU Server laufen jetzt auf NVIDIA RTX 6000 Blackwell

Ihr Modell braucht mehr GPU-Speicher, als eine 48-GB-Karte bietet? Der Managed GPU Server 96 stellt eine dedizierte NVIDIA RTX PRO 6000 Blackwell Max-Q mit 96 GB bereit, inklusive abgestimmtem Modell, vLLM, Open WebUI und 24/7 Monitoring im deutschen Rechenzentrum. 1.799 € netto pro Monat zuzüglich 999 € einmaliger Einrichtung. Managed GPU Server ansehen · Termin vereinbaren

Stand Oktober 2026: Das Angebot hieß zum Zeitpunkt dieser Umstellung AI Server Pro und heißt heute Managed GPU Server 96. Preis und Leistungsumfang in diesem Beitrag sind auf den aktuellen Stand gebracht.

Im Managed GPU Server 96 setzen wir nicht mehr auf die RTX 6000 Ada, sondern auf die NVIDIA RTX PRO 6000 Blackwell Max-Q. Damit steht deutlich mehr Headroom für große Modelle, längere Kontexte und höhere Durchsatzanforderungen bereit.


Inhaltsverzeichnis


Die Kernänderungen auf einen Blick

1) Deutlich mehr VRAM: 96 GB statt 48 GB

Der Managed GPU Server 96 kommt mit 96 GB GDDR7 VRAM (ECC) in der Blackwell-Generation; die RTX 6000 Ada lag bei 48 GB GDDR6 (ECC). Das ist die wichtigste Änderung für LLMs, weil VRAM in der Praxis über Modellgröße, Kontextlänge, Batch-Größe und Parallelität entscheidet.

2) Neue Architektur (Blackwell) und neue Core-Generationen

Die RTX PRO 6000 Blackwell Serie bringt Blackwell-Architektur, 5th-Gen Tensor Cores und 4th-Gen RT Cores. Die RTX 6000 Ada basiert auf Ada Lovelace mit 4th-Gen Tensor Cores und 3rd-Gen RT Cores. Für AI-Workloads ist vor allem der Sprung bei den Tensor Cores relevant.

3) Plattform-Modernisierung: PCIe Gen 5 vs. PCIe Gen 4

Die RTX PRO 6000 Blackwell Varianten sind auf PCIe Gen 5 x16 ausgelegt, die RTX 6000 Ada auf PCIe Gen 4 x16. Das kann je nach Workload (z. B. Daten-Streaming, Multi-Node Pipelines) zusätzliche Reserven bringen.

4) Max-Q: Dichte & Effizienz für skalierbare Setups

Im Managed GPU Server 96 kommt die Max-Q-Variante zum Einsatz. NVIDIA positioniert diese explizit für dichte Konfigurationen und als Balance aus Performance und Energieeffizienz, also für Setups, die Performance pro Rack und Server optimieren.


Warum dieser Schritt: größere Modelle, längere Kontexte, mehr gleichzeitige Nutzer

In der Praxis sehen wir bei produktiven LLM-Anwendungen drei typische Engpässe:

  1. VRAM-Limit – Modell passt nicht vollständig in die GPU
  2. Time-to-First-Token – Prompt Processing / Prefill ist zu langsam
  3. Durchsatz – Token-Generierung unter Last zu niedrig

Mit Blackwell adressieren wir genau diese Punkte: mehr VRAM für große Modelle/Long Context und spürbar mehr Performance sowohl im Prompt Processing als auch bei der Token-Generierung.


Performance: Blackwell vs. Ada (LLM-Inference Benchmarks)

Für eine externe, nachvollziehbare Einordnung nutzen wir die Messwerte von Hardware Corner. Dort wird mit llama.cpp / llama-bench auf Ubuntu 24.04 und CUDA 12.8 getestet; die Token-Generation ist in Tokens/Sekunde, bei 4-bit Quantisierung (Q4_K_XL).

Token-Generierung bei 16K Kontext

Modell (16K Kontext, 4-bit) RTX 6000 Ada (t/s) RTX 6000 Blackwell (t/s) Vorteil Blackwell
Qwen3 8B 98,68 140,62 +42,5%
Qwen3 14B 58,51 96,86 +65,5%
Qwen3 30B 120,12 139,76 +16,4%
Qwen3 32B 25,08 45,72 +82,3%
gpt-oss 20B 137,10 237,92 +73,5%
Llama 70B 13,65 28,24 +106,9%

Quelle: Hardware Corner Token-Generation Tabelle (16K Kontext)

Wichtig für die Praxis: Je größer Modell und Kontext, desto eher zahlt sich Blackwell aus. Bei 65K Kontext sieht man in mehreren Fällen nahezu eine Verdopplung (oder mehr) der Token-Generierung – z. B. Qwen3 14B +123%, Qwen3 32B +173%.

Prompt Processing (Time-to-First-Token)

Das Prefill/Prompt-Processing ist oft der unterschätzte Faktor. Bei 16K Kontext:

Modell RTX 6000 Ada (tok/s) RTX 6000 Blackwell (tok/s) Vorteil
Qwen3 8B 4.096 7.588 +85%
Llama 3.3 70B 526 1.355 +158%

Das ist besonders relevant bei RAG (lange Prompts), Tool-Use oder Multi-Turn Chats – weil es direkt die gefühlte Responsiveness beeinflusst.


Was Ihnen 96 GB VRAM konkret ermöglichen

Der größte Sprung ist nicht „nur" schneller – sondern mehr machbar auf einer einzelnen GPU:

  • 100B+-Klasse ohne Offloading / ohne Multi-GPU als Zwang: Die 96-GB-Klasse ist die praktikable Single-GPU-Option, wenn Modelle im 100B+ Parameterbereich ohne System-RAM-Offloading laufen sollen.
  • Mit Blackwell laufen auch große Modelle wie GPT-OSS 120B (~150 t/s) oder Mistral Large 123B direkt auf einer GPU.

Vergleich: Was passt auf welche GPU?

Modell RTX 6000 Ada (48 GB) RTX 6000 Blackwell (96 GB)
Llama 3.1 8B (Q4) ✅ ✅
Llama 3.1 70B (Q4) ⚠️ knapp ✅
Qwen3 32B (Q4) ✅ ✅
GPT-OSS 120B (MXFP4) ❌ ✅
Mistral Large 123B (Q4) ❌ ✅

Was bleibt gleich: Ihr Stack, Ihre Kontrolle, Ihr Standort

Der GPU-Wechsel ändert nichts am Grundprinzip unserer Managed GPU Server:

  • Serverstandort Deutschland: dedizierter Server in einem deutschen Rechenzentrum. Externe APIs, Telemetrie und Backupziele werden als eigene Datenwege abgestimmt.
  • Dedizierte GPU-Ressourcen ohne Sharing: eine dedizierte NVIDIA GPU pro Server
  • Abgestimmtes Modell, vLLM und Open WebUI sind im Monatspreis enthalten
  • Managed-Betrieb: proaktives 24/7 Monitoring, OS-, Treiber-, vLLM- und Open-WebUI-Updates mit CVE-Einordnung, Incident-Bearbeitung nach Service Level
  • Die 96 GB schaffen Spielraum für ausgewählte Fine-Tuning-Verfahren; Umfang und Architektur stimmen wir je Vorhaben ab

Hinweis zur Übertragbarkeit der Benchmarks

Die oben zitierten Werte stammen aus einem klar definierten Test-Setup (llama.cpp/llama-bench, CUDA 12.8, 4-bit Quantisierung). In produktiven Umgebungen (z. B. vLLM, andere Quantisierungen, Batch-Settings, KV-Cache-Strategien) können absolute Zahlen abweichen. Die Max-Q-Variante arbeitet zudem mit einer niedrigeren Leistungsaufnahme als die Workstation Edition. Die Richtung (mehr VRAM und deutlicher Performance-Sprung) bleibt konsistent.


Verfügbarkeit & nächster Schritt

Der Managed GPU Server 96 mit NVIDIA RTX PRO 6000 Blackwell Max-Q (96 GB GDDR7 ECC) kostet 1.799 € netto pro Monat zuzüglich 999 € netto einmaliger Einrichtung. Für kompaktere Modelle gibt es den Managed GPU Server 24 mit NVIDIA RTX PRO 4000 Blackwell SFF Edition (24 GB GDDR7 ECC) für 699 € netto pro Monat zuzüglich 499 € Einrichtung. Hostsystem, Laufzeit und Bereitstellung werden im Angebot bestätigt.

Wenn Sie bereits ein konkretes Ziel haben (z. B. „70B-Chat mit 32K Kontext und X parallelen Nutzern" oder „RAG mit großem Dokumentenkorpus"), prüfen wir vor der Bereitstellung, ob 24 GB, 96 GB oder eine individuelle Architektur passt.

Managed GPU Server ansehen · Termin vereinbaren


Weiterführende Guides

Anfrage

Blackwell-GPU-Kapazität für Ihren Workload anfragen

Wir prüfen Modell, Kontext und Parallelität und stellen einen passend konfigurierten Managed GPU Server 96 mit RTX PRO 6000 Blackwell bereit.

Was möchten Sie auf dem GPU-Server betreiben?

Wie sollen wir antworten?

Häufig gestellte Fragen

Antworten auf wichtige Fragen zu diesem Thema

Die GPU wechselte von der RTX 6000 Ada (48 GB VRAM) auf die RTX PRO 6000 Blackwell Max-Q (96 GB GDDR7 ECC). Das ist doppelt so viel VRAM auf einer neuen Architektur. Das Angebot hieß zum Zeitpunkt der Umstellung AI Server Pro und heißt heute Managed GPU Server 96.

In den zitierten Messwerten von Hardware Corner liegt die Token-Generierung je nach Modell und Kontext zwischen rund 16 % und 173 % höher. Bei großen Modellen wie Llama 70B verdoppelt sie sich bei 16K Kontext etwa.

Mit 96 GB VRAM laufen auch 100B+ Modelle wie GPT-OSS 120B oder Mistral Large 123B auf einer einzelnen GPU ohne Offloading.

Der Managed GPU Server 96 enthält ein abgestimmtes Modell, eine gemanagte vLLM-Inferenzschicht und Open WebUI. Bestehende Ollama- oder vLLM-Setups lassen sich übertragen; weitere Modelle, RAG, SSO und eigene Integrationen werden separat eingeordnet.

1.799 € netto pro Monat zuzüglich 999 € netto einmaliger Einrichtung. Enthalten sind dedizierter Server mit dedizierter GPU, abgestimmtes Modell, vLLM, Open WebUI, 24/7 Monitoring, Updates und technischer Betrieb. Für kleinere Modelle gibt es den Managed GPU Server 24 mit RTX PRO 4000 Blackwell SFF Edition (24 GB) für 699 € netto pro Monat zuzüglich 499 € Einrichtung.

Zuerst ordnen wir Modell, Quantisierung, Kontext und Parallelität gegen 24 oder 96 GB GPU-Speicher ein. Hostsystem, RAM, Speicher, Netzwerk, Laufzeit und Bereitstellung werden im Angebot bestätigt.

Timo Wevelsiep

Geschrieben von

Timo Wevelsiep

Co-Founder & CEO

Co-Founder von WZ-IT. Spezialisiert auf Cloud-Infrastruktur, Open-Source-Plattformen und Managed Services für KMUs und Enterprise-Kunden weltweit.

LinkedIn

Lassen Sie uns über Ihre Idee sprechen

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

Rückruf vereinbaren

Rückruf

Rückruf vereinbaren

Nummer hinterlassen, wir rufen zurück, spätestens am nächsten Werktag.

Für ein ausführliches Gespräch können Sie alternativ einen Termin buchen.

Unternehmen weltweit vertrauen WZ-IT

  • ml&s
  • Rekorder
  • Keymate
  • Führerscheinmacher
  • SolidProof
  • ARGE
  • Boese VA
  • nextGYM
  • SweetConnect GmbH
  • Golem.de
  • Millenium
  • Paritel
  • Yonju
  • EVADXB
  • Mr. Clipart
  • Aphy AG
  • Negosh
  • ABCO Water Systems
1/3 - Themenauswahl33%

Worum geht es bei Ihrer Anfrage?

Wählen Sie zuerst den Leistungsbereich, der am besten zu Ihrem Vorhaben passt.