DGX Spark vs. AI Cube: Welche lokale KI-Hardware passt zu Ihrem Unternehmen?

Hinweis zum Inhalt: Die Informationen in diesem Artikel wurden nach bestem Wissen zum Zeitpunkt der Veröffentlichung zusammengestellt. Technische Details, Preise, Versionen, Lizenzmodelle und externe Inhalte können sich ändern. Bitte prüfen Sie die genannten Angaben eigenständig, insbesondere vor geschäftskritischen oder sicherheitsrelevanten Entscheidungen. Dieser Artikel ersetzt keine individuelle Fach-, Rechts- oder Steuerberatung.

WZ-IT AI Cube als lokalen KI-Server konfigurieren - GB10-Hardware, vollständige Ersteinrichtung, Härtung, vorab abgestimmtes lokales Modell und Support in einem definierten Lieferumfang. Erstgespräch vereinbaren
DGX Spark und WZ-IT AI Cube sind heute keine grundsätzlich unterschiedlichen Leistungsklassen. Beide basieren auf der NVIDIA-GB10-Klasse mit 128 GB Unified Memory. Wer nur GPU, Speicher oder beworbene FP4-Leistung vergleicht, vergleicht deshalb weitgehend dieselbe technische Kategorie.
Die eigentliche Entscheidung lautet: Kaufen Sie eine Hersteller-Appliance und bauen den produktiven KI-Stack selbst auf, oder beschaffen Sie ein vorkonfiguriertes System mit definiertem Einrichtungsumfang?
Inhaltsverzeichnis
- Die kurze Antwort
- Hardware und Lieferumfang im Vergleich
- Was 128 GB Unified Memory praktisch bedeuten
- Wann DGX Spark passt
- Wann der WZ-IT AI Cube passt
- Wann beide Systeme zu klein sind
- Kosten richtig vergleichen
- Entscheidungsmatrix
Die kurze Antwort
DGX Spark passt, wenn ein technisch erfahrenes Team die NVIDIA-Entwicklungsumgebung selbst verwalten, Modelle auswählen und die Arbeitsoberfläche, Identitäten, Datenquellen, Updates und Backups eigenständig aufbauen möchte.
Der WZ-IT AI Cube passt, wenn dieselbe kompakte GB10-Klasse plug-and-play vorbereitet als lokaler KI-Server geliefert werden soll: mit gehärteter Basisinstallation, Open WebUI, Ollama und/oder vLLM, einem vorab abgestimmten Modell, Dokumentation und technischer Einbindung.
Ein individuelles GPU-System passt, wenn Hochverfügbarkeit, Rackmount, dedizierte GPUs, hoher paralleler Durchsatz oder deutlich größere Speicherkonfigurationen erforderlich sind.
Hardware und Lieferumfang im Vergleich
| Punkt | NVIDIA DGX Spark | WZ-IT AI Cube |
|---|---|---|
| Rechenplattform | NVIDIA GB10 Grace Blackwell | NVIDIA GB10 auf ASUS/NVIDIA-Appliance-Basis |
| Systemspeicher | 128 GB LPDDR5x Unified Memory | 128 GB LPDDR5x Unified Memory |
| CPU | 20-Core Arm | 20-Core Arm |
| Netzwerk | 10 GbE und ConnectX-7 | 10 GbE und ConnectX-7 |
| Betriebssystem | NVIDIA DGX OS | Vollständig eingerichtetes und gehärtetes Linux mit abgestimmten GPU-Treibern |
| KI-Arbeitsoberfläche | Selbst auszuwählen und einzurichten | Open WebUI vorkonfiguriert |
| Modellbereitstellung | Durch das eigene Team | Ollama und/oder vLLM plus vorab abgestimmtes, installiertes und geprüftes Modell |
| Einrichtung | Eigenleistung oder separater Dienstleister | Basiseinrichtung, Härtung, Inbetriebnahme und Support |
| Dokumentation | Herstellerdokumentation | Zusätzlich Dokumentation der WZ-IT-Konfiguration |
| Weiterbetrieb | Eigenverantwortung | Eigenbetrieb mit Root-Zugriff oder optional durch WZ-IT |
Der WZ-IT AI Cube ist damit kein Gegenentwurf zur GB10-Hardware. Er ist ein definierter Liefer- und Einrichtungsumfang auf dieser Hardwareklasse.
Was 128 GB Unified Memory praktisch bedeuten
Unified Memory steht CPU und GPU gemeinsam zur Verfügung. Dadurch können quantisierte Modelle geladen werden, die nicht in typische 24- oder 48-GB-Grafikkarten passen. NVIDIA positioniert ein einzelnes System dieser Klasse für Modelle bis etwa 200 Milliarden Parameter und zwei gekoppelte Systeme für größere Modelle.
Diese Angabe beantwortet aber nur die Speicherfrage. Für den produktiven Einsatz sind weitere Werte entscheidend:
- Wie viele Tokens pro Sekunde liefert das konkrete Modell?
- Wie verändert sich der Durchsatz bei mehreren gleichzeitigen Anfragen?
- Wie lang sind Systemprompt, Dokumentkontext und Antwort?
- Welche Quantisierung wird verwendet?
- Läuft das Modell mit der gewählten Runtime stabil auf Arm und GB10?
Ein Modell kann in den Speicher passen und trotzdem für zehn parallele Nutzer zu langsam sein. Deshalb legen wir die Konfiguration anhand des tatsächlichen Anwendungsfalls fest.
Wann DGX Spark passt
DGX Spark ist sinnvoll, wenn:
- bereits Erfahrung mit Linux, Containern und lokalen Modell-Runtimes vorhanden ist,
- die NVIDIA-Softwareumgebung für Entwicklung oder Modelltests genutzt werden soll,
- Arbeitsoberfläche, Identität, RAG und Betrieb bewusst intern aufgebaut werden,
- kein definierter Einrichtungsumfang eines Dienstleisters benötigt wird.
Für ein Plattform- oder Entwicklungsteam kann genau diese Eigenverantwortung gewünscht sein.
Wann der WZ-IT AI Cube passt
Der AI Cube richtet sich an Unternehmen, die nicht mit einer leeren Hardwareplattform beginnen möchten. Die Standardkonfiguration umfasst:
- die kompakte GB10-Appliance mit 128 GB Unified Memory,
- vollständig eingerichtetes und gehärtetes Linux mit GPU-Treibern und Container-Runtime,
- Open WebUI als Oberfläche für Chat, Modelle und Wissenssammlungen,
- Ollama und/oder vLLM für lokale Modellbereitstellung,
- ein vorab abgestimmtes lokales Modell, installiert und technisch geprüft,
- Ersteinrichtung, Einweisung und Support,
- technische Dokumentation und Root-Zugriff.
Wissensquellen, SSO, individuelle RAG-Pipelines, MCP-Server, Middleware oder ein laufender Managed Service können darauf aufbauen. Sie gehören nicht pauschal in denselben Festpreis, weil Umfang und Datenquellen je Unternehmen unterschiedlich sind.
Wann beide Systeme zu klein sind
Eine einzelne GB10-Appliance ist kein Ersatz für jede GPU-Infrastruktur. Eine individuelle Architektur ist sinnvoll, wenn eines der folgenden Kriterien gilt:
- viele gleichzeitige Nutzer mit kurzen garantierten Antwortzeiten,
- Hochverfügbarkeit oder definierte Wiederanlaufziele,
- Rackmount, redundante Netzteile oder Datacenter-Vorgaben,
- Modelle oder Kontexte, die mehr Speicher oder Durchsatz erfordern,
- Training oder umfangreiches Fine-Tuning statt überwiegender Inferenz,
- vorhandene Kubernetes-, Proxmox- oder GPU-Cluster, die integriert werden sollen.
In diesen Fällen planen wir dedizierte GPUs, Multi-GPU-Systeme oder verteilte Inferenz. Der AI Cube kann trotzdem als Test-, Entwicklungs- oder Ausweichsystem erhalten bleiben.
Kosten richtig vergleichen
Der Marktpreis einer DGX-Spark- oder GX10-Appliance hängt von Anbieter, SSD-Konfiguration und Verfügbarkeit ab. Ein sinnvoller Vergleich trennt deshalb drei Kostenblöcke:
- Hardware - Appliance, SSD und gegebenenfalls Zubehör.
- Einrichtung - Betriebssystem, Runtime, Oberfläche, Modell, Netzwerk und Identität.
- Betrieb - Updates, Monitoring, Backup, Modellaustausch und Support.
Der WZ-IT AI Cube Pro Managed kostet ab 899 Euro netto im Monat, zzgl. einmalig Bereitstellung und Ersteinrichtung. Die Mindestlaufzeit beträgt sechs Monate. Darin sind Hardware, Härtung, vorkonfigurierter Stack, ein vorab abgestimmtes lokales Modell, Dokumentation und Support sowie Monitoring, Updates und laufender technischer Betrieb enthalten. Individuelle Integrationen werden separat geplant.
Cloud-API-Kosten lassen sich erst mit einem realen Lastprofil gegenüberstellen. Reine Token-Hochrechnungen ohne Eingabe-/Ausgabeverhältnis, Kontextlänge, Cache-Nutzung und Auslastung erzeugen eine Scheingenauigkeit.
Entscheidungsmatrix
| Anforderung | Passender Einstieg |
|---|---|
| Eigenes Plattformteam will den NVIDIA-Stack selbst aufbauen | DGX Spark oder GX10 als reine Hardware |
| Lokaler Chat und Wissenssuche sollen vorkonfiguriert starten | WZ-IT AI Cube |
| Eigene Dokumente, Open WebUI und ein erstes Modell werden benötigt | WZ-IT AI Cube |
| Vorhandene GPU-Hardware soll weitergenutzt werden | Integration auf bestehender Infrastruktur |
| HA, Rackmount oder hoher paralleler Durchsatz sind erforderlich | Individueller GPU-Server oder Cluster |
| Keine Hardware am eigenen Standort gewünscht | LLM Hosting |
Die Hardwareklasse ist nur der Ausgangspunkt. Entscheidend ist, welche Software bereits eingerichtet sein soll, wer die Integration übernimmt und wer das System nach der Übergabe betreibt.
Sie möchten die Optionen anhand Ihres Einsatzes einordnen? AI Cube und Lieferumfang ansehen oder Erstgespräch vereinbaren.
Weiterführende Guides
- Lokale KI-Inferenz mit dem AI Cube
- Ollama vs. vLLM
- GPU-Server für lokale KI
- Open WebUI als selbst gehostete KI-Arbeitsoberfläche
Quellen
Lokale KI-Hardware passend zum Einsatz auswählen
Wir ordnen Modelle, Datenmenge, Nutzerzahl und Betriebsanforderungen ein und klären, ob eine GB10-Appliance, vorhandene GPU-Hardware oder ein größeres System passt.
Häufig gestellte Fragen
Antworten auf wichtige Fragen zu diesem Thema
Beide gehören zur NVIDIA-GB10-Klasse mit 128 GB Unified Memory und einem 20-Core-Arm-Prozessor. Der wesentliche Unterschied liegt im Angebot: DGX Spark ist ein Herstellerprodukt, der WZ-IT AI Cube kombiniert eine ASUS/NVIDIA-Hardwarebasis mit vollständig eingerichteter und gehärteter Basisinstallation, Open WebUI, Ollama und/oder vLLM, einem vorab abgestimmten lokalen Modell sowie Ersteinrichtung und Support.
Der AI Cube Pro Managed kostet ab 899 Euro netto im Monat, zzgl. einmalig Bereitstellung und Ersteinrichtung. Die Mindestlaufzeit beträgt sechs Monate. Enthalten sind Hardware, Härtung, der vorkonfigurierte KI-Stack, ein abgestimmtes lokales Modell, Dokumentation und Support sowie Monitoring, Updates und laufender technischer Betrieb. Individuelle Integrationen werden separat vereinbart.
NVIDIA positioniert Systeme dieser Klasse für Modelle bis etwa 200 Milliarden Parameter. Ob ein konkretes Modell sinnvoll läuft, hängt zusätzlich von Quantisierung, Kontextlänge, Runtime und gewünschtem Durchsatz ab. In den Speicher passen und produktiv schnell laufen sind zwei verschiedene Fragen.
Ja. Zwei AI Cubes können über ConnectX-7 direkt gekoppelt werden. Unterstützte Workloads lassen sich verteilen. Das verdoppelt den nutzbaren Speicher jedoch nicht automatisch für jede Anwendung und stellt ohne zusätzliche Architektur keine Hochverfügbarkeit her.
Nein. Lokale Verarbeitung reduziert externe Datenwege und erleichtert technische Kontrolle. Rechtskonformität hängt weiterhin vom konkreten Zweck, den Daten, Berechtigungen, Löschfristen, Protokollierung und den organisatorischen Maßnahmen ab.

Geschrieben von
Timo Wevelsiep
Co-Founder & CEO
Co-Founder von WZ-IT. Spezialisiert auf Cloud-Infrastruktur, Open-Source-Plattformen und Managed Services für KMUs und Enterprise-Kunden weltweit.
LinkedInLassen Sie uns über Ihre Idee sprechen
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.





