[email protected]
Interaktiver Simulator

LLM Token/s Simulator: Qwen3.6-35B-A3B NVFP4 auf GB10

Reicht ein AI Cube für Ihr Team, und wie fühlt sich eine lokale KI im Alltag an? Erleben Sie die gemessene Ausgabegeschwindigkeit von nvidia/Qwen3.6-35B-A3B-NVFP4 im Einzelchat und unter paralleler Last auf einem AI Cube mit GB10.

Cloud Wolke HerausforderungServer NachhaltigkeitIT Beratung Service Consulting SoforthilfeTimo Wevelsiep Robin ZinsExperten für Innovation Migration AWSHetzner Hosting zuverlässig

Simulator

Token pro Sekunde selbst ausprobieren

Regler für Geschwindigkeit und Antwortlänge einstellen, Simulation starten und mitlesen. Die Voreinstellungen entsprechen gemessenen Werten.

108 tok/s
10120 tok/s

Qwen-Presets zeigen die gemessene Geschwindigkeit je Chat in einem öffentlichen GB10-Test vom 19.07.2026. Der Test verwendete 1.024 Eingabe- und 256 Ausgabe-Token. Für Ihren Einsatz prüfen wir Modell, Kontext und Parallelität separat.

500 Token
503.000 Token
Ausgabe0 / 500 Token
Simulation starten, um die Antwort im gewählten Tempo mitzulesen.
Geschätzt
4,63 s
Vergangen
0,00 s
Aktuell
0,0 tok/s

Aktuelle Messwerte

Qwen3.6-35B-A3B-NVFP4 auf einem AI Cube

Die sichtbare Rate je Chat sinkt unter paralleler Last, während der Gesamtdurchsatz des Systems steigt. Beides ist für die Dimensionierung relevant.

AI Cube · 1 × NVIDIA GB10 · 128 GB Unified Memory

nvidia/Qwen3.6-35B-A3B-NVFP4

  • ≈ 108 tok/s · Einzelchat
  • ≈ 43 tok/s · 8 parallele Chats · je Chat
  • ≈ 320 tok/s · 8 parallele Chats · gesamt
  • Architektur: 35B gesamt · 3B aktiv
  • Checkpoint: NVIDIA NVFP4
  • Runtime: vLLM · FP8 KV-Cache · MTP-2
  • Test-Workload: 1.024 Input · 256 Output
Alternative Referenz: GPT-OSS 20B erreichte im Einzelchat rund 91 tok/s. Da Runtime und Quantisierung abweichen, ist dies kein direkter Qualitäts- oder Modellvergleich.
Ausgabegeschwindigkeit unter paralleler Last
Parallele ChatsJe ChatGesamtTTFT p50
1≈ 108 tok/s≈ 100 tok/s178 ms
2≈ 85 tok/s≈ 158 tok/s209 ms
4≈ 50 tok/s≈ 189 tok/s245 ms
8≈ 43 tok/s≈ 320 tok/s282 ms
16≈ 29 tok/s≈ 432 tok/s447 ms
  • Öffentlich dokumentierte Messung vom 19.07.2026 auf einem einzelnen GB10. Je-Chat- und Gesamtwerte beruhen auf unterschiedlichen Aggregationen des Test-Harness und können deshalb bei kleinen Laststufen leicht voneinander abweichen. NVIDIA-Modellkarte · Messdaten und Konfiguration

Anwendungsfälle

Typische Anwendungsfälle: wie lange eine Antwort dauert

Ab etwa 30 Token pro Sekunde je Chat lässt sich eine Antwort gut mitlesen. Wie lange sie insgesamt dauert, hängt von ihrer Länge ab.

  • KI-Chat

    Sichtbare Geschwindigkeit je aktiver Unterhaltung
    • Tokens: 50-250
    • Empf. Speed: 30+ tok/s
    • Dauer: 0.5-8s
  • E-Mail

    Antwortdauer hängt zusätzlich von der gewünschten Länge ab
    • Tokens: 200-500
    • Empf. Speed: 30+ tok/s
    • Dauer: 2-17s
  • Bericht/Artikel

    Bei langen Ausgaben wird der Gesamtdurchsatz besonders relevant
    • Tokens: 1000-3000
    • Empf. Speed: 30+ tok/s
    • Dauer: 9-100s

Planungswert für einen AI Cube: bis zu zehn gleichzeitig erzeugte Antworten. Der Wert liegt zwischen den gemessenen Stufen 8 und 16; eine scheinpräzise 10er-Zahl leiten wir daraus nicht ab. Für Teams von fünf bis zwanzig Personen reicht ein Cube in aller Regel, für die Auslegung zählt der Test mit Zielmodell, Kontext und Wissensquellen.

Nächster Schritt

KI-Inferenz im eigenen Netz: der AI Cube

Der AI Cube bringt die gemessene Leistung in Ihr Netz, ohne Cloud-Abhängigkeit und ohne externe Token-Kosten. Einmal für Gerät und Einrichtung, monatlich für die Wartung.

Einmalig

Der AI Cube

ab 6.490 € nettoeinmalig, Ausführung mit 1 TB
  • NVIDIA GB10 mit 128 GB Unified Memory, vorkonfiguriert für Ihr Netzwerk
  • Abgestimmte Sprachmodelle und Open WebUI als Arbeitsoberfläche
  • Lieferung in zehn Werktagen, Einweisung inklusive

Laufende Wartung

AI Cube Care

ab 349,90 € netto / Monatdie ersten zwölf Monate mit dem Gerät, danach monatlich kündbar
  • Updates für System, Inferenz-Engine und Modelle im Wartungsfenster
  • Monitoring und Alarmierung rund um die Uhr
  • Support per Ticket mit Antwort bis zum nächsten Werktag

Mehr gleichzeitige Last, als ein Cube trägt, oder kein Platz im eigenen Haus: Managed GPU Server im deutschen Rechenzentrum, ab 699 € netto / Monat. Managed GPU Server ansehen

Alle Preise verstehen sich netto zuzüglich gesetzlicher Umsatzsteuer. Die Angebote richten sich an Unternehmen.

Häufige Fragen zur Token-Geschwindigkeit

Token, Einflussfaktoren, Praxis und der AI Cube

Grundlagen

Einflussfaktoren

Praktische Anwendung

Hardware & AI Cube

Bewertungen & Projekte

Was Kunden über die Zusammenarbeit sagen

Von der lokalen KI-Integration bis zu Architektur, Datenhoheit und laufendem Betrieb.

WZ-IT hat unsere Studio-Infrastruktur von dezentralen Einzelgeräten auf eine zentrale Plattform gehoben: Jeder Standort ist per VPN sicher angebunden, neue Geräte werden automatisiert onboardet und ein kompletter Standort wird per Vorlage provisioniert - ohne manuelle Schritte vor Ort. Was mich am meisten beeindruckt hat, ist die Breite und Tiefe des Wissens: Timo und Robin sind kein normaler IT-Dienstleister, der einen Server aufsetzt und wieder geht. Die beiden denken sich in hochkomplexe Infrastruktur- und Softwarethemen rein, arbeiten sich in jede Anforderung ein, die wir ihnen hinlegen, und bauen Vernetzung, Provisioning und Betrieb so auf, dass am Ende alles zusammenpasst. WZ-IT ist ein hervorragender Partner, wenn es um komplexe Software-, Netzwerk- und Architekturprojekte geht.
Steve KirchnerGeschäftsführer, nextGYM GmbH
Projekt ansehen

International

Gebaut im Ruhrgebiet. Produktiv weltweit.

WZ-IT plant, entwickelt und betreibt Infrastruktur und Software für Kunden in Deutschland und international. Projekte setzen wir remote um und begleiten sie auch nach dem Go-live im laufenden Betrieb.

Ausgewählte Projekte

Kundenstimmen ansehen

  • Lokale KI-Lösung integrieren
  • Souveräne Infrastruktur modernisieren
  • Open-Source-KI-Architektur entwerfen
  • Souveränen Open-Source-Stack planen
  • Proxmox & Backup absichern lassen
  • Legacy-Software modernisieren
  • Cloud-Kosten senken - bis −81 %
  • HA-Proxmox-Cluster aufbauen
  • Mit Managed Proxmox virtualisieren
  • Kollaboration managen lassen
  • Vom Prototyp in den Betrieb
  • Standorte und Cluster sicher verbinden

Anfrage

Ergebnis in eine belastbare Konfiguration überführen

Der Simulator zeigt Richtwerte aus Messungen. Für ein Angebot prüfen wir Modell, Quantisierung, Last und Integrationen gemeinsam.

  • Direkt mit Timo und Robin - kein Vertrieb, kein Sales-Pitch
  • Ehrliche Einschätzung, auch wenn wir nicht der richtige Partner sind
  • Konkrete nächste Schritte für Infrastruktur, Software oder KI

Kein Risiko: Im schlechtesten Fall gehen Sie mit mehr Klarheit über Ihr Projekt heraus als vorher.

Timo und Robin, Gründer von WZ-IT

Welche Infrastruktur soll geprüft werden?

Übernehmen Sie die wichtigsten Annahmen aus dem Rechner in das Freitextfeld.

Antwort in der Regel innerhalb eines Werktags. Bitte senden Sie noch keine Zugangsdaten.

Die Beratung von WZ-IT zu unserer Azure-Migration war schon im Erstgespräch fachlich sehr fundiert und völlig unverbindlich - wir haben eine Menge mitgenommen.
Jakob ÖschlbergerInno7 GmbH