AI Cube · 1 × NVIDIA GB10 · 128 GB Unified Memory
nvidia/Qwen3.6-35B-A3B-NVFP4
- ≈ 108 tok/s · Einzelchat
- ≈ 43 tok/s · 8 parallele Chats · je Chat
- ≈ 320 tok/s · 8 parallele Chats · gesamt
- Architektur: 35B gesamt · 3B aktiv
- Checkpoint: NVIDIA NVFP4
- Runtime: vLLM · FP8 KV-Cache · MTP-2
- Test-Workload: 1.024 Input · 256 Output



