Sie möchten Qwen für Chat, Coding oder Dokumente nutzen, ohne Eingaben an eine fremde API zu senden. Wir betreiben den passenden Qwen-Checkpoint auf einem dedizierten GPU-Server in einem deutschen Rechenzentrum.
Unternehmen weltweit vertrauen WZ-IT
Qwen ist die Open-Weight-Modellfamilie von Alibaba. Die aktuellen Modelle decken allgemeinen Chat mit Bildeingabe (Qwen3.8-27B), große Mixture-of-Experts-Modelle (Qwen3.5-122B-A10B) und spezialisierte Coding-Modelle (Qwen3-Coder-Next) ab. Die hier behandelten Checkpoints stehen unter Apache 2.0.
Auf einem eigenen Server laufen die Gewichte lokal. Eingaben, Dokumente und Quellcode gehen nicht an Alibaba oder eine andere Modell-API, und die Kosten hängen nicht von der Zahl der Tokens ab.
Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum. Mit Auftragsverarbeitungsvertrag, ohne Datenweg zu einer Modell-API.
Fester Monatspreis je Serverstufe statt Abrechnung nach verbrauchten Tokens. Mehr Anfragen erhöhen die Rechnung nicht.
Checkpoint und Quantisierung bleiben, bis Sie einem Wechsel zustimmen. Kein stilles Modell-Update durch einen Anbieter.
Herstellerangaben und Größe der Gewichtsdateien je Format, mit Quelle.
| Checkpoint | Veröffentlicht | Parameter | Kontext laut Hersteller | Gewichte je Format |
|---|---|---|---|---|
| Qwen/Qwen3.8-27B | 08/2026 | 27,8 Mrd. (dense, mit Vision) | 262.144 Tokens nativ | |
| Qwen/Qwen3.5-122B-A10B | 02/2026 | 122 Mrd. gesamt / 10 Mrd. aktiv (MoE) | 262.144 Tokens nativ | |
| Qwen/Qwen3-Coder-Next | 02/2026 | 80 Mrd. gesamt / 3 Mrd. aktiv (MoE) | 262.144 Tokens nativ |
GB = 10⁹ Bytes, Summe der Gewichtsdateien im genannten Hugging-Face-Repository. Zusätzlich braucht der Betrieb Speicher für KV-Cache, Runtime und gegebenenfalls Bildverarbeitung. Stand Oktober 2026.
Qwen3.8-Flash-Next steht unter der Qwen Community License 1.0. Sie verlangt für Unternehmen mit Model-as-a-Service- oder AI-Work-Assistant-Geschäft eine separate Lizenz von Qwen vor jeder kommerziellen Nutzung. Dieses Modell bieten wir deshalb nicht im gehosteten Betrieb an. Lizenztext
Technische Einordnung, keine Rechtsberatung. Maßgeblich ist der Lizenztext der eingesetzten Modellversion.
Open-Source-LLM-Lizenzen im VergleichDie Empfehlung folgt aus der Größe der Gewichte plus Reserve für Kontext und Runtime.
| Modell | Format | Gewichte | Mindestens empfohlen | Hinweis |
|---|---|---|---|---|
| Qwen3.8-27B | BF16 | 55,6 GB | Managed GPU Server 96 | |
| Qwen3.8-27B | FP8 | 30,9 GB | Managed GPU Server 96 | |
| Qwen3.8-27B | NVFP4 | 21,9 GB | Managed GPU Server 96 | Die Gewichte allein belegen fast die gesamten 24 GB. Für Kontext und Runtime bleibt dort kein Raum. |
| Qwen3.5-122B-A10B | FP8 | 127,2 GB | Managed GPU Server 192 | |
| Qwen3.5-122B-A10B | BF16 | 250,2 GB | Managed GPU Server 384 | |
| Qwen3-Coder-Next | FP8 | 80,4 GB | Managed GPU Server 192 | Auf 96 GB bleiben nach den Gewichten rund 15 GB für Kontext und Runtime. Das reicht nur für kurze Kontexte und wenige parallele Anfragen. |
| Qwen3-Coder-Next | BF16 | 159,4 GB | Managed GPU Server 384 |
Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.
1 × RTX PRO 4000 Blackwell, 24 GB GPU-Speicher
699 € netto / Monat, monatlich kündbar
499 € netto Einrichtung einmalig
Konfiguration ansehenFür diese Familie relevant
1 × RTX PRO 6000 Blackwell Max-Q, 96 GB GPU-Speicher
1.799 € netto / Monat, monatlich kündbar
999 € netto Einrichtung einmalig
Konfiguration ansehenFür diese Familie relevant
2 × RTX PRO 6000 Blackwell Max-Q, 192 GB GPU-Speicher
Preis und Laufzeit auf Anfrage
Konfiguration ansehenFür diese Familie relevant
4 × RTX PRO 6000 Blackwell Max-Q, 384 GB GPU-Speicher
Preis und Laufzeit auf Anfrage
Konfiguration ansehenDer Managed GPU Server 288 mit drei GPUs ist für mehrere Modelle nebeneinander gedacht, weil vLLM ein Modell nur bei durch die GPU-Zahl teilbaren Attention-Heads verteilt.
Architektur, Quantisierung und Verteilung auf mehrere GPUs.
Qwen3.8-27B nutzt die Architektur Qwen3_5ForConditionalGeneration, Qwen3.5-122B-A10B die MoE-Variante davon und Qwen3-Coder-Next Qwen3NextForCausalLM. Alle drei stehen in der Liste der von vLLM unterstützten Modelle.
Qwen veröffentlicht offizielle FP8-Checkpoints. Die NVFP4-Fassung von Qwen3.8-27B stammt von NVIDIA und ist Mixed Precision: MLP-Schichten in NVFP4, Attention in FP8. Qualität und Speicherbedarf vergleichen wir je Format auf der Zielhardware.
Qwen3.5-122B-A10B hat 32 Attention-Heads, Qwen3-Coder-Next 16. Beide lassen sich in vLLM auf zwei oder vier GPUs verteilen. Drei GPUs teilen die Heads nicht ohne Rest, deshalb ist der Server mit drei GPUs für mehrere Modelle nebeneinander gedacht.
Die Modelle unterstützen nativ 262.144 Tokens. Die eingestellte Kontextlänge legen wir nach verfügbarem GPU-Speicher und Parallelität fest. Der volle Herstellerkontext ist nicht automatisch Teil jeder Stufe.
Der Managed GPU Server ist eine betriebene Modellumgebung, kein leerer Server.
Ein abgestimmtes Modell in der vereinbarten Quantisierung, bereitgestellt über eine gemanagte vLLM-Inferenzschicht.
Anwendungen und Coding-Clients binden den Server über Basis-URL und API-Schlüssel an.
Gemanagte Chat-Oberfläche für Teams, die das Modell ohne eigene Anwendung nutzen.
Host, GPU, vLLM und Open WebUI werden proaktiv überwacht, Störungen nach Service Level bearbeitet.
Betriebssystem, Treiber, vLLM und Open WebUI werden geprüft und kontrolliert aktualisiert. Modellwechsel nur nach Absprache.
Auftragsverarbeitungsvertrag, dokumentierte Konfiguration und ein persönlicher Ansprechpartner.
Leistungsumfang, Preise und Mehr-GPU-Server stehen auf der Produktseite.
Managed GPU Server ansehengpt-oss Hosting
gpt-oss Hosting in Deutschland: gpt-oss-120b und gpt-oss-20b von OpenAI auf dedizierter GPU, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehenGemma Hosting
Gemma Hosting in Deutschland: Gemma 4 31B, 26B A4B und 12B von Google auf dedizierter GPU, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehenMistral Hosting
Mistral Hosting in Deutschland: Mistral Small 4, Devstral Small 2 und Mistral Medium 3.5 auf dedizierter GPU, mit vLLM, Lizenzprüfung und Betrieb mit AVV.
Familie ansehenDevstral Hosting
Devstral Hosting in Deutschland: Devstral Small 2 und Devstral 2 von Mistral AI für Coding-Agenten, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehenDeepSeek Hosting
DeepSeek Hosting in Deutschland: DeepSeek-V4-Flash auf einem dedizierten Server mit vier GPUs, mit vLLM, MIT-Lizenz und ohne Datenweg zur DeepSeek-API.
Familie ansehenLlama Hosting
Llama Hosting in Deutschland: warum Llama 4 für EU-Unternehmen lizenzrechtlich ausscheidet, wie Llama 3.3 70B läuft und welche Alternativen es gibt.
Familie ansehenModell prüfen lassen
Nennen Sie Modell, Kontextlänge und gleichzeitige Anfragen. Wir prüfen Checkpoint, Lizenz und Serverstufe vor dem Angebot.
Lizenz, Serverstufe, Datenweg und Betrieb
Für allgemeinen Chat, Dokumente und Bildeingabe ist Qwen3.8-27B der naheliegende Einstieg. Mindestens empfohlen ist der Managed GPU Server 96, in BF16, FP8 oder NVFP4. Für Softwareentwicklung mit Agenten kommt Qwen3-Coder-Next hinzu, mindestens empfohlen ist dort der Managed GPU Server 192.
Qwen3.8-27B, Qwen3.5-122B-A10B und Qwen3-Coder-Next stehen unter Apache 2.0. Die kommerzielle Nutzung ist ohne Umsatz- oder Nutzerschwelle erlaubt. Ausgenommen ist Qwen3.8-Flash-Next: Die Qwen Community License verlangt für bestimmte Geschäftsmodelle eine separate Lizenz, deshalb bieten wir dieses Modell nicht an.
Nein. Beim Hosting laufen die Modellgewichte auf Ihrem dedizierten Server in einem deutschen Rechenzentrum. Es gibt keine Verbindung zu einer Alibaba-API. Anfragen, Dokumente und Antworten bleiben auf dem Server und in den Systemen, die Sie anbinden.
Bei Mixture-of-Experts-Modellen müssen alle Experten im GPU-Speicher liegen, auch wenn pro Token nur ein Teil rechnet. Die FP8-Gewichte belegen rund 80 GB. Für Kontext, KV-Cache und Runtime bleibt auf 96 GB wenig Raum, deshalb empfehlen wir mindestens zwei GPUs.
Das Modell unterstützt diesen Kontext, aber jeder lange Kontext belegt GPU-Speicher für den KV-Cache. Wir stellen die Kontextlänge passend zu Serverstufe und gleichzeitigen Anfragen ein und nennen den Wert im Angebot.
Neue Checkpoints prüfen wir vor dem Wechsel auf Lizenz, vLLM-Unterstützung und Speicherbedarf. Der Wechsel erfolgt nach Absprache in einem Wartungsfenster, die bisherige Version bleibt bis zur Abnahme verfügbar.
Ja. vLLM stellt eine OpenAI-kompatible API bereit. Anwendungen, die heute eine OpenAI-kompatible Schnittstelle nutzen, sprechen den Server über Basis-URL und API-Schlüssel an. Open WebUI steht zusätzlich als Chat-Oberfläche bereit.
Der Einstieg für Qwen ist der Managed GPU Server 96, mindestens empfohlen für Qwen3.8-27B: 1.799 € netto / Monat plus 999 € netto Einrichtung einmalig, mit dediziertem Server, vLLM, Open WebUI und Managed-Betrieb durch WZ-IT. Größere Varianten brauchen einen Mehr-GPU-Server, dessen Preis wir auf Anfrage nennen. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.