WZ-IT Logo
Qwen Hosting

Qwen Hosting in Deutschland: Qwen-Modelle auf dedizierter GPU betreiben

Sie möchten Qwen für Chat, Coding oder Dokumente nutzen, ohne Eingaben an eine fremde API zu senden. Wir betreiben den passenden Qwen-Checkpoint auf einem dedizierten GPU-Server in einem deutschen Rechenzentrum.

Betrieb in deutschem RechenzentrumBetrieb mit AVVvLLM und OpenAI-kompatible API

Unternehmen weltweit vertrauen WZ-IT

Bewertungen

Unternehmen weltweit vertrauen WZ-IT

Stadtwerke BrühlDGHO e.V.ABCO Water SystemsGolem.deEVADXBnextGYMAInergyml&sOdiseo SolutionsAnnotaARGESweetConnect GmbH
Ausgangslage

Warum Qwen selbst betreiben

Qwen ist die Open-Weight-Modellfamilie von Alibaba. Die aktuellen Modelle decken allgemeinen Chat mit Bildeingabe (Qwen3.8-27B), große Mixture-of-Experts-Modelle (Qwen3.5-122B-A10B) und spezialisierte Coding-Modelle (Qwen3-Coder-Next) ab. Die hier behandelten Checkpoints stehen unter Apache 2.0.

Auf einem eigenen Server laufen die Gewichte lokal. Eingaben, Dokumente und Quellcode gehen nicht an Alibaba oder eine andere Modell-API, und die Kosten hängen nicht von der Zahl der Tokens ab.

  • Daten bleiben in Deutschland

    Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum. Mit Auftragsverarbeitungsvertrag, ohne Datenweg zu einer Modell-API.

  • Planbare Kosten

    Fester Monatspreis je Serverstufe statt Abrechnung nach verbrauchten Tokens. Mehr Anfragen erhöhen die Rechnung nicht.

  • Modellversion unter Kontrolle

    Checkpoint und Quantisierung bleiben, bis Sie einem Wechsel zustimmen. Kein stilles Modell-Update durch einen Anbieter.

Modellfakten

Qwen-Checkpoints im Überblick

Herstellerangaben und Größe der Gewichtsdateien je Format, mit Quelle.

CheckpointVeröffentlichtParameterKontext laut HerstellerGewichte je Format
Qwen/Qwen3.8-27B08/202627,8 Mrd. (dense, mit Vision)262.144 Tokens nativ
Qwen/Qwen3.5-122B-A10B02/2026122 Mrd. gesamt / 10 Mrd. aktiv (MoE)262.144 Tokens nativ
Qwen/Qwen3-Coder-Next02/202680 Mrd. gesamt / 3 Mrd. aktiv (MoE)262.144 Tokens nativ

GB = 10⁹ Bytes, Summe der Gewichtsdateien im genannten Hugging-Face-Repository. Zusätzlich braucht der Betrieb Speicher für KV-Cache, Runtime und gegebenenfalls Bildverarbeitung. Stand Oktober 2026.

Lizenz

Qwen: Lizenz und kommerzielle Nutzung

Lizenz
Apache License 2.0 (Lizenztext)
Kommerzielle Nutzung
Ja, auch für Produkte und Dienste von Unternehmen jeder Größe.
Pflichten und Schwellen
Lizenztext und Copyright-Hinweise bei Weitergabe beilegen, Änderungen kennzeichnen. Keine Umsatz- oder Nutzerschwelle.
Prüfstand
Stand Oktober 2026

Nicht im Angebot

Qwen3.8-Flash-Next steht unter der Qwen Community License 1.0. Sie verlangt für Unternehmen mit Model-as-a-Service- oder AI-Work-Assistant-Geschäft eine separate Lizenz von Qwen vor jeder kommerziellen Nutzung. Dieses Modell bieten wir deshalb nicht im gehosteten Betrieb an. Lizenztext

Technische Einordnung, keine Rechtsberatung. Maßgeblich ist der Lizenztext der eingesetzten Modellversion.

Open-Source-LLM-Lizenzen im Vergleich
Serverstufe

Mindestens empfohlene Serverstufe für Qwen

Die Empfehlung folgt aus der Größe der Gewichte plus Reserve für Kontext und Runtime.

ModellFormatGewichteMindestens empfohlenHinweis
Qwen3.8-27BBF1655,6 GBManaged GPU Server 96
Qwen3.8-27BFP830,9 GBManaged GPU Server 96
Qwen3.8-27BNVFP421,9 GBManaged GPU Server 96Die Gewichte allein belegen fast die gesamten 24 GB. Für Kontext und Runtime bleibt dort kein Raum.
Qwen3.5-122B-A10BFP8127,2 GBManaged GPU Server 192
Qwen3.5-122B-A10BBF16250,2 GBManaged GPU Server 384
Qwen3-Coder-NextFP880,4 GBManaged GPU Server 192Auf 96 GB bleiben nach den Gewichten rund 15 GB für Kontext und Runtime. Das reicht nur für kurze Kontexte und wenige parallele Anfragen.
Qwen3-Coder-NextBF16159,4 GBManaged GPU Server 384

Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Die Stufen des Managed GPU Servers

Managed GPU Server 24

1 × RTX PRO 4000 Blackwell, 24 GB GPU-Speicher

699 € netto / Monat, monatlich kündbar

499 € netto Einrichtung einmalig

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 96

1 × RTX PRO 6000 Blackwell Max-Q, 96 GB GPU-Speicher

1.799 € netto / Monat, monatlich kündbar

999 € netto Einrichtung einmalig

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 192

2 × RTX PRO 6000 Blackwell Max-Q, 192 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 384

4 × RTX PRO 6000 Blackwell Max-Q, 384 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Der Managed GPU Server 288 mit drei GPUs ist für mehrere Modelle nebeneinander gedacht, weil vLLM ein Modell nur bei durch die GPU-Zahl teilbaren Attention-Heads verteilt.

vLLM

Qwen mit vLLM betreiben

Architektur, Quantisierung und Verteilung auf mehrere GPUs.

Architekturen

Qwen3.8-27B nutzt die Architektur Qwen3_5ForConditionalGeneration, Qwen3.5-122B-A10B die MoE-Variante davon und Qwen3-Coder-Next Qwen3NextForCausalLM. Alle drei stehen in der Liste der von vLLM unterstützten Modelle.

Quantisierung

Qwen veröffentlicht offizielle FP8-Checkpoints. Die NVFP4-Fassung von Qwen3.8-27B stammt von NVIDIA und ist Mixed Precision: MLP-Schichten in NVFP4, Attention in FP8. Qualität und Speicherbedarf vergleichen wir je Format auf der Zielhardware.

Tensor-Parallelität

Qwen3.5-122B-A10B hat 32 Attention-Heads, Qwen3-Coder-Next 16. Beide lassen sich in vLLM auf zwei oder vier GPUs verteilen. Drei GPUs teilen die Heads nicht ohne Rest, deshalb ist der Server mit drei GPUs für mehrere Modelle nebeneinander gedacht.

Kontext

Die Modelle unterstützen nativ 262.144 Tokens. Die eingestellte Kontextlänge legen wir nach verfügbarem GPU-Speicher und Parallelität fest. Der volle Herstellerkontext ist nicht automatisch Teil jeder Stufe.

Betrieb durch WZ-IT

Was im Betrieb enthalten ist

Der Managed GPU Server ist eine betriebene Modellumgebung, kein leerer Server.

Modell und vLLM

Ein abgestimmtes Modell in der vereinbarten Quantisierung, bereitgestellt über eine gemanagte vLLM-Inferenzschicht.

OpenAI-kompatible API

Anwendungen und Coding-Clients binden den Server über Basis-URL und API-Schlüssel an.

Open WebUI

Gemanagte Chat-Oberfläche für Teams, die das Modell ohne eigene Anwendung nutzen.

24/7 Monitoring

Host, GPU, vLLM und Open WebUI werden proaktiv überwacht, Störungen nach Service Level bearbeitet.

Updates mit CVE-Einordnung

Betriebssystem, Treiber, vLLM und Open WebUI werden geprüft und kontrolliert aktualisiert. Modellwechsel nur nach Absprache.

AVV und Dokumentation

Auftragsverarbeitungsvertrag, dokumentierte Konfiguration und ein persönlicher Ansprechpartner.

Leistungsumfang, Preise und Mehr-GPU-Server stehen auf der Produktseite.

Managed GPU Server ansehen

Modell prüfen lassen

Modell und Serverstufe prüfen lassen

Nennen Sie Modell, Kontextlänge und gleichzeitige Anfragen. Wir prüfen Checkpoint, Lizenz und Serverstufe vor dem Angebot.

Welche Serverstufe soll geprüft werden?

Die Auswahl ist unverbindlich. Wir bestätigen Modell-Fit, Lizenz und Laufzeit vor einem Angebot.

Wie sollen wir antworten?

Antwort in der Regel innerhalb eines Werktags. Bitte senden Sie noch keine Zugangsdaten.

Häufige Fragen zu Qwen Hosting

Lizenz, Serverstufe, Datenweg und Betrieb

Für allgemeinen Chat, Dokumente und Bildeingabe ist Qwen3.8-27B der naheliegende Einstieg. Mindestens empfohlen ist der Managed GPU Server 96, in BF16, FP8 oder NVFP4. Für Softwareentwicklung mit Agenten kommt Qwen3-Coder-Next hinzu, mindestens empfohlen ist dort der Managed GPU Server 192.

Qwen3.8-27B, Qwen3.5-122B-A10B und Qwen3-Coder-Next stehen unter Apache 2.0. Die kommerzielle Nutzung ist ohne Umsatz- oder Nutzerschwelle erlaubt. Ausgenommen ist Qwen3.8-Flash-Next: Die Qwen Community License verlangt für bestimmte Geschäftsmodelle eine separate Lizenz, deshalb bieten wir dieses Modell nicht an.

Nein. Beim Hosting laufen die Modellgewichte auf Ihrem dedizierten Server in einem deutschen Rechenzentrum. Es gibt keine Verbindung zu einer Alibaba-API. Anfragen, Dokumente und Antworten bleiben auf dem Server und in den Systemen, die Sie anbinden.

Bei Mixture-of-Experts-Modellen müssen alle Experten im GPU-Speicher liegen, auch wenn pro Token nur ein Teil rechnet. Die FP8-Gewichte belegen rund 80 GB. Für Kontext, KV-Cache und Runtime bleibt auf 96 GB wenig Raum, deshalb empfehlen wir mindestens zwei GPUs.

Das Modell unterstützt diesen Kontext, aber jeder lange Kontext belegt GPU-Speicher für den KV-Cache. Wir stellen die Kontextlänge passend zu Serverstufe und gleichzeitigen Anfragen ein und nennen den Wert im Angebot.

Neue Checkpoints prüfen wir vor dem Wechsel auf Lizenz, vLLM-Unterstützung und Speicherbedarf. Der Wechsel erfolgt nach Absprache in einem Wartungsfenster, die bisherige Version bleibt bis zur Abnahme verfügbar.

Ja. vLLM stellt eine OpenAI-kompatible API bereit. Anwendungen, die heute eine OpenAI-kompatible Schnittstelle nutzen, sprechen den Server über Basis-URL und API-Schlüssel an. Open WebUI steht zusätzlich als Chat-Oberfläche bereit.

Der Einstieg für Qwen ist der Managed GPU Server 96, mindestens empfohlen für Qwen3.8-27B: 1.799 € netto / Monat plus 999 € netto Einrichtung einmalig, mit dediziertem Server, vLLM, Open WebUI und Managed-Betrieb durch WZ-IT. Größere Varianten brauchen einen Mehr-GPU-Server, dessen Preis wir auf Anfrage nennen. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Kontakt

Lassen Sie uns über Ihre Idee sprechen

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

E-Mail
[email protected]
Rückruf vereinbaren

Rückruf

Rückruf vereinbaren

Nummer hinterlassen, wir rufen zurück, spätestens am nächsten Werktag.

Für ein ausführliches Gespräch können Sie alternativ einen Termin buchen.

Unternehmen weltweit vertrauen WZ-IT

  • ml&s
  • Rekorder
  • Keymate
  • Führerscheinmacher
  • SolidProof
  • ARGE
  • Boese VA
  • nextGYM
  • SweetConnect GmbH
  • Golem.de
  • Millenium
  • Paritel
  • Yonju
  • EVADXB
  • Mr. Clipart
  • Aphy AG
  • Negosh
  • ABCO Water Systems
1/3 - Themenauswahl33%

Worum geht es bei Ihrer Anfrage?

Wählen Sie zuerst den Leistungsbereich, der am besten zu Ihrem Vorhaben passt.