WZ-IT Logo
DeepSeek Hosting

DeepSeek Hosting in Deutschland: DeepSeek-V4-Flash auf dedizierten GPUs

Sie möchten DeepSeek nutzen, aber keine Daten an die DeepSeek-API in China senden. Wir betreiben die offenen Gewichte auf einem dedizierten Mehr-GPU-Server in einem deutschen Rechenzentrum.

Betrieb in deutschem RechenzentrumBetrieb mit AVVvLLM und OpenAI-kompatible API

Unternehmen weltweit vertrauen WZ-IT

Bewertungen

Unternehmen weltweit vertrauen WZ-IT

Stadtwerke BrühlDGHO e.V.ABCO Water SystemsGolem.deEVADXBnextGYMAInergyml&sOdiseo SolutionsAnnotaARGESweetConnect GmbH
Ausgangslage

Warum DeepSeek selbst betreiben

DeepSeek veröffentlicht seine Modelle als offene Gewichte unter der MIT-Lizenz. Die aktuelle Generation V4 ist auf lange Kontexte bis 1 Mio. Tokens und agentische Aufgaben ausgelegt. Die Modelle sind groß: Schon DeepSeek-V4-Flash umfasst 284 Mrd. Parameter.

Wichtig ist die Unterscheidung zwischen Gewichten und Hersteller-API. Wer die DeepSeek-App oder die DeepSeek-API nutzt, sendet Daten an Server des Herstellers. Beim Hosting laufen die heruntergeladenen Gewichte dagegen auf Ihrem Server in Deutschland, ohne Verbindung zu DeepSeek.

  • Daten bleiben in Deutschland

    Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum. Mit Auftragsverarbeitungsvertrag, ohne Datenweg zu einer Modell-API.

  • Planbare Kosten

    Fester Monatspreis je Serverstufe statt Abrechnung nach verbrauchten Tokens. Mehr Anfragen erhöhen die Rechnung nicht.

  • Modellversion unter Kontrolle

    Checkpoint und Quantisierung bleiben, bis Sie einem Wechsel zustimmen. Kein stilles Modell-Update durch einen Anbieter.

Modellfakten

DeepSeek-Checkpoints im Überblick

Herstellerangaben und Größe der Gewichtsdateien je Format, mit Quelle.

CheckpointVeröffentlichtParameterKontext laut HerstellerGewichte je Format
deepseek-ai/DeepSeek-V4-Flash-073107/2026284 Mrd. gesamt / 13 Mrd. aktiv (MoE)1 Mio. Tokens
deepseek-ai/DeepSeek-V4.1-Flash09/2026552 Mrd. Backbone / 8 bzw. 16 Mrd. aktiv1 Mio. Tokens

GB = 10⁹ Bytes, Summe der Gewichtsdateien im genannten Hugging-Face-Repository. Zusätzlich braucht der Betrieb Speicher für KV-Cache, Runtime und gegebenenfalls Bildverarbeitung. Stand Oktober 2026.

Lizenz

DeepSeek: Lizenz und kommerzielle Nutzung

Lizenz
MIT License (Lizenztext)
Kommerzielle Nutzung
Ja, ohne Umsatz- oder Nutzerschwelle. Die MIT-Lizenz gilt für Repository und Modellgewichte.
Pflichten und Schwellen
Copyright- und Lizenzhinweis bei Weitergabe beilegen. Keine weiteren Nutzungsbedingungen im Repository.
Prüfstand
Stand Oktober 2026

Technische Einordnung, keine Rechtsberatung. Maßgeblich ist der Lizenztext der eingesetzten Modellversion.

Open-Source-LLM-Lizenzen im Vergleich
Serverstufe

Mindestens empfohlene Serverstufe für DeepSeek

Die Empfehlung folgt aus der Größe der Gewichte plus Reserve für Kontext und Runtime.

ModellFormatGewichteMindestens empfohlenHinweis
DeepSeek-V4-Flash-0731FP4/FP8166,9 GBManaged GPU Server 384Auf 192 GB blieben nach den Gewichten nur rund 25 GB für Kontext und Runtime.
DeepSeek-V4.1-FlashFP4/FP8510,3 GBKeine unserer StufenDie Gewichte sind größer als unsere größte Stufe mit 384 GB. Dieses Modell bieten wir nicht an.

Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Die Stufen des Managed GPU Servers

Managed GPU Server 24

1 × RTX PRO 4000 Blackwell, 24 GB GPU-Speicher

699 € netto / Monat, monatlich kündbar

499 € netto Einrichtung einmalig

Konfiguration ansehen

Managed GPU Server 96

1 × RTX PRO 6000 Blackwell Max-Q, 96 GB GPU-Speicher

1.799 € netto / Monat, monatlich kündbar

999 € netto Einrichtung einmalig

Konfiguration ansehen

Managed GPU Server 192

2 × RTX PRO 6000 Blackwell Max-Q, 192 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 384

4 × RTX PRO 6000 Blackwell Max-Q, 384 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Der Managed GPU Server 288 mit drei GPUs ist für mehrere Modelle nebeneinander gedacht, weil vLLM ein Modell nur bei durch die GPU-Zahl teilbaren Attention-Heads verteilt.

vLLM

DeepSeek mit vLLM betreiben

Architektur, Quantisierung und Verteilung auf mehrere GPUs.

Architektur

DeepSeek-V4-Flash nutzt DeepseekV4ForCausalLM, eine von vLLM unterstützte Architektur. DeepSeek-V4.1-Flash nutzt eine neue Encoder-Decoder-Architektur, die zum Prüfzeitpunkt nicht in der Liste der von vLLM unterstützten Modelle steht.

Gewichtsformat

Die Expertengewichte liegen in 4 Bit vor, weitere Teile in FP8. Die Herstellerbeispiele beziehen sich auf GB300-Systeme. Welche Kernel auf der RTX PRO 6000 Blackwell laufen, prüfen wir mit der eingesetzten vLLM-Version vor dem Angebot.

Verteilung

Mit 64 Attention-Heads lässt sich V4-Flash per Tensor-Parallelität auf zwei oder vier GPUs verteilen, alternativ per Expert-Parallelität. Für V4-Flash empfehlen wir mindestens vier GPUs.

Kontext

DeepSeek gibt 1 Mio. Tokens Kontext an. Jede lange Anfrage belegt Speicher für den KV-Cache. Welche Kontextlänge auf dem Server sinnvoll ist, legen wir nach Ihren Anfragen fest. 1 Mio. Tokens sind nicht automatisch Teil der Konfiguration.

Betrieb durch WZ-IT

Was im Betrieb enthalten ist

Der Managed GPU Server ist eine betriebene Modellumgebung, kein leerer Server.

Modell und vLLM

Ein abgestimmtes Modell in der vereinbarten Quantisierung, bereitgestellt über eine gemanagte vLLM-Inferenzschicht.

OpenAI-kompatible API

Anwendungen und Coding-Clients binden den Server über Basis-URL und API-Schlüssel an.

Open WebUI

Gemanagte Chat-Oberfläche für Teams, die das Modell ohne eigene Anwendung nutzen.

24/7 Monitoring

Host, GPU, vLLM und Open WebUI werden proaktiv überwacht, Störungen nach Service Level bearbeitet.

Updates mit CVE-Einordnung

Betriebssystem, Treiber, vLLM und Open WebUI werden geprüft und kontrolliert aktualisiert. Modellwechsel nur nach Absprache.

AVV und Dokumentation

Auftragsverarbeitungsvertrag, dokumentierte Konfiguration und ein persönlicher Ansprechpartner.

Leistungsumfang, Preise und Mehr-GPU-Server stehen auf der Produktseite.

Managed GPU Server ansehen

Modell prüfen lassen

Modell und Serverstufe prüfen lassen

Nennen Sie Modell, Kontextlänge und gleichzeitige Anfragen. Wir prüfen Checkpoint, Lizenz und Serverstufe vor dem Angebot.

Welche Serverstufe soll geprüft werden?

Die Auswahl ist unverbindlich. Wir bestätigen Modell-Fit, Lizenz und Laufzeit vor einem Angebot.

Wie sollen wir antworten?

Antwort in der Regel innerhalb eines Werktags. Bitte senden Sie noch keine Zugangsdaten.

Häufige Fragen zu DeepSeek Hosting

Lizenz, Serverstufe, Datenweg und Betrieb

Nicht beim Hosting. Daten gehen nur dann an DeepSeek, wenn Sie die DeepSeek-App oder die DeepSeek-API nutzen. Wir betreiben die heruntergeladenen Gewichte auf einem dedizierten Server in einem deutschen Rechenzentrum. Das Modell hat dort keine Verbindung zum Hersteller, Anfragen und Antworten bleiben auf dem Server.

Der Betrieb lässt sich datenschutzkonform gestalten: Die Gewichte laufen auf einem dedizierten Server in einem deutschen Rechenzentrum, WZ-IT schließt einen Auftragsverarbeitungsvertrag ab, und es gibt keine Übermittlung an DeepSeek oder in ein Drittland. Die DSGVO-Pflichten für Ihre eigene Verarbeitung, etwa Rechtsgrundlage und Verarbeitungsverzeichnis, bleiben bei Ihnen. Anders ist es bei der DeepSeek-App und der DeepSeek-API: Dort gehen die Daten an den Anbieter in China.

Mindestens empfohlen ist der Managed GPU Server 384 mit vier RTX PRO 6000 Blackwell Max-Q. Die Gewichte belegen rund 167 GB, mit zwei GPUs bliebe zu wenig Speicher für Kontext und gleichzeitige Anfragen.

Nein. Die Gewichte von V4.1-Flash belegen über 500 GB und sind damit größer als unsere größte Stufe. Außerdem steht die Architektur zum Prüfzeitpunkt nicht in der Liste der von vLLM unterstützten Modelle.

Ja. Repository und Modellgewichte stehen unter der MIT-Lizenz, ohne Umsatz- oder Nutzerschwelle. Bei Weitergabe ist der Lizenzhinweis beizulegen.

Die aktuelle V4-Generation hat kein Modell, das sich auf einer einzelnen GPU mit 96 GB betreiben lässt. Für eine GPU empfehlen wir Modelle wie Qwen3.8-27B oder gpt-oss-120b, die wir auf den jeweiligen Familienseiten einordnen.

Modellgewichte im Safetensors-Format enthalten nur Zahlen, keinen ausführbaren Code. Den Inferenzcode liefert vLLM. Zusätzliche Skripte aus dem Repository setzen wir nur nach Prüfung ein, ausgehende Verbindungen des Servers sind abgestimmt.

Mindestens empfohlen für DeepSeek-V4-Flash-0731 ist der Managed GPU Server 384. Den Preis für Mehr-GPU-Server nennen wir auf Anfrage, die Laufzeit steht im Angebot. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Kontakt

Lassen Sie uns über Ihre Idee sprechen

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

E-Mail
[email protected]
Rückruf vereinbaren

Rückruf

Rückruf vereinbaren

Nummer hinterlassen, wir rufen zurück, spätestens am nächsten Werktag.

Für ein ausführliches Gespräch können Sie alternativ einen Termin buchen.

Unternehmen weltweit vertrauen WZ-IT

  • ml&s
  • Rekorder
  • Keymate
  • Führerscheinmacher
  • SolidProof
  • ARGE
  • Boese VA
  • nextGYM
  • SweetConnect GmbH
  • Golem.de
  • Millenium
  • Paritel
  • Yonju
  • EVADXB
  • Mr. Clipart
  • Aphy AG
  • Negosh
  • ABCO Water Systems
1/3 - Themenauswahl33%

Worum geht es bei Ihrer Anfrage?

Wählen Sie zuerst den Leistungsbereich, der am besten zu Ihrem Vorhaben passt.