WZ-IT Logo
Mistral Hosting

Mistral Hosting in Deutschland: Mistral-Modelle auf dedizierter GPU betreiben

Sie möchten Modelle des französischen Herstellers Mistral AI selbst betreiben und dabei die Lizenz je Modell richtig einordnen. Wir betreiben den passenden Checkpoint auf einem dedizierten GPU-Server in einem deutschen Rechenzentrum.

Betrieb in deutschem RechenzentrumBetrieb mit AVVvLLM und OpenAI-kompatible API

Unternehmen weltweit vertrauen WZ-IT

Bewertungen

Unternehmen weltweit vertrauen WZ-IT

Stadtwerke BrühlDGHO e.V.ABCO Water SystemsGolem.deEVADXBnextGYMAInergyml&sOdiseo SolutionsAnnotaARGESweetConnect GmbH
Ausgangslage

Warum Mistral selbst betreiben

Mistral AI veröffentlicht mehrere Modelllinien mit unterschiedlichen Lizenzen. Mistral Small 4 vereint Chat, Reasoning und Coding in einem Mixture-of-Experts-Modell unter Apache 2.0. Devstral Small 2 ist auf Softwareentwicklung ausgerichtet. Mistral Medium 3.5 und Devstral 2 sind größere Dense-Modelle unter einer Modified MIT License mit Umsatzschwelle.

Gerade weil die Lizenzen innerhalb der Familie abweichen, prüfen wir vor dem Angebot, welcher Checkpoint für Ihr Unternehmen zulässig ist. Betrieben wird das Modell auf Ihrem dedizierten Server, ohne Verbindung zur Mistral-API.

  • Daten bleiben in Deutschland

    Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum. Mit Auftragsverarbeitungsvertrag, ohne Datenweg zu einer Modell-API.

  • Planbare Kosten

    Fester Monatspreis je Serverstufe statt Abrechnung nach verbrauchten Tokens. Mehr Anfragen erhöhen die Rechnung nicht.

  • Modellversion unter Kontrolle

    Checkpoint und Quantisierung bleiben, bis Sie einem Wechsel zustimmen. Kein stilles Modell-Update durch einen Anbieter.

Modellfakten

Mistral-Checkpoints im Überblick

Herstellerangaben und Größe der Gewichtsdateien je Format, mit Quelle.

CheckpointVeröffentlichtParameterKontext laut HerstellerGewichte je Format
mistralai/Mistral-Small-4-119B-260303/2026119 Mrd. gesamt / 6,5 Mrd. aktiv (MoE)256K Tokens
mistralai/Devstral-Small-2-24B-Instruct-251212/202524 Mrd. (dense)256K Tokens
mistralai/Mistral-Medium-3.5-128B05/2026128 Mrd. (dense)256K Tokens
mistralai/Devstral-2-123B-Instruct-251212/2025123 Mrd. (dense)256K Tokens

GB = 10⁹ Bytes, Summe der Gewichtsdateien im genannten Hugging-Face-Repository. Zusätzlich braucht der Betrieb Speicher für KV-Cache, Runtime und gegebenenfalls Bildverarbeitung. Stand Oktober 2026.

Lizenz

Mistral: Lizenz und kommerzielle Nutzung

Lizenz
Apache 2.0 (Small 4, Devstral Small 2) / Modified MIT (Medium 3.5, Devstral 2) (Lizenztext)
Kommerzielle Nutzung
Mistral Small 4 und Devstral Small 2: ja, ohne Schwelle. Mistral Medium 3.5 und Devstral 2: nur für Unternehmen, deren konsolidierter weltweiter Monatsumsatz im Vormonat 20 Mio. USD nicht überschreitet.
Pflichten und Schwellen
Modified MIT: Namensnennung und Lizenzhinweis beilegen. Oberhalb der Umsatzschwelle bestehen keine Rechte aus der Lizenz, auch nicht für abgeleitete Modelle; eine kommerzielle Lizenz vergibt Mistral AI auf Anfrage.
Prüfstand
Stand Oktober 2026

Technische Einordnung, keine Rechtsberatung. Maßgeblich ist der Lizenztext der eingesetzten Modellversion.

Open-Source-LLM-Lizenzen im Vergleich
Serverstufe

Mindestens empfohlene Serverstufe für Mistral

Die Empfehlung folgt aus der Größe der Gewichte plus Reserve für Kontext und Runtime.

ModellFormatGewichteMindestens empfohlenHinweis
Mistral Small 4NVFP470,8 GBManaged GPU Server 96
Mistral Small 4FP8120,9 GBManaged GPU Server 192
Devstral Small 2FP825,8 GBManaged GPU Server 96
Mistral Medium 3.5FP8133,6 GBManaged GPU Server 192Lizenzhinweis: keine Rechte bei mehr als 20 Mio. USD konsolidiertem Monatsumsatz.
Devstral 2FP8128,2 GBManaged GPU Server 192Lizenzhinweis: keine Rechte bei mehr als 20 Mio. USD konsolidiertem Monatsumsatz.

Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Die FP8-Größen sind die Summe der Gewichtsdateien eines Formats. Die Mistral-Repositories enthalten die Gewichte zusätzlich ein zweites Mal im Format consolidated, das beim Betrieb nicht doppelt geladen wird.

Die Stufen des Managed GPU Servers

Managed GPU Server 24

1 × RTX PRO 4000 Blackwell, 24 GB GPU-Speicher

699 € netto / Monat, monatlich kündbar

499 € netto Einrichtung einmalig

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 96

1 × RTX PRO 6000 Blackwell Max-Q, 96 GB GPU-Speicher

1.799 € netto / Monat, monatlich kündbar

999 € netto Einrichtung einmalig

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 192

2 × RTX PRO 6000 Blackwell Max-Q, 192 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Managed GPU Server 384

4 × RTX PRO 6000 Blackwell Max-Q, 384 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Der Managed GPU Server 288 mit drei GPUs ist für mehrere Modelle nebeneinander gedacht, weil vLLM ein Modell nur bei durch die GPU-Zahl teilbaren Attention-Heads verteilt.

vLLM

Mistral mit vLLM betreiben

Architektur, Quantisierung und Verteilung auf mehrere GPUs.

Architektur

Mistral Small 4, Mistral Medium 3.5 und Devstral Small 2 nutzen Mistral3ForConditionalGeneration, eine von vLLM unterstützte Architektur. Mistral empfiehlt für den Betrieb das Paket mistral_common in einer aktuellen Version.

NVFP4 und FP8

Mistral veröffentlicht Mistral Small 4 offiziell in FP8 und NVFP4. Die NVFP4-Fassung belegt rund 71 GB und ist damit die Variante für den Managed GPU Server 96. In der Modellkarte nutzt Mistral für beide Formate zwei GPUs.

Attention

Mistral Small 4 nutzt Multi-Head Latent Attention. vLLM braucht dafür ein passendes Attention-Backend, das wir mit der eingesetzten Version auf der RTX PRO 6000 Blackwell prüfen.

Tensor-Parallelität

Mistral Medium 3.5 und Devstral 2 haben 96 Attention-Heads und 8 KV-Heads und lassen sich auf zwei oder vier GPUs verteilen. Die Herstellerbeispiele nutzen acht GPUs; für die FP8-Gewichte mit rund 130 GB empfehlen wir mindestens zwei RTX PRO 6000.

Betrieb durch WZ-IT

Was im Betrieb enthalten ist

Der Managed GPU Server ist eine betriebene Modellumgebung, kein leerer Server.

Modell und vLLM

Ein abgestimmtes Modell in der vereinbarten Quantisierung, bereitgestellt über eine gemanagte vLLM-Inferenzschicht.

OpenAI-kompatible API

Anwendungen und Coding-Clients binden den Server über Basis-URL und API-Schlüssel an.

Open WebUI

Gemanagte Chat-Oberfläche für Teams, die das Modell ohne eigene Anwendung nutzen.

24/7 Monitoring

Host, GPU, vLLM und Open WebUI werden proaktiv überwacht, Störungen nach Service Level bearbeitet.

Updates mit CVE-Einordnung

Betriebssystem, Treiber, vLLM und Open WebUI werden geprüft und kontrolliert aktualisiert. Modellwechsel nur nach Absprache.

AVV und Dokumentation

Auftragsverarbeitungsvertrag, dokumentierte Konfiguration und ein persönlicher Ansprechpartner.

Leistungsumfang, Preise und Mehr-GPU-Server stehen auf der Produktseite.

Managed GPU Server ansehen

Modell prüfen lassen

Modell und Serverstufe prüfen lassen

Nennen Sie Modell, Kontextlänge und gleichzeitige Anfragen. Wir prüfen Checkpoint, Lizenz und Serverstufe vor dem Angebot.

Welche Serverstufe soll geprüft werden?

Die Auswahl ist unverbindlich. Wir bestätigen Modell-Fit, Lizenz und Laufzeit vor einem Angebot.

Wie sollen wir antworten?

Antwort in der Regel innerhalb eines Werktags. Bitte senden Sie noch keine Zugangsdaten.

Häufige Fragen zu Mistral Hosting

Lizenz, Serverstufe, Datenweg und Betrieb

Mistral Small 4 in NVFP4 und Devstral Small 2 in FP8. Beide stehen unter Apache 2.0. Mistral Small 4 in FP8 sowie Mistral Medium 3.5 und Devstral 2 brauchen mindestens den Managed GPU Server 192.

Nur wenn der konsolidierte weltweite Monatsumsatz Ihres Unternehmens im Vormonat 20 Mio. USD nicht überschreitet. Darüber gewährt die Modified MIT License keine Rechte, eine kommerzielle Lizenz vergibt Mistral AI auf Anfrage. Für Mistral Small 4 und Devstral Small 2 gilt Apache 2.0 ohne Schwelle.

Die Herkunft des Modells entscheidet nicht über den Datenschutz. Entscheidend ist, wo und wie es betrieben wird. Bei uns läuft das Modell auf einem dedizierten Server in einem deutschen Rechenzentrum, mit Auftragsverarbeitungsvertrag und ohne Verbindung zur Mistral-API.

Devstral Small 2 ist ein Dense-Modell mit 24 Mrd. Parametern und läuft auf dem Managed GPU Server 96. Qwen3-Coder-Next ist größer und braucht mindestens den Managed GPU Server 192. Welches Modell für Ihre Repositories bessere Ergebnisse liefert, vergleichen wir mit Ihren Aufgaben.

NVFP4 speichert die Gewichte überwiegend mit 4 Bit und belegt rund 71 GB, FP8 rund 121 GB. Für NVFP4 ist mindestens der Managed GPU Server 96 empfohlen, für FP8 der Managed GPU Server 192. Qualitätsunterschiede prüfen wir mit Beispielen aus Ihrem Einsatz.

Ja. vLLM stellt eine OpenAI-kompatible API bereit, zusätzlich steht Open WebUI als Chat-Oberfläche zur Verfügung. Coding-Clients mit OpenAI-kompatibler Schnittstelle lassen sich direkt verbinden.

Der Einstieg für Mistral ist der Managed GPU Server 96, mindestens empfohlen für Mistral Small 4 und Devstral Small 2: 1.799 € netto / Monat plus 999 € netto Einrichtung einmalig, mit dediziertem Server, vLLM, Open WebUI und Managed-Betrieb durch WZ-IT. Größere Varianten brauchen einen Mehr-GPU-Server, dessen Preis wir auf Anfrage nennen. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Kontakt

Lassen Sie uns über Ihre Idee sprechen

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

E-Mail
[email protected]
Rückruf vereinbaren

Rückruf

Rückruf vereinbaren

Nummer hinterlassen, wir rufen zurück, spätestens am nächsten Werktag.

Für ein ausführliches Gespräch können Sie alternativ einen Termin buchen.

Unternehmen weltweit vertrauen WZ-IT

  • ml&s
  • Rekorder
  • Keymate
  • Führerscheinmacher
  • SolidProof
  • ARGE
  • Boese VA
  • nextGYM
  • SweetConnect GmbH
  • Golem.de
  • Millenium
  • Paritel
  • Yonju
  • EVADXB
  • Mr. Clipart
  • Aphy AG
  • Negosh
  • ABCO Water Systems
1/3 - Themenauswahl33%

Worum geht es bei Ihrer Anfrage?

Wählen Sie zuerst den Leistungsbereich, der am besten zu Ihrem Vorhaben passt.