WZ-IT Logo
Devstral Hosting

Devstral Hosting in Deutschland: Coding-Modelle von Mistral selbst betreiben

Sie möchten Coding-Agenten und IDE-Assistenten mit einem eigenen Modell betreiben, ohne Quellcode an eine fremde API zu senden. Wir betreiben Devstral auf einem dedizierten GPU-Server in einem deutschen Rechenzentrum.

Betrieb in deutschem RechenzentrumBetrieb mit AVVvLLM und OpenAI-kompatible API

Unternehmen weltweit vertrauen WZ-IT

Bewertungen

Unternehmen weltweit vertrauen WZ-IT

Stadtwerke BrühlDGHO e.V.ABCO Water SystemsGolem.deEVADXBnextGYMAInergyml&sOdiseo SolutionsAnnotaARGESweetConnect GmbH
Ausgangslage

Warum Devstral selbst betreiben

Devstral ist die Coding-Linie von Mistral AI. Die Modelle sind auf Agenten für die Softwareentwicklung ausgelegt: Codebasis durchsuchen, Änderungen über mehrere Dateien vornehmen, Werkzeuge aufrufen. Devstral Small 2 hat 24 Mrd. Parameter, nimmt auch Bilder entgegen und steht unter Apache 2.0. Devstral 2 hat 123 Mrd. Parameter und steht unter einer Modified MIT License mit Umsatzschwelle.

Coding-Agenten senden große Teile einer Codebasis als Kontext an das Modell. Auf einem eigenen Server bleiben Quellcode, Diffs und Testausgaben im deutschen Rechenzentrum. IDE-Erweiterungen und Agenten-Clients sprechen den Server über die OpenAI-kompatible API von vLLM an. Die allgemeinen Modelle Mistral Small 4 und Mistral Medium 3.5 ordnen wir auf der Seite zu Mistral Hosting ein.

  • Daten bleiben in Deutschland

    Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum. Mit Auftragsverarbeitungsvertrag, ohne Datenweg zu einer Modell-API.

  • Planbare Kosten

    Fester Monatspreis je Serverstufe statt Abrechnung nach verbrauchten Tokens. Mehr Anfragen erhöhen die Rechnung nicht.

  • Modellversion unter Kontrolle

    Checkpoint und Quantisierung bleiben, bis Sie einem Wechsel zustimmen. Kein stilles Modell-Update durch einen Anbieter.

Modellfakten

Devstral-Checkpoints im Überblick

Herstellerangaben und Größe der Gewichtsdateien je Format, mit Quelle.

CheckpointVeröffentlichtParameterKontext laut HerstellerGewichte je Format
mistralai/Devstral-Small-2-24B-Instruct-251212/202524 Mrd. (dense, mit Vision)256K Tokens
mistralai/Devstral-2-123B-Instruct-251212/2025123 Mrd. (dense, nur Text)256K Tokens

GB = 10⁹ Bytes, Summe der Gewichtsdateien im genannten Hugging-Face-Repository. Zusätzlich braucht der Betrieb Speicher für KV-Cache, Runtime und gegebenenfalls Bildverarbeitung. Stand Oktober 2026.

Lizenz

Devstral: Lizenz und kommerzielle Nutzung

Lizenz
Apache 2.0 (Devstral Small 2) / Modified MIT (Devstral 2) (Lizenztext, Modellkarte Devstral Small 2)
Kommerzielle Nutzung
Devstral Small 2: ja, ohne Umsatz- oder Nutzerschwelle. Devstral 2: nur wenn der konsolidierte weltweite Monatsumsatz Ihres Unternehmens (oder Ihres Arbeitgebers) im Vormonat 20 Mio. USD nicht überschreitet.
Pflichten und Schwellen
Modified MIT: Namensnennung und Lizenzhinweis beilegen. Oberhalb der Umsatzschwelle bestehen keine Rechte aus der Lizenz, auch nicht für abgeleitete oder kombinierte Modelle; eine kommerzielle Lizenz vergibt Mistral AI auf Anfrage. Apache 2.0: Lizenztext und Hinweise bei Weitergabe beilegen.
Prüfstand
Stand Oktober 2026

Technische Einordnung, keine Rechtsberatung. Maßgeblich ist der Lizenztext der eingesetzten Modellversion.

Open-Source-LLM-Lizenzen im Vergleich
Serverstufe

Mindestens empfohlene Serverstufe für Devstral

Die Empfehlung folgt aus der Größe der Gewichte plus Reserve für Kontext und Runtime.

ModellFormatGewichteMindestens empfohlenHinweis
Devstral Small 2FP825,8 GBManaged GPU Server 96Die Gewichte allein sind größer als 24 GB. Die Reserve auf 96 GB geht in Kontext und gleichzeitige Agentenläufe.
Devstral 2FP8128,2 GBManaged GPU Server 192Lizenzhinweis: keine Rechte bei mehr als 20 Mio. USD konsolidiertem Monatsumsatz des Unternehmens.

Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Mistral veröffentlicht beide Modelle als FP8-Checkpoint. Die Repositories enthalten die Gewichte zusätzlich ein zweites Mal im Format consolidated, das beim Betrieb nicht doppelt geladen wird.

Die Stufen des Managed GPU Servers

Managed GPU Server 24

1 × RTX PRO 4000 Blackwell, 24 GB GPU-Speicher

699 € netto / Monat, monatlich kündbar

499 € netto Einrichtung einmalig

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 96

1 × RTX PRO 6000 Blackwell Max-Q, 96 GB GPU-Speicher

1.799 € netto / Monat, monatlich kündbar

999 € netto Einrichtung einmalig

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 192

2 × RTX PRO 6000 Blackwell Max-Q, 192 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Managed GPU Server 384

4 × RTX PRO 6000 Blackwell Max-Q, 384 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Der Managed GPU Server 288 mit drei GPUs ist für mehrere Modelle nebeneinander gedacht, weil vLLM ein Modell nur bei durch die GPU-Zahl teilbaren Attention-Heads verteilt.

vLLM

Devstral mit vLLM betreiben

Architektur, Quantisierung und Verteilung auf mehrere GPUs.

Architekturen

Devstral Small 2 nutzt Mistral3ForConditionalGeneration mit Bild-Encoder, Devstral 2 die reine Textarchitektur Ministral3ForCausalLM. Beide stehen in der Liste der von vLLM unterstützten Modelle. Mistral verlangt für den Betrieb mistral_common ab Version 1.8.6.

Tool Calling für Agenten

Coding-Agenten rufen Werkzeuge über Function Calling auf. vLLM aktiviert das für Devstral mit dem Tool-Call-Parser mistral und automatischer Tool-Auswahl, so wie in der Modellkarte beschrieben. Clients mit OpenAI-kompatibler Schnittstelle nutzen das über Basis-URL und API-Schlüssel.

Kontext und gleichzeitige Agenten

Jeder Agentenlauf hält seinen Kontext im KV-Cache. Lange Kontexte und viele gleichzeitige Läufe teilen sich denselben GPU-Speicher. Mistrals eigenes Beispiel betreibt Devstral Small 2 mit vollen 262.144 Tokens auf zwei GPUs. Auf einer GPU stellen wir Kontextlänge und parallele Läufe passend zu Ihrem Team ein.

Tensor-Parallelität

Devstral Small 2 hat 32 Attention-Heads, Devstral 2 hat 96, beide mit 8 KV-Heads. Beide lassen sich auf zwei oder vier GPUs verteilen. Mistrals Beispiel für Devstral 2 nutzt acht GPUs; für die FP8-Gewichte mit rund 128 GB empfehlen wir mindestens zwei RTX PRO 6000.

Betrieb durch WZ-IT

Was im Betrieb enthalten ist

Der Managed GPU Server ist eine betriebene Modellumgebung, kein leerer Server.

Modell und vLLM

Ein abgestimmtes Modell in der vereinbarten Quantisierung, bereitgestellt über eine gemanagte vLLM-Inferenzschicht.

OpenAI-kompatible API

Anwendungen und Coding-Clients binden den Server über Basis-URL und API-Schlüssel an.

Open WebUI

Gemanagte Chat-Oberfläche für Teams, die das Modell ohne eigene Anwendung nutzen.

24/7 Monitoring

Host, GPU, vLLM und Open WebUI werden proaktiv überwacht, Störungen nach Service Level bearbeitet.

Updates mit CVE-Einordnung

Betriebssystem, Treiber, vLLM und Open WebUI werden geprüft und kontrolliert aktualisiert. Modellwechsel nur nach Absprache.

AVV und Dokumentation

Auftragsverarbeitungsvertrag, dokumentierte Konfiguration und ein persönlicher Ansprechpartner.

Leistungsumfang, Preise und Mehr-GPU-Server stehen auf der Produktseite.

Managed GPU Server ansehen

Modell prüfen lassen

Modell und Serverstufe prüfen lassen

Nennen Sie Modell, Kontextlänge und gleichzeitige Anfragen. Wir prüfen Checkpoint, Lizenz und Serverstufe vor dem Angebot.

Welche Serverstufe soll geprüft werden?

Die Auswahl ist unverbindlich. Wir bestätigen Modell-Fit, Lizenz und Laufzeit vor einem Angebot.

Wie sollen wir antworten?

Antwort in der Regel innerhalb eines Werktags. Bitte senden Sie noch keine Zugangsdaten.

Häufige Fragen zu Devstral Hosting

Lizenz, Serverstufe, Datenweg und Betrieb

Devstral Small 2 ist der Einstieg für IDE-Assistenten und Coding-Agenten, mindestens empfohlen ist der Managed GPU Server 96. Devstral 2 ist das größere Modell, mindestens empfohlen ist der Managed GPU Server 192, und die Lizenz hat eine Umsatzschwelle. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Nur wenn der konsolidierte weltweite Monatsumsatz Ihres Unternehmens oder Ihres Arbeitgebers im Vormonat 20 Mio. USD nicht überschreitet. Darüber gewährt die Modified MIT License keine Rechte, auch nicht für abgeleitete Modelle; eine kommerzielle Lizenz vergibt Mistral AI auf Anfrage. Devstral Small 2 steht unter Apache 2.0 ohne Schwelle.

Clients und IDE-Erweiterungen mit OpenAI-kompatibler Schnittstelle verbinden sich über Basis-URL, API-Schlüssel und Modellname. Mistral nennt in der Modellkarte unter anderem Mistral Vibe, Cline, Kilo Code, OpenHands und SWE-agent. Tool Calling stellt vLLM über den Parser für Mistral-Modelle bereit.

Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum, ohne Verbindung zur Mistral-API. Viele Coding-Clients haben zusätzlich eigene Einstellungen für Anbieter und Telemetrie. Wir stimmen mit Ihnen ab, dass die Clients nur den eigenen Endpunkt ansprechen.

Das hängt weniger von der Zahl der Personen ab als von gleichzeitigen Agentenläufen und deren Kontextlänge. Ein Agent mit großem Repository-Kontext belegt deutlich mehr KV-Cache als eine kurze Chatfrage. Wir legen Kontextlänge und Parallelität mit Ihren typischen Aufgaben fest und nennen die Werte im Angebot.

Devstral Small 2 ist ein Dense-Modell mit 24 Mrd. Parametern und passt auf eine GPU mit 96 GB. Qwen3-Coder-Next ist ein größeres Mixture-of-Experts-Modell und braucht mindestens den Managed GPU Server 192. Welches Modell auf Ihren Repositories bessere Ergebnisse liefert, vergleichen wir mit Ihren Aufgaben.

Die Modelle unterstützen ihn, aber jeder lange Kontext belegt GPU-Speicher. Der volle Kontext ist nicht automatisch Teil jeder Stufe. Wir stellen die Kontextlänge passend zu Serverstufe und gleichzeitigen Agentenläufen ein.

Der Einstieg für Devstral ist der Managed GPU Server 96, mindestens empfohlen für Devstral Small 2: 1.799 € netto / Monat plus 999 € netto Einrichtung einmalig, mit dediziertem Server, vLLM, Open WebUI und Managed-Betrieb durch WZ-IT. Größere Varianten brauchen einen Mehr-GPU-Server, dessen Preis wir auf Anfrage nennen. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Kontakt

Lassen Sie uns über Ihre Idee sprechen

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

E-Mail
[email protected]
Rückruf vereinbaren

Rückruf

Rückruf vereinbaren

Nummer hinterlassen, wir rufen zurück, spätestens am nächsten Werktag.

Für ein ausführliches Gespräch können Sie alternativ einen Termin buchen.

Unternehmen weltweit vertrauen WZ-IT

  • ml&s
  • Rekorder
  • Keymate
  • Führerscheinmacher
  • SolidProof
  • ARGE
  • Boese VA
  • nextGYM
  • SweetConnect GmbH
  • Golem.de
  • Millenium
  • Paritel
  • Yonju
  • EVADXB
  • Mr. Clipart
  • Aphy AG
  • Negosh
  • ABCO Water Systems
1/3 - Themenauswahl33%

Worum geht es bei Ihrer Anfrage?

Wählen Sie zuerst den Leistungsbereich, der am besten zu Ihrem Vorhaben passt.