WZ-IT Logo
Gemma Hosting

Gemma Hosting in Deutschland: Gemma 4 auf dedizierter GPU betreiben

Sie möchten ein mehrsprachiges Modell mit Bildeingabe nutzen, das unter Apache 2.0 steht. Wir betreiben Gemma 4 auf einem dedizierten GPU-Server in einem deutschen Rechenzentrum.

Betrieb in deutschem RechenzentrumBetrieb mit AVVvLLM und OpenAI-kompatible API

Unternehmen weltweit vertrauen WZ-IT

Bewertungen

Unternehmen weltweit vertrauen WZ-IT

Stadtwerke BrühlDGHO e.V.ABCO Water SystemsGolem.deEVADXBnextGYMAInergyml&sOdiseo SolutionsAnnotaARGESweetConnect GmbH
Ausgangslage

Warum Gemma selbst betreiben

Gemma ist die Open-Weight-Familie von Google DeepMind. Gemma 4 gibt es als Dense-Modelle (31B, 12B) und als Mixture-of-Experts-Modell (26B A4B), mit Bildeingabe, über 140 Sprachen und bis zu 256K Kontext. Mit Gemma 4 hat Google die Lizenz auf Apache 2.0 umgestellt.

Für viele Unternehmen ist Gemma 4 interessant, weil Google offizielle 4-Bit-Checkpoints mit Quantization-Aware Training veröffentlicht. Damit lassen sich auch kleinere GPU-Stufen nutzen, ohne auf Community-Quantisierungen angewiesen zu sein.

  • Daten bleiben in Deutschland

    Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum. Mit Auftragsverarbeitungsvertrag, ohne Datenweg zu einer Modell-API.

  • Planbare Kosten

    Fester Monatspreis je Serverstufe statt Abrechnung nach verbrauchten Tokens. Mehr Anfragen erhöhen die Rechnung nicht.

  • Modellversion unter Kontrolle

    Checkpoint und Quantisierung bleiben, bis Sie einem Wechsel zustimmen. Kein stilles Modell-Update durch einen Anbieter.

Modellfakten

Gemma-Checkpoints im Überblick

Herstellerangaben und Größe der Gewichtsdateien je Format, mit Quelle.

CheckpointVeröffentlichtParameterKontext laut HerstellerGewichte je Format
google/gemma-4-31B-it04/202630,7 Mrd. (dense)256K Tokens
google/gemma-4-26B-A4B-it04/202625,2 Mrd. gesamt / 3,8 Mrd. aktiv (MoE)256K Tokens
google/gemma-4-12B-it05/202611,95 Mrd. (dense)256K Tokens

GB = 10⁹ Bytes, Summe der Gewichtsdateien im genannten Hugging-Face-Repository. Zusätzlich braucht der Betrieb Speicher für KV-Cache, Runtime und gegebenenfalls Bildverarbeitung. Stand Oktober 2026.

Lizenz

Gemma: Lizenz und kommerzielle Nutzung

Lizenz
Apache License 2.0 (Gemma 4) (Lizenztext)
Kommerzielle Nutzung
Ja, ohne Umsatz- oder Nutzerschwelle.
Pflichten und Schwellen
Die Lizenzseite zu Gemma 4 enthält den Apache-2.0-Text ohne zusätzliche Nutzungsbedingungen. Gemma 3 und ältere Versionen stehen weiter unter den Gemma Terms of Use mit Prohibited Use Policy.
Prüfstand
Stand Oktober 2026

Technische Einordnung, keine Rechtsberatung. Maßgeblich ist der Lizenztext der eingesetzten Modellversion.

Open-Source-LLM-Lizenzen im Vergleich
Serverstufe

Mindestens empfohlene Serverstufe für Gemma

Die Empfehlung folgt aus der Größe der Gewichte plus Reserve für Kontext und Runtime.

ModellFormatGewichteMindestens empfohlenHinweis
Gemma 4 31BBF1662,5 GBManaged GPU Server 96
Gemma 4 31BQAT W4A1623,3 GBManaged GPU Server 96Die Gewichte belegen fast die gesamten 24 GB. Für Kontext und Runtime ist die nächste Stufe nötig.
Gemma 4 26B A4BBF1651,6 GBManaged GPU Server 96
Gemma 4 12BBF1623,9 GBManaged GPU Server 96
Gemma 4 12BQAT W4A1610,3 GBManaged GPU Server 24

Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Die QAT-Q4_0-Dateien im GGUF-Format sind für llama.cpp und darauf aufbauende Werkzeuge gedacht. Unsere Serverstufen nutzen vLLM, deshalb ordnen wir dort die W4A16-Checkpoints im Format compressed-tensors ein. Für Gemma 4 26B A4B veröffentlicht Google zum Prüfzeitpunkt keinen W4A16-Checkpoint.

Die Stufen des Managed GPU Servers

Für diese Familie relevant

Managed GPU Server 24

1 × RTX PRO 4000 Blackwell, 24 GB GPU-Speicher

699 € netto / Monat, monatlich kündbar

499 € netto Einrichtung einmalig

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 96

1 × RTX PRO 6000 Blackwell Max-Q, 96 GB GPU-Speicher

1.799 € netto / Monat, monatlich kündbar

999 € netto Einrichtung einmalig

Konfiguration ansehen

Managed GPU Server 192

2 × RTX PRO 6000 Blackwell Max-Q, 192 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Managed GPU Server 384

4 × RTX PRO 6000 Blackwell Max-Q, 384 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Der Managed GPU Server 288 mit drei GPUs ist für mehrere Modelle nebeneinander gedacht, weil vLLM ein Modell nur bei durch die GPU-Zahl teilbaren Attention-Heads verteilt.

vLLM

Gemma mit vLLM betreiben

Architektur, Quantisierung und Verteilung auf mehrere GPUs.

Architekturen

Gemma 4 31B und 26B A4B nutzen Gemma4ForConditionalGeneration, Gemma 4 12B die encoderfreie Variante Gemma4UnifiedForConditionalGeneration. Beide stehen in der Liste der von vLLM unterstützten Modelle.

Quantisierung

Für vLLM veröffentlicht Google die QAT-Checkpoints im Format compressed-tensors (W4A16: 4-Bit-Gewichte, 16-Bit-Aktivierungen). Die GGUF-Dateien mit Q4_0 richten sich an llama.cpp.

Hybride Attention

Gemma 4 wechselt zwischen lokaler Sliding-Window-Attention und globaler Attention. Das senkt den Speicherbedarf langer Kontexte, ersetzt aber nicht die Auslegung von Kontextlänge und Parallelität.

Tensor-Parallelität

Gemma 4 31B hat 32 Attention-Heads, 26B A4B und 12B haben 16. Für die genannten Checkpoints reicht eine GPU. Zwei GPUs kommen bei langen Kontexten oder mehreren Modellen auf einem Server in Frage.

Betrieb durch WZ-IT

Was im Betrieb enthalten ist

Der Managed GPU Server ist eine betriebene Modellumgebung, kein leerer Server.

Modell und vLLM

Ein abgestimmtes Modell in der vereinbarten Quantisierung, bereitgestellt über eine gemanagte vLLM-Inferenzschicht.

OpenAI-kompatible API

Anwendungen und Coding-Clients binden den Server über Basis-URL und API-Schlüssel an.

Open WebUI

Gemanagte Chat-Oberfläche für Teams, die das Modell ohne eigene Anwendung nutzen.

24/7 Monitoring

Host, GPU, vLLM und Open WebUI werden proaktiv überwacht, Störungen nach Service Level bearbeitet.

Updates mit CVE-Einordnung

Betriebssystem, Treiber, vLLM und Open WebUI werden geprüft und kontrolliert aktualisiert. Modellwechsel nur nach Absprache.

AVV und Dokumentation

Auftragsverarbeitungsvertrag, dokumentierte Konfiguration und ein persönlicher Ansprechpartner.

Leistungsumfang, Preise und Mehr-GPU-Server stehen auf der Produktseite.

Managed GPU Server ansehen

Modell prüfen lassen

Modell und Serverstufe prüfen lassen

Nennen Sie Modell, Kontextlänge und gleichzeitige Anfragen. Wir prüfen Checkpoint, Lizenz und Serverstufe vor dem Angebot.

Welche Serverstufe soll geprüft werden?

Die Auswahl ist unverbindlich. Wir bestätigen Modell-Fit, Lizenz und Laufzeit vor einem Angebot.

Wie sollen wir antworten?

Antwort in der Regel innerhalb eines Werktags. Bitte senden Sie noch keine Zugangsdaten.

Häufige Fragen zu Gemma Hosting

Lizenz, Serverstufe, Datenweg und Betrieb

Gemma 4 12B als QAT-W4A16-Checkpoint ist die Variante für den Managed GPU Server 24. Für mehr Qualität ist Gemma 4 31B in BF16 oder W4A16 der nächste Schritt, mindestens empfohlen ist dort der Managed GPU Server 96.

Die Lizenzseite zu Gemma 4 enthält den Text der Apache License 2.0 ohne Verweis auf zusätzliche Nutzungsbedingungen. Die Gemma Terms of Use mit Prohibited Use Policy betreffen Gemma 3 und ältere Versionen.

Gemma 4 12B mit W4A16 ja, die Gewichte belegen rund 10 GB. Gemma 4 31B mit W4A16 belegt rund 23 GB und lässt auf 24 GB keinen Raum für Kontext, dafür empfehlen wir mindestens den Managed GPU Server 96. Die kleineren GGUF-Dateien sind für llama.cpp gedacht, nicht für vLLM.

Für die Gewichte allein: Gemma 4 12B rund 10 GB mit W4A16 und rund 24 GB in BF16, Gemma 4 26B A4B rund 52 GB in BF16, Gemma 4 31B rund 23 GB mit W4A16 und rund 63 GB in BF16. Dazu kommen Kontext und gleichzeitige Anfragen. Mindestens empfohlen ist deshalb der Managed GPU Server 24 für Gemma 4 12B mit W4A16 und der Managed GPU Server 96 für alle anderen Varianten.

Nein. Die Gewichte laufen auf Ihrem dedizierten Server in einem deutschen Rechenzentrum, es gibt keine Verbindung zu Google-Diensten. Das gilt für das gehostete Modell, nicht für Werkzeuge, die Sie zusätzlich an externe Dienste anbinden.

Ja. Alle hier genannten Gemma-4-Modelle nehmen Text und Bilder entgegen und geben Text aus. Bildeingaben belegen zusätzlichen Kontext, das berücksichtigen wir bei der Auslegung.

Google gibt Unterstützung für über 140 Sprachen an. Für Ihren Anwendungsfall testen wir Antworten mit eigenen Beispielen, bevor das Modell produktiv geht.

Der Einstieg für Gemma ist der Managed GPU Server 24, mindestens empfohlen für Gemma 4 12B: 699 € netto / Monat plus 499 € netto Einrichtung einmalig, mit dediziertem Server, vLLM, Open WebUI und Managed-Betrieb durch WZ-IT. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Kontakt

Lassen Sie uns über Ihre Idee sprechen

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

E-Mail
[email protected]
Rückruf vereinbaren

Rückruf

Rückruf vereinbaren

Nummer hinterlassen, wir rufen zurück, spätestens am nächsten Werktag.

Für ein ausführliches Gespräch können Sie alternativ einen Termin buchen.

Unternehmen weltweit vertrauen WZ-IT

  • ml&s
  • Rekorder
  • Keymate
  • Führerscheinmacher
  • SolidProof
  • ARGE
  • Boese VA
  • nextGYM
  • SweetConnect GmbH
  • Golem.de
  • Millenium
  • Paritel
  • Yonju
  • EVADXB
  • Mr. Clipart
  • Aphy AG
  • Negosh
  • ABCO Water Systems
1/3 - Themenauswahl33%

Worum geht es bei Ihrer Anfrage?

Wählen Sie zuerst den Leistungsbereich, der am besten zu Ihrem Vorhaben passt.