Sie möchten ein mehrsprachiges Modell mit Bildeingabe nutzen, das unter Apache 2.0 steht. Wir betreiben Gemma 4 auf einem dedizierten GPU-Server in einem deutschen Rechenzentrum.
Unternehmen weltweit vertrauen WZ-IT
Gemma ist die Open-Weight-Familie von Google DeepMind. Gemma 4 gibt es als Dense-Modelle (31B, 12B) und als Mixture-of-Experts-Modell (26B A4B), mit Bildeingabe, über 140 Sprachen und bis zu 256K Kontext. Mit Gemma 4 hat Google die Lizenz auf Apache 2.0 umgestellt.
Für viele Unternehmen ist Gemma 4 interessant, weil Google offizielle 4-Bit-Checkpoints mit Quantization-Aware Training veröffentlicht. Damit lassen sich auch kleinere GPU-Stufen nutzen, ohne auf Community-Quantisierungen angewiesen zu sein.
Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum. Mit Auftragsverarbeitungsvertrag, ohne Datenweg zu einer Modell-API.
Fester Monatspreis je Serverstufe statt Abrechnung nach verbrauchten Tokens. Mehr Anfragen erhöhen die Rechnung nicht.
Checkpoint und Quantisierung bleiben, bis Sie einem Wechsel zustimmen. Kein stilles Modell-Update durch einen Anbieter.
Herstellerangaben und Größe der Gewichtsdateien je Format, mit Quelle.
| Checkpoint | Veröffentlicht | Parameter | Kontext laut Hersteller | Gewichte je Format |
|---|---|---|---|---|
| google/gemma-4-31B-it | 04/2026 | 30,7 Mrd. (dense) | 256K Tokens | |
| google/gemma-4-26B-A4B-it | 04/2026 | 25,2 Mrd. gesamt / 3,8 Mrd. aktiv (MoE) | 256K Tokens | |
| google/gemma-4-12B-it | 05/2026 | 11,95 Mrd. (dense) | 256K Tokens |
GB = 10⁹ Bytes, Summe der Gewichtsdateien im genannten Hugging-Face-Repository. Zusätzlich braucht der Betrieb Speicher für KV-Cache, Runtime und gegebenenfalls Bildverarbeitung. Stand Oktober 2026.
Technische Einordnung, keine Rechtsberatung. Maßgeblich ist der Lizenztext der eingesetzten Modellversion.
Open-Source-LLM-Lizenzen im VergleichDie Empfehlung folgt aus der Größe der Gewichte plus Reserve für Kontext und Runtime.
| Modell | Format | Gewichte | Mindestens empfohlen | Hinweis |
|---|---|---|---|---|
| Gemma 4 31B | BF16 | 62,5 GB | Managed GPU Server 96 | |
| Gemma 4 31B | QAT W4A16 | 23,3 GB | Managed GPU Server 96 | Die Gewichte belegen fast die gesamten 24 GB. Für Kontext und Runtime ist die nächste Stufe nötig. |
| Gemma 4 26B A4B | BF16 | 51,6 GB | Managed GPU Server 96 | |
| Gemma 4 12B | BF16 | 23,9 GB | Managed GPU Server 96 | |
| Gemma 4 12B | QAT W4A16 | 10,3 GB | Managed GPU Server 24 |
Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.
Die QAT-Q4_0-Dateien im GGUF-Format sind für llama.cpp und darauf aufbauende Werkzeuge gedacht. Unsere Serverstufen nutzen vLLM, deshalb ordnen wir dort die W4A16-Checkpoints im Format compressed-tensors ein. Für Gemma 4 26B A4B veröffentlicht Google zum Prüfzeitpunkt keinen W4A16-Checkpoint.
Für diese Familie relevant
1 × RTX PRO 4000 Blackwell, 24 GB GPU-Speicher
699 € netto / Monat, monatlich kündbar
499 € netto Einrichtung einmalig
Konfiguration ansehenFür diese Familie relevant
1 × RTX PRO 6000 Blackwell Max-Q, 96 GB GPU-Speicher
1.799 € netto / Monat, monatlich kündbar
999 € netto Einrichtung einmalig
Konfiguration ansehen2 × RTX PRO 6000 Blackwell Max-Q, 192 GB GPU-Speicher
Preis und Laufzeit auf Anfrage
Konfiguration ansehen4 × RTX PRO 6000 Blackwell Max-Q, 384 GB GPU-Speicher
Preis und Laufzeit auf Anfrage
Konfiguration ansehenDer Managed GPU Server 288 mit drei GPUs ist für mehrere Modelle nebeneinander gedacht, weil vLLM ein Modell nur bei durch die GPU-Zahl teilbaren Attention-Heads verteilt.
Architektur, Quantisierung und Verteilung auf mehrere GPUs.
Gemma 4 31B und 26B A4B nutzen Gemma4ForConditionalGeneration, Gemma 4 12B die encoderfreie Variante Gemma4UnifiedForConditionalGeneration. Beide stehen in der Liste der von vLLM unterstützten Modelle.
Für vLLM veröffentlicht Google die QAT-Checkpoints im Format compressed-tensors (W4A16: 4-Bit-Gewichte, 16-Bit-Aktivierungen). Die GGUF-Dateien mit Q4_0 richten sich an llama.cpp.
Gemma 4 wechselt zwischen lokaler Sliding-Window-Attention und globaler Attention. Das senkt den Speicherbedarf langer Kontexte, ersetzt aber nicht die Auslegung von Kontextlänge und Parallelität.
Gemma 4 31B hat 32 Attention-Heads, 26B A4B und 12B haben 16. Für die genannten Checkpoints reicht eine GPU. Zwei GPUs kommen bei langen Kontexten oder mehreren Modellen auf einem Server in Frage.
Der Managed GPU Server ist eine betriebene Modellumgebung, kein leerer Server.
Ein abgestimmtes Modell in der vereinbarten Quantisierung, bereitgestellt über eine gemanagte vLLM-Inferenzschicht.
Anwendungen und Coding-Clients binden den Server über Basis-URL und API-Schlüssel an.
Gemanagte Chat-Oberfläche für Teams, die das Modell ohne eigene Anwendung nutzen.
Host, GPU, vLLM und Open WebUI werden proaktiv überwacht, Störungen nach Service Level bearbeitet.
Betriebssystem, Treiber, vLLM und Open WebUI werden geprüft und kontrolliert aktualisiert. Modellwechsel nur nach Absprache.
Auftragsverarbeitungsvertrag, dokumentierte Konfiguration und ein persönlicher Ansprechpartner.
Leistungsumfang, Preise und Mehr-GPU-Server stehen auf der Produktseite.
Managed GPU Server ansehenQwen Hosting
Qwen Hosting in Deutschland: Qwen3.8-27B, Qwen3.5-122B und Qwen3-Coder-Next auf dedizierter GPU, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehengpt-oss Hosting
gpt-oss Hosting in Deutschland: gpt-oss-120b und gpt-oss-20b von OpenAI auf dedizierter GPU, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehenMistral Hosting
Mistral Hosting in Deutschland: Mistral Small 4, Devstral Small 2 und Mistral Medium 3.5 auf dedizierter GPU, mit vLLM, Lizenzprüfung und Betrieb mit AVV.
Familie ansehenDevstral Hosting
Devstral Hosting in Deutschland: Devstral Small 2 und Devstral 2 von Mistral AI für Coding-Agenten, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehenDeepSeek Hosting
DeepSeek Hosting in Deutschland: DeepSeek-V4-Flash auf einem dedizierten Server mit vier GPUs, mit vLLM, MIT-Lizenz und ohne Datenweg zur DeepSeek-API.
Familie ansehenLlama Hosting
Llama Hosting in Deutschland: warum Llama 4 für EU-Unternehmen lizenzrechtlich ausscheidet, wie Llama 3.3 70B läuft und welche Alternativen es gibt.
Familie ansehenModell prüfen lassen
Nennen Sie Modell, Kontextlänge und gleichzeitige Anfragen. Wir prüfen Checkpoint, Lizenz und Serverstufe vor dem Angebot.
Lizenz, Serverstufe, Datenweg und Betrieb
Gemma 4 12B als QAT-W4A16-Checkpoint ist die Variante für den Managed GPU Server 24. Für mehr Qualität ist Gemma 4 31B in BF16 oder W4A16 der nächste Schritt, mindestens empfohlen ist dort der Managed GPU Server 96.
Die Lizenzseite zu Gemma 4 enthält den Text der Apache License 2.0 ohne Verweis auf zusätzliche Nutzungsbedingungen. Die Gemma Terms of Use mit Prohibited Use Policy betreffen Gemma 3 und ältere Versionen.
Gemma 4 12B mit W4A16 ja, die Gewichte belegen rund 10 GB. Gemma 4 31B mit W4A16 belegt rund 23 GB und lässt auf 24 GB keinen Raum für Kontext, dafür empfehlen wir mindestens den Managed GPU Server 96. Die kleineren GGUF-Dateien sind für llama.cpp gedacht, nicht für vLLM.
Für die Gewichte allein: Gemma 4 12B rund 10 GB mit W4A16 und rund 24 GB in BF16, Gemma 4 26B A4B rund 52 GB in BF16, Gemma 4 31B rund 23 GB mit W4A16 und rund 63 GB in BF16. Dazu kommen Kontext und gleichzeitige Anfragen. Mindestens empfohlen ist deshalb der Managed GPU Server 24 für Gemma 4 12B mit W4A16 und der Managed GPU Server 96 für alle anderen Varianten.
Nein. Die Gewichte laufen auf Ihrem dedizierten Server in einem deutschen Rechenzentrum, es gibt keine Verbindung zu Google-Diensten. Das gilt für das gehostete Modell, nicht für Werkzeuge, die Sie zusätzlich an externe Dienste anbinden.
Ja. Alle hier genannten Gemma-4-Modelle nehmen Text und Bilder entgegen und geben Text aus. Bildeingaben belegen zusätzlichen Kontext, das berücksichtigen wir bei der Auslegung.
Google gibt Unterstützung für über 140 Sprachen an. Für Ihren Anwendungsfall testen wir Antworten mit eigenen Beispielen, bevor das Modell produktiv geht.
Der Einstieg für Gemma ist der Managed GPU Server 24, mindestens empfohlen für Gemma 4 12B: 699 € netto / Monat plus 499 € netto Einrichtung einmalig, mit dediziertem Server, vLLM, Open WebUI und Managed-Betrieb durch WZ-IT. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.