Sie möchten ein Llama-Modell auf eigener Infrastruktur nutzen. Wir ordnen ein, welche Llama-Version ein Unternehmen in der EU lizenzrechtlich nutzen kann, und betreiben Llama 3.3 70B auf einem dedizierten GPU-Server in Deutschland.
Unternehmen weltweit vertrauen WZ-IT
Llama ist die Open-Weight-Familie von Meta. Die jüngste Generation Llama 4 (Scout und Maverick, April 2025) besteht aus multimodalen Mixture-of-Experts-Modellen. Die Acceptable Use Policy zu Llama 4 gewährt die Rechte aus Abschnitt 1(a) der Lizenz für diese multimodalen Modelle nicht an Unternehmen mit Hauptsitz in der EU. Ausgenommen sind nur Endnutzer eines Produkts oder Dienstes, in das die Modelle eingebaut sind. Llama 4 bieten wir deshalb nicht an.
Betreiben lässt sich Llama 3.3 70B Instruct, ein reines Textmodell vom Dezember 2024 unter der Llama 3.3 Community License. Seit April 2025 hat Meta im Hugging-Face-Konto meta-llama keine neuen Modellgewichte veröffentlicht. Wer ein aktuelles Modell sucht, findet bei Qwen, gpt-oss, Gemma und Mistral Familien mit neueren Checkpoints und Apache-2.0-Lizenz.
Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum. Mit Auftragsverarbeitungsvertrag, ohne Datenweg zu einer Modell-API.
Fester Monatspreis je Serverstufe statt Abrechnung nach verbrauchten Tokens. Mehr Anfragen erhöhen die Rechnung nicht.
Checkpoint und Quantisierung bleiben, bis Sie einem Wechsel zustimmen. Kein stilles Modell-Update durch einen Anbieter.
Herstellerangaben und Größe der Gewichtsdateien je Format, mit Quelle.
| Checkpoint | Veröffentlicht | Parameter | Kontext laut Hersteller | Gewichte je Format |
|---|---|---|---|---|
| meta-llama/Llama-3.3-70B-Instruct | 12/2024 | 70,6 Mrd. (dense, nur Text) | 131.072 Tokens | |
| meta-llama/Llama-4-Scout-17B-16E-Instruct | 04/2025 | 109 Mrd. gesamt / 17 Mrd. aktiv (MoE, multimodal) | 10 Mio. Tokens |
|
| meta-llama/Llama-4-Maverick-17B-128E-Instruct | 04/2025 | 400 Mrd. gesamt / 17 Mrd. aktiv (MoE, multimodal) | 1 Mio. Tokens |
GB = 10⁹ Bytes, Summe der Gewichtsdateien im genannten Hugging-Face-Repository. Zusätzlich braucht der Betrieb Speicher für KV-Cache, Runtime und gegebenenfalls Bildverarbeitung. Stand Oktober 2026.
Llama 4 Scout und Llama 4 Maverick sind multimodale Modelle. Die Acceptable Use Policy zu Llama 4 gewährt die Rechte aus Abschnitt 1(a) der Llama 4 Community License nicht an Personen mit Wohnsitz oder Unternehmen mit Hauptsitz in der EU. Die Ausnahme gilt nur für Endnutzer eines Produkts oder Dienstes, in das die Modelle eingebaut sind. Als Unternehmen in Deutschland bieten wir Llama 4 deshalb nicht an. Lizenztext
Technische Einordnung, keine Rechtsberatung. Maßgeblich ist der Lizenztext der eingesetzten Modellversion.
Open-Source-LLM-Lizenzen im VergleichDie Empfehlung folgt aus der Größe der Gewichte plus Reserve für Kontext und Runtime.
| Modell | Format | Gewichte | Mindestens empfohlen | Hinweis |
|---|---|---|---|---|
| Llama 3.3 70B | FP8 | 72,7 GB | Managed GPU Server 96 | Auf 96 GB bleiben nach den Gewichten rund 23 GB für Kontext und Runtime. Das begrenzt Kontextlänge und gleichzeitige Anfragen. |
| Llama 3.3 70B | BF16 | 141,1 GB | Managed GPU Server 192 | |
| Llama 4 Scout | BF16 | 217,3 GB | Keine unserer Stufen | Nicht im Angebot: keine Rechte nach Abschnitt 1(a) für Unternehmen mit Hauptsitz in der EU. |
| Llama 4 Maverick | FP8 | 416,8 GB | Keine unserer Stufen | Nicht im Angebot: EU-Ausschluss in der Lizenz, außerdem größer als unsere größte Stufe mit 384 GB. |
Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.
Meta veröffentlicht Llama 3.3 70B nur in BF16. Die FP8-Größe stammt aus dem Checkpoint von Red Hat AI im Format compressed-tensors, der unter der Llama 3.3 Community License steht. Die FP8- und NVFP4-Checkpoints von NVIDIA stehen zusätzlich unter der NVIDIA Open Model License.
1 × RTX PRO 4000 Blackwell, 24 GB GPU-Speicher
699 € netto / Monat, monatlich kündbar
499 € netto Einrichtung einmalig
Konfiguration ansehenFür diese Familie relevant
1 × RTX PRO 6000 Blackwell Max-Q, 96 GB GPU-Speicher
1.799 € netto / Monat, monatlich kündbar
999 € netto Einrichtung einmalig
Konfiguration ansehenFür diese Familie relevant
2 × RTX PRO 6000 Blackwell Max-Q, 192 GB GPU-Speicher
Preis und Laufzeit auf Anfrage
Konfiguration ansehen4 × RTX PRO 6000 Blackwell Max-Q, 384 GB GPU-Speicher
Preis und Laufzeit auf Anfrage
Konfiguration ansehenDer Managed GPU Server 288 mit drei GPUs ist für mehrere Modelle nebeneinander gedacht, weil vLLM ein Modell nur bei durch die GPU-Zahl teilbaren Attention-Heads verteilt.
Architektur, Quantisierung und Verteilung auf mehrere GPUs.
Llama 3.3 70B nutzt LlamaForCausalLM, eine der am längsten von vLLM unterstützten Architekturen. Für den Betrieb ist kein zusätzliches Paket nötig.
Meta veröffentlicht nur BF16-Gewichte. Für den Managed GPU Server 96 nutzen wir einen FP8-Checkpoint im Format compressed-tensors. Vor dem Angebot prüfen wir Herkunft, Lizenz und Antwortqualität des quantisierten Checkpoints.
Mit 64 Attention-Heads und 8 KV-Heads lässt sich Llama 3.3 70B auf zwei oder vier GPUs verteilen. Für BF16 mit rund 141 GB empfehlen wir mindestens zwei RTX PRO 6000.
Llama 3.3 unterstützt 131.072 Tokens. In FP8 auf einer GPU mit 96 GB bleibt wenig Speicher für den KV-Cache, die eingestellte Kontextlänge fällt dort kürzer aus. Den Wert legen wir nach Ihren Anfragen fest und nennen ihn im Angebot.
Der Managed GPU Server ist eine betriebene Modellumgebung, kein leerer Server.
Ein abgestimmtes Modell in der vereinbarten Quantisierung, bereitgestellt über eine gemanagte vLLM-Inferenzschicht.
Anwendungen und Coding-Clients binden den Server über Basis-URL und API-Schlüssel an.
Gemanagte Chat-Oberfläche für Teams, die das Modell ohne eigene Anwendung nutzen.
Host, GPU, vLLM und Open WebUI werden proaktiv überwacht, Störungen nach Service Level bearbeitet.
Betriebssystem, Treiber, vLLM und Open WebUI werden geprüft und kontrolliert aktualisiert. Modellwechsel nur nach Absprache.
Auftragsverarbeitungsvertrag, dokumentierte Konfiguration und ein persönlicher Ansprechpartner.
Leistungsumfang, Preise und Mehr-GPU-Server stehen auf der Produktseite.
Managed GPU Server ansehenQwen Hosting
Qwen Hosting in Deutschland: Qwen3.8-27B, Qwen3.5-122B und Qwen3-Coder-Next auf dedizierter GPU, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehengpt-oss Hosting
gpt-oss Hosting in Deutschland: gpt-oss-120b und gpt-oss-20b von OpenAI auf dedizierter GPU, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehenGemma Hosting
Gemma Hosting in Deutschland: Gemma 4 31B, 26B A4B und 12B von Google auf dedizierter GPU, mit vLLM, OpenAI-kompatibler API und Betrieb mit AVV.
Familie ansehenMistral Hosting
Mistral Hosting in Deutschland: Mistral Small 4, Devstral Small 2 und Mistral Medium 3.5 auf dedizierter GPU, mit vLLM, Lizenzprüfung und Betrieb mit AVV.
Familie ansehenModell prüfen lassen
Nennen Sie Modell, Kontextlänge und gleichzeitige Anfragen. Wir prüfen Checkpoint, Lizenz und Serverstufe vor dem Angebot.
Lizenz, Serverstufe, Datenweg und Betrieb
Nicht auf Grundlage der Llama 4 Community License. Die Acceptable Use Policy gewährt die Rechte aus Abschnitt 1(a) für die multimodalen Llama-4-Modelle nicht an Unternehmen mit Hauptsitz in der EU. Ausgenommen sind Endnutzer eines Produkts oder Dienstes, in das die Modelle eingebaut sind. Den Betrieb der Modelle auf eigener Infrastruktur deckt diese Ausnahme nach unserer Einordnung nicht ab. Wir bieten Llama 4 deshalb nicht an.
Llama 3.3 70B Instruct. In FP8 ist mindestens der Managed GPU Server 96 empfohlen, mit begrenztem Raum für Kontext. In BF16 ist mindestens der Managed GPU Server 192 empfohlen. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.
Die Acceptable Use Policy zu Llama 3.3 enthält dieselbe Klausel, bezogen auf multimodale Modelle in Llama 3.3. Llama 3.3 70B Instruct nimmt nur Text entgegen und gibt nur Text aus. Maßgeblich ist der Lizenztext der eingesetzten Version; die Einordnung auf dieser Seite ist keine Rechtsberatung.
Bei Weitergabe oder Bereitstellung die Lizenz beilegen und „Built with Llama“ gut sichtbar angeben, die Acceptable Use Policy einhalten und abgeleitete Modelle mit „Llama“ am Anfang des Namens versehen. Unternehmen mit mehr als 700 Mio. monatlich aktiven Nutzern am Veröffentlichungstag brauchen eine eigene Lizenz von Meta.
Llama 3.3 70B ist vom Dezember 2024, der Wissensstand der Trainingsdaten reicht laut Meta bis Dezember 2023. Seit April 2025 sind keine neuen Llama-Gewichte erschienen. Wer bestehende Anwendungen auf Llama 3.3 abgestimmt hat, kann es weiter betreiben. Für neue Projekte vergleichen wir zusätzlich Qwen3.8-27B, gpt-oss-120b, Gemma 4 und Mistral Small 4.
Meta nennt Deutsch unter den acht offiziell unterstützten Sprachen von Llama 3.3. Für Ihren Anwendungsfall testen wir Antworten mit eigenen Beispielen, bevor das Modell produktiv geht.
Nein. Die Gewichte laufen auf Ihrem dedizierten Server in einem deutschen Rechenzentrum, ohne Verbindung zu Meta. Anfragen, Dokumente und Antworten bleiben auf dem Server und in den Systemen, die Sie anbinden.
Der Einstieg für Llama ist der Managed GPU Server 96, mindestens empfohlen für Llama 3.3 70B: 1.799 € netto / Monat plus 999 € netto Einrichtung einmalig, mit dediziertem Server, vLLM, Open WebUI und Managed-Betrieb durch WZ-IT. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.