WZ-IT Logo
Llama Hosting

Llama Hosting in Deutschland: Llama 3.3 betreiben, Llama 4 in der EU einordnen

Sie möchten ein Llama-Modell auf eigener Infrastruktur nutzen. Wir ordnen ein, welche Llama-Version ein Unternehmen in der EU lizenzrechtlich nutzen kann, und betreiben Llama 3.3 70B auf einem dedizierten GPU-Server in Deutschland.

Betrieb in deutschem RechenzentrumBetrieb mit AVVvLLM und OpenAI-kompatible API

Unternehmen weltweit vertrauen WZ-IT

Bewertungen

Unternehmen weltweit vertrauen WZ-IT

Stadtwerke BrühlDGHO e.V.ABCO Water SystemsGolem.deEVADXBnextGYMAInergyml&sOdiseo SolutionsAnnotaARGESweetConnect GmbH
Ausgangslage

Warum Llama selbst betreiben

Llama ist die Open-Weight-Familie von Meta. Die jüngste Generation Llama 4 (Scout und Maverick, April 2025) besteht aus multimodalen Mixture-of-Experts-Modellen. Die Acceptable Use Policy zu Llama 4 gewährt die Rechte aus Abschnitt 1(a) der Lizenz für diese multimodalen Modelle nicht an Unternehmen mit Hauptsitz in der EU. Ausgenommen sind nur Endnutzer eines Produkts oder Dienstes, in das die Modelle eingebaut sind. Llama 4 bieten wir deshalb nicht an.

Betreiben lässt sich Llama 3.3 70B Instruct, ein reines Textmodell vom Dezember 2024 unter der Llama 3.3 Community License. Seit April 2025 hat Meta im Hugging-Face-Konto meta-llama keine neuen Modellgewichte veröffentlicht. Wer ein aktuelles Modell sucht, findet bei Qwen, gpt-oss, Gemma und Mistral Familien mit neueren Checkpoints und Apache-2.0-Lizenz.

  • Daten bleiben in Deutschland

    Das Modell läuft auf einem dedizierten Server in einem deutschen Rechenzentrum. Mit Auftragsverarbeitungsvertrag, ohne Datenweg zu einer Modell-API.

  • Planbare Kosten

    Fester Monatspreis je Serverstufe statt Abrechnung nach verbrauchten Tokens. Mehr Anfragen erhöhen die Rechnung nicht.

  • Modellversion unter Kontrolle

    Checkpoint und Quantisierung bleiben, bis Sie einem Wechsel zustimmen. Kein stilles Modell-Update durch einen Anbieter.

Modellfakten

Llama-Checkpoints im Überblick

Herstellerangaben und Größe der Gewichtsdateien je Format, mit Quelle.

CheckpointVeröffentlichtParameterKontext laut HerstellerGewichte je Format
meta-llama/Llama-3.3-70B-Instruct12/202470,6 Mrd. (dense, nur Text)131.072 Tokens
meta-llama/Llama-4-Scout-17B-16E-Instruct04/2025109 Mrd. gesamt / 17 Mrd. aktiv (MoE, multimodal)10 Mio. Tokens
meta-llama/Llama-4-Maverick-17B-128E-Instruct04/2025400 Mrd. gesamt / 17 Mrd. aktiv (MoE, multimodal)1 Mio. Tokens

GB = 10⁹ Bytes, Summe der Gewichtsdateien im genannten Hugging-Face-Repository. Zusätzlich braucht der Betrieb Speicher für KV-Cache, Runtime und gegebenenfalls Bildverarbeitung. Stand Oktober 2026.

Lizenz

Llama: Lizenz und kommerzielle Nutzung

Lizenz
Llama 3.3 Community License + Acceptable Use Policy (Lizenztext, Acceptable Use Policy Llama 3.3)
Kommerzielle Nutzung
Ja, für Llama 3.3 70B Instruct. Wer mit eigenen Produkten oder Diensten am Veröffentlichungstag mehr als 700 Mio. monatlich aktive Nutzer hatte, braucht eine separate Lizenz von Meta.
Pflichten und Schwellen
Wer das Modell oder einen Dienst damit bereitstellt, legt die Lizenz bei und zeigt „Built with Llama“ gut sichtbar auf Website, Oberfläche oder in der Dokumentation an. Die Acceptable Use Policy ist einzuhalten. Ihre EU-Klausel betrifft multimodale Modelle; Llama 3.3 70B Instruct ist ein reines Textmodell.
Prüfstand
Stand Oktober 2026

Nicht im Angebot

Llama 4 Scout und Llama 4 Maverick sind multimodale Modelle. Die Acceptable Use Policy zu Llama 4 gewährt die Rechte aus Abschnitt 1(a) der Llama 4 Community License nicht an Personen mit Wohnsitz oder Unternehmen mit Hauptsitz in der EU. Die Ausnahme gilt nur für Endnutzer eines Produkts oder Dienstes, in das die Modelle eingebaut sind. Als Unternehmen in Deutschland bieten wir Llama 4 deshalb nicht an. Lizenztext

Technische Einordnung, keine Rechtsberatung. Maßgeblich ist der Lizenztext der eingesetzten Modellversion.

Open-Source-LLM-Lizenzen im Vergleich
Serverstufe

Mindestens empfohlene Serverstufe für Llama

Die Empfehlung folgt aus der Größe der Gewichte plus Reserve für Kontext und Runtime.

ModellFormatGewichteMindestens empfohlenHinweis
Llama 3.3 70BFP872,7 GBManaged GPU Server 96Auf 96 GB bleiben nach den Gewichten rund 23 GB für Kontext und Runtime. Das begrenzt Kontextlänge und gleichzeitige Anfragen.
Llama 3.3 70BBF16141,1 GBManaged GPU Server 192
Llama 4 ScoutBF16217,3 GBKeine unserer StufenNicht im Angebot: keine Rechte nach Abschnitt 1(a) für Unternehmen mit Hauptsitz in der EU.
Llama 4 MaverickFP8416,8 GBKeine unserer StufenNicht im Angebot: EU-Ausschluss in der Lizenz, außerdem größer als unsere größte Stufe mit 384 GB.

Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Meta veröffentlicht Llama 3.3 70B nur in BF16. Die FP8-Größe stammt aus dem Checkpoint von Red Hat AI im Format compressed-tensors, der unter der Llama 3.3 Community License steht. Die FP8- und NVFP4-Checkpoints von NVIDIA stehen zusätzlich unter der NVIDIA Open Model License.

Die Stufen des Managed GPU Servers

Managed GPU Server 24

1 × RTX PRO 4000 Blackwell, 24 GB GPU-Speicher

699 € netto / Monat, monatlich kündbar

499 € netto Einrichtung einmalig

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 96

1 × RTX PRO 6000 Blackwell Max-Q, 96 GB GPU-Speicher

1.799 € netto / Monat, monatlich kündbar

999 € netto Einrichtung einmalig

Konfiguration ansehen

Für diese Familie relevant

Managed GPU Server 192

2 × RTX PRO 6000 Blackwell Max-Q, 192 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Managed GPU Server 384

4 × RTX PRO 6000 Blackwell Max-Q, 384 GB GPU-Speicher

Preis und Laufzeit auf Anfrage

Konfiguration ansehen

Der Managed GPU Server 288 mit drei GPUs ist für mehrere Modelle nebeneinander gedacht, weil vLLM ein Modell nur bei durch die GPU-Zahl teilbaren Attention-Heads verteilt.

vLLM

Llama mit vLLM betreiben

Architektur, Quantisierung und Verteilung auf mehrere GPUs.

Architektur

Llama 3.3 70B nutzt LlamaForCausalLM, eine der am längsten von vLLM unterstützten Architekturen. Für den Betrieb ist kein zusätzliches Paket nötig.

Quantisierung

Meta veröffentlicht nur BF16-Gewichte. Für den Managed GPU Server 96 nutzen wir einen FP8-Checkpoint im Format compressed-tensors. Vor dem Angebot prüfen wir Herkunft, Lizenz und Antwortqualität des quantisierten Checkpoints.

Tensor-Parallelität

Mit 64 Attention-Heads und 8 KV-Heads lässt sich Llama 3.3 70B auf zwei oder vier GPUs verteilen. Für BF16 mit rund 141 GB empfehlen wir mindestens zwei RTX PRO 6000.

Kontext

Llama 3.3 unterstützt 131.072 Tokens. In FP8 auf einer GPU mit 96 GB bleibt wenig Speicher für den KV-Cache, die eingestellte Kontextlänge fällt dort kürzer aus. Den Wert legen wir nach Ihren Anfragen fest und nennen ihn im Angebot.

Betrieb durch WZ-IT

Was im Betrieb enthalten ist

Der Managed GPU Server ist eine betriebene Modellumgebung, kein leerer Server.

Modell und vLLM

Ein abgestimmtes Modell in der vereinbarten Quantisierung, bereitgestellt über eine gemanagte vLLM-Inferenzschicht.

OpenAI-kompatible API

Anwendungen und Coding-Clients binden den Server über Basis-URL und API-Schlüssel an.

Open WebUI

Gemanagte Chat-Oberfläche für Teams, die das Modell ohne eigene Anwendung nutzen.

24/7 Monitoring

Host, GPU, vLLM und Open WebUI werden proaktiv überwacht, Störungen nach Service Level bearbeitet.

Updates mit CVE-Einordnung

Betriebssystem, Treiber, vLLM und Open WebUI werden geprüft und kontrolliert aktualisiert. Modellwechsel nur nach Absprache.

AVV und Dokumentation

Auftragsverarbeitungsvertrag, dokumentierte Konfiguration und ein persönlicher Ansprechpartner.

Leistungsumfang, Preise und Mehr-GPU-Server stehen auf der Produktseite.

Managed GPU Server ansehen

Modell prüfen lassen

Modell und Serverstufe prüfen lassen

Nennen Sie Modell, Kontextlänge und gleichzeitige Anfragen. Wir prüfen Checkpoint, Lizenz und Serverstufe vor dem Angebot.

Welche Serverstufe soll geprüft werden?

Die Auswahl ist unverbindlich. Wir bestätigen Modell-Fit, Lizenz und Laufzeit vor einem Angebot.

Wie sollen wir antworten?

Antwort in der Regel innerhalb eines Werktags. Bitte senden Sie noch keine Zugangsdaten.

Häufige Fragen zu Llama Hosting

Lizenz, Serverstufe, Datenweg und Betrieb

Nicht auf Grundlage der Llama 4 Community License. Die Acceptable Use Policy gewährt die Rechte aus Abschnitt 1(a) für die multimodalen Llama-4-Modelle nicht an Unternehmen mit Hauptsitz in der EU. Ausgenommen sind Endnutzer eines Produkts oder Dienstes, in das die Modelle eingebaut sind. Den Betrieb der Modelle auf eigener Infrastruktur deckt diese Ausnahme nach unserer Einordnung nicht ab. Wir bieten Llama 4 deshalb nicht an.

Llama 3.3 70B Instruct. In FP8 ist mindestens der Managed GPU Server 96 empfohlen, mit begrenztem Raum für Kontext. In BF16 ist mindestens der Managed GPU Server 192 empfohlen. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Die Acceptable Use Policy zu Llama 3.3 enthält dieselbe Klausel, bezogen auf multimodale Modelle in Llama 3.3. Llama 3.3 70B Instruct nimmt nur Text entgegen und gibt nur Text aus. Maßgeblich ist der Lizenztext der eingesetzten Version; die Einordnung auf dieser Seite ist keine Rechtsberatung.

Bei Weitergabe oder Bereitstellung die Lizenz beilegen und „Built with Llama“ gut sichtbar angeben, die Acceptable Use Policy einhalten und abgeleitete Modelle mit „Llama“ am Anfang des Namens versehen. Unternehmen mit mehr als 700 Mio. monatlich aktiven Nutzern am Veröffentlichungstag brauchen eine eigene Lizenz von Meta.

Llama 3.3 70B ist vom Dezember 2024, der Wissensstand der Trainingsdaten reicht laut Meta bis Dezember 2023. Seit April 2025 sind keine neuen Llama-Gewichte erschienen. Wer bestehende Anwendungen auf Llama 3.3 abgestimmt hat, kann es weiter betreiben. Für neue Projekte vergleichen wir zusätzlich Qwen3.8-27B, gpt-oss-120b, Gemma 4 und Mistral Small 4.

Meta nennt Deutsch unter den acht offiziell unterstützten Sprachen von Llama 3.3. Für Ihren Anwendungsfall testen wir Antworten mit eigenen Beispielen, bevor das Modell produktiv geht.

Nein. Die Gewichte laufen auf Ihrem dedizierten Server in einem deutschen Rechenzentrum, ohne Verbindung zu Meta. Anfragen, Dokumente und Antworten bleiben auf dem Server und in den Systemen, die Sie anbinden.

Der Einstieg für Llama ist der Managed GPU Server 96, mindestens empfohlen für Llama 3.3 70B: 1.799 € netto / Monat plus 999 € netto Einrichtung einmalig, mit dediziertem Server, vLLM, Open WebUI und Managed-Betrieb durch WZ-IT. Welche Stufe für Ihren Einsatz passt, hängt von Kontextlänge und gleichzeitigen Anfragen ab. Wir prüfen das vor dem Angebot.

Kontakt

Lassen Sie uns über Ihre Idee sprechen

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

E-Mail
[email protected]
Rückruf vereinbaren

Rückruf

Rückruf vereinbaren

Nummer hinterlassen, wir rufen zurück, spätestens am nächsten Werktag.

Für ein ausführliches Gespräch können Sie alternativ einen Termin buchen.

Unternehmen weltweit vertrauen WZ-IT

  • ml&s
  • Rekorder
  • Keymate
  • Führerscheinmacher
  • SolidProof
  • ARGE
  • Boese VA
  • nextGYM
  • SweetConnect GmbH
  • Golem.de
  • Millenium
  • Paritel
  • Yonju
  • EVADXB
  • Mr. Clipart
  • Aphy AG
  • Negosh
  • ABCO Water Systems
1/3 - Themenauswahl33%

Worum geht es bei Ihrer Anfrage?

Wählen Sie zuerst den Leistungsbereich, der am besten zu Ihrem Vorhaben passt.