07.09.2026
Dokumente automatisch auslesen und prüfen mit KI: selbst gehostet
Seit dem 1. Januar 2025 muss jedes inländische Unternehmen E-Rechnungen empfangen können. Ein Teil der Belege kommt damit als strukturiertes XML an und wird geparst...
Hosting von Large Language Models (LLM) in Deutschland - sicher, performant und betriebsbereit. Auf DSGVO-Anforderungen ausgerichtet mit dedizierter GPU-Infrastruktur.
Unternehmen weltweit vertrauen WZ-IT
Diese Seite ist die Betriebsebene unseres KI-Angebots: Sie trägt die Lösungen, die Sie kaufen - vom Angebotsfinder bis zum internen Assistenten. Der Stack bleibt dabei in Ihrem Besitz.
Large Language Models (LLM) sind KI-Modelle, die natürliche Sprache verstehen und generieren können. Für Unternehmen bieten sie enorme Möglichkeiten: von der Automatisierung der Kundenkommunikation über intelligente Dokumentenanalyse bis hin zu Coding-Assistenten und Wissensmanagement.
Mit unserem LLM Hosting Deutschland betreiben Sie diese leistungsstarken Modelle in Ihrer eigenen, auf DSGVO-Anforderungen ausgerichteten Infrastruktur - ohne Ihre sensiblen Daten an globale Cloud-Anbieter weitergeben zu müssen.
Ob Llama 4, Qwen3, DeepSeek-R1 oder andere offene Modelle - wir kümmern uns um Installation, Betrieb und Optimierung Ihrer LLM-Infrastruktur.
Volle Kontrolle über Ihre KI-Infrastruktur
Für Modelle, Speicher und Verarbeitung können deutsche Standorte gewählt werden. Externe Integrationen, Fernzugriffe und Unterauftragnehmer werden dokumentiert, damit die konkrete Datenschutzbewertung nachvollziehbar bleibt.
Sie bestimmen Modelle, Schnittstellen und Datenflüsse. Nicht benötigte externe Modell-APIs können entfallen; aktivierte Integrationen und ausgehende Verbindungen werden transparent dokumentiert.
Erfüllen Sie strenge Compliance-Anforderungen in regulierten Branchen wie Gesundheit, Finanzen oder öffentliche Verwaltung.
Keine versteckten API-Kosten, keine Überraschungen bei der Abrechnung. Planbare monatliche Fixkosten statt Pay-per-Token bei Cloud-Anbietern.
Dedizierte GPU-Ressourcen ohne Sharing. Optimale Latenz für Ihre Anwendungen ohne Abhängigkeit von globalen Cloud-Diensten.
Fine-Tuning und Anpassung Ihrer Modelle an Ihre spezifischen Anforderungen. Keine Einschränkungen durch API-Limits oder Vendor-Lock-ins.
Was benötigt man für professionelles LLM Hosting?
Das Hosting von Large Language Models stellt besondere Anforderungen an die Infrastruktur. Wir sorgen dafür, dass alles optimal konfiguriert ist.
LLMs benötigen GPUs mit ausreichend VRAM. Faustregel für die Gewichte: quantisiert (Q4) etwa ein halbes Gigabyte je Milliarde Parameter, in FP16 rund das Vierfache. Für Kontext und KV-Cache kommt je nach Kontextlänge und Parallelität noch einiges dazu - für Llama 3.1 70B planen wir deshalb rund 48 GB ein, für Gemma 3 27B rund 20 GB.
Neben GPU-Speicher benötigen Sie ausreichend RAM (mindestens 64 GB) und schnellen NVMe-Speicher für Modelldateien und Caching. Die Modelldateien selbst belegen in FP16 rund 15 GB (7B) bis 150 GB (70B) auf der Platte; im quantisierten Betrieb entsprechend weniger.
Für produktive Anwendungen mit mehreren Nutzern ist eine stabile, schnelle Netzwerkverbindung essentiell. Unsere Server bieten Gigabit-Anbindung mit geringer Latenz innerhalb Deutschlands.
Der komplette Software-Stack inklusive CUDA-Treibern, Ollama, OpenWebUI und Container-Orchestrierung wird von uns installiert, konfiguriert und aktuell gehalten.
Professionelles Monitoring der GPU-Auslastung, Temperaturüberwachung und Sicherheitsupdates gehören zum Service. Automatisierte Backups sind optional zubuchbar.
Bei wachsenden Anforderungen skalieren wir Ihre Infrastruktur horizontal (mehrere Server) oder vertikal (stärkere GPUs). Load-Balancing zwischen mehreren Instanzen ist möglich.
Wir kümmern uns um alles - Sie nutzen einfach Ihre LLMs
Von der initialen Einrichtung bis zum täglichen Betrieb: Unser Managed LLM Hosting übernimmt alle technischen Aspekte.
Auf Wunsch: Installation der gewünschten LLMs (Llama, Qwen, Gemma, Mistral, DeepSeek, GPT-OSS), Einrichtung von Ollama oder vLLM als Modellserver, OpenWebUI als Web-Interface und optionale API-Endpunkte für Ihre Anwendungen.
Wir überwachen Ihre LLM-Infrastruktur rund um die Uhr technisch, führen Systemupdates durch und optimieren die GPU-Performance. Wie schnell wir auf einen Alarm reagieren, richtet sich nach dem vereinbarten Service Level.
Unser Team unterstützt Sie bei der Modellauswahl, Integration in Ihre Anwendungen und Optimierung für Ihre spezifischen Anwendungsfälle. Priorisierter Support via E-Mail und optional per Telefon/Video.
Fixe monatliche Kosten ohne versteckte Gebühren, keine Pay-per-Token-Abrechnung. Monatlich kündbar. Den konkreten Preis stimmen wir nach Konfiguration im Erstgespräch ab.
Eine Auswahl beliebter Open-Source-LLMs

Metas aktuelle Generation als Mixture-of-Experts: 109B Parameter, davon 17B pro Token aktiv, natives Multimodal und sehr langer Kontext. Läuft auf einer einzelnen 96-GB-Karte.

Das leistungsstärkste Modell von Google, das auf einer einzelnen Consumer-GPU läuft. Vision-Support für Bildanalyse integriert.

Offenes Reasoning-Modell, das seinen Denkprozess zeigt (Chain-of-Thought) und Werkzeugaufrufe unterstützt.
Europäisches Modell von Mistral AI mit klarer Lizenzlage - 24B dicht, passt auf eine 20-GB-Karte und ist die naheliegende Wahl, wenn die Herkunft des Modells zählt.
Microsofts kompaktes 14B Modell mit überragender Performance für seine Größe. Optimal für ressourceneffiziente Deployments.
Alibabas mehrsprachiges Modell unter Apache 2.0, von 0,6B bis 235B. Starker Allrounder mit gutem Coding- und Reasoning-Verhalten - die verbreitetste Wahl für lokalen Betrieb.

Die einfachste Art, LLMs lokal zu betreiben. Perfekt für Entwicklung, Prototypen und kleine bis mittlere Produktionsworkloads.

High-Performance Inferenz-Engine für produktive Workloads. Optimiert für maximalen Durchsatz und minimale Latenz bei hoher Last.
Welches Framework ist das richtige für Sie?
Wir empfehlen Ollama für einfache Anwendungsfälle, Entwicklung und moderate Last. Für produktive Anwendungen mit vielen gleichzeitigen Nutzern und hohen Performance-Anforderungen ist vLLM die bessere Wahl. Wir beraten Sie gerne bei der Auswahl!
Typische Anwendungsfälle und Zielgruppen
Bieten Sie Ihren Kunden KI-gestützte Services wie Content-Erstellung, SEO-Analysen oder Chatbots - mit eigener LLM-Infrastruktur statt teurer OpenAI-API-Kosten.
Universitäten, Forschungseinrichtungen und Bildungsträger nutzen eigene LLMs für wissenschaftliche Arbeiten, Studien und Lehre ohne Datenschutz-Bedenken.
KMUs in Deutschland setzen LLMs für interne Wissensdatenbanken, Kundenservice-Automation, Code-Analyse oder Dokumenten-Klassifizierung ein.
Verknüpfen Sie Ihr LLM mit Ihren eigenen Dokumenten, Wikis oder Datenbanken. Mitarbeiter stellen Fragen in natürlicher Sprache und erhalten präzise Antworten aus Ihrem Wissensbestand.
Entwicklerteams nutzen LLMs lokal für Code-Vervollständigung, Review und Dokumentation - ohne Quellcode an externe APIs zu senden.
Erstellen Sie Produktbeschreibungen, Marketing-Texte oder Social-Media-Content mit Ihrem eigenen LLM in Ihrer Corporate Language.
Analysieren und klassifizieren Sie große Mengen an Dokumenten, Verträgen oder E-Mails automatisiert und auf DSGVO-Anforderungen ausgerichtet.
Mit RAG verbinden Sie Ihr LLM mit externen Wissensquellen. Das Modell durchsucht Ihre Dokumente und generiert Antworten basierend auf tatsächlichen Fakten aus Ihrer Datenbasis. Ideal für Unternehmenswikis, Support-Datenbanken oder Forschungsarchive.
Anfrage
Beschreiben Sie Modelle, Zugriff und Datenquellen. Wir leiten daraus Infrastruktur und Betriebsumfang ab.
Warum eigenes Hosting oft die bessere Wahl ist
| Merkmal | Eigenes Hosting (WZ-IT) | Cloud-APIs (OpenAI, etc.) |
|---|---|---|
| Datenschutz | Hosting in Deutschland, auf DSGVO-Anforderungen ausgerichtet | Daten gehen an US-Anbieter |
| Kosten | Fixe monatliche Kosten | Variable Token-Preise, oft teurer |
| Kontrolle | Volle Kontrolle über Modelle | Abhängigkeit vom Anbieter |
| Anpassung | Fine-Tuning jederzeit möglich | Eingeschränkt oder teuer |
| Latenz | Optimal (Deutschland) | Variabel, abhängig von Region |
| Verfügbarkeit | Dedizierte Ressourcen, keine Rate-Limits | Rate-Limits, Ausfälle möglich |
Alles, was Sie über LLM Hosting wissen müssen
Ja, Sie können jedes Open-Source-Modell nutzen, das mit Ollama oder vLLM kompatibel ist. Das umfasst alle gängigen Modelle wie Llama, Gemma, Mistral, DeepSeek, Phi, und viele mehr. Wir unterstützen Sie auch beim Fine-Tuning oder der Konvertierung eigener Modelle.
Selbstverständlich. Sie können jederzeit auf eine leistungsstärkere GPU upgraden (z.B. von RTX 4000 auf RTX 6000) oder zusätzliche Server für Load-Balancing hinzufügen. Wir bieten sowohl vertikale als auch horizontale Skalierung an.
Alle Modelle, die mit Ollama oder vLLM laufen: Llama 4 (Scout, Maverick) und weiterhin Llama 3.3, Qwen3 (0,6B-235B), Gemma 3 (1B-27B), DeepSeek-R1, Mistral Small 3.2, Phi-4, GPT-OSS (20B, 120B) und hunderte weitere. Die komplette Liste finden Sie auf ollama.com/library. Stand: August 2026.
Mit Ollama erreichen Sie auf unserer RTX 4000 bei Gemma 3 27B etwa 10-15 Tokens/Sekunde - ein Erfahrungswert, keine zugesicherte Leistung. Mit vLLM sind bei hoher Last deutlich höhere Durchsätze möglich; das vLLM-Projekt misst in eigenen Benchmarks bis zu 24x mehr Durchsatz gegenüber HuggingFace Transformers. Die exakte Performance hängt vom Modell, der Kontextlänge und der Anzahl gleichzeitiger Anfragen ab.
Ja, sowohl Ollama als auch vLLM bieten OpenAI-kompatible APIs. Sie können Ihre Anwendungen einfach umstellen, indem Sie die API-URL ändern - der Code bleibt nahezu identisch. Zusätzlich gibt es native Client-Libraries für Python, JavaScript, Go und weitere Sprachen.
Unser Monitoring erkennt Probleme meist, bevor sie Auswirkungen haben. Bei Störungen reagieren wir umgehend. Als Managed-Service-Kunde haben Sie priorisierten Support via E-Mail, optional auch Telefon-/Video-Support verfügbar.
Ja, abhängig vom verfügbaren VRAM können Sie mehrere Modelle parallel laden oder zwischen ihnen wechseln. Ollama verwaltet das automatisch. Auf der Pro-Konfiguration mit 96 GB VRAM lassen sich zum Beispiel ein 27B- und ein 7B-Modell gleichzeitig geladen halten.
Wir halten das System (OS, CUDA, Ollama/vLLM) aktuell und installieren Sicherheitsupdates zeitnah. Modellaktualisierungen erfolgen auf Wunsch - Sie entscheiden, wann Sie ein neues Modellrelease nutzen möchten.
Nutzen Sie die Macht von Large Language Models - sicher und souverän
07.09.2026
Seit dem 1. Januar 2025 muss jedes inländische Unternehmen E-Rechnungen empfangen können. Ein Teil der Belege kommt damit als strukturiertes XML an und wird geparst...
24.05.2026
Wer KI in produktive Geschäftsprozesse bringt, steht schnell vor einer unbequemen Frage: Was passiert da eigentlich genau? Welcher Prompt ging an welches Modell, warum kam...
10.05.2026
Drei unauthentifizierte API-Calls. Kein Login, kein Exploit-Framework, keine Privilege Escalation. Drei POST-Requests an einen Standard-Port, und der Speicher der Maschine ist auf Reisen — mit...
05.05.2026
Die Hochrisiko-Pflichten des EU AI Act greifen nicht zum 2. August 2026. Eigenständige Hochrisiko-Systeme nach Anhang III haben jetzt bis zum 2. Dezember 2027 Zeit,...
24.11.2025
OpenAI hat GPT-OSS 120B am 5. August 2025 als Open-Weight-Reasoning-Modell veröffentlicht. Durch die ab Werk verwendete MXFP4-Quantisierung positioniert OpenAI das Modell für eine einzelne GPU...
Kein Risiko: Im schlechtesten Fall gehen Sie mit mehr Klarheit über Ihr Projekt heraus als vorher.


„Die Beratung von WZ-IT zu unserer Azure-Migration war schon im Erstgespräch fachlich sehr fundiert und völlig unverbindlich - wir haben eine Menge mitgenommen.“
Von der lokalen KI-Integration bis zu Architektur, Datenhoheit und laufendem Betrieb.
“WZ-IT hat unsere Studio-Infrastruktur von dezentralen Einzelgeräten auf eine zentrale Plattform gehoben: Jeder Standort ist per VPN sicher angebunden, neue Geräte werden automatisiert onboardet und ein kompletter Standort wird per Vorlage provisioniert - ohne manuelle Schritte vor Ort. Was mich am meisten beeindruckt hat, ist die Breite und Tiefe des Wissens: Timo und Robin sind kein normaler IT-Dienstleister, der einen Server aufsetzt und wieder geht. Die beiden denken sich in hochkomplexe Infrastruktur- und Softwarethemen rein, arbeiten sich in jede Anforderung ein, die wir ihnen hinlegen, und bauen Vernetzung, Provisioning und Betrieb so auf, dass am Ende alles zusammenpasst. WZ-IT ist ein hervorragender Partner, wenn es um komplexe Software-, Netzwerk- und Architekturprojekte geht.”

Steve Kirchner
Geschäftsführer, nextGYM GmbH

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.