Architektur und Migration
Sizing, Zielumgebung, Datenübernahme, Cutover und Wiederanlauf werden vor dem produktiven Betrieb geklärt.

WZ-IT plant, installiert und betreibt LiteLLM als Managed Hosting, in Ihrer Cloud oder on-premises. Je nach Zielbild übernehmen wir Migration, sichere Netzwerk- und Identity-Anbindung, Monitoring, Backups, Updates sowie Integrationen und Weiterentwicklung.
Unternehmen weltweit vertrauen WZ-IT

LiteLLM ist ein Gateway zwischen Anwendungen und LLM-Anbietern. Teams sprechen eine OpenAI-kompatible API an und können trotzdem zwischen lokalen Modellen, europäischen Endpunkten und Cloud-Providern routen.
Wir betreiben LiteLLM als kontrollierte KI-Zugriffsschicht: mit Virtual Keys, Budgets, Provider-Fallbacks, Logging, Netzsegmentierung und Integration in Ollama, vLLM, Langfuse und interne Anwendungen. SSO ist in der Open-Source-Version bis fünf Nutzer enthalten; darüber hinaus sowie für Audit-Logs und JWT-Authentifizierung setzt LiteLLM die Enterprise-Edition voraus.
Ohne Gateway wachsen API-Keys, Provider-Abhängigkeiten und Kostenkontrolle schnell unkontrolliert. LiteLLM bringt Routing, Quotas und Fallbacks an eine zentrale Stelle.
LiteLLM steht unter MIT-Lizenz, ausgenommen das Verzeichnis enterprise/ mit eigener Lizenz. Virtual Keys, Budgets, Rate Limits, Fallbacks und Prometheus-Metriken sind in der Open-Source-Version enthalten. Wir prüfen vorab, ob Sie Enterprise-Funktionen wie SSO für mehr als fünf Nutzer, Audit-Logs oder Secret Manager brauchen.
Routen Sie Anfragen an Ollama, OpenAI-kompatible Endpunkte, europäische Provider oder Hyperscaler-APIs über eine einheitliche Schnittstelle.
Provider-Ausfälle, Rate Limits oder Kostenlimits können über Fallback-Regeln und Routing-Policies abgefangen werden.
Teams und Anwendungen erhalten eigene Schlüssel, Budgets und Policies statt direkter Provider-Zugänge.
Token-Verbrauch, Modelle, Provider und Budgets werden zentral sichtbar und steuerbar.
Bestehende Anwendungen können häufig ohne großen Umbau auf neue Modelle oder Provider umgestellt werden.
Wir härten das Gateway, trennen Netze, integrieren Authentifizierung und überwachen Metriken, Logs und Verfügbarkeit.
LiteLLM entkoppelt Anwendungen von einzelnen Modellanbietern und macht Provider-Wechsel, Fallbacks und lokale Modelle kontrollierbar.
Virtual Keys, Budgets und Policies schaffen eine saubere technische Grenze zwischen Teams, Anwendungen und Modellanbietern.
Wir betreiben LiteLLM mit TLS, Netzwerksegmentierung, Monitoring und klaren Betriebsprozessen für produktive KI-Workloads.
Wir stellen nicht nur eine Anwendung bereit. WZ-IT plant die technische Architektur, bindet Netzwerk und Identitäten an, übernimmt den vereinbarten Betrieb und entwickelt Integrationen weiter, wenn der Standard nicht ausreicht.
Sizing, Zielumgebung, Datenübernahme, Cutover und Wiederanlauf werden vor dem produktiven Betrieb geklärt.
SSO, sichere Zugänge, interne Systeme und vorhandene Security-Komponenten werden passend eingebunden.
Updates, Backups, technische Überwachung und Reaktionswege folgen einem transparenten Betriebsumfang.
APIs, Automatisierungen und individuelle Erweiterungen können über die reine Bereitstellung hinaus umgesetzt werden.
Der konkrete Umfang hängt von Anwendung, Edition, Infrastruktur und Kritikalität ab. Herstellerlizenzen und Sonderkomponenten werden separat ausgewiesen.
KI-Anwendungen benötigen neben der Oberfläche kontrollierte Modellzugänge, Wissensquellen, Berechtigungen und Beobachtbarkeit. Wir planen diese Datenflüsse als zusammenhängenden Stack.
Teams, Fachanwendungen und API-Clients greifen über definierte Oberflächen und Schnittstellen zu.
TLS, Firewall-Regeln, Reverse Proxy oder private Netzwerkpfade werden passend zur Exposition der Plattform geplant.
Lokale Konten, SSO, Verzeichnisdienste, Service Accounts und Notfallzugänge werden mit klaren Rollen verbunden.
Anwendungslogik, Modellzugriffe, Rollen und freigegebene Funktionen laufen in einer kontrollierten Umgebung.
Lokale oder externe Modelle, GPU-/CPU-Ressourcen, Routing, Limits und Kostenkontrolle.
Dokumente, Datenbanken, Vektorsuche und nachvollziehbare Datenpfade für RAG und Suche.
Geprüfte Tools, APIs, Protokollierung, Metriken und technische Qualitätskontrollen.
Modelle, Erweiterungen und Datenquellen werden nicht pauschal freigeschaltet. Berechtigungen, Datenabfluss, Kosten und fachliche Kontrolle werden je Anwendungsfall bewertet.
Ein klarer Betriebsumfang statt einer unübersichtlichen Hosting-Pauschale.
Wir richten eine Testinstanz für Sie ein, in der Regel am nächsten Werktag. Ohne Zahlungsdaten. Nach sieben Tagen wird sie gelöscht, sofern Sie nicht übernehmen.
Compute, Anwendungen, Speicher und Reaktionszeit werden getrennt ausgewiesen. So sehen Sie, was im laufenden Betrieb enthalten ist und welche Anforderungen erst nach einem technischen Assessment angeboten werden.
Wir planen auch individuelle LiteLLM-Architekturen, Integrationen und Migrationsprojekte. Kontaktieren Sie uns für ein technisches Assessment.
Eine verwaltete LiteLLM-Standardanwendung ist im Starter-Workload enthalten. Ab Business kommt ein flexibel nutzbares Betriebsbudget für planbare Leistungen innerhalb der regulären Servicezeit hinzu. Wählen Sie Compute, weitere Anwendungen, Speicher und das passende Service Level.
Ein Workload ist eine Compute-Instanz mit den darauf vereinbarten Anwendungen.
Ein Standard-App je Workload ist bereits enthalten. Zusätzliche dedizierte Server zählen als weitere Workloads.
7,99 € netto je zusätzliche 100 GB und Monat, inklusive täglichem verschlüsseltem Offsite-Backup mit 7 Tagen Aufbewahrung. Abgerechnet wird die bereitgestellte Kapazität, nicht die tatsächliche Belegung.
Wir setzen auch individuelle Sicherungsintervalle und Aufbewahrungsfristen um. Zum Beispiel: tägliche Sicherungen für 30 Tage und eine monatliche Sicherung für 12 Monate. Umfang, Speicherbedarf und Zusatzkosten werden separat vereinbart.
Wird individuell geprüft; individuelles Angebot.
Das Standard-Hosting läuft auf einer einzelnen Instanz ohne Hochverfügbarkeit. Für individuelle Architekturen wird die Ausfallsicherheit separat vereinbart.
Zero Downtime auf Anfrage
Verteilter Betrieb mit mehreren Instanzen, Datenbank-Cluster und rollierenden Updates, sodass ein Node-Ausfall keine Unterbrechung verursacht. Nur für dafür geeignete Anwendungen; Auslegung und Preis nach technischer Prüfung.
Diese Seite deckt Installation und vereinbarten Plattformbetrieb für LiteLLM ab. Eigener Code, die Zugriffsschicht und besondere Vertraulichkeitsanforderungen bleiben klar getrennte, bei Bedarf ergänzbare Verantwortungsbereiche.
Anwendung pflegen
Individuelle Erweiterungen, Schnittstellen und Dependencies kontrolliert aktualisieren und weiterbetreiben.
ab 699,90 € netto / Monat
Leistung ansehenZugriff absichern
Identitätsbasierte Zugänge und private Netzwerkpfade als eigene Betriebsschicht ergänzen.
ab 349,90 € netto / Monat
Leistung ansehenVertraulich betreiben
Für Berufsgeheimnisträger Vertrags-, Zugriffs- und Infrastrukturvorgaben im eigenen Betriebsmodell abgrenzen.
ab 499,90 € netto / Monat
Leistung ansehenDrei fachlich angrenzende Wege statt einer langen Liste weiterer Produkte.
Alle Preise verstehen sich netto zuzüglich gesetzlicher Umsatzsteuer. Die Angebote richten sich an Unternehmen.
Gesamtsystem ansehenAnfrage
Nennen Sie kurz Ausgangslage und Ziel für LiteLLM. Wir ordnen Infrastruktur, Integration und laufenden Betrieb ein.
Antworten auf die wichtigsten Fragen
Ja, bis auf das Verzeichnis enterprise/ steht LiteLLM unter MIT-Lizenz. Die Open-Source-Version enthält den Proxy mit Virtual Keys, Nutzern und Teams, Kostenauswertung, Budgets, Rate Limits, Fallbacks, Logging und Prometheus-Metriken. Die Enterprise-Edition wird jährlich lizenziert; LiteLLM nennt den Preis nur auf Anfrage (Stand Oktober 2026).
Unter anderem SSO für mehr als fünf Nutzer, SCIM, Authentifizierung per JWT oder OIDC, Audit-Logs, Secret Manager wie HashiCorp Vault, Rotation von Virtual Keys, IP-Allowlists, Guardrails je Key oder Team und getrenntes Logging je Team. Für viele interne Gateways reicht die Open-Source-Version; welche Edition Sie brauchen, klären wir vor dem Aufbau.
Das SDK ist eine Python-Bibliothek, die eine einzelne Anwendung direkt mit vielen LLM-Anbietern verbindet. Der Proxy ist ein zentraler Server, das LLM-Gateway: Er stellt allen Anwendungen und Teams eine OpenAI-kompatible API bereit und verwaltet Keys, Budgets, Routing und Logging an einer Stelle. Wir hosten und betreiben den Proxy.
Den LiteLLM-Container mit fest gepinnter Version, eine PostgreSQL-Datenbank für Keys, Teams, Nutzer und Kostenauswertung sowie Redis, sobald mehr als eine Instanz läuft, für Rate Limits und den gemeinsamen Router-Zustand. Dazu kommen TLS, Backups der Datenbank und Monitoring.
Jede Anwendung und jedes Team bekommt einen eigenen Virtual Key mit Budget, Zeitraum und Rate Limit. LiteLLM erfasst die Kosten je Key, Team und Modell und blockiert Anfragen, wenn ein Budget erreicht ist. Die Nutzung externer Anbieter rechnen diese weiterhin über Ihren eigenen Vertrag ab.
Ja. Fallbacks leiten Anfragen bei Fehlern, Rate Limits oder zu langen Kontexten an ein definiertes Ersatzmodell weiter, zum Beispiel von einem lokalen vLLM-Modell an einen zweiten Endpunkt. Zusätzlich verteilt der Router Last über mehrere Instanzen desselben Modells.
01.10.2026
Am 30. September 2026 hat BerriAI ein Sicherheitsadvisory für den LiteLLM-Proxy veröffentlicht: GHSA-7hp6-4w63-5g45. Ein angemeldeter Nutzer mit der Rolle internaluser kann sich damit zum proxyadmin...
28.09.2026
Ein KI-Agent ist schnell gebaut. Ein KI-Agent, der zwölf Monate lang zuverlässig Tickets anlegt, Freigaben einholt, jeden Schritt nachvollziehbar protokolliert und nach einem Sicherheitsupdate noch...
18.09.2026
Wer ein Sprachmodell in eine RAG-Anwendung oder einen internen Assistenten einbinden will, ohne auf OpenAI oder Anthropic direkt zuzugreifen, landet bei einer kleinen Gruppe europäischer...
Diese Lösungen werden oft zusammen mit LiteLLM eingesetzt
Diese Lösungen bieten ähnliche Funktionalitäten und können gemeinsam evaluiert werden
“WZ-IT hat unsere Studio-Infrastruktur von dezentralen Einzelgeräten auf eine zentrale Plattform gehoben: Jeder Standort ist per VPN sicher angebunden, neue Geräte werden automatisiert onboardet und ein kompletter Standort wird per Vorlage provisioniert - ohne manuelle Schritte vor Ort. Was mich am meisten beeindruckt hat, ist die Breite und Tiefe des Wissens: Timo und Robin sind kein normaler IT-Dienstleister, der einen Server aufsetzt und wieder geht. Die beiden denken sich in hochkomplexe Infrastruktur- und Softwarethemen rein, arbeiten sich in jede Anforderung ein, die wir ihnen hinlegen, und bauen Vernetzung, Provisioning und Betrieb so auf, dass am Ende alles zusammenpasst. WZ-IT ist ein hervorragender Partner, wenn es um komplexe Software-, Netzwerk- und Architekturprojekte geht.”

Steve Kirchner
Geschäftsführer, nextGYM GmbH

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.