Was ist LiteLLM? Das Gateway für viele LLMs
Timo Wevelsiep•Aktualisiert: 23.07.2026Hinweis zum Inhalt: Versionen, Befehle und Preise können sich ändern. Bitte prüfen Sie kritische Schritte vor dem produktiven Einsatz eigenständig. Dieser Leitfaden ersetzt keine individuelle Beratung.
KI-Infrastruktur sauber aufsetzen lassen? WZ-IT baut und betreibt den Open-Source-LLM-Stack auf eigener Infrastruktur - inklusive Gateway, Inferenz und Observability, DSGVO-konform aus einer Hand. LLM-Hosting ansehen
Sobald mehr als eine Anwendung ein Sprachmodell nutzt, stellt sich die Frage nach einer zentralen Anlaufstelle. LiteLLM ist genau das: ein Gateway, das viele Modelle über eine Schnittstelle ansprechbar macht und den Zugriff steuert. Dieser Artikel erklärt, was LiteLLM leistet, warum ein Gateway im Unternehmen sinnvoll ist und wie es im Open-Source-LLM-Stack sitzt. Stand Juli 2026.
Inhaltsverzeichnis
- Das Problem: viele Modelle, viele APIs
- Was LiteLLM macht
- Der LiteLLM-Proxy (Gateway)
- Warum ein Gateway im Unternehmen
- LiteLLM im Stack
Das Problem: viele Modelle, viele APIs
In der Praxis bleibt es selten bei einem Modell. Ein selbst gehostetes LLM für sensible Daten, ein spezialisiertes Modell für Code, vielleicht ein externer Dienst für Ausnahmefälle - und jedes hat seine eigene Schnittstelle, Authentifizierung und Abrechnung. Werden diese Details in jede Anwendung eingebaut, entsteht ein Flickenteppich: Jeder Modellwechsel bedeutet Änderungen an vielen Stellen.
Ein Gateway löst das, indem es sich zwischen Anwendungen und Modelle schiebt und eine einheitliche Schnittstelle nach vorne anbietet.
Was LiteLLM macht
LiteLLM stellt ein einziges, OpenAI-kompatibles Interface über mehr als 100 Sprachmodelle bereit. Eine Anwendung sendet ihre Anfrage im Standard-OpenAI-Format an LiteLLM, und LiteLLM übersetzt sie auf den jeweiligen Anbieter - mit einem konsistenten Antwortformat, unabhängig davon, welches Modell tatsächlich antwortet.
Der praktische Effekt: Anwendungen müssen nur noch das OpenAI-Format kennen. Ob dahinter ein selbst gehostetes vLLM, ein lokales Ollama oder ein externer Dienst arbeitet, ist für die Anwendung transparent. Das Modell wird austauschbar.
Der LiteLLM-Proxy (Gateway)
Über die reine Übersetzung hinaus bringt der LiteLLM-Proxy die Funktionen mit, die den Produktivbetrieb ausmachen (LiteLLM-Dokumentation):
- Authentifizierung und Autorisierung - ein zentraler API-Gateway mit Zugriffskontrolle.
- Kostenverfolgung und Budgets - Ausgaben nachverfolgen und Budgets pro Projekt setzen.
- Rate-Limits - Nutzung pro Nutzer begrenzen.
- Retry und Fallback - automatisches Ausweichen über mehrere Deployments hinweg.
- Admin-Dashboard - eine Oberfläche zur Überwachung und Verwaltung.
LiteLLM ist Open Source (von BerriAI) und lässt sich per Docker vollständig selbst hosten - das Gateway läuft damit auf eigener Infrastruktur.
Warum ein Gateway im Unternehmen
Der Wert eines Gateways zeigt sich, sobald mehrere Teams oder Anwendungen dieselbe Modell-Infrastruktur nutzen. Statt Zugriff, Kosten und Ausfallbehandlung in jeder Anwendung neu zu lösen, liegen sie an einer Stelle:
- Governance - wer darf welches Modell nutzen, mit welchem Limit.
- Kostenkontrolle - transparente Budgets und Verfolgung statt undurchsichtiger Nutzung.
- Entkopplung - Modelle im Hintergrund tauschen oder ergänzen, ohne Anwendungen anzufassen.
- Verfügbarkeit - Fallback erhöht die Robustheit, ohne dass jede Anwendung sie selbst baut.
Das ist der Unterschied zwischen „ein Modell läuft" und „KI wird im Unternehmen betrieben".
LiteLLM im Stack
Im Open-Source-LLM-Stack sitzt LiteLLM als Gateway-Schicht zwischen den Anwendungen und der Inferenz. Unter ihm bedient eine Engine wie vLLM die Modelle; neben ihm zeichnet eine Observability-Schicht wie Langfuse die Anfragen auf. LiteLLM ist damit die zentrale Steuerungsstelle, die aus einem oder mehreren laufenden Modellen einen kontrollierbaren, auditierbaren Dienst macht - die Voraussetzung für einen souveränen, produktiven KI-Betrieb.
Lieber betreiben lassen?
Sie möchten Lokale & Souveräne KI nicht selbst betreiben? WZ-IT übernimmt Einrichtung, Betrieb und Wartung - DSGVO-konform aus Deutschland.
Häufig gestellte Fragen
Antworten auf die wichtigsten Fragen
LiteLLM ist ein Open-Source-Gateway (Proxy), das mehr als 100 verschiedene Sprachmodelle über ein einziges, OpenAI-kompatibles Interface ansprechbar macht. Eine Anwendung spricht nur noch mit LiteLLM im Standard-OpenAI-Format, und LiteLLM übersetzt die Anfrage auf den jeweiligen Modell-Anbieter - egal ob selbst gehostetes vLLM, Ollama oder ein externer Dienst dahinter läuft.
Ein Gateway entkoppelt Anwendungen von konkreten Modellen und zentralisiert den Betrieb: Authentifizierung, Budgets und Kostenverfolgung, Rate-Limits sowie Fallback zwischen mehreren Modellen liegen an einer Stelle statt in jeder Anwendung. So lässt sich das Modell im Hintergrund tauschen oder ergänzen, ohne die Anwendungen anzufassen.
Ja. LiteLLM ist Open Source (von BerriAI) und lässt sich per Docker vollständig selbst hosten. Damit läuft das Gateway auf eigener Infrastruktur, und die Anfragen inklusive Prompts bleiben unter eigener Kontrolle - passend zu einem souveränen, DSGVO-konformen KI-Betrieb.
vLLM ist die Inferenz-Engine, die ein Modell tatsächlich bedient und Anfragen berechnet. LiteLLM ist das Gateway darüber, das den Zugriff auf ein oder mehrere solcher Modelle bündelt und steuert. Beide ergänzen sich: vLLM liefert die Antworten, LiteLLM regelt, wer wie viel und in welchem Format darauf zugreifen darf.
Ja. Der LiteLLM-Proxy verfolgt die Ausgaben und erlaubt Budgets pro Projekt oder Nutzer, dazu Rate-Limits und ein Admin-Dashboard zur Überwachung. Das ist besonders wertvoll, wenn mehrere Teams oder Anwendungen dieselbe Modell-Infrastruktur nutzen.
LiteLLM unterstützt Retry- und Fallback-Logik über mehrere Deployments hinweg. Fällt ein Modell oder Anbieter aus, kann die Anfrage automatisch an ein anderes weitergereicht werden. So erhöht das Gateway die Verfügbarkeit, ohne dass die aufrufende Anwendung die Ausfallbehandlung selbst implementieren muss.
Mehr zu Lokale & Souveräne KI
- Der Open-Source-LLM-Stack
- Was ist LiteLLM?
- Was ist Langfuse?
- Was ist vLLM?
- vLLM vs. Ollama
- Was ist RAG?
- Open WebUI an Nextcloud anbinden (RAG mit ACLs)
- Was ist lokale KI?
- Cloud-KI vs. self-hosted
- KI-Souveränität für Unternehmen
- Welches LLM selbst hosten?
- GPU & VRAM dimensionieren
- Qdrant vs. pgvector
- EU AI Act für Unternehmen
- Lokale KI für Berufsgeheimnisträger
- Dokumente mit KI verarbeiten
- KI-Agenten & Automatisierung






