Deutschland → weltweit
WZ-IT Logo

Der Open-Source-LLM-Stack: Modelle selbst betreiben

Timo WevelsiepTimo WevelsiepAktualisiert: 23.07.2026

Hinweis zum Inhalt: Versionen, Befehle und Preise können sich ändern. Bitte prüfen Sie kritische Schritte vor dem produktiven Einsatz eigenständig. Dieser Leitfaden ersetzt keine individuelle Beratung.

Lokale KI produktiv betreiben lassen? WZ-IT baut und betreibt den kompletten Open-Source-LLM-Stack auf eigener Infrastruktur - GPU-Hardware, Inferenz, Gateway, Observability und RAG, DSGVO-konform aus einer Hand. LLM-Hosting ansehen

Ein LLM selbst zu hosten ist selten „ein Tool installieren". Für den Produktivbetrieb braucht es einen Stack aus mehreren Open-Source-Komponenten, die jeweils eine Schicht abdecken - von der reinen Inferenz bis zur auditierbaren Mehrbenutzer-Nutzung. Dieser Artikel ordnet die Schichten und die wichtigsten Werkzeuge ein: vLLM, Ollama, LiteLLM, Langfuse, Open WebUI und die Vektordatenbank. Stand Juli 2026.

Inhaltsverzeichnis

Warum ein Stack statt eines Tools

Ein Modell zum Laufen zu bringen ist heute einfach - ein Befehl, und Ollama bedient ein LLM. Der Sprung ins Produktivsystem ist der schwierige Teil: Mehrere Nutzer und Anwendungen greifen zu, Zugriffe müssen gesteuert und Kosten begrenzt werden, jede Anfrage soll nachvollziehbar sein, und Wissen aus eigenen Dokumenten soll einfließen, ohne Berechtigungen zu verletzen.

Keine einzelne Komponente löst all das. Deshalb hat sich ein modularer Stack etabliert, in dem jede Schicht eine klar umrissene Aufgabe übernimmt und über offene, meist OpenAI-kompatible Schnittstellen mit den anderen spricht. Der große Vorteil: Jede Schicht ist austauschbar, und alles läuft auf eigener Infrastruktur.

Die fünf Schichten im Überblick

Schicht Aufgabe Typische Werkzeuge
Inferenz Das Modell bedienen vLLM, Ollama
Gateway Zugriff bündeln, steuern LiteLLM
Observability Anfragen nachvollziehen, auditieren Langfuse
Frontend Nutzer-Oberfläche, Mehrbenutzer Open WebUI
Vektordatenbank Wissen für RAG speichern Qdrant, pgvector

Nicht jede Installation braucht alle fünf. Ein einzelner Anwendungsfall kommt mit Inferenz und Gateway aus; ein Wissens-Assistent ergänzt Frontend und Vektordatenbank. Der Stack wächst mit den Anforderungen.

Inferenz: das Modell bedienen

Die unterste Schicht bedient das Sprachmodell und beantwortet Anfragen. Zwei Werkzeuge dominieren:

  • vLLM - eine schnelle Inferenz- und Serving-Engine mit hohem Durchsatz (PagedAttention, Continuous Batching) und einem OpenAI-kompatiblen API-Server. Die richtige Wahl, wenn viele Anfragen effizient über GPUs laufen sollen.
  • Ollama - der einfachste Einstieg: Ein Befehl, und ein Modell läuft lokal. Ideal für schnelle Tests und kleine Lasten, mit weniger Durchsatz als vLLM bei parallelen Anfragen.

Welche Engine passt, hängt an Last und Anspruch - Details in Was ist vLLM?.

Gateway und Observability

Über der Inferenz liegen zwei Schichten, die aus einem laufenden Modell einen betreibbaren Dienst machen:

LiteLLM ist das Gateway: ein einziges, OpenAI-kompatibles Interface über mehr als 100 Modelle. Anwendungen sprechen nur noch mit dem Gateway, egal ob dahinter vLLM, Ollama oder ein externes Modell antwortet. Das bringt zentrale Authentifizierung, Budgets, Rate-Limits und Fallback an eine Stelle - mehr dazu in Was ist LiteLLM?.

Langfuse ist die Observability: eine Open-Source-Plattform, die jede Anfrage als nachvollziehbaren Trace aufzeichnet, dazu Auswertungen, Metriken und Prompt-Verwaltung. Das ist nicht nur für die Fehlersuche wertvoll, sondern auch für die Nachweis- und Logging-Anforderungen, die der EU AI Act an KI-Systeme stellt.

Frontend und Wissen

Für die Nutzer fehlt eine Oberfläche, für Wissenssysteme ein Gedächtnis:

Open WebUI ist das verbreitete Frontend: eine self-hosted Weboberfläche mit Benutzer-, Rollen- und Gruppenverwaltung, Anbindung an das Gateway, RAG-Funktion und Audit-Logging, per OIDC oder LDAP an das eigene Verzeichnis angebunden. Es macht aus dem Stack ein Werkzeug, das auch Nicht-Techniker nutzen.

Die Vektordatenbank (etwa Qdrant oder die Postgres-Erweiterung pgvector) speichert das Wissen aus eigenen Dokumenten als Vektoren, damit das Modell darauf zugreifen kann - die Grundlage für Retrieval-Augmented Generation (RAG). Entscheidend im Unternehmen: Berechtigungen müssen dabei technisch erzwungen werden, nicht dem Modell überlassen.

Souverän betrieben statt zusammengestückelt

Der eigentliche Wert des Open-Source-Stacks ist die Souveränität: Jede Schicht läuft auf eigener Infrastruktur - GPU-Server, Proxmox oder Bare Metal -, sodass weder Prompts noch Dokumente das Haus verlassen. Das ist der Unterschied zu Cloud-KI-Diensten und die Grundlage für DSGVO-Konformität.

Der Preis ist Integrationsarbeit: Fünf Komponenten müssen sauber zusammenspielen, abgesichert, überwacht und aktuell gehalten werden. Genau hier trennt sich das Experiment vom Produktivsystem. WZ-IT plant, baut und betreibt diesen Stack aus einer Hand - von der Hardware bis zum RAG-Wissenssystem. Wie das Gateway und die Inferenz im Detail funktionieren, vertiefen Was ist LiteLLM? und Was ist vLLM?.

Lieber betreiben lassen?

Sie möchten Lokale & Souveräne KI nicht selbst betreiben? WZ-IT übernimmt Einrichtung, Betrieb und Wartung - DSGVO-konform aus Deutschland.

Häufig gestellte Fragen

Antworten auf die wichtigsten Fragen

Ein produktiver LLM-Stack besteht aus mehreren Schichten: einer Inferenz-Engine, die das Modell bedient (vLLM oder Ollama), einem Gateway, das den Zugriff bündelt (LiteLLM), einer Observability-Schicht für Nachvollziehbarkeit (Langfuse), einem Frontend für die Nutzer (Open WebUI) und - für Wissenssysteme - einer Vektordatenbank (Qdrant oder pgvector). Alle Komponenten sind Open Source und selbst hostbar.

Ollama ist hervorragend, um schnell ein Modell laufen zu lassen, deckt aber nur die Inferenz-Schicht ab. Für den Produktivbetrieb fehlen Zugriffssteuerung und Kostenkontrolle über mehrere Modelle (Gateway), Nachvollziehbarkeit und Auditierung der Anfragen (Observability) sowie oft ein Mehrbenutzer-Frontend. Diese Aufgaben übernehmen die anderen Schichten des Stacks.

Ja. Alle genannten Komponenten sind Open Source und laufen vollständig auf eigener Infrastruktur - auf GPU-Servern, Proxmox oder Bare Metal. Damit verlassen weder die Prompts noch die Dokumente das Haus. Das ist der entscheidende Unterschied zu Cloud-KI-Diensten und die Grundlage für DSGVO-Konformität und die Logging-Anforderungen des EU AI Act.

LiteLLM stellt ein einziges, OpenAI-kompatibles Interface über viele Modelle bereit. Anwendungen sprechen nur noch mit dem Gateway, egal ob dahinter vLLM, Ollama oder ein externes Modell läuft. Das entkoppelt Anwendungen von Modellen und bringt zentrale Authentifizierung, Budgets, Rate-Limits und Fallback an einer Stelle.

Nein, zwingend nicht. Der Stack läuft als Container-Verbund und lässt sich mit Docker Compose auf einem einzelnen GPU-Server betreiben. Für größere, hochverfügbare Installationen bietet sich Kubernetes an - mehrere Komponenten (etwa Langfuse) empfehlen Helm-Deployments für den produktiven Betrieb. Die Wahl hängt an Skalierung und Verfügbarkeitsanforderung.

Ja, der Stack ist modular. Ein reiner Chat-Assistent braucht kein RAG und keine Vektordatenbank; ein einzelnes Modell für eine Anwendung kommt kurzfristig ohne Gateway aus. Für einen belastbaren, auditierbaren Mehrbenutzer-Betrieb lohnen sich Gateway und Observability aber fast immer - sie sind der Unterschied zwischen Experiment und Produktivsystem.

Kontakt

Lassen Sie uns über Ihre Idee sprechen

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

E-Mail
[email protected]

Führende Unternehmen vertrauen WZ-IT

  • ml&s
  • Rekorder
  • Keymate
  • Führerscheinmacher
  • SolidProof
  • ARGE
  • Boese VA
  • nextGYM
  • Maho Management
  • Golem.de
  • Millenium
  • Paritel
  • Yonju
  • EVADXB
  • Mr. Clipart
  • Aphy AG
  • Negosh
  • ABCO Water Systems
Timo Wevelsiep & Robin Zins - CEOs of WZ-IT

Timo Wevelsiep & Robin Zins

Geschäftsführer

1/3 - Themenauswahl33%

Worum geht es bei Ihrer Anfrage?

Wählen Sie einen oder mehrere Bereiche, bei denen wir Sie unterstützen dürfen.