Souveräne KI heißt: Modelle laufen auf eigener Infrastruktur, keine Daten verlassen das Haus. Wir bauen und betreiben lokale KI-Systeme aus einer Hand - von der GPU-Hardware über den Open-Source-LLM-Stack bis zu RAG-Wissenssystemen. Auf diesen Seiten ordnen wir die Werkzeuge ehrlich ein, zeigen den produktiven Betrieb und den Weg zu DSGVO-konformer KI.
Was ist lokale KI?
Lokale KI heißt: Sprachmodelle laufen auf eigener Infrastruktur statt in der Cloud. Was das bedeutet, warum Unternehmen so arbeiten und wann es sinnvoll ist.
Cloud-KI vs. self-hosted
KI aus der Cloud oder selbst hosten? Der Vergleich: Datenschutz, Kosten pro Token gegen eigene Hardware, Kontrolle und Aufwand - und wann welches Modell passt.
KI-Souveränität für Unternehmen
KI-Souveränität heißt Kontrolle über Daten und Modelle. Warum 'Server in Frankfurt' nicht reicht, was der Rechtsrahmen fordert - und die Alternative.
Welches LLM selbst hosten?
Welches offene Sprachmodell selbst hosten? Modellgröße nach Anwendungsfall, die Lizenzfrage (Apache, MIT vs. Llama) und wie man das passende Modell auswählt.
GPU & VRAM dimensionieren
Wie viel VRAM braucht ein LLM? Die drei Komponenten - Modellgewichte, KV-Cache und Overhead - mit Faustregeln, Quantisierung und einem Rechenbeispiel.
Was ist vLLM?
vLLM ist eine schnelle Inferenz-Engine für LLMs: PagedAttention, Continuous Batching, OpenAI-kompatibler API-Server. Was vLLM macht und wann es passt.
vLLM vs. Ollama
Ollama oder vLLM für selbst gehostete LLMs? Der Vergleich: Einfachheit vs. Durchsatz, CPU vs. GPU, Einzelnutzer vs. Produktion - und wann welche Engine passt.
Der Open-Source-LLM-Stack
LLM selbst hosten heißt nicht ein Tool, sondern ein Stack: Inferenz (vLLM), Gateway (LiteLLM), Observability (Langfuse), Frontend und RAG - souverän betrieben.
Was ist LiteLLM?
LiteLLM ist ein OpenAI-kompatibles Gateway über 100+ LLMs: eine Schnittstelle, zentrale Auth, Budgets, Rate-Limits, Fallback. Was es macht und wozu.
Was ist Langfuse?
Langfuse ist eine Open-Source-Plattform für LLM-Observability: Tracing, Evaluation, Prompt-Management. Was es macht und warum es für den EU AI Act zählt.
Was ist RAG?
RAG verbindet ein LLM mit den eigenen Dokumenten: wie es funktioniert, warum es Halluzinationen senkt und wo Berechtigungen zum Knackpunkt werden.
Open WebUI an Nextcloud anbinden (RAG mit ACLs)
RAG auf Nextcloud-Dokumenten mit echten Rechten: warum ACLs vor der Vektorsuche erzwungen werden - Identität, Nextcloud-Shares, Qdrant-Filter.
Qdrant vs. pgvector
Qdrant oder pgvector für RAG? Der Vergleich: dedizierte Vektordatenbank gegen Postgres-Erweiterung, Skalierung, Betrieb und Filter - und wann welche passt.
Lokale KI für Berufsgeheimnisträger
Anwälte, Ärzte, Steuerberater: Warum Cloud-KI bei Schweigepflicht (§203 StGB) ausscheidet und lokale KI die Compliance-Lösung ist - Branchen und Setup.
Dokumente mit KI verarbeiten
Intelligente Dokumentenverarbeitung mit KI: wie LLMs die klassische OCR erweitern, typische Anwendungsfälle und der souveräne, self-hosted Weg mit Paperless-AI.
KI-Agenten & Automatisierung
Was KI-Agenten von einfacher Automatisierung unterscheidet, wie n8n Geschäftsprozesse orchestriert und warum souveräner Betrieb der sichere Weg ist.
Aus einer Hand
WZ-IT baut und betreibt Lokale & Souveräne KI produktiv für Unternehmen - Konzeption, Umsetzung und Betrieb aus einer Hand.
LLM-Hosting ansehen →Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.
Timo Wevelsiep & Robin Zins
Geschäftsführer
