Souveräne KI heißt: Modelle laufen auf eigener Infrastruktur, keine Daten verlassen das Haus. Wir bauen und betreiben lokale KI-Systeme aus einer Hand - von der GPU-Hardware über den Open-Source-LLM-Stack bis zu RAG-Wissenssystemen. Auf diesen Seiten ordnen wir die Werkzeuge ehrlich ein, zeigen den produktiven Betrieb und den Weg zu datenschutzorientierter KI.
Was ist lokale KI?
Lokale KI erklärt: Betriebsgrenzen, Architektur, Hardware, Datenschutz und der Weg vom Pilot zum produktiven On-Premise- oder Self-hosted-System.
Cloud-KI vs. self-hosted
Cloud-KI, dedizierter Betrieb, Self-Hosting oder Hybrid? Vergleich von Datenschutz, Kontrolle, Qualität, TCO und Betriebsaufwand mit Entscheidungsmatrix.
KI-Souveränität für Unternehmen
KI-Souveränität heißt Kontrolle über Daten, Modelle und Betrieb. Ein praxisnaher Prüfrahmen für Cloud, Managed AI und On-Premise-KI.
Chatbot oder Wissens-Navigator?
Support-Chatbot, geführte Wissenssuche oder einfach eine gute Volltextsuche? Vier Optionen im Vergleich - mit den Fällen, in denen sich keine lohnt.
Welches LLM selbst hosten?
Welches LLM selbst hosten? Auswahl nach Aufgabe, Qualität, Lizenz, Sprache, VRAM, Durchsatz und Betrieb - mit praxisnaher Evaluationsmatrix.
GPU & VRAM dimensionieren
Wie viel VRAM braucht ein LLM? Die drei Komponenten - Modellgewichte, KV-Cache und Overhead - mit Faustregeln, Quantisierung und einem Rechenbeispiel.
Inferenz vs. Training
Training erzeugt Modelle, Inferenz nutzt sie - und bestimmt Ihre Kosten. Warum die meisten Unternehmen kein Training brauchen, welche GPU reicht und wann RAG genügt.
Was ist vLLM?
vLLM ist eine schnelle Inferenz-Engine für LLMs: PagedAttention, Continuous Batching, OpenAI-kompatibler API-Server. Was vLLM macht und wann es passt.
vLLM vs. Ollama
Ollama oder vLLM für selbst gehostete LLMs? Der Vergleich: Einfachheit vs. Durchsatz, CPU vs. GPU, Einzelnutzer vs. Produktion - und wann welche Engine passt.
Der Open-Source-LLM-Stack
LLM selbst hosten heißt nicht ein Tool, sondern ein Stack: Inferenz (vLLM), Gateway (LiteLLM), Observability (Langfuse), Frontend und RAG - souverän betrieben.
Was ist LiteLLM?
LiteLLM ist ein OpenAI-kompatibles Gateway über 100+ LLMs: eine Schnittstelle, zentrale Auth, Budgets, Rate-Limits, Fallback. Was es macht und wozu.
Was ist Langfuse?
Langfuse ist eine Open-Source-Plattform für LLM-Observability: Tracing, Evaluation, Prompt-Management. Was es macht und warum es für den EU AI Act zählt.
Was ist RAG?
RAG verbindet ein LLM mit den eigenen Dokumenten: wie es funktioniert, warum es Halluzinationen senkt und wo Berechtigungen zum Knackpunkt werden.
Open WebUI an Nextcloud anbinden (RAG mit ACLs)
RAG auf Nextcloud-Dokumenten mit echten Rechten: warum ACLs vor der Vektorsuche erzwungen werden - Identität, Nextcloud-Shares, Qdrant-Filter.
Qdrant vs. pgvector
Qdrant oder pgvector für RAG? Der Vergleich: dedizierte Vektordatenbank gegen Postgres-Erweiterung, Skalierung, Betrieb und Filter - und wann welche passt.
RAG mit Berechtigungen
Zugriffsrechte in RAG-Systemen: warum der Prompt keine Sicherheitsgrenze ist, wo der Filter sitzen muss und was ein Nachfilter über die Trefferzahl verrät.
EU AI Act für Unternehmen
EU AI Act für Unternehmen: Rollen, Risikostufen, Fristen nach dem AI Omnibus 2026 und ein konkreter Umsetzungsplan für Governance und Betrieb.
KI-Agenten: Rechte und Freigaben
Unter wessen Konto handelt ein KI-Agent? Dienstkonto gegen delegierte Identität, Werkzeugkatalog statt Vollzugriff, Freigaben und Protokoll.
KI-Assistent und Betriebsrat
Interner KI-Assistent und Betriebsrat: Mitbestimmung nach § 87 BetrVG, Datenschutz, Protokollierung und technische Regeln für eine Betriebsvereinbarung.
Lokale KI für Berufsgeheimnisträger
KI bei § 203 StGB: Anforderungen für Anwälte, Ärzte und Steuerberater, Betriebsmodelle, technische Kontrollen und ein praxisnaher Prüfpfad.
Dokumente mit KI verarbeiten
Intelligente Dokumentenverarbeitung mit KI: wie LLMs die klassische OCR erweitern, typische Anwendungsfälle und der souveräne, self-hosted Weg mit Paperless-AI.
KI-Agenten & Automatisierung
Was KI-Agenten von einfacher Automatisierung unterscheidet, wie n8n Geschäftsprozesse orchestriert und warum souveräner Betrieb der sichere Weg ist.
Aus einer Hand
WZ-IT baut und betreibt Lokale & Souveräne KI produktiv für Unternehmen - Konzeption, Umsetzung und Betrieb aus einer Hand.
LLM-Hosting ansehen →Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.
Timo Wevelsiep & Robin Zins
Geschäftsführer
