Lokale KI beginnt nicht bei einer abstrakten Architektur. Der AI Cube Pro ist unser vorkonfigurierter Einstieg mit Open WebUI, lokalem Modell, Härtung und Ersteinrichtung. Diese Wissensseiten helfen bei Datenschutz, Modellen, Kosten, Dimensionierung, RAG und sicherem Betrieb und zeigen, wann Standardhardware genügt oder ein größerer Aufbau sinnvoll ist.
Was ist lokale KI?
Lokale KI erklärt: Betriebsgrenzen, Architektur, Hardware, Datenschutz und der Weg vom Pilot zum produktiven On-Premise- oder Self-hosted-System.
Cloud-KI vs. self-hosted
Cloud-KI, dedizierter Betrieb, Self-Hosting oder Hybrid? Vergleich von Datenschutz, Kontrolle, Qualität, TCO und Betriebsaufwand mit Entscheidungsmatrix.
Eigenes ChatGPT für Unternehmen
Eigenes ChatGPT für Unternehmen: Cloud-Workspace, EU-Plattform, Private Cloud und lokale KI nach Daten, Kosten, Wissen und Betrieb vergleichen.
KI-Souveränität für Unternehmen
KI-Souveränität heißt Kontrolle über Daten, Modelle und Betrieb. Ein praxisnaher Prüfrahmen für Cloud, Managed AI und On-Premise-KI.
Chatbot oder Wissens-Navigator?
Support-Chatbot, geführte Wissenssuche oder einfach eine gute Volltextsuche? Vier Optionen im Vergleich - mit den Fällen, in denen sich keine lohnt.
Welches LLM selbst hosten?
Welches LLM selbst hosten? Auswahl nach Aufgabe, Qualität, Lizenz, Sprache, VRAM, Durchsatz und Betrieb - mit praxisnaher Evaluationsmatrix.
GPU & VRAM dimensionieren
Wie viel VRAM braucht ein LLM? Die drei Komponenten - Modellgewichte, KV-Cache und Overhead - mit Faustregeln, Quantisierung und einem Rechenbeispiel.
Inferenz vs. Training
Inferenz nutzt fertige KI-Modelle und prägt die laufenden Kosten. Der Guide erklärt GPU-Bedarf, RAG, Fine-Tuning und sinnvolle Trainingsfälle.
Was kostet ein lokaler KI-Server?
Kosten lokaler KI-Server verständlich kalkulieren: Hardware, Einrichtung, Nutzer, Betrieb, Integration und Vergleich mit Cloud-Abos über drei Jahre.
KI-Server kaufen oder mieten?
KI-Server kaufen oder mieten: Kosten, Laufzeit, Hardwaretausch, Betrieb, Upgrade und TCO für Appliance, Managed Server und eigene Infrastruktur.
Lokalen KI-Server nach Nutzern dimensionieren
Lokale KI nach Nutzerzahl dimensionieren: Parallelität, Antwortlänge, Kontext, Modell und Lasttest als belastbare Grundlage für die Hardwareauswahl.
LLM-Modelle auf 128 GB Unified Memory
LLMs für 128 GB Unified Memory: konkrete GB10-Modelle, Quantisierung, KV-Cache, Kontext und Auswahl für den AI Cube verständlich eingeordnet.
AI Cubes mit ConnectX-7 verbinden
AI Cubes über ConnectX-7 verbinden: direkte Topologien, NVIDIA Sync, Load Balancing, verteilte Inferenz und technische Grenzen eines GB10-Clusters.
ASUS Ascent GX10 für Unternehmen einrichten
ASUS Ascent GX10 für Unternehmen einrichten: lokale Modelle, Open WebUI, Härtung, Benutzer, Netzwerk, Backup und produktiver Betrieb.
NVIDIA DGX Spark für Unternehmen einrichten
NVIDIA DGX Spark als lokale KI-Plattform einrichten: Modelle, Open WebUI, Benutzer, Netzwerk, Härtung, Backup, Monitoring und Betrieb.
Acer Veriton GN100 für Unternehmen einrichten
Acer Veriton GN100 für lokale KI einrichten: DGX OS, Modelle, Open WebUI, Benutzer, Netzwerk, Härtung, Backup, Monitoring und Betrieb.
Dell Pro Max mit GB10 für Unternehmen einrichten
Dell Pro Max mit GB10 produktiv einrichten: Appliance-Modus, Modelle, Open WebUI, Härtung, Benutzer, Netzwerk, Backup, Monitoring und Betrieb.
Gigabyte AI TOP ATOM für Unternehmen einrichten
Gigabyte AI TOP ATOM als lokale KI-Plattform einrichten: Modelle, Open WebUI, ARM64, Benutzer, Härtung, Backup, ConnectX-7 und Monitoring.
HP ZGX Nano G1n für Unternehmen einrichten
HP ZGX Nano G1n produktiv einrichten: lokales Modell, Open WebUI, ZGX Toolkit, Benutzer, Härtung, Backup, Monitoring und sicherer Betrieb.
Lenovo ThinkStation PGX für Unternehmen einrichten
Lenovo ThinkStation PGX für lokale KI einrichten: DGX OS, Modelle, Open WebUI, Benutzer, Härtung, Netzwerk, Backup, Monitoring und Betrieb.
MSI EdgeXpert für Unternehmen einrichten
MSI EdgeXpert produktiv einrichten: lokale Modelle, Open WebUI, NVIDIA AI Enterprise, Benutzer, Härtung, Backup, Monitoring und Betrieb.
Was ist vLLM?
vLLM ist eine schnelle Inferenz-Engine für LLMs: PagedAttention, Continuous Batching, OpenAI-kompatibler API-Server. Was vLLM macht und wann es passt.
vLLM vs. Ollama
Ollama oder vLLM für selbst gehostete LLMs? Der Vergleich: Einfachheit vs. Durchsatz, CPU vs. GPU, Einzelnutzer vs. Produktion - und wann welche Engine passt.
Der Open-Source-LLM-Stack
LLM selbst hosten heißt nicht ein Tool, sondern ein Stack: Inferenz (vLLM), Gateway (LiteLLM), Observability (Langfuse), Frontend und RAG - souverän betrieben.
Was ist LiteLLM?
LiteLLM ist ein OpenAI-kompatibles Gateway über 100+ LLMs: eine Schnittstelle, zentrale Auth, Budgets, Rate-Limits, Fallback. Was es macht und wozu.
Was ist Langfuse?
Langfuse ist eine Open-Source-Plattform für LLM-Observability: Tracing, Evaluation, Prompt-Management. Was es macht und warum es für den EU AI Act zählt.
Open WebUI als Appliance produktiv betreiben
Open WebUI produktiv als lokale KI-Plattform betreiben: Benutzer, Wissen, Modelle, Datenbank, Backup, Updates, Monitoring und sichere Zugriffe.
Was ist RAG?
RAG verbindet ein LLM mit den eigenen Dokumenten: wie es funktioniert, warum es Halluzinationen senkt und wo Berechtigungen zum Knackpunkt werden.
Wissenstransfer bei Mitarbeiterwechsel
So planen Sie den Wissenstransfer bei Mitarbeiterwechsel: Themen auswählen, Interviews führen, Inhalte prüfen und für die Nachfolge zugänglich machen.
Open WebUI an Nextcloud anbinden (RAG mit ACLs)
RAG auf Nextcloud-Dokumenten mit echten Rechten: warum ACLs vor der Vektorsuche erzwungen werden - Identität, Nextcloud-Shares, Qdrant-Filter.
Qdrant vs. pgvector
Qdrant oder pgvector für RAG? Der Vergleich: dedizierte Vektordatenbank gegen Postgres-Erweiterung, Skalierung, Betrieb und Filter - und wann welche passt.
RAG mit Berechtigungen
Zugriffsrechte in RAG-Systemen: warum der Prompt keine Sicherheitsgrenze ist, wo der Filter sitzen muss und was ein Nachfilter über die Trefferzahl verrät.
RAG mit Nextcloud, SharePoint und DMS
Nextcloud, SharePoint oder DMS sicher mit lokaler KI verbinden: Synchronisation, Berechtigungen, Löschung und RAG-Architektur verständlich erklärt.
EU AI Act für Unternehmen
EU AI Act für Unternehmen: Rollen, Risikostufen, Fristen nach dem AI Omnibus 2026 und ein konkreter Umsetzungsplan für Governance und Betrieb.
KI-Agenten: Rechte und Freigaben
Unter wessen Konto handelt ein KI-Agent? Dienstkonto gegen delegierte Identität, Werkzeugkatalog statt Vollzugriff, Freigaben und Protokoll.
KI-Assistent und Betriebsrat
Interner KI-Assistent und Betriebsrat: Mitbestimmung nach § 87 BetrVG, Datenschutz, Protokollierung und technische Regeln für eine Betriebsvereinbarung.
DSGVO-konforme KI: Prüfkriterien
DSGVO-konforme KI prüfen: Zweck, Rechtsgrundlage, Datenwege, Löschung, Berechtigungen, Anbieter und technische Maßnahmen verständlich erklärt.
Lokale KI sicher von außen bereitstellen
Lokale KI sicher für Homeoffice und Standorte bereitstellen: VPN, NetBird, Reverse Proxy und die passende Zugriffsmethode ohne offenen Modellport.
Lokale KI für Berufsgeheimnisträger
KI bei § 203 StGB: Anforderungen für Anwälte, Ärzte und Steuerberater, Betriebsmodelle, technische Kontrollen und ein praxisnaher Prüfpfad.
Dokumente mit KI verarbeiten
Intelligente Dokumentenverarbeitung mit KI: wie LLMs die klassische OCR erweitern, typische Anwendungsfälle und der souveräne, self-hosted Weg mit Paperless-AI.
KI-Agenten & Automatisierung
Was KI-Agenten von einfacher Automatisierung unterscheidet, wie n8n Geschäftsprozesse orchestriert und warum souveräner Betrieb der sichere Weg ist.
Aus einer Hand
WZ-IT baut und betreibt Lokale KI für Unternehmen produktiv für Unternehmen - Konzeption, Umsetzung und Betrieb aus einer Hand.
AI Cube Pro ansehen →Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.