25.06.2026
Lokale KI für Anwaltskanzleien: §203, Mandatsdaten und RAG
Wie lokale RAG-Systeme Mandatswissen erschließen, Quellen belegen und Aktenrechte bis in die Antwort übernehmen.
Der AI Cube Standard ist der Plug-and-play-Einstieg für KI-Chat, Dokumentensuche und eigene Assistenten. Vollständig vorkonfiguriert, mit abgestimmtem lokalem Modell, Ersteinrichtung und Support.

AI Cube Standard · Persönliche Lieferung und Einrichtung in Deutschland möglich
Der AI Cube stellt lokale KI als Arbeitswerkzeug bereit - für vertrauliche Dokumente, internes Wissen und wiederkehrende Aufgaben in unterschiedlichen Branchen.
Handbücher, Richtlinien, Akten oder Projektdokumentation durchsuchen und Antworten mit Quellenbezug erhalten.
Dokumente zusammenfassen, klassifizieren, vergleichen und für weitere Arbeitsschritte vorbereiten.
Eigene Assistenten mit festgelegter Aufgabe, ausgewähltem Modell und freigegebener Wissensbasis bereitstellen.
Entwürfe, Auswertungen und wiederkehrende textbasierte Arbeitsschritte mit lokalen Modellen vorbereiten.
Audio, Diktate, Bilder und PDFs abhängig vom eingesetzten Modell lokal verarbeiten.
Mitarbeitenden KI bereitstellen, ohne für jeden Nutzer ein Konto bei einem externen Modellanbieter vorauszusetzen.
Sie erhalten eine vollwertige lokale KI-Plattform, mit der Ihr Unternehmen eigene Anwendungsfälle erproben und erste Workloads produktiv nutzen kann. WZ-IT bereitet Hardware, Plattform und Modell gemeinsam vor.
AI Cube Standard
Vollständig eingerichteter lokaler KI-Server für KI-Chat, Dokumentensuche, eigene Assistenten und weitere Anwendungen im Unternehmensnetz.
netto, einmalig · optionaler Managed-Betrieb ab 149,90 € netto im Monat
Vor der Auslieferung klären wir Anwendungsfall, Modell, Speicher und Zugriffswege. Anschließend konfigurieren und testen wir das System in Deutschland. Die enthaltenen fünf Stunden stehen für Inbetriebnahme, Netzwerk- und Benutzerkonfiguration, Einweisung und technische Fragen zur Verfügung.
Kompakte Appliance
Unified Memory für lokale Modelle und lange Kontexte
Die konkrete SSD- und Modellkonfiguration wird vor der Bestellung anhand von Datenmenge, Modellgröße und Nutzung festgelegt.
Vertrauliche Daten und § 203 StGB
Bei vollständig lokaler Konfiguration bleiben Prompts, Dokumente und Modellantworten in Ihrer festgelegten Infrastruktur. Das ist besonders für Unternehmen mit vertraulichem Wissen sowie für Kanzleien, Heilberufe, Steuerberatung und weitere Berufsgeheimnisträger relevant.
Für einen §203-konformen Einsatz stimmen wir Datenwege, Berechtigungen, Protokollierung und Administrationszugriffe technisch ab. Die rechtliche und organisatorische Bewertung bleibt vom konkreten Einsatz abhängig.
Prompts, Dokumente und Modellantworten können innerhalb der eigenen Infrastruktur bleiben.
Zugriffe auf Modelle und Wissensbasen lassen sich nach Personen und Teams strukturieren.
Persönliche und geteilte Wissensbasen erhalten passende Lese- und Schreibrechte.
Netzwerkwege, externe Anbieter, Updates und Administrationszugriffe werden bewusst festgelegt.
Im Browser chatten, Dokumente befragen und eigene Assistenten nutzen: Open WebUI bildet die gemeinsame Arbeitsoberfläche, während Modelle, Wissen und Zugriffe unter Ihrer Kontrolle bleiben.
Vorinstalliert
Open WebUI bündelt Chats, Dateien, Wissensbasen, Modelle und Werkzeuge. WZ-IT richtet die Plattform auf dem Cube ein; Ihre berechtigten Nutzer können anschließend eigene Wissensbasen anlegen und für Teams freigeben.
Chats, Verläufe, Dateien und Modellauswahl in einer für Teams verständlichen Oberfläche.
Berechtigte Nutzer können Dokumente hochladen, Sammlungen anlegen und Wissen persönlich oder gemeinsam im Team verwenden.
Ollama oder vLLM stellt ausgewählte Open-Weight-Modelle direkt auf dem AI Cube bereit.
OIDC-Anmeldung und passende Zugriffsstrukturen werden an Ihre Identitätsumgebung angebunden.
Freigegebene Cloud- oder In-Region-Modelle können neben lokalen Modellen gezielt ergänzt werden.
Eigene Anwendungen und geprüfte Werkzeuge lassen sich über kontrollierte Schnittstellen anbinden.
WZ-IT verbindet Benutzer, Netzwerk, Modelle und freigegebene Datenquellen. Ihr Team arbeitet im Unternehmensnetz oder bei Bedarf über einen kontrollierten externen Zugang.
Zielarchitektur
Der Cube kann abgeschottet im internen Netz arbeiten oder bewusst mit vorhandenen Plattformen und freigegebenen Modelldiensten verbunden werden. Externe Zugriffe werden nicht durch eine offene Verwaltungsoberfläche gelöst, sondern über definierte Netzwerk- und Identitätswege.


OIDC, Gruppen und Rollen für Mitarbeiter und Administratoren.
Lokale Inferenz sowie optional freigegebene externe Endpunkte.
Dokumente, RAG-Speicher und vorhandene Datenquellen.
Updates, Backup, Monitoring und dokumentierte Administration.
Lokale Modelle und Datenquellen ohne ausgehende Modellaufrufe - passend für besonders sensible Anwendungsfälle.
Mitarbeitende und Administratoren greifen verschlüsselt über ein identitätsbasiertes VPN zu, ohne den Cube direkt öffentlich bereitzustellen.
Für externe Nutzung planen wir bei Bedarf ein vorgeschaltetes Gateway mit TLS, Zugriffskontrolle und klarer Netztrennung.
Welche Daten lokal bleiben und welche externen Dienste erreichbar sind, wird vor der Inbetriebnahme festgelegt und dokumentiert.
Von der sicheren Einbindung bis zur individuellen Anwendung erhalten Sie einen Ansprechpartner für KI-Plattform, Infrastruktur, Netzwerk und Softwareentwicklung.
End-to-End-Umsetzung
Sie müssen Hardware, KI-Plattform, Netzwerk und individuelle Entwicklung nicht zwischen mehreren Dienstleistern koordinieren. WZ-IT kann die gesamte technische Strecke umsetzen und weiterbetreiben.
Die fünf Inklusivstunden decken Inbetriebnahme, Benutzer- und Netzwerkkonfiguration, Einweisung und technische Fragen ab. Das Befüllen von Wissensbasen, Datenmigrationen und individuelle Integrationen werden separat angeboten.
Netzwerk, Benutzer, Firewall, VPN-Zugriff, Speicher und Backup passend zur vorhandenen Umgebung planen und umsetzen.
Nextcloud, Dateisysteme, Datenbanken, Wikis oder geeignete Schnittstellen von Fachsystemen als separates Integrationsprojekt anbinden.
Individuelle APIs, Automatisierungen, Middleware oder MCP-Server entwickeln, wenn die Standardfunktionen für den gewünschten Prozess nicht ausreichen.
Monitoring, Patch-Management und technische Betreuung ab 149,90 € netto im Monat sowie Modellwechsel, neue Integrationen und Weiterentwicklung nach vereinbartem Scope.
Nach Freigabe der Konfiguration bereiten wir Hardware, Plattform und lokales Modell vor, liefern den AI Cube in unter zwei Wochen vollständig vorkonfiguriert aus und nehmen ihn gemeinsam in Betrieb.
Anwendungsfall, lokales Modell, Speicher, Nutzer und Zugriffswege gemeinsam abstimmen.
System, Treiber, Open WebUI, Inferenz und das vorab abgestimmte lokale Modell vollständig einrichten, härten und technisch prüfen.
Innerhalb von zwei Wochen nach Freigabe liefern wir den vorkonfigurierten AI Cube aus und nehmen ihn im gemeinsamen Remote-Termin in Ihrer Umgebung in Betrieb.
Wir erklären die Nutzung und unterstützen bei der Einrichtung. Managed-Betrieb, Monitoring und Patches sind anschließend ab 149,90 € netto im Monat verfügbar.
Die Inklusivzeit steht für Inbetriebnahme, Netzwerk- und Benutzerkonfiguration, Einweisung und technische Fragen zur Verfügung. Für Datenmigrationen, Wissensquellen und individuelle Integrationen erhalten Sie auf Wunsch einen abgestimmten Umsetzungsscope.
Nach der Inbetriebnahme kann Ihr Team den AI Cube selbst betreiben oder die laufende technische Verantwortung an WZ-IT übergeben. Hardware und Root-Zugriff bleiben bei Ihnen.
Managed AI Cube
netto je AI Cube und Monat
Der Basisbetrieb deckt den vereinbarten technischen Betrieb der vorhandenen Installation ab. Umfang, Wartungsfenster, Backup-Ziele und Zuständigkeiten werden vor Beginn dokumentiert; Erweiterungen und größere Integrationen bleiben separat planbar.
Technische Überwachung der vereinbarten Systemkomponenten und nachvollziehbare Alarmwege.
Geplante Sicherheits- und Systemupdates für Betriebssystem, Container und den vereinbarten KI-Stack.
Backup-Management, Prüfungen und Wiederanlaufverfahren nach dem vereinbarten Scope und Speicherziel.
Essential ist die Basis. Business, Production und Critical ergänzen definierte Reaktionszeiten; Production und Critical decken P1-Reaktion rund um die Uhr ab.
Sagen Sie uns kurz, wofür Sie lokale KI einsetzen möchten und wie viele Personen damit arbeiten sollen. Wir schlagen die passende Konfiguration und den nächsten Schritt vor.
Der AI Cube Standard deckt den Einstieg und erste produktive Workloads ab. Wenn Modelle, Parallelität, Speicher oder Verfügbarkeitsanforderungen darüber hinausgehen, planen wir die passende größere Lösung.
AI Cube Standard
Für Unternehmen, die lokale KI einführen, Anwendungsfälle mit eigenen Daten erproben und erste Workloads produktiv nutzen möchten.

AI Cube Custom
Für größere Modelle, mehr parallele Nutzer, zusätzliche Speicherkapazität, Redundanz oder besondere Netzwerk- und Betriebsanforderungen.

Lokaler Chat, Dokumentensuche und erste RAG-Anwendungen für ein Team
AI Cube Standard
Ein Standort, 128 GB Unified Memory und planbare Nutzung
AI Cube Standard
Viele parallele Nutzer, HA, Rackmount oder dedizierte GPUs
AI Cube Custom
Vorhandene GPU-Hardware soll weiterverwendet werden
Integration oder Managed AI
Keine KI-Hardware am eigenen Standort gewünscht
LLM Hosting
Mehrere Geräte koppeln
Zwei AI Cubes können direkt über eine 200-GbE-QSFP-Verbindung gekoppelt werden. Damit lassen sich unterstützte Inferenz- und Fine-Tuning-Workloads über mehrere Knoten verteilen oder Modelle nutzen, die nicht sinnvoll auf ein einzelnes Gerät passen.
Die Kopplung erhöht nicht automatisch Verfügbarkeit oder Durchsatz für jede Anwendung. Software, Modell, Parallelisierungsverfahren und Netzwerktopologie müssen zum Workload passen; eine HA-Zusage wird separat geplant.
NVIDIA-GB10-Klasse mit 128 GB Unified Memory, wahlweise 1 TB, 2 TB oder 4 TB NVMe-SSD. Kompakter Appliance-Formfaktor, ConnectX-7 für die Kopplung mehrerer Cubes, Betrieb an 230 V. Vollständig eingerichtet und gehärtet mit Linux, GPU-Treibern, Open WebUI, Modell-Runtime und dem vorab abgestimmten lokalen Modell. Root-Zugriff liegt bei Ihnen.
Themen
Der AI Cube ist eine vorkonfigurierte lokale KI-Appliance für Unternehmen. Er verbindet Open WebUI, lokale Modelle und eigene Wissensquellen für Anwendungsfälle wie Dokumentensuche, interne Assistenten, Transkription und technische KI-Workloads.
Der WZ-IT AI Cube ist das Standardprodukt auf geprüfter ASUS/NVIDIA-Appliance-Basis. Für größere Modelle, viele parallele Nutzer oder besondere Infrastruktur-Anforderungen planen wir AI Cube Custom Builds mit dedizierten NVIDIA-GPUs, Multi-GPU, Rackmount oder individueller Netzwerkanbindung.
Der Verbrauch hängt vom gewählten Appliance- oder Custom-Setup und der tatsächlichen Last ab. Der Standard-AI-Cube ist als kompakte lokale KI-Box für Büro- und Unternehmensumgebungen ausgelegt; größere Custom-Systeme prüfen wir vorab hinsichtlich Strom, Kühlung und Standortbedingungen.
Beim Standard-AI-Cube ist der M.2-NVMe-Speicher austauschbar. GPU und Unified Memory sind Teil des GB10-Superchips und damit fest verbaut - mehr Rechenleistung oder mehr Speicher bekommen Sie über einen AI Cube Custom Build, bei dem wir Komponenten frei wählen. Die Hardware gehört in beiden Fällen Ihnen, Sie können sie also jederzeit selbst warten oder warten lassen.
Das ist möglich, wenn ausschließlich lokale Modelle und lokale Datenquellen konfiguriert werden. Sobald externe Modellanbieter, Werkzeuge oder Integrationen aktiviert sind, können Daten die Umgebung verlassen. Diese Datenwege legen wir bei der Einrichtung fest und dokumentieren sie.
Der AI Cube schafft eine technische Grundlage für lokale Verarbeitung, ersetzt aber keine rechtliche und organisatorische Bewertung. Modellanbieter, Datenquellen, Berechtigungen, Protokollierung, Aufbewahrung und Administrationszugänge müssen zum konkreten Einsatz passen und dokumentiert werden.
Der AI Cube eignet sich technisch für Umgebungen mit Berufsgeheimnissen, weil Modelle und Daten lokal verarbeitet und Zugriffswege kontrolliert werden können. Ob ein konkreter Einsatz die rechtlichen und organisatorischen Anforderungen erfüllt, muss für den jeweiligen Anwendungsfall geprüft werden.
Ja. Nach Freigabe der Konfiguration liefern wir den AI Cube in unter zwei Wochen vollständig vorbereitet aus und nehmen ihn innerhalb dieses Zeitraums im vereinbarten Remote-Termin mit Ihnen in Betrieb. Hardware, Open WebUI, Modell-Runtime und das vorab abgestimmte lokale Modell sind eingerichtet, gehärtet und technisch geprüft.
Ja. Wir übernehmen die vollständige Ersteinrichtung von Betriebssystem, GPU-Treibern, Container-Runtime, Open WebUI und Modell-Runtime, härten die Basisinstallation und prüfen das vorab abgestimmte lokale Modell vor der Auslieferung.
Enthalten sind Hardware, vollständige Ersteinrichtung und Härtung, der eingerichtete KI-Stack, ein vorab abgestimmtes und getestetes lokales Modell, Dokumentation sowie fünf Stunden für Inbetriebnahme, Netzwerk- und Benutzerkonfiguration, Einweisung und technische Fragen. Das Befüllen von Wissensbasen, Datenmigrationen und individuelle Integrationen werden separat angeboten.
Der AI Cube wird mit Open WebUI als Oberfläche sowie Ollama und/oder vLLM für lokale Inferenz vorbereitet. Open WebUI bringt Wissenssammlungen und RAG bereits mit. Lokale Open-Weight-Modelle, freigegebene externe Modelle und zusätzliche Vektordatenbanken werden passend zum Einsatz konfiguriert.
Ja. Berechtigte Nutzer können in Open WebUI Dokumente hochladen, persönliche oder gemeinsame Wissensbasen anlegen und Teams Lese- oder Schreibrechte geben. Das Befüllen bestehender Ablagen, Datenmigrationen und automatisierte Anbindungen an DMS, Nextcloud oder SharePoint sind separate Integrationsleistungen.
Ja - je nach Hardware-Ausstattung können mehrere Modelle parallel betrieben werden. Für intensive oder parallele Nutzung empfehlen wir leistungsstärkere bzw. angepasste Hardware-Konfigurationen.
Neben Chatbots und RAG-Systemen: Audio/Video-Transkription, Dokumenten-Indizierung, Data-Processing, Code-Assistenz, Automatisierung interner Prozesse - ideal für datenschutzkritische oder compliance-relevante Szenarien.
Der Standard-AI-Cube kostet 5.990,90 € exkl. USt. inklusive Hardware, vollständiger Basiseinrichtung und Härtung, abgestimmtem lokalen Modell sowie fünf Stunden für Inbetriebnahme, Einweisung und Support. AI Cube Custom Builds kalkulieren wir projektbezogen. Wirtschaftlich wird der AI Cube vor allem bei sensiblen Daten, planbarer Last und langfristiger Nutzung: keine externen Token-Abhängigkeiten, volle Kontrolle über Daten und Hardware.
Wenn Datenschutz, Kontrolle, konstante Performance und langfristige Planung wichtig sind - z. B. bei sensiblen Daten, Compliance-Anforderungen oder häufigem KI-Einsatz.
Ja. Wir unterstützen die Migration: Daten- und Modell-Übernahme, Neuaufsetzung auf Ihrem On-Prem-System - ohne externe Abhängigkeit.
Der AI Cube wird gekauft und gehört Ihrem Unternehmen, während unsere AI Server gemietet werden und als monatlicher Managed Service laufen. Der Cube eignet sich für langfristige Planung, lokale Kontrolle und feste Standorte; der gemietete Server für flexible Projekte oder variable Last.
Betriebssystem, GPU-Treiber, Container, Open WebUI, Inferenz-Stack und Modelle benötigen regelmäßige Updates und eine abgestimmte Backup-Strategie. Ihr Team kann das selbst übernehmen oder WZ-IT ab 149,90 € netto je AI Cube und Monat mit dem vereinbarten Betrieb, Monitoring und Patch-Management beauftragen.
Ja. Wir binden den Cube in vorhandene Netze, Identitätsdienste und Datenquellen ein. Für kontrollierten externen Zugriff können wir beispielsweise NetBird oder ein vorgeschaltetes Reverse-Proxy-Gateway einsetzen, ohne die Verwaltungsoberfläche direkt öffentlich bereitzustellen.
Der Managed-Betrieb beginnt bei 149,90 € netto je AI Cube und Monat. Der konkrete Scope umfasst je nach Vereinbarung Monitoring, Patch-Management, Backup-Begleitung und technische Betreuung. Für zeitkritische Systeme stehen zusätzlich Business-, Production- und Critical-Service-Levels zur Verfügung.
Auf Wunsch liefern wir ein Backup-Konzept: regelmäßige Snapshots, redundante oder externe Speicheroptionen, Remote-Backup - so sind Sie auch bei Hardware-Defekt abgesichert.
Inbetriebnahme und Support leisten wir remote, auf Deutsch und Englisch. Vor-Ort-Termine oder Auslieferung über Partner stimmen wir bei passenden Projekten ab.
Der Standard-AI-Cube basiert auf einer geprüften ASUS/NVIDIA-Appliance. Konfiguration, Installation des Local-AI-Stacks, Test und Inbetriebnahme erfolgen bei uns in Deutschland. Für AI Cube Custom Builds stellen wir zusätzlich die Komponenten passend zum Workload zusammen und integrieren sie bei uns.
Ja - wir bieten ein Reseller-Programm mit attraktiven Einkaufskonditionen, technischer Unterstützung und optionaler White-Label-Lizenz. Ideal für Systemhäuser und IT-Dienstleister.
25.06.2026
Wie lokale RAG-Systeme Mandatswissen erschließen, Quellen belegen und Aktenrechte bis in die Antwort übernehmen.
10.05.2026
Drei unauthentifizierte API-Calls. Kein Login, kein Exploit-Framework, keine Privilege Escalation. Drei POST-Requests an einen Standard-Port, und der Speicher der Maschine ist auf Reisen — mit...
28.04.2026
DGX Spark und WZ-IT AI Cube sind heute keine grundsätzlich unterschiedlichen Leistungsklassen. Beide basieren auf der NVIDIA-GB10-Klasse mit 128 GB Unified Memory. Wer nur GPU,...
24.11.2025
OpenAI hat GPT-OSS 120B am 5. August 2025 als Open-Weight-Reasoning-Modell veröffentlicht. Durch die ab Werk verwendete MXFP4-Quantisierung positioniert OpenAI das Modell für eine einzelne GPU...
09.11.2025
Lokale KI-Inferenz bedeutet, dass ein Sprach- oder Multimodalmodell auf eigener Hardware statt über eine öffentliche API ausgeführt wird. Unternehmen gewinnen damit Kontrolle über Datenwege, Modellwahl...
08.11.2025
Die Nutzung von Large Language Models (LLMs) wie GPT-4, Claude oder Llama hat sich in den letzten Jahren von experimentellen Anwendungen zu unternehmenskritischen Werkzeugen entwickelt....
Kein Risiko: Im schlechtesten Fall gehen Sie mit mehr Klarheit über Ihr Projekt heraus als vorher.


„Die Beratung von WZ-IT zu unserer Azure-Migration war schon im Erstgespräch fachlich sehr fundiert und völlig unverbindlich - wir haben eine Menge mitgenommen.“
Von der lokalen KI-Integration bis zu Architektur, Datenhoheit und laufendem Betrieb.
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.
Timo Wevelsiep & Robin Zins
Geschäftsführer

