Architektur und Migration
Sizing, Zielumgebung, Datenübernahme, Cutover und Wiederanlauf werden vor dem produktiven Betrieb geklärt.
WZ-IT plant, installiert und betreibt PrivateGPT als Managed Hosting, in Ihrer Cloud oder on-premises. Je nach Zielbild übernehmen wir Migration, sichere Netzwerk- und Identity-Anbindung, Monitoring, Backups, Updates sowie Integrationen und Weiterentwicklung.
Unternehmen weltweit vertrauen WZ-IT
Die genannten Namen sind Marken ihrer jeweiligen Inhaber: PrivateGPT (Zylon by PrivateGPT). WZ-IT ist ein unabhängiger Dienstleister und steht in keiner geschäftlichen, partnerschaftlichen oder vertraglichen Beziehung zu diesen Unternehmen. Wir bieten unabhängige Migrations-, Installations-, Hosting- und Betriebsdienstleistungen an.
PrivateGPT stellt Bausteine für dokumentenbasierte RAG-Anwendungen mit Large Language Models bereit. Dokumentenverarbeitung, Retrieval und Modellzugriff können lokal betrieben werden; bei Remote-LLM- oder Embedding-Anbietern werden die jeweils übermittelten Inhalte extern verarbeitet.
Die Plattform unterstützt lokale und entfernte Modellanbieter. Wir legen Datenflüsse, Modellzugriffe, Vektorspeicher und Berechtigungen deshalb passend zum Schutzbedarf aus, statt aus Self-Hosting pauschal Datenschutzkonformität abzuleiten.
Wir installieren, hosten und betreiben PrivateGPT wahlweise On-Premise oder auf abgestimmter Infrastruktur in Deutschland. Lokale und externe Modell- sowie Embedding-Dienste werden als nachvollziehbare Datenflüsse geplant.
Wir bieten 24/7-Monitoring, Backups und Wartung für Ihre PrivateGPT-Instanz. Menschliche Reaktionszeiten und Supportzeiten richten sich nach dem gewählten Service Level. Inklusive Unterstützung bei der Integration Ihrer bevorzugten LLM-Provider, der Dokumenten-Ingestion und RAG-Optimierung.
Dokumente, Embeddings und Modellanfragen können bei vollständig lokaler Konfiguration in der eigenen Umgebung bleiben. Externe Provider werden als eigene Datenflüsse bewertet und freigegeben.
RAG-Pipeline mit Dokumenten-Parsing, Splitting, Metadaten, Embeddings und Chunk-Retrieval. Ergebnisqualität und Quellenbezug werden anhand des konkreten Bestands getestet.
FastAPI-basierte Architektur mit OpenAI-kompatiblen Endpunkten. Benötigte Parameter, Streaming-, Tool- und Client-Funktionen werden versionsbezogen getestet und bei Bedarf angepasst.
Kann komplett offline und lokal betrieben werden - on-premise, in Ihrer Private Cloud oder Air-Gapped-Umgebung. Keine Abhängigkeit von externen Cloud-Diensten.
Unterstützt lokale Provider (Ollama, LlamaCPP) und Remote-Provider (OpenAI, Azure OpenAI, Sagemaker, etc.). Wechseln Sie flexibel zwischen verschiedenen Modellen.
Dokumentenverarbeitung mit Parsing, Chunking, Metadaten und Embeddings. Ergebnisqualität und unterstützte Formate hängen von Version, Parsern und Konfiguration ab.
Bei lokaler Auslegung lassen sich Speicherorte, Identitäten und Netzwerkpfade kontrollieren. Die rechtliche Zulässigkeit hängt zusätzlich vom konkreten Einsatzzweck und den angebundenen Diensten ab.
Der öffentlich einsehbare Quellcode steht unter Apache-2.0-Lizenz und kann technisch geprüft und angepasst werden. Modelle und weitere Abhängigkeiten werden separat bewertet.
Basiert auf LlamaIndex Framework. Freie Wahl zwischen verschiedenen LLM-Providern, Vektordatenbanken und Deployment-Modellen ohne Abhängigkeit von einzelnen Anbietern.
Professionelle Installation auf Ihrer Infrastruktur - On-Premise, Cloud oder Hybrid
In Ihrem Rechenzentrum
AWS, Azure, Hetzner & Co.
Erweiterte Architektur nach technischer und lizenzrechtlicher Prüfung
Vertrauliche Dokumente in einer kontrollierten Umgebung durchsuchen; Datenflüsse, Modellzugriffe und Telemetrie werden entsprechend Ihrer Architektur konfiguriert
Kontrollierbare Datenflüsse für Organisationen mit erhöhtem Schutzbedarf; rechtliche und fachliche Anforderungen werden projektbezogen geprüft
Production-ready RAG mit intelligentem Dokumenten-Parsing, Embeddings-Generierung und kontextbasierter Chunk-Retrieval für präzise Antworten
Flexible Nutzung von lokalen LLMs (Ollama, LlamaCPP) oder Remote-Providern (OpenAI, Azure OpenAI, Gemini) je nach Anforderung
Komplett offline betreibbar für mehrschichtige Sicherheitsmaßnahmensanforderungen, isolierte Netzwerke und Air-Gapped-Umgebungen ohne externe Abhängigkeiten
FastAPI-basierte Architektur mit OpenAI-kompatibler API für nahtlose Integration in bestehende Tools und Workflows ohne Code-Änderungen
Sichere Einwahl und Zugriffskontrolle für Ihre Installation
WireGuard, NetBird oder Tailscale
Direkt oder über vorgeschalteten Identity-Layer
Abhängig von Anwendung, Edition und Identity Provider
Fail2Ban, Rate Limiting, IP Whitelisting
Wir richten für Sie einen sicheren VPN-Zugang zu Ihrer Installation ein - ideal für Remote-Work und externe Mitarbeiter.
Full-Service Installation ohne versteckte Kosten
PrivateGPT ermöglicht lokale LLM-Nutzung mit eigenen Dokumenten. Wir integrieren es in Ihre bestehende Infrastruktur und erweitern die Fähigkeiten.
Über die API binden wir PrivateGPT an Ihre Systeme an: Chat-Completion, Document Ingest, und Context-Retrieval lassen sich programmatisch steuern.
Wir entwickeln Custom Ingestion Pipelines: Spezielle Dokumenttypen (CAD, Verträge, Code) werden mit optimierten Chunking-Strategien verarbeitet.
Das LlamaIndex-Backend erlaubt tiefe Anpassungen: Custom Retrievers, Reranker, und Embedding-Modelle für domänenspezifische Suche.
So setzen wir PrivateGPT-Entwicklung in der Praxis um.
Hochsensible Umgebungen (Behörden, Verteidigung) dürfen keine Cloud-Verbindung haben, brauchen aber LLM-Fähigkeiten.
Vollständig offline-fähiges Setup mit lokalen Modellen, eigenen Embeddings, und airgapped Update-Mechanismen.
Anwälte müssen tausende Dokumente nach relevanten Passagen durchsuchen. Manuelle Sichtung dauert Wochen.
PrivateGPT mit juristisch optimiertem Chunking und Retrieval. Fragen in natürlicher Sprache, Antworten mit Quellennachweis.
Führungskräfte bekommen hunderte E-Mails täglich. Zusammenfassungen und Priorisierung werden benötigt.
PrivateGPT-Integration, die E-Mails analysiert, zusammenfasst, und nach Dringlichkeit kategorisiert - vollständig on-premise.
Wir stellen nicht nur eine Anwendung bereit. WZ-IT plant die technische Architektur, bindet Netzwerk und Identitäten an, übernimmt den vereinbarten Betrieb und entwickelt Integrationen weiter, wenn der Standard nicht ausreicht.
Sizing, Zielumgebung, Datenübernahme, Cutover und Wiederanlauf werden vor dem produktiven Betrieb geklärt.
SSO, sichere Zugänge, interne Systeme und vorhandene Security-Komponenten werden passend eingebunden.
Updates, Backups, technische Überwachung und Reaktionswege folgen einem transparenten Betriebsumfang.
APIs, Automatisierungen und individuelle Erweiterungen können über die reine Bereitstellung hinaus umgesetzt werden.
Der konkrete Umfang hängt von Anwendung, Edition, Infrastruktur und Kritikalität ab. Herstellerlizenzen und Sonderkomponenten werden separat ausgewiesen.
KI-Anwendungen benötigen neben der Oberfläche kontrollierte Modellzugänge, Wissensquellen, Berechtigungen und Beobachtbarkeit. Wir planen diese Datenflüsse als zusammenhängenden Stack.
Teams, Fachanwendungen und API-Clients greifen über definierte Oberflächen und Schnittstellen zu.
TLS, Firewall-Regeln, Reverse Proxy oder private Netzwerkpfade werden passend zur Exposition der Plattform geplant.
Lokale Konten, SSO, Verzeichnisdienste, Service Accounts und Notfallzugänge werden mit klaren Rollen verbunden.
Anwendungslogik, Modellzugriffe, Rollen und freigegebene Funktionen laufen in einer kontrollierten Umgebung.
Lokale oder externe Modelle, GPU-/CPU-Ressourcen, Routing, Limits und Kostenkontrolle.
Dokumente, Datenbanken, Vektorsuche und nachvollziehbare Datenpfade für RAG und Suche.
Geprüfte Tools, APIs, Protokollierung, Metriken und technische Qualitätskontrollen.
Modelle, Erweiterungen und Datenquellen werden nicht pauschal freigeschaltet. Berechtigungen, Datenabfluss, Kosten und fachliche Kontrolle werden je Anwendungsfall bewertet.
Ein klarer Betriebsumfang statt einer unübersichtlichen Hosting-Pauschale.
Wir richten eine Testinstanz für Sie ein, in der Regel am nächsten Werktag. Ohne Zahlungsdaten. Nach sieben Tagen wird sie gelöscht, sofern Sie nicht übernehmen.
Compute, Anwendungen, Speicher und Reaktionszeit werden getrennt ausgewiesen. So sehen Sie, was im laufenden Betrieb enthalten ist und welche Anforderungen erst nach einem technischen Assessment angeboten werden.
Wir planen auch individuelle PrivateGPT-Architekturen, Integrationen und Migrationsprojekte. Kontaktieren Sie uns für ein technisches Assessment.
Eine verwaltete PrivateGPT-Standardanwendung ist im Starter-Workload enthalten. Ab Business kommt ein flexibel nutzbares Betriebsbudget für planbare Leistungen innerhalb der regulären Servicezeit hinzu. Wählen Sie Compute, weitere Anwendungen, Speicher und das passende Service Level.
Ein Workload ist eine Compute-Instanz mit den darauf vereinbarten Anwendungen.
Ein Standard-App je Workload ist bereits enthalten. Zusätzliche dedizierte Server zählen als weitere Workloads.
7,99 € netto je zusätzliche 100 GB und Monat, inklusive täglichem verschlüsseltem Offsite-Backup mit 7 Tagen Aufbewahrung. Abgerechnet wird die bereitgestellte Kapazität, nicht die tatsächliche Belegung.
Wir setzen auch individuelle Sicherungsintervalle und Aufbewahrungsfristen um. Zum Beispiel: tägliche Sicherungen für 30 Tage und eine monatliche Sicherung für 12 Monate. Umfang, Speicherbedarf und Zusatzkosten werden separat vereinbart.
+299 € netto je Workload und Monat
Das Standard-Hosting läuft auf einer einzelnen Instanz ohne Hochverfügbarkeit. Für individuelle Architekturen wird die Ausfallsicherheit separat vereinbart.
Zero Downtime auf Anfrage
Verteilter Betrieb mit mehreren Instanzen, Datenbank-Cluster und rollierenden Updates, sodass ein Node-Ausfall keine Unterbrechung verursacht. Nur für dafür geeignete Anwendungen; Auslegung und Preis nach technischer Prüfung.
Diese Seite deckt Installation und vereinbarten Plattformbetrieb für PrivateGPT ab. Eigener Code, die Zugriffsschicht und besondere Vertraulichkeitsanforderungen bleiben klar getrennte, bei Bedarf ergänzbare Verantwortungsbereiche.
Anwendung pflegen
Individuelle Erweiterungen, Schnittstellen und Dependencies kontrolliert aktualisieren und weiterbetreiben.
ab 699,90 € netto / Monat
Leistung ansehenZugriff absichern
Identitätsbasierte Zugänge und private Netzwerkpfade als eigene Betriebsschicht ergänzen.
ab 349,90 € netto / Monat
Leistung ansehenVertraulich betreiben
Für Berufsgeheimnisträger Vertrags-, Zugriffs- und Infrastrukturvorgaben im eigenen Betriebsmodell abgrenzen.
ab 499,90 € netto / Monat
Leistung ansehenDrei fachlich angrenzende Wege statt einer langen Liste weiterer Produkte.
Alle Preise verstehen sich netto zuzüglich gesetzlicher Umsatzsteuer. Die Angebote richten sich an Unternehmen.
Gesamtsystem ansehenAnfrage
Nennen Sie kurz Ausgangslage und Ziel für PrivateGPT. Wir ordnen Infrastruktur, Integration und laufenden Betrieb ein.
Der AI Cube deckt den kompakten Einstieg ab. Für größere Modelle, Rackmount oder hohe Parallelität planen wir individuelle GPU-Systeme.
Dedizierte NVIDIA GPU-Server in Deutschland inklusive abgestimmtem Modell, vLLM-Inferenzschicht, Open WebUI und laufendem Managed-Betrieb.
Kompakter lokaler KI-Server auf NVIDIA-GB10-Basis. Vollständig eingerichtet, gehärtet und mit einem vorab abgestimmten Modell vorbereitet.
Als Alternative zum Managed Hosting im Rechenzentrum stellt WZ-IT die Hardware bereit, richtet PrivateGPT ein und übernimmt Absicherung, Monitoring, Updates, Backup und technischen Support. Der Zugriff kann auf das interne Netz begrenzt oder über VPN und vorhandene Identitäten freigegeben werden.
ab 349 € netto / Monat · zzgl. einmalig Bereitstellung und Ersteinrichtung

Diese Lösungen werden oft zusammen mit PrivateGPT eingesetzt
Diese Lösungen bieten ähnliche Funktionalitäten und können gemeinsam evaluiert werden
Diese Lösungen sind direkte Alternativen mit ähnlichen Einsatzgebieten
Kein Risiko: Im schlechtesten Fall gehen Sie mit mehr Klarheit über Ihr Projekt heraus als vorher.


„Die Beratung von WZ-IT zu unserer Azure-Migration war schon im Erstgespräch fachlich sehr fundiert und völlig unverbindlich - wir haben eine Menge mitgenommen.“
“WZ-IT hat unsere Studio-Infrastruktur von dezentralen Einzelgeräten auf eine zentrale Plattform gehoben: Jeder Standort ist per VPN sicher angebunden, neue Geräte werden automatisiert onboardet und ein kompletter Standort wird per Vorlage provisioniert - ohne manuelle Schritte vor Ort. Was mich am meisten beeindruckt hat, ist die Breite und Tiefe des Wissens: Timo und Robin sind kein normaler IT-Dienstleister, der einen Server aufsetzt und wieder geht. Die beiden denken sich in hochkomplexe Infrastruktur- und Softwarethemen rein, arbeiten sich in jede Anforderung ein, die wir ihnen hinlegen, und bauen Vernetzung, Provisioning und Betrieb so auf, dass am Ende alles zusammenpasst. WZ-IT ist ein hervorragender Partner, wenn es um komplexe Software-, Netzwerk- und Architekturprojekte geht.”

Steve Kirchner
Geschäftsführer, nextGYM GmbH

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.