Anwendung
Installation, Konfiguration, Rollen, Updates und kontrollierte Upgrade-Pfade für Open WebUI.
WZ-IT installiert, integriert und betreibt Open WebUI als KI-Plattform - auf unserer oder Ihrer Infrastruktur. Wir verbinden Modelle, GPU-Ressourcen, Wissensquellen, Identity und sichere Netzwerkzugänge und entwickeln die Lösung bei Bedarf weiter.
Die genannten Namen sind Marken ihrer jeweiligen Inhaber: Open WebUI (the Open WebUI project). WZ-IT ist ein unabhängiger Dienstleister und steht in keiner geschäftlichen, partnerschaftlichen oder vertraglichen Beziehung zu diesen Unternehmen. Wir bieten unabhängige Migrations-, Installations-, Hosting- und Betriebsdienstleistungen an.
Open WebUI ist eine erweiterbare, selbst gehostete KI-Benutzeroberfläche für Ollama und OpenAI-kompatible APIs. Sie bündelt unterschiedliche Modelle, Chats, Wissensquellen und Werkzeuge in einer gemeinsamen Oberfläche und kann lokal, in der Cloud oder in einer hybriden Architektur betrieben werden.
Als unabhängiger Dienstleister planen wir nicht nur die Anwendung, sondern den vollständigen technischen Kontext: Inferenz, Speicher, Identitäten, Netzwerkzugänge, Backups, Monitoring und Integrationen in bestehende Systeme.
Wir installieren, integrieren und betreiben Open WebUI wahlweise auf unserer Infrastruktur in Deutschland, in Ihrer Cloud oder On-Premise. Lokale Modelle, externe Modell-APIs und hybride Varianten werden passend zu Datenklassen, Leistung und Budget kombiniert.
Monitoring, Backups, Wartung und menschliche Reaktionszeiten richten sich nach dem vereinbarten Betriebsumfang und Service Level. Das aktuelle Lizenzmodell schützt das Open-WebUI-Branding; White-Labeling oder verändertes Branding kann eine gesonderte Enterprise-Lizenz des Herstellers erfordern.
Open WebUI ist der sichtbare Einstieg. Für einen belastbaren Unternehmensbetrieb müssen Anwendung, Inferenz, Daten, Identitäten, Netzwerk und Betrieb gemeinsam geplant werden.
Installation, Konfiguration, Rollen, Updates und kontrollierte Upgrade-Pfade für Open WebUI.
Ollama, vLLM, LiteLLM oder externe APIs passend zu Datenschutz, Latenz, Last und Kosten.
RAG, Wissensquellen, Tools, APIs, SSO und bestehende Unternehmenssysteme kontrolliert anbinden.
Monitoring, Backups, Security Updates, Incident-Prozesse und Service Levels für den produktiven Stack.
Der genaue Umfang wird im Angebot festgelegt. Die folgende Matrix zeigt das typische Modell für Hosting und Betrieb durch WZ-IT.
| Bereich | Verantwortung | Typischer Umfang |
|---|---|---|
| Architektur & Deployment | WZ-IT | Zielbild, Dimensionierung, Segmentierung, Deployment und dokumentierte Übergabe in die Betriebsphase. |
| Open-WebUI-Plattform | WZ-IT | Installation, technische Konfiguration, abgesicherte Updates und Wiederherstellbarkeit der Anwendung. |
| Monitoring, Backup & Incidents | WZ-IT | Proaktive Überwachung, vereinbarte Backups und Reaktion innerhalb des gewählten Service Levels. |
| Modelle & Provider | Gemeinsam | Wir integrieren und betreiben die technische Anbindung; Modellwahl, Nutzungsrechte und fachliche Eignung stimmen wir mit Ihnen ab. |
| Identitäten & Netzwerk | Gemeinsam | Wir bauen SSO, Rollen, MFA und Secure Access auf; vorhandene Identity- und Netzwerkvorgaben kommen von beiden Seiten zusammen. |
| Inhalte & KI-Governance | Kunde | Sie bestimmen zulässige Daten, Nutzergruppen, fachliche Freigaben und den verantwortlichen Einsatz der KI-Ausgaben. |
| Individuelle Erweiterungen | Optional WZ-IT | Pipelines, Tools, Oberflächen und Schnittstellen entwickeln wir als klar abgegrenzte Zusatzleistung. |
Intuitive Benutzeroberfläche inspiriert von ChatGPT mit vollständiger Markdown- und LaTeX-Unterstützung für mathematische Formeln.
Nahtlose Integration mit Ollama für lokale LLM-Ausführung - unterstützt Llama, Mistral, Gemma und viele weitere Modelle.
Lokale und Remote RAG-Integration - chatten Sie mit PDFs, Word, Excel, PowerPoint, Webseiten und YouTube-Videos.
Erstellen Sie eigene Modelle aus Ollama-Basismodellen, fügen Sie Custom Characters und Agents hinzu - direkt in der Oberfläche.
Open WebUI kann vollständig in Ihrer Infrastruktur betrieben werden. Externe Modell- oder Suchdienste werden nur angebunden, wenn sie zur vereinbarten Architektur gehören.
Granulare Berechtigungen, Benutzergruppen und rollenbasierte Zugriffskontrolle für sichere Team-Umgebungen.
Modulares Erweiterungskonzept für anpassbare RAG-Pipelines, Function Calling und weitere Integrationen, abhängig von Version und Konfiguration.
Nutzen Sie mehrere Modelle gleichzeitig - OpenAI, Anthropic, Ollama und andere OpenAI-kompatible APIs parallel.
Integrieren Sie Web-Suchergebnisse direkt in RAG-Konversationen mit verschiedenen Such-Providern.
Nahtlose Integration von Bild-Generierung für dynamische visuelle Inhalte in Ihren Chats.
Optimiert für Desktop, Laptop und Mobile - als Progressive Web App mit Offline-Zugriff installierbar.
Vollständige Internationalisierung mit Unterstützung für zahlreiche Sprachen - nutzen Sie Open WebUI in Ihrer bevorzugten Sprache.
Der Ressourcenbedarf hängt nicht allein von Open WebUI ab. Entscheidend sind Modellbetrieb, parallele Nutzer, RAG-Daten, Integrationen und gewünschte Ausfallsicherheit.
| Einsatzprofil | Startpunkt | Was die Größe bestimmt |
|---|---|---|
| Externe Modell-API, kleines Team | CPU S oder M | Open WebUI, Authentifizierung und Proxy laufen ohne lokale Inferenz. Nutzerzahl, Plugins und Dateiverarbeitung bestimmen den tatsächlichen Bedarf. |
| Teamplattform mit RAG | CPU M oder L + Speicher | Dokumentvolumen, Embeddings, Vektordatenbank, parallele Verarbeitung und Aufbewahrung werden gemeinsam dimensioniert. |
| Lokale Modelle oder hohe Inferenzlast | GPU-Assessment | Modellgröße, Quantisierung, Kontextfenster, Parallelität und gewünschte Antwortzeit bestimmen GPU-Typ, VRAM und Anzahl der GPUs. |
| Hochverfügbarkeit oder mehrere Standorte | Architektur-Assessment | Load Balancing, Datenbank, Object Storage, Inferenz-Pools, Recovery-Ziele und Netzwerkpfade werden als Gesamtsystem geplant. |
Der Preisrechner kalkuliert den standardisierten CPU-Workload für Anwendung und Betrieb. GPU-Ressourcen, Modell-APIs, größere RAG-Speicher, Hochverfügbarkeit und komplexe Migrationen kommen nach einem technischen Assessment hinzu.
Der Betriebsort folgt Ihren Anforderungen an Kontrolle, vorhandene Infrastruktur, Datenflüsse und Skalierung.
Standardisierter Workload auf europäischer Infrastruktur mit Betrieb, Monitoring und Backup aus einer Hand.
Deployment in Ihrem bestehenden Cloud-Account; Eigentum und Providervertrag bleiben bei Ihnen, der Betrieb kann bei uns liegen.
Betrieb in Ihrem Rechenzentrum oder auf Ihrer Virtualisierung, einschließlich abgeschotteter oder eingeschränkt verbundener Umgebungen.
Oberfläche, Modelle und Wissensquellen können getrennt platziert und über kontrollierte Netzwerkpfade verbunden werden.
Ein klarer Betriebsumfang statt einer unübersichtlichen Hosting-Pauschale.
Wir richten eine Testinstanz für Sie ein, in der Regel am nächsten Werktag. Ohne Zahlungsdaten. Nach sieben Tagen wird sie gelöscht, sofern Sie nicht übernehmen.
Wir verbinden die passende Compute-Größe mit laufendem Betrieb, Backups, Monitoring und einem Service Level, das zur Kritikalität von Open WebUI passt. Hochverfügbarkeit und Recovery-Ziele werden bei Bedarf separat geplant.
Wir planen auch individuelle Hosting-Architekturen, Integrationen und Migrationen rund um Open WebUI. Kontaktieren Sie uns für ein technisches Assessment.
Eine verwaltete Open WebUI-Standardanwendung ist im Starter-Workload enthalten. Jedes Service Level enthält zusätzlich flexibel nutzbare Expertenzeit für planbare Leistungen innerhalb der regulären Servicezeit. Wählen Sie Compute, weitere Anwendungen, Speicher und das passende Service Level.
Ein Workload ist eine Compute-Instanz mit den darauf vereinbarten Anwendungen.
Ein Standard-App je Workload ist bereits enthalten. Zusätzliche dedizierte Server zählen als weitere Workloads.
79,90 € je angefangenem TB und Monat, inklusive täglichem verschlüsseltem Offsite-Backup mit 7 Tagen Aufbewahrung.
Nennen Sie kurz Ausgangslage und Ziel für Open WebUI. Wir ordnen Infrastruktur, Integration und laufenden Betrieb ein.
Professionelle Installation auf Ihrer Infrastruktur - On-Premise, Cloud oder Hybrid
In Ihrem Rechenzentrum
AWS, Azure, Hetzner & Co.
Erweiterte Architektur nach technischer und lizenzrechtlicher Prüfung
Wir analysieren Ihre vorhandene Open WebUI-Umgebung, planen die Zielarchitektur und sichern die Umstellung mit Backup und Rückfalloption ab.
Eigene Chat-Oberfläche mit lokal kontrollierbaren Datenflüssen; ein Offline-Betrieb ist mit ausschließlich lokalen Modellen und Abhängigkeiten möglich
Nahtlose Integration mit Ollama für lokale LLM-Ausführung ohne Cloud-Abhängigkeit - Llama, Mistral, Gemma und mehr
Retrieval Augmented Generation für intelligente Dokumentenabfragen und Wissensdatenbanken mit PDFs, Word, Excel
Lokale KI-Modelle ohne Datenübertragung an externe Anbieter - perfekt für regulierte Branchen und Datenschutz
Multi-User-Umgebung mit Rollen, Berechtigungen und individuellen Chat-Historien für Unternehmens-Teams
Experimentieren mit verschiedenen LLMs, Custom Functions, Python-Tools und API-Integrationen für AI-Entwicklung
Wir binden Open WebUI sicher an Benutzer, Standorte, Clouds und bestehende Unternehmensnetze an.
NetBird, WireGuard sowie Standort- und Cloud-Anbindung
Keycloak, Authentik und bestehende Verzeichnisdienste
Zentrale Regeln für Benutzer, Gruppen und administrative Zugriffe
TLS, Firewall, Rate Limiting und nachvollziehbare Zugriffe
Wir verbinden Open WebUI über sichere Netzwerkpfade mit Benutzern, Modellen, Datenquellen und vorhandenen Systemen. Zugänge, Identitäten und Berechtigungen werden dabei gemeinsam geplant.
Full-Service Installation ohne versteckte Kosten
Die Plattform sitzt zwischen Nutzern und den freigegebenen Modellen, Wissensquellen und Tools. Zugriff und Identität werden nicht als nachträgliche Add-ons behandelt.
Mitarbeitende, Teams, externe Nutzer oder verteilte Niederlassungen.
NetBird, WireGuard, Reverse Proxy, Segmentierung und kontrollierte Freigaben.
Keycloak oder Authentik, SSO, MFA, Gruppen und rollenbasierte Berechtigungen.
Gemeinsame Oberfläche, Rollen, Modellzugriffe, Chats, Wissen und Erweiterungen.
Ollama, vLLM, LiteLLM oder freigegebene externe Modell-APIs.
RAG, Vektordatenbank, Object Storage und angebundene Dokumentquellen.
APIs, Automationen, Fachanwendungen und individuell entwickelte Funktionen.
Die Darstellung ist ein modulares Referenzbild. Welche Komponenten benötigt werden und wo sie laufen, wird aus Datenklassen, Last, vorhandener IT und Betriebsanforderungen abgeleitet.
Open WebUI bringt Chat-Interface und RAG-Pipeline mit - aber Enterprise-Anforderungen verlangen mehr. Wir erweitern das Frontend für Ihre Use Cases.
Wir nutzen die REST API für Integrationen und die Pipelines für Custom Model Routing: Je nach Input wird automatisch das passende Modell gewählt.
Input- und Output-Filter: Vor dem Senden an das Modell können wir Prompts anreichern (RAG-Kontext), nach der Antwort können wir Compliance-Checks durchführen.
Für UI-Anpassungen entwickeln wir Custom Svelte Components: Spezielle Eingabemasken, Visualisierungen, Branchen-spezifische Chat-Layouts.
So setzen wir Open WebUI-Entwicklung in der Praxis um.
Verschiedene Anfragen (Code vs. Text vs. Analyse) brauchen verschiedene Modelle, aber User sollen sich nicht darum kümmern.
Pipeline, die Input analysiert und automatisch an das optimale Modell (GPT-4, Claude, lokales Llama) routet - transparent für den User.
Interne Dokumente (SharePoint, Confluence) sollen im Chat durchsuchbar sein, ohne sie manuell hochzuladen.
Automatischer Sync von Unternehmens-Dokumenten in die Vector-DB. Bei jeder Frage wird relevanter Kontext aus dem Wissensbestand injiziert.
LLM-Antworten könnten sensible Infos enthalten (PII, interne Codes). Vor der Anzeige muss gefiltert werden.
Output-Pipeline, die Antworten scannt und sensible Daten maskiert oder blockiert, bevor sie dem User angezeigt werden.
Der AI Cube Pro verbindet Open WebUI, lokale Modellbereitstellung und ein vorab abgestimmtes Modell zu einer vollständig vorkonfigurierten KI-Plattform. Mitarbeitende können direkt chatten und persönliche oder gemeinsame Wissensbereiche aufbauen; automatisierte Datenquellen und individuelle RAG-Pipelines ergänzen wir bei Bedarf.

Nach Konfigurationsfreigabe in unter zwei Wochen einsatzbereit
5.999 € netto
RAG, Datenquellen, Schnittstellen, sichere Vernetzung und individuelle Workflows werden separat geplant.
Optionaler Betrieb ab 149,90 € netto je AI Cube und Monat; im §203-Scope mit AVV, begrenzten Administrationsrechten sowie schriftlicher Verpflichtung der beteiligten Personen zur Geheimhaltung und Belehrung über die strafrechtlichen Folgen
Ob ihr Open WebUI selbst im Haus betreiben oder Daten von Berufsgeheimnisträgern §203-tauglich unterbringen müsst - wir bauen, betreiben und warten Open WebUI auf einem verschlüsselten Vor-Ort-Server. Daten verlassen das Haus nie im Klartext.
Open WebUI on-premise ansehen
Konkrete Antworten zu Hosting, Modellen, RAG, Sicherheit, Betrieb und Lizenzierung.
Ja. Der vereinbarte Umfang kann Anwendung, Betriebssystem und Container, Monitoring, Backups, Updates und Incident-Reaktion umfassen. Die menschlichen Reaktionszeiten richten sich nach dem gewählten Service Level; Modellkosten und individuelle Entwicklung werden getrennt ausgewiesen.
Ja. Wir installieren und betreiben Open WebUI in Ihrem Rechenzentrum, auf Proxmox, Kubernetes oder in Ihrem Cloud-Account. Vor einer Übernahme prüfen wir Zugänge, Backup, Monitoring, technische Schulden und Verantwortungsgrenzen. Mehr dazu unter On-Premise.
Open WebUI unterstützt Ollama und OpenAI-kompatible APIs. Dadurch lassen sich lokale Inferenzsysteme wie Ollama oder vLLM sowie freigegebene externe Modellanbieter anbinden. Wir wählen Gateway, Modelle und Routing anhand von Datenklassen, Qualität, Latenz und Kosten.
Nein. Bei externen Modell-APIs benötigt die Oberfläche normalerweise keinen eigenen GPU-Server. Lokale große Sprachmodelle werden dagegen nach Modellgröße, VRAM, Parallelität und Ziel-Latenz dimensioniert. Dafür planen wir bei Bedarf einen Managed GPU-Server.
Wir planen Ingestion, Textextraktion, Embeddings, Vektorspeicher, Metadaten und Aktualisierung der Quellen als zusammenhängende Pipeline. Bei vertraulichen Beständen klären wir zusätzlich Berechtigungen, Quellenanzeige, Löschkonzept und die Grenzen der fachlichen Verlässlichkeit.
Ja, sofern sie nach einem technischen Audit betreibbar übernommen werden kann. Wir prüfen Version, Datenbank, Volumes, Secrets, Modellanbindungen, Backups, Netzwerk und Wiederherstellung. Notwendige Bereinigungen oder Migrationen werden vor dem laufenden Betrieb transparent abgegrenzt.
Im Standardbetrieb überwachen wir Erreichbarkeit und vereinbarte technische Zustände des Workloads. Tägliche Backups mit sieben Tagen Aufbewahrung sind im Standardangebot enthalten. Zusätzliche Datenbanken, Vektorspeicher, GPU-Systeme, längere Aufbewahrung und konkrete RTO/RPO werden passend zur Architektur vereinbart.
Für größere Umgebungen trennen wir Anwendung, Datenbank, Speicher und Inferenz und planen Load Balancing, mehrere Workloads, Inferenz-Pools sowie Recovery. Hochverfügbarkeit ist kein pauschales Häkchen im Hostingtarif, sondern wird anhand von Ausfallfolgen, RTO, RPO und Lastprofil ausgelegt.
Die aktuelle Open-WebUI-Lizenz erlaubt den Einsatz mit unverändertem Original-Branding. Für die Entfernung oder Veränderung des Brandings gelten Ausnahmen und gegebenenfalls Enterprise-Lizenzanforderungen; maßgeblich ist immer die aktuelle Lizenz des Herstellers. Wir prüfen die technische Umsetzung, leisten aber keine Rechtsberatung.
Wissen & Anleitungen
Vergleiche, Installationsanleitungen und Architekturbeiträge unabhängig vom konkreten WZ-IT-Angebot lesen.
10.05.2026
Drei unauthentifizierte API-Calls. Kein Login, kein Exploit-Framework, keine Privilege Escalation. Drei POST-Requests an einen Standard-Port, und der Speicher der Maschine ist auf Reisen — mit...
03.12.2025
Open WebUI ist eine mächtige selbst gehostete Web-Oberfläche für Large Language Models. Egal ob lokale Modelle mit Ollama oder Anbindung an OpenAI - Open WebUI...
24.11.2025
OpenAI hat GPT-OSS 120B am 5. August 2025 als Open-Weight-Reasoning-Modell veröffentlicht. Durch die ab Werk verwendete MXFP4-Quantisierung positioniert OpenAI das Modell für eine einzelne GPU...
Diese Lösungen werden oft zusammen mit Open WebUI eingesetzt
Diese Lösungen bieten ähnliche Funktionalitäten und können gemeinsam evaluiert werden
Diese Lösungen sind direkte Alternativen mit ähnlichen Einsatzgebieten
Kein Risiko: Im schlechtesten Fall gehen Sie mit mehr Klarheit über Ihr Projekt heraus als vorher.


„Die Beratung von WZ-IT zu unserer Azure-Migration war schon im Erstgespräch fachlich sehr fundiert und völlig unverbindlich - wir haben eine Menge mitgenommen.“
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.