Architektur und Migration
Sizing, Zielumgebung, Datenübernahme, Cutover und Wiederanlauf werden vor dem produktiven Betrieb geklärt.

WZ-IT plant, installiert und betreibt Ollama als Managed Hosting, in Ihrer Cloud oder on-premises. Je nach Zielbild übernehmen wir Migration, sichere Netzwerk- und Identity-Anbindung, Monitoring, Backups, Updates sowie Integrationen und Weiterentwicklung.
Unternehmen weltweit vertrauen WZ-IT

Ollama ist die Inferenz-Schicht für lokale Sprachmodelle. Statt Unternehmensdaten an externe KI-Dienste zu senden, laufen Modelle wie Llama, Mistral, Gemma oder Qwen auf Ihrer eigenen Infrastruktur.
Wir betreiben Ollama produktionsnah: mit GPU-Tuning, Modellverwaltung, API-Gateway, Monitoring, Backup-Strategie und sauberer Integration in Open WebUI, AnythingLLM, RAG-Pipelines und interne Anwendungen.
Ollama ist schnell gestartet, aber produktiver Betrieb braucht mehr als einen Docker-Container. Wir planen Hardware, Modellgrößen, VRAM-Budget, Zugriffswege, Updates und Observability passend zu Ihrem Use Case.
Die Software steht unter MIT-Lizenz. Dadurch eignet sich Ollama gut als offene Basis für souveräne KI-Infrastruktur, solange Security, Betrieb und Modell-Governance sauber gelöst werden.
Modelle laufen auf eigener Hardware, im eigenen Rechenzentrum oder auf einem Server in einem deutschen Rechenzentrum. Bei ausschließlich lokalen Modellen und Diensten bleiben Prompts und Ausgaben in der kontrollierten Infrastruktur.
Wir dimensionieren VRAM, CPU, RAM und Storage passend zu Modellgröße, Kontextfenster, Nutzerzahl und Antwortzeit.
Saubere Verwaltung von Modellversionen, Pull-Prozessen, Freigaben und Rollbacks für reproduzierbare KI-Umgebungen.
On-Premise, AI Cube, GPU-Server oder Private Cloud: Ollama wird so betrieben, dass Datenschutz, Verfügbarkeit und Zugriffskontrolle zusammenpassen.
Wir binden Ollama an Open WebUI, AnythingLLM, LiteLLM, interne Anwendungen, Automatisierungen und RAG-Pipelines an.
Monitoring, Updates, Backups, Modelltests, Security-Hardening und Support machen aus einer lokalen Demo eine belastbare KI-Plattform.
Ollama übernimmt die lokale Modell-Ausführung und bildet die technische Basis für Chat, RAG, Agenten und interne KI-APIs.
Wir kümmern uns um Modellwechsel, Updates, GPU-Auslastung, Health Checks und klare Prozesse für produktive Umgebungen.
Zugriff erfolgt über VPN, SSO, interne Netze oder API-Gateways. Externe Modelle, Integrationen und Update-Dienste werden als eigene Datenflüsse dokumentiert.
Wir stellen nicht nur eine Anwendung bereit. WZ-IT plant die technische Architektur, bindet Netzwerk und Identitäten an, übernimmt den vereinbarten Betrieb und entwickelt Integrationen weiter, wenn der Standard nicht ausreicht.
Sizing, Zielumgebung, Datenübernahme, Cutover und Wiederanlauf werden vor dem produktiven Betrieb geklärt.
SSO, sichere Zugänge, interne Systeme und vorhandene Security-Komponenten werden passend eingebunden.
Updates, Backups, technische Überwachung und Reaktionswege folgen einem transparenten Betriebsumfang.
APIs, Automatisierungen und individuelle Erweiterungen können über die reine Bereitstellung hinaus umgesetzt werden.
Der konkrete Umfang hängt von Anwendung, Edition, Infrastruktur und Kritikalität ab. Herstellerlizenzen und Sonderkomponenten werden separat ausgewiesen.
KI-Anwendungen benötigen neben der Oberfläche kontrollierte Modellzugänge, Wissensquellen, Berechtigungen und Beobachtbarkeit. Wir planen diese Datenflüsse als zusammenhängenden Stack.
Teams, Fachanwendungen und API-Clients greifen über definierte Oberflächen und Schnittstellen zu.
TLS, Firewall-Regeln, Reverse Proxy oder private Netzwerkpfade werden passend zur Exposition der Plattform geplant.
Lokale Konten, SSO, Verzeichnisdienste, Service Accounts und Notfallzugänge werden mit klaren Rollen verbunden.
Anwendungslogik, Modellzugriffe, Rollen und freigegebene Funktionen laufen in einer kontrollierten Umgebung.
Lokale oder externe Modelle, GPU-/CPU-Ressourcen, Routing, Limits und Kostenkontrolle.
Dokumente, Datenbanken, Vektorsuche und nachvollziehbare Datenpfade für RAG und Suche.
Geprüfte Tools, APIs, Protokollierung, Metriken und technische Qualitätskontrollen.
Modelle, Erweiterungen und Datenquellen werden nicht pauschal freigeschaltet. Berechtigungen, Datenabfluss, Kosten und fachliche Kontrolle werden je Anwendungsfall bewertet.
Ein klarer Betriebsumfang statt einer unübersichtlichen Hosting-Pauschale.
Compute, Anwendungen, Speicher und Reaktionszeit werden getrennt ausgewiesen. So sehen Sie, was im laufenden Betrieb enthalten ist und welche Anforderungen erst nach einem technischen Assessment angeboten werden.
Wir planen auch individuelle Ollama-Architekturen, Integrationen und Migrationsprojekte. Kontaktieren Sie uns für ein technisches Assessment.
Wählen Sie einen technischen Startpunkt, zusätzlichen Speicher und das gewünschte Service Level. Wir prüfen die Auswahl anschließend gegen Anwendung, Lastprofil, Integrationen und Zielarchitektur.
Ein Workload ist eine Compute-Instanz mit den darauf vereinbarten Anwendungen.
Ein Standard-App je Workload ist bereits enthalten. Zusätzliche dedizierte Server zählen als weitere Workloads.
Zusätzlichen Speicherbedarf für Daten, Artefakte und Backups vormerken.
Wir setzen auch individuelle Sicherungsintervalle und Aufbewahrungsfristen um. Zum Beispiel: tägliche Sicherungen für 30 Tage und eine monatliche Sicherung für 12 Monate. Umfang, Speicherbedarf und Zusatzkosten werden separat vereinbart.
Wird individuell geprüft; individuelles Angebot.
Das Standard-Hosting läuft auf einer einzelnen Instanz ohne Hochverfügbarkeit. Für individuelle Architekturen wird die Ausfallsicherheit separat vereinbart.
Zero Downtime auf Anfrage
Verteilter Betrieb mit mehreren Instanzen, Datenbank-Cluster und rollierenden Updates, sodass ein Node-Ausfall keine Unterbrechung verursacht. Nur für dafür geeignete Anwendungen; Auslegung und Preis nach technischer Prüfung.
Diese Seite deckt Installation und vereinbarten Plattformbetrieb für Ollama ab. Eigener Code, die Zugriffsschicht und besondere Vertraulichkeitsanforderungen bleiben klar getrennte, bei Bedarf ergänzbare Verantwortungsbereiche.
Anwendung pflegen
Individuelle Erweiterungen, Schnittstellen und Dependencies kontrolliert aktualisieren und weiterbetreiben.
ab 699,90 € netto / Monat
Leistung ansehenZugriff absichern
Identitätsbasierte Zugänge und private Netzwerkpfade als eigene Betriebsschicht ergänzen.
ab 349,90 € netto / Monat
Leistung ansehenVertraulich betreiben
Für Berufsgeheimnisträger Vertrags-, Zugriffs- und Infrastrukturvorgaben im eigenen Betriebsmodell abgrenzen.
ab 499,90 € netto / Monat
Leistung ansehenDrei fachlich angrenzende Wege statt einer langen Liste weiterer Produkte.
Alle Preise verstehen sich netto zuzüglich gesetzlicher Umsatzsteuer. Die Angebote richten sich an Unternehmen.
Gesamtsystem ansehenAnfrage
Nennen Sie kurz Ausgangslage und Ziel für Ollama. Wir ordnen Infrastruktur, Integration und laufenden Betrieb ein.
Der AI Cube deckt den kompakten Einstieg ab. Für größere Modelle, Rackmount oder hohe Parallelität planen wir individuelle GPU-Systeme.
Dedizierte NVIDIA GPU-Server in Deutschland inklusive abgestimmtem Modell, vLLM-Inferenzschicht, Open WebUI und laufendem Managed-Betrieb.
Kompakter lokaler KI-Server auf NVIDIA-GB10-Basis. Vollständig eingerichtet, gehärtet und mit einem vorab abgestimmten Modell vorbereitet.
Antworten auf die wichtigsten Fragen
Ollama steht unter MIT-Lizenz und ist für den lokalen Betrieb kostenlos. Kosten fallen nur für die Cloud-Modelle an, die Ollama zusätzlich auf eigener Infrastruktur anbietet: nach einem Startguthaben nutzungsbasiert oder im Monatstarif (Stand Oktober 2026). Beim Self-Hosting entstehen Kosten für Server oder Hardware und für den Betrieb; den Rahmen klären wir nach Modell, Nutzerzahl und Antwortzeit.
Lokal betrieben verarbeitet Ollama Prompts und Antworten ausschließlich auf dem eigenen Server; Ollama selbst sieht diese Daten nicht. Anders bei den Cloud-Modellen: Dort gehen Prompts an die Ollama-Cloud. In produktiven Installationen schalten wir die Cloud-Funktionen ab, also Cloud-Modelle und Websuche (OLLAMA_NO_CLOUD). Wir betreiben den Server in Ihrer Infrastruktur oder in einem deutschen Rechenzentrum und schließen einen Auftragsverarbeitungsvertrag ab.
Ollama läuft auch auf CPUs, für flüssige Antworten im Team ist eine GPU mit ausreichend VRAM die Regel. Der VRAM bestimmt, welche Modellgröße und welche Kontextlänge passen. Parallele Anfragen an dasselbe Modell vergrößern den benötigten Kontextspeicher, deshalb dimensionieren wir nach Modell, Nutzerzahl und Antwortzeit.
Ollama lauscht standardmäßig nur lokal auf Port 11434 und bringt keine eigene Benutzerverwaltung mit. Für den Teambetrieb stellen wir den Dienst über OLLAMA_HOST bereit und setzen davor einen Reverse Proxy oder ein Gateway mit Authentifizierung, TLS und Zugriff über VPN oder internes Netz. Nutzer arbeiten meist über Open WebUI.
Ja. Ollama bietet neben der eigenen API OpenAI-kompatible Endpunkte für Chat Completions, Completions, Embeddings, Modelle und die Responses API. Anwendungen, die für OpenAI geschrieben sind, lassen sich so über eine geänderte Basis-URL an lokale Modelle anbinden.
Ollama passt für Einzelplätze, Tests und kleine Teams. Wenn viele Nutzer gleichzeitig arbeiten, Antwortzeiten unter Last steigen oder ein Modell über mehrere GPUs verteilt werden muss, ist vLLM die bessere Laufzeit. Da beide OpenAI-kompatible APIs bieten, lässt sich mit Ollama starten und später zu vLLM migrieren, ohne die Anwendungen neu zu bauen.
29.09.2026
Ein Service-Postfach oder eine Ticket-Queue wird meist von Hand sortiert: Jemand liest jede Anfrage, ordnet sie einem Thema zu, setzt die Priorität und gibt sie...
27.09.2026
Seit 2025 ist eine neue Gruppe offener Modelle erschienen, die Dokumentseiten als Bild lesen und als Text, Markdown oder JSON ausgeben: olmOCR, PaddleOCR-VL, GLM-OCR, DeepSeek-OCR,...
20.09.2026
XWiki bringt von Haus aus keine KI mit. Wer im Wiki einen Chat mit Quellenangaben, eine Schreibhilfe im Editor oder eine semantische Suche über die...
Diese Lösungen werden oft zusammen mit Ollama eingesetzt
Diese Lösungen bieten ähnliche Funktionalitäten und können gemeinsam evaluiert werden
Diese Lösungen sind direkte Alternativen mit ähnlichen Einsatzgebieten
“WZ-IT hat unsere Studio-Infrastruktur von dezentralen Einzelgeräten auf eine zentrale Plattform gehoben: Jeder Standort ist per VPN sicher angebunden, neue Geräte werden automatisiert onboardet und ein kompletter Standort wird per Vorlage provisioniert - ohne manuelle Schritte vor Ort. Was mich am meisten beeindruckt hat, ist die Breite und Tiefe des Wissens: Timo und Robin sind kein normaler IT-Dienstleister, der einen Server aufsetzt und wieder geht. Die beiden denken sich in hochkomplexe Infrastruktur- und Softwarethemen rein, arbeiten sich in jede Anforderung ein, die wir ihnen hinlegen, und bauen Vernetzung, Provisioning und Betrieb so auf, dass am Ende alles zusammenpasst. WZ-IT ist ein hervorragender Partner, wenn es um komplexe Software-, Netzwerk- und Architekturprojekte geht.”

Steve Kirchner
Geschäftsführer, nextGYM GmbH

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.