07.09.2026
Dokumente automatisch auslesen und prüfen mit KI: selbst gehostet
Seit dem 1. Januar 2025 muss jedes inländische Unternehmen E-Rechnungen empfangen können. Ein Teil der Belege kommt damit als strukturiertes XML an und wird geparst...
Sie entwickeln Ihre KI-Anwendung, wir kümmern uns um die gesamte Infrastruktur - von der Hardware bis zum 24/7-Monitoring
Unternehmen weltweit vertrauen WZ-IT
Diese Seite ist die Betriebsebene unseres KI-Angebots: Sie trägt die Lösungen, die Sie kaufen - vom Angebotsfinder bis zum internen Assistenten. Der Stack bleibt dabei in Ihrem Besitz.
Der Managed KI-Server ermöglicht es Ihnen, sich vollständig auf die Entwicklung und den Einsatz Ihrer KI-Anwendungen zu konzentrieren. Wir übernehmen die komplette Verwaltung Ihrer KI-Server-Infrastruktur - von der initialen Einrichtung über das kontinuierliche Monitoring bis hin zum technischen Support.
Mit unserem Managed Service erhalten Sie leistungsstarke NVIDIA RTX GPU Server in deutschen Rechenzentren, betreut von erfahrenen DevOps-Ingenieuren. Kein Vendor Lock-in, transparente Preise und volle Kontrolle über Ihre Daten und Modelle.
Ideal für Unternehmen und Entwickler, die AI-Workloads produktiv betreiben möchten, ohne eigene Hardware- und Infrastruktur-Teams aufbauen zu müssen. Von Training großer Modelle bis zur Bereitstellung hochperformanter Inferenz-Dienste.
Wir unterstützen beide führenden Open-Source-Frameworks für AI-Inferenz. Jedes hat seine Stärken - wir helfen Ihnen, das richtige für Ihren Use Case zu wählen.
Das benutzerfreundliche Framework für einfaches Deployment und Management von Large Language Models
Prototypen, Chatbots, interne Tools, RAG-Anwendungen mit moderaten Anforderungen
Das Hochleistungs-Framework für Production-Grade AI-Inferenz mit maximaler Throughput-Optimierung
Production-APIs mit hohem Traffic, Batch-Processing, Multi-User-Anwendungen, Performance-kritische Dienste
| Ollama | vLLM | |
|---|---|---|
| Einfachheit | Sehr einfach | Komplex |
| Throughput | Gut | Sehr hoch bei paralleler Last |
| Latenz bei Last | Erhöht sich linear | Bleibt niedrig |
| Am besten für | Entwicklung, Prototypen, moderate Workloads | Production, hoher Traffic, Performance-kritisch |
Starten Sie mit Ollama für schnelle Entwicklung und Prototyping. Wenn Sie hohe Anforderungen an Throughput und Skalierung haben oder Production-Grade-Performance benötigen, migrieren Sie zu vLLM. Wir unterstützen beide Frameworks vollständig und helfen bei der Migration.
Wir übernehmen alle operativen Aufgaben rund um Ihre AI-Server-Infrastruktur
Auf Wunsch: Vollständige Einrichtung Ihrer AI-Server inkl. Betriebssystem, GPU-Treibern, CUDA, Docker, Kubernetes oder Ihrer bevorzugten Orchestrierung. Installation und Konfiguration von AI-Frameworks wie PyTorch, TensorFlow, Ollama oder vLLM nach Ihren Anforderungen.
24/7 Überwachung aller kritischen Systemmetriken: GPU-Auslastung, Temperatur, Arbeitsspeicher, Netzwerk und Anwendungsperformance. Automatische Warnmeldungen bei Anomalien, damit wir eingreifen können, bevor der Betrieb betroffen ist. Grafana-Dashboards mit Einblick in Ihre Infrastruktur sind optional zubuchbar.
Regelmäßige Sicherheitsupdates für Betriebssystem, GPU-Treiber und alle installierten Komponenten. Automatisierte Patch-Management-Prozesse mit Rollback-Möglichkeiten. Firewall-Konfiguration, SSH-Härtung und proaktive Schwachstellen-Scans.
Automatisierte Backups Ihrer Konfigurationen, Modelle und Daten möglich (optional). Sichere Aufbewahrung in geografisch getrennten Rechenzentren. Getestete Wiederherstellungsprozesse mit definierten Recovery Time Objectives (RTO) und Recovery Point Objectives (RPO).
Direkter Zugang zu erfahrenen DevOps- und AI-Infrastruktur-Experten via E-Mail, Telefon oder Ticket-System. Reaktionszeiten gemäß vereinbartem Service Level. Unterstützung bei Performance-Optimierung, Skalierung und Troubleshooting von AI-Workloads.
Reaktions- und Wiederherstellungszeiten vereinbaren wir individuell und halten sie schriftlich fest - abgestuft nach Kritikalität Ihrer Umgebung. Dazu gehören definierte Prioritätsstufen, nachvollziehbare Incident-Dokumentation und ein regelmäßiger Report über Störungen und Wartungsarbeiten.
Hochleistungs-Hardware in deutschen Rechenzentren
Wir setzen auf professionelle NVIDIA RTX GPUs. Der AI Server Basic mit RTX 4000 SFF Ada (20 GB VRAM) eignet sich für Inferenz und mittelgroße Modelle. Der AI Server Pro mit RTX 6000 Blackwell Max-Q (96 GB GDDR7) trägt große Modelle wie Llama-3-70B oder DeepSeek-R1-32B im quantisierten Betrieb sowie LoRA/QLoRA-Fine-Tuning.
Alle Server stehen in deutschen Rechenzentren. Der jeweilige Rechenzentrumsbetreiber ist nach ISO 27001 und BSI C5 Type 2 zertifiziert - diese Zertifizierungen gelten für den Betreiber des Rechenzentrums, nicht für WZ-IT. Ihre Daten bleiben im deutschen Rechtsraum. Redundante Stromversorgung, Klimatisierung und physische Zutrittskontrolle gehören zum Standard dieser Rechenzentren.
Direkte Anbindung an europäische Internet-Backbones mit geringen Latenzen. 1 Gbit/s inklusive, 10 Gbit/s optional verfügbar. DDoS-Schutz und redundante Netzwerkpfade für maximale Ausfallsicherheit.
NVMe-SSD-Speicher für maximale I/O-Performance bei Modell-Loading und Daten-Preprocessing. Optionale Anbindung an Object Storage (S3-kompatibel) für große Datasets und Modell-Repositories. Automatisierte Backup-Systeme mit verschlüsselter Speicherung.
Klare Preise ohne versteckte Kosten - monatlich kündbar
Vollständig verwalteter AI Server mit NVIDIA RTX 4000 SFF Ada für Inferenz und mittelgroße Modelle
Vollständig verwalteter AI Server mit NVIDIA RTX 6000 Blackwell Max-Q für große Modelle und Fine-Tuning
Unser Managed KI-Server ist verfügbar für den AI Server Basic mit vollständigem Management-Service. Diese Investition umfasst Hardware, Betrieb, Monitoring, Updates und Support - alles aus einer Hand, ohne zusätzliche Personalkosten für Systemadministration.
Der Managed Service umfasst: NVIDIA RTX GPU Server (Hardware), Rechenzentrumskosten, Strom, Netzwerk-Traffic (bis 20TB/Monat), 24/7 Monitoring, Security-Updates und System-Wartung. Setup & Installation sind optional verfügbar.
Monatliche Kündigungsfrist und Export von Daten und Konfigurationen in vereinbarten Standardformaten. Sie behalten die Kontrolle über Ihre KI-Modelle und Trainingsdaten; bei einem Wechsel unterstützen wir die abgestimmte Übergabe.
Hinweis zu Preisen: Angegebene Preise sind unverbindliche Richtpreise und können sich ändern. Der konkrete Preis hängt von Ihrer individuellen Konfiguration, Laufzeit und Leistungsumfang ab. Für ein verbindliches Angebot sprechen Sie uns bitte direkt an.
Anfrage
Nennen Sie den bestehenden oder geplanten Stack und welche Verantwortung WZ-IT übernehmen soll.
Die angebotenen Serverstandorte liegen in Deutschland. Datenflüsse durch optionale Integrationen, Updates und Fernzugriffe werden gesondert dokumentiert - das erleichtert die Datenschutzbewertung der konkreten Umgebung.
Langjährige Erfahrung mit Open-Source-KI-Stacks: Ollama, vLLM, PyTorch, TensorFlow, CUDA-Optimierung. Wir kennen die Fallstricke bei GPU-Treibern, Modell-Quantisierung und Performance-Tuning und bringen diese Praxiserfahrung in Ihr Projekt ein.
Kein anonymer Ticket-Support: Sie haben direkte Ansprechpartner, die Ihre Infrastruktur und Ihre Anforderungen kennen. Schnelle Entscheidungswege, pragmatische Lösungen und echte Partnerschaft statt Call-Center-Mentalität. Bei Bedarf auch Vor-Ort-Termine möglich.
Root-Zugriff nach vereinbartem Betriebsmodell, monatliche Kündigung und Export in vereinbarten Standardformaten. Wir setzen auf etablierte Technologien und dokumentieren Abhängigkeiten, damit ein späterer Wechsel planbar bleibt.
Starten Sie mit einem Server und wachsen Sie nach Bedarf. Einfache Erweiterung um zusätzliche GPU-Nodes, Storage oder Netzwerk-Kapazität. Wir beraten Sie zu optimalen Sizing-Strategien und unterstützen bei der Implementierung von Auto-Scaling-Konzepten.
Bei Dauerbetrieb ist ein fester Monatspreis in der Regel besser planbar als abgerechnete Cloud-GPU-Stunden. Keine unerwarteten Kosten durch Speicher- oder Traffic-Gebühren. Was sich in Ihrem Fall rechnet, sehen wir uns im Erstgespräch gemeinsam an.
| Managed Service | Unmanaged Server | |
|---|---|---|
| Setup & Konfiguration | Vollständig durch uns | Eigenständig |
| Monitoring | 24/7 Proaktiv | Selbst implementieren |
| Updates | Automatisiert mit Tests | Manuell erforderlich |
| Support | Schneller Experten-Support | Keine Unterstützung |
| Zeitaufwand | Fokus auf Entwicklung | Zeit für Admin-Aufgaben |
Antworten auf die wichtigsten Fragen
Wir unterstützen alle gängigen Frameworks: PyTorch, TensorFlow, Ollama, vLLM, LangChain, Hugging Face Transformers und viele mehr. Wir installieren und konfigurieren die von Ihnen benötigten Tools nach Ihren Spezifikationen.
Ja, Sie erhalten vollständigen Root-Zugriff via SSH. Sie können jederzeit eigene Software installieren oder Konfigurationen anpassen. Wir kümmern uns um die Basissystemwartung, Sie behalten volle Kontrolle über Ihre Anwendungen.
Nach Vertragsabschluss provisionieren, konfigurieren und übergeben wir Ihren Managed KI-Server. Den Zeitplan stimmen wir im Erstgespräch ab - er hängt von Konfiguration und Hardware-Verfügbarkeit ab.
Wir übernehmen die komplette Hardware-Verwaltung. Bei Defekten organisieren wir den Austausch über das Rechenzentrum. Ist die optionale Backup-Leistung gebucht, stellen wir Ihre Daten daraus wieder her - Reaktions- und Wiederherstellungszeiten richten sich nach dem vereinbarten Service Level.
Lassen Sie uns Ihre Anforderungen besprechen und ein individuelles Angebot erstellen
Modelle in Deutschland betreiben - Auswahl, Bereitstellung und Betrieb des Inferenz-Stacks.
Dedizierte GPU-Server für Inferenz und Fine-Tuning.
Eigene Hardware im Haus, wenn die Daten den Standort nicht verlassen sollen.
Traces, Qualität, Retrieval, Kosten und Änderungen produktiver KI-Anwendungen laufend kontrollieren.
07.09.2026
Seit dem 1. Januar 2025 muss jedes inländische Unternehmen E-Rechnungen empfangen können. Ein Teil der Belege kommt damit als strukturiertes XML an und wird geparst...
24.05.2026
Wer KI in produktive Geschäftsprozesse bringt, steht schnell vor einer unbequemen Frage: Was passiert da eigentlich genau? Welcher Prompt ging an welches Modell, warum kam...
10.05.2026
Drei unauthentifizierte API-Calls. Kein Login, kein Exploit-Framework, keine Privilege Escalation. Drei POST-Requests an einen Standard-Port, und der Speicher der Maschine ist auf Reisen — mit...
05.05.2026
Die Hochrisiko-Pflichten des EU AI Act greifen nicht zum 2. August 2026. Eigenständige Hochrisiko-Systeme nach Anhang III haben jetzt bis zum 2. Dezember 2027 Zeit,...
24.11.2025
OpenAI hat GPT-OSS 120B am 5. August 2025 als Open-Weight-Reasoning-Modell veröffentlicht. Durch die ab Werk verwendete MXFP4-Quantisierung positioniert OpenAI das Modell für eine einzelne GPU...
Kein Risiko: Im schlechtesten Fall gehen Sie mit mehr Klarheit über Ihr Projekt heraus als vorher.


„Die Beratung von WZ-IT zu unserer Azure-Migration war schon im Erstgespräch fachlich sehr fundiert und völlig unverbindlich - wir haben eine Menge mitgenommen.“
Von der lokalen KI-Integration bis zu Architektur, Datenhoheit und laufendem Betrieb.
“WZ-IT hat unsere Studio-Infrastruktur von dezentralen Einzelgeräten auf eine zentrale Plattform gehoben: Jeder Standort ist per VPN sicher angebunden, neue Geräte werden automatisiert onboardet und ein kompletter Standort wird per Vorlage provisioniert - ohne manuelle Schritte vor Ort. Was mich am meisten beeindruckt hat, ist die Breite und Tiefe des Wissens: Timo und Robin sind kein normaler IT-Dienstleister, der einen Server aufsetzt und wieder geht. Die beiden denken sich in hochkomplexe Infrastruktur- und Softwarethemen rein, arbeiten sich in jede Anforderung ein, die wir ihnen hinlegen, und bauen Vernetzung, Provisioning und Betrieb so auf, dass am Ende alles zusammenpasst. WZ-IT ist ein hervorragender Partner, wenn es um komplexe Software-, Netzwerk- und Architekturprojekte geht.”

Steve Kirchner
Geschäftsführer, nextGYM GmbH

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

