Europäische LLM-APIs im Vergleich: Mistral, STACKIT, IONOS, Mittwald, T-Systems

Hinweis zum Inhalt: Die Informationen in diesem Artikel wurden nach bestem Wissen zum Zeitpunkt der Veröffentlichung zusammengestellt. Technische Details, Preise, Versionen, Lizenzmodelle und externe Inhalte können sich ändern. Bitte prüfen Sie die genannten Angaben eigenständig, insbesondere vor geschäftskritischen oder sicherheitsrelevanten Entscheidungen. Dieser Artikel ersetzt keine individuelle Fach-, Rechts- oder Steuerberatung.

Sprachmodell für RAG oder Assistenten auswählen? WZ-IT bindet europäische Modell-APIs oder eigene Inferenz über ein Gateway an und dokumentiert die Datenwege, siehe LLM-Hosting im KI-Hub. Termin vereinbaren
Wer ein Sprachmodell in eine RAG-Anwendung oder einen internen Assistenten einbinden will, ohne auf OpenAI oder Anthropic direkt zuzugreifen, landet bei einer kleinen Gruppe europäischer Anbieter: Mistral AI, STACKIT, IONOS, mittwald und T-Systems. Alle fünf bieten eine OpenAI-kompatible Schnittstelle. Damit enden die Gemeinsamkeiten.
Die Anbieter unterscheiden sich im Rechenzentrumsstandort, in den Aussagen zu Speicherung und Training, im Modellkatalog und vor allem darin, ob sie Embedding- und Reranker-Modelle anbieten, die eine RAG-Anwendung neben dem Sprachmodell braucht. Dieser Beitrag vergleicht die fünf Dienste anhand ihrer eigenen Dokumentation, ordnet Azure OpenAI und Amazon Bedrock mit Blick auf den CLOUD Act ein und zeigt, ab wann eigene Inferenz die bessere Wahl ist. Alle Modelllisten und Preise haben den Stand September 2026.
Inhaltsverzeichnis
- Die fünf Anbieter im Überblick
- Standort, Speicherung und Vertrag
- Modellkataloge im September 2026
- Schnittstelle und Preismodell
- Was bei den einzelnen Anbietern zu beachten ist
- Azure OpenAI, AWS Bedrock und der CLOUD Act
- Modelle kommen und gehen
- Mischbetrieb über ein Gateway
- Ab wann eigene Inferenz sinnvoll ist
- Unser Vorgehen bei WZ-IT
- Weiterführende Guides
Die fünf Anbieter im Überblick
| Anbieter | Dienst | Sitz, Konzern | Verarbeitung |
|---|---|---|---|
| Mistral AI | La Plateforme (Mistral Studio) | Paris, eigenständig | EU als Standard, US-Endpunkt wählbar |
| STACKIT | AI Model Serving | Neckarsulm, Schwarz Gruppe | Deutschland, Region eu01 |
| IONOS | AI Model Hub | Montabaur, IONOS SE | Deutschland, Berlin |
| mittwald | AI Hosting (mStudio) | Espelkamp, mittwald | Deutschland |
| T-Systems | AI Foundation Services | Frankfurt, Deutsche Telekom | T-Cloud Deutschland für Open-Source-Modelle, proprietäre Modelle über Azure und Google Cloud |
Mistral ist der einzige der fünf, der eigene Modelle entwickelt. Die übrigen vier betreiben Open-Weight-Modelle von Drittherstellern (Qwen, gpt-oss, Llama, Gemma, Mistral) auf eigener Infrastruktur. T-Systems vermittelt zusätzlich proprietäre Modelle von OpenAI, Anthropic und Google.
Standort, Speicherung und Vertrag
Für die datenschutzrechtliche Bewertung zählen drei Fragen: Wo wird verarbeitet, was wird gespeichert, und gibt es einen Vertrag zur Auftragsverarbeitung (AVV) nach Art. 28 DSGVO.
| Anbieter | Speicherung der Inhalte | Training mit Kundendaten | AVV | Zertifikate laut Anbieter |
|---|---|---|---|---|
| Mistral | EU-Hosting als Standard | kostenloser Modus: ja, mit Opt-out; Pay-as-you-go: Opt-out-Recht | Data Processing Addendum | SOC 2 Type II, ISO 27001/27701 |
| STACKIT | keine Speicherung der Anfragen | nein | im Vertragswerk prüfen | BSI C5, ISO 27001 |
| IONOS | nicht protokolliert, nicht persistiert | nein | Teil des Vertrags, keine separate Unterschrift | BSI C5, ISO 27001 |
| mittwald | keine Inhalte, nur Metadaten (IP, API-Key, Zeitpunkt, Tokenzahl) | nein | AV-Vertrag über das mittwald-Kundenkonto | ISO 27001 |
| T-Systems (T-Cloud-Modelle) | nicht gespeichert, nicht einsehbar | nein | auf Anfrage, Telekom-Vorlage | ISO 27001 |
Belege: Mistral speichert Daten standardmäßig in der EU, bei ausdrücklicher Nutzung des US-Endpunkts in den USA (Mistral Help Center). Zum Training unterscheidet Mistral zwischen dem kostenlosen Modus, in dem Ein- und Ausgaben zum Training genutzt werden dürfen, und Pay-as-you-go, bei dem Kunden ein Opt-out-Recht haben (Mistral Help Center, Training). STACKIT speichert keine Kundendaten aus Anfragen und trainiert nicht damit (STACKIT FAQ). IONOS verarbeitet ausschließlich in deutschen Rechenzentren, protokolliert keine Inhalte und behält nur Zeitpunkt, Modell und Tokenzahl für die Abrechnung (IONOS Data Handling). mittwald speichert keine Inhalte, aber Metadaten wie IP-Adresse und API-Key (mittwald Datenschutz AI Hosting). T-Systems stellt einen AVV auf Anfrage bereit und nennt ISO 27001 für den Betrieb (T-Systems Enterprise Trust).
Bei STACKIT beschreibt die Produktdokumentation den AVV nicht; er ist im Rahmen des Cloud-Vertrags zu klären. Für alle Anbieter gilt: Zertifikate beziehen sich auf den Geltungsbereich, den der Anbieter angibt, nicht automatisch auf jeden einzelnen Dienst.
Modellkataloge im September 2026
Eine RAG-Anwendung braucht drei Modellarten: ein Embedding-Modell für den Index, optional einen Reranker für die Feinsortierung der Treffer und ein Sprachmodell für die Antwort. Die Tabelle zeigt eine Auswahl der Sprachmodelle und die vollständigen Embedding- und Reranker-Angebote.
| Anbieter | Sprachmodelle (Auswahl) | Embedding | Reranker |
|---|---|---|---|
| Mistral | Mistral Medium 3.5, Mistral Large 3, Mistral Small 4, Ministral 3 (3B, 8B, 14B), zusätzlich GLM 5.2 und 5.3 | Mistral Embed, Codestral Embed | keiner |
| STACKIT | gpt-oss-120b, gpt-oss-20b, Qwen3.8 27B, Qwen3-VL 235B, Llama 3.3 70B, Gemma 4 31B | E5 Mistral 7B, Qwen3-VL-Embedding 8B | keiner |
| IONOS | Qwen3.5 397B A17B, gpt-oss-120b, Llama 3.3 70B, Qwen3.8 27B, Mistral Small 24B, Qwen3.5 9B | BGE M3, Paraphrase Multilingual MPNet v2, Qwen3 VL Embedding 8B, BGE Large 1.5 (bis 22.10.2026) | Qwen3 VL Reranker 8B |
| mittwald | gpt-oss-120b, Qwen3.5-122B-A10B, Qwen3.6-35B-A3B, Qwen3.8-27B, Ministral-3-14B, Qwen3.5-0.8B | Qwen3-Embedding-8B | Qwen3-VL-Reranker-2B |
| T-Systems (T-Cloud) | gpt-oss-120b, Mistral Small 4, Gemma 4, Qwen 3.6 35B, GLM 5.2, NVIDIA Nemotron 3 Super 120B | BGE-M3, Jina Embeddings v2 Base DE | keiner |
Quellen: Mistral Modellübersicht, STACKIT Shared Models, IONOS LLMs, Embeddings und Reranker, mittwald Modelle, T-Systems Modelle.
Drei Beobachtungen aus der Tabelle:
- gpt-oss-120b führen vier der fünf Anbieter. Das Modell ist ein naheliegender gemeinsamer Nenner, wenn ein Anbieterwechsel ohne Modellwechsel möglich bleiben soll.
- Für deutsche Texte bieten T-Systems mit Jina Embeddings v2 Base DE und IONOS sowie T-Systems mit BGE-M3 mehrsprachige beziehungsweise deutschsprachig optimierte Embeddings. Welches Modell für deutsche Dokumente passt, behandelt der Beitrag zu Embedding-Modellen für Deutsch.
- Reranker sind die Lücke. Nur IONOS und mittwald haben einen im Katalog. Warum Reranking die Trefferqualität deutlich beeinflusst, erklärt der Artikel zu Hybrid Search und Reranking.
Schnittstelle und Preismodell
| Anbieter | OpenAI-kompatibler Endpunkt | Preismodell | Beispiel laut Preisseite |
|---|---|---|---|
| Mistral | https://api.mistral.ai/v1 |
pro Million Token, Ein- und Ausgabe getrennt | Mistral Small 4: 0,15 / 0,60 USD |
| STACKIT | https://api.openai-compat.model-serving.eu01.onstackit.cloud/v1 |
pro Million Token, Stufen nach Modellgröße | Eingabe 0,15 bis 1,50 EUR, Ausgabe 0,25 bis 1,75 EUR |
| IONOS | https://openai.inference.de-txl.ionos.com/v1 |
pro Million Token; Embedding und Reranking nur Eingabe | gpt-oss-120b: 0,15 / 0,65 EUR |
| mittwald | OpenAI-kompatibel, mStudio-Konto erforderlich | monatliche Token-Pakete | Starter 9 EUR für 5 Mio. Token, Business 149 EUR für 300 Mio. Token |
| T-Systems | https://llm-server.llmhub.t-systems.net/v2 |
pro Million Token mit monatlicher Mindestabnahme | Essential ab 1.000 EUR im Monat; T-Cloud-Modelle z. B. 0,20 / 0,65 EUR |
Preise pro Million Token (Eingabe / Ausgabe), Stand September 2026, nach Mistral, STACKIT, IONOS, mittwald und T-Systems. Die Preisangaben sind nicht direkt vergleichbar, weil Modelle, Stufen und Mindestabnahmen verschieden sind.
OpenAI-kompatibel heißt: Der Chat-Completions- und meist auch der Embeddings-Endpunkt folgen dem OpenAI-Format, ein vorhandener OpenAI-Client funktioniert nach Änderung von Basis-URL, Schlüssel und Modellname (Mistral Migration Guide). Nicht jede Funktion ist identisch umgesetzt. Tool Calling, strukturierte Ausgaben, Kontextgrenzen und Rate Limits unterscheiden sich je Modell und Anbieter und gehören in einen Test vor der Umstellung. Einen Reranking-Endpunkt kennt die OpenAI-API nicht; Anbieter mit Reranker stellen dafür eine eigene Route bereit.
Was bei den einzelnen Anbietern zu beachten ist
Mistral. Einziger Anbieter mit eigener Modellfamilie und dem größten Angebot an Spezialmodellen (OCR, Sprache, Code, Moderation). Die Trainingseinstellung ist nicht automatisch ausgeschaltet und sollte in der Organisation geprüft und dokumentiert werden. Mistral nennt Unterauftragnehmer außerhalb der EU mit Standardvertragsklauseln; die Liste liegt im Trust Center.
STACKIT. Preisstufen nach Modellgröße, ein kleiner, stabil gepflegter Katalog, Region eu01 in Deutschland. Zwei Modelle sind als veraltet markiert (Qwen3.6 27B, Gemma 3 27B). Ein Reranker fehlt. Zusätzliche Modelle können über eine Serviceanfrage angefragt werden.
IONOS. Das breiteste RAG-Angebot der fünf: mehrere Embedding-Modelle, ein Reranker und eine eigene Collections-API für semantische Suche. IONOS veröffentlicht Abschaltdaten mit Nachfolgern: Llama 3.1 8B endet am 15. Oktober 2026, Mistral Nemo und BGE Large 1.5 am 22. Oktober 2026 (IONOS Modelle).
mittwald. Paketpreise statt reiner Verbrauchsabrechnung, was die Kosten planbar macht, aber eine Auslastungsschätzung voraussetzt. Voraussetzung ist ein mStudio-Konto mit Organisation und aktivem Tarif. Der Katalog enthält neben Chat, Embedding und Reranker auch OCR (GLM-OCR), Spracherkennung (whisper-large-v3-turbo) und Sprachausgabe.
T-Systems. Die größte Modellauswahl, weil proprietäre Modelle mit vermittelt werden. Genau hier liegt die Einschränkung: Nur die Open-Source-Modelle laufen in der T-Cloud in Deutschland. GPT-Modelle laufen über Azure in Schweden, Claude und Mistral Medium 3 über Google Cloud in Europa, Gemini über Google Cloud weltweit. Für diese Kategorie gelten die Bedingungen der Vorleister, die Unterauftragnehmer weltweit einsetzen können (T-Systems Enterprise Trust). Wer den Dienst wegen des deutschen Standorts wählt, sollte die zulässigen Modelle im Gateway einschränken.
Azure OpenAI, AWS Bedrock und der CLOUD Act
US-Hyperscaler bieten EU-Verarbeitung an, bleiben aber US-Unternehmen. Der CLOUD Act verpflichtet Anbieter von Kommunikations- und Cloud-Diensten, Daten herauszugeben, die in ihrem Besitz, Gewahrsam oder unter ihrer Kontrolle sind, unabhängig davon, ob sie innerhalb oder außerhalb der USA gespeichert sind (18 U.S.C. § 2713). Die Wahl einer EU-Region ändert daran nichts.
| Angebot | EU-Option | Was sie regelt |
|---|---|---|
| Azure OpenAI (Microsoft Foundry) | Bereitstellungstyp Data Zone Standard, Zone EU | Inferenz nur innerhalb der EU Data Boundary, die auch EFTA-Staaten umfassen kann; gespeicherte Daten bleiben in der Azure-Geografie der Ressource. Global Standard kann in jeder Azure-Region verarbeiten (Microsoft Learn). |
| Amazon Bedrock | geografische Cross-Region-Inferenz EU | Inferenz innerhalb der EU-Regionen, gespeicherte Daten in der Ursprungsregion (AWS Dokumentation). Claude ist darüber in EU-Regionen nutzbar. |
| AWS European Sovereign Cloud | Region eusc-de-east-1, Brandenburg | Betrieb durch in der EU ansässiges Personal. Bedrock bietet dort seit dem 17. September 2026 Gemma 4 an (31B, 26B-A4B, E2B), Claude nicht (AWS Security Blog). |
Microsoft weist darauf hin, dass Regionen ohne vorherige Ankündigung zu einer Datenzone hinzukommen können. Wie weit der CLOUD Act auf eine rechtlich eigenständige EU-Tochter wie die der AWS European Sovereign Cloud reicht, ist juristisch umstritten. Diese Einordnung ist keine Rechtsberatung; für Daten mit hohem Schutzbedarf gehört sie in die Datenschutz-Folgenabschätzung. Welche Pflichten die KI-Verordnung für RAG-Anwendungen mit sich bringt, behandelt der Beitrag RAG und KI-Verordnung.
Für europäische Anbieter ohne US-Mutterkonzern greift der CLOUD Act nicht unmittelbar. Das gilt für die Modelle, die sie selbst betreiben, nicht für vermittelte Modelle wie bei T-Systems.
Modelle kommen und gehen
Ein Modellkatalog ist kein stabiles Produkt. IONOS hat seit Mai 2025 sieben Modelle abgeschaltet, darunter Llama 3.1 405B am 15. September 2026 und das deutsche Modell Teuken 7B am 16. April 2026. STACKIT markiert Vorgänger als veraltet, bevor sie entfallen, und Mistral führt eine eigene Abkündigungsliste.
Für eine RAG-Anwendung hat das zwei Folgen:
- Sprachmodell: Ein Nachfolger antwortet anders. Vor dem Wechsel braucht es einen Regressionstest mit festen Testfragen, wie im Artikel zu RAG-Qualität messen beschrieben.
- Embedding-Modell: Vektoren verschiedener Modelle sind nicht austauschbar. IONOS schreibt beim Wechsel von BGE Large 1.5 auf BGE M3 ausdrücklich vor, den Bestand neu einzubetten (IONOS Embedding-Modelle). Bei großen Dokumentbeständen ist das ein eigenes Projekt.
Wer Modellversionen über Jahre stabil halten muss, etwa weil Antworten Teil eines geprüften Verfahrens sind, hat mit einer API weniger Kontrolle als mit eigenem Betrieb.
Mischbetrieb über ein Gateway
Embedding, Reranker und Sprachmodell müssen nicht beim selben Anbieter laufen. Eine häufige Aufteilung:
| Komponente | Betrieb | Begründung |
|---|---|---|
| Embedding | lokal | wenig Rechenbedarf, der gesamte Dokumentbestand bleibt im Haus, kein erzwungener Neuindex durch Abkündigung |
| Reranker | lokal | bei den meisten APIs nicht verfügbar, geringer Rechenbedarf |
| Sprachmodell | lokal oder europäische API | je nach Schutzbedarf der abgerufenen Textstellen und Last |
Bei einer API-Nutzung verlassen nur die Frage und die abgerufenen Textstellen das Netz, nicht der gesamte Bestand. Das ist weniger als bei einem vollständig ausgelagerten Dienst, aber nicht nichts: Die Berechtigungsprüfung muss vor dem Abruf greifen, damit keine Passagen an das Modell gehen, die der Nutzer nicht sehen darf. Wie das umgesetzt wird, beschreibt der Artikel zu RAG-Berechtigungen.
Ein Gateway wie LiteLLM bündelt die Anbieter hinter einem Endpunkt, protokolliert Nutzung und Kosten und erlaubt Fallbacks. Über die Modellliste im Gateway lässt sich außerdem festlegen, dass nur Modelle mit deutschem oder europäischem Betrieb erreichbar sind. Den Betrieb von LiteLLM übernimmt WZ-IT als Managed LiteLLM.
Ab wann eigene Inferenz sinnvoll ist
Eine europäische Modell-API ist für viele Anwendungen ausreichend. Eigene Inferenz ist die bessere Wahl, wenn einer der folgenden Punkte zutrifft:
| Kriterium | Modell-API | Eigene Inferenz |
|---|---|---|
| Datenweg | Frage und Textstellen gehen zum Anbieter | nichts verlässt das eigene Netz oder den eigenen Server |
| Berufsgeheimnisse (§ 203 StGB), vertrauliche Behördendaten | nur mit sorgfältiger vertraglicher Prüfung | Datenweg vollständig unter eigener Kontrolle |
| Last | schwankend, gering bis mittel | dauerhaft, planbar, viele gleichzeitige Nutzer |
| Modellversion | Anbieter entscheidet über Abschaltung | Version bleibt, bis Sie wechseln |
| Embedding und Reranker | oft nicht im Angebot | laufen auf derselben Hardware mit |
| Kosten | pro Token, keine Grundlast | feste Kosten, unabhängig vom Verbrauch |
WZ-IT bietet für eigene Inferenz zwei Wege. Der AI Cube ist eine KI-Appliance im eigenen Netzwerk mit 1, 2 oder 4 TB NVMe-Speicher. Managed GPU-Server von WZ-IT laufen in einem deutschen Rechenzentrum mit NVIDIA RTX PRO 4000 Blackwell (24 GB) oder RTX PRO 6000 Blackwell (96 GB) und werden mit vLLM und Open WebUI betrieben. Welche Modellgröße auf welchen Grafikspeicher passt, zeigt der Artikel zur VRAM-Dimensionierung. Die Wahl der Inferenz-Software vergleicht der Beitrag vLLM, Ollama oder llama.cpp.
Unser Vorgehen bei WZ-IT
- Einordnung. Anwendungsfall, Datenarten, Schutzbedarf, Nutzerzahl und Lastprofil. Daraus ergibt sich, ob eine Modell-API, eigene Inferenz oder ein Mischbetrieb passt.
- Anbieterauswahl. Abgleich von Standort, AVV, Trainingsregel, Modellkatalog, Embedding- und Reranker-Angebot mit den Anforderungen, Stand der jeweiligen Anbieterdokumentation.
- Test mit eigenen Daten. Feste Testfragen aus Ihrem Bestand gegen die infrage kommenden Modelle, Bewertung von Antwortqualität, Quellenangaben und Antwortzeiten.
- Anbindung über ein Gateway. LiteLLM mit freigegebenen Modellen, Protokollierung und Kostenkontrolle, lokale Embeddings und Reranker nach Bedarf.
- Betrieb. Überwachung von Abkündigungen, Regressionstest vor Modellwechseln, Support, Beratung und Implementierung durch WZ-IT.
Für einen strukturierten Einstieg mit eigenem Dokumentbestand steht der RAG-Sprint zur Verfügung.
Weiterführende Guides
- Embedding-Modelle für Deutsch, BGE-M3, Qwen3-Embedding und weitere Modelle für deutsche Dokumente im Vergleich.
- RAG und KI-Verordnung, wann ein RAG-System Hochrisiko-KI ist und welche Pflichten gelten.
- RAG-Wissensdatenbank in Behörden, Datenbestand, Rechte und Betrieb auf eigener Hardware.
- Hybrid Search und Reranking, warum ein Reranker die Trefferqualität verbessert.
- On-Premise-KI-Lösungen im Vergleich, sechs Betriebswege von Cloud-Workspace bis GPU-Server.
- KI-Lösungen von WZ-IT, der Hub mit allen Angeboten zu lokaler KI und LLM-Betrieb.
Europäische API oder eigene Inferenz? Wir vergleichen die Anbieter für Ihren Anwendungsfall, testen mit Ihren Daten und binden das passende Modell über ein Gateway an. Termin vereinbaren
Quellen
- Mistral, Modellübersicht
- Mistral, API-Preise
- Mistral Help Center, Speicherort der Daten
- Mistral Help Center, Nutzung von Daten zum Training
- Mistral Help Center, SOC 2 und ISO 27001
- Mistral, Data Processing Addendum
- Mistral, Migration Guides
- STACKIT, Available Shared Models
- STACKIT, AI Model Serving FAQ
- STACKIT, AI Model Serving Produktseite
- IONOS, AI Model Hub Modelle
- IONOS, Large Language Models
- IONOS, Embedding-Modelle
- IONOS, Reranking-Modelle
- IONOS, Data Handling
- IONOS, AI Model Hub Produktseite
- mittwald, AI Hosting
- mittwald, Modelle im AI Hosting
- mittwald, Datenschutz im AI Hosting
- T-Systems AI Foundation Services, Modelle
- T-Systems AI Foundation Services, Plans and Pricing
- T-Systems AI Foundation Services, Enterprise Trust
- Microsoft Learn, Deployment types in Microsoft Foundry Models
- AWS, Geographic cross-Region inference in Amazon Bedrock
- AWS Security Blog, Open-Weight-Modelle auf Bedrock in der AWS European Sovereign Cloud
- 18 U.S.C. § 2713, Cornell Law School
Sprachmodelle europäisch oder im eigenen Haus betreiben
Wir ordnen Ihren Anwendungsfall nach Schutzbedarf und Last ein, binden eine europäische Modell-API oder eigene Inferenz über ein Gateway an und dokumentieren die Datenwege.
Häufig gestellte Fragen
Antworten auf wichtige Fragen zu diesem Thema
Im deutschsprachigen Raum sind vor allem fünf Dienste relevant: Mistral AI (La Plateforme, Paris), STACKIT AI Model Serving (Schwarz Gruppe), IONOS AI Model Hub, mittwald AI Hosting und T-Systems AI Foundation Services. Alle bieten eine OpenAI-kompatible Schnittstelle. Die Modellkataloge unterscheiden sich deutlich und ändern sich laufend, Stand dieses Vergleichs ist September 2026.
Stand September 2026 führen IONOS (Qwen3 VL Reranker 8B) und mittwald (Qwen3-VL-Reranker-2B) einen Reranker im Katalog. STACKIT, T-Systems und Mistral bieten laut Modellübersicht keinen Reranker an. Wer Reranking braucht und einen dieser Anbieter nutzt, betreibt den Reranker meist lokal.
Nein, nicht allein durch die Region. Der CLOUD Act (18 U.S.C. § 2713) verpflichtet US-Anbieter, Daten in ihrem Besitz, Gewahrsam oder ihrer Kontrolle herauszugeben, unabhängig vom Speicherort. Der Bereitstellungstyp Data Zone Standard begrenzt die Verarbeitung auf die EU Data Boundary, ändert aber nichts daran, dass Microsoft ein US-Unternehmen ist. Das ist eine rechtliche Einordnung, keine Rechtsberatung.
Nein. Qwen, gpt-oss oder Llama sind Open-Weight-Modelle. Der europäische Anbieter betreibt die Modellgewichte auf eigener Hardware, Anfragen gehen nicht an Alibaba, OpenAI oder Meta. Entscheidend für den Datenweg ist, wer die Inferenz betreibt und wo, nicht wer das Modell entwickelt hat.
IONOS, STACKIT, mittwald und T-Systems (für die in der T-Cloud betriebenen Modelle) schließen Training mit Kundendaten in ihrer Dokumentation aus. Bei Mistral hängt es von der Einstellung ab: Im kostenlosen Modus kann Mistral Ein- und Ausgaben zum Training nutzen, bei Pay-as-you-go haben Kunden ein Opt-out-Recht. Die Einstellung sollte in der Console aktiv geprüft werden.
Nein. Open-Source-Modelle wie gpt-oss-120b, Mistral Small 4, Gemma 4 oder BGE-M3 betreibt T-Systems in der T-Cloud in Deutschland. Proprietäre Modelle wie GPT-5, Claude und Gemini leitet der Dienst an Microsoft Azure oder Google Cloud weiter. Gemini-Modelle werden dort weltweit verarbeitet, und die Vorleister können Unterauftragnehmer weltweit einsetzen.
Stand September 2026 nicht. Amazon Bedrock in der AWS European Sovereign Cloud (Region eusc-de-east-1 in Brandenburg) bietet seit dem 17. September 2026 Gemma 4 als erste Open-Weight-Modellfamilie an. Claude ist über Bedrock in den regulären EU-Regionen nutzbar, nicht in der Sovereign Cloud.
Für das Sprachmodell meist ja, da alle fünf Anbieter eine OpenAI-kompatible Schnittstelle bieten; ein Gateway wie LiteLLM erleichtert den Wechsel zusätzlich. Beim Embedding-Modell ist ein Wechsel aufwendiger: Vektoren verschiedener Modelle sind nicht austauschbar, der gesamte Index muss neu berechnet werden.
Eigene Inferenz ist sinnvoll, wenn Daten das eigene Netz nicht verlassen sollen, etwa bei Berufsgeheimnissen nach § 203 StGB, wenn dauerhaft hohe Last anfällt, wenn Modellversionen stabil bleiben müssen oder wenn Embedding und Reranker ohnehin lokal laufen. Eine Modell-API passt besser bei schwankender, geringer Last und wenn sich Modelle häufig ändern sollen.

Geschrieben von
Timo Wevelsiep
Co-Founder & CEO
Co-Founder von WZ-IT. Spezialisiert auf Cloud-Infrastruktur, Open-Source-Plattformen und Managed Services für KMUs und Enterprise-Kunden weltweit.
LinkedInLassen Sie uns über Ihre Idee sprechen
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.





