Embedding-Modelle für Deutsch 2026: BGE-M3, Qwen3-Embedding und E5 im Vergleich

Hinweis zum Inhalt: Die Informationen in diesem Artikel wurden nach bestem Wissen zum Zeitpunkt der Veröffentlichung zusammengestellt. Technische Details, Preise, Versionen, Lizenzmodelle und externe Inhalte können sich ändern. Bitte prüfen Sie die genannten Angaben eigenständig, insbesondere vor geschäftskritischen oder sicherheitsrelevanten Entscheidungen. Dieser Artikel ersetzt keine individuelle Fach-, Rechts- oder Steuerberatung.

Sie wollen ein RAG-System auf deutschen Dokumenten aufbauen? WZ-IT misst Embedding-Modelle mit Referenzfragen auf Ihrem Bestand und betreibt Retrieval, Reranker und Sprachmodell auf eigener Hardware, siehe RAG Proof of Value und interner KI-Assistent im KI-Hub. Termin vereinbaren
Das Embedding-Modell entscheidet in einem RAG-System, welche Textstellen überhaupt beim Sprachmodell ankommen. Findet die Suche den passenden Absatz nicht, kann auch das größte Sprachmodell die Frage nicht belegt beantworten. Trotzdem wird das Embedding-Modell oft nach dem ersten Tutorial gewählt und danach nicht mehr hinterfragt.
Für deutsche Dokumente ist die Auswahl 2026 breiter als noch vor zwei Jahren: BGE-M3, die Qwen3-Embedding-Familie, multilingual-e5, EmbeddingGemma, Granite Embedding R2 und mehrere Jina-Generationen stehen als offene Gewichte bereit, Mistral Embed als europäische API. Die Unterschiede liegen weniger in einer Benchmark-Zahl als in Lizenz, Kontextlänge, Vektordimension, Speicherbedarf und darin, welche Inferenz-Server das Modell vollständig unterstützen. Dieser Beitrag stellt die Modelle nach diesen Kriterien gegenüber. Stand September 2026.
Inhaltsverzeichnis
- Was das Embedding-Modell in einem RAG-System entscheidet
- Die Modelle im Überblick
- Lizenzen: nicht jedes offene Modell ist kommerziell nutzbar
- Was Benchmarks über deutsche Texte aussagen
- Kontextlänge, Dimensionen und Speicherbedarf
- VRAM und Hardware
- Betrieb mit TEI, vLLM und Ollama
- Welches Modell für welchen Einsatz
- Modellwechsel bedeutet Neuindexierung
- Unser Vorgehen bei WZ-IT
- Weiterführende Guides
Was das Embedding-Modell in einem RAG-System entscheidet
Ein Embedding-Modell übersetzt Text in einen Vektor, eine Liste von Zahlen. Texte mit ähnlicher Bedeutung liegen im Vektorraum nahe beieinander. Bei der Indexierung wird jeder Abschnitt (Chunk) eines Dokuments eingebettet und in einer Vektordatenbank wie Qdrant oder PostgreSQL mit pgvector gespeichert. Bei einer Frage wird die Frage mit demselben Modell eingebettet, und die Datenbank liefert die nächstgelegenen Chunks. Die Grundlagen beschreibt der Wissensartikel Was ist RAG?.
Aus diesem Ablauf ergeben sich die Anforderungen an das Modell:
| Eigenschaft | Warum sie zählt |
|---|---|
| Sprachabdeckung | Deutsche Fachsprache, Komposita und gemischte deutsch-englische Bestände müssen sinnvoll abgebildet werden |
| Maximale Eingabelänge | Text jenseits der Grenze wird abgeschnitten und ist für die Suche unsichtbar |
| Vektordimension | Bestimmt Speicherbedarf des Index und Grenzen der Vektordatenbank |
| Lizenz | Legt fest, ob das Modell im Unternehmen genutzt werden darf |
| Modellgröße | Bestimmt VRAM, Durchsatz bei der Indexierung und Latenz pro Anfrage |
| Unterstützung im Inferenz-Server | Entscheidet, ob Funktionen wie Sparse-Vektoren im Betrieb verfügbar sind |
Das Embedding-Modell ist dabei nur ein Baustein. Die Aufteilung der Dokumente (Chunking) und die Kombination mit einer Stichwortsuche und einem Reranker (Hybrid Search und Reranking) beeinflussen die Trefferqualität ebenso stark.
Die Modelle im Überblick
Die Tabelle enthält die Modelle, die für deutschsprachige RAG-Systeme 2026 regelmäßig in Frage kommen. Angaben aus den jeweiligen Model Cards auf Hugging Face, Parameterzahlen aus den Modelldateien.
| Modell | Anbieter | Parameter | Dimension | Max. Token | Lizenz | Veröffentlicht |
|---|---|---|---|---|---|---|
| BGE-M3 | BAAI | 568 Mio. | 1.024 | 8.192 | MIT | Januar 2024 |
| Qwen3-Embedding-0.6B | Alibaba Qwen | 0,6 Mrd. | 1.024 (32 bis 1.024) | 32.768 | Apache 2.0 | Juni 2025 |
| Qwen3-Embedding-4B | Alibaba Qwen | 4,0 Mrd. | 2.560 (32 bis 2.560) | 32.768 | Apache 2.0 | Juni 2025 |
| Qwen3-Embedding-8B | Alibaba Qwen | 7,6 Mrd. | 4.096 (32 bis 4.096) | 32.768 | Apache 2.0 | Juni 2025 |
| multilingual-e5-large | Microsoft (intfloat) | 560 Mio. | 1.024 | 512 | MIT | Juni 2023 |
| multilingual-e5-large-instruct | Microsoft (intfloat) | 560 Mio. | 1.024 | 512 | MIT | Februar 2024 |
| EmbeddingGemma-300m | 308 Mio. | 768 (128 bis 768) | 2.048 | Gemma Terms of Use | September 2025 | |
| Granite Embedding 311M Multilingual R2 | IBM | 311 Mio. | 768 (128 bis 768) | 32.768 | Apache 2.0 | April 2026 |
| jina-embeddings-v2-base-de | Jina AI | 161 Mio. | 768 | 8.192 | Apache 2.0 | Januar 2024 |
| jina-embeddings-v3 | Jina AI | 572 Mio. | 1.024 (32 bis 1.024) | 8.192 | CC BY-NC 4.0 | September 2024 |
| jina-embeddings-v5-text-small | Jina AI | 677 Mio. | 1.024 (32 bis 1.024) | 32.768 | CC BY-NC 4.0 | Februar 2026 |
| Mistral Embed | Mistral AI | nicht veröffentlicht | 1.024 | 8k | nur API | Dezember 2023 |
Werte in Klammern: Die Modelle unterstützen Matryoshka Representation Learning (MRL). Die Vektoren lassen sich auf eine kleinere Dimension kürzen, mit geringem Qualitätsverlust und deutlich kleinerem Index.
Einige Besonderheiten, die im Betrieb eine Rolle spielen:
- BGE-M3 erzeugt aus einem Modell drei Darstellungen: einen dichten Vektor, Sparse-Gewichte je Token (ähnlich BM25) und Multi-Vektoren im ColBERT-Stil (Model Card). Damit ist eine hybride Suche ohne zweites Modell möglich.
- Qwen3-Embedding erwartet auf der Anfrageseite eine Instruktion (
Instruct: ... Query: ...), die Dokumente werden ohne Instruktion eingebettet. Ohne Instruktion sinkt die Retrieval-Leistung laut Qwen um etwa 1 bis 5 Prozent. Die Instruktion sollte auch bei deutschen Texten auf Englisch formuliert sein, weil die Trainingsinstruktionen überwiegend englisch waren (Model Card). - multilingual-e5 verlangt die Präfixe
query:undpassage:, die Instruct-Variante eine Instruktion auf der Anfrageseite. Eingaben werden auf 512 Token gekürzt (Model Card). - jina-embeddings-v2-base-de ist zweisprachig für Deutsch und Englisch trainiert, ausdrücklich auch für gemischte Eingaben (Model Card).
- Jina AI gehört seit Oktober 2025 zu Elastic (Elastic, Ankündigung). Die Modelle bleiben auf Hugging Face verfügbar und werden zusätzlich über den Elastic Inference Service angeboten.
Lizenzen: nicht jedes offene Modell ist kommerziell nutzbar
Offene Gewichte bedeuten nicht automatisch freie Nutzung im Unternehmen. Das betrifft vor allem die Jina-Modelle, die in vielen Vergleichen weit oben stehen.
| Modell | Lizenz | Kommerzieller Einsatz |
|---|---|---|
| BGE-M3 | MIT | erlaubt |
| Qwen3-Embedding 0.6B, 4B, 8B | Apache 2.0 | erlaubt |
| multilingual-e5-large, -instruct | MIT | erlaubt |
| Granite Embedding R2 | Apache 2.0 | erlaubt |
| jina-embeddings-v2-base-de | Apache 2.0 | erlaubt |
| EmbeddingGemma-300m | Gemma Terms of Use | erlaubt, mit Nutzungsbedingungen und Richtlinie zur verbotenen Nutzung; Download auf Hugging Face erst nach Zustimmung |
| jina-embeddings-v3 | CC BY-NC 4.0 | nur mit kommerzieller Lizenz von Jina AI |
| jina-embeddings-v4 | Qwen Research License | nur mit gesonderter Lizenz |
| jina-embeddings-v5-text-small und -nano | CC BY-NC 4.0 | nur mit kommerzieller Lizenz von Jina AI |
Die Model Card von jina-embeddings-v3 formuliert es ausdrücklich: Wer das Modell außerhalb von AWS und Azure oder on-premises im Unternehmen einsetzt, nutzt es unter CC BY-NC 4.0, für kommerzielle Nutzung ist eine Anfrage beim Vertrieb nötig (Model Card, Abschnitt License). Bei jina-embeddings-v4 stand zunächst CC BY-NC 4.0, die korrekte Lizenz ist laut Model Card die Qwen Research License, weil das Modell auf Qwen2.5-VL-3B aufbaut (Model Card).
Für ein produktives RAG-System im Unternehmen bleiben ohne Zusatzvertrag damit BGE-M3, Qwen3-Embedding, multilingual-e5, Granite Embedding R2, jina-embeddings-v2-base-de und, unter den Gemma-Bedingungen, EmbeddingGemma.
Was Benchmarks über deutsche Texte aussagen
Der Massive Text Embedding Benchmark (MTEB) ist die übliche Referenz. Für die Auswahl deutscher Modelle ist er nur bedingt aussagekräftig, weil die bekannten Ranglisten über viele Sprachen und Aufgaben mitteln.
Mehrsprachiger Gesamtwert. Die Model Card von Qwen3-Embedding veröffentlicht die Mittelwerte im mehrsprachigen MTEB (MMTEB) über alle Aufgaben, Stand der Vergleichswerte 24. Mai 2025 (Model Card). Für jina-embeddings-v5-text-small nennt Jina 67,7 (Model Card).
| Modell | MMTEB, Mittelwert über Aufgaben |
|---|---|
| Qwen3-Embedding-8B | 70,58 |
| Qwen3-Embedding-4B | 69,45 |
| jina-embeddings-v5-text-small | 67,7 |
| Qwen3-Embedding-0.6B | 64,33 |
| multilingual-e5-large-instruct | 63,22 |
| BGE-M3 | 59,56 |
Dieser Mittelwert enthält Klassifikation, Clustering, Bitext-Mining und weitere Aufgaben, die für RAG keine Rolle spielen.
Deutsches Retrieval. Aussagekräftiger für RAG ist das Retrieval auf deutschen Texten. MTEB enthält dafür den Benchmark MTEB(deu, v1) mit den Retrieval-Aufgaben GermanQuAD, GermanDPR, XMarket und GerDaLIR (MTEB-Benchmarkdefinition). Für die aktuellen Modelle liegen dort nicht durchgängig Ergebnisse vor. Eine Aufgabe, für die es für fast alle Kandidaten Werte gibt, ist der deutsche Teil von MIRACL (Retrieval auf der deutschen Wikipedia, Variante mit Hard Negatives). Die folgenden Werte stammen aus dem öffentlichen MTEB-Ergebnisrepository, Stand September 2026.
| Modell | MIRACL Deutsch, nDCG@10 |
|---|---|
| Qwen3-Embedding-4B | 62,98 |
| Qwen3-Embedding-8B | 61,92 |
| jina-embeddings-v5-text-small | 57,99 |
| BGE-M3 | 57,59 |
| EmbeddingGemma-300m | 56,60 |
| Qwen3-Embedding-0.6B | 54,21 |
| Granite Embedding 311M Multilingual R2 | 50,97 |
| multilingual-e5-large-instruct | 43,37 |
Drei Beobachtungen aus beiden Tabellen:
- Größer ist nicht automatisch besser. Im deutschen Retrieval liegt das 4B-Modell vor dem 8B-Modell, obwohl das 8B-Modell im Gesamtwert führt.
- Gesamtwerte können täuschen. multilingual-e5-large-instruct liegt im MMTEB-Mittel vor BGE-M3, im deutschen Retrieval aber deutlich dahinter.
- Wikipedia ist nicht Ihr Bestand. Erlasse, Verträge, Handbücher, Wartungsprotokolle und gescannte PDFs verhalten sich anders als Lexikonartikel. MTEB führt inzwischen mit
RTEB(deu, beta)einen deutschen Retrieval-Benchmark mit Rechts-, Gesundheits- und Geschäftsdaten, der teils auf nicht öffentlichen Datensätzen beruht (Benchmarkdefinition).
Die Benchmarks eignen sich, um die Kandidatenliste auf drei oder vier Modelle zu verkleinern. Die Entscheidung trifft ein Testset mit echten Fragen und den zugehörigen Fundstellen aus dem eigenen Bestand. Wie ein solches Testset aufgebaut und ausgewertet wird, beschreibt der Wissensartikel RAG-Qualität messen.
Kontextlänge, Dimensionen und Speicherbedarf
Kontextlänge. Die maximale Eingabelänge begrenzt die Chunk-Größe. multilingual-e5 schneidet nach 512 Token ab, der Rest eines längeren Abschnitts fließt nicht in den Vektor ein. BGE-M3 und jina-embeddings-v2-base-de verarbeiten 8.192 Token, Qwen3-Embedding, Granite Embedding R2 und jina-embeddings-v5 bis zu 32.768 Token. Eine lange Eingabelänge heißt nicht, dass lange Chunks besser suchen: Ein Vektor für zehn Seiten bildet deren Inhalt nur grob ab. Sie erlaubt aber, Abschnitte nach der Dokumentstruktur zu schneiden, statt nach einer festen Tokenzahl.
Dimension und Indexgröße. In pgvector belegt ein Vektor 4 × Dimension + 8 Byte, der Typ vector lässt sich bis 2.000 Dimensionen mit einem Index versehen, halfvec bis 4.000 (pgvector README). Für eine Million Chunks ergibt das ohne Indexstrukturen:
| Dimension | Beispielmodell | Speicher je Vektor | 1 Mio. Chunks | Index in pgvector |
|---|---|---|---|---|
| 768 | EmbeddingGemma, Granite R2 | 3.080 Byte | ca. 3,1 GB | vector |
| 1.024 | BGE-M3, Qwen3-0.6B, E5 | 4.104 Byte | ca. 4,1 GB | vector |
| 2.560 | Qwen3-Embedding-4B | 10.248 Byte | ca. 10,2 GB | halfvec oder gekürzt |
| 4.096 | Qwen3-Embedding-8B | 16.392 Byte | ca. 16,4 GB | nur gekürzt oder mit Binärquantisierung |
Die Qwen3-Modelle mit 2.560 und 4.096 Dimensionen lassen sich über MRL auf 1.024 Dimensionen kürzen. Ob der Qualitätsverlust dabei akzeptabel ist, gehört ins Testset. Qdrant hat diese Indexgrenze nicht, dort wirken sich große Dimensionen auf Arbeitsspeicher und Suchlatenz aus. Die Unterschiede der beiden Datenbanken beschreibt Qdrant vs. pgvector.
VRAM und Hardware
Embedding-Modelle sind klein im Vergleich zu Sprachmodellen. In FP16 oder BF16 belegen die Gewichte etwa zwei Byte pro Parameter:
| Modell | Parameter | Gewichte in FP16/BF16 |
|---|---|---|
| jina-embeddings-v2-base-de | 161 Mio. | ca. 0,3 GB |
| EmbeddingGemma-300m | 308 Mio. | ca. 0,6 GB |
| Granite Embedding 311M R2 | 311 Mio. | ca. 0,6 GB |
| multilingual-e5-large | 560 Mio. | ca. 1,1 GB |
| BGE-M3 | 568 Mio. | ca. 1,1 GB |
| Qwen3-Embedding-0.6B | 0,6 Mrd. | ca. 1,2 GB |
| Qwen3-Embedding-4B | 4,0 Mrd. | ca. 8 GB |
| Qwen3-Embedding-8B | 7,6 Mrd. | ca. 15 GB |
Dazu kommt Speicher für die Verarbeitung, der mit Batchgröße und Eingabelänge wächst. Bei 8.192 oder 32.768 Token pro Eingabe ist dieser Anteil nicht vernachlässigbar.
Für die Hardwareplanung heißt das:
- Modelle bis rund 600 Mio. Parameter laufen auch auf der CPU. Für Suchanfragen im laufenden Betrieb reicht das oft. Die Erstindexierung eines großen Bestands dauert auf der CPU jedoch um ein Vielfaches länger als auf einer GPU.
- Embedding-Modell, Reranker und Sprachmodell teilen sich den Grafikspeicher, wenn sie auf derselben Maschine laufen. Auf einer GPU mit 24 GB, etwa der NVIDIA RTX PRO 4000 Blackwell, bleibt neben einem Qwen3-Embedding-8B (ca. 15 GB) wenig Platz für ein Sprachmodell. Mit BGE-M3 oder Qwen3-Embedding-0.6B bleibt der größte Teil frei.
- Die Erstindexierung ist die Lastspitze. Danach werden nur neue und geänderte Dokumente eingebettet und die Anfragen der Nutzer, jeweils wenige Dutzend Token.
Wie sich VRAM für das gesamte System aus Sprachmodell, KV-Cache, Embedding und Reranker zusammensetzt, beschreibt GPU und VRAM dimensionieren.
Betrieb mit TEI, vLLM und Ollama
Drei Inferenz-Server kommen für Embedding-Modelle üblicherweise in Frage. Alle drei stellen eine HTTP-Schnittstelle bereit, vLLM und TEI zusätzlich im OpenAI-kompatiblen Format.
| Text Embeddings Inference (TEI) | vLLM | Ollama | |
|---|---|---|---|
| Ausrichtung | reiner Embedding- und Reranker-Server von Hugging Face | Inferenz-Server für Sprachmodelle, mit Pooling-Modus für Embeddings | Modellverwaltung und Inferenz für Einzelplatz und kleine Server |
| Qwen3-Embedding | unterstützt | unterstützt | 0.6B, 4B, 8B in der Bibliothek |
| BGE-M3 | dichte Vektoren | dicht, Sparse und ColBERT über BgeM3EmbeddingModel |
dichte Vektoren |
| multilingual-e5, EmbeddingGemma | unterstützt | unterstützt | EmbeddingGemma in der Bibliothek |
| Reranker | ja, XLM-RoBERTa- und GTE-basierte Modelle | ja, über Score-Schnittstelle | nein |
Quellen: TEI, unterstützte Modelle, vLLM, Embedding-Modelle, vLLM, BGE-M3, Ollama-Bibliothek, Ollama Embed-API. Stand September 2026.
Worauf es im Betrieb ankommt:
- Sparse-Vektoren von BGE-M3. vLLM liefert sie, wenn das Modell mit überschriebener Architektur gestartet wird, weil die
config.jsondas Modell sonst als einfaches XLM-RoBERTa lädt:
vllm serve BAAI/bge-m3 \
--runner pooling \
--hf-overrides '{"architectures": ["BgeM3EmbeddingModel"]}' \
--pooler-config.task token_classify
Mit --pooler-config.task embed liefert dieselbe Instanz dichte Vektoren. In TEI ist die Sparse-Unterstützung für BGE-M3 als Pull Request eingereicht, aber noch nicht übernommen.
- Blackwell-GPUs in TEI. Für GPUs der Blackwell-Generation mit Compute Capability 12.0, zu denen die RTX PRO 4000 und 6000 Blackwell gehören, führt TEI ein eigenes Image, das als experimentell gekennzeichnet ist (TEI-Dokumentation).
- Präfixe und Instruktionen müssen in der Anwendung gesetzt werden, nicht im Server. Ein Pipeline-Baustein, der bei E5
query:vergisst oder bei Qwen3 die Instruktion weglässt, verschlechtert die Suche ohne Fehlermeldung. - Custom Code. jina-embeddings-v2 und v3 laden eigenen Modellcode (
trust_remote_code). Das ist im Betrieb eine zusätzliche Code-Abhängigkeit, die bei Updates mitgeprüft werden muss.
Ollama eignet sich für Prototypen und den Einzelplatz. Für produktive Systeme mit vielen gleichzeitigen Anfragen und einer Erstindexierung großer Bestände sind TEI oder vLLM die belastbareren Wege. Den Vergleich der Inferenz-Server für Sprachmodelle enthält der Beitrag vLLM, Ollama und llama.cpp im Vergleich, die Einrichtung übernehmen wir als vLLM-Betrieb oder mit Ollama.
Welches Modell für welchen Einsatz
Die Tabelle ist ein Ausgangspunkt für die Kandidatenliste, keine Rangliste. Die Auswahl bestätigt oder widerlegt erst das Testset.
| Einsatz | Kandidaten | Begründung |
|---|---|---|
| Deutscher Dokumentbestand mit Hybrid Search | BGE-M3 | Dichte und Sparse-Vektoren aus einem Modell, MIT-Lizenz, 1.024 Dimensionen |
| Höchste Trefferqualität, GPU vorhanden | Qwen3-Embedding-4B | bester deutscher Retrieval-Wert der Auswahl, Apache 2.0, Dimension per MRL kürzbar |
| Wenig VRAM oder reiner CPU-Betrieb | Qwen3-Embedding-0.6B, EmbeddingGemma-300m, Granite Embedding 311M R2 | kleine Modelle, 768 bis 1.024 Dimensionen |
| Lange Dokumente ohne feine Zerlegung | Qwen3-Embedding, Granite Embedding R2 | bis 32.768 Token Eingabe |
| Bestehende E5-Installation | multilingual-e5-large-instruct beibehalten, Wechsel messen | Wechsel nur, wenn das Testset eine Verbesserung zeigt |
| Keine eigene GPU, Daten dürfen in die EU-Cloud | Mistral Embed oder Embedding-Modelle europäischer Anbieter | Abrechnung pro Token, Dokumente verlassen das eigene Netz |
Für die API-Variante gilt: Bei der Indexierung wird der gesamte Dokumentbestand an den Anbieter übertragen, im Betrieb jede Suchanfrage. Welche europäischen Anbieter welche Embedding-Modelle anbieten, vergleicht der Beitrag Europäische LLM-APIs im Vergleich. Embedding und Reranker brauchen wenig Rechenleistung und lassen sich auch dann lokal betreiben, wenn das Sprachmodell über eine API läuft.
Modellwechsel bedeutet Neuindexierung
Vektoren verschiedener Modelle sind nicht vergleichbar. Ein Wechsel des Embedding-Modells bedeutet, den gesamten Bestand neu einzubetten. Das gilt auch für einen Wechsel der Dimension per MRL, der Präfixe oder der Instruktion.
Praktische Folgen:
- Modell, Revision, Dimension und Instruktion dokumentieren. Auf Hugging Face ändern sich auch bestehende Modelle, zum Beispiel wurde bei jina-embeddings-v3 ein Fehler in der Matryoshka-Kürzung nachträglich korrigiert (Model Card). Eine feste Revision im Deployment verhindert, dass sich Vektoren unbemerkt ändern.
- Neuen Index parallel aufbauen. Der alte Index bleibt aktiv, bis der neue vollständig ist und im Testset mindestens gleich gut abschneidet.
- Testset erneut ausführen. Recall und Ranking-Metriken vor und nach dem Wechsel vergleichen, nicht nur Stichproben.
- Berechtigungen mitführen. Der neue Index muss dieselben Zugriffsinformationen je Chunk tragen wie der alte, siehe RAG mit Berechtigungen.
Unser Vorgehen bei WZ-IT
Wir wählen das Embedding-Modell nicht nach Rangliste, sondern mit Messungen auf Ihrem Bestand.
- Bestand und Fragen erfassen. Dokumenttypen, Sprachen, Länge, gescannte Anteile und typische Fragen der Fachbereiche.
- Kandidaten eingrenzen. Nach Lizenz, Kontextlänge, Dimension und Hardware bleiben meist drei bis vier Modelle.
- Mit Referenzfragen messen. Im RAG Proof of Value arbeiten wir mit 40 bis 60 Referenzfragen einschließlich Quellen- und Nichtwissenstests, mit Baseline-Messung und zwei Optimierungszyklen.
- Betrieb einrichten. Embedding-Modell und Reranker laufen mit TEI oder vLLM auf dem AI Cube in Ihrem Netzwerk oder auf einem Managed GPU-Server von WZ-IT mit NVIDIA RTX PRO 4000 Blackwell (24 GB) oder RTX PRO 6000 Blackwell (96 GB).
- Dokumentieren und übergeben. Modellrevision, Dimension, Instruktionen und Testset werden festgehalten, damit ein späterer Modellwechsel messbar bleibt.
Support, Beratung und Implementierung durch WZ-IT. Den Aufbau als produktiven Assistenten mit Rechten und Quellenangaben beschreibt die Seite interner KI-Assistent.
Weiterführende Guides
- Hybrid Search und Reranking, Stichwortsuche, dichte Vektoren und Cross-Encoder kombinieren.
- Chunking für deutsche Dokumente, Abschnittsgrößen, Struktur und Metadaten.
- RAG-Qualität messen, Testset, Retrieval- und Antwortmetriken.
- Europäische LLM-APIs im Vergleich, Anbieter mit Embedding- und Reranker-Modellen in der EU.
- RAG-Wissensdatenbank in der Verwaltung, Aufbau für Behörden mit eigenem Betrieb.
- KI-Lösungen von WZ-IT, der Hub mit allen KI-Leistungen.
Welches Embedding-Modell passt zu Ihren Dokumenten? Wir messen die Kandidaten mit Referenzfragen aus Ihrem Bestand und betreiben das gewählte Modell auf Ihrer Hardware oder einem Managed GPU-Server von WZ-IT. Termin vereinbaren
Quellen
- BAAI, BGE-M3 Model Card
- Qwen, Qwen3-Embedding-8B Model Card
- Qwen, Qwen3-Embedding-0.6B Model Card
- Qwen, Qwen3-Embedding-4B Model Card
- intfloat, multilingual-e5-large Model Card
- intfloat, multilingual-e5-large-instruct Model Card
- Google, EmbeddingGemma Model Card
- Google, Gemma Terms of Use
- IBM, Granite Embedding 311M Multilingual R2 Model Card
- Jina AI, jina-embeddings-v2-base-de Model Card
- Jina AI, jina-embeddings-v3 Model Card
- Jina AI, jina-embeddings-v4 Model Card
- Jina AI, jina-embeddings-v5-text-small Model Card
- Elastic, Jina AI wird Teil von Elastic
- Mistral AI, Mistral Embed Model Card
- Mistral AI, Text Embeddings
- MTEB, Benchmarkdefinitionen
- MTEB, RTEB-Benchmarkdefinitionen
- MTEB, Ergebnisrepository
- MTEB Leaderboard
- pgvector README
- Hugging Face, Text Embeddings Inference: unterstützte Modelle und Hardware
- Text Embeddings Inference, Pull Request zu BGE-M3 Sparse
- vLLM, unterstützte Embedding-Modelle
- vLLM, Pooling-Modelle: BGE-M3
- Ollama, Qwen3-Embedding in der Modellbibliothek
- Ollama, Embed-API
Embedding-Modell für Ihre Dokumente auswählen
Wir testen Embedding-Modelle mit Referenzfragen auf Ihrem eigenen Dokumentbestand und betreiben das gewählte Modell auf Ihrer Hardware oder einem Managed GPU-Server von WZ-IT.
Häufig gestellte Fragen
Antworten auf wichtige Fragen zu diesem Thema
Es gibt kein Modell, das für jeden Bestand gewinnt. Als Ausgangspunkt für deutsche RAG-Systeme eignen sich BGE-M3 (MIT-Lizenz, 8.192 Token, Dense und Sparse aus einem Modell) und Qwen3-Embedding in 0.6B oder 4B (Apache 2.0, bis 32.768 Token). Im deutschen Teil des MIRACL-Retrieval-Benchmarks liegt Qwen3-Embedding-4B mit einem nDCG@10 von 62,98 vorn, BGE-M3 erreicht 57,59 (MTEB-Ergebnisdaten, Stand September 2026). Die Entscheidung fällt mit einem Testset aus eigenen Dokumenten.
Nicht ohne Weiteres. jina-embeddings-v3 und die fünfte Generation jina-embeddings-v5-text stehen unter CC BY-NC 4.0, also nur für nicht-kommerzielle Nutzung. Für den Einsatz im Unternehmen ist eine kommerzielle Lizenz nötig. jina-embeddings-v4 steht unter der Qwen Research License. Der Vorgänger jina-embeddings-v2-base-de ist dagegen Apache 2.0 lizenziert.
Nein. Im deutschen MIRACL-Retrieval liegt Qwen3-Embedding-4B mit 62,98 vor der 8B-Variante mit 61,92. Das 8B-Modell braucht in FP16 rund 15 GB VRAM nur für die Gewichte und erzeugt 4.096-dimensionale Vektoren, die den Vektorindex etwa viermal so groß machen wie 1.024 Dimensionen. Ob sich der Mehraufwand lohnt, zeigt nur eine Messung auf dem eigenen Bestand.
In der Regel nicht. Die aktuellen mehrsprachigen Modelle wie BGE-M3, Qwen3-Embedding, EmbeddingGemma oder Granite Embedding R2 sind auf Deutsch trainiert und decken gemischte Bestände mit englischen Dokumenten mit ab. Das zweisprachige jina-embeddings-v2-base-de (Deutsch und Englisch, Apache 2.0) ist eine kleine Alternative mit 161 Mio. Parametern, stammt aber aus dem Januar 2024.
Weil multilingual-e5-large und multilingual-e5-large-instruct Eingaben auf höchstens 512 Token kürzen. Alles dahinter geht nicht in den Vektor ein. Die Chunks müssen deshalb unter dieser Grenze bleiben. BGE-M3 verarbeitet 8.192 Token, Qwen3-Embedding und Granite Embedding R2 bis zu 32.768 Token.
Ja. Vektoren verschiedener Modelle liegen in unterschiedlichen Vektorräumen und sind nicht vergleichbar, oft haben sie auch eine andere Dimension. Frage und Dokumente müssen mit demselben Modell und denselben Präfixen oder Instruktionen eingebettet werden. Ein Modellwechsel bedeutet, den gesamten Bestand neu einzubetten und die Suchqualität erneut zu messen.
Die Gewichte belegen in FP16 oder BF16 etwa zwei Byte pro Parameter: BGE-M3 und multilingual-e5-large rund 1,1 GB, Qwen3-Embedding-0.6B rund 1,2 GB, Qwen3-Embedding-4B rund 8 GB und Qwen3-Embedding-8B rund 15 GB. Dazu kommt Speicher für die Verarbeitung der Eingaben, der mit Batchgröße und Textlänge wächst. Die kleinen Modelle laufen auch auf der CPU, bei der Erstindexierung großer Bestände ist eine GPU deutlich im Vorteil.
Nein. Die Embedding-Schnittstelle von Ollama gibt dichte Vektoren zurück. Die Sparse-Gewichte von BGE-M3 für die hybride Suche liefern die Bibliothek FlagEmbedding und vLLM, wenn das Modell mit der Architektur BgeM3EmbeddingModel und der Pooling-Aufgabe token_classify gestartet wird. In Text Embeddings Inference ist die Unterstützung dafür noch nicht übernommen (Stand September 2026).
Ja, Mistral Embed ist über die API des französischen Anbieters Mistral AI verfügbar, erzeugt 1.024-dimensionale Vektoren und verarbeitet laut Model Card einen Kontext von 8k Token. Der Preis liegt laut Model Card bei 0,10 US-Dollar pro Million Token (Stand September 2026). Dabei wird der gesamte Dokumentbestand zur Indexierung an die API übertragen, und jede Suchanfrage ebenfalls. Das Modell ist nicht als offene Gewichte verfügbar.

Geschrieben von
Timo Wevelsiep
Co-Founder & CEO
Co-Founder von WZ-IT. Spezialisiert auf Cloud-Infrastruktur, Open-Source-Plattformen und Managed Services für KMUs und Enterprise-Kunden weltweit.
LinkedInLassen Sie uns über Ihre Idee sprechen
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.





