XWiki KI einrichten: LLM Application mit lokalem Modell und RAG

Hinweis zum Inhalt: Die Informationen in diesem Artikel wurden nach bestem Wissen zum Zeitpunkt der Veröffentlichung zusammengestellt. Technische Details, Preise, Versionen, Lizenzmodelle und externe Inhalte können sich ändern. Bitte prüfen Sie die genannten Angaben eigenständig, insbesondere vor geschäftskritischen oder sicherheitsrelevanten Entscheidungen. Dieser Artikel ersetzt keine individuelle Fach-, Rechts- oder Steuerberatung.

XWiki mit KI-Suche über eigene Inhalte? WZ-IT betreibt XWiki und richtet die LLM Application mit einem Modell auf eigener Hardware oder einem Managed GPU-Server ein, siehe XWiki Managed Hosting und KI-Lösungen. Termin vereinbaren
XWiki bringt von Haus aus keine KI mit. Wer im Wiki einen Chat mit Quellenangaben, eine Schreibhilfe im Editor oder eine semantische Suche über die eigenen Seiten will, installiert die LLM Application aus dem Projekt xwiki-contrib und das zugehörige Index for the LLM Application. Zusammen ergeben sie ein RAG-System innerhalb von XWiki: Seiten werden in Abschnitte zerlegt, als Vektoren in Solr gespeichert und bei jeder Frage als Kontext an das Sprachmodell übergeben.
Deutschsprachige Anleitungen dazu gibt es kaum, und die offizielle Extension-Seite nennt teils veraltete Voraussetzungen. Dieser Beitrag beschreibt den Stand der Version 0.10 vom 18. September 2026: Voraussetzungen, Installation, Anbindung an Ollama oder vLLM, Indexierung, Rechte und die Grenzen der Erweiterung. Alle Konfigurationsschritte folgen der Dokumentation auf extensions.xwiki.org und dem Quellcode auf GitHub. Stand September 2026.
Inhaltsverzeichnis
- Was die LLM Application ist
- Versionsstand und Voraussetzungen
- Architektur: wo Modell, Index und Rechte liegen
- Installation über den Extension Manager
- Lokales Modell anbinden: Ollama und vLLM
- Wiki-Inhalte indexieren: Collections und RAG
- Rechte: was der Chat sehen darf
- MCP-Server und externe Einbindung
- Grenzen und bekannte Probleme
- Unser Vorgehen bei WZ-IT
- Weiterführende Guides
Was die LLM Application ist
Das Projekt „LLM" bündelt mehrere Erweiterungen, die gemeinsam versioniert werden (Projektseite LLM). Entwickelt wird es unter anderem von Ludovic Dubost und Michael Hamann, Teile der Indexierung wurden über NGI Search im Projekt WAISE gefördert (WAISE-Proposal).
| Erweiterung | Zweck | Typ | Aktive Installationen |
|---|---|---|---|
| LLM Application | Chat, Schreibhilfe im Editor, Prompt-Datenbank, Server- und Modellkonfiguration | XAR | 213 |
| Index for the LLM Application | Collections, Chunking, Embeddings, Suche als RAG-Kontext | XAR | 176 |
| LLM Internal Inference Server | Embeddings im XWiki-Prozess auf der CPU | JAR | 56 |
| Token-based authentication | Anmeldung externer Anwendungen per signiertem JWT | XAR | 44 |
| LLM Chat WebJar | einbettbares Chat-Widget und JavaScript-Bibliothek | WebJar | 231 |
| MCP Server | Wiki-Inhalte als Werkzeuge für KI-Agenten | XAR und JAR | keine Angabe |
Installationszahlen laut extensions.xwiki.org, Stand September 2026. Alle Erweiterungen stehen unter der GNU Lesser General Public License 2.1 und sind als BETA gekennzeichnet. Die Dokumentation formuliert es direkt: Unerwartetes Verhalten ist möglich.
Die Funktionen der LLM Application im Überblick:
- Chat mit Auswahl zwischen den freigegebenen Modellen, Temperatur und Systemprompt in den erweiterten Einstellungen.
- Quick Tasks aus einer Prompt-Datenbank, etwa Zusammenfassen oder Übersetzen. Eigene Prompts lassen sich mit Titel, System- und Nutzerprompt und Temperatur anlegen.
- Übernahme in die Seite: Antworten lassen sich im Editor an der Cursorposition einfügen oder in die Zwischenablage kopieren.
- Kontext aus dem Index, sobald das Index for the LLM Application installiert und einem Modell mindestens eine Collection zugeordnet ist.
Versionsstand und Voraussetzungen
Die Versionen der letzten Monate laut Jira-Projekt LLMAI und den Tags im GitHub-Repository:
| Version | Veröffentlicht | Wichtige Änderungen |
|---|---|---|
| 0.10 | 18.09.2026 | weitere MCP-Werkzeuge (Anhänge, Objekte, Schema, Verlauf), Fehlerkorrektur: Stichwortsuche ohne Wiki-Filter lieferte Abschnitte aus anderen Wikis (LLMAI-164) |
| 0.9 | 07.07.2026 | Administrationsoberfläche für den MCP-Server, Korrektur für Inferenzserver ohne HTTP/2-Upgrade wie LM Studio (LLMAI-137) |
| 0.8 | 18.03.2026 | MCP-Server, Suchkontext über die REST-API, Plattformbasis XWiki 17.4 |
| 0.7.2 | 01.08.2025 | letzte Version auf Basis XWiki 16.2 |
| 0.7 | 26.11.2024 | Stichwortsuche zusätzlich zur Vektorsuche |
| 0.5 | 09.07.2024 | Indexierung vorhandener Wiki-Bereiche, Embeddings auf der CPU im XWiki-Server |
Wer 0.8 oder 0.9 einsetzt und mehrere Wikis in einer Farm betreibt, sollte wegen LLMAI-164 auf 0.10 aktualisieren.
| Voraussetzung | Wert | Quelle |
|---|---|---|
| XWiki-Version für 0.8 bis 0.10 | ab 17.4.0 | README, Parent-POM 17.4.0 |
| XWiki-Version für 0.3 bis 0.7.2 | ab 16.2.0 | Extension-Seite |
| Installation | Extension Manager mit Internetzugang, Offline-Installation nur manuell | Extension-Seite |
| Chat-Modell | externer Server mit OpenAI-kompatibler API (/chat/completions) |
Extension-Seite |
| Embedding-Modell | externer Server (/embeddings) oder Internal Inference Server |
Extension-Seite, Quellcode |
| Internal Inference Server | nur Linux auf x86-64, rund 500 MB für Modell und PyTorch | Extension-Seite |
Die Kompatibilitätsangabe „16.2.0 and above" auf der Seite der LLM Application ist für aktuelle Versionen überholt. Maßgeblich ist das README mit „Minimal XWiki version supported: XWiki 17.4.0". Eine Installation auf XWiki 16.x bedeutet vor der KI-Einführung also ein Plattform-Upgrade.
Architektur: wo Modell, Index und Rechte liegen
Die LLM Application ist eine Vermittlungsschicht. XWiki selbst führt keine Chat-Modelle aus, sondern leitet Anfragen an einen Inferenzserver weiter und stellt dafür eine eigene OpenAI-kompatible REST-API bereit (/rest/wikis/<wiki>/aiLLM/v1/chat/completions und /v1/models).
| Baustein | Wo er läuft | Was zu beachten ist |
|---|---|---|
| Chat-Modell | externer Inferenzserver (Ollama, vLLM, europäische API) | nur OpenAI-kompatible Endpunkte |
| Embedding-Modell | externer Server oder im XWiki-Prozess | Vektorlänge im Index fest 1.024 |
| Vektor- und Stichwortindex | eigener Solr-Core aillm in XWikis Solr |
Kosinus-Ähnlichkeit, Vektorfeld mit 1.024 Dimensionen |
| Rechteprüfung | nach der Suche, je Collection | Methode public, external oder xwiki |
Drei Details aus dem Quellcode von Version 0.10 sind für die Planung wichtig (application-ai-llm auf GitHub):
- Feste Vektorlänge. Der Solr-Core legt das Vektorfeld mit 1.024 Dimensionen an. Embeddings werden vor dem Speichern auf genau diese Länge gebracht: längere abgeschnitten, kürzere mit Nullen aufgefüllt. Ein Modell mit 1.024 Dimensionen passt ohne Verlust.
- Hybride Suche ohne Reranking. Seit 0.7 laufen Vektorsuche und Stichwortsuche parallel. Die Ergebnisse werden aneinandergehängt und doppelte Abschnitte entfernt, ohne gemeinsame Rangfolge und ohne Reranker. Wie sich das von Reciprocal Rank Fusion und Cross-Encodern unterscheidet, erklärt der Artikel zu Hybrid Search und Reranking.
- Rechte nach der Suche. Die Rechteprüfung filtert die bereits gefundenen Abschnitte. Fallen viele Treffer heraus, erhält das Modell entsprechend weniger Kontext.
Installation über den Extension Manager
Die Installation folgt dem üblichen XWiki-Weg (LLM Application, Prerequisites & Installation Instructions):
- Mit einem Konto mit Administrationsrechten anmelden.
- Im Extension Manager nach „LLM Application" suchen und installieren. Abhängigkeiten wie LLM Models API und Chat WebJar werden mitinstalliert.
- Für RAG zusätzlich „Index for the LLM Application" installieren.
- Nur wenn Embeddings im XWiki-Prozess berechnet werden sollen: „LLM Internal Inference Server" installieren.
- XWiki neu starten. Ohne Neustart bleibt die Modellliste leer, das ist der bekannte Fehler XWIKI-21887, der im September 2026 noch offen ist.
Ohne Internetzugang des XWiki-Servers funktioniert der Extension Manager nicht. Dann bleibt der manuelle Weg: XAR-Datei herunterladen, über Administration und Import einspielen und alle abhängigen Erweiterungen einzeln nachinstallieren. Für Installationen in abgeschotteten Netzen ist das ein eigener Arbeitsschritt, der bei jedem Update wiederkehrt.
Nach der Installation erscheint „LLM Application" im Anwendungspanel. Im Editor öffnet eine Schaltfläche in der Werkzeugleiste den Chat. Die Schaltfläche nutzt dasselbe Symbol wie „Einfügen", eine eigene Ikone gibt es laut Dokumentation noch nicht.
Lokales Modell anbinden: Ollama und vLLM
Die Konfiguration hat zwei Ebenen: Server und Modelle. Ein Server beschreibt den Endpunkt, ein Modell die konkrete Freigabe für Nutzer.
Server anlegen (Administration, Konfiguration der LLM Application):
| Feld | Inhalt | Hinweis |
|---|---|---|
| Server name | frei wählbarer Name, zum Beispiel ollama-intern |
eindeutig halten, bei doppelten Namen wird der erste Eintrag ignoriert |
| URL prefix | Basis-URL mit abschließendem / |
an das Präfix werden chat/completions, models und embeddings angehängt |
| Token | API-Schlüssel, falls der Server einen verlangt | für Ollama ohne Authentifizierung leer lassen |
| Can Stream | Streaming-Antworten | zur Fehlersuche vorübergehend deaktivieren |
Typische Werte für das URL-Präfix:
| Server | URL prefix | Dokumentation |
|---|---|---|
| Ollama | http://ollama.intern:11434/v1/ |
Ollama, OpenAI compatibility |
| vLLM | http://vllm.intern:8000/v1/ |
vLLM, OpenAI-compatible server |
| Embeddings im XWiki-Prozess | leer lassen | Internal Inference Server erforderlich |
Der häufigste Fehler bei Ollama ist das fehlende /v1/. Ollama stellt die OpenAI-kompatible API unter /v1/ bereit, nicht im Wurzelpfad (XWiki-Forum). Den Inferenzserver muss der XWiki-Server erreichen, nicht der Browser der Nutzer: Alle Anfragen laufen über XWiki.
Modelle anlegen (unterhalb des Chats in der LLM Application):
| Feld | Bedeutung |
|---|---|
| Server name | der oben angelegte Server |
| Type | „Large language model" für Chat, „Embeddings model" für den Index |
| Model ID | Name des Modells auf dem Server, etwa qwen3:32b bei Ollama oder der Modellpfad bei vLLM |
| Number of Dimensions | nur für Embeddings, zum Beispiel 1024 |
| Context size | maximale Kontextlänge in Tokens, begrenzt den Chatverlauf |
| Allow guests | Zugriff ohne Anmeldung; nur bewusst aktivieren |
| Group | Gruppen, die das Modell nutzen dürfen |
| Collections | Collections, deren Inhalte als Kontext dienen; leer bedeutet reiner Chat |
| Search results limit / Keyword search results limit | Anzahl Abschnitte aus Vektor- und Stichwortsuche |
| Context prompt | Anweisung mit dem Platzhalter {{search_results}} |
| Chunk Template | Darstellung eines Treffers mit {{url}}, {{index}} und {{content}} |
Die LLM Application übernimmt Modelle nicht automatisch vom Server. Das ist Absicht: Admins sollen nur freigegebene Modelle anbieten und dasselbe Modell mit unterschiedlichen Collections unter verschiedenen Namen bereitstellen können (XWiki-Forum). Sinnvoll sind sprechende Namen wie „Handbuch IT, mit Quellen" statt der technischen Modell-ID.
Welcher Inferenzserver passt, hängt von Nutzerzahl und Hardware ab. Ollama eignet sich für den Einstieg, vLLM für viele parallele Anfragen; der Vergleich steht im Beitrag vLLM, Ollama oder llama.cpp. Wie viel Grafikspeicher ein Modell braucht, erklärt der Artikel zum VRAM-Sizing.
Wiki-Inhalte indexieren: Collections und RAG
Eine Collection ist ein abgegrenzter Wissensbereich mit eigenem Embedding-Modell, eigenen Chunking-Parametern und eigener Rechteprüfung (Index for the LLM Application). Die Übersicht der Collections ist für Admins am unteren Rand der LLM Application verlinkt.
| Eigenschaft | Optionen | Empfehlung |
|---|---|---|
| Document store | internal (eigene Dokumente, auch per REST-API) oder XWiki (vorhandene Bereiche) |
für Wiki-Inhalte XWiki |
| Document spaces | Liste der zu indexierenden Bereiche | Bereiche nach Zielgruppe trennen |
| Embedding Model | ein angelegtes Embeddings model | mehrsprachig, 1.024 Dimensionen |
| Chunking Method | nur maxChars |
ohne Alternative |
| Chunking Max Size | maximale Länge in Zeichen, mindestens 10 | an Seitenstruktur anpassen und testen |
| Chunking Overlap Offset | Überlappung in Zeichen, kleiner als die halbe Maximalgröße | moderat wählen |
| Rights Check Method | public, external, xwiki |
für Wiki-Bereiche mit Seitenrechten xwiki |
| Allow Guests / Query Groups | wer die Collection abfragen darf | Gruppen statt Gäste |
Chunking. Die Methode maxChars sucht innerhalb der maximalen Länge nacheinander nach Überschrift, Leerzeile, Zeilenumbruch, Satzende und Leerzeichen und trennt an der ersten passenden Stelle. Ein Abschnitt kann dabei bis auf die halbe Maximalgröße schrumpfen. Welche Größen für deutsche Texte mit langen Sätzen und Tabellen tragen, beschreibt der Artikel zu Chunking-Strategien. Die indexierten Abschnitte lassen sich in einer Live-Data-Tabelle der Collection prüfen, samt Fehlermeldungen beim Embedding.
Anhänge. Dokumente im internen Store können Anhänge haben, deren Text über Apache Tika extrahiert wird. Gescannte PDFs ohne Textebene liefern dabei keinen Inhalt; eine OCR-Stufe gehört nicht zur Erweiterung.
Embedding-Modell. Wegen der festen Vektorlänge von 1.024 passen Modelle mit genau dieser Dimension ohne Verlust:
| Modell | Dimensionen | Sprachen | Hinweis |
|---|---|---|---|
| BGE-M3 | 1.024 | mehrsprachig | Kontext bis 8.192 Tokens |
| multilingual-e5-large | 1.024 | mehrsprachig | erwartet die Präfixe query: und passage: |
| all-MiniLM-L6-v2 | 384 | Englisch | mitgeliefertes Beispiel „Default", für deutsche Inhalte ungeeignet |
Für Modelle wie multilingual-e5 hat die Modellkonfiguration die Felder „Embedding Index Prefix" und „Embedding Query Prefix". Ein Vergleich weiterer Modelle für deutsche Texte steht im Beitrag Embedding-Modelle für Deutsch.
Wer das Embedding-Modell oder die Chunking-Parameter ändert, muss die Collection neu indexieren. Ohne Neuindexierung gelten geänderte Chunking-Werte erst, wenn ein Dokument das nächste Mal bearbeitet wird. Im Forum berichten Anwender außerdem von Fehlern beim Embedding einzelner Modelle über Ollama (XWiki-Forum); vor der vollständigen Indexierung lohnt ein Test mit einem kleinen Bereich.
Rechte: was der Chat sehen darf
Die Dokumentation des Index ist hier eindeutig: Bei der Abfrage werden die regulären XWiki-Rechte nicht geprüft. Zugriff wird auf zwei Ebenen gesteuert, über die Collection und über eine Rechteprüfmethode je Dokument.
| Methode | Prüft | Geeignet für |
|---|---|---|
public |
nichts, alle Dokumente der Collection sind freigegeben | Bereiche, die jeder Berechtigte vollständig lesen darf |
external |
per HTTP-POST an eine eigene URL, Antwort je Dokument true oder false |
Inhalte aus Fremdsystemen mit eigener Rechteverwaltung |
xwiki |
Standard-Seitenrechte von XWiki | nur Collections mit dem Document store XWiki |
Bei external sendet XWiki die Dokument-IDs, den XWiki-Benutzernamen und, falls vorhanden, LDAP-Kennung, OIDC-Konten und JWT-Identitäten. Fehlende Werte oder Fehler werten als „kein Zugriff".
Für die Praxis folgt daraus:
- Collections nach Zielgruppen schneiden. Eine Collection für das gesamte Wiki mit Methode
publicgibt jedem Berechtigten der Collection alle Inhalte als Kontext, auch aus Bereichen, die er im Wiki nicht öffnen darf. - Für Wiki-Bereiche
xwikiwählen. Nur diese Methode spiegelt die Seitenrechte. - Embedding-Modelle für beide Seiten freigeben. Die Gruppen des Embedding-Modells müssen sowohl die Nutzer enthalten, deren Änderungen indexiert werden, als auch die Nutzer, die im Chat fragen.
- Gäste nur bewusst. „Allow guests" auf Modellen und Collections öffnet den Zugriff ohne Anmeldung; bei API-Modellen entstehen dabei Kosten.
Warum Rechte nie über den Prompt, sondern im Retrieval durchgesetzt werden müssen, erklärt der Artikel Berechtigungen in RAG-Systemen.
MCP-Server und externe Einbindung
MCP-Server. Seit Version 0.8 enthält das Projekt einen Server für das Model Context Protocol, seit 0.9 mit Administrationsoberfläche. Er macht Wiki-Inhalte für KI-Agenten und andere MCP-fähige Clients zugänglich. Laut Quellcode von Version 0.10 gilt:
| Aspekt | Verhalten |
|---|---|
| Endpunkt | /rest/wikis/<wiki>/aiLLM/mcp |
| Standardzustand | nach der Installation aktiv, pro Wiki abschaltbar |
| Werkzeuge | Lesewerkzeuge eingeschaltet, Schreibwerkzeuge (Seiten, Objekte, Anhänge, Schema) ausgeschaltet |
| Rechte | jeder Zugriff wird gegen die XWiki-Rechte des angemeldeten Nutzers geprüft |
| Anmeldung | OAuth-Metadaten verweisen auf den OpenID-Connect-Provider von XWiki |
| Bereichsfilter | Whitelist oder Blacklist für Bereiche und Dokumente |
Eine eigene Dokumentationsseite für den MCP-Server gibt es auf extensions.xwiki.org im September 2026 noch nicht. Wer die LLM Application installiert, sollte die MCP-Konfiguration deshalb aktiv prüfen und den Endpunkt abschalten, wenn er nicht gebraucht wird. Wie Freigaben für schreibende Agenten gestaltet werden, beschreibt der Artikel KI-Agenten: Rechte und Freigaben.
Chat in anderen Anwendungen. Das Chat WebJar liefert ein Widget, das sich per Script-Tag in andere Webanwendungen einbinden lässt. Für die Anmeldung externer Nutzer gibt es den Token-Authenticator: Die Anwendung signiert ein JWT mit einem Ed25519-Schlüssel, XWiki legt den Nutzer an oder aktualisiert ihn und übernimmt Gruppen aus dem Token. Die Dokumentation empfiehlt ein eindeutiges Gruppenpräfix, damit eine externe Anwendung keine Gruppen wie XWikiAdminGroup setzen kann (Token-based authentication).
Grenzen und bekannte Probleme
| Thema | Stand in Version 0.10 |
|---|---|
| Reifegrad | BETA, Fehlermeldungen oft knapp; Fehlersuche über das XWiki-Log und mit deaktiviertem Streaming |
| Halluzinationen | trotz Kontext möglich, laut Dokumentation einschließlich erfundener Verweise auf Kontext |
| Chunking | nur zeichenbasiert (maxChars), keine strukturbasierte oder semantische Zerlegung |
| Ranking | Vektor- und Stichwortsuche werden aneinandergehängt, kein Reranker |
| Vektorlänge | fest 1.024, andere Dimensionen werden angepasst |
| Modellliste | leer nach Änderungen an Erweiterungen bis zum Neustart (XWIKI-21887) |
| Offline-Betrieb | Extension Manager braucht Internet, sonst manuelle Installation |
| Editor | Einfügen nur im WYSIWYG-Editor, XWiki-Syntax über Kopieren in den Quelltext-Editor |
| Chat-Modelle im XWiki-Prozess | nicht unterstützt |
Für ein Wiki, in dem Mitarbeitende gezielt in Handbüchern und Richtlinien suchen, reicht dieser Funktionsumfang oft aus, wenn Collections und Rechte sauber geschnitten sind. Wer Inhalte aus mehreren Systemen zusammenführt, Reranking braucht oder die Antwortqualität systematisch messen will, setzt eine separate RAG-Schicht neben das Wiki. Wie solche Messungen aufgebaut werden, steht im Artikel RAG-Qualität messen.
Unser Vorgehen bei WZ-IT
Wir richten die LLM Application als Projekt mit festem Ablauf ein, auf Ihrer Infrastruktur oder in einer von uns betriebenen Umgebung in Deutschland. Support, Beratung und Implementierung durch WZ-IT.
- Bestandsaufnahme. XWiki-Version, Datenbank, Solr, Authentifizierung und Rechtestruktur. Liegt die Version unter 17.4.0, planen wir das Plattform-Upgrade vorab.
- Modellbetrieb festlegen. Ein lokales Modell auf dem AI Cube im eigenen Netzwerk, auf einem Managed GPU-Server von WZ-IT mit NVIDIA RTX PRO 4000 Blackwell (24 GB) oder RTX PRO 6000 Blackwell (96 GB), oder eine europäische Modell-API. Den Inferenzserver betreiben wir mit vLLM oder Ollama.
- Collections und Rechte. Zuschnitt nach Zielgruppen, Rechteprüfmethode passend zu Ihrer Berechtigungsstruktur, Embedding-Modell für deutsche Inhalte, Prüfung der MCP-Konfiguration.
- Antwortqualität prüfen. Referenzfragen aus dem Fachbereich, Prüfung der Quellen und Nachschärfen von Chunking und Kontextprompt. Als abgegrenztes Projekt bieten wir das als RAG Proof of Value an.
- Betrieb auf Wunsch. Updates von XWiki und Erweiterung, Monitoring und Backups als XWiki Managed Hosting. Reicht der Funktionsumfang der LLM Application nicht, bauen wir einen internen KI-Assistenten, der XWiki als eine von mehreren Quellen anbindet.
Weiterführende Guides
- Atlassian Rovo Alternative self-hosted, Wiki und KI-Schicht ohne Atlassian Cloud.
- Onyx self-hosted: Installation und Vergleich, eine eigenständige KI-Suche über mehrere Quellen.
- Embedding-Modelle für Deutsch, Dimensionen, Lizenzen und Betrieb im Vergleich.
- BookStack, Wiki.js, XWiki oder Docmost, die Wiki-Auswahl vor der KI-Frage.
- Was ist RAG?, die Grundlagen von Retrieval-Augmented Generation.
- KI-Lösungen, der Hub mit allen Betriebswegen für Modelle.
XWiki-Inhalte mit KI durchsuchbar machen? Wir prüfen Ihre Installation, binden ein Modell auf eigener Hardware oder einem Managed GPU-Server an und schneiden Collections und Rechte passend zu Ihrem Wiki. Termin vereinbaren
Quellen
- XWiki Extensions, Projekt LLM
- XWiki Extensions, LLM Application
- XWiki Extensions, Index for the LLM Application
- XWiki Extensions, LLM Internal Inference Server
- XWiki Extensions, Token-based authentication for the LLM Application
- XWiki Extensions, LLM Chat WebJar
- GitHub, xwiki-contrib/application-ai-llm
- XWiki Jira, Projekt LLMAI
- XWiki Jira, LLMAI-164: keywordSearch is missing the wiki filter
- XWiki Jira, LLMAI-137: HTTP/2-Upgrade bei LM Studio
- XWiki Jira, XWIKI-21887
- XWiki-Forum, Modelle aus Ollama werden nicht automatisch geladen
- XWiki-Forum, Konfiguration der LLM Application mit Ollama
- XWiki-Forum, Fehler beim Indexieren mit Ollama-Embeddings
- XWiki Design, WAISE-Proposal
- Ollama, OpenAI compatibility
- vLLM, OpenAI-compatible server
- Hugging Face, BAAI/bge-m3
- Hugging Face, intfloat/multilingual-e5-large
- Hugging Face, sentence-transformers/all-MiniLM-L6-v2
KI-Suche für XWiki einrichten
Wir prüfen Ihre XWiki-Installation, binden ein lokales oder europäisches Modell an und richten Collections mit einer Rechteprüfung ein, die zu Ihrer Berechtigungsstruktur passt.
Häufig gestellte Fragen
Antworten auf wichtige Fragen zu diesem Thema
Nein. XWiki Standard enthält keine KI-Funktion. Chat, Schreibhilfe und RAG-Suche kommen über die LLM Application, eine Erweiterung aus dem Projekt xwiki-contrib. Sie ist als BETA gekennzeichnet, steht unter LGPL 2.1 und liegt im September 2026 in Version 0.10 vom 18. September 2026 vor.
Mindestens XWiki 17.4.0. Das README im GitHub-Repository nennt 17.4.0 als kleinste unterstützte Version, und seit Version 0.8 baut die Erweiterung auf der XWiki-Plattform 17.4 auf. Die Angabe 16.2.0 auf der Extension-Seite gilt nur für die Versionen 0.3 bis 0.7.2.
Ja. Die LLM Application spricht jeden Server mit OpenAI-kompatibler API an. Als URL-Präfix wird die Basis-URL mit /v1/ und abschließendem Schrägstrich eingetragen, bei Ollama also zum Beispiel http://ollama.intern:11434/v1/. Chat-Modelle laufen immer auf einem externen Inferenzserver, nicht in XWiki selbst.
Nein, das ist ein verbreiteter Irrtum. Bei der Suche im Index werden die normalen XWiki-Rechte nicht geprüft. Zugriff wird über die Gruppen einer Collection und eine Rechteprüfmethode je Collection gesteuert. Nur die Methode XWiki prüft Seitenrechte, und sie funktioniert nur für Collections, die Wiki-Bereiche direkt indexieren.
Nein. Jedes Modell, das Nutzer im Chat sehen oder das für Embeddings verwendet wird, muss einzeln als Modellkonfiguration angelegt werden, mit Server, Typ, Modell-ID und berechtigten Gruppen. Das ist so gewollt, damit Admins nur freigegebene Modelle anbieten und dasselbe Modell mit unterschiedlichen Collections bereitstellen können.
Ein mehrsprachiges Modell mit 1.024 Dimensionen, etwa BGE-M3 oder multilingual-e5-large. Der Solr-Index der Erweiterung speichert Vektoren mit fester Länge 1.024. Längere Vektoren werden abgeschnitten, kürzere mit Nullen aufgefüllt. Das mitgelieferte Beispielmodell all-MiniLM-L6-v2 ist für englische Texte trainiert.
Nein. Die Dokumentation hält ausdrücklich fest, dass das Modell trotz Kontext Fakten erfinden, Quellen behaupten, die es nicht gibt, oder den Kontext ignorieren kann. RAG verringert dieses Risiko, schließt es aber nicht aus. Antworten müssen deshalb mit Quellenlinks angezeigt und mit Testfragen geprüft werden.
Er stellt Wiki-Inhalte als Werkzeuge für KI-Agenten über das Model Context Protocol bereit, unter /rest/wikis/<wiki>/aiLLM/mcp. Nach der Installation ist der Endpunkt standardmäßig aktiv, Lesewerkzeuge sind eingeschaltet, Schreibwerkzeuge ausgeschaltet. Jeder Zugriff wird gegen die XWiki-Rechte des angemeldeten Nutzers geprüft.
Das ist ein bekannter Fehler in XWiki (XWIKI-21887). Nach Installation, Upgrade oder Deinstallation einer Erweiterung bleibt die Liste der Modelle bis zum nächsten Neustart leer. Abhilfe ist ein Neustart von XWiki nach jeder Änderung an der Erweiterung.
Nicht auf dem XWiki-Server. Chat-Modelle laufen auf einem separaten Inferenzserver, der für lokale Modelle in der Regel eine GPU braucht. Embeddings können optional im XWiki-Prozess auf der CPU berechnet werden, über den LLM Internal Inference Server, der nur Linux auf x86-64 unterstützt.

Geschrieben von
Timo Wevelsiep
Co-Founder & CEO
Co-Founder von WZ-IT. Spezialisiert auf Cloud-Infrastruktur, Open-Source-Plattformen und Managed Services für KMUs und Enterprise-Kunden weltweit.
LinkedInLassen Sie uns über Ihre Idee sprechen
Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.





