Deutschland → weltweit
WZ-IT Logo

Was ist Langfuse? Observability für LLM-Anwendungen

Timo WevelsiepTimo WevelsiepAktualisiert: 23.07.2026

Hinweis zum Inhalt: Versionen, Befehle und Preise können sich ändern. Bitte prüfen Sie kritische Schritte vor dem produktiven Einsatz eigenständig. Dieser Leitfaden ersetzt keine individuelle Beratung.

KI-Betrieb nachvollziehbar und auditierbar aufsetzen lassen? WZ-IT baut und betreibt den Open-Source-LLM-Stack inklusive Observability - jede Anfrage nachvollziehbar, DSGVO-konform und aus einer Hand. LLM-Hosting ansehen

Ein Sprachmodell im Produktivbetrieb ist ohne Observability eine Blackbox: Man sieht, dass es antwortet, aber nicht, warum es so antwortet - und kann es nicht belegen. Langfuse schließt diese Lücke. Dieser Artikel erklärt, was Langfuse leistet, warum Nachvollziehbarkeit gerade unter dem EU AI Act zählt und wo Langfuse im Open-Source-LLM-Stack sitzt. Stand Juli 2026.

Inhaltsverzeichnis

Das Problem: KI ohne Nachvollziehbarkeit

Eine KI-Anwendung besteht aus mehr als einem Modellaufruf: Eine Anfrage durchläuft Retrieval aus Dokumenten, das Zusammensetzen des Kontexts, den eigentlichen LLM-Aufruf und oft mehrere Schritte hintereinander. Wenn eine Antwort falsch, teuer oder unerwartet ist, muss man diese Kette nachvollziehen können - sonst bleibt jede Verbesserung Raten.

Im Unternehmen kommt eine zweite Anforderung hinzu: Nachweisbarkeit. Wer entscheidet, ein KI-System einzusetzen, muss belegen können, was es auf welche Eingabe hin getan hat. Beides - Fehlersuche und Nachweis - verlangt eine Aufzeichnung, die es bei reiner Modell-Inferenz nicht gibt.

Was Langfuse macht

Langfuse ist eine quelloffene Plattform für das Engineering und die Observability von LLM-Anwendungen - offen, selbst hostbar und erweiterbar. Sie zeichnet auf, was durch eine KI-Anwendung läuft, und macht es sicht- und auswertbar.

Zwei Eigenschaften sind für den souveränen Betrieb entscheidend: Langfuse ist selbst hostbar (für Produktion wird ein Kubernetes/Helm-Deployment empfohlen), sodass die aufgezeichneten Anfragen auf eigener Infrastruktur bleiben. Und es basiert auf OpenTelemetry, was die Kompatibilität erhöht und Anbieter-Bindung vermeidet - mit über 100 Integrationen, darunter das OpenAI SDK, LangChain, LlamaIndex und LiteLLM.

Tracing, Evaluation und Prompt-Management

Langfuse deckt drei Kernaufgaben ab:

  • Tracing/Observability - jede Anfrage wird als Trace aufgezeichnet, inklusive LLM-Aufrufen, Retrieval und Embeddings, über mehrstufige Abläufe und Konversationen hinweg. Das ist die Datengrundlage für alles Weitere.
  • Evaluation - die Qualität der Antworten lässt sich systematisch bewerten, etwa per LLM-as-a-judge, mit Datensätzen, Experimenten und eigenen Bewertungen.
  • Prompt-Management - Prompts werden versioniert, getestet (über einen Playground) und optimiert, statt sie fest im Code zu vergraben.

Ergänzt wird das durch Metrik-Dashboards und Auswertungen. Aus „das Modell antwortet irgendwie" wird so ein steuerbarer, messbarer Dienst.

Langfuse und der EU AI Act

Der EU AI Act verlangt für bestimmte KI-Systeme Protokollierung und Nachvollziehbarkeit. Genau diese technische Grundlage liefert Langfuse: Jede Interaktion wird als Trace erfasst und lässt sich auswerten, sodass sich Audit-Logs und Nachweise darauf aufbauen lassen.

Langfuse ersetzt keine juristische Bewertung, ob und wie der EU AI Act auf ein konkretes System zutrifft. Aber es liefert die belastbare Datenspur, ohne die solche Anforderungen praktisch kaum erfüllbar sind - ein wichtiger Baustein, wenn KI nicht nur laufen, sondern auch verantwortet werden soll.

Langfuse im Stack

Im Open-Source-LLM-Stack ist Langfuse die Observability-Schicht. Sie liegt quer zu den anderen Komponenten: Das Gateway LiteLLM lässt sich direkt an Langfuse anbinden, sodass jede über das Gateway laufende Anfrage automatisch als Trace erfasst wird - egal, ob dahinter eine vLLM-Inferenz oder ein anderes Modell arbeitet. So entsteht aus einem laufenden Modell ein nachvollziehbarer, auditierbarer Dienst - die Voraussetzung für verantworteten KI-Betrieb im Unternehmen.

Lieber betreiben lassen?

Sie möchten Lokale & Souveräne KI nicht selbst betreiben? WZ-IT übernimmt Einrichtung, Betrieb und Wartung - DSGVO-konform aus Deutschland.

Häufig gestellte Fragen

Antworten auf die wichtigsten Fragen

Langfuse ist eine quelloffene Plattform für das Engineering und die Observability von LLM-Anwendungen. Sie zeichnet jede Anfrage als nachvollziehbaren Trace auf, bietet Evaluation und Prompt-Verwaltung und lässt sich vollständig selbst hosten. Langfuse basiert auf OpenTelemetry und integriert sich mit gängigen Werkzeugen wie dem OpenAI SDK, LangChain, LlamaIndex und LiteLLM.

Sobald KI produktiv läuft, muss nachvollziehbar sein, was das Modell auf welche Eingabe hin geantwortet hat - für die Fehlersuche, die Qualitätssicherung und den Nachweis gegenüber Prüfern. Ohne Observability ist ein LLM eine Blackbox. Langfuse macht Anfragen, Kontext und Antworten sichtbar und auswertbar.

Ja. Langfuse ist Open Source und ausdrücklich selbst hostbar - für den produktiven Betrieb wird ein Deployment per Kubernetes/Helm empfohlen, kleinere Installationen laufen per Docker. Damit bleiben die aufgezeichneten Anfragen und Prompts auf eigener Infrastruktur, passend zu einem souveränen KI-Betrieb.

Ja, indirekt. Der EU AI Act verlangt für bestimmte KI-Systeme Protokollierung und Nachvollziehbarkeit. Langfuse zeichnet jede Interaktion als Trace auf und schafft damit die technische Grundlage für Audit-Logs und Nachweise. Es ersetzt keine Rechtsberatung, liefert aber die belastbare Datenspur, die solche Anforderungen praktisch erfüllbar macht.

LiteLLM ist das Gateway, das den Zugriff auf Modelle steuert. Langfuse ist die Observability-Schicht, die aufzeichnet und auswertet, was durch das System läuft. Beide ergänzen sich: LiteLLM lässt sich direkt an Langfuse anbinden, sodass jede über das Gateway laufende Anfrage automatisch als Trace erfasst wird.

Langfuse bietet Tracing für LLM-Aufrufe, Retrieval und Embeddings, dazu Evaluation (etwa LLM-as-a-judge, Datensätze und Experimente), Prompt-Management mit Versionierung und einem Playground sowie Metrik-Dashboards. Damit lassen sich Qualität, Kosten und Verhalten einer KI-Anwendung systematisch verbessern statt zu raten.

Kontakt

Lassen Sie uns über Ihre Idee sprechen

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

E-Mail
[email protected]

Führende Unternehmen vertrauen WZ-IT

  • ml&s
  • Rekorder
  • Keymate
  • Führerscheinmacher
  • SolidProof
  • ARGE
  • Boese VA
  • nextGYM
  • Maho Management
  • Golem.de
  • Millenium
  • Paritel
  • Yonju
  • EVADXB
  • Mr. Clipart
  • Aphy AG
  • Negosh
  • ABCO Water Systems
Timo Wevelsiep & Robin Zins - CEOs of WZ-IT

Timo Wevelsiep & Robin Zins

Geschäftsführer

1/3 - Themenauswahl33%

Worum geht es bei Ihrer Anfrage?

Wählen Sie einen oder mehrere Bereiche, bei denen wir Sie unterstützen dürfen.