Lunary ist ein Observability- und Evaluations-Tool für KI-Anwendungen auf Basis großer Sprachmodelle. Es hilft Teams dabei, das Verhalten ihrer KI in der Produktion zu verstehen, indem zentrale Metriken, Logs und Nutzerverhalten erfasst werden.
LLM- und Chatbot-Observability
Lunary verfolgt Modellanfragen und -antworten, Fehler und Latenzen, damit Entwickler sehen können, wo sich die Qualität im Zeitverlauf verändert und wo Nutzer hängen bleiben.
Protokollierung von Anfragen und Antworten für LLM-Aufrufe
Monitoring von Fehlern und Latenz
Chatbot-fokussierte Dashboards, um Lücken zwischen Nutzerintention und Modellausgabe zu erkennen
Prompt-Management und Experimente
Prompts speichern und versionieren, die Performance vergleichen und A/B-Tests durchführen, um schneller mit Prompt-Texten und Modellkonfigurationen zu iterieren.
Prompt-Bibliothek mit Versionskontrolle
Vergleich der Prompt-Performance
A/B-Tests für Prompts und Konfigurationen
Qualitätsevaluation und Produktanalysen
Automatisierte und manuelle Bewertungen kombinieren, Gespräche labeln und die Qualität nach Szenario analysieren. Produktmetriken helfen dabei, das Verhalten des LLM mit Geschäftsergebnissen zu verbinden.
Workflows für automatisierte und manuelle Reviews
Gesprächs-Labeling und szenariobasierte Analyse
Metriken mit Bezug zu Retention, Conversion und erfolgreichen Sessions

