AgentPantheon
Relari (YC W24) logo

Relari (YC W24)Plattform für Testing, Bewertung und generierte synthetische Daten für KI-Agenten.

4.3 (6)
Daniel NikulshynGeprüft von Daniel Nikulshyn·Aktualisiert Juli 2026

Übersicht

Relari ist eine Entwicklerplattform, die sich auf die Verbesserung der Zuverlässigkeit von KI-Agenten durch systematische Tests und Evaluierung konzentriert. Sie hilft Teams dabei, synthetische Datensätze zu erstellen, automatisierte Evaluierungen durchzuführen und die Leistung von Agenten in realistischen Szenarien zu bewerten, bevor sie in die Produktion gehen. Gestützt auf Y Combinator (W24) richtet sich Relari an Engineering-Teams, die komplexe LLM-Anwendungen und mehrstufige Agenten entwickeln, bei denen traditionelle QA- Methoden nicht ausreichen. Das Tooling zielt darauf ab, die Sorgfalt der Softwareentwicklung - Unit-Tests, Regressionstests und messbare Metriken - auf nicht-deterministische KI-Systeme zu übertragen. Die Plattform unterstützt benutzerdefinierte Evaluatoren, Szenariosimulationen und kontinuierliche Überwachung, was sie sowohl für die Validierung vor dem Launch als auch für die laufende Qualitätssicherung von Produktionsagenten nützlich macht.

Hauptfunktionen

  • Synthetische Datenbankerzeugung
  • Automatisierte Agentenevaluierungspipeline
  • Szenario- und Gesprächssimulation
  • Konfigurierbare Bewertungsmetriken
  • Regressionstest für LLM-Anwendungen
  • Leistungsbewertung und -berichterstattung

Preise

Modell
Free
Kategorie
Observability
Bewertung
4.3 / 5 (6)

Anwendungsfälle

Testen von KI-Agenten

Verlässliche und testbare Benutzer von KI-Agenten.

Pro & Contra

Pro

  • Zur Entwicklung zugeschnitten für die Bewertung von Multi-Stell-AI-Agenten
  • Generiert synthetisches Testdaten auf großen Maßstab
  • Unterstützt benutzerdefinierte Metriken und Evaluator
  • Gebannt von Y Combinator mit aktiver Entwicklung
  • Fördert die Verwendung von Software-Engineering-Schriften, wie Einheitstests, Regressionsprüfungen und messbaren Metriken

Contra

  • Zurückhaltend für technische Teams, nicht für Nicht-Entwickler
  • Neue Plattform mit einem sich ständig verändernden Funktionsumfang
  • Bekannt mit Integration arbeiten, die bestehende Stacks passt

Bewertungen

4.3

Durchschnitt aus 6 Bewertungen.

5
2
4
4
3
0
2
0
1
0

Melde dich an, um eine Bewertung abzugeben.

F

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

R

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

D

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

C

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Y

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

L

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Fragen & Antworten

Noch keine Fragen — sei die/der Erste!

Frage stellen

Alternativen zu Observability