AgentPantheon
Relari (YC W24) logo

Relari (YC W24)Platformă de testare, evaluare și generare de date sintetice pentru agenți AI

4.3 (6)
Daniel NikulshynRecenzat de Daniel Nikulshyn·Actualizat iulie 2026

Prezentare

Relari este o platformă de dezvoltare pentru dezvoltatori care se concentrează asupra îmbunătățirii fiabilității agenților AI prin testare și evaluare sistematice. Ei ajut echipa să genereze seturi de date sintetice, să desfășoare evaluări automate și să compare performanța agenților în scenarii realiste anterior de a lansa produsele în producție. Relăsat de către Y Combinator (W24), Relari este adresat echipei de ingineri care construiesc aplicații complexe cu LLM și agenți de mai multe pași, unde verificarea tradițională nu reușește. Setul de instrumente al aplicației urmărește să introducă rigorul ingineriei software—testele unitare, verificările de regres, și criteriile măsurabile—în sistemele AI ne-deterministe. Platforma oferă evaluatori personalizați, simulări de scenariu și monitorizare continuă, ceea ce o face utilă atât pentru validarea înainte de lansare, cât și pentru asigurarea calității a unor agenți de producție în timp real.

Funcții cheie

  • Generarea de seturi de date sintetice
  • Pipelines de evaluare automate pentru agenți
  • Simularea de scenarii și conversații
  • Metrici de evaluare personalizabile
  • Testare de regresie pentru aplicații LLM
  • Evaluarea performanței și raportare

Prețuri

Model
Free
Categorie
Observability
Evaluare
4.3 / 5 (6)

Cazuri de utilizare

Testarea agenților AI

Evaluarea agenților fiabili și testabili pentru agenți AI.

Pro și contra

Pro

  • Conceput special pentru evaluarea agenților AI multi-pași
  • Generează date de testare sintetice la scară
  • Suportă metrici și evaluatori personalizați
  • Sprijinit de Y Combinator cu dezvoltare activă

Contra

  • Orientat în principal către echipele tehnice, nu către non-dezvoltatori
  • Platformă mai nouă cu un set de caracteristici în evoluție
  • Poate necesita lucrări de integrare pentru a se potrivi cu stivele existente

Recenzii

4.3

Medie din 6 evaluări.

5
2
4
4
3
0
2
0
1
0

Conectează-te pentru a lăsa o recenzie.

F

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

R

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

D

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

C

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Y

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

L

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Întrebări

Nu există întrebări încă — fii primul.

Pune o întrebare

Alternative la Observability