AgentPantheon
Relari (YC W24) logo

Relari (YC W24)Testing, evaluering og syntetisk datagenereringsplattform for AI-agenter.

4.3 (6)
Daniel NikulshynAnmeldt av Daniel Nikulshyn·Oppdatert juli 2026

Oversikt

Relari er en utviklerplattform som fokuserer på å forbedre påliteligheten til AI-agenter gjennom systematisk testing og evaluering. Den hjelper team med å generere syntetiske datasett, kjøre automatiserte evalueringer og benchmarke agentens ytelse på realistiske scenarier før de rulles ut til produksjon. Støttet av Y Combinator (W24), retter Relari seg mot ingeniørteam som bygger komplekse LLM‑applikasjoner og multi‑step‑agenter der tradisjonell QA ikke er tilstrekkelig. Verktøyet har som mål å bringe programvareingeniørens disiplin—enhetstester, regresjonstester og målbare metrikker—til ikke‑deterministiske AI‑systemer. Plattformen støtter tilpassede evaluatører, scenario-simulering og kontinuerlig overvåking, noe som gjør den nyttig både for validering før lansering og for løpende kvalitetssikring av produksjonsagenter.

Nøkkelfunksjoner

  • Generering av syntetiske datasett
  • Automatiserte evalueringspipelines for agenter
  • Simulering av scenarier og samtaler
  • Tilpassbare evalueringsmetrikker
  • Regresjonstesting for LLM-apper
  • Ytelsestesting og rapportering

Priser

Modell
Free
Vurdering
4.3 / 5 (6)

Brukstilfeller

Testing av AI-agenter

Pålitelig og testbar evaluering av AI-agenter.

Fordeler og ulemper

Fordeler

  • Skreddersydd for evaluering av flerstegs AI-agenter
  • Genererer syntetiske testdata i stor skala
  • Støtter tilpassede metrikker og evaluators
  • Støttet av Y Combinator med aktiv utvikling

Ulemper

  • Primært rettet mot tekniske team, ikke ikke-utviklere
  • Nyere plattform med stadig utviklende funksjonssett
  • Kan kreve integrasjonsarbeid for å passe inn i eksisterende stacks

Anmeldelser

4.3

Gjennomsnitt fra 6 vurderinger.

5
2
4
4
3
0
2
0
1
0

Logg inn for å legge igjen en anmeldelse.

F

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

R

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

D

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

C

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Y

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

L

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Spørsmål

Ingen spørsmål ennå — still det første.

Still et spørsmål

Alternativer til Observability