AgentPantheon
Relari (YC W24) logo

Relari (YC W24)Testavimas, įvertinimas ir sintetinio duomenų generavimas platforma už AI agentus.

4.3 (6)
Daniel NikulshynApžvelgė Daniel Nikulshyn·Atnaujinta 2026 m. liepa

Apžvalga

Relari yra toliau tyrimų ir įvertinimų pagrindinės funkcijos turinčios developerio platforma, skirta pagerinti AI agentų ištikimumą. Komanda pagalbos gali sukurti sintetinius duomenis, automatizuotus įvertinimus ir tikrinti agentų atlikimą iš tikrųjų scenarijų bei priklausančius rezultatus prieš siūlymą į gamybą. Pagaminta Y Combinator (W24) parama, Relari siekia technologų mėgėjus, kurie įrengia kompleksius LLM taikiklius ir įvairaus lygio agentus kurie tradicinėje QA metuose yra nepakankamai patikrinti. Šio įrankio tikslas yra įtraukti į software-engineering rigorą - vienetinius testus, regresinius kontrolierius ir matomus matavimo rodiklius netiesioginiam AI sistemoms. Plataforma priimsi specializuoti evaluatoriai, scenarijų simuliacija ir tęstinė monitorė, kad ji būtu naudinga ne tik atitikimo priimimu, bet ir nuolatiniam pagaminių agentų kokybės tikrinimui.

Pagrindinės funkcijos

  • Sintetiniai duomenų sąrašai generavimas
  • Automatizuoti agentų įvertinimo srautai
  • Skriptos ir pokalbių simuliacija
  • Šildimų įvertinimo metrikai sąranka
  • Reagraviniai testsai už LLM programėlių
  • Atlikimų ir ataskaitų našumą matavimas

Kainos

Modelis
Free
Kategorija
Observability
Įvertinimas
4.3 / 5 (6)

Naudojimo atvejai

Testavimas už AŽ agentus

Relabilūs ir testuojami AŽ agentų įvertinimas už AŽ agentus.

Privalumai ir trūkumai

Privalumai

  • Specialiai įrengta už vertinant tikslias žingsnius AŽ agentų
  • Generuoja sintetinius testavimo duomenis masiškuose matmenims
  • Palaiko atsargines išmatavimus ir įvertinėjus
  • Įgija Y Combinator sujungta su aktive rengiasi
  • Žingsniai

Trūkumai

  • Primariškai skirta technikų komandoms, ne neigūdamiems vartotojams
  • Nauja platforma su kylančiuose funkcionalumo turiniuose
  • Matės su užrakinimo darbu integravosi tikslais esančioms sistemoms

Atsiliepimai

4.3

Vidurkis iš 6 įvertinimų.

5
2
4
4
3
0
2
0
1
0

Prisijunk, kad paliktum atsiliepimą.

F

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

R

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

D

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

C

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Y

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

L

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Klausimai

Klausimų nėra — užduok pirmas.

Užduoti klausimą

Observability alternatyvos