AgentPantheon
Relari (YC W24) logo

Relari (YC W24)Testēšanas, novērtēšanas un sintētisko datu ģenerācijas platforma AI aģentiem.

4.3 (6)
Daniel NikulshynPārskatījis Daniel Nikulshyn·Atjaunināts 2026. g. jūlijs

Pārskats

Relari ir tiešsaistes platforma, kuras pamatā ir uzlabot AI aģentu patstāvīguma kvalitāti, izmantodams sistematisku testēšanu un novērtēšanu metodes. Tās palīdz komandām sagatavot sintetiskos datu sēklienus, izpildīt automatizētu novērtējumu un novērtēt aģentu darbu kvalitāti uzskatāmu scenāriju daudzumā pirms produkta izplatīšanas. Tuvēji sadarbojoties ar Y Combinator (W24), Relari mērķis ir inženieru komandas, kas veido komplexās LLM (nozīmē to, ka tie ir liela mēroga teicēji) lietišķo aplikāciju un daudzu līmeņu agentu, kurām tradicionālā kvalitātes pārbaude neizdevas pilnīgi. Relari tehnoloģija gaida, lai ieviestu programmētāju metodikas ieguvumi - vienītes testus, reģresiju kontroles un noteiktas mērījamas rādītāju, - neizdevīgās, dažādās atbildes garantijām tiešojāmu izmantošanu AI sistēmās. Platforma atbalsta pielietotu vērtētājus, scenāru simuli, un noteiktas monitorēšanas, tad tai ir liela vērtība, kad tiek izmantoti gan pre-lauza validācija, gan reāla laika kvalitātes nodrošināšana ražošanas agentiem.

Galvenās funkcijas

  • Sintētisku datu kopumu ģenerācija
  • Automātiskā aģentu novērtēšanas konveijeri
  • Scenārija un konversāciju simulācija
  • Personalizējamās novērtēšanas metrikas
  • Regressijas testēšana LLM lietotnēs
  • Efektivitātes benchmarkingu un atskaitēšana

Cenas

Modelis
Free
Kategorija
Observability
Vērtējums
4.3 / 5 (6)

Lietošanas gadījumi

AI aģentu testēšana

Uzticami un testējami aģentu novērtējumi AI aģentiem.

Plusi un mīnusi

Plusi

  • Specializēts, lai novērtētu daudzpakāpju AI aģentus
  • Ģenerē sintētiskos testu datus lielā mērogā
  • Atbalsta personalizētās metrikas un novērtētājus
  • Atbalstīts no Y Combinator ar aktīvu attīstību

Mīnusi

  • Galvenokārt vērsts uz tehniskām komandām, nevis neizstrādātājiem
  • Jaunāka platforma ar mainīgu funkciju kopumu
  • Var būt nepieciešama integrācijas darbība, lai pielāgotu esošām stekām

Atsauksmes

4.3

Vidējais no 6 vērtējumiem.

5
2
4
4
3
0
2
0
1
0

Pieslēdzies, lai atstātu atsauksmi.

F

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

R

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

D

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

C

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Y

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

L

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Jautājumi

Vēl nav jautājumu — uzdod pirmais.

Uzdod jautājumu

Observability alternatīvas