AgentPantheon
Relari (YC W24) logo

Relari (YC W24)Todennäköisyyksien testaus, arviointi sekä tietynäytteen generaatioalusta AI-agentitien parissa.

4.3 (6)
Daniel NikulshynArvostellut Daniel Nikulshyn·Päivitetty heinäkuu 2026

Yleiskatsaus

Relari on kehittäjille suunnattu alusta, joka pyrkii parantamaan AI-agenttien uskottavuutta systemaattisilla testaamislla ja arvioinnilla. Se auttaa ryhmiä lisiittämään synoteettisia tietolähdeviipereitä, ajaa automaatisia arvioituksia ja arvioi agentin suorituskykyä realistisissa tilanteissa ennen kuin agentti lähetetään tuotantoon. Relari on yhtiö, jonka taustaa on Y Combinator (W24). Sen tavoitteena ovat insinööriteemat, jotka kehittävät monimutkaisia LLM-sovelluksia ja monivaiheisia agentteja, joissa perinteinen testaus ei ole riittävä. Sen työkalut ovat tarkoitettu toistamaan ohjelmistokehittäjien tarkat käytännöt, ja sen ansiosta LLM-malleihin ja ei-deterministisiin järjestelmiin tulee yhä mittauksellisempaa mittaustoimia—kuten yksikkötestejä ja regressiotesttej—samalla kun saadaan käyttöön mittaamattomia mitta-asiakkaita. Sovellus tukee persoonallisia arviointijohtimia, kohdekäyttäytymisen simulatorointia sekä jatkuvaa valvontaa, mikä tekee siitä hyödyllistä sekä lähelle loppua kohdistuvien todennäköisyyksien ja laadun tarkastuksessa että on ajoitusjärjestelmien jatkuvaa laatuvarmenpidettä tukevassa käyttöönotossa.

Pääominaisuudet

  • Synthetinen datasetin generaatio
  • Automatisoitu agenttien arviointiin liittyvä ketterät ketjut
  • Skenaariokeskundet ja keskusteltavuuden simulointi
  • Muokattavissa olevia arviointimetodeja
  • Jälkikäteen testaus LLM-sovelluksille
  • Suorituskykykokeet ja raportointi

Hinnat

Malli
Free
Kategoria
Observability
Arvio
4.3 / 5 (6)

Käyttötapaukset

Testaus AI-agenttien

Luotettava ja testattava arviointi AI-agenttien toteuttamiselle.

Plussat ja miinukset

Plussat

  • Omaa tarkoitusta varten kehitetty muutospaineisten AI-agentien arviointiin
  • Synthetistä testitietoa skaalataan
  • Tukee mukautettuja metriikkejä ja arviointilaitteita
  • Taustalla Y Combinatorin kanssa aktiivinen kehitys

Miinukset

  • Pääosin tähtää ketteränä käytössä oleville tekniseen tiimiin, ei kehystelemisistä
  • Uusi alusta kehityksessä olevan ominaisuuden määrällä
  • Osaaminen vaaditaan välttääkseen integraatio työtä varten vanhat räätälistä

Arvostelut

4.3

Keskiarvo 6 arviosta.

5
2
4
4
3
0
2
0
1
0

Kirjaudu sisään jättääksesi arvostelun.

F

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

R

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

D

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

C

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Y

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

L

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Kysymykset

Ei kysymyksiä — kysy ensimmäinen.

Kysy kysymys

Observability vaihtoehdot