AgentPantheon
Relari (YC W24) logo

Relari (YC W24)Платформа за тестване, оценка и създаване на съответстващи данни за агенти AI.

4.3 (6)
Daniel NikulshynПрегледано от Daniel Nikulshyn·Актуализирано юли 2026 г.

Преглед

Relari е платформата за разработчици, насочена към подобряване на надеждността на AI агенти чрез систематично тестироване и оценка. Тя помага на отборите да създават синтетични набори данни, извършват автоматични оценки и определят перформансите на агента преди изпращането му в производство. С подкрепата на компанията за стартапи Y Combinator (W24), насочва се към инженерски екипи, развиващи сложни приложения с използване на масивни слоеве нейронни мрежи (LLM) и множество стъпки агенти, където традиционната проверка за еrror не е подходяща. Наредбите му целта е да приложи изискванията на софтуерния инженеринг — единични тестове, регресионни проверки и измерими показатели — при системи с аири характеристики, използващи нейронни мрежи. Платформата поддържа custom evaluators, сценарий на симулация и непрекъсната мониторинг, което я прави полезна както за прелооншавна валидация, така и за постоянно сигурно състояние на производствени агенти.

Ключови функции

  • Генерация на съответстващи данни
  • Автоматизирана оценена програмна схема за агенти
  • Симулация и съседство на сцени и разговори
  • Настройваеми оценителни метрици
  • Протест на регресия за приложения на ЛЛМ
  • Изчерпателна извозвестия и отчети за изпълнение
  • Оценяване на изпълнение и предоставяне на отчети

Цени

Модел
Free
Категория
Observability
Оценка
4.3 / 5 (6)

Случаи на употреба

Тестване на агенти AI.

Съществуващи и тестваеми агенти за агенти за AI.

Плюсове и минуси

Плюсове

  • Пусната за целенасочени от тестване на многошагови агенти AI.
  • Генерира съответстващи данни на масов износ.
  • Поддържа настройваеми метрици и оценителни критерии.
  • Подкрепа от Y Combinator с активно разрастване.
  • Препоръчителна за приложенията срещу ЛЛМ

Минуси

  • Основно насочено към технически тимове, а не към непрофесионалисти.
  • Ново платформено решение с развиващ се набор на функции.
  • Възможни да бъде изисквано интегриране за фитинги при съществуващи стъклове

Отзиви

4.3

Средно от 6 оценки.

5
2
4
4
3
0
2
0
1
0

Влез, за да оставиш отзив.

F

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

R

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

D

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

C

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Y

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

L

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Въпроси

Все още няма въпроси — задай първия.

Задай въпрос

Алтернативи на Observability

KeywordsAI logo

KeywordsAI

Observability

Единен платформен интерфейс за разработчиките за създаване, мониторинг и скалане на приложенията на LLM.

5.0 (6)
Free
Guardian logo

Guardian

Observability

Платформа за сигурност и управление за самостоятелни АИ агенти и интелигентни системи.

5.0 (5)
Free
Maxim AI logo

Maxim AI

Observability

Платформа от начало до край за оценяване, мониторинг и усъвършенстване на агенти AI

4.8 (6)
Free
Weave logo

Weave

Observability

Едно кодова платформа за построяване на AI workflow, която позволява компаниите да автоматизират операциите си, интегрирайки множество great language models (LLMs) и свързвайки запитвания без затруднения...

4.8 (5)
Free
llm scout logo

llm scout

Observability

Наблюдавайте как се появява марката ви в рамките на ChatGPT, Claude, Perplexity и Google AI Обзорите.

4.8 (5)
Free
FoundryAI logo

FoundryAI

Observability

Създаване, оценяване и подобряване на АИ агенти за изгодна автоматизация

4.8 (4)
Free
Helicone AI logo

Helicone AI

Observability

Всебирна платформа за наблюдение, отбелязване и усъвършенстване на производствени приложения с LLM.

4.7 (6)
Free
Fiddler AI logo

Fiddler AI

Observability

Платформа за наблюдение и сигурност на AI за monitorirane, обяснения и управление на приложенията на ML и LLM.

4.7 (6)
Free