AgentPantheon
Relari (YC W24) logo

Relari (YC W24)Plataforma de teste, avaliação e geração de dados sintéticos para agentes de IA.

4.3 (6)
Daniel NikulshynAvaliado por Daniel Nikulshyn·Atualizado julho de 2026

Visão geral

Relari é uma plataforma de desenvolvedor focada em melhorar a confiabilidade de agentes de IA por meio de testes e avaliações sistemáticos. Ajuda equipes a gerar conjuntos de dados sintéticos, executar avaliações automatizadas e avaliar o desempenho do agente em cenários realistas antes de serem enviados à produção. Apoiado pelo Y Combinator (W24), o Relari visa equipes de engenharia que constroem aplicações complexas de LLM e agentes multi-etapa onde o QA tradicional é insuficiente. Suas ferramentas visam trazer rigor de engenharia de software - testes unitários, verificações de regressão e métricas mensuráveis - para sistemas de IA não determinísticos. A plataforma suporta avaliadores personalizados, simulação de cenários e monitoramento contínuo, tornando-a útil tanto para validação pré-lançamento quanto para garantia de qualidade contínua de agentes de produção.

Funcionalidades principais

  • Geração de conjunto de dados sintéticos
  • Pipelines de avaliação de agente automatizados
  • Simulação de cenários e conversas
  • Métricas de avaliação personalizáveis
  • Testes de regressão para aplicativos LLM
  • Benchmarking e relatórios de desempenho

Preços

Modelo
Free
Categoria
Observability
Avaliação
4.3 / 5 (6)

Casos de uso

Testando agentes de IA

Avaliação de agentes confiáveis e testáveis para agentes de IA.

Prós e contras

Prós

  • Desenvolvido especificamente para avaliar agentes de IA multi-etapa
  • Gera dados de teste sintéticos em escala
  • Suporta métricas e avaliadores personalizados
  • Apoiado pelo Y Combinator com desenvolvimento ativo

Contras

  • Principalmente direcionado a equipes técnicas, não desenvolvedores
  • Plataforma mais recente com um conjunto de recursos em evolução
  • Pode exigir trabalho de integração para se adequar a pilhas existentes

Avaliações

4.3

Média de 6 avaliações.

5
2
4
4
3
0
2
0
1
0

Entra para deixar uma avaliação.

F

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

R

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

D

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

C

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Y

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

L

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Perguntas e respostas

Ainda sem perguntas — sê o primeiro a perguntar.

Faz uma pergunta

Alternativas a Observability