AgentPantheon
Relari (YC W24) logo

Relari (YC W24)Plataforma para pruebas, evaluación y generación de datos sintéticos para agente de inteligencia artificial.

4.3 (6)
Daniel NikulshynReseñado por Daniel Nikulshyn·Actualizado julio de 2026

Resumen

Relari es una plataforma para desarrolladores centrada en mejorar la fiabilidad de los agentes de IA mediante pruebas y evaluaciones sistemáticas. Ayuda a los equipos a generar conjuntos de datos sintéticos, ejecutar evaluaciones automatizadas y comparar el rendimiento de los agentes en escenarios realistas antes de implementarlos en producción. Respaldado por Y Combinator (W24), Relari se enfoca en equipos de ingeniería que construyen aplicaciones LLM complejas y agentes de varios pasos donde la QA tradicional se queda corta. Sus herramientas buscan aportar el rigor de la ingeniería de software — pruebas unitarias, comprobaciones de regresión y métricas medibles— a sistemas de IA no deterministas. La plataforma admite evaluadores personalizados, simulación de escenarios y monitoreo continuo, lo que la hace útil tanto para la validación previa al lanzamiento como para el aseguramiento continuo de la calidad de los agentes de producción.

Funciones clave

  • Generación de conjuntos de datos sintéticos
  • Pipelines de evaluación de agentes automatizados
  • Simulación de escenarios y conversaciones
  • Métricas de evaluación personalizables
  • Pruebas de regresión para aplicaciones de LLM
  • Benchmarking y informes de rendimiento

Precio

Modelo
Free
Categoría
Observability
Valoración
4.3 / 5 (6)

Casos de uso

Pruebas de agentes de inteligencia artificial

Evaluación fiable y probada de agente de inteligencia artificial.

Pros y contras

Ventajas

  • Diseñada específicamente para evaluar agentes AI de varios pasos
  • Genera datos de prueba sintéticos a gran escala
  • Apoya métricas y evaluadores personalizados
  • Backed por Y Combinator con desarrollo activo

Contras

  • Principalmente enfocada en equipos técnicos, no en no desarrolladores
  • Plataforma más joven con un conjunto de características en evolución
  • Puede requerir trabajo de integración para adaptarse a las estanterías existentes

Reseñas

4.3

Promedio de 6 valoraciones.

5
2
4
4
3
0
2
0
1
0

Inicia sesión para dejar una reseña.

F

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

R

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

D

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

C

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Y

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

L

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Preguntas y respuestas

Aún no hay preguntas — sé el primero en preguntar.

Hacer una pregunta

Alternativas a Observability