AgentPantheon
Relari (YC W24) logo

Relari (YC W24)Πλατφόρμα δοκιμών, αξιολόγησης και δημιουργίας συνθετικών δεδομένων για AI agents.

4.3 (6)
Daniel NikulshynΑξιολογήθηκε από Daniel Nikulshyn·Ενημερώθηκε Ιούλιος 2026

Επισκόπηση

Η Relari είναι μια πλατφόρμα για προγραμματιστές που εστιάζει στη βελτίωση της αξιοπιστίας των AI agents μέσω συστηματικού testing και αξιολόγησης. Βοηθά τις ομάδες να δημιουργούν συνθετικά σύνολα δεδομένων, να εκτελούν αυτοματοποιημένες αξιολογήσεις και να benchmark την απόδοση των agents σε ρεαλιστικά σενάρια πριν τα μεταφέρουν στην παραγωγή. Υποστηριζόμενο από το Y Combinator (W24), το Relari στοχεύει σε ομάδες μηχανικών που δημιουργούν σύνθετες εφαρμογές LLM και πολυβηματικούς πράκτορες, όπου η παραδοσιακή QA αποτυγχάνει. Το εργαλείο του αποσκοπεί να φέρει την αυστηρότητα της μηχανικής λογισμικού — unit tests, regression checks και μετρήσιμα metrics — στα μη‑ντετερμινιστικά συστήματα AI. Η πλατφόρμα υποστηρίζει προσαρμοσμένους αξιολογητές, προσομοίωση σεναρίων και συνεχή παρακολούθηση, καθιστώντας την χρήσιμη τόσο για την επαλήθευση πριν την κυκλοφορία όσο και για τη συνεχή διασφάλιση ποιότητας των παραγωγικών πρακτόρων.

Βασικές λειτουργίες

  • Δημιουργία συνθετικών συνόλων δεδομένων
  • Αυτοματοποιημένες ροές αξιολόγησης πρακτόρων
  • Προσομοίωση σεναρίων και συζητήσεων
  • Προσαρμόσιμες μετρικές αξιολόγησης
  • Δοκιμές παλινδρόμησης για εφαρμογές LLM
  • Βαθμονόμηση απόδοσης και αναφορά

Τιμές

Μοντέλο
Free
Κατηγορία
Observability
Βαθμολογία
4.3 / 5 (6)

Περιπτώσεις χρήσης

Δοκιμή AI agents

Αξιόπιστη και δοκιμαστέα αξιολόγηση πρακτόρων για AI agents.

Υπέρ και κατά

Υπέρ

  • Σχεδιασμένο ειδικά για αξιολόγηση πολυ-βηματικών AI agents
  • Δημιουργεί συνθετικά δεδομένα δοκιμών σε κλίμακα
  • Υποστηρίζει προσαρμοσμένες μετρικές και αξιολογητές
  • Υποστηρίζεται από το Y Combinator με ενεργή ανάπτυξη

Κατά

  • Κυρίως στοχεύει σε τεχνικές ομάδες, όχι σε μη προγραμματιστές
  • Νέα πλατφόρμα με εξελισσόμενο σύνολο λειτουργιών
  • Μπορεί να απαιτήσει εργασίες ενσωμάτωσης για προσαρμογή σε υπάρχουσες υποδομές

Κριτικές

4.3

Μέσος όρος από 6 βαθμολογίες.

5
2
4
4
3
0
2
0
1
0

Σύνδεση για κριτική.

F

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

R

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

D

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

C

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Y

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

L

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Ερωτήσεις

Καμία ερώτηση — κάνε την πρώτη.

Κάνε μια ερώτηση

Εναλλακτικές για Observability

KeywordsAI logo

KeywordsAI

Observability

Πολιπλατφόρμα προγραμματιστών για την κατασκευή, παρακολούθηση και κλιμάκωση εφαρμογών LLM.

5.0 (6)
Free
Guardian logo

Guardian

Observability

Πλατφόρμα ασφάλειας και διακυβέρνησης για αυτόνομους AI πράκτορες και έξυπνα συστήματα.

5.0 (5)
Free
Maxim AI logo

Maxim AI

Observability

Πλατφόρμα end-to-end για την αξιολόγηση, παρακολούθηση και βελτίωση AI agents

4.8 (6)
Free
Weave logo

Weave

Observability

Ένας δημιουργός ροών εργασίας AI χωρίς κώδικα που επιτρέπει στις επιχειρήσεις να αυτοματοποιούν τις λειτουργίες τους ενσωματώνοντας πολλαπλά μεγάλα μοντέλα γλώσσας (LLMs) και συνδέοντας προτροπές...

4.8 (5)
Free
llm scout logo

llm scout

Observability

Παρακολουθήστε πώς η μάρκα σας εμφανίζεται σε ChatGPT, Claude, Perplexity και τις Επισκοπήσεις Google AI.

4.8 (5)
Free
FoundryAI logo

FoundryAI

Observability

Δημιουργήστε, αξιολογήστε και βελτιώστε AI πράκτορες για επιχειρησιακό αυτοματισμό

4.8 (4)
Free
Helicone AI logo

Helicone AI

Observability

Πλατφόρμα παρατηρησιμότητας όλα-ενός για την παρακολούθηση, αποσφαλμάτωση και βελτίωση παραγωγικών εφαρμογών LLM.

4.7 (6)
Free
Fiddler AI logo

Fiddler AI

Observability

Πλατφόρμα AI παρατηρησιμότητας και ασφάλειας για παρακολούθηση, εξήγηση και διακυβέρνηση εφαρμογών ML και LLM.

4.7 (6)
Free