#Evaluation
17 tools tagged “Evaluation”
Athina AI
Kollaborative AI-Entwicklungsplattform zum Erstellen, Testen und Überwachen von AI-Features.
FoundryAI
Baue, bewerte und verbessere AI-Agenten für Geschäftsautomatisierung
Log10
Skalieren Sie die Expertenbewertung von LLMs mit automatisierter Echtzeit-Fehlererkennung.
Langfuse
Eine Open-Source-Plattform für LLM-Engineering, die Observability, Metriken, Evaluierungen und Prompt‑Management bietet, um große Sprachmodell-Apps zu debuggen und zu verbessern.
Latitude
Erstellen Sie produktionsreife KI-Agenten aus einer einzigen Prompt mit integrierten Evaluierungen und Beobachtbarkeit.
Quotient AI
Echtzeit-Überwachungs- und Bewertungsplattform zum Erkennen von KI-Ausfällen in Search, RAG und Agenten.
Vijil
Plattform zur Erstellung, Bewertung und Durchführung zuverlässiger AI-Agenten mit Randsicherungen für Zuverlässigkeit und Sicherheit
LangSmith
Plattform für Beobachtbarkeit, Bewertung und Fehlerbehebung für Anwendungen mit LLM aus der LangChain-Team
Keywords AI
Observability‑ und Debugging‑Plattform für die schnellere Bereitstellung zuverlässiger, LLM‑gestützter Anwendungen.
Coval
Plattform für die Simulation und Bewertung von AI-Stimmen- und Chatagenten auf massenspezifische Weise
Phonic Voice AI
End-to-End Voice AI-Plattform zum Erstellen, Beobachten und Bewerten zuverlässiger konversationeller Sprachagenten.
KeywordsAI
Einheitliche Entwicklerplattform zum Erstellen, Überwachen und Skalieren von LLM-Anwendungen.
Phoenix
Open-Source-Observability- und Evaluierungsplattform für das Tracing und die Verbesserung von KI-Anwendungen.
QualiaInterviews
Mit-AI-leitete Plattform für multinationale, konversationsbasierte Forschungs- und Evaluierungsinterviews in Skalenebene.
Mosaic AI Agent Framework
Eine Suite von Tools von Databricks zum Erstellen, Bereitstellen und Bewerten hochwertiger AI-Agenten und RAG-Anwendungen.
Humanloop
Enterprise LLM Evaluation und Prompt‑Management‑Plattform für die Bereitstellung zuverlässiger KI‑Funktionen.
LangWatch
LLM-Optimierungsstudio für die Überwachung, Bewertung und Verbesserung von KI-Anwendungen in der Produktion.















