#Evaluation
17 tools tagged “Evaluation”
Athina AI
Geliştirilmek için, test edilmek için ve izlenmek için AI özelliklerini inşa etmek için birlikte çalışma AI geliştirme platformu.
FoundryAI
İşlem otomasyonu için AI ajansı inşa, değerlendir ve iyileştir
Log10
Uzman LLM değerlendirmelerini otomasyonla gerçek zamanlı hata algılamasıyla ölçeklendirin.
Langfuse
Açık kaynaklı LLM mühendisliği platformu olarak, gözlemlenilebilirlik, metrikler,评価 ve komut yönetimi sunmaktadır. Model doğrulama ve büyük dil modeli uygulamalarının güncellenme ve hata ayıklama için performans izlenmesi, model kalitesini ve doğruluğunu değerlendirmek için test ve değerlendirmeler, model çıktı için optimizasyon ve kenar değerleri için komut yönetimi sunuyor.
Latitude
Üretim için AI agentlerinden bir tek ipucu ile varsayılan değerlendirmeler ve gözlemleme ile oluşturun.
Quotient AI
Hızlı zaman diliminde izleme ve değerlendirme platformu, arama, RAG ve agentler için AI hatalarını yakalamak için
Vijil
Güvenilir ve güvenli kilitli AI ajansının yapılandırılması, değerlendirilmesi ve işletilmesi platformu.
LangSmith
LLM uygulamaları için observasyon, değerlendirmeye ve hata ayıklama platformu LangChain ekibi tarafından
Keywords AI
Güvenilir LLM tabanlı uygulamaları daha hızlı dağıtmak içinobservasyon ve hata ayıklamadan oluşan bir platförm.
Coval
Büyük ölçekli AI ses ve sohbet agALARININ test edilmeyeceği simulation ve değerlendirme platformu
Phonic Voice AI
End-to-end ses AI platformu, güvenilir sohbetçi ses agentleri oluşturmak, gözden geçirmek ve değerlendirmek için.
KeywordsAI
Geliştirici platformu için bir araya gelen LLM uygulamalarını inşa etmek, izlemek ve ölçeklendirmek.
Phoenix
Açık kaynaklı izleme ve değerlendirme platformu, LLM uygulamalarını izleme ve geliştirmek için.
QualiaInterviews
Çeviri diliyle, ölçeklenebilir araştırmalar ve değerlendirmeler için konuşma interviewleri yürüten AI-led platform.
Mosaic AI Agent Framework
Databricks'ın yüksek kaliteli AI ajansları ve RAG uygulamaları yapmak için oluşturma, dağıtma ve değerlendirmek için bir set araçlar.
Humanloop
Sanal zekânın güvenilir özelliklerini teslim etmek için kurumsal LLM değerlendirmesi ve emir yönetimi platformu.
LangWatch
LLM'nin optimize edilebilirliğinin, üretim ortamlarındaki AI uygulamalarının takibini, değerlendirmesini ve iyileştirilmesini sağlayan bir stüdyo.















