#Evaluation
17 tools tagged “Evaluation”
Athina AI
Samarbeidsplattform for AI-utvikling for å bygge, teste og overvåke AI-funksjoner.
FoundryAI
Bygg, evaluer og forbedre AI‑agenter for forretningsautomatisering
Log10
Skaler ekspert LLM-evaluering med automatisert sanntidfeiloppdagelse.
Langfuse
En åpen kildekode LLM‑teknisk plattform som tilbyr observabilitet, metrikker, evalueringer og prompt‑håndtering for å feilsøke og forbedre applikasjoner med store språkmodeller
Latitude
Bygg produksjons‑AI‑agenter fra et enkelt prompt med innebygde evals og observabilitet.
Quotient AI
Sanntidsovervåknings- og evalueringsplattform for å oppdage AI-feil i søk, RAG og agenter.
Vijil
Plattform for å bygge, vurdere og operere pålitelige AI-agenter med sikkerhets og nøkkelprotektor mot relativ tilsvitere
LangSmith
Observability, evaluering og debuggingplattform for LLM-applikasjoner fra LangChain-teamet
Keywords AI
Observability- og feilsøkingsplattform for raskere levering av pålitelige LLM-drevne applikasjoner.
Coval
Simulering og vurderingsplattform for testing AI-voice og chatte-agenter på større skala
Phonic Voice AI
End-to-end stemme‑AI‑plattform for å bygge, observere og evaluere pålitelige samtalevennlige stemmeagenter.
KeywordsAI
Enhetlig utviklerplattform for å bygge, overvåke og skalere LLM-applikasjoner.
Phoenix
Åpen kilde observabilitets- og evalueringsplattform for sporing og forbedring av AI-applikasjoner.
QualiaInterviews
AI-drevet plattform for flerspråklige, samtaleorienterte forsknings- og evalueringsintervjuer i stor skala
Mosaic AI Agent Framework
En pakke med verktøy fra Databricks for å bygge, distribuere og evaluere høykvalitets AI‑agenter og RAG‑applikasjoner.
Humanloop
Enterprise LLM-evaluerings- og promptadministrasjonsplattform for å levere pålitelige AI-funksjoner.
LangWatch
LLM-optimeringsstudio for overvåking, evaluering og forbedring av AI-applikasjoner i produksjon.















