Open-source LLM and agent evaluation framework with 50+ metrics, LLM-as-Judge augmentation, and guardrail scanners (jailbreak, PII, prompt-injection). Useful for scoring RAG outputs, agent trajectories, and function-calling behavior in data-science workflows.
| Тип | Репозиторий |
| Категория | GitHub-проекты / Из awesome-списка |
| Цена | открытый код |
| Платформа | Своё развёртывание |
| Системы | исходный код |
| Язык сайта | en |
| GitHub | future-agi/ai-evaluation |