rmr-rnd/harness-bench

github.com
Visit site

️ Как оценивать агентский harness Одной LLM недостаточно, чтобы понять качество AI-агента. На итоговый результат влия

⚡️ Как оценивать агентский harness Одной LLM недостаточно, чтобы понять качество AI-агента. На итоговый результат влияет агентский harness — как он управляет инструментами, памятью, сообщениями, восстановлением после ошибок. Чтобы разобраться в этой теме, мы провели ряд экспериментов. И выкатили в open source Harness Bench — открытый фреймворк для сравнения связок «модель + harness». А в новой мощной статье на Хабре рассказали про архитектуру фреймворка, адаптацию классических бенчмарков под системы агентов, поделились инженерными находками и результатами сравнений разных связок. ↗️ Читайте статью ↗️ Тестируйте бенч Автор и статьи, и бенчмарка, Андрей Иванов — NLP-инженер в R&D red_mad_robot.

Specs

Type Tool
SectionDirectories & rankings
Site languageen

Found in sources

Similar in «Directories & rankings»

Submit a site to the catalog

Just send the link — we will work out the rest.

We will review what you send and add it to the catalog if it fits.

Not sure how to implement it? We can help

Tell us about your task — we will pick the tools and suggest where to start.

0 / 5000
Verification code

Fields marked with an asterisk are required. Your data is used only to reply.