Тип

Тег «Benchmark» — 46

arena.ai

arena.ai

Публичный лидерборд ИИ-моделей: сравниваешь ответы вслепую и голосуешь за лучший

Платформа Каталоги и рейтинги Только веб

OpenHands

openhands.dev

Платформа OpenHands для оркестрации ИИ-агентов, выполняющих задачи разработчиков: код, команды, API. Модель-агностик, самохостинг.

Агент AI-агенты Веб + десктоп

Qwen/Qwen-Image-Bench

huggingface.co

Модель image-text-to-text · лицензия apache-2.0

Модель Модели и платформы Только веб

Модель image-text-to-text · лицензия apache-2.0

Модель Модели и платформы Десктоп

Crab

crab.camel-ai.org

Framework for building LLM agent benchmark environments in a Python-centric way.

Агент Фреймворки для агентов Веб + десктоп

Модель image-text-to-text · лицензия apache-2.0

Модель Модели и платформы Своё развёртывание

snuh/hari-q3-8b

huggingface.co

Модель Модели и платформы Своё развёртывание

SWE-bench

swebench.com

Бенчмарк и лидерборд для ИИ-агентов, чинящих реальные issue из GitHub-репозиториев

Другое Каталоги и рейтинги

Artificial Analysis

artificialanalysis.ai

Независимые замеры качества, цены и скорости ИИ-моделей и API-провайдеров

Платформа Каталоги и рейтинги Только веб

Модель text-generation · лицензия apache-2.0

Модель Модели и платформы Своё развёртывание

Модель text-generation · лицензия apache-2.0

Модель Модели и платформы Своё развёртывание

Epoch AI

epoch.ai

Исследовательский институт: данные и бенчмарки о траектории развития ИИ

Платформа Каталоги и рейтинги Только веб

Модель text-generation · лицензия apache-2.0

Модель Модели и платформы Своё развёртывание

Модель text-generation · лицензия apache-2.0

Модель Модели и платформы Своё развёртывание

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Инструмент Видео

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Инструмент Видео

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Инструмент Видео

openmoss/abc-bench

github.com

Claude Sonnet 4.5 побеждает на backend-бенчмарке ABC-Bench , лучше всех справившись с кодом и настройкой окружения ABC-Bench — первый бенчмарк, который проверяет способность ИИ-агентов решать полноценные задачи backend-разработки: от изучения кода в репозитории до настройки окружения и запуска сервиса в контейнере.

Инструмент Каталоги и рейтинги

Claude Sonnet 4.5 побеждает на backend-бенчмарке ABC-Bench , лучше всех справившись с кодом и настройкой окружения ABC-Bench — первый бенчмарк, который проверяет способность ИИ-агентов решать полноценные задачи backend-разработки: от изучения кода в репозитории до настройки окружения и запуска сервиса в контейнере.

Инструмент Каталоги и рейтинги

️ 💊 Baichuan-M3: открытая медицинская модель ведет диалог как настоящий врач, обходя GPT-5.2-High и людей в точности диагностики Baichuan-M3 ведет себя как опытный терапевт — методично выясняет детали: когда именно началась боль, какого она характера, есть ли сопутствующие симптомы, какие лекарства принимались, были ли подобные эпизоды раньше.

Инструмент Изображения

️ 💊 Baichuan-M3: открытая медицинская модель ведет диалог как настоящий врач, обходя GPT-5.2-High и людей в точности диагностики Baichuan-M3 ведет себя как опытный терапевт — методично выясняет детали: когда именно началась боль, какого она характера, есть ли сопутствующие симптомы, какие лекарства принимались, были ли подобные эпизоды раньше.

Инструмент Изображения

os-world.github.io

os-world.github.io

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Инструмент Прочее

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Инструмент Браузерные расширения

claw-bench.com

claw-bench.com

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Инструмент Браузерные расширения

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Инструмент Браузерные расширения

Предложить сайт в каталог

Пришлите ссылку — остальное мы выясним сами.

Мы рассмотрим, что вы прислали, и добавим в каталог, если подойдёт.

Не знаете, как внедрить? Мы поможем

Расскажите про задачу — подберём инструменты и подскажем, с чего начать.

0 / 5000
Проверочный код

Поля со звёздочкой обязательны. Данные используются только для ответа.