Type

Tag “Benchmark” — 46

Arena AI

arena.ai

Chat, compare, vote for the world's best AI models. Join the community shaping the public leaderboard for LLMs, image, and code models through real-world evaluation.

Platform Directories & rankings Web only

OpenHands

openhands.dev

OpenHands helps engineers automate repetitive coding tasks.

Agent AI agents Web + desktop

Qwen/Qwen-Image-Bench

huggingface.co

Модель image-text-to-text · лицензия apache-2.0

Model Models & platforms Web only

Crab

crab.camel-ai.org

Framework for building LLM agent benchmark environments in a Python-centric way.

Agent Agent frameworks Web + desktop

Модель image-text-to-text · лицензия apache-2.0

Model Models & platforms Self-hosted

snuh/hari-q3-8b

huggingface.co

Model Models & platforms Self-hosted

SWE-bench

swebench.com

Бенчмарк и лидерборд для ИИ-агентов, чинящих реальные issue из GitHub-репозиториев

Other Directories & rankings

Artificial Analysis

artificialanalysis.ai

Independent benchmarks comparing AI models on quality, speed, and cost.

Platform Directories & rankings Web only

Модель text-generation · лицензия apache-2.0

Model Models & platforms Self-hosted

Epoch AI

epoch.ai

Исследовательский институт: данные и бенчмарки о траектории развития ИИ

Platform Directories & rankings Web only

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Tool Video

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Tool Video

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Tool Video

openmoss/abc-bench

github.com

Claude Sonnet 4.5 побеждает на backend-бенчмарке ABC-Bench , лучше всех справившись с кодом и настройкой окружения ABC-Bench — первый бенчмарк, который проверяет способность ИИ-агентов решать полноценные задачи backend-разработки: от изучения кода в репозитории до настройки окружения и запуска сервиса в контейнере.

Tool Directories & rankings

Claude Sonnet 4.5 побеждает на backend-бенчмарке ABC-Bench , лучше всех справившись с кодом и настройкой окружения ABC-Bench — первый бенчмарк, который проверяет способность ИИ-агентов решать полноценные задачи backend-разработки: от изучения кода в репозитории до настройки окружения и запуска сервиса в контейнере.

Tool Directories & rankings

️ 💊 Baichuan-M3: открытая медицинская модель ведет диалог как настоящий врач, обходя GPT-5.2-High и людей в точности диагностики Baichuan-M3 ведет себя как опытный терапевт — методично выясняет детали: когда именно началась боль, какого она характера, есть ли сопутствующие симптомы, какие лекарства принимались, были ли подобные эпизоды раньше.

Tool Images

️ 💊 Baichuan-M3: открытая медицинская модель ведет диалог как настоящий врач, обходя GPT-5.2-High и людей в точности диагностики Baichuan-M3 ведет себя как опытный терапевт — методично выясняет детали: когда именно началась боль, какого она характера, есть ли сопутствующие симптомы, какие лекарства принимались, были ли подобные эпизоды раньше.

Tool Images

os-world.github.io

os-world.github.io

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Other

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Browser extensions

claw-bench.com

claw-bench.com

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Browser extensions

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Browser extensions

Submit a site to the catalog

Just send the link — we will work out the rest.

We will review what you send and add it to the catalog if it fits.

Not sure how to implement it? We can help

Tell us about your task — we will pick the tools and suggest where to start.

0 / 5000
Verification code

Fields marked with an asterisk are required. Your data is used only to reply.