Type

Tag “Benchmark” — 20

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Tool Video

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Tool Video

LLaVA-OneVision-2-8B : мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео.

Tool Video

openmoss/abc-bench

github.com

Claude Sonnet 4.5 побеждает на backend-бенчмарке ABC-Bench , лучше всех справившись с кодом и настройкой окружения ABC-Bench — первый бенчмарк, который проверяет способность ИИ-агентов решать полноценные задачи backend-разработки: от изучения кода в репозитории до настройки окружения и запуска сервиса в контейнере.

Tool Directories & rankings

Claude Sonnet 4.5 побеждает на backend-бенчмарке ABC-Bench , лучше всех справившись с кодом и настройкой окружения ABC-Bench — первый бенчмарк, который проверяет способность ИИ-агентов решать полноценные задачи backend-разработки: от изучения кода в репозитории до настройки окружения и запуска сервиса в контейнере.

Tool Directories & rankings

️ 💊 Baichuan-M3: открытая медицинская модель ведет диалог как настоящий врач, обходя GPT-5.2-High и людей в точности диагностики Baichuan-M3 ведет себя как опытный терапевт — методично выясняет детали: когда именно началась боль, какого она характера, есть ли сопутствующие симптомы, какие лекарства принимались, были ли подобные эпизоды раньше.

Tool Images

️ 💊 Baichuan-M3: открытая медицинская модель ведет диалог как настоящий врач, обходя GPT-5.2-High и людей в точности диагностики Baichuan-M3 ведет себя как опытный терапевт — методично выясняет детали: когда именно началась боль, какого она характера, есть ли сопутствующие симптомы, какие лекарства принимались, были ли подобные эпизоды раньше.

Tool Images

os-world.github.io

os-world.github.io

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Other

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Browser extensions

claw-bench.com

claw-bench.com

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Browser extensions

ClawBench : лучший ИИ-агент справился лишь с 33% реальных повседневных задач в интернете Исследователи из UBC, Vector Institute и CMU представили ClawBench — бенчмарк для проверки ИИ-агентов на реальных сайтах.

Tool Browser extensions

Kimi-K2 и Qwen3-235B - лучшие нейросети для торговли акциями на бирже, GPT-5 и Claude 4 Sonnet далеко позади Китайские исследователи представили StockBench — первый бенчмарк для тестирования LLM-агентов в реальной биржевой торговле.

Tool Directories & rankings

ИИ-агенты справились с 2.5% реальных задач с биржи фрилансеров Исследователи из Center for AI Safety и Scale AI проверили, могут ли ведущие ИИ-агенты заменить фрилансеров.

Tool Directories & rankings

DeepEyesV2 — открытая агентная мультимодальная модель на базе Qwen2.5-VL-7B, которая умеет не просто понимать текст и изображения, но и активно использовать внешние инструменты.

Tool AI agents

DeepEyesV2 — открытая агентная мультимодальная модель на базе Qwen2.5-VL-7B, которая умеет не просто понимать текст и изображения, но и активно использовать внешние инструменты.

Tool AI agents

DeepEyesV2 — открытая агентная мультимодальная модель на базе Qwen2.5-VL-7B, которая умеет не просто понимать текст и изображения, но и активно использовать внешние инструменты.

Tool AI agents

DeepEyesV2 — открытая агентная мультимодальная модель на базе Qwen2.5-VL-7B, которая умеет не просто понимать текст и изображения, но и активно использовать внешние инструменты.

Tool AI agents

prime-rl/p1

github.com

Открытая модель впервые получила золотую медаль на Международной физической олимпиаде IPhO 2025 Модель P1-235B-A22B от Shanghai AI Laboratory стала первой открытой моделью, которая получила золотую медаль на IPhO 2025 — самой престижной физической олимпиаде в мире, где решение каждой задачи требует и аналитической точности, и творческого подхода.

Tool Agent frameworks

prime-rl/p1-235b-a22b

huggingface.co

Открытая модель впервые получила золотую медаль на Международной физической олимпиаде IPhO 2025 Модель P1-235B-A22B от Shanghai AI Laboratory стала первой открытой моделью, которая получила золотую медаль на IPhO 2025 — самой престижной физической олимпиаде в мире, где решение каждой задачи требует и аналитической точности, и творческого подхода.

Tool Agent frameworks

video-reality-test.github.io

video-reality-test.github.io

Лучшая AI-модель на 13% хуже людей распознает сгенерированные ASMR-видео Исследователи из Oxford, NUS и CUHK представили Video Reality Test — первый бенчмарк для тестирования способности VLM отличать настоящие ASMR-видео от сгенерированных.

Tool Directories & rankings

Submit a site to the catalog

Just send the link — we will work out the rest.

We will review what you send and add it to the catalog if it fits.

Not sure how to implement it? We can help

Tell us about your task — we will pick the tools and suggest where to start.

0 / 5000
Verification code

Fields marked with an asterisk are required. Your data is used only to reply.