datasets/t-tech/ru-arena-hard

huggingface.co
Открыть сайт

Сделали то, чего самим так не хватало — диалоговые бенчмарки на русском языке Да, мы перевели англоязычные варианты и

Сделали то, чего самим так не хватало — диалоговые бенчмарки на русском языке Да, мы перевели англоязычные варианты и тщательно отфильтровали все на предмет ошибок перевода и чувствительного контента. Зачем нам это? Часто не хватает открытых инструментов для объективной оценки LLM на русском языке. Компании сравнивают LLM на своих внутренних датасетах — что создает сложности в сравнении различных LLM моделей. Многие используют англоязычные бенчмарки или создают закрытые решения. Все это затрудняет сравнение моделей для всего сообщества. Ну и, собственно, вот они: 😀 Mt-bench 😀 Arena-hard 😀 Alpaca eval В своем декабрьском релизе T-Lite и T-Pro мы максимально постарались замерять свои модели на открытых бенчмарках, а подробный training report все еще здесь.

Характеристики

Тип Инструмент
КатегорияКаталоги и рейтинги
Язык сайтаen

Найден в источниках

Похожие в разделе «Каталоги и рейтинги»

Предложить сайт в каталог

Пришлите ссылку — остальное мы выясним сами.

Мы рассмотрим, что вы прислали, и добавим в каталог, если подойдёт.

Не знаете, как внедрить? Мы поможем

Расскажите про задачу — подберём инструменты и подскажем, с чего начать.

0 / 5000
Проверочный код

Поля со звёздочкой обязательны. Данные используются только для ответа.