Сделали то, чего самим так не хватало — диалоговые бенчмарки на русском языке Да, мы перевели англоязычные варианты и
Сделали то, чего самим так не хватало — диалоговые бенчмарки на русском языке Да, мы перевели англоязычные варианты и тщательно отфильтровали все на предмет ошибок перевода и чувствительного контента. Зачем нам это? Часто не хватает открытых инструментов для объективной оценки LLM на русском языке. Компании сравнивают LLM на своих внутренних датасетах — что создает сложности в сравнении различных LLM моделей. Многие используют англоязычные бенчмарки или создают закрытые решения. Все это затрудняет сравнение моделей для всего сообщества. Ну и, собственно, вот они: 😀 Mt-bench 😀 Arena-hard 😀 Alpaca eval В своем декабрьском релизе T-Lite и T-Pro мы максимально постарались замерять свои модели на открытых бенчмарках, а подробный training report все еще здесь.
| Type | Tool |
| Section | Directories & rankings |
| Site language | en |