В OpenRouter приехали Qwen3-ASR, распознавание речи на 0,6 и 1,7 миллиарда параметров. Сами модели Qwen выложила ещё в к
В OpenRouter приехали Qwen3-ASR, распознавание речи на 0,6 и 1,7 миллиарда параметров. Сами модели Qwen выложила ещё в конце января под Apache 2.0, теперь их можно дёргать по API без своего сервера: 0,00018 доллара за минуту аудио у младшей и 0,00048 у старшей. Обе понимают 30 языков и 22 китайских диалекта, сами определяют язык, работают в потоке и офлайн, принимают до 20 минут аудио за раз и вытягивают пение и речь поверх музыки. Русский в списке есть. По русскому в техотчёте 1.7B даёт WER 5,99% на FLEURS и 8,28% на CommonVoice, то есть примерно шесть и восемь неверно распознанных слов из ста. Младшая 0.6B заметно слабее, 9,91 и 14,07. Закрытая Qwen3-ASR-Flash точнее обеих, 4,81 и 5,73. Прямого сравнения с Whisper по-русски в отчёте нет, а на общей таблице по 30 языкам Whisper large-v3 старшую модель обходит, 8,16 против 12,60. Берут они скоростью. На одной видеокарте 1.7B прожёвывает около 67 минут аудио за минуту работы, 0.6B около 108, а в пакетном режиме на 128 потоках счёт идёт на тысячи. В независимом русском тесте на маке у 0.6B были ошибки в именах и пропадала пунктуация, так что на созвонах с терминами младшую лучше проверять. @neuro_channel