openrouter.ai

openrouter.ai
Visit site

В OpenRouter приехали Qwen3-ASR, распознавание речи на 0,6 и 1,7 миллиарда параметров. Сами модели Qwen выложила ещё в к

В OpenRouter приехали Qwen3-ASR, распознавание речи на 0,6 и 1,7 миллиарда параметров. Сами модели Qwen выложила ещё в конце января под Apache 2.0, теперь их можно дёргать по API без своего сервера: 0,00018 доллара за минуту аудио у младшей и 0,00048 у старшей. Обе понимают 30 языков и 22 китайских диалекта, сами определяют язык, работают в потоке и офлайн, принимают до 20 минут аудио за раз и вытягивают пение и речь поверх музыки. Русский в списке есть. По русскому в техотчёте 1.7B даёт WER 5,99% на FLEURS и 8,28% на CommonVoice, то есть примерно шесть и восемь неверно распознанных слов из ста. Младшая 0.6B заметно слабее, 9,91 и 14,07. Закрытая Qwen3-ASR-Flash точнее обеих, 4,81 и 5,73. Прямого сравнения с Whisper по-русски в отчёте нет, а на общей таблице по 30 языкам Whisper large-v3 старшую модель обходит, 8,16 против 12,60. Берут они скоростью. На одной видеокарте 1.7B прожёвывает около 67 минут аудио за минуту работы, 0.6B около 108, а в пакетном режиме на 128 потоках счёт идёт на тысячи. В независимом русском тесте на маке у 0.6B были ошибки в именах и пропадала пунктуация, так что на созвонах с терминами младшую лучше проверять. @neuro_channel

Specs

Type Tool
SectionImages
Platform API only
Systems api, web
Site languageen

Platforms

Found in sources

Similar in «Images»

Submit a site to the catalog

Just send the link — we will work out the rest.

We will review what you send and add it to the catalog if it fits.

Not sure how to implement it? We can help

Tell us about your task — we will pick the tools and suggest where to start.

0 / 5000
Verification code

Fields marked with an asterisk are required. Your data is used only to reply.