xiaomimimo/mimo-audio

github.com
Открыть сайт

MiMo-Audio: GPT-3 moment for speech domain github | demo | huggingface На днях LLM команда Xiaomi опубликовала в от

MiMo-Audio: GPT-3 moment for speech domain github | demo | huggingface На днях LLM команда Xiaomi опубликовала в открытый доступ MiMo-Audio — 7b LLM с нативной поддержкой понимания и генерации речи. Основные особенности модели: - единые дискретные токены для понимания и генерации - предобучение на 100+ миллионах часов речи (для сравнения: Kimi-Audio — 13M часов; Whisper-large-v3 — 1M часов) В этом посте мы кратко опишем подход и полученные результаты Токенизация аудио Для кодирования аудио авторы используют Transformer (1.2B) с RVQ токенизацией. В нем одна секунда аудио кодируется 25 токенами в каждом из R=8 кодбуков. Одна из проблем в токенизации аудио — компромисс между кодированием семантики и акустических особенностей. Для ее решения применяют multi-task обучение в 2 этапа 1) обучение токенизатора на реконструкцию исходной аудиозаписи (акустика) + audio captioning с помощью LLM (семантика), 11M часов 2) с замороженным энкодером и квантизатором (которые подстроились под семантическое пространство LLM) доучивают декодер и вокодер для улучшения качества реконструкции Добавление модальностей в текстовую LLM - для каждого из R=8 уровней RVQ инициализируют таблицу эмбеддингов - аудио данные сильно разрежены, одна секунда кодируется 25 токенами, для выравнивания с токенами текста добавляют PatchEncoder , который сжимает (seq_len=4)x(R=8) токенов в один эмбеддинг - из финального скрытого состояния LLM генерируется как текстовый токен, так и аудио токены, для последних добавляют PatchDecoder : 16-layer Transformer, 8 lm-head'ов для каждого уровня RVQ, MusicGen -like задержка по времени между уровнями квантизации Pre-training Про данные сказано только то, что их 100M+ часов, они разнообразные и фильтрованные Инициализируют модель весами MiMo и учат в 2 этапа 1) Understanding Training. Добавляют к LLM PatchEncoder и учат все веса модели. 1.2T текстовых токенов + 1.4T аудио. Loss вычисляется только по текстовым токенам. Задачи: speech-text interleaved; spee

Характеристики

Тип Инструмент
КатегорияАудио, голос и музыка
Язык сайтаen

Найден в источниках

Похожие в разделе «Аудио, голос и музыка»

Предложить сайт в каталог

Пришлите ссылку — остальное мы выясним сами.

Мы рассмотрим, что вы прислали, и добавим в каталог, если подойдёт.

Не знаете, как внедрить? Мы поможем

Расскажите про задачу — подберём инструменты и подскажем, с чего начать.

0 / 5000
Проверочный код

Поля со звёздочкой обязательны. Данные используются только для ответа.