daVinci-MagiHuman: открытая модель генерирует видео с липсинком длиной 5 секунд за 2 секунды на одном H100 Команды SII-GAIR и Sand.ai опубликовали daVinci-MagiHuman — открытую мультимодальную 15B-модель на основе однопоточного трансформера, которая одновременно генерирует видео и синхронное аудио и создает 5-секундный клип в 256p за 2 секунды на одном GPU H100.