wren93/tuna

github.com
Открыть сайт

Tuna: Taming Unified Visual Representations for Native Unified Multimodal Models [код обещают тут] Ранее мы много обсуждали мультимодальную генерацию с точки зрения: - Архитектуры : учить ли голову поверх LLM/VLM или делать unified backbone; - Представления данных : дискретное или непрерывное кодирование для картинок и текстов - Визуальных энкодеров : обычно для дискриминативных и генеративных задач используют разные (SigLip/VAE), но, например, Show-o2 ( статья, разбор )

Описание

Характеристики

Тип Инструмент
КатегорияИзображения
Язык сайтаen

Найден в источниках

Похожие в разделе «Изображения»

Предложить сайт в каталог

Пришлите ссылку — остальное мы выясним сами.

Мы рассмотрим, что вы прислали, и добавим в каталог, если подойдёт.

Не знаете, как внедрить? Мы поможем

Расскажите про задачу — подберём инструменты и подскажем, с чего начать.

0 / 5000
Проверочный код

Поля со звёздочкой обязательны. Данные используются только для ответа.