Tuna: Taming Unified Visual Representations for Native Unified Multimodal Models [код обещают тут] Ранее мы много обсуждали мультимодальную генерацию с точки зрения: - Архитектуры : учить ли голову поверх LLM/VLM или делать unified backbone; - Представления данных : дискретное или непрерывное кодирование для картинок и текстов - Визуальных энкодеров : обычно для дискриминативных и генеративных задач используют разные (SigLip/VAE), но, например, Show-o2 ( статья, разбор )
| Тип | Инструмент |
| Категория | Изображения |
| Язык сайта | en |