metallik.ru
Был нормальный SEO-спец, познакомился с ИИ, стал ужасным У меня в Металлик и Ко есть команда SEO-специалистов на аутсорсе, которые медленно прокачивали довольно «сложный» сайт к росту трафика.
Был нормальный SEO-спец, познакомился с ИИ, стал ужасным У меня в Металлик и Ко есть команда SEO-специалистов на аутсорсе, которые медленно прокачивали довольно «сложный» сайт к росту трафика.
Финал Битвы агентов : объявляем тех, кто обошел других участников.
Финал Битвы агентов : объявляем тех, кто обошел других участников.
Финал Битвы агентов : объявляем тех, кто обошел других участников.
Финал Битвы агентов : объявляем тех, кто обошел других участников.
Ну что, время для традиционного поста любви к нашим партнерам 💙 Вайб Conversations возникает не сам по себе, а благодаря людям и компаниям, которые поддерживают конференцию — привозят реальные кейсы, технологии, экспертизу и кучу классных активностей для нашего комьюнити!
Итоги Битвы агентов : сражение завершилось на Conversations 14 лучших AI-агентов демонстрировали на сцене Conversations сегодня!
Итоги Битвы агентов : сражение завершилось на Conversations 14 лучших AI-агентов демонстрировали на сцене Conversations сегодня!
Итоги Битвы агентов : сражение завершилось на Conversations 14 лучших AI-агентов демонстрировали на сцене Conversations сегодня!
Итоги Битвы агентов : сражение завершилось на Conversations 14 лучших AI-агентов демонстрировали на сцене Conversations сегодня!
Уже две недели, как прошла 12-ая Conversations !
Пока научная общественность следит за воодушевляющими снимками Земли и Луны, внимание человечества скорее приковано к событиям вокруг Ирана.
В ближайшие выходные — Европейский университет на выезде в Переделкино!
️ Возможность: бежать, где хочется, и помочь тем, кто ждёт Началась регистрация на благотворительный онлайн-марафон «Мы бежим».
Все реклама слишком долго висит.
Железный закон робототехники или вторжение ИИ в университеты Для многих студентов выпускной является долгожданной церемонией, вознаграждением за усилия, приложенные к получению степени.
Самое худшее, что может линкануть фаундер стартапа это вайбкоженный дизайн by Claude code design.
Тут вышли Kimi k3 и вот сейчас выходит новый Qwen 3.8 max, который тоже будет ака «fable class model».
HealthTech Solutions Day: Россия–Филиппины.
Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling [ код и данные ] UniPic 3.0 заявляется как решение одной из самых востребованных, но сложных задач в сообществе: многокадровой композиции (multi-image composition), особенно для сценариев взаимодействия человека и объекта (human-object interaction, HOI).
Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling [ код и данные ] UniPic 3.0 заявляется как решение одной из самых востребованных, но сложных задач в сообществе: многокадровой композиции (multi-image composition), особенно для сценариев взаимодействия человека и объекта (human-object interaction, HOI).
Tuna: Taming Unified Visual Representations for Native Unified Multimodal Models [код обещают тут] Ранее мы много обсуждали мультимодальную генерацию с точки зрения: - Архитектуры : учить ли голову поверх LLM/VLM или делать unified backbone; - Представления данных : дискретное или непрерывное кодирование для картинок и текстов - Визуальных энкодеров : обычно для дискриминативных и генеративных задач используют разные (SigLip/VAE), но, например, Show-o2 ( статья, разбор )
За последние пару недель вышло несколько новых мультимодалок.
Несколько свежих работ по теме с фокусом на генерацию и редактирование картинок.
Несколько свежих работ по теме с фокусом на генерацию и редактирование картинок.
Emu3.5: Native Multimodal Models are World Learners [ код и веса ] Emu3.5 представляет собой развитие идей предыдущих версий Emu, но с колоссальным скачком в масштабе и амбициях.
Юзаем Photoshop, CapCut, Figma и многие другие в одном месте — появился сервис, который собрал в себе тулзы с открытым исходным кодом Главный плюс: всё работает прямо в браузере и без регистрации.
Emu3.5: Native Multimodal Models are World Learners [ код и веса ] Emu3.5 представляет собой развитие идей предыдущих версий Emu, но с колоссальным скачком в масштабе и амбициях.
Transfer between Modalities with MetaQueries [ страничка с кодом и данными ] Выше мы много обсуждали мультимодальные модели, способные одновременно понимать и генерировать картинки и текст.
Синтетические данные для претрейна LLM: когда они помогают, а когда вредят (by Meta) Можно ли обучать языковые модели на данных, сгенерированных другими LLM?
HunyuanImage 3.0 Technical Report [ код , веса ] Tensent продолжают релизы, новая HunyuanImage позиционируется как самая мощная open-source модель для генерации изображений на данный момент.
OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation [ код и веса есть ] Существующие на сегодняшний день мультимодальные системы строятся по модульному принципу: отдельные модели для понимания (understanding), генерации и редактирования изображений.
Draw-In-Mind: Learning Precise Image Editing via Chain-of-Thought Imagination [ код, данные и веса обещают тут ] Yet another генеративка, обученная одновременно на T2I и instruction-based editing, уже не должна никого удивлять.
Приглашаем вас на выставку и конференцию "Здоровье нации — основа процветания России"!
Цельс на AI Future!
Искусственный интеллект в медицине — Цельс на НОВАМЕД 2026 Сегодня, 22 июня , Артём Капнинский, коммерческий директор Цельс , выступит на VI Всероссийском форуме с международным участием НОВАМЕД 2026 в Казани.
Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding [веса есть на HF ] NVIDIA выпустили большой техрепорт про диффузионные языковые модели.
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model [ код и веса ] Inclusion AI делает unified multimodal dLLM для understanding + generation.
Neon: Negative Extrapolation from Self-Training Improves Image Generation [код] Мой любимый формат статей - простые, понятные и полезные находки с высоким потенциалом практической применимости.
ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration [ код , веса ] Исследователи из NVIDIA и Университета Гонконга (HKU) поднимают проблему агентного оркестрирования.
End-to-End Training for Unified Tokenization and Latent Denoising [ код и веса ] Современные LDM почти всегда двухступенчатые: сначала отдельно учат токенизатор (автоэнкодер), потом замораживают его и сверху учат генератор в зафиксированном латентном пространстве.
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing [ код и веса ] Возвращаемся к теме мультимодальных генеративных моделей.
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing [ код и веса ] Возвращаемся к теме мультимодальных генеративных моделей.
One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers [ код есть ] В генерации изображений обычно платишь за пиксели: больше разрешение - больше токенов - больше FLOPS.
Self-Distillation Enables Continual Learning [ Код & датасеты ] Исследователи из MIT и ETH Zurich предлагают SDFT (Self-Distillation Fine-Tuning) — метод для непрерывного обучения (continual learning) языковых моделей.
Lance: Unified Multimodal Modeling by Multi-Task Synergy [код и веса на странице проекта ] ByteDance продолжают заниматься мультимодальной генерацией, выпуская один техрепорт за другим.
Сегодня, в первый понедельник июля, в России отмечается День архитектора — профессиональный праздник работников архитектурной и градостроительной отрасли.
Дружочки!