@c_research
Исследования AI глазами исследователя Автор: @snk4tr Сергей Кастрюлин
О канале Concise Research
Исследования AI глазами исследователя Автор: @snk4tr Сергей Кастрюлин
AI-обзор
Обновлено 20.07.2026Канал "Concise Research" посвящен исследованиям в области искусственного интеллекта. Автор, Сергей Кастрюлин, публикует краткие обзоры и аналитические статьи о новейших разработках в сфере AI, включая мультимодальные модели и агенты. Контент канала будет интересен специалистам и любителям технологий, интересующимся последними достижениями в области ИИ.
Описание сформировано MaxBook AI на основе последних публикаций канала.
Основные метрики
Вовлечённость
Здоровье аудитории
Часовая активность
МСККогда канал публикует — распределение постов по часам суток.
Последние публикации канала «Concise Research»
- 219 просмотров, 14 реакций, 14 июл. 2026 г.
Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появилась обновлённая модель — Alice AI ART 2.0. Пользователи уже сейчас могут протестировать два базовых сценария её работы: Text-to-Image и Image-to-Image. Для Яндекса этот релиз — первый шаг к тому, чтобы получить unified-модель с едиными метриками и стеком, которая одинаково хорошо умеет и в T2I, и в I2I. Команда генеративных моделей в компьютерном зрении рассказала на Хабре об экспериментах на этом пути, которые сработали и не сработали. Делимся основным. С чего начали Стартовали, имея две сущности. С…
Открыть пост в MAX - 355 просмотров, 22 реакций, 07 июл. 2026 г.
ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужие. Чтобы спорить у постеров, слушать доклады, искать неожиданные идеи и пытаться понять, куда сейчас движется область Но не только Ещё — чтобы увидеться с командой не через календарь и созвоны. Поговорить с исследователями и инженерами за пределами своего ежедневного круга. Потолкаться на экспо и в секции постеров про RL, случайно встретить знакомых и сопоставить имена из статей с живыми людьми И, конечно, чтобы немного прикоснуться к культуре другой страны: к улицам, еде, ритму города и маленьким…
Открыть пост в MAX - 507 просмотров, 1 реакций, 03 июл. 2026 г.
Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла унификация? В прошлом посте закончили на том, что агент-оркестратор с двумя специализированными моделями решает те же задачи, что и BAGEL-стайл унификация. За те же 14 месяцев это направление тоже не стояло на месте. Разберём, где мультимодальность нужна по существу задачи, где агенты её вытягивают. Где мультимодальность реально нужна и агенты её вытягивают ▶️ Знание-ориентированная генерация. Чистые T2I не знают счёта NBA-финала, курса акций на дату, как выглядит малоизвестное лого. Gen-Searcher через…
Открыть пост в MAX - 417 просмотров, 7 реакций, 02 июл. 2026 г.
Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL и близкие по времени работы продавали унифицированные модели с одним набором весов на понимание и генерацию картинок. Мотивационный тезис — модальности взаимно усиливают друг друга. Экспериментальных подтверждений тогда было немного, но авторы смотрели в светлое будущее. Прошло 14 месяцев. Посмотрим, что реально измерили за это время. Что говорит литература ▶️ Are Unified VLMs Necessary (май 2025). Единственная известная мне работа, где синергию померили чисто и на изолированной задаче. На синтетическом…
Открыть пост в MAX - 435 просмотров, 1 реакций, 29 июн. 2026 г.
Результаты На IA-Bench Qwen-Image-Agent даёт IA-score 45.4 . Для контекста: • Nano Banana Pro — 42.6 • GPT-Image-1.5 — 35.7 • Чистый Qwen-Image-2.0 без агента — 17.4 То есть агентский обвес поверх собственной модели даёт ~+28 пунктов и выводит её выше топовых закрытых рендереров на этом бенче. На WISE-Verified, более старом бенче на world knowledge ситуация аналогичная. В работе аблейтят влияние поиска (IA-score падает на 11 пунктов), ризонинга (минус 10 нуктнов). Удаление памяти и промежуточной оценки влияет меньше, но суммарно еще -8. А еще при замене GPT-5.5 на Qwen-Plus + Qwen-VL-Max…
Открыть пост в MAX - 419 просмотров, 3 реакций, 29 июн. 2026 г.
Тексты для T2I, второй акт : переписывание промтов, агенты и Context Gap [кода нет, новый бенч] Ранее в Тексты для T2I претрена разбирали две работы про тренировочные кепшены — Structured Captions и Design Choices for Synthetic Captions . Если коротко, обе пришли к выводу, что для T2I-претрена выгодно использовать структурированные кепшены: длинные , с заданным порядком пунктов и единым форматом. Чем плотнее и регулярнее текст в обучении, тем лучше модель учит соответствие текст-картинка. Побочный эффект - модель ждёт на входе огромную портянку, а пользователь приходит с "make a cool poster".…
Открыть пост в MAX - 580 просмотров, 4 реакций, 18 июн. 2026 г.
Qwen-Image-2.0 Technical Report Вышел-таки, красивое. Модельку так и не выложили, не красивое. Понравилось, что число авторов не исчисляется сотнями. Не понравилось, что страниц всего 30 и то половина картинки. Оч не подробно для команды Qwen.
Открыть пост в MAX - 593 просмотров, 9 реакций, 17 июн. 2026 г.
UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer [ссылка на код, а кода нет ☔️ ] Очередная unified MM-модель от Nanjing + ByteDance Seed с декаплингом диффузионного декодера от LLM-бэкбона в духе DDT/RAE/PixNerd. Авторы атакуют две знакомые проблемы UMM: конфликт understanding и generation лоссов и фрагментированное виз пространство. Архитектура Noisy ViT → LLM-бэкбон (Qwen3-VL-4B для VLM-UniDDT) → отдельный diffusion decoder (~1B). Ключевая фишка — Noisy ViT учат принимать вход на любом таймстепе шума, поэтому один энкодер обслуживает и понимание…
Открыть пост в MAX - 636 просмотров, 7 реакций, 09 июн. 2026 г.
SpecEdit: Training-Free Acceleration for Diffusion based Image Editing via Semantic Locking [код пока нет, обещают] Работа про ускорение диффузионного редактирования изображений без дообучения. Не новая модель, а надстройка над уже существующими редакторами вроде Qwen-Image-Edit и FLUX.1-Kontext. Проблема При редактировании не все области картинки одинакого важны. Не важные регионы можно сначала редактированть в низком разрешении, а потом апсемплить. При этом, стандартные методы динамического разрешения обычно решают, какие токены апсемплить, по низкоуровневым признакам: границам, дисперсии…
Открыть пост в MAX - 614 просмотров, 5 реакций, 03 июн. 2026 г.
За последнюю неделю вышли две довольно любопытные работы по мультимодальной генерации. Первая рассматривает UMM в контексте нынче модных pixel-space картиночных диффузионок. Вторая — тех репорт про то как запихнуть аж 7 разных модальностей в одну модель. Representation Forcing for Bottleneck-Free Unified Multimodal Models Новелти работы в том что делают мультимодалку с генерацией картинок без использования VAE. Для этого: • Общая тушка сначала авторегрессионно предсказывает семантические картиночные токены, • Та же тушка, но уже в режиме пиксельной диффузионки догенерирует картинку. По…
Открыть пост в MAX - 623 просмотров, 5 реакций, 25 мая 2026 г.
Lance: Unified Multimodal Modeling by Multi-Task Synergy [код и веса на странице проекта ] ByteDance продолжают заниматься мультимодальной генерацией, выпуская один техрепорт за другим. При этом, очередная модель под названием Lance имеет не так много отличий от своих предшественников: • Задачи : к стандартным задачам i2i, t2i, VLM и LLM генерации добавляют генерацию и редактирование видео; • Размер : при этом, модель буквально микроскопическая - всего 3В параметров; • Архитектура : в стандартную для мультимодалок dual-stream архитектуру добавили новый Modality-aware Rotary Positional…
Открыть пост в MAX - 606 просмотров, 6 реакций, 21 мая 2026 г.
Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding [веса есть на HF ] NVIDIA выпустили большой техрепорт про диффузионные языковые модели. Это не работа про объединённое мультимодальное понимание и генерацию в стиле BAGEL / LLaDA2.0-Uni: здесь нет генерации изображений. Но для линии диффузионных языковых моделей статья важная, потому что авторы не пытаются заменить авторегрессию диффузией (как это дедалось ранее), а объединяют авторегрессию, диффузию и самоспекуляцию в одном языковом бэкбоне. Главная идея : авторегрессионный и…
Открыть пост в MAX - 471 просмотров, 4 реакций, 20 мая 2026 г.
Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models [кода/весов не вижу] Интересная работа про unified multimodal models, но не про улучшение генерации через понимание, как обычно в BAGEL/BLIP3-o-like системах, а наоборот: может ли генерация улучшать понимание? Авторы называют это G2U (Generation-to-Understanding). Идея простая: перед ответом на вопрос модель сначала генерирует вспомогательную картинку — visual thought — а потом использует и исходное изображение, и эту сгенерированную версию для финального ризонинга. Пайплайн 1. Visual Thought Generation :…
Открыть пост в MAX - 549 просмотров, 10 реакций, 18 мая 2026 г.
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model [ код и веса ] Inclusion AI делает unified multimodal dLLM для understanding + generation. В отличие от MAR / Fluid / UniFluid / NexusGen, где генерация строится вокруг AR/MAR-предсказания visual tokens/latents, и от Qwen-Image / HunyuanImage / BAGEL / Transfusion, где обычно есть отдельный VLM/LLM и diffusion/flow head или гибрид NTP + diffusion, здесь ставка на общий discrete diffusion backbone: текст и semantic visual tokens учатся через один block-wise mask prediction objective. Важное…
Открыть пост в MAX - 809 просмотров, 12 реакций, 24 апр. 2026 г.
Первые статьи с ICLR 2026 О том, как стартовала конференция, рассказали в канале @MLunderhood . А прямо сейчас исследователь Yandex Research Сергей Кастрюлин делится работой об адаптивном гайдансе без использования классификатора в диффузионках. Dynamic Classifier-Free Diffusion Guidance via Online Feedback После обучения диффузионной модели стандартный шаг её подготовки к использованию — это подбор параметров инференса. Например, подбор CFG scale и паттерна распределения CFG в случае с динамическим гайденсом. Авторы из Google DeepMind предлагают метод для более эффективной настройки…
Открыть пост в MAX
Качество и доверие
Эвристические сигналы качества по публичным метрикам (охват, реакции, динамика подписчиков). Это не доказанный фрод и не приговор — лишь поводы присмотреться к каналу.
Реклама и монетизация
Средние показатели последних публикаций. Тип определён по тексту поста — оценочно.
Публикации
Дополнительно
Из 15 пойманных постов в диапазоне ID сообщений отсутствует 10. Пропуски — это удалённые посты ИЛИ медиа-альбомы и служебные сообщения (один альбом = несколько ID). Точную причину по одним ID определить нельзя.