Concise Research

TelegramТехнологии

@c_research

Исследования AI глазами исследователя Автор: @snk4tr Сергей Кастрюлин

1.2K
Подписчиков
44.4%
Охват (Reach Rate / RR)
просмотры / подписчики
1.3%
Вовлечённость (ER)
реакции / просмотры

О канале Concise Research

1.2Kподписчиков546средний охват44.4%охват (RR)1.3%вовлечённость (ER)

Исследования AI глазами исследователя Автор: @snk4tr Сергей Кастрюлин

AI-обзор

Обновлено 20.07.2026

Канал "Concise Research" посвящен исследованиям в области искусственного интеллекта. Автор, Сергей Кастрюлин, публикует краткие обзоры и аналитические статьи о новейших разработках в сфере AI, включая мультимодальные модели и агенты. Контент канала будет интересен специалистам и любителям технологий, интересующимся последними достижениями в области ИИ.

Описание сформировано MaxBook AI на основе последних публикаций канала.

Основные метрики

Вовлечённость

44.4%Охват
Подписчиков1.2K
Просмотров/пост546
Реакций/пост7
Высокая
Качество
1.28%
Реакции/просм.
15
Постов
7
Реакций/пост
1.28%просмотров конвертируются в реакции

Здоровье аудитории

Средний охват: ~546 на пост — это ~44% от 1.2K подписчиков
44%
Доля от числа подписчиков. Один пост видит не обязательно одна и та же часть аудитории, поэтому остаток — не «неактивные подписчики».
44.4%
Охват (RR)
Отличное
1.28%
ER (вовлечённость)
~7 реакций/пост
Здоровый канал. Более 30% подписчиков видят публикации — аудитория живая и вовлечённая.

Часовая активность

МСК

Когда канал публикует — распределение постов по часам суток.

12:00
Пик публикаций
0%
Ночью (0-6)
Публикует днём
0
3
6
9
12
15
18
21
Распределение 15 постов по часам публикации и средний охват/реакции постов в этот час. Время — московское (МСК). Это график публикаций канала, не онлайн-статус аудитории.

Последние публикации канала «Concise Research»

  1. 219 просмотров, 14 реакций, 14 июл. 2026 г.

    Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появилась обновлённая модель — Alice AI ART 2.0. Пользователи уже сейчас могут протестировать два базовых сценария её работы: Text-to-Image и Image-to-Image. Для Яндекса этот релиз — первый шаг к тому, чтобы получить unified-модель с едиными метриками и стеком, которая одинаково хорошо умеет и в T2I, и в I2I. Команда генеративных моделей в компьютерном зрении рассказала на Хабре об экспериментах на этом пути, которые сработали и не сработали. Делимся основным. С чего начали Стартовали, имея две сущности. С…

    Открыть пост в MAX
  2. 355 просмотров, 22 реакций, 07 июл. 2026 г.

    ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужие. Чтобы спорить у постеров, слушать доклады, искать неожиданные идеи и пытаться понять, куда сейчас движется область Но не только Ещё — чтобы увидеться с командой не через календарь и созвоны. Поговорить с исследователями и инженерами за пределами своего ежедневного круга. Потолкаться на экспо и в секции постеров про RL, случайно встретить знакомых и сопоставить имена из статей с живыми людьми И, конечно, чтобы немного прикоснуться к культуре другой страны: к улицам, еде, ритму города и маленьким…

    Открыть пост в MAX
  3. 507 просмотров, 1 реакций, 03 июл. 2026 г.

    Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла унификация? В прошлом посте закончили на том, что агент-оркестратор с двумя специализированными моделями решает те же задачи, что и BAGEL-стайл унификация. За те же 14 месяцев это направление тоже не стояло на месте. Разберём, где мультимодальность нужна по существу задачи, где агенты её вытягивают. Где мультимодальность реально нужна и агенты её вытягивают ▶️ Знание-ориентированная генерация. Чистые T2I не знают счёта NBA-финала, курса акций на дату, как выглядит малоизвестное лого. Gen-Searcher через…

    Открыть пост в MAX
  4. 417 просмотров, 7 реакций, 02 июл. 2026 г.

    Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL и близкие по времени работы продавали унифицированные модели с одним набором весов на понимание и генерацию картинок. Мотивационный тезис — модальности взаимно усиливают друг друга. Экспериментальных подтверждений тогда было немного, но авторы смотрели в светлое будущее. Прошло 14 месяцев. Посмотрим, что реально измерили за это время. Что говорит литература ▶️ Are Unified VLMs Necessary (май 2025). Единственная известная мне работа, где синергию померили чисто и на изолированной задаче. На синтетическом…

    Открыть пост в MAX
  5. 435 просмотров, 1 реакций, 29 июн. 2026 г.

    Результаты На IA-Bench Qwen-Image-Agent даёт IA-score 45.4 . Для контекста: • Nano Banana Pro — 42.6 • GPT-Image-1.5 — 35.7 • Чистый Qwen-Image-2.0 без агента — 17.4 То есть агентский обвес поверх собственной модели даёт ~+28 пунктов и выводит её выше топовых закрытых рендереров на этом бенче. На WISE-Verified, более старом бенче на world knowledge ситуация аналогичная. В работе аблейтят влияние поиска (IA-score падает на 11 пунктов), ризонинга (минус 10 нуктнов). Удаление памяти и промежуточной оценки влияет меньше, но суммарно еще -8. А еще при замене GPT-5.5 на Qwen-Plus + Qwen-VL-Max…

    Открыть пост в MAX
  6. 419 просмотров, 3 реакций, 29 июн. 2026 г.

    Тексты для T2I, второй акт : переписывание промтов, агенты и Context Gap [кода нет, новый бенч] Ранее в Тексты для T2I претрена разбирали две работы про тренировочные кепшены — Structured Captions и Design Choices for Synthetic Captions . Если коротко, обе пришли к выводу, что для T2I-претрена выгодно использовать структурированные кепшены: длинные , с заданным порядком пунктов и единым форматом. Чем плотнее и регулярнее текст в обучении, тем лучше модель учит соответствие текст-картинка. Побочный эффект - модель ждёт на входе огромную портянку, а пользователь приходит с "make a cool poster".…

    Открыть пост в MAX
  7. 580 просмотров, 4 реакций, 18 июн. 2026 г.

    Qwen-Image-2.0 Technical Report Вышел-таки, красивое. Модельку так и не выложили, не красивое. Понравилось, что число авторов не исчисляется сотнями. Не понравилось, что страниц всего 30 и то половина картинки. Оч не подробно для команды Qwen.

    Открыть пост в MAX
  8. 593 просмотров, 9 реакций, 17 июн. 2026 г.

    UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer [ссылка на код, а кода нет ☔️ ] Очередная unified MM-модель от Nanjing + ByteDance Seed с декаплингом диффузионного декодера от LLM-бэкбона в духе DDT/RAE/PixNerd. Авторы атакуют две знакомые проблемы UMM: конфликт understanding и generation лоссов и фрагментированное виз пространство. Архитектура Noisy ViT → LLM-бэкбон (Qwen3-VL-4B для VLM-UniDDT) → отдельный diffusion decoder (~1B). Ключевая фишка — Noisy ViT учат принимать вход на любом таймстепе шума, поэтому один энкодер обслуживает и понимание…

    Открыть пост в MAX
  9. 636 просмотров, 7 реакций, 09 июн. 2026 г.

    SpecEdit: Training-Free Acceleration for Diffusion based Image Editing via Semantic Locking [код пока нет, обещают] Работа про ускорение диффузионного редактирования изображений без дообучения. Не новая модель, а надстройка над уже существующими редакторами вроде Qwen-Image-Edit и FLUX.1-Kontext. Проблема При редактировании не все области картинки одинакого важны. Не важные регионы можно сначала редактированть в низком разрешении, а потом апсемплить. При этом, стандартные методы динамического разрешения обычно решают, какие токены апсемплить, по низкоуровневым признакам: границам, дисперсии…

    Открыть пост в MAX
  10. 614 просмотров, 5 реакций, 03 июн. 2026 г.

    За последнюю неделю вышли две довольно любопытные работы по мультимодальной генерации. Первая рассматривает UMM в контексте нынче модных pixel-space картиночных диффузионок. Вторая — тех репорт про то как запихнуть аж 7 разных модальностей в одну модель. Representation Forcing for Bottleneck-Free Unified Multimodal Models Новелти работы в том что делают мультимодалку с генерацией картинок без использования VAE. Для этого: • Общая тушка сначала авторегрессионно предсказывает семантические картиночные токены, • Та же тушка, но уже в режиме пиксельной диффузионки догенерирует картинку. По…

    Открыть пост в MAX
  11. 623 просмотров, 5 реакций, 25 мая 2026 г.

    Lance: Unified Multimodal Modeling by Multi-Task Synergy [код и веса на странице проекта ] ByteDance продолжают заниматься мультимодальной генерацией, выпуская один техрепорт за другим. При этом, очередная модель под названием Lance имеет не так много отличий от своих предшественников: • Задачи : к стандартным задачам i2i, t2i, VLM и LLM генерации добавляют генерацию и редактирование видео; • Размер : при этом, модель буквально микроскопическая - всего 3В параметров; • Архитектура : в стандартную для мультимодалок dual-stream архитектуру добавили новый Modality-aware Rotary Positional…

    Открыть пост в MAX
  12. 606 просмотров, 6 реакций, 21 мая 2026 г.

    Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding [веса есть на HF ] NVIDIA выпустили большой техрепорт про диффузионные языковые модели. Это не работа про объединённое мультимодальное понимание и генерацию в стиле BAGEL / LLaDA2.0-Uni: здесь нет генерации изображений. Но для линии диффузионных языковых моделей статья важная, потому что авторы не пытаются заменить авторегрессию диффузией (как это дедалось ранее), а объединяют авторегрессию, диффузию и самоспекуляцию в одном языковом бэкбоне. Главная идея : авторегрессионный и…

    Открыть пост в MAX
  13. 471 просмотров, 4 реакций, 20 мая 2026 г.

    Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models [кода/весов не вижу] Интересная работа про unified multimodal models, но не про улучшение генерации через понимание, как обычно в BAGEL/BLIP3-o-like системах, а наоборот: может ли генерация улучшать понимание? Авторы называют это G2U (Generation-to-Understanding). Идея простая: перед ответом на вопрос модель сначала генерирует вспомогательную картинку — visual thought — а потом использует и исходное изображение, и эту сгенерированную версию для финального ризонинга. Пайплайн 1. Visual Thought Generation :…

    Открыть пост в MAX
  14. 549 просмотров, 10 реакций, 18 мая 2026 г.

    LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model [ код и веса ] Inclusion AI делает unified multimodal dLLM для understanding + generation. В отличие от MAR / Fluid / UniFluid / NexusGen, где генерация строится вокруг AR/MAR-предсказания visual tokens/latents, и от Qwen-Image / HunyuanImage / BAGEL / Transfusion, где обычно есть отдельный VLM/LLM и diffusion/flow head или гибрид NTP + diffusion, здесь ставка на общий discrete diffusion backbone: текст и semantic visual tokens учатся через один block-wise mask prediction objective. Важное…

    Открыть пост в MAX
  15. 809 просмотров, 12 реакций, 24 апр. 2026 г.

    Первые статьи с ICLR 2026 О том, как стартовала конференция, рассказали в канале @MLunderhood . А прямо сейчас исследователь Yandex Research Сергей Кастрюлин делится работой об адаптивном гайдансе без использования классификатора в диффузионках. Dynamic Classifier-Free Diffusion Guidance via Online Feedback После обучения диффузионной модели стандартный шаг её подготовки к использованию — это подбор параметров инференса. Например, подбор CFG scale и паттерна распределения CFG в случае с динамическим гайденсом. Авторы из Google DeepMind предлагают метод для более эффективной настройки…

    Открыть пост в MAX

Качество и доверие

100
из 100
Явных аномалий не обнаружено

Эвристические сигналы качества по публичным метрикам (охват, реакции, динамика подписчиков). Это не доказанный фрод и не приговор — лишь поводы присмотреться к каналу.

Реклама и монетизация

Эффективность по типу контента

Средние показатели последних публикаций. Тип определён по тексту поста — оценочно.

Видео(3 поста)551 просм. · 6 реакц.
Фото(9 постов)531 просм. · 7 реакц.
Текст(3 поста)465 просм. · 10 реакц.

Публикации

15 последних публикаций

Дополнительно

10пропущенных ID постов

Из 15 пойманных постов в диапазоне ID сообщений отсутствует 10. Пропуски — это удалённые посты ИЛИ медиа-альбомы и служебные сообщения (один альбом = несколько ID). Точную причину по одним ID определить нельзя.