@applied_scientist_blog
📊 Applied Scientist из Amazon о технологиях AI. Исследования, практика, новости из индустрии, полезные инструменты с AI - делюсь всем, чем сама интересуюсь. Для связи: @piunova_a
О канале Ученый без степени | AI-блог Ани
📊 Applied Scientist из Amazon о технологиях AI. Исследования, практика, новости из индустрии, полезные инструменты с AI - делюсь всем, чем сама интересуюсь. Для связи: @piunova_a
AI-обзор
Обновлено 19.07.2026Канал "Ученый без степени | AI-блог Ани" ведёт Applied Scientist из Amazon и посвящён технологиям искусственного интеллекта. Автор делится своими исследованиями, практическим опытом, новостями из индустрии и полезными инструментами с AI. Контент канала будет интересен всем, кто интересуется современными разработками в сфере AI.
Описание сформировано MaxBook AI на основе последних публикаций канала.
Основные метрики
Вовлечённость
Здоровье аудитории
Часовая активность
МСККогда канал публикует — распределение постов по часам суток.
Последние публикации канала «Ученый без степени | AI-блог Ани»
- 976 просмотров, 15 реакций, 27 дек. 2025 г.
Почитала тех репорт 🔗 Fun-Audio-Chat — LALM (Large Audio Language Model) от Tongyi Team (Alibaba). Интересно, что теперь большинство конкурентов в сравнительных таблицах это другие китайские модели (Kimi-Audio, GLM4-Voice, …), опенсорс-гонка сместилась, такое время. По бенчмаркам уже становится сложно делать однозначные выводы, результаты смешанные в зависимости от задачи Тем не менее в статье нашла пару интересных архитектурных и тренировочных решений 👇 Архитектура ⏺ Модель в двух версиях: 8B (опенсорс, на основе Qwen3-VL-8B) и MoE 30B-A3B (30B параметров, 3B активных) ⏺ Whisper-large-v3…
Открыть пост в MAX - 698 просмотров, 22 реакций, 25 дек. 2025 г.
Год подходит к концу, поэтому самое время подводить итоги. В этом посте разбираю одну из центральных тем блога в этом году: собеседования на ML/Research роли. ⚫️ В первой половине года я много собеседовал и понял, что хочется делиться тем, что может помочь соискателям. Так появились эти тексты. Они разные по формату и теме, все субъективные и основаны на личном опыте. А теплые сообщения в личку о пользе текстов только мотивируют стараться ✨ Типы вопросов на собеседованиях про Трансформеры Подборка ресурсов для изучения RL в контексте LLM Лонгрид ML Breadth Interview Deep Dive Как готовиться к…
Открыть пост в MAX - 900 просмотров, 28 реакций, 22 дек. 2025 г.
✨ Meta выпустила 🔗 SAM Audio , модель для open-domain audio separation. В отличие от классических сепараторов с фиксированными стемами (vocals/drums/bass/other), здесь можно изолировать произвольный звук 🎧 Архитектура В основе flow matching модель на базе Diffusion Transformer (DiT). На вход подаем замиксованное аудио и промпты для изоляции. Промпты могут быть трёх типов: 1️⃣ Текстовый: описание звука текстом («dog barking», «woman speaking»). Текст обрабатывает T5-Base энкодер, фичи инжектятся через cross-attention 2️⃣ Визуальный: видео + маска объекта. Хотим изолировать голос…
Открыть пост в MAX - 934 просмотров, 53 реакций, 16 дек. 2025 г.
Давно не было разборов. А все потому, что последние ~1,5 месяца я много собеседовалась. 🐹 В сумме прошла 28 интервью, включая HR-скрининги, технические этапы, два онсайта, один из которых — с исследовательской задачей и презентацией результатов в конце дня. Что из этого вышло и вышло ли расскажу позже, а пока впечатления именно о процессе поиска и подачи. Было стрессово, трудно, местами изнурительно 🌸 Искала вакансии в Европе и на удалёнке. В приоритете были американские стартапы и бигтехи с офисами в Европе, а также быстрорастущие европейские команды в области аудио, речи (ASR, TTS,…
Открыть пост в MAX - 1.2K просмотров, 21 реакций, 07 нояб. 2025 г.
Генерация речи с LLM задача нетривиальная, мы тренируем модель воспроизводить наиболее вероятную последовательность аудио / речевых токенов; но это усреднение часто ведет к плоским ненатуральным интонациям, эмоциям и паузам, множеству артефактов. 💃 И здесь RL как раз неплохо вписывается, дает возможность вознаграждать разборчивость, и не поощрять непонятную речь Если вам интересно попробовать RL post-training для TTS на практике, вот хороший пост-tutorial и репозиторий с кодом . Что тут происходит? 🌸 Архитектура: TTS модель Llasa, на базе Llama-3.2 1В с X-codec-2 токенизатором 🪻…
Открыть пост в MAX - 1.1K просмотров, 14 реакций, 03 нояб. 2025 г.
В далеком 2020 году вывели степенные законы масштабирования для pre-training. Теперь команда Meta (и партнеры из академии) попытались сделать то же самое для RL 🔗 «The Art of Scaling RL Compute for LLMs» показывает, что это предсказуемая сигмоида и предлагает ScaleRL рецепт стабильного RL проверенный на 100k GPU‑часов 😑 Почему не power law, а sigmoid? В отличие от pre-training, где cross-entropy loss следует степенному закону, в RL метрики обычно ограничены сверху ( accuracy, pass@k ) и ведут себя как sigmoid . Логично: в начале модель исследует пространство, учится базовым навыкам, рост…
Открыть пост в MAX - 940 просмотров, 23 реакций, 29 окт. 2025 г.
Хороший пост от разработчика PyTorch с обзором внутреннего устройства фреймворка пост 2019 года, так что некоторые детали уже эволюционировали (слияние Variable/Tensor уже случилось, например), но ментальные модели про тензоры, страйды, автоград и путь вызова — это всё ещё актуально, мне понравилось 🔗 https://blog.ezyang.com/2019/05/pytorch-internals/
Открыть пост в MAX - 978 просмотров, 15 реакций, 27 окт. 2025 г.
🐹 ARC-Encoder от Kyutai: plug-and-play компрессия для LLM На прошлой неделе вышла крутая статья от Kyutai Labs (да, я им симпатизирую): 🔗 ARC-Encoder learning compressed text representations for large language models Почему-то осталась относительно незамеченной, хотя на мой взгляд работа хорошо сделана и достойна deep-dive чтения. Как уже видно из названия, эта статья даже не про TTS & STT, здесь авторы придумали универсальный энкодер для сжатия длинных контекстов в LLM'ках в х4-8 раз практически без потерь качества ответов на различных downstream задачах (QA, text summarization, перевод),…
Открыть пост в MAX - 4.3K просмотров, 17 реакций, 21 окт. 2025 г.
Интерактивный tutorial по аудио кодекам от Kyutai labs 😎 https://kyutai.org/next/codec-explainer
Открыть пост в MAX - 1.1K просмотров, 18 реакций, 21 окт. 2025 г.
Microsoft предлагает использовать speech-LLM для оценки качества синтетической речи. Идея практичная, стандартные протоколы типа MOS и A/B тестов трудозатратны, а на выходе получаем оценку без качественных инсайтов, что именно пошло не так 🔗 SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation 🐯 SQ-LLM Авторы собрали датасет SpeechEval : 32к аудио (реальных и синтетики, включая коммерческие TTS), 128к аннотаций на 4 языках (en/zh/ja/fr). Аннотации включают оценки по 8 измерениям: overall quality, intelligibility, distortion, speech rate, dynamic range, emotional…
Открыть пост в MAX - 832 просмотров, 11 реакций, 15 окт. 2025 г.
Летом вышла HRM, модель на 27М с «биологически вдохновленной иерархией» и 32% на ARC-AGI. У нас тут был обзор на deep-dive от ARC-AGI, где показали, что эта самая иерархия не так и нужна В комьюнити HRM уже успели покрутить, и вышел еще разбор, из которого про модель я узнала больше, чем из оригинальной работы. А следом Tiny Recursion Model, в которой отбросили всю сложность HRM 🔗 HIERARCHICAL REASONING MODELS: PERSPECTIVES AND MISCONCEPTIONS 🔗 Less is More: Recursive Reasoning with Tiny Networks 🤔 Что не так с RNN RNN страдают от BPTT. Vanishing gradients возникают из-за того, что hidden…
Открыть пост в MAX - 681 просмотров, 16 реакций, 14 окт. 2025 г.
🐈 Learning is not supposed to be fun Карпатый зарелизил новый репозиторий для обучения LLM’ок с нуля — 🔗 nanochat It weighs ~8,000 lines of imo quite clean code to: - Train the tokenizer using a new Rust implementation - Pretrain a Transformer LLM on FineWeb, evaluate CORE score across a number of metrics - Midtrain on user-assistant conversations from SmolTalk, multiple choice questions, tool use. - SFT, evaluate the chat model on world knowledge multiple choice (ARC-E/C, MMLU), math (GSM8K), code (HumanEval) - RL the model optionally on GSM8K with "GRPO" - Efficient inference the model in…
Открыть пост в MAX - 1.0K просмотров, 16 реакций, 09 окт. 2025 г.
🎧 Align2Speak: TTS для мало-ресурсного языка на 30 минутах аудио Статья о том, как прокачать синтез речи для мало-ресурсных языков. Авторы показывают, что даже на 30 мин парных данных (аудио & текст) можно получить качественный TTS с помощью GRPO post-training. 🔗 Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference Optimization Статья понравилась, потому что идея простая и прикладная (разбирать что-то сложное пока нет времени). Ну и интересно все, что связано с бутстрэппингом на новые языки. Это, кстати, продолжение 🔗 Koel-TTS (NVIDIA) от той же команды.…
Открыть пост в MAX
Качество и доверие
Эвристические сигналы качества по публичным метрикам (охват, реакции, динамика подписчиков). Это не доказанный фрод и не приговор — лишь поводы присмотреться к каналу.
Реклама и монетизация
Средние показатели последних публикаций. Тип определён по тексту поста — оценочно.
Публикации
Дополнительно
Из 13 пойманных постов в диапазоне ID сообщений отсутствует 8. Пропуски — это удалённые посты ИЛИ медиа-альбомы и служебные сообщения (один альбом = несколько ID). Точную причину по одним ID определить нельзя.