@fminxyz
Канал Дани Меркулова Интересные сюжеты из прикладной математики Красивые визуализации Полезные ссылки Буду выкладывать интересные штуки, с которыми сталкиваюсь в рамках исследований/ преподавания Сайт: fmin.xyz Автор канала: @bratishk
О канале fmin.xyz
Канал Дани Меркулова Интересные сюжеты из прикладной математики Красивые визуализации Полезные ссылки Буду выкладывать интересные штуки, с которыми сталкиваюсь в рамках исследований/ преподавания Сайт: fmin.xyz Автор канала: @bratishk
AI-обзор
Обновлено 18.07.2026Канал "fmin.xyz" посвящен прикладной математике и машинному обучению. Автор делится интересными сюжетами из своей работы, публикует визуализации и полезные ссылки на ресурсы. Контент будет интересен тем, кто интересуется алгоритмами, численными методами и современными тенденциями в AI.
Описание сформировано MaxBook AI на основе последних публикаций канала.
Основные метрики
Рост подписчиков
Вовлечённость
Здоровье аудитории
Часовая активность
МСККогда канал публикует — распределение постов по часам суток.
Последние публикации канала «fmin.xyz»
- 7.3K просмотров, 116 реакций, 04 июл. 2025 г.
🧬 Эволюционные алгоритмы Полтора месяца назад DeepMind выкатил AlphaEvolve , где LLM-агент генерирует, скрещивает и отбирает фрагменты кода на основе эволюционного подхода. Так появляются новые алгоритмы — от рекордов в матричном умножении до оптимальных расписаний вычислений и топологий печатных плат для TPU. Сообщество уже откликнулось опен-сорсным OpenEvolve — можно запустить тот же процесс самому и выращивать свои программы. На анимации — пример: генетический алгоритм оптимизирует расписание светофоров. Есть улица с несколькими светофорами. Каждый дважды зажигает красный на…
Открыть пост в MAX - 16.3K просмотров, 138 реакций, 28 февр. 2025 г.
QR алгоритм 🥸 Одна из жемчужин численных методов. Он используется для поиска собственных чисел матрицы. 🥰 Простой и стабильный, а при небольших модификациях ещё и быстрый. Qₖ, Rₖ = qr(Aₖ) - Вычисляем QR-разложение матрицы Aₖ₊₁ = RₖQₖ - Умножаем факторы в обратном порядке 😑 Для произвольной квадратной матрицы он сходится к верхнетреугольной матрице, на диагонали которой стоят её собственные числа (картинка слева) 👍 Если же матрица - симметричная, то он сходится вообще к диагональной матрице собственных чисел (картинка справа). Идея анимации взята у Gabriel Peyré - один из лучших…
Открыть пост в MAX - 8.4K просмотров, 95 реакций, 12 февр. 2025 г.
Наглядно о том, зачем нужна нормализация признаков Простая анимация, которая показывает фиксированное число итераций градиентного спуска, стартующего из одной и той же точки для хороших и плохих задач. В хороших задачах направления примерно одинаковы с точки зрения значений минимизируемой функции. Для квадратичной функции (aka линейная регрессия) это измеряется числом обусловленности гессиана. Явление характерно не только для квадратичных функций - это одна из главных причин наличия разных нормализаций в нейросетях. 👨💻 Код для построения анимации
Открыть пост в MAX - 7.0K просмотров, 75 реакций, 31 янв. 2025 г.
Подбор шага с помощью линейного поиска в градиентном спуске Если нам известны характеристики сильно выпуклой функции, то мы можем выбрать оптимальный постоянный шаг 2/(μ + L), где μ и L – наименьшее и наибольшее собственные значения гессиана функции. Однако на практике эти параметры почти никогда не известны. Да и функции бывают невыпуклые. Приходится подбирать learning rate вручную (перебор), линейным поиком или использовать эвристики/адаптивные алгоритмы (например, AdamW, NAG-GS). В первой части видео мы минимизируем функцию Розенброка с помощью градиентного спуска с разными постоянными…
Открыть пост в MAX - 6.4K просмотров, 86 реакций, 05 дек. 2024 г.
О чем пишут на ICLR 2025 Пока все ждут результаты ревью одной из самых главных конференций по AI, вот анализ ключевых слов работ, поданных на неё. Всего в датасете около 9600 работ (подано вроде чуть больше), а самые популярные категории (фул картинки и полный датасет в комментариях): 1797: large language models 592: diffusion models 458: reinforcement learning 291: transformers 280: graph neural networks 247: generative models 222: deep learning 210: benchmark 210: representation learning 194: interpretability 175: ai safety 160: alignment 160: multimodal large language models 135:…
Открыть пост в MAX - 6.4K просмотров, 77 реакций, 30 нояб. 2024 г.
Как ускоряли обучение GPT - 2 S в 10 раз 🤩 Очень интересный репозиторий Modded-NanoGPT , и набор тредов о том, как спидранили обучение GPT-2 (самой маленькой версии на 125М параметров). 😎 Результат был достигнут на 8xH100 за 4.7 минуты на PyTorch вместо 45 минут в бейзлайне (llm.c). В денежном выражении это экономия с ~$15 до ~$1.56. Представляете, обучение GPT-2 S с нуля теперь стоит $1.5 и занимает 5 минут. А обучение XL модели ~$200 и 10 часов. 😂 Стоит обратить внимание, что всё это произошло за счёт алгоритмических/модельных улучшений. Потенциально можно все эти трюки перенести…
Открыть пост в MAX - 5.4K просмотров, 51 реакций, 31 окт. 2024 г.
В начале октября вышел ежегодный отчет State of AI Report 2024 🔗 Ссылка Помимо обзора прогресса за последний год, в конце есть секция с предсказаниями (в прошлом репорте 5 из 10 предсказаний сбылась, 3 не сбылись). Поставлю интуитивные имхо 🟢 / 🔴 , если согласен/не согласен - проверим через год. 1️⃣ Вложение более 10 млрд $ от государства в крупную американскую AI лабораторию вызовет проверку на уровне национальной безопасности. 🔴 Такое вообще бывало? Чтобы в критически важную технологию вкладывали так много другие государства? 2️⃣ Приложение или сайт, созданные без навыков…
Открыть пост в MAX - 11.9K просмотров, 107 реакций, 13 окт. 2024 г.
Нейронная сеть Хопфилда 🏆 На этой неделе нобелевскую премию по физике дали Джону Хопфилду и Джеффри Хинтону за основополагающие открытия и изобретения, которые позволяют использовать машинное обучение с помощью искусственных нейронных сетей. 😲 Я, как и многие в моем окружении, сначала недоумевал, почему так и причем здесь физика. И решил заботать, что вообще такое нейронная сеть Хопфилда, и получил дикое удовольствие. Оказывается, что сама концепция заметно отличается от тех нейронных сетей, к которым мы привыкли. В этих сетях гораздо больше связи с физикой и биологией, чем в…
Открыть пост в MAX - 8.5K просмотров, 131 реакций, 09 сент. 2024 г.
Почему все используют градиентные методы для обучения больших моделей? 🤩 Продемонстрирую наглядно на примере решения задачи Multidimensional Scaling (MDS). В этой задаче нам надо нарисовать на плоскости объекты, про которые мы знаем только насколько каждый из них далеко друг от друга. Т.е. на входе у нас матрица попарных расстояний, а на выходе координаты объектов на плоскости. Причем эти координаты должны быть такими, чтобы соотношения расстояний между объектами оставалось как можно более близким к исходным. В качестве функции потерь выступает сумма квадратов отклонений расстояний между…
Открыть пост в MAX - 6.3K просмотров, 70 реакций, 20 июл. 2024 г.
Мам, я хочу double descent - у нас есть double descent дома! 💀 Феномен двойного спуска - явление, наблюдаемое в моделях машинного обучения, при котором при увеличении сложности модели на тестовых данных сначала наблюдается улучшение качества предсказаний (первый спуск), затем идёт ожидаемый рост ошибки (переобучение), а потом, внезапно, происходит улучшение обобщающей способности модели (второй спуск). Интересно, что похожую картинку можно получить на довольно простом примере полиномиальной регрессии. На анимации выше слева 50 точек синусоиды, которые используются в качестве train set для…
Открыть пост в MAX - 5.3K просмотров, 129 реакций, 16 июл. 2024 г.
Сегодня я планировал быть в Барселоне, рассказывать нашу работу по квантизации LLM на конференции UAI, но т.к. мой шенген делают уже больше месяца, я был вынужден использовать последнюю диффузионную модель Stable Paint, чтобы добавить меня к постеру, который, к моей большой радости, всё же был представлен @Ivan_Oseledets . Когда приведу в порядок код, напишу пост про сам алгоритм (он прикольный - матрица раскладывается на 2 слагаемых, каждое из которых хорошо квантизуется), а пока оставлю постер в комментах.
Открыть пост в MAX - 6.6K просмотров, 84 реакций, 10 апр. 2024 г.
Почему стохастический градиентный спуск не сходится? 👍 Многие привыкли использовать SGD(stochastic gradient descent), но не все знают, что он гарантированно(!) не сходится в случае постоянного шага (learning rate) даже для самой приятной в мире функции - сильно выпуклой квадратичной (даже в среднем). 😰 🧠 Почему так? Дело в том, что в SGD на каждой итерации на самом деле решается другая задача, построенная по выбранным данным. И эта задача на батче может радикально отличаться от полной задачи (однако, внимательный читатель может отметить, что это не гарантирует очень плохой шаг 😬 ). То…
Открыть пост в MAX - 5.0K просмотров, 54 реакций, 20 мар. 2024 г.
Коварный метод Ньютона 🏌️ Безнапряжная эстетика направлений движения методов оптимизации для невыпуклых задач. 🚶♂️ Метод Ньютона легко сходится не только к минимумам (светлые области), но и к максимумам (темные области). Дело в том, что метод строит квадратичную локальную аппроксимацию функции и если вдруг она не выпукла, то он может построить параболу ветвями вниз и уверенно проследует в её максимум. То есть вы вроде применили метод оптимизации для минимизации функции, а она возьми и увеличься 😊 . Для градиентного спуска с правильным шагом такого быть не может, антиградиент всегда…
Открыть пост в MAX - 4.3K просмотров, 42 реакций, 10 мар. 2024 г.
Непредсказуемая сложность MIP 💡 Есть такая особенность в задачах целочисленного линейного программирования (Mixed Integer Programming - MIP), что по её виду не совсем понятно насколько сложной она будет. 🤔 Бывает так, что задача с миллионами переменных и ограничений решается на десктопе быстрее, чем за час, а бывают задачи с тысячами переменных/ограничений, которые до сих пор вообще никак не решены любыми средствами и солверами (в т.ч. коммерческим Gurobi). 😢 Однако, если позволить переменным быть не только целочисленными, но лежать в некотором отрезке (выпуклая релаксация MIP), то почти…
Открыть пост в MAX - 4.7K просмотров, 58 реакций, 22 февр. 2024 г.
l₁ регуляризация стимулирует разреженность решения 🤨 При обучении линейной регрессии иногда хочется найти не просто вектор весов, с которыми надо учитывать фичи, но и стимулировать этот вектор обладать некоторыми свойствами. 📝 Фишки l₂ - регуляризации (Ridge-регрессия): * Единственность решения, чего нельзя гарантировать в исходной задаче. * Новая задача становится лучше обусловлена. * Задача гарантированно становится сильно выпуклой. 📝 Основная фишка l₁ - регуляризации (Lasso-регрессия) - это разреженность решения или автоматический выбор признаков . В векторе оптимального решения будет…
Открыть пост в MAX
Качество и доверие
Эвристические сигналы качества по публичным метрикам (охват, реакции, динамика подписчиков). Это не доказанный фрод и не приговор — лишь поводы присмотреться к каналу.
Реклама и монетизация
Внешняя реклама, которую этот канал размещал в других лентах.
Рекламирует с 13.06.2026
- @addlist1 пост
- @abstractDL1 пост
- канал #abstractDL1 пост
- @Ivan_Oseledets1 пост
Каналы, которые размещали рекламу этого канала у себя.
- @yazopprep1 пост · 413 охват
Средние показатели последних публикаций. Тип определён по тексту поста — оценочно.
Цитирование
Сколько раз канал упомянут и репостнут в постах других каналов.