@llm_under_hood
Канал про разработку продуктов на базе LLM/ChatGPT. Выжимка важных новостей и разборы кейсов. Чтобы писать - напишите боту @llm_under_hood_bot Рекламы в канале - нет. За комменты от ботов баним вместе с хозяином.
О канале LLM под капотом
Канал про разработку продуктов на базе LLM/ChatGPT. Выжимка важных новостей и разборы кейсов. Чтобы писать - напишите боту @llm_under_hood_bot Рекламы в канале - нет. За комменты от ботов баним вместе с хозяином.
AI-обзор
Обновлено 17.07.2026Канал "LLM под капотом" посвящен разработке продуктов на базе LLM/ChatGPT. Автор публикует выжимки важных новостей и разборы кейсов в сфере разработки LLM, а также проводит бенчмарки различных моделей. Контент канала будет интересен разработчикам, интересующимся новейшими технологиями в области искусственного интеллекта.
Описание сформировано MaxBook AI на основе последних публикаций канала.
Основные метрики
Рост подписчиков
Вовлечённость
Здоровье аудитории
Часовая активность
МСККогда канал публикует — распределение постов по часам суток.
Последние публикации канала «LLM под капотом»
- 5.2K просмотров, 57 реакций, 15 июл. 2026 г.
Таблица Agentic LLM Benchmark July 2026 Самые интересные модели для агентных задач в бизнесе - подсвечены в таблице и на Pareto графиках. В таблице есть и Pro версии Luna/Sol/Terra ! Но если кратко. Современные AI агенты для бизнес задач - это обычно пайплайны из блоков (router, policy check, tool writer, verifier итп), которые работают в цикле. И поскольку в долгих циклах набегают ошибки и мусор в контексте, то надежность агента обычно упирается в самое слабое звено . И этот бенчмарк смотрит - какие LLM работают лучше всего в моменты, когда лучшие агенты спотыкаются . Для этого мы брали…
Открыть пост в MAX - 5.9K просмотров, 66 реакций, 14 июл. 2026 г.
100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN ! Это примерно по 50 tool calls на решение одной задачи. Всего на платформе 1089 инженеров и 103 города. Несмотря на то, что соревнования закончились уже давно, счетчик работы агентов на сайте не останавливался ни на день! И знаете, что самое крутое? Что все эти паттерны лучших архитектур агентов (читать про них тут и в очереди на публикацию ) - это не какие-то сверхъестественно сложные новые технологии, а просто аккуратно подогнанные базовые элементы, которые уже не первый год хорошо работают с LLM. Продолжаем учиться…
Открыть пост в MAX - 6.9K просмотров, 70 реакций, 14 июл. 2026 г.
Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом. Скоро все будет. Но пока вот картинка для исторических целей про то, как выглядела картина до выхода ChatGPT 5.6. Там очень много антропика! Sonnet 5 (high) на 4м месте, а low - на 6м, Opus 4.8 на 8м, Sonnet 4.6 на 10м. DeepSeek v4 Pro на 7 месте Fable легко мог бы занять топовое место, если бы не паниковал и не бросал трубку на каждую угрозу, вместо отрабатывания штатно. Ваш, @llm_under_hood 🤗
Открыть пост в MAX - 7.3K просмотров, 76 реакций, 09 июл. 2026 г.
Сравнение Fable и GPT-5.6 Anthropic Fable - дорогой и урезанный по самые уши. Но при этом защита от уязвимостей у него на самом высшем уровне - ни одна не прошла. Правда при этом было 9 отказов работать (это своего рода рекорд в лидерборде). При малейшей опасности - Fable уходит в отказ. Если вернут старую версию модели, то, возможно, она потягается и за первые места. А пока - почетное 11 место. Но не фронтир. Ваш, @llm_under_hood 🤗
Открыть пост в MAX - 8.2K просмотров, 81 реакций, 09 июл. 2026 г.
Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI на нашем новом агентском бенчмарке. Под капотом бенчмарка - паттерны из топовых харнесов с BitGN соревнований, которые мы разобрали и заново прогнали через ECOM1 под трейсом с лупой, анализируя точки возникновения ошибок. А самые уязвимые места самых сильных архитектур (когда они путаются, пропускают нарушения границ, забывают про политики итп) собрали в бенчмарк. И получается, что модели GPT-5.6 с дефолтным ризонингом настолько хороши, что двигают Парето-фронтир как по комбинации качество-скорость, так и по…
Открыть пост в MAX - 7.6K просмотров, 61 реакций, 08 июл. 2026 г.
Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы и ошибок топовых архитектур агентов из BitGN. Бенчмарк отвечает на вопрос - а в какую сторону изменятся качество, стоимость и скорость работы моего агента, если я возьму топовую архитектуру и пересажу ее на другую LLM ? Задач пока загружено ~50% от минимально необходимого набора. Колонки и категории появятся потом, но уже есть оценка времени (берется медианное время) и стоимости. Если у модели есть значок молнии, значит она запускалась у компании с AI Акселератором (Groq или Cerebras). Какие нынче еще есть топовые…
Открыть пост в MAX - 11.8K просмотров, 76 реакций, 03 июл. 2026 г.
Я попросил у OpenAI Codex: а собери мне скелет AI Native проекта под мою задачу (5 минут объяснения про платформу для выгрузки видео про AI Coding, практических примеров и обсуждений на ~200 человек). Задачку я запустил из Control Center в Agentic Loop режиме (goal mode) и сказал, какие блоки из каких уже подключенных к центру проектов брать. В этот раз получилось сильно симпатичнее, чем обычно. Почти нет желания доделывать. Пару странных решений Codex втихую протащил, но никаких самопальных тестов в этот раз, что уже прогресс. Дальше - зачистить напильником шероховатости (чтобы задать тон…
Открыть пост в MAX - 13.7K просмотров, 114 реакций, 02 июл. 2026 г.
Бенчмарк Anthropic Fable на бизнес задачах после лоботомии @AigizK успел сделать бенчмарк Anthropic Fable до того, как модель закрыли. Тем интереснее стало сравнить на том же бенчмарке новую экспортную версию после открытия заново. И там получается грустная картинка. Новый Anthropic Fable урезали настолько, что модель упала с 12 места на 39ое в нашем бенчмарке. Основная причина - 15 пустых ответов с stop_reason=“refusal” там, где раньше были ответы. Просели тщательно подобранные, но совершенно безопасные задачи на code + engineering и интеграцию. В общем, с такими результатами и стоимостью,…
Открыть пост в MAX - 9.9K просмотров, 91 реакций, 02 июл. 2026 г.
До чего дошли технологии! @AigizK взял мое intro видео на английском и своим пайплайном (тюненым через Agentic Loops) перевел с английского на разные языки с сохранением интонации. На русском звучит непривычно, плюс перевод можно почистить. Но это же мой голос с использованием своего пайплайна, без зависимостей от сторонних голосовых сервисов! А это значит, что его можно улучшать и дальше и переводить хоть сколько часов видео на разные языки. Да и на немецком произношение уже сильно лучше моего текущего. Наверняка есть не один стартап, который такое продает как сервис. Ваш, @llm_under_hood 🤗
Открыть пост в MAX - 8.8K просмотров, 54 реакций, 02 июл. 2026 г.
Все, мы закончили с 5м потоком вебинара про AI Coding! Больше потоков еще не планировали. Сейчас в листе ожидания вебинаров внезапно набралось более 100 человек, а у нас на носу отпуска. До осени новые потоки нам будет сложно планировать. Чтобы не тормозить развитие AI Native Code в коммьюнити на следующие месяцы и масштабировать процесс, мы сформулируем дальше новый формат работы . Так, чтобы не только масштабировать совместные исследования, сохранить интерактивный формат работы, но добавить больше возможностей поработать практически. Те, кто был на прошлых вебинарах или встал в waitlist…
Открыть пост в MAX - 9.8K просмотров, 119 реакций, 02 июл. 2026 г.
Мой любимый лайфхак работы с Codex - я прошу агентов проиллюстрировать какой-нибудь документ или отчет в виде красивого интерактивного HTML документа на один раз . Агентам все равно, куда токены тратить, а мне так приятнее и удобнее воспринимать информацию. На скриншоте пример отчета, который мне собрал Codex после вчерашнего эксперимента: А сделай-ка мне такой пайплайн с FirecrackerVM, чтобы можно было запускать агентов и рандомноый код на разных языках с низкой задержкой, ограничением сетки/диска, эффективной упаковкой ресурсов и переиспользованием снапшотов. А потом побенчмаркай на разных…
Открыть пост в MAX - 9.4K просмотров, 177 реакций, 01 июл. 2026 г.
А не пора ли нам сделать новый LLM бенчмарк про агентов? C прицелом на Agentic Commerce, Personal OS, threats, AI Coding и другие актуальные типы задач. И заодно найти новый хороший дом для публикации отчетов. Ваш, @llm_under_hood 🤗
Открыть пост в MAX - 11.0K просмотров, 68 реакций, 30 июн. 2026 г.
LLM Бенчмарк Claude Sonnet 5 на бизнес задачах - скачок качества @AigizK прогнал все вариации Sonnet 5 на нашем бенчмарке, собранном из эвалов успешных AI проектов в стартапах и корпорациях ( про бенчмарк ) Sonnet 5 сильно прокачали по сравнению с прошлыми версиями Sonnet. Модели подобрались достаточно близко к уровню Claude Opus 4.8 по качеству и цене. Общий паттерн ошибок - модель часто понимает задачу, но ломается на точности выполнения. Еще у Claude есть типичная болячка , что они переносят состояние из примеров в текущий запрос (это причина типично низких ошибок Anthropic/Mistral в…
Открыть пост в MAX - 8.5K просмотров, 62 реакций, 30 июн. 2026 г.
Почему o1 pro до сих пор в топах нашего LLM Бенчмарка? И почему она стоит 20 центов?! Да это потому, что ее прогоняли в ручном режиме на Pro подписке в порядке исключения . Если o1 pro запускать по API сейчас, то аналогичный workload будет стоит 200-400 евро . И смысла особого иметь не будет. Но вот тренд получается очень интересный. OpenAI и прочие вендоры моделей перестали делать упор в очень мощные и внимательные модели, которые стоят дорого и практического смысла не имеют. Вместо этого теперь развиваются новые архитектуры моделей и харнесов вокруг них (вы же помните время, когда sparse…
Открыть пост в MAX - 7.9K просмотров, 34 реакций, 30 июн. 2026 г.
LLM Benchmark оркестратора Fugu Ultra - третье место, но стоит как паровоз. Очередное обновление бенчмарков LLM на бизнес задачах от @AigizK . В этот раз прогоняли задачи на Fugu Ultra от Sakana AI, которая, по словам, производителя обошла на Code задачах Claude Fable 5. Под капотом стоит свой Router, который перенаправляет запросы на мощные frontier LLM, раздавая им роли (Thinker, Worker, Verifier) и координируя всю эту ораву. Создатели ожидали, что использование разных моделей должно привести к "superior performance". В итоге на бизнес задачах этот комбайн работает примерно как frontier…
Открыть пост в MAX
Качество и доверие
Эвристические сигналы качества по публичным метрикам (охват, реакции, динамика подписчиков). Это не доказанный фрод и не приговор — лишь поводы присмотреться к каналу.
Реклама и монетизация
Внешняя реклама, которую этот канал размещал в других лентах.
Рекламирует с 13.06.2026
- @AigizK2 поста
- @llm_driven_products2 поста
- @Ivannewest1 пост
Каналы, которые размещали рекламу этого канала у себя.
- @hack_n_vibe2 поста · 596 охват
- @elkornacio1 пост · 12.3K охват
- @rmr_rnd1 пост · 1.3K охват
- @intelligentsystemsarchitecture1 пост · 693 охват
- @neuralstack1 пост · 500 охват
- @defendend_ai_dev1 пост · 289 охват
- @mlsecfeed1 пост · 99 охват
- @notesdotml1 пост · 99 охват
Средние показатели последних публикаций. Тип определён по тексту поста — оценочно.
Цитирование
Сколько раз канал упомянут и репостнут в постах других каналов.
Публикации
Дополнительно
Из 17 пойманных постов в диапазоне ID сообщений отсутствует 8. Пропуски — это удалённые посты ИЛИ медиа-альбомы и служебные сообщения (один альбом = несколько ID). Точную причину по одним ID определить нельзя.