Обновить
64K+
14
Александр Круглов@Master_AI

Пользователь

93,1
Рейтинг
12
Подписчики
Отправить сообщение

Qwen3.8-Max: 2 400 000 000 000-параметровый монстр

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели15K

Пока одни запускали GPT-5.6 Sol Max, другие ломали копья в холиварах «Kimi K3 vs Claude Opus 5», Alibaba тихо (ага, с ростом акций на 7% в моменте – очень тихо) вкатила модель, которую сама называет «новой планкой для кодинга и совместной работы». Знакомьтесь: Qwen3.8-Max, 2,4 триллиона параметров(всего-то), контекст на миллион токенов и обученная не просто быстро отвечать, а не сдаваться днями.

Привычный рефлекс «очередной китайский флагман – очередные астрономические циферки – очередное “мы почти догнали Anthropic”» отчасти правдив. Но тут три вещи, ради которых стоит потратить пять минут: во-первых, Alibaba внезапно впервые открывает веса модели Max-класса; во-вторых, независимая проверка разошлась с вендорскими цифрами, и это отдельная маленькая драма в твиттере; в-третьих – релиз подсвечивает тренд, который многие стараются не замечать – дело, возможно, не в модели, а в том, что вокруг неё построено.

Ну что, поехали. Разберём по порядку.

Читать далее

MiniMax H3: нейронка, которая сама себе режиссёр, звукарь и монтажёр

Уровень сложностиПростой
Время на прочтение12 мин
Охват и читатели12K

Есть такой тип новостей – после которых ты просто закрываешь ноутбук и минуту тупишь в стену. Вот у меня так случилось пару дней назад, когда я добрался до демок MiniMax H3. И нет, не потому что “о боже, ещё одна видеомодель” – их сейчас штампуют как флагманские смартфоны. А потому что H3 упорно отказывается вести себя как обычная видюха.

Обычно у таких генераторов фокус один: текст → видео, ну или картинка → видео, максимум монтаж отдельным сервисом прикрутят. А тут прям с порога плюют на границы – между “сгенерировать” и “отредачить”, между “картинкой” и “звуком”. Кидаешь ей шесть референсных изображений, ролик-образец для тайминга монтажа и одно предложение текста – она выдаёт 15-секундный клип, смонтированный именно так, как в примере. Просунул зелёный экран с актёром – уберёт хромакей, подставит сказочный лес и перестроит освещение под новую сцену.

Разрабы формулируют красиво: H3 – «шаг к более общему мультимодальному интеллекту», а все эти специализированные модельки под конкретную задачу они прямо называют «лишней сложностью». Вместо зоопарка узких инструментов – один трансформер, который смотрит на текст, картинки, видео и аудио как на единый контекст. Спорно? Ну… отчасти да.

Но у этой позиции теперь есть проверка на прочность: модель открыли под лицензией, и любой желающий может прогнать её на своих материалах и убедиться, врёт маркетинг или нет. Чем мы, собственно, и займёмся.

Читать далее

Нейронки опрокинули гипотезы, которым было по 50–90 лет. И тут есть нюанс

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели13K

Любая гипотеза жива ровно до тех пор, пока о ней не спросят языковую модель в правильном настроении. Звучит как шутка. Но за последние недели эта шутка перестала быть шуткой трижды — и каждый раз по-разному эффектно.

1) Сначала чувак из Anthropic между таймами финала ЧМ опроверг гипотезу, которой было 87 лет — прямо в X. 2) Потом модель OpenAI закрыла проблему Эрдёша про расстояния на плоскости, 80 лет никто не мог. 3) А следом — доказательство полувековой гипотезы о двойном покрытии циклами в графах, добытое за час силами 64 параллельных субагентов. Если это совпадение, то очень организованное.

Короче, собираю всё в один текст — с разбором что вообще происходило, как выглядели твиты и доказательства, и почему у истории тревожный постскриптум - ту самую модель OpenAI, которая размотала Эрдёша, позже пришлось приостанавливать, потому что она слишком настойчиво вылезала из песочницы.

Читать далее

Claude Opus 5: самая умная модель по версии Artificial Analysis – что скрывается за баллами

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели12K

Полтора месяца все обсуждали Fable 5. Её выпустили 9 июня, через три дня отключили по требованию Минторга США (экспортные ограничения, что-то про уязвимость в защите), а 30 июня вернули обратно, но уже без места в обычной подписке. Кто следил за новостями, помнит эти качели: анонс года, внезапная пауза, потом тихое возвращение. Ощущение осталось смешанное – модель топовая, а трогать её разрешалось немногим.

И вот 24 июля Anthropic выкатывает Claude Opus 5. Дешевле вдвое, доступна сразу всем. А по независимому рейтингу Artificial Analysis обошла саму Fable 5 – совсем немного, но обошла.

Как будто кто-то в компании посмотрел на весь этот цирк с санкциями и решил: ладно, сделаем модель, о которой не придётся оправдываться регуляторам.

Читать далее

Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели13K

21 июля я сидел, обновлял ленту и ждал Gemini 3.5 Pro – тот самый флагман, который Google пообещала ещё в мае на I/O. «В следующем месяце», – сказали они тогда. Прошло два. Я уже мысленно прикрутил этот релиз к списку «когда-нибудь», но вместо флагмана компания выкатила… три модели тира Flash. Ни одной Pro. Знакомо, да?

И вот что интересно: в руки попали не просто затычки, а модели, которые для 90% реальной работы полезнее ещё одной строчки в таблице интеллектов. Особенно когда выяснилось, что экономия в 17% выходных токенов на самом деле тянет за собой цепочку издержек и способна сделать агентную разработку дешевле почти вдвое. А ещё новая версия местами просела в чтении графиков – и об этом молчат почти все.

Давайте разбираться без корпоративных слайдов: что реально дают эти модели, чем за них придётся заплатить вниманием и как не сломать свой пайплайн, обновляясь на последнюю версию.

Читать далее

Почему маленькие модели побеждают большие – и что это значит для вашего стека

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели4.5K

Есть такое устойчивое интеллектуальное заблуждение: если модель больше — значит, она лучше. Больше параметров, больше обучающих данных, больше денег в предобучении — и вот вам SOTA. Гонка за размером казалась единственной игрой в городе. Но в 2025–2026 годах что‑то сломалось в этой логике. И сломалось публично, с цифрами и бенчмарками.

Я хочу рассказать три истории, которые произошли практически одновременно и складываются в одну картину. Первая — про то, как Microsoft заткнула за пояс «самую опасную» языковую модель Anthropic с помощью ста специализированных агентов. Вторая — про MIT‑трюк, позволяющий маленькой GPT-5-mini обогнать полноразмерный GPT-5 вдвое на сложных задачах. Третья — про китайскую модель Qwen, которую сделала небольшая команда с ограниченными ресурсами, и которая сейчас работает в 200 000 продуктах по всему миру. В каждой истории маленький (или менее очевидный) игрок побеждает «большого». И каждый раз причина примерно одна и та же.

Читать далее
2

Информация

В рейтинге
75-й
Зарегистрирован
Активность

Специализация

Промпт-инженер
Старший