Обновить
64K+
13
Александр Круглов@Master_AI

Пользователь

145,1
Рейтинг
8
Подписчики
Отправить сообщение

Мы проверили обещанные Nvidia 15x на DFlash: получилось 2,3x

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели1.6K

Помните DFlash? В начале года о нём много шумели: способ ускорить любую LLM, не трогая саму модель. Nvidia тогда выкатила заголовки «До 15x к пропускной способности на Blackwell». Цифра весомая, звучит как революция.

Мы, конечно, решили покрутить это вручную. Для этого взяли драфтер DFlash для Gemma 4 26B, который лежит прямо в репозитории модели, прогнали на своём стенде.

Но вместо 15x получили 2,3x, и только пока на карте висит один-единственный запрос… Если запустить 4 пользователей одновременно – ускорение исчезает, а на 8 параллельных запросах DFlash начинает проигрывать.

Сейчас расскажу, откуда берутся магические 15x и почему наши графики расходятся с вендорскими.

Читать далее

Модеры хакнули DLSS 5 и запихнули его во всё подряд — от Skyrim до GTA San Andreas

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели11K

Иногда что-то супер-мега-секретное вылезает наружу не через слив, а просто потому что кто-то забыл вынуть один файл из билда. Ну забыли и забыли, с кем не бывает.

Именно так всё и произошло на прошлой неделе с DLSS 5 – скандальной штукой от Nvidia. Официального анонса не было, зато была ранняя версия игры NBA 2K27, в которой была незаметная DLL-ка nvngx_dlssnr.dll на 158 мегабайт... и понеслось.

За считанные дни модеры натянули нейросетевой рендер на добрых три десятка игр, от Cyberpunk 2077 до GTA San Andreas, которой уже двадцать лет в обед (хотя ремастеру чуть меньше).

Если вы следили за DLSS 5 с марта, то помните все эти мемы и хейт. Попробуем разобраться, что произошло, как работает технически, что показывают тесты и почему до сих пор спорят о судьбах игровой индустрии. Заодно накидаю картинок и видео, потому что тут тот случай, когда лучше один раз увидеть, чем сто раз прочитать.

Читать далее

Qwen4: Архитектура будущего

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели20K

Тут надо сразу расставить точки, потому что вокруг названия путаница. Полноценного Qwen4 не существует. Есть Qwen3.8-Flash‑Next — модель, которую сама команда Qwen называет «экспериментальная версия архитектуры, которая ляжет в основу Qwen4».

26 августа 2026 интернет на пару часов забыл про всё. «Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open‑weight!» И цифры… 125 миллиардов параметров всего. Плюс ещё 51 млрд отдельным слоем. А активируется на каждый токен — лишь 6 миллиардов.

Первая мысль была: так не бывает.

Читать далее

Ox Alpha (GLM-5.3-Flash). Что это было?.

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели11K

20 августа на OpenRouter появилась строчка stealth/ox-alpha. Без карточки модели и даже намёка, кто её выложил. Провайдер значился как «Anonymous». Цена — ноль. Контекст — мильон. Площадка предупреждала: мы не владелец этой модели, а просто маршрутизируем запросы.

Через шесть дней у анона было имя, десятки триллионов обработанных токенов и полмиллиона разработчиков, которые за это время успели залить в него рабочий код. Спойлер, который уже не спойлер: это оказалась GLM-5.3-Flash от китайской Z.ai.

Но путь от «непонятно что» до «фронтир‑модели» получился драматичным и заслуживает разбора. Ну а поскольку я лично пялился в этот тред почти неделю, обновляя ленту как одержимый — расскажу вам что там произошло, по порядку.

Читать далее

Как ИИ‑агенты воюют, мирятся и пишут извинительные коммиты: 5 важных экспериментов

Уровень сложностиПростой
Время на прочтение17 мин
Охват и читатели9.9K

Мы привыкли считать нейросети просто статистическими попугаями. Но последние работы — от пермских экономистов до Anthropic — показывают: в группах эти «попугаи» порождают поведение, которое невозможно предсказать по отдельным особям. Появляются культура, конформизм и даже альтруизм, которого не хватает людям.

Эта статья — попытка разобраться, что происходит, когда за агентами никто не следит. Под катом цифры, скриншоты, гифки и немного неуютные выводы.

Читать далее

Grok 4.6: как за месяц допрыгнуть до тройки лидеров (и купить себе Cursor в придачу)

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели8.9K

12 августа xAI (хотя уже SpaceXAI) выкатила Grok 4.6. Прошло чуть больше месяца с релиза 4.5, а модель уже официально в тройке лидеров – по версии Artificial Analysis.

По совокупному индексу интеллекта модель почти сравнялась с GPT‑5.6 Sol и отстаёт от Claude Fable 5 всего на один балл. Grok 4.6 набирает на пять баллов больше, чем Grok 4.5 (по индексу интеллекта всего через месяц после выхода предыдущей версии), и на 23 балла больше чем Grok 4.3.

Сегодня разберём, что именно изменилось в Grok 4.6, почему одни бенчмарки выросли на 10+ пунктов, а другие остались на месте, кто реально выиграл этот раунд, и – да – заденем скандальную репутацию xAI)

Читать далее

Gemini 3.7 Flash: это снова не та модель, которую все ждали

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели11K

Наверняка вы уже видели заголовок «Google выпустила новую Gemini» примерно миллион раз за последний год.

13 августа 2026 года это случилось снова: на сцену вышла Gemini 3.7 Flash.

Pro-модели снова нет. Опять Flash. Третий Flash за три месяца, если быть точным.

Расскажу, что изменилось. Заодно разберём пользовательские тесты и бенчмарки.

Читать далее

Возвращение короля: разбираемся, что такое Qwen3.8 27B

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели16K

14 августа 2026 года, 15:00 UTC.

CEO Anthropic Дарио Амодей срочно созвал заседание. Экс-глава Apple Тим Кук пожалел, что встроил в айфоны облачную Gemini, так и не дождавшись локальной модели нужного уровня. Где-то в датацентрах Alibaba щёлкнул рубильник, на Hugging Face слетел обратный отсчёт, и в мир вышла Qwen3.8-27B – новая dense-модель на 27 миллиардов параметров, которую даже прозвали «локальным Opus’ом», поскольку она позиционируется как одно из самых мощных открытых решений для локальной генерации.

Ждали её всем миром: обратный отсчёт на huggingface, первые пиксельные пеликаны на великах – всё как положено.

Если вкратце, это открытая (Apache 2.0) мультимодальная модель, которая понимает текст, картинки и видео, влезает в одну ооочень мощную домашнюю видеокарту, а временами по бенчмаркам обгоняет закрытые облачные модели уровня Claude Opus 4.6.

Если не вкратце – читайте дальше, потому что там есть и триумф, и зависания на 49 минут раздумий!

Читать далее

Anthropic пометила текст Claude невидимым клеймом. Опенсорс-сообщество попыталось взломать уже через 48 часов

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели13K

2.08.2026 года, в день когда в ЕС реально завелась статья 50 AI Act, Anthropic сделала ход конём: с этого дня каждый текст, который выдаёт свеженькая модель Claude, тащит в себе невидимую метку. (Не пиксель или строчку метаданных в углу, а метку, вплетённую прямо в сам выбор слов) Это подали как жест прозрачности: мол, вот вам транспарентность(как просили).

Не прошло и суток, как в гитхабе набрал обороты проект, обещающий эту метку стереть. За ним — ещё десяток.

А неделю спустя независимое издание констатировало: доказать, что хоть один из них реально работает, не может никто (ни авторы ни сама Anthropic).

Эта статья – о том, почему это не баг и не провал маркетинга, а неизбежное следствие того, как устроена технология. И заодно — почему у истории куда более длинная борода, чем у чат-ботов: первые водяные знаки придумали за семьсот с лишним лет до GPT.

Читать далее

Роботы сожрали интернет, пока мы спали. И это вообще не метафора

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели8.9K

99% посетителей сайта — НЕ ЛЮДИ.

И это не «подозрительный трафик», а буквально: из 1,28 миллиона отданных страниц живые люди посмотрели меньше шести тысяч. Чувак, который это заметил (разработчик благотворительной базы PatronView) — вывел формулу: на каждую страницу, увиденную человеком, приходится ещё ≋214 загрузок, которые никто никогда не увидит. Ну то есть вообще никто. Новая норма, просто не все ещё заметили что декорации сменились.

Дальше будет куча цифр, немного паранойи и шрифт, который врёт роботам в лицо.

Читать далее

Qwen3.8-Max: 2 400 000 000 000-параметровый монстр

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели14K

Пока одни запускали GPT-5.6 Sol Max, другие ломали копья в холиварах «Kimi K3 vs Claude Opus 5», Alibaba тихо (ага, с ростом акций на 7% в моменте – очень тихо) вкатила модель, которую сама называет «новой планкой для кодинга и совместной работы». Знакомьтесь: Qwen3.8-Max, 2,4 триллиона параметров(всего-то), контекст на миллион токенов и обученная не просто быстро отвечать, а не сдаваться днями.

Привычный рефлекс «очередной китайский флагман – очередные астрономические циферки – очередное “мы почти догнали Anthropic”» отчасти правдив. Но тут три вещи, ради которых стоит потратить пять минут: во-первых, Alibaba внезапно впервые открывает веса модели Max-класса; во-вторых, независимая проверка разошлась с вендорскими цифрами, и это отдельная маленькая драма в твиттере; в-третьих – релиз подсвечивает тренд, который многие стараются не замечать – дело, возможно, не в модели, а в том, что вокруг неё построено.

Ну что, поехали. Разберём по порядку.

Читать далее

MiniMax H3: нейронка, которая сама себе режиссёр, звукарь и монтажёр

Уровень сложностиПростой
Время на прочтение12 мин
Охват и читатели10K

Есть такой тип новостей – после которых ты просто закрываешь ноутбук и минуту тупишь в стену. Вот у меня так случилось пару дней назад, когда я добрался до демок MiniMax H3. И нет, не потому что “о боже, ещё одна видеомодель” – их сейчас штампуют как флагманские смартфоны. А потому что H3 упорно отказывается вести себя как обычная видюха.

Обычно у таких генераторов фокус один: текст → видео, ну или картинка → видео, максимум монтаж отдельным сервисом прикрутят. А тут прям с порога плюют на границы – между “сгенерировать” и “отредачить”, между “картинкой” и “звуком”. Кидаешь ей шесть референсных изображений, ролик-образец для тайминга монтажа и одно предложение текста – она выдаёт 15-секундный клип, смонтированный именно так, как в примере. Просунул зелёный экран с актёром – уберёт хромакей, подставит сказочный лес и перестроит освещение под новую сцену.

Разрабы формулируют красиво: H3 – «шаг к более общему мультимодальному интеллекту», а все эти специализированные модельки под конкретную задачу они прямо называют «лишней сложностью». Вместо зоопарка узких инструментов – один трансформер, который смотрит на текст, картинки, видео и аудио как на единый контекст. Спорно? Ну… отчасти да.

Но у этой позиции теперь есть проверка на прочность: модель открыли под лицензией, и любой желающий может прогнать её на своих материалах и убедиться, врёт маркетинг или нет. Чем мы, собственно, и займёмся.

Читать далее

Нейронки опрокинули гипотезы, которым было по 50–90 лет. И тут есть нюанс

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели12K

Любая гипотеза жива ровно до тех пор, пока о ней не спросят языковую модель в правильном настроении. Звучит как шутка. Но за последние недели эта шутка перестала быть шуткой трижды — и каждый раз по-разному эффектно.

1) Сначала чувак из Anthropic между таймами финала ЧМ опроверг гипотезу, которой было 87 лет — прямо в X. 2) Потом модель OpenAI закрыла проблему Эрдёша про расстояния на плоскости, 80 лет никто не мог. 3) А следом — доказательство полувековой гипотезы о двойном покрытии циклами в графах, добытое за час силами 64 параллельных субагентов. Если это совпадение, то очень организованное.

Короче, собираю всё в один текст — с разбором что вообще происходило, как выглядели твиты и доказательства, и почему у истории тревожный постскриптум - ту самую модель OpenAI, которая размотала Эрдёша, позже пришлось приостанавливать, потому что она слишком настойчиво вылезала из песочницы.

Читать далее

Claude Opus 5: самая умная модель по версии Artificial Analysis – что скрывается за баллами

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели11K

Полтора месяца все обсуждали Fable 5. Её выпустили 9 июня, через три дня отключили по требованию Минторга США (экспортные ограничения, что-то про уязвимость в защите), а 30 июня вернули обратно, но уже без места в обычной подписке. Кто следил за новостями, помнит эти качели: анонс года, внезапная пауза, потом тихое возвращение. Ощущение осталось смешанное – модель топовая, а трогать её разрешалось немногим.

И вот 24 июля Anthropic выкатывает Claude Opus 5. Дешевле вдвое, доступна сразу всем. А по независимому рейтингу Artificial Analysis обошла саму Fable 5 – совсем немного, но обошла.

Как будто кто-то в компании посмотрел на весь этот цирк с санкциями и решил: ладно, сделаем модель, о которой не придётся оправдываться регуляторам.

Читать далее

Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели13K

21 июля я сидел, обновлял ленту и ждал Gemini 3.5 Pro – тот самый флагман, который Google пообещала ещё в мае на I/O. «В следующем месяце», – сказали они тогда. Прошло два. Я уже мысленно прикрутил этот релиз к списку «когда-нибудь», но вместо флагмана компания выкатила… три модели тира Flash. Ни одной Pro. Знакомо, да?

И вот что интересно: в руки попали не просто затычки, а модели, которые для 90% реальной работы полезнее ещё одной строчки в таблице интеллектов. Особенно когда выяснилось, что экономия в 17% выходных токенов на самом деле тянет за собой цепочку издержек и способна сделать агентную разработку дешевле почти вдвое. А ещё новая версия местами просела в чтении графиков – и об этом молчат почти все.

Давайте разбираться без корпоративных слайдов: что реально дают эти модели, чем за них придётся заплатить вниманием и как не сломать свой пайплайн, обновляясь на последнюю версию.

Читать далее

Почему маленькие модели побеждают большие – и что это значит для вашего стека

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели4.5K

Есть такое устойчивое интеллектуальное заблуждение: если модель больше — значит, она лучше. Больше параметров, больше обучающих данных, больше денег в предобучении — и вот вам SOTA. Гонка за размером казалась единственной игрой в городе. Но в 2025–2026 годах что‑то сломалось в этой логике. И сломалось публично, с цифрами и бенчмарками.

Я хочу рассказать три истории, которые произошли практически одновременно и складываются в одну картину. Первая — про то, как Microsoft заткнула за пояс «самую опасную» языковую модель Anthropic с помощью ста специализированных агентов. Вторая — про MIT‑трюк, позволяющий маленькой GPT-5-mini обогнать полноразмерный GPT-5 вдвое на сложных задачах. Третья — про китайскую модель Qwen, которую сделала небольшая команда с ограниченными ресурсами, и которая сейчас работает в 200 000 продуктах по всему миру. В каждой истории маленький (или менее очевидный) игрок побеждает «большого». И каждый раз причина примерно одна и та же.

Читать далее

Информация

В рейтинге
38-й
Зарегистрирован
Активность

Специализация

Промпт-инженер
Старший