Неделя выдалась такая, что впору сериал снимать с открытым финалом. Модели штампуют быстрее, чем успеваешь придумывать им имена, лидерборды переворачиваются за завтраком, а где-то в недрах OpenAI десять тысяч автономных агентов молча уселись решать задачу, за которую математики бьются с прошлого века (и, кажется, решили).

Что же произошло на этой неделе?


Большие модели недели

Gemini 3.8 Flash: третье обновление за три месяца

Google выкатила Gemini 3.8 Flash – ровно через три недели после 3.7 Flash, уже третье обновление линейки за три месяца.

Секрет прост: модель «делает больше работы» на сложных задачах – выполняет больше шагов рассуждений и чаще вызывает инструменты, тратя больше токенов ради результата.

На DeepSWE v1.1, тесте на автономное решение сложных инженерных задач, 3.8 Flash обходит большинство более крупных фронтир-моделей за долю их стоимости.

Qwen3.8-Max ненадолго обогнал Claude Opus 5

2 сентября модель Alibaba Qwen3.8-Max-0902 вышла на первое место в рейтинге Code Arena WebDev, обогнав Claude Opus 5 Max на три балла – при той же цене в $2 за миллион входных и $6 за миллион выходных токенов.

Красивая история про то, как китайская модель обошла условного тяжеловеса, продержалась ровно пять дней: к 7 сентября таблица снова перестроилась – Claude Fable 5.1 Max набрал 1896 очков, GPT-6 Astra Max – 1860, Claude Opus 5 Max – 1766, а Qwen3.8-Max-0902 скатился на четвёртое место с пометкой «предварительно».

DeepSeek выпустил V4.1-Flash

DeepSeek представил модель V4.1-Flash с нативной мультимодальностью и анонсировал поэтапный вывод V4-Pro. Это самая компактная модель в новом семействе – MoE на 552 млрд параметров с архитектурой causal encoder-decoder, где на вход активно 8 миллиардов параметров, на выход – 16.

image
DeepSeek заявляет, что новая модель превосходит V4-Pro по скорости и стоимостиge

Приятная деталь: требования к KV-кешу снижены – модели нужна лишь четверть HBM-памяти и одна восьмая SSD-хранилища по сравнению с прошлым поколением. С 14 сентября все запросы к deepseek-v4-pro автоматически переключат на V4.1-Flash.

GPT-6 Astra: первая модель OpenAI, получившая наивысший уровень риска

Спустя год после запуска GPT-5 компания представила GPT-6 Astra – модель, которую OpenAI назвала «самой умной и согласованной».

За день до релиза компания подтвердила: Astra получила статус «критического» риска в кибербезопасности – первый случай, когда модель OpenAI получает наивысший уровень угрозы хоть в одной из трёх отслеживаемых областей.

Из бенчмарков: FrontierMath Tier 4 (v2) – 97,6%, GPQA Diamond – 96,0%, ARC-AGI-1 – 98,5%, хотя на Humanity’s Last Exam с инструментами модель неожиданно уступила Fable 5.1 от Anthropic, вышедшей парой дней ранее.

ChatGPT 6 уже доступна в GPTunneL.

Попробуйте модель здесь:

GPT 6 Astra


Инфраструктура

NVIDIA покупает Hugging Face за $12,93 млрд

Дженсен Хуанг объявил, что NVIDIA приобретает Hugging Face за $12 930 300 000.

Платформой пользуются более 18 миллионов разработчиков и создателей контента, которые делятся более чем 3 миллионами моделей, 500 тысячами датасетов и миллионом приложений. Ей же пользуются свыше 200 тысяч компаний.

NVIDIA обещает, что платформа останется открытой: разработчики по-прежнему смогут выбирать любые модели, фреймворки и облака, а вычисления NVIDIA не станут обязательным условием.

NVIDIA PAIR

Раз уж заговорили про NVIDIA – компания также запустила PAIR (Personal AI Router), опенсорсный роутер для домашней сети, который задействует простаивающие Mac и PC для обработки запросов ИИ-агентов вроде NemoClaw, OpenClaw или Hermes через субагентов.

Демонстрация работы PAIR – распределение запросов между устройствами в сети
Демонстрация работы PAIR – распределение запросов между устройствами в сети

PAIR не объединяет GPU в единый ускоритель и не делит один запрос на несколько машин – он просто отправляет отдельные запросы на подходящий свободный узел через уже установленные Ollama или LM Studio, поддерживая Mac на M4+ и GeForce RTX 20xx+. В тесте с двумя PC на RTX 5090 и моделью Qwen3.6 35B A3B пять субагентов ускорили работу примерно в 1,6 раза.

Google задействует DDR4 из списанных серверов

Вот вам иллюстрация дефицита памяти: Google начал вытаскивать модули DDR4 из списанных серверов и переиспользовать их в новых ИИ-машинах.

Нихил Чериан, старший директор по инфраструктуре цепочки поставок Google, признал на форуме: индустрия за считаные месяцы перешла от дефицита вычислений к дефициту памяти – высокопроизводительная память сейчас составляет около 75% стоимости комплектующих типового ИИ-сервера. Компания даже спроектировала специальные адаптеры для подключения устаревшей DDR4-памяти к новому поколению серверов, выстроив внутреннюю цепочку рециклинга, и параллельно оптимизирует архитектуру моделей и сжатие KV-кеша.


Другие релизы

ChatGPT Images 2.5: быстрее и точнее

OpenAI представила ChatGPT Images 2.5. Компания заявляет о снижении задержки генерации наполовину. А главное практическое улучшение – точечное редактирование: модель меняет только то, что попросили, не затрагивая остальную композицию. Все, кто просил поменять фон и получал взамен другое лицо на фото, поймут ценность апдейта.

Обновлённая модель лучше держит последовательность в длинных сессиях редактирования и по-прежнему хорошо работает с прозрачным фоном.

Разработчики смогут выбрать один из вариантов новой модели: GPT-Image-2.5 Flare и Sunburst.

GPTunneL включил «Гром Телевизор»

На ИИ-платформе GPTunneL появился «Гром Телевизор» – бесконечный ИИ-эфир, где зрители сами придумывают, что сейчас будет показывать телевизор. Достаточно написать промпт вроде «Гэндальф варит зелье со Скуби-Ду» – через 20 секунд нейросеть сгенерирует ролик и отправит в общий эфир.

За непрерывностью трансляции спрятан пайплайн: видео со звуком генерируется примерно за 7,8 секунды на Nvidia B200, затем ffmpeg обрабатывает ролик и отдаёт его в HLS-поток. Если пользовательских промптов нет, сюжеты для эфира придумывает сама модель Grom. Это телевидение, которое не снимали заранее – оно сочиняет себя во время просмотра. Присоединяйтесь на GPTunnel, Twitch и YouTube.

Suno выкатывает v6 – с благословения Warner, BMG и Believe

Suno запустила новую модель v6 сразу в трёх версиях – и полностью отключает старые.

Флагманская v6 обещает отполированный результат в любом жанре; v6-wild – та же линейка, но менее предсказуемая, для экспериментов; v6-mini – бесплатная и, по заверению компании, самая быстрая среди бесплатных моделей на музыкальных платформах.

Три модели v6 в интерфейсе Suno
Три модели v6 в интерфейсе Suno

Из практичного: теперь можно менять отдельные части готовой песни текстовым запросом – например, попросить, чтобы припев спел госпел-хор, не трогая остальное, или собрать мэшап из вокала одной песни и барабанов другой.

А вот что Suno старательно не говорит – так это на чём именно обучены новые модели. Компания называет Warner, BMG и Believe соразработчиками, но не раскрывает составы каталогов и ранее просила засекретить размер обучающих данных.

Microsoft превращает Excel в живой дашборд

Microsoft готовит функцию Excel Canvas – Copilot-инструмент, который собирает данные таблицы в единый дашборд с графиками и метриками, автоматически обновляющийся при изменении исходных данных.

По сути, конец эпохи ручного форматирования диаграмм под очередную презентацию для начальства. Функция значится в дорожной карте Microsoft AI at Work под номером 569424 со статусом «в разработке», ожидается на десктопе и в вебе к сентябрю 2026-го (но статус намекает: это скорее пожелание, чем обещание).


Наука и культура

Толстой снова «отвечает» на вопросы – устами «Алисы»

Ко дню рождения Льва Толстого 9 сентября «Яндекс» запустил ИИ-персонажа писателя в чате с «Алисой». Достаточно сказать «Алиса, позови Льва Толстого», и начинается диалог, где классик отвечает цитатами из своих книг и дневников.

Роверы «Яндекса» разъезжают по улице Льва Толстого с цитатами из его дневников
Роверы «Яндекса» разъезжают по улице Льва Толстого с цитатами из его дневников

Специалисты поработали с архивными аудиозаписями, убрали шумы и настроили синтез речи так, чтобы передать интонации писателя.

В мини-квестах по мотивам произведений можно самому повлиять на сюжет – придумать, как встретятся Наташа Ростова и Андрей Болконский, или помочь Жилину сбежать из плена; всё это доступно с 9 по 14 сентября.

Плюс на «Яндекс Картах» появилась 3D-модель усадьбы «Хамовники», по которой можно «прогуляться» и понаблюдать за роверами, транслирующими цитаты из дневников прямо у стен усадьбы.

Погода нынче чудная. Только купаться нельзя. Очень холодно по ночам.

ИИ решил задачу тысячелетия

Математики OpenAI объявили, что группа из 10 000 автономных ИИ-агентов нашла «сингулярность» в уравнениях Навье – Стокса в трёхмерном пространстве, решив тем самым одну из шести оставшихся задач тысячелетия Института Клэя с призом в миллион долларов. Результат формально проверен на языке Lean.

Уравнения Навье – Стокса описывают, как текут жидкости, и с середины XIX века остаётся открытым базовый вопрос: могут ли их решения «взрываться», то есть развиваться так, что бесконечно малая часть жидкости начинает течь бесконечно быстро.

Визуализация решения OpenAI – вихрь, где жёлтый цвет обозначает более быстрое вращение, синий – более медленное
Визуализация решения OpenAI – вихрь, где жёлтый цвет обозначает более быстрое вращение, синий – более медленное

Около сотни агентов OpenAI работали примерно 50 часов над опровержением регулярности для уравнений Эйлера, а затем 10 000 агентов потратили 88 часов на доказательство сингулярности для Навье – Стокса плюс ещё 17 часов на формализацию результата. Всего агенты обменялись почти 5 миллионами сообщений.


Важные цифры недели

  • $12 930 300 000 – именно во столько обошлась NVIDIA покупка Hugging Face.

  • 10 000 автономных агентов и почти 5 миллионов сообщений – именно столько потребовалось OpenAI, чтобы найти сингулярность в уравнениях Навье – Стокса.

  • 75% – такую долю стоимости комплектующих ИИ-сервера сейчас занимает память.

  • $5000 – текущая цена видеокарты RTX 5090 при изначальном ценнике в $2000.

  • 50% – на столько OpenAI сократила задержку генерации в ChatGPT Images 2.5.

  • 3 балла – такой разрыв позволил Qwen3.8-Max-0902 на пять дней занять первую строчку рейтинга Code Arena.

  • 198 лет – столько исполнилось Льву Толстому 9 сентября.


Ну, вот и все семь дней. Спасибо, что дочитали до конца – неделя выдалась напряжённая, и, чувствую, следующая будет не легче. Google явно готовит Gemini 4, у Anthropic и OpenAI явно есть что ответить, а споры вокруг задачи тысячелетия ещё наверняка получат продолжение. Берегите память в серверах и головах, до встречи через неделю!

Читать подробнее:

GPT Images 2.5: новая нейросеть для генерации изображений от OpenAI
Как же за всем этим успевать? За это время вышли ещё и обновлённый DeepSeek, и результаты по Навье-С...
habr.com
Grom TV: первый в России бесконечный онлайновый ИИ‑телевизор
Последние недели у меня в рабочих чатах через слово мелькает фраза «а давай Гэндальф сварит зелье со...
habr.com
ChatGPT-6 Astra: подробный обзор новой модели
Обычно к очередному релизу я отношусь спокойно: ну, ещё одна циферка на бенчмарке. Но тут даже я, по...
habr.com