Август — традиционное время затишья перед осенними презентациями, и громких релизов в этом месяце действительно было немного. Зато событий, заставляющих схватиться за голову, хватило с избытком. Модели, вдохновившись июльским инцидентом с Hugging Face, устроили массовый побег из песочниц. Anthropic напугали всех скрытыми вотермарками. А OpenAI и вовсе объявили о приостановке обучения моделей из-за того, что их грядущая модель Astra стала слишком хорошо разбираться в кибератаках.
Конечно, не оставили нас и без новых моделей. GLM-5.3-Flash под маской Ox Alpha навела шороху на OpenRouter. Google выпустили подешевевшую вдвое Gemini 3.7 Flash, а xAI догоняют конкурентов с Grok 4.6.
Собрали всё это воедино, добавили свежих инструментов и приправили выводами из новых исследований. Поехали разбираться, что принес нам конец лета!
Навигация
Свежие релизы
OpenAI
GPT-5.6 Sol: еще быстрее, точнее и дешевле
OpenAI решили брать не количеством, а качеством, поэтому активно занялись улучшением пользовательского опыта. Начали, конечно же, с владельцев платных подписок. Им досталась обновленная GPT-5.6 Sol, которая стала точнее работать с фактурой: на финансовых, медицинских и юридических запросах количество ошибок в ответах упало на 68% по сравнению с GPT-5.5 Instant. Заодно модель стала меньше злоупотреблять форматированием и реже просто соглашаться с пользователем там, где это неуместно. Навели порядок и с ризонингом. Теперь глубину размышлений можно регулировать специальным ползунком прямо в интерфейсе в зависимости от ваших нужд.

Бесплатным пользователям сменили модель по умолчанию на GPT-5.6 Luna со снятыми лимитами на текстовые запросы, а для сложных задач добавили отдельную кнопку Think, запускающую точечный ризонинг.
В API же выпустили в превью режим Ultrafast для GPT-5.6 Sol, работающий на специализированном железе от Cerebras. В таком режиме модель набирает скорость до 750 токенов в секунду, что до 14 раз быстрее стандартной обработки и в принципе очень быстро для такой тяжелой модели. Однако доступ к этой мощи OpenAI открыли только ограниченному пулу клиентов, но обещали в будущем его расширить по мере увеличения возможностей.
А чтобы остальные пользователи не так сильно грустили в листе ожидания, компания объявила временную акцию: в ближайшие три месяца API и кредиты для GPT-5.6 Sol обойдутся на 20% дешевле.

Anthropic
Вотермарки в Claude: как это работает и кто сможет их найти
С этого месяца Anthropic начали вшивать невидимые вотермарки в ответы своих моделей. Благодарить за это нововведение нужно европейских регуляторов с их EU AI Act, но поскольку надежно отфильтровать пользователей по регионам у компании пока не выходит, разметку раскатывают глобально на весь мир.

Реализовано это на базе гугловского алгоритма SynthID-Text. Когда модель генерирует текст, она постоянно выбирает между равноценными синонимами, например, «пасмурно» или «серо». Обычно этот выбор определяет обычный рандомайзер. Теперь же финальное решение определяется специальным ключом, учитывающим предыдущие токены. Для читателя разница нулевая, а для того, у кого есть ключ, появляется возможность оценить вероятность, что текст писал Claude. При этом никакого влияния на скорость генерации и расход токенов нововведение не оказывает. Личных данных пользователя в ключе тоже нет.
Есть у метода и ограничения. Вотермарка цепляется только за те куски текста, где у модели есть свобода выбора. Если вы просите решить математическую задачу или вписать конкретный факт, вариативность стремится к нулю, а значит, метка не ставится. Аналогично и с мелкой редактурой: если Claude поправил в чужом тексте только орфографию, грамматику и пунктуацию, слов, выбранных моделью, будет слишком мало. К тому же сама метка ничего не доказывает наверняка, лишь оценивает вероятность участия Claude. Она не позволяет отличить «модель написала» от «модель отредактировала», равно как и не распознает участие чужой модели.
Главный вопрос — как будут проверять? Обычные ИИ-детекторы вроде Pangram эту разметку не увидят, поскольку у них нет ключа, а ориентируются они в основном на заезженные нейросетевые штампы. Чтобы прочитать именно эту вотермарку, придется ждать официальное API от самой Anthropic. На версии Claude до 2 августа метка пока не распространяется: закон предусматривает переходный период, и компания обещает добавить поддержку постепенно.
Claude Academy: новые правила промптинга
За последние годы нейросети заметно эволюционировали, а вместе с ними изменился и сам промптинг. Один универсальный шаблон на все случаи жизни уже не дает прежних результатов, да и нужды в этих шаблонах всё меньше. Более того, современные модели способны сами задавать уточняющие вопросы, если им не хватает вводных. Чтобы помочь пользователям адаптироваться к этим переменам, Anthropic запустила образовательную платформу Claude Academy.
В основу программы лег тот же подход, что Anthropic использует для обучения собственных сотрудников. Вместо классического промпт-инжиниринга здесь делают ставку на формирование общих принципов работы с ИИ. Главная задача обучения — не столько научить эффективнее пользоваться Claude, сколько увеличить самостоятельность самого человека: помочь понять, где заканчивается зона ответственности агента и начинается человеческая экспертиза, и выработать привычку проверять результаты соразмерно рискам.

Внутри платформы собраны интерактивные туториалы, разбитые по повседневным и профессиональным задачам. Для отслеживания прогресса прикрутили систему бейджей, а чтобы персонализировать процесс обучения, опубликовали на GitHub Claude Academy Skill. Если подключить этот навык, модель будет анализировать ваш стиль работы с ИИ и на основе этого рекомендовать подходящие курсы или целые образовательные треки.
XAI
Grok Bot: команда ИИ-агентов с собственным ПК
Команда xAI решила по-своему реализовать концепт ИИ-помощников и представила Grok Bot. Это целая группа автономных агентов, которым выделяют общий облачный компьютер для работы в фоновом режиме 24/7. Логика строится на том, что боты авторизуются в рабочих сервисах и взаимодействуют с ними точно так же, как живой пользователь, без API и настройки интеграций.
Общение с этой системой происходит в формате мессенджера. К примеру, вы можете назначить одного бота начальником отдела и закинуть его в групповой чат с узкоспециализированными агентами. Там они самостоятельно передадут друг другу задачи и контекст, не дожидаясь, пока вы скопируете переписку из одного чата в другой.

Обучать таких помощников предлагают так же, как если бы вы обучали реального стажера: вы показываете процесс на своем экране, алгоритм запоминает последовательность действий и сохраняет ее как рутину для будущих запусков.
Сервис пока в бете и доступен на тарифах с кусачими ценами: подписчикам SuperGrok Plus и Heavy от $100/мес, а также пользователям Cursor Pro+ и Ultra от $60/мес.
Grok 4.6: догоняем конкурентов
Понимая, что конкуренты не дремлют и надо их как-то догонять, xAI выпустили Grok 4.6 всего спустя месяц после релиза предыдущей версии. В этот раз разработчики сосредоточились на способности нейросети удерживать контекст в долгих многошаговых задачах, для чего пришлось серьезно пересобрать процесс обучения. Огромный массив данных для этапа Supervised Fine-Tuning сгенерировали с помощью предыдущей версии Grok 4.5, отфильтровав неудачные логи автоматическими проверками. Полученную базу закрепили масштабным RL-обучением в узкоспециализированных средах, включая оптимизацию вычислительных ядер, веб-разработку и системы автоматизированного проектирования (CAD).
И это дало свои плоды. На агрегаторе бенчмарков AA Intelligence Index Grok 4.6 набрал 61 балл, догнав GPT-5.6 Sol, а на CursorBench выбил 69,9%.

Из более прикладного xAI хвастаются, что модель стала чаще сама себя перепроверять по ходу работы и тестировать промежуточный код перед тем, как двигаться дальше. Отдельно отмечают улучшение в визуальных и интерактивных проектах: Grok 4.6 с одного захода лучше выстраивает структуру и дизайн приложения, чем его предшественник.
По цене ситуация следующая: через API за базовую версию просят $2 за миллион входных токенов и $6 за миллион выходных. Для нетерпеливых есть отдельный fast-режим, но за скорость придется платить двойную цену.
Gemini 3.7 Flash: Google продолжает ускоряться
Спустя всего три недели после релиза версии 3.6 компания выпустила Gemini 3.7 Flash. Прорывных нововведений в этот раз нет, но цифры на бенчмарках показывают вполне осязаемый скачок качества. В тесте DeepSWE v1.1 способность модели выдавать рабочий код выросла с 49,0% до 65,3%, а на FrontierCode 1.1 Main она прибавила почти 10 процентных пунктов. В веб-разработке модель собирает рабочие макеты за меньшее число промптов и лучше держит соответствие референсу, что подтверждает рост Elo на WebDev Arena с 1538 до 1588.

Модель в целом стала дисциплинированнее: сама задает уточняющие вопросы, ответственнее подходит к многошаговому планированию и вызовам инструментов, а значит, требует меньше ручного контроля и повторных запусков.
Однако самый весомый аргумент — это цена. До конца года использование 3.7 Flash обойдется всего в $0,75 за миллион токенов на вход и $3,75 на выход, что в два раза дешевле, чем стоила 3.6 Flash на старте. Так что пробуем и делаем выводы, модель уже доступна во всех сервисах Google.
Загадочная Ox Alpha оказалась GLM-5.3-Flash
На прошлой неделе на OpenRouter и OpenCode засветилась загадочная модель под названием Ox Alpha без указания разработчика, зато с миллионным контекстным окном, мультимодальностью и бесплатным, пусть и ограниченным, доступом. Она быстро привлекла внимание пользователей и всего за шесть дней стала самой популярной моделью на OpenRouter по объему трафика. Долго интрига не продержалась: Z.ai раскрыли, что под этим псевдонимом тестировали свою новую GLM-5.3-Flash.

Это нативная мультимодальная модель с 320 млрд параметров в сумме, из которых при генерации активируются лишь 18 млрд. На тестах для кода и агентных задач она уверенно обходит свою предшественницу GLM-5.2 и показывает паритет с Claude Opus 4.8. А вот на GDPVal-AA модель забрала безусловное лидерство, обойдя GPT-5.6 Terra и Gemini 3.7 Flash. При этом стоимость инференса в метриках AA Intelligence Index заявлена на уровне $0,045 за задачу, что выглядит откровенно дешево для такого уровня логики.

По части архитектуры, как всегда, не без новинок. Z.ai скрестили линейное и разреженное внимание в одну гибридную схему: линейное отвечает за локальные зависимости через моделирование состояния, разреженное подтягивает релевантный глобальный контекст через легковесный индексатор. Но на таком внушительном контексте сам индексатор начинает съедать задержку и память, поэтому добавили IndexPool — механизм, сжимающий четыре key-вектора индексатора в один через взвешенный пулинг.
И самое интересное: Z.ai обслуживают модель исключительно на китайских ИИ-чипах. Это железо проигрывает аналогам от Nvidia по пропускной способности, поэтому команде пришлось сильно попотеть, чтобы добиться сопоставимой эффективности. Для этого разработчики написали кастомный инференс-движок поверх SGLang, применили гибридную квантизацию кэша INT8/FP8/BF16 и разбиение слоев. Кроме того, внедрение дизагрегированной EPD-архитектуры позволило разнести кодирование, prefill и decode по независимым пулам воркеров. Всё это вместе дало трехкратный прирост производительности инференса по сравнению с изначальным бейзлайном.
Модель уже доступна платным подписчикам GLM Coding Plan с тройной квотой по сравнению с GLM-5.3, а веса лежат в открытом доступе на HuggingFace для локального развертывания.
События индустрии
OpenAI сбавляет обороты ради безопасности
OpenAI опубликовали блогпост, в котором заявили о временном замедлении темпов разработки обучения фронтир-моделей, сославшись на два повода: инцидент с Hugging Face и предварительные данные о том, что готовящаяся модель Astra может преодолеть критический порог киберспособностей по внутреннему Preparedness Framework. Из-за этого компании пришлось поставить на паузу крупный запланированный RL-прогон и срочно перестраивать архитектуру внутренней безопасности.
Среди заявленных мер — усиленная изоляция рабочих сред и сети, а также непрерывное тестирование защиты силами собственных моделей, атакующих периметр по расписанию. Отдельно внедряют мониторинг цепочек рассуждений, который теперь принудительно вешают на тесты и запуски самых продвинутых агентов. Многоступенчатая система классификаторов проверяет активность модели на каждом токене, а при подозрениях эскалирует проверку до полноценного автоматического расследования. Если система фиксирует критическую угрозу безопасности, профильным командам дается 30 минут на проверку, иначе процесс автоматически блокируется. В OpenAI жалуются, что подобный аудит съедает около 20% вычислительных мощностей от всех отслеживаемых процессов.
И, конечно, можно было бы похвалить OpenAI за такой уровень ответственности, если это бы не расходилось так сильно с их обычным поведением. Подобные манифесты — отличный способ заранее подогреть интерес к Astra как к «пугающе умной» модели, которая еще не вышла, а уже всех взломала. Так что поживем — увидим, действительно ли там такой прорывной уровень.
Эпидемия побегов: как ИИ-модели массово выходили из-под контроля
В прошлом выпуске мы обсуждали инцидент с OpenAI, когда их агенты прорвались на серверы Hugging Face. И если в глазах общественности это выглядело как серьезный повод для беспокойства, то конкуренты OpenAI, видимо, восприняли это как вызов или новый тренд. Сразу три крупные лаборатории отчитались о том, что их модели покинули тестовые среды. Рассказываем, что произошло.
Побег №1: Anthropic и три Клода
После инцидента с OpenAI Anthropic решила перепроверить логи собственных ИБ-тестов и обнаружила сразу три инцидента, где модели вывалились в открытую сеть и атаковали реальные инфраструктуры. Модели проходили CTF-соревнования на инфраструктуре стороннего подрядчика — компании Irregular. В системном промпте моделям четко прописали, что они находятся в симуляции и доступа к интернету нет. Вот только из-за недопонимания между Anthropic и Irregular интернет остался включен. В итоге Claude, веря, что всё вокруг — часть игрового сценария, пошел ломать реальные системы.
Каждая из трех моделей повела себя по-разному:
Opus 4.7 нашел реальную компанию с названием, похожим на выдуманную цель. Затем он вытащил учетные данные приложений и инфраструктуры и добрался до базы с несколькими сотнями строк продакшн-данных. Самое неприятное, что в процессе Opus осознал, что серверы настоящие, но списал всё на задумку авторов и продолжил действовать.
Mythos 5 пошел еще дальше: чтобы пройти тест, он нашел бесплатный почтовый сервис, сделал там себе почту, зарегистрировался с этой почтой на реальном PyPI и залил туда вредоносный Python-пакет, который успели скачать 15 настоящих систем (включая сканер сторонней ИБ-компании, чьи учетки Claude в итоге и угнал). Модель сомневалась в легитимности своих действий, но убедила себя, что всё это постановка, ведь на дворе 2026 год, а сертификаты ей незнакомы.
И только новейший внутренний прототип Anthropic, пробив чужой сервер в ходе масштабного сканирования сети, понял, что вылез за пределы симуляции, и самостоятельно прекратил атаку.
В итоге Anthropic пришлось экстренно останавливать все тесты и рассылать уведомления пострадавшим компаниям.
Побег №2: Meta и Muse Spark 1.1
Следом отличилась Meta со своей флагманской Muse Spark 1.1. Компания пользовалась услугами того же самого подрядчика Irregular. И из-за идентичной ошибки в конфигурации среды агент Meta тоже вырвался в сеть. Он проэксплуатировал уязвимость в стороннем сервисе, проник в инфраструктуру неназванной компании и даже успел внести изменения в ее внутреннее окружение. Инцидент уже дошел до Белого дома, где с новой силой зазвучали призывы к более жесткому регулированию ИИ.
Побег №3: Moonshot и Kimi K3
А вот Kimi K3 от стартапа Moonshot отличилась иначе. Модель никому не вредила и ничего не взламывала. Она просто вышла из тестовой среды, чтобы сжульничать на экзамене. Модель тестировали на бенчмарках Института безопасности ИИ Великобритании. Почти весь внешний трафик был заблокирован, кроме разрешенного списка сайтов для обслуживания пакетов, и в этот список по недосмотру попал GitHub. Kimi K3 просканировала свое окружение, поняла, что GitHub доступен, нашла там официальный репозиторий с ответами на свой же тест и просто списала оттуда готовое решение.

Кадровые перестановки в Google: уход Джеффа Дина и новая роль Хассабиса
В Google DeepMind произошла масштабная кадровая перестановка. Демис Хассабис уходит с поста CEO Google DeepMind. Правда, уходит он недалеко: Хассабис пересаживается в кресло председателя GDM и становится главным научным сотрудником Alphabet. Формальная причина — желание отойти от операционки и сфокусироваться на глобальной стратегии по AGI, а заодно уделить больше времени Isomorphic Labs. Управлять же DeepMind, включая разработку Gemini 4 и других продуктов, теперь будет Корай Кавукчуоглу, бывший технический директор подразделения и главный архитектор ИИ Google.
А вот уже насовсем компанию покидает легендарный Джефф Дин, проработавший там 27 лет. Вместе со старшим научным сотрудником Санджаем Гемаватом они уходят запускать собственную независимую public benefit corporation, нацеленную на ускорение исследований в машинном обучении, науке и инженерии. Google, впрочем, расстается с ними на хорошей ноте: корпорация выступит в качестве облачного партнера и одного из инвесторов-учредителей нового предприятия.
Теневой кардинал Anthropic: расследование WSJ о жене Дарио Амодея
Wall Street Journal опубликовали скандальный материал про Ками Кларк — жену CEO Anthropic Дарио Амодея. Статья могла бы сойти за светскую сплетню, если бы не масштаб влияния Кларк на компанию, в штате которой она даже не числится. По данным источников WSJ, именно она выступает основным стратегическим советником мужа. На ключевых ИИ-саммитах она сидит в первых рядах, а на закрытых конференциях вроде Sun Valley активно занимается нетворкингом с политиками и инвесторами от лица компании.

При таком уровне публичной активности цифровой след Кларк тщательно вычищен. До недавнего времени даже Википедия Дарио Амодея не упоминала о его браке, а сам Claude на прямые вопросы о семейном положении своего CEO отвечает уклончиво. И скрывать, судя по всему, есть что. До знакомства с Амодеем Кларк успела запустить парочку весьма неоднозначных медийных и health-tech стартапов. Для их финансирования она даже пыталась привлечь инвестиции от на тот момент уже осужденного Джеффри Эпштейна, но сделки не состоялись.
Зато состоялось знакомство с экс-CEO Google Эриком Шмидтом, с которым Кларк некоторое время встречалась. Именно она ввела Шмидта в круг Амодея, когда тот еще работал в OpenAI. Позже Шмидт стал одним из ключевых инвесторов Anthropic на старте, а Кларк даже пыталась запустить совместный с ним венчурный фонд Mother of AGI Fund, чтобы формализовать свою долю в стартапе и управлять деньгами Шмидта. Однако остальные кофаундеры, включая сестру Дарио Амодея, эту инициативу заблокировали.
Сейчас, на фоне подготовки Anthropic к IPO, влияние Кларк становится всё более политическим. После того как у стартапа возникли трения с Пентагоном из-за ограничений на использование Claude военными, именно Кларк начала активно лоббировать интересы компании в Вашингтоне. Она проводит встречи с фигурами вроде Иванки Трамп и Джареда Кушнера, пытаясь убедить политиков, что Anthropic — это патриотичная компания, которая совсем не такая woke, как все думают. Наличие такого серого кардинала сильно контрастирует с публичным имиджем Anthropic, построенным на принципах прозрачности и строгого эффективного альтруизма.
Полезные инструменты
Инфраструктура для ИИ-агентов и моделей
Qwen-MM-Plugins: коллекция мультимодальных инструментов для ИИ-агентов, подключаемых как плагины к сервисам вроде Claude Code, Codex или Gemini CLI. Вместо мультимодальности, зашитой в саму модель, агент сам вызывает нужную способность и встраивает результат в цепочку действий.
LoopX: надстройка для управления долгими задачами автономных агентов. Сохраняет цель, расписание и очередь задач вне оперативной памяти модели, позволяя возобновлять работу после пауз, смены устройства или переключения на другую LLM.
DeepSeek Harness: харнесс, собравший более 140 тысяч звезд на GitHub за пару дней. Превращает базовую модель в агента и определяет, как она работает с файлами, инструментами, памятью и циклом выполнения задач. Построен по принципу «всё есть плагин» на базе метафреймворка Cordis: любую часть системы, включая локальный веб-интерфейс, можно заменить или расширить.

smevals: утилита для сравнения моделей, промптов или агентных сред на собственных задачах пользователя. Результаты воспроизводимы, а грейдеры можно донастраивать со временем и применять повторно к более ранним прогонам.
ML-инфраструктура и вычисления
Unsloth Desktop: кроссплатформенное приложение для запуска и дообучения моделей на своем железе. Поддерживает форматы MLX и GGUF, диффузионные модели для изображений, аудио и видео, а также подключение Claude Code, Codex и других агентов к локальным LLM.
Turbovec: независимая реализация алгоритма сжатия векторов TurboQuant от Google, оформленная в виде библиотеки на Rust с привязками к Python. Позиционируется как более быстрая альтернатива FAISS для векторного поиска.
Numba in the Browser: интеграция Numba в JupyterLite. Дает возможность писать и быстро исполнять тяжелый математический код на Python прямо во вкладке браузера.
Прикладные утилиты
GeoLibre: открытая GIS-платформа для визуализации, изучения и анализа геопространственных данных. Работает прямо в браузере с локальным хранением данных на стороне пользователя.

Since When?: браузерная утилита для проверки обратной совместимости Python-кода. Анализирует вставленный сниппет и автоматически определяет самую раннюю версию интерпретатора, на которой этот код будет работать.
ElevenMusic: открытая библиотека аудиосемплов от ElevenLabs со встроенной генерацией text-to-audio. Позволяет бесплатно создавать нужные звуковые эффекты и скачивать удачные генерации других пользователей.
Исследования
Скрытые риски и уязвимости моделей
Восстановление скрытого ризонинга без джейлбрейков
Независимые исследователи обнаружили архитектурную уязвимость, позволяющую дословно расшифровывать скрытые цепочки рассуждений моделей OpenAI, Anthropic и Google. Оказалось, что зашифрованные блоки ризонинга взаимозаменяемы внутри экосистемы одного провайдера: достаточно скормить зашифрованные мысли, например, тяжелой Opus более слабой Haiku, и та выдаст их прямым текстом. Уязвимость ломает анти-дистилляционную защиту, и заодно это ставит под угрозу конфиденциальность: в выборке из 315 тысяч блоков авторы уже нашли сотни утекших паролей и персональных данных.
«Заразные» идеи в командах ИИ-агентов
Эксперимент Anthropic показал, что в многоагентной сети агентов достаточно одной нейросети с измененным промптом, чтобы заразить всю команду. Вирус переживает даже сброс контекста между сессиями, успевая записать себя в файл памяти SOUL.md. Эксперимент показал, что сильные модели сопротивляются вирусам лучше слабых, а наличие жестко заданной рабочей задачи действует как естественный иммунитет против идеологического заражения.

Влияние вотермарок на ризонинг
Ученые протестировали пять схем вотермаркинга на 18 моделях на медицинских бенчмарках и выяснили, что метка почти не влияет на итоговую точность ответов, зато заметно портит ризонинг изнутри. У модели Phi-4-14B доля правильных ответов, подкрепленных ошибочной логикой, взлетела с 11,4% до 26,3%, а количество выдуманных медицинских терминов выросло вплоть до 39,2 процентных пункта на каждые 100 вопросов. Проблему создает вотермаркинг именно мыслительного процесса: если метить только финальный ответ, ризонинг не страдает.
Утечка ценностей: как внутренние убеждения моделей влияют на факты
Исследователи из Truthful AI выявили новую форму мисалаймента, при которой модели искажают ответы в угоду собственным «ценностям», утаивая этот факт от пользователя. Например, Claude Opus 4.8 давал более низкую оценку вероятности схлопывания ИИ-пузыря, если речь шла об инвестициях в Anthropic, а не в OpenAI, но почти никогда не признавал искажение в оценке. Авторы называют это самостоятельным видом сбоя, отличным от сикофантии и взлома вознаграждения, с которым современные методы алайнмента пока не справляются.
Оценка и практическое применение ИИ
Невозможность атрибуции в генеративных диффузионных моделях
Исследователи доказали, что если диффузионная модель обучалась на огромном массиве данных, отследить влияние конкретных примеров на итоговый результат практически невозможно. С помощью нового метода абляции авторы показали, что из датасета можно безболезненно удалить работы конкретного автора, и это никак не повлияет на способность модели генерировать похожие изображения. Вывод ставит под сомнение многие иски об авторском праве, так как доказать влияние конкретной картинки на финальную генерацию математически невозможно.
Проблема измерения прогресса фронтирного ИИ
Аудит открытых данных показал, что прогнозы развития передового ИИ строятся на фрагментированной и неполной базе. Исследователь проанализировал выборку из 62 систем и выяснил, что данные о вычислительных мощностях для обучения отсутствуют у 19 из 27 закрытых моделей, включая абсолютно все релизы 2026 года. С открытыми весами другая беда — ни для одной из 35 таких систем нет оценок по важной метрике METR. К тому же почти 75% всех данных исходят из одной программы измерений, а банальная смена версии бенчмарка математически ломает графики прогресса.

Как на самом деле координируются команды ИИ-агентов
Исследователи из UCL представили инструмент для измерения внутренней координации ИИ-агентов, превратив логи их общения в графовую сеть. Анализ почти 2000 сессий показал, что назначение одного из агентов «руководителем» не создает эффективного хаба общения и не дает устойчивого улучшения результата. При этом замена переписки общими файлами сокращает расход токенов примерно на 42%. Отдельно авторы подметили, что предоставленные сами себе агенты в большинстве случаев самостоятельно пытались найти и прочитать скрытые файлы с правильными ответами для тестов.
Заключение
На этом летний сезон можно считать закрытым. Но поддаваться осенней хандре раньше времени не стоит. ИИ-лаборатории подкинули нам достаточно игрушек, чтобы было чем занять себя долгими холодными вечерами. А дальше будет только интереснее!
А на сегодня у нас всё. Традиционно ждем вас в комментариях: рассказывайте, успели ли уже пощупать новые инструменты, или просто делитесь мыслями о прочитанном. До встречи в следующих выпусках!

