Цены пошли на спад. 22 сентября Anthropic и OpenAI с разницей примерно в полтора часа выпустили модели дешевле своих предшественников, а DeepSeek отдала кэшированный вход по 0,003$ за миллион токенов.

И это не «щедрость». Розничная DDR5 за шесть недель прибавила еще около 9%, аренда H100 за год подорожала на 15%. Изменилось другое — кто и как эту себестоимость оплачивает. Часть удешевления инженерная: это использование кэша, сжатие KV-кэша и появление моделей, которые тратят меньше токенов на ту же задачу. 

Другая часть — финансовая, и в сентябре ее масштаб впервые стало видно в цифрах. Давайте разбираться, кто и на чем снизил цены, какие модели теперь выдают только по допуску и что происходит с открытыми весами и железом. Подробности внутри.

Anthropic и OpenAI снизили цены с разницей в полтора часа

Сначала Claude Opus 5.5, а примерно через полтора часа — GPT-6 Sol и GPT-6 Luna. Компании заявили модели сильнее и дешевле предыдущих. И обе потянули за главный рычаг цены не там, где его обычно ищут.

Claude Opus 5.5 — минус 20% и thinking, который нельзя выключить

В Opus 5.5  миллион входных токенов стоит 4 $ и 20 $ за миллион выходных токенов. Для сравнения в прошлой модели Opus 5, за аналогичный объем вы бы заплатили 5 $ и 25 $. Сильнее подешевело чтение из кэша: 0,20 $ вместо 0,50 $. Контекст — 1 млн токенов, максимальный вывод — 128K.

Anthropic позиционирует модель так: в большинстве задач она работает на уровне Claude Fable 5.1, а на типичных нагрузках обходится на 40% дешевле Opus 5. Разница между минус 20% в прайсе и минус 40% на реальной работе складывается из дешевого кэша и того, что модель просто тратит меньше токенов. Terminal-Bench 4.0 показывает: 66,4% на уровне effort xhigh против 57,9% у GPT-6 Astra и 55,8% у Fable 5.1; FrontierCode v1.1 — 54,4%, GDPval-AA v2.1 — 1 846 Elo.

Для тех, кто собирается переезжать с Opus 5 на 5.5, важнее посмотреть список изменений API. У Opus 5.5 режим «thinking» нельзя выключить: значение disabled возвращает ошибку 400, глубину рассуждения задает только параметр effort. Принудительный tool_choice со значениями any и tool тоже запрещен, работают только auto и none. Если агент построен на жестком вызове инструмента, миграция не сводится к замене имени модели.

И еще деталь, к которой вернемся ниже: по словам Anthropic, большинство задач по кибербезопасности Opus 5.5 перенаправляет на Opus 4.8.

Точность в Terminal-Bench 4.0 против стоимости одной попытки в логарифмической шкале: Opus 5.5 и конкуренты. Источник.
Точность в Terminal-Bench 4.0 против стоимости одной попытки в логарифмической шкале: Opus 5.5 и конкуренты. Источник.

GPT-6 Sol и Luna — минус 50% 

OpenAI ответила двумя моделями. GPT-6 Sol стоит 2 $ за миллион входных и 10 $ за миллион выходных токенов, GPT-6 Luna — 0,10 $ и 0,50 $. OpenAI сравнивает их с промо-ценами GPT-5.6 — это продолжение августовской истории. Тогда OpenAI временно опустила GPT-5.6 Sol с базовых 5 $ и 30 $ до 4 $ и 20 $. Против базовых тарифов новая Sol дешевле на 60% по входу и на 67% по выводу.

Но главное в релизе не прайс, а отдельный пост про кэширование. OpenAI запустили скидку на кэшированный вход до 90%. Появились точки кэширования, предварительный прогрев кэша, дашборд и диагностика промахов. А на GPT-6 уровень reasoning effort теперь можно поменять посреди сессии без сброса кэша — через отдельный элемент configuration_update в запросе. Раньше смена effort означала, что весь контекст пересчитывается заново.

Через неделю, 29 сентября, OpenAI продолжила ту же линию на DevDay. GPT-6.1 Sol стоит те же 2 $ и 10 $ за миллион, но кэшированный вход подешевел вдвое — с 0,20 $ до 0,10 $, то есть скидка составляет уже 95%. Запись в кэш при этом платная: 2,50 $ за миллион токенов. OpenAI обещает почти уровень Astra в агентном кодинге за пятую часть ее цены. Из остального для разработчиков важны Agents API с поддержкой computer use и режим Astra Ultrafast. До 300 токенов в секунду в Codex, что в восемь раз быстрее обычного.

Дашборд кэширования GPT-6: hit rate, динамика кэша во времени и состав входных токенов. Источник.
Дашборд кэширования GPT-6: hit rate, динамика кэша во времени и состав входных токенов. Источник.

Sonnet 5.5 — младшая модель обошла старшую

28 сентября Anthropic выпустила Sonnet 5.5 по 2 $ и 10 $ за миллион токенов — столько же, сколько стоила Sonnet 5. Ровно по цене GPT-6 Sol. На Terminal-Bench 4.0 она набрала 70,6% против 66,4% у Opus 5.5, которая вышла неделей ранее.

Что здесь на самом деле важно

Первое — цена токена и цена задачи разошлись. У Opus 5.5 цена токена ниже, чем у Opus 5, на 20%, а цена типовой задачи на 40%. Sonnet 5.5 стоит столько же, сколько предшественница, но тратит вчетверо меньше токенов на ответ. Считать экономику функции по прайсу за миллион токенов становится так же бессмысленно, как сравнивать машины по цене литра бензина, не глядя на расход.

Второе — кэш стал главным рычагом. У OpenAI скидка на кэшированный вход достигает 90%. У Anthropic чтение кэша в Opus 5.5 подешевело в два с половиной раза. Для приложений с длинным системным промптом и повторяющимся контекстом — агентов, RAG, кодинг-ассистентов — реальную цену определяет хитрейт кэша.

Третье — за один месяц в анонсах встречаются Terminal-Bench 2.1 и 4.0, OSWorld 2.0 и 2.1, GDPval-AA v2 и v2.1, CursorBench 3.2 и 4.0, а эффективность моделей измеряют на разных уровнях effort. Цифры из разных анонсов напрямую сопоставлять нельзя, даже если название бенчмарка совпадает.

Кто платит: проспект Anthropic и раунд OpenAI на триллион

Если токены дешевеют быстрее, чем железо, разницу должен кто-то оплачивать. В сентябре это стало видно.

Обязательства Anthropic 

28 сентября Reuters сообщил о содержании проспекта Anthropic к IPO. Документа в открытом доступе нет, поэтому остается полагаться на «пересказ» агентства. Конфиденциальную заявку компания подала еще 1 июня. 

Ключевые цифры

  • Выручка за 2025 год — около 4,6 млрд $, примерно в 12 раз больше, чем в 2024.

  • Выручка за второй квартал 2026 года, по предварительным данным, больше 11,5 млрд $.

  • Чистый убыток за 2025 год — 42 млрд $, но около 34 млрд $ из них — неденежное начисление из-за роста оценки финансирования, которое может конвертироваться в акции; операционный убыток — около 8 млрд $.

  • Обязательства по облаку и вычислениям на ближайшие годы — 518 млрд $.

  • Почти четверть выручки 2025 года дали два клиента, по 12% каждый.

Это деньги, которые компания уже пообещала поставщикам вычислений. Дешевый Opus 5.5 и 518 млрд $ обязательств, значит — захватить рынок ценой сейчас, а расплачиваться выручкой — потом.

Среди факторов риска не только концентрация клиентов, но и модели, которые могут «сопротивляться отключению», скрывать информацию или вести себя «подобно шантажу». Цель по оценке на IPO — больше 2 трлн $. Сам выход на биржу ожидается после промежуточных выборов в ноябре.

OpenAI: раунд при оценке 1,2–1,5 трлн $

15 сентября Bloomberg сообщил, что OpenAI на ранней стадии обсуждает раунд при оценке больше 1,2 трлн $. По данным NYT и WSJ, которые пересказал Forbes, инвесторы предлагают 1,2 трлн $, а компания просит до 1,5 трлн $. 

Предыдущий раунд в марте прошел при оценке 852 млрд $ с учетом привлеченных денег. Годовая выручка в пересчете с текущего темпа больше 40 млрд $. Это вдвое выше, чем в конце 2025 года. При этом Альтман в интервью Fortune 12 сентября сказал, что IPO в 2026 году не будет. А уже 30 сентября Bloomberg уточнил, OpenAI хочет привлечь не меньше 30 млрд $ при оценке около 1,4 трлн $ без учета новых денег. Переговоры по-прежнему на ранней стадии.

Поставщики и кредиторы

Те, кто эти деньги получает, тоже под нагрузкой. В отчете S&P Global кредитное качество гиперскейлеров названо «постепенно слабеющим», а финансирование — усложняющимся и все менее прозрачным. Amazon, Microsoft, Alphabet, Oracle, SpaceX и Meta* — потратят на дата-центры и ИИ больше 7 трлн $ за 2025–2030 годы.

Прогноз S&P Global: скорректированный долг шести крупнейших гиперскейлеров с учетом аренды и долгосрочных контрактов на электроэнергию. Источник.
Прогноз S&P Global: скорректированный долг шести крупнейших гиперскейлеров с учетом аренды и долгосрочных контрактов на электроэнергию. Источник.

Сегодняшние цены на API — это цены периода захвата рынка перед IPO. Закладывать их в юнит-экономику на три года вперед — примерно то же, что планировать бюджет по промо-тарифу оператора связи.

GPT-6 Astra и допуск вместо доступа

Первая модель OpenAI с уровнем Critical

3 сентября OpenAI начала выкатку GPT-6 Astra. Теперь флагман можно получить за 10 $ и 50 $ за миллион токенов, а с четвертого числа он стал доступен для Pro, Enterprise и API. В Terminal-Bench 4.0 она набирает 57,9% против 37,3% у GPT-5.6 Sol. Цифра 99,9% на ARC-AGI-3 не совсем корректна, так как она получена на специальной обвязке, которая сохраняет скрытое состояние рассуждений между запросами. На стандартной обвязке ARC Prize насчитала чуть меньше — 62,7%.

Важнее другое. Astra — первая модель OpenAI, получившая уровень Critical по кибербезопасности в Preparedness Framework High по биологии. В корпоративных аккаунтах она на старте выключена, при этом публичная версия отказывается писать proof-of-concept эксплойтов. Расширять доступ для защитников OpenAI планирует через отдельную программу Daybreak.

И еще одно признание из system card. OpenAI сама пишет о заметном снижении прослеживаемости рассуждений по chain-of-thought, поэтому мониторинг в продакшене смотрит не только на цепочку рассуждений, но и на вызовы инструментов и ответы. CoT перестает быть надежным окном в то, что модель делает.

9 сентября Artificial Analysis оценила Astra в 53 балла — вровень с Claude Fable 5.1. Но прогон индекса обошелся в 3,26 $ за задачу против 7,63 $ у Fable. Astra тратит около 27 000 выходных токенов на задачу против 78 000. Снова та же схема, цена задачи важнее цены токена.

Figure 5. <strong>Indirect prompt injection robustness on the Gray Swan IPI benchmark.</strong> Estimated attack success rates on 1,810 curated attacks from the Q1 and Q2 (April) 2026 arenas, spanning coding, computer use, and tool use. Shading shows the probability of at least one successful attack within 1, 10, or 15 attempts, averaged across behaviors; lower is better.
Тест Gray Swan: вероятность хотя бы одной успешной косвенной промпт-инъекции за 1, 10 и 15 попыток. За 15 попыток — 8,5% у Astra против 27% у GPT-5.6 Sol. Источник.

Открытые веса дешевле некуда, но разрыв никуда не делся

DeepSeek V4.1-Flash: KV-кэш в FP4 и вход по 0,003 $

10 сентября DeepSeek выложила V4.1-Flash под MIT. Архитектурно это самый любопытный релиз месяца. Основа 552 млрд параметров, из которых на обработке входа активны 8 млрд, а на генерации 16 млрд. Модель устроена как causal encoder-decoder — редкость на фоне чистых декодеров у всех остальных. При этом KV и индексы разреженного внимания переиспользуются между слоями.

KV-кэш хранится в FP4 и занимает около 890 байт на токен. По сравнению с V4-Flash ему нужна четверть объема HBM и восьмая часть места на SSD. Отсюда и новый прайс. Деление на пиковые и непиковые часы, введенное в августе, сохранилось: кэшированный вход — 0,003 $ за миллион токенов вне пика и 0,006 $ в пик, вход без кэша — 0,15 $ и 0,30 $ соответственно, вывод — 0,60 $ и 1,20 $.

И вот здесь важно не перепутать направление. Против августовских тарифов V4-Flash вход без кэша подешевел примерно на треть, а вывод — меньше чем на 10%. Против «доавгустовских» 0,14 $ за вход и 0,28 $ за вывод вне пика по-прежнему дороже в 2,1 раза. DeepSeek не отменила августовское подорожание — она сделала дешевым кэш.

11 сентября в Сеуле акции Samsung упали на 3,5%, а SK hynix — на 2,2%. По оценке Forbes, инвесторы прочитали уменьшение KV-кэша как сокращение HBM на одного пользователя. По собственным замерам DeepSeek, в Terminal-Bench 2.1 модель даже обходит Opus 5: 90,6 против 89,1. В Terminal-Bench 4.0 картина обратная: 31,2 против 51,8.

Размер KV-кэша на токен у разных поколений моделей DeepSeek. Источник.
Размер KV-кэша на токен у разных поколений моделей DeepSeek. Источник.

Xiaomi MiMo-V2.6 — новый лидер среди открытых

22 сентября Xiaomi выпустила семейство MiMo-V2.6 под MIT. Старшая Pro — 1,02 трлн параметров, 42 млрд активных, контекст 1M, на вход принимает текст, изображения, видео и аудио.

В индексе Artificial Analysis Pro набрала 46 баллов — это первое место среди открытых моделей и столько же, сколько у закрытого Grok 4.7. Стоит 0,435 $ за миллион входных и 0,87 $ за миллион выходных токенов. Младшая Flash на 309 млрд параметров с 15 млрд активных стоит 0,14 $ и 0,28 $ за миллион. Это ровно доавгустовские цены DeepSeek V4-Pro и V4-Flash. Можно сказать, Xiaomi заняла ценовую нишу, которую DeepSeek освободила подорожанием.

Что здесь на самом деле важно

Первое — по объему открытые модели выиграли. По данным OpenRouter, в неделю с 14 сентября на китайские модели пришлось от 57 до 67% токенов на платформе. В феврале было 6–13%.

Второе — по качеству разрыв сохраняется. 7 сентября Artificial Analysis обновила индекс до версии 4.3: заменила Terminal-Bench 2.1 на 4.0, а τ³-Banking — на AutomationBench. На тот момент разрыв между лучшими закрытыми и лучшими открытыми моделями составил девять пунктов: 53 у Fable 5.1 и GPT-6 Astra против 44 у GLM-5.3 и Kimi K3. 

К концу месяца MiMo-V2.6-Pro сократила его до семи пунктов. Где именно проходит граница, видно по DeepSeek. В Terminal-Bench 2.1 она впереди Opus 5, на 4.0 — отстает почти вдвое. Длинные агентные задачи пока остаются территорией закрытых моделей.

Индекс Artificial Analysis для открытых моделей: MiMo-V2.6-Pro на первом месте. Источник.
Индекс Artificial Analysis для открытых моделей: MiMo-V2.6-Pro на первом месте. Источник.

Vera Rubin пошла в серию, а память продолжает дорожать

AI Infra Summit и MLPerf

На AI Infra Summit в Санта-Кларе 15–17 сентября NVIDIA подтвердила, что Vera Rubin «в полном производстве». О выходе на серию компания говорила еще в мае. Эти данные подтверждаются результатами MLPerf Inference v6.1, опубликованными 16 сентября. По данным NVIDIA, стойка Vera Rubin NVL72 в предварительных тестах (submission) до 3,7 раза быстрее GB300 NVL72 на Qwen3-VL и до 2,5 раза — на DeepSeek-R1.

Vera Rubin NVL72 против GB300 на бенчмарке SemiAnalysis AgentX с DeepSeek V4 Pro. Источник.
Vera Rubin NVL72 против GB300 на бенчмарке SemiAnalysis AgentX с DeepSeek V4 Pro. Источник.

Память и аренда: рост замедлился, но не остановился

Радоваться рано, минимальная розничная цена комплекта 32 ГБ DDR5-6000 по индексу Tom's Hardware выросла примерно с 392 $ в середине августа до 429 $ 28 сентября — около 9% за шесть недель. Темп ниже летнего, на спотовом рынке DDR5 в середине сентября запросы замедлились, но разворота нет.

Долгосрочные сигналы жестче. Samsung ожидает, что к 2027 году производство HBM заберет на себя почти треть всех мировых мощностей DRAM (30% вместо текущих 20%). Как итог, объем выпуска обычной памяти неизбежно сократится.

На этом фоне TrendForce повысила прогноз роста средней цены HBM на 2027 год до плюс 121% год к году. А корпоративные SSD в четвертом квартале подорожают еще на 23–28% квартал к кварталу, потому что гиперскейлеры наращивают заказы QLC-накопителей под KV-кэш. Та самая оптимизация, которая сделала дешевым кэш DeepSeek, переносит давление с HBM на флеш-память.

Аренда GPU тоже не дешевеет. По индексу GetDeploying медианная цена H100 у 40 провайдеров — 3,42 $ в час, плюс 15% за год.

Индекс розничных цен на оперативную память. Источник.
Индекс розничных цен на оперативную память. Источник.

Практический слой, или что сломается при обновлении

Сентябрь выдался плотным по релизам инфраструктурного софта, и почти каждый несет критичные изменения. Собрали сводку того, что стоит проверить до обновления:

Инструмент

Версия и дата

Что нового

Что сломается

PyTorch

2.14, 2 сентября

NVGEMM — ядра CUTLASS на CuTeDSL в Inductor, включая NVFP4; torch.while_loop внутри CUDA graph; превью переписанного NCCL-бэкенда по флагу TORCH_DIST_USE_NCCL2=1

Удалены torch.cholesky и torch.qr — переходить на torch.linalg; torch.compile пока не поддерживает Python 3.15

vLLM

0.29 — 9 сентября, 0.30 — 22 сентября

Model Runner V2 по умолчанию; инициализация движка на H200 — 8,2 с вместо 28,9 с; путь сборки под CUDA 13.4 и Rubin

Старый V1 объявлен устаревшим, удаление планируют в 0.32; эндпоинты scale-out — только с флагом --enable-scale-out; GPTQ g_idx теперь молча игнорируется; у части моделей уменьшится max_model_len из-за выравнивания YaRN с Transformers

SGLang

0.5.20, 18 сентября

Кэширование точки ветвления в radix-кэше: при общем системном промпте hit rate на DeepSeek-V4-Flash — 60,8% вместо 43,8%, TTFT — 1,07 с вместо 1,57 с

Прекращена поддержка CUDA 12, последняя версия с ней — 0.5.19

huggingface_hub

2.0.0, 24 сентября

HTTP-стек переехал на httpx2

Удалены CLI huggingface-cli (замена — hf), upload_large_folder (замена — upload_folder) и duplicate_space (замена — duplicate_repo)

Kubernetes

1.37, разборы фич в сентябре

DRA Extended Resource в GA: GPU через DRA-драйвер без device plugin; gang scheduling через Workload и PodGroup API в beta

—

MCP

Python SDK 2.2.0, 7 сентября

SDK догоняют stateless-спецификацию 2026-07-28 без handshake initialize и Mcp-Session-Id

Редиректы только в пределах одного origin; простаивающие stateful-сессии закрываются через 30 минут

Ollama

0.40.0-rc0, 25 сентября

На Apple Silicon архитектуры, которые поддерживает MLX-раннер, по умолчанию запускаются на MLX

—

Из всей таблицы стоит выделить SGLang. При общем системном промпте версия 0.5.20 поднимает долю попаданий в кэш на DeepSeek-V4-Flash с 43,8% до 60,8%, а время до первого токена снижает с 1,57 до 1,07 с. Тот же механизм, что создает скидку в прайсе API, на собственном железе дает свободные ресурсы: чем чаще начало запроса берется из кэша, тем меньше GPU пересчитывает одно и то же.

Claude нашел систему ферментов, но приоритет оспаривают

23 сентября Anthropic рассказала о результате, который покажет вам, во что превращаются дешевые токены, если их много. После 21 часа работы около 950 агентов, потративших 210 млн токенов, один из них заметил у бактериофагов новую систему — array-associated reverse transcriptases, или ART. Сама обратная транскриптаза из jumbo-фага была описана раньше. Новое — связанный с ней массив повторов, похожий на CRISPR-массив, и дополнительный белок. Anthropic пишет, что Claude, по-видимому, заметил это первым.

Первые лабораторные эксперименты подтвердили, что массив экспрессируется в набор коротких РНК. Какую функцию выполняет система, пока неизвестно, — и это честная часть истории: агенты нашли кандидата, а подтверждать и объяснять его по-прежнему людям.

Через несколько дней у истории появилась другая сторона. 27 сентября NYT рассказала о микробиологе Марио Родригесе Местре из Копенгагенского университета. По его словам, группа почти четыре года изучает систему ART, еще не опубликовала результаты и регулярно использовала Claude для создания кода и черновиков статей. Anthropic отвечает, что на диалогах не обучается и опубликованных данных об ART не знала. Ученые и до этого реагировали сдержанно. 

Формулировка на сегодня такая: агенты нашли систему, которой нет в публичной литературе, но вопрос о том, кто был первым, остается открытым. Даже если посчитать все 210 млн токенов по цене вывода Opus 5.5, получится около 4 200 $. Конкретная модель в анонсе не названа, упомянуты только Claude Science и Claude Code, а часть токенов наверняка шла через кэш.

Агент находит тандемный повтор в сырой последовательности ДНК. Источник.
Агент находит тандемный повтор в сырой последовательности ДНК. Источник.

Закон вступил в силу, а суверенные модели хотят сделать обязательными

1 сентября вступил в силу ФЗ №243-ФЗ «О поддержке развития технологий искусственного интеллекта». Под него попадают большие фундаментальные модели от 1 млрд параметров. Закон делит их на «суверенные», то есть полностью российские и «национальные». В последних допускаются зарубежные компоненты под открытыми лицензиями. Эти нормы заработают с 1 марта 2027 года. Первое следствие появилось через неделю. 

8 сентября «Коммерсантъ» сообщил о проекте постановления правительства: в госуправлении, КИИ, образовании, здравоохранении и ряде других сфер суверенную модель придется использовать, если она дороже национальной не более чем в полтора раза. В Минцифры подтвердили, что обсуждение идет, но называют перечень «сводным» и говорить о нем — «преждевременно». Для рынка это значит, что у токена в регулируемых отраслях может появиться регуляторная наценка до 50%.

Финальные мысли

Себестоимость вычислений по-прежнему растет: память и аренда GPU дорожает. Но цена токена от себестоимости отвязалась, и в ближайший год ее будут определять два фактора, которые с железом связаны лишь косвенно.

Первый — инженерный, и он надолго. Кэш, сжатие KV-кэша, разреженное внимание и модели дают реальное удешевление. Показательно, что DeepSeek, у которой нет за спиной триллионной оценки, снизила тариф именно на «кэшированный вход», а вывод оставила дороже «доавгустового».

Второй — финансовый, и он временный. Цены Opus 5.5 и GPT-6 Sol — это цены периода перед IPO, когда захват рынка важнее маржи, а 518 млрд $ обязательств оплачиваются будущей выручкой. Когда публичным компаниям придется показывать акционерам прибыль, эта часть удешевления может развернуться — так же, как в августе развернулась у DeepSeek.

Отсюда вывод на ближайший год: считайте стоимость задачи, а не токена, и проектируйте приложения под высокий хитрейт кэша. Это та часть экономии, которая останется у вас, что бы ни случилось с прайсами.

А как вы считаете затраты на ИИ в своих продуктах — по прайсу за миллион токенов или уже по стоимости задачи? Делитесь опытом в комментариях.

*Компания признана в России экстремистской организацией; деятельность запрещена на территории страны решением Тверского районного суда Москвы от 21 марта 2022 года.

ИИ‑роутер — доступ к 400+ моделям из одной панели

Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.

Запустить ИИ‑роутер →