В мае 2026 года Anthropic объявила, что получает Colossus 1 – кластер мощностью больше 300 МВт, где стоит свыше 220 тысяч GPU NVIDIA. Строили его для Grok, а владеет им SpaceX, которая в феврале купила xAI. Один разработчик моделей арендовал суперкомпьютер у другого, и рынок принял это спокойно.

Для 2026 года это нормальная картина. Релизы моделей выходят раз в пару месяцев, а настоящая борьба идёт тише: в договорах на гигаватты, в собственных чипах, в каталогах облаков, в прайсах за миллион токенов и в инструментах, к которым привыкают разработчики.

Первое оружие: гигаватты

Мощность для ИИ сейчас считают в гигаваттах, а число ускорителей идёт вторым. Чипы можно купить за месяцы, а подключение нового дата-центра к сети и охлаждение занимают годы. Отсюда и анонсы сделок, где мощность стоит первой строкой.

OpenAI подробнее всех рассказывает, сколько мощности у неё уже работает. Финансовый директор компании в январе привела цифры: 0,2 ГВт в 2023 году, 0,6 ГВт в 2024-м и около 1,9 ГВт в 2025-м. В апреле 2026 года OpenAI сообщила, что по контрактам уже набрала больше 10 ГВт и перекрыла цель Stargate на 2029 год. Под неё подписаны и договоры на железо: с NVIDIA на 5 ГВт систем Vera Rubin, с AMD на 6 ГВт, с Broadcom на 10 ГВт собственных ускорителей и с AWS примерно на 2 ГВт Trainium. Складывать эти цифры не стоит, потому что во многом это чипы для тех же дата-центров.

Подписанная мощность ещё не работает. По оценке Epoch AI, которая следит за стройками по спутниковым снимкам и заявлениям подрядчиков, в середине апреля из семи площадок Stargate работала одна, в Абилине, примерно на 0,3 ГВт. Сама Epoch ждала там 0,6 ГВт к концу мая и 1,2 ГВт к концу года. А расширение Абилина сверх 1,2 ГВт в марте остановили из-за задержек с подключением к энергосети.

AWS обещает Anthropic до 5 ГВт, из них около 1 ГВт на Trainium к концу 2026 года. Google ещё в 2025 году договорилась поставить ей до миллиона TPU, а Broadcom на сентябрьском звонке с инвесторами рассказала о 1 ГВт Ironwood для Anthropic в 2026 году и ещё 5 ГВт TPU 8i в 2027-м. Дальше идут до 1 ГВт в Azure, до 2 ГВт на AMD, Colossus 1 и собственные дата-центры в Техасе и Нью-Йорке. Сколько из этого уже работает, Anthropic не раскрывает.

xAI строит быстро: первый Colossus, по словам компании, собрали за 122 дня. В проспекте SpaceX к IPO сказано, что Colossus и Colossus II вместе дают около 1 ГВт. Google зависит от чужого железа меньше всех: у неё своё облако, свои дата-центры и TPU, которые она разрабатывает вместе с Broadcom. Alphabet на 2026 год закладывает от 195 до 205 млрд долларов капитальных затрат.

Капитальные затраты крупнейших техкомпаний на 2026 год, методики учёта немного различаются. Источники: отчёты за апрель–июнь 2026 года

Для масштаба: у Amazon план около 220 млрд долларов, у Microsoft – около 175 млрд, у Meta – 130–145 млрд. Большая часть этих денег уходит в дата-центры, которыми потом пользуются в том числе OpenAI и Anthropic.

Компания

Работающая мощность (по данным компаний)

Крупнейшие контракты на будущее

На чём считает

OpenAI

около 1,9 ГВт в 2025 году

больше 10 ГВт по Stargate, железо NVIDIA, AMD, Broadcom и AWS

NVIDIA, AMD, Trainium, свой чип Jalapeño (первые поставки в 2026 году, массово с 2027-го)

Anthropic

не раскрывается

AWS до 5 ГВт, TPU 5 ГВт с 2027 года, AMD до 2 ГВт, Azure 30 млрд долларов и до 1 ГВт

TPU, Trainium, NVIDIA, AMD

Google

не раскрывается

капзатраты 195–205 млрд долларов за 2026 год

свои TPU, NVIDIA

xAI

около 1 ГВт (Colossus и Colossus II)

расширение Colossus II

только NVIDIA

Второе оружие: свой чип

Пока все остальные подписывают контракты, NVIDIA собирает деньги. За квартал, закончившийся в июле 2026 года, её выручка составила 96,2 млрд долларов, а дата-центры принесли 89 млрд, на 117% больше, чем годом раньше. Каждый, кто может, пытается выйти из этой зависимости хотя бы частично.

Дальше всех продвинулась Google. В апреле она показала восьмое поколение TPU, и на этот раз это сразу два специализированных чипа: 8t для обучения и 8i для работы готовых моделей. Обучению нужна прежде всего вычислительная мощность, инференсу – много быстрой памяти под длинный контекст.

TPU 8t

TPU 8i

Ironwood (v7)

Назначение

обучение

инференс

инференс

Пиковая производительность FP4

12,6 ПФЛОПС

10,1 ПФЛОПС

нет данных

Память HBM на чип

216 ГБ

288 ГБ

192 ГБ

Скорость HBM

6,5 ТБ/с

8,6 ТБ/с

7,4 ТБ/с

Встроенная SRAM

128 МБ

384 МБ

нет данных

Чипов в поде

9 600

до 1 024 активных

до 9 216

Google заявляет для 8t до 2,7 раза лучшую производительность на доллар в обучении, чем у Ironwood. Это цифры самой компании, независимых замеров пока нет, а общую доступность обещали к концу года. В апреле Google ещё и объявила, что начнёт поставлять TPU отдельным клиентам для их собственных дата-центров. Первая выручка от этого ожидается в конце 2026 года, основная – в 2027-м.

У Amazon своя линия, Trainium. Третье поколение доступно с декабря 2025 года, у него 144 ГБ HBM3e на чип, а среди клиентов Amazon называет и Anthropic, и OpenAI. Microsoft в январе запустила Maia 200 и обслуживает на ней в том числе модели GPT-5.2.

OpenAI заказала свой чип у Broadcom. Ускоритель Jalapeño для инференса по собственным замерам OpenAI на пике пропускной способности делает в 1,5–1,9 раза больше работы на ватт, чем системы GB200 и GB300. Broadcom в сентябре сообщила, что начала отгрузки, а развёртывание на 1,3 ГВт запланировано на 2027 год.

xAI по-прежнему считает всё на NVIDIA. Стройка не ждёт, пока созреет свой кремний, но и наценку NVIDIA компании приходится оплачивать целиком.

Третье оружие: облако без эксклюзива

Ещё пару лет назад OpenAI жила в Azure, Anthropic – в AWS, Gemini – в Google Cloud. В 2026 году эксклюзивы почти исчезли. В апреле OpenAI и Microsoft переписали договор: OpenAI может продавать свои продукты через любое облако, хотя новинки по-прежнему выходят сначала в Azure. С июня модели OpenAI и Codex общедоступны в Amazon Bedrock. Claude с конца 2025 года есть во всех трёх крупнейших облаках, а Grok продаётся через Microsoft Foundry и Oracle OCI.

Дело в том, как покупают крупные клиенты. У банка или ритейлера уже есть договор с облаком, согласованные требования безопасности и бюджет, который надо потратить. Модель, которой нет в этом облаке, для них почти не существует. Вот поставщики моделей и идут туда, где у клиента уже лежат деньги.

Облака при этом продают модели конкурентов, сдают им железо и вкладывают в них деньги. Если свести связи двух крупнейших лабораторий с поставщиками, получится вот что:

Поставщик

OpenAI

Anthropic

Amazon

инвестиция 50 млрд долларов, около 2 ГВт Trainium, модели в Bedrock

основной партнёр по обучению, 13 млрд долларов инвестиций и ещё до 20 млрд, до 5 ГВт

Microsoft

договор на 250 млрд долларов в Azure, Maia 200 обслуживает модели OpenAI

до 5 млрд долларов инвестиций, обязательство купить Azure на 30 млрд, Claude в Foundry

Google

по данным СМИ, Google Cloud с 2025 года среди поставщиков мощности, объём не раскрыт

до 40 млрд долларов инвестиций, до миллиона TPU, с 2027 года ещё 5 ГВт TPU 8i

NVIDIA

30 млрд долларов инвестиций, 5 ГВт Vera Rubin

до 10 млрд долларов инвестиций

AMD

6 ГВт MI450, варрант на акции AMD

до 2 ГВт MI450 и до 5 млрд долларов инвестиций

Oracle

партнёр по 4,5 ГВт площадок Stargate, стойки в Абилине

–

SpaceX (xAI)

–

Colossus 1

Зависимость работает в обе стороны. Привязаны не только клиенты, но и сами лаборатории: контракт OpenAI на 250 млрд долларов в Azure или обязательство Anthropic потратить больше 100 млрд в AWS за десять лет держат их не слабее, чем облачный договор держит банк.

Четвёртое оружие: цена токена

Для разработчика вся эта война в итоге сводится к счёту за API. Вот что стоят флагманские и «рабочие» модели на начало октября 2026 года по стандартному тарифу и для запросов до 200 тысяч токенов:

Модель

Вход, $ за 1 млн токенов

Чтение из кеша

Выход

GPT-6 Astra

10

1

50

GPT-6.1 Sol

2

0,10

10

Claude Fable 5.1

10

0,25

50

Claude Opus 5.5

4

0,20

20

Gemini 3.1 Pro (preview)

2

0,20

12

Gemini 3.8 Flash

0,75

0,075

3,75

Grok 4.7

2

0,50

6

Рынок разделился. Самые мощные модели продаются как премиум: GPT-6 Astra и Claude Fable 5.1 стоят одинаково, 10 долларов за миллион входных токенов и 50 за миллион выходных. Для сравнения, флагманский GPT-5 в 2025 году стоил 1,25 и 10. Gemini 4 Argon, который пока не вышел в открытый API, Google анонсировала по промо-цене 2 и 10 долларов, а после промо – 4 и 20.

В среднем сегменте, наоборот, идёт ценовая война. GPT-6.1 Sol, Gemini 3.1 Pro и Grok 4.7 стоят на входе по 2 доллара. Opus год назад стоил 15 и 75 долларов, а Opus 5.5 – уже 4 и 20.

Бывает и обратное движение. На странице цен Gemini 3.8 Flash прямо написано, что с 1 января 2027 года вход подорожает с 0,75 до 1,5 доллара, а выход – с 3,75 до 7,5. Google причин не называет, но похоже, что заканчивается промо-период.

На длинной дистанции цены всё же падают. Epoch AI посчитала, что стоимость одного и того же результата на математических и научных бенчмарках с 2023 года снижалась примерно в 13 раз в год, быстрее всего в первые месяцы после выхода модели-рекордсмена.

Но цена за токен ещё не цена задачи. Artificial Analysis прогоняет модели по одному набору тестов и показывает среднюю стоимость одной задачи. Grok 4.7 в режиме xhigh обходится в 3,74 доллара за задачу, а GPT-6.1 Sol в режиме max – в 0,72, хотя тарифы у них близкие. И набирает Sol больше: 52 балла против 46. Модель, которая много рассуждает, съедает разницу в тарифе своими токенами.

Пятое оружие: экосистема для разработчиков

Последнее оружие – инструменты разработчика. У каждой из четырёх компаний есть свой агент для кода: Codex у OpenAI, Claude Code у Anthropic, Gemini CLI у Google, Grok Build у xAI. Как они устроены и чем отличаются, мы можем разобрать в отдельной статье, здесь важнее другое.

Часть экосистемы стала общей. Протокол MCP для подключения инструментов к моделям придумала Anthropic, а потом его поддержали и OpenAI, и Google. Инструмент, написанный один раз, работает с моделями разных поставщиков, и это снижает цену переезда.

С открытыми весами картина другая. OpenAI, Google и xAI выложили модели с открытыми весами: gpt-oss, Gemma и Grok 2. Их можно запустить на своём сервере и не зависеть от чужого API. Claude доступен только через API и облака, так что команда, которой нужна модель у себя, к Anthropic с этим не придёт.

А что с самими моделями

Разрыв между лучшими моделями на удивление мал. В индексе Artificial Analysis на начало октября первое место у Claude Opus 5.5 с 58 баллами, но в режиме max, где задача стоит около 6 долларов. GPT-6 Astra набирает 53 балла за 3,26 доллара, Gemini 4 Argon – 53 за 1,99, Grok 4.7 – 46.

На арене, где модели сравнивают живые пользователи, первое место у Gemini 4 Argon, а между первым и четвёртым местом около 20 очков. При этом GPT-6 Astra там на 29-м месте, а Grok 4.7 – на 92-м, так что разные площадки видят разных лидеров. А классический тест на программирование SWE-bench Verified потерял доверие: OpenAI перестала публиковать по нему результаты, потому что нашла ошибки в тестах и следы задач в обучающих данных.

Отрыв лидеров держится месяцами, и следующий релиз конкурента его съедает. Поэтому одной сильной модели мало, и борьба переехала туда, где преимущество живёт дольше.

Что думаем мы

Если выбирать одно оружие, мы бы поставили на работающие гигаватты, то есть на мощность, которая уже подключена к сети и охлаждается. Модели догоняют друг друга за месяцы, цены пересматривают каждый квартал, а дата-центр строится годами, и его нельзя скопировать после чужого релиза.

По этому критерию у каждой компании своя сильная сторона и своя уязвимость. Google меньше всех зависит от чужих чипов и облаков, но её новый флагман Gemini 4 Argon пока доступен только узкому кругу клиентов. OpenAI собрала больше всех контрактов и публикует рабочие гигаватты по годам, поэтому разрыв между подписанным и работающим у неё виден лучше всего. Абилин показал, что энергосеть договором не ускоришь. Anthropic разложила заказы по четырём платформам, но почти всё её железо принадлежит другим, а сколько мощности у неё работает, она не раскрывает. xAI строит свои кластеры быстрее остальных, но сидит на одном поставщике чипов, а Colossus 1 SpaceX сдала конкуренту.

Когда мощности не хватает всем, цены двигаются не только вниз, и пример Gemini 3.8 Flash это уже показал. Совет разработчику отсюда простой. Держите вызовы модели за тонким слоем абстракции, сравнивайте стоимость готовой задачи, а не цену токена, и не завязывайте продукт на функцию, которая есть только у одного поставщика, если без неё можно обойтись.