TL;DR
31 августа 2026 в 23:59 по тихоокеанскому времени заканчивается промо, которое с 13 мая держало недельные лимиты Claude Code на 50% выше стандартных. Продлевали его трижды — 13 июля, 19 июля, 19 августа. После отмены недельная ёмкость падает примерно на треть: делить на полтора — это возврат к 67% от привычного. Одновременно работает второй множитель, о котором говорят реже: модели Claude 4.7 и новее считают тот же самый текст примерно на 30% дороже в токенах, а файл CLAUDE.md — в 1,445 раза. Сложите одно с другим, и получите ощущение, что лимит закончился «в два раза быстрее, чем раньше», хотя формально урезали только треть.
Ниже — что именно заканчивается, с датами и ссылками на документацию Anthropic. И вторая половина, ради которой всё писалось: что с этим делать. Штатный режим «дорогая модель планирует, дешёвая исполняет» внутри самого Claude Code. Механика banked reset у Codex — она существует, но работает не так, как о ней рассказывают. GLM-5.3-Flash, она же нашумевшая Ox Alpha, — с моими собственными замерами, которые расходятся с анонсом. И Fugu от Sakana, которую почти все описывают неправильно.
Что именно заканчивается
Промо на +50% к недельным лимитам Claude Code действует с 13 мая 2026 и заканчивается 31 августа в 23:59 PT. Anthropic продлевала его трижды, каждый раз незадолго до истечения, так что четвёртое продление исключать нельзя — но планировать на него не стоит. Арифметика возврата простая и неприятная: если сейчас ёмкость составляет 150% от базовой, то после отмены остаётся 100%, то есть две трети от того, к чему вы привыкли за три с половиной месяца. Это не «немного ужмут» — это треть недельного бюджета, которую придётся либо экономить, либо чем‑то замещать.
Вот полная картина изменений, которые накопились с мая:
Что | Когда | Цифры |
|---|---|---|
Промо +50% к недельным лимитам | заканчивается 31.08.2026 | действовало с 13.05, продлевалось трижды |
Fable 5 включён в Max и Team Premium | 20.07.2026 | потолок — 50% недельного лимита, не дополнительная ёмкость |
Потолки на субагентов | v2.1.217, 21.07.2026 | 20 одновременных, 200 на сессию, глубина спавна 3 |
Новый токенизатор | с Claude 4.7 | ≈ +30% токенов на том же тексте |
Промо Cowork +100% | закончилось 05.08.2026 | пул общий с Claude Code |
Про Fable 5 стоит сказать отдельно, потому что формулировка «включён в подписку» вводит в заблуждение. Модель действительно доступна на Max и Team Premium постоянно — но с потолком в 50% недельного лимита, и это не добавленная ёмкость, а доля от общего пула. То есть Fable не расширяет бюджет, а делит существующий.
Второй множитель: токены подорожали, а вы не заметили
Модели Claude 4.7 и новее — включая Opus 5 и Fable 5 — используют новый токенизатор, который на том же самом тексте выдаёт примерно на 30% больше токенов. Это официальная сноска на странице цен Anthropic, а не догадка сообщества. Разница неравномерна и зависит от типа содержимого: обычные промпты дорожают в 1,373 раза, git‑логи в 1,344, диффы в 1,212, а структурированные данные вроде JSON и CSV почти не меняются — 1,07–1,13. Хуже всего файлу инструкций CLAUDE.md: 1,445, то есть почти в полтора раза. Именно он читается в начале каждой сессии, и именно он у большинства разработчиков разросся за месяцы работы.

Слева — недельная ёмкость до и после 31 августа. Справа — во сколько раз новый токенизатор удорожает тот же текст.
Отсюда неочевидный вывод: чистка CLAUDE.md теперь окупается дважды. Раньше это была гигиена ради внимания модели, теперь — ещё и прямая экономия лимита на каждой сессии. Файл на 400 строк, который вы держите «на всякий случай», после смены токенизатора стоит вам почти в полтора раза дороже, чем стоил весной, и платите вы за него при каждом запуске.
Почему это ощущается сильнее, чем считается
Claude Code, чат Claude и Cowork тянут лимит из одного общего пула — одного seat allowance на аккаунт. Промо у этих продуктов при этом разные и разъезжаются по датам: у Cowork прибавка в 100% закончилась 5 августа, у Claude Code прибавка в 50% заканчивается 31-го. Если вы пользуетесь двумя продуктами сразу, вы уже пережили одно сокращение и не связали его с промо, потому что урезали не там, где вы работаете.
Есть ещё два механизма, которые расходуют лимит быстрее, чем подсказывает интуиция. Первый: agent teams потребляют примерно в семь раз больше токенов, чем обычная сессия — это цифра из документации Anthropic, а не оценка. Второй: время жизни prompt‑кэша различается в двенадцать раз в зависимости от того, чем вы платите. На подписке кэш живёт час, на usage credits — пять минут. При работе урывками, с паузами по десять‑пятнадцать минут, на кредитах вы каждый раз платите за контекст заново.
Хорошие новости, которые пришли в том же месяце
Не всё в августовских изменениях против пользователя. С версии 2.1.234, примерно с 13 августа, Claude Code по умолчанию сам дожидается сброса лимита и продолжает прерванную задачу — параметр autoContinueAtUsageLimit включён, а не выключен, то есть это opt‑out. Раньше упереться в лимит посреди длинной задачи означало потерять контекст и начать заново.
Второе: команда /usage на платных планах теперь показывает не только остаток, но и атрибуцию расхода — что именно съело лимит, с разбивкой по навыкам и MCP‑серверам, с порогом флага в 10% недавнего потребления. Это первый штатный способ узнать, куда уходит бюджет, а не гадать. Отдельно исправили завышенную атрибуцию MCP в версии 2.1.222 — если вы смотрели /usage до неё и удивлялись цифрам, посмотрите ещё раз.
И третье, приятное: Anthropic отменила запланированное подорожание Sonnet 5 на 50%. Цена $2 за миллион входных и $10 за миллион выходных токенов, которая объявлялась как вводная, стала постоянной — повышение до $3/$15 с 1 сентября не состоится.
Фон: почему вокруг лимитов столько нервов
Есть цифра, которая объясняет общее настроение лучше любых рассуждений. 23 июля Anthropic обновила Transparency Hub и опубликовала данные за первое полугодие 2026: 11,4 миллиона заблокированных аккаунтов против 1,45 миллиона за вторую половину 2025 года. Рост в 7,9 раза за полгода. При этом текст Usage Policy не менялся — на документе стоит дата вступления в силу 15 сентября 2025 года. То есть ужесточились не правила, а плотность их применения.
Это ровно то ощущение «а меня‑то за что?», которое было в комментариях к моей июньской статье про блокировки. Формально ничего нового не запретили — просто то же самое стали ловить в восемь раз чаще.
Второй факт из того же отчёта неожиданно обнадёживающий: доля успешных апелляций выросла втрое. Было 1,7 тысячи отмен из 52 тысяч обращений — 3,3%. Стало 42 тысячи из 398 тысяч — 10,6%. Апелляция перестала быть лотереей: подавать её теперь имеет смысл, шанс вырос с «почти никогда» до «каждый десятый».
Что делать. Способ первый: не уходить никуда
Самое дешёвое решение обычно ближайшее, и в случае Claude Code оно встроено. Схему «дорогая модель планирует, дешёвая исполняет» не нужно городить через прокси и самописные обёртки — она поддерживается штатно, алиасом модели opusplan. Работает так: Opus думает в plan mode, дальше клиент автоматически переключается на Sonnet для исполнения плана. Одна настройка в конфигурации, никакого клея. Есть и второй механизм, advisor tool: дешёвая основная модель зовёт сильную в ключевых точках, и в документации приведена готовая таблица разумных пар.

Четыре способа пережить сокращение: что работает сразу, что требует переезда и где подводные камни.
У opusplan есть оборотная сторона, которую я не нашёл в очевидных местах документации и выяснил на практике: каждый вход в plan mode и выход из него — это смена модели, а значит полный сброс prompt‑кэша. На короткой задаче выигрыш очевиден, на длинной сессии с частыми переключениями режимов пересборка контекста может съесть всю экономию на исполнителе. Мерить надо на своей нагрузке, а не верить общему правилу.
Модель субагента, кстати, задаётся полем model во frontmatter — sonnet, opus, haiku, fable, полный идентификатор или inherit. Массовые механические прогоны на Haiku вместо унаследованной модели дают заметную экономию там, где качество рассуждений не нужно. А потолок в 20 одновременных субагентов, который ввели в июле, — настраиваемый, а не жёсткий; жёсткий только предел в 200 субагентов на сессию.
Способ второй: Codex как запасной аэродром
Про Codex ходит слух, что у него есть «кнопка сброса лимитов», которой нет у Claude. Слух правдив наполовину, и вторая половина важнее первой.
Механизм существует и называется banked reset. Определение OpenAI: это разовый сброс лимита Codex, сохранённый в аккаунте до момента использования или истечения. Он обнуляет и пятичасовое, и недельное окно сразу, сдвигая дату недельного сброса. Лежит в настройках, в разделе usage, доступен из десктопа, CLI и веба. Живёт 30 дней и сгорает. Если сбрасывать в момент активации нечего, он не тратится и остаётся лежать.
А теперь важное. Его нельзя купить и нельзя выпросить у поддержки. Формулировка OpenAI недвусмысленная: banked reset — это промо‑бенефит, а поддержка не выдаёт ручных или «в порядке любезности» сбросов. Приходят они тремя задокументированными путями, и все три — акции: запуск самой функции в июне, отдельные объявления и компенсации за инциденты. Планировать работу в расчёте на сброс нельзя, это лотерея, а не инструмент.
Настоящий платный выход из лимита у Codex другой — кредиты. Пользователи Plus и Pro, упёршись в потолок, докупают кредиты и продолжают работать без перехода на более дорогой план. Есть автопополнение с настраиваемым месячным потолком трат, кредиты живут 12 месяцев и общие для Codex, Work и Excel. Цену в долларах OpenAI не публикует — она зависит от аккаунта, региона и плана.
Но самый недооценённый рычаг у Codex — не деньги, а выбор модели, и разница там кратная. На плане Plus за пятичасовое окно: GPT-5.6 Sol даёт 10–100 локальных сообщений, Terra — 25–200, Luna — 250–2000. Между крайними моделями двадцатипятикратный разрыв. OpenAI сама советует это первым пунктом в FAQ про то, как растянуть лимит: переключитесь на модель поменьше. Мы почему‑то считаем нормальным гонять флагман на задачах, где хватит модели попроще, а потом удивляемся, что бюджет кончился к четвергу.
И ещё одна деталь, которая снимает главное возражение против переезда. Команда /import в Codex CLI переносит из Claude Code десять категорий: файлы инструкций, settings.json, навыки, плагины, папки проектов, память проектов, переписку за последние 30 дней (до 50 бесед), конфигурацию MCP, хуки, слэш‑команды и субагентов. То есть попробовать Codex — это не «настраивать всё заново», а одна команда. С 7 августа он ещё и умеет досинхронизировать уже импортированные беседы без дублей.
Забавное совпадение по датам: 31 августа — дедлайн и у OpenAI тоже. В этот день в Codex выводят из обращения GPT-5.4 и GPT-5.4 mini для пользователей, залогиненных через ChatGPT.
Способ третий: GLM-5.3-Flash, она же Ox Alpha
Историю вы наверняка видели: в середине августа на OpenRouter появилась анонимная stealth‑модель Ox Alpha, за выходные вышла на первое место по использованию, обогнав DeepSeek более чем вдвое, а 26 августа Z.ai признала авторство. В блоге компании это сказано прямо: «перед релизом мы тестировали GLM-5.3-Flash анонимно под именем ox‑alpha на OpenCode и OpenRouter, чтобы собрать отзывы». Веса выложены на Hugging Face под MIT: 320 миллиардов параметров всего, 18 миллиардов активных.
Сразу два уточнения, без которых можно потратить вечер впустую. Первое: Ox Alpha больше не существует физически. По данным API OpenRouter запись stealth/ox-alpha создана 20 августа и сейчас имеет пустой список провайдеров — это не «временно недоступна», это мёртвая запись. Живая называется z-ai/glm-5.3-flash, создана 26 августа, и она уже платная: бесплатный период закончился вместе со стелс‑режимом. Заголовки про «бесплатную модель, которая обошла DeepSeek» всё ещё висят в лентах, но ведут в никуда.
Второе: GLM-5.3-Flash и GLM-5.3 — разные модели, и путать их дорого. Flash — это та самая бывшая Ox Alpha. Флагман GLM-5.3 заметно сильнее: на DeepSWE v1.1 он даёт 66,9 против 63,4 у Flash. Веса флагмана Z.ai задержала примерно на две недели ради дополнительной проверки безопасности — как раз из‑за того, насколько хорошо он ищет уязвимости. Так что цифры из обзоров про «GLM обошёл всех» чаще всего относятся к флагману, а бесплатно все пробовали Flash.
Я подключил её воркером под оркестровку Claude 23 августа, ещё до раскрытия авторства, и мои замеры расходятся с анонсом по нескольким пунктам сразу:
Что мерил | Результат |
|---|---|
Доступность | 80% — 32 успеха из 40 проб за 13 минут, отказы идут пачками |
Задержка | от 16 до 153 секунд на одном и том же запросе |
Контекст | 266 751 токен принят за 21 с; на ~500K вернула пустой ответ — заявленный 1M не подтверждён |
Параллельность | девять одновременных запросов положили эндпоинт |
Качество кода | на задаче с |
То есть по качеству разбора кода претензий нет — модель нашла даже то, о чём её не просили. А вот по надёжности до продакшена далеко: восемь из десяти запросов доходят, задержка гуляет в десять раз, а параллелить нельзя.
Теперь про «лучше Opus 5 на некоторых задачах» — фраза, которая гуляет по обзорам. Проверил, и картина получилась заметно скромнее.
Z.ai в собственных launch‑материалах сравнивает GLM-5.3 не с Opus 5, а с Opus 4.8 — моделью прошлого поколения. Opus 5 вышел 24 июля, за три недели до GLM-5.3, но в сравнение не попал. На единственном публичном бенчмарке с прямым сопоставлением — DeepSWE v1.1 — Opus 5 выигрывает: 68,8 против 66,9, а GLM-5.3-Flash и вовсе 63,4. Независимая оценка Artificial Analysis даёт Opus 5 индекс 63, GLM-5.3-Flash — 57.
Хуже того, на официальном верифицируемом лидерборде Terminal‑Bench записей GLM-5.3 и Flash нет вообще — самый свежий GLM там пятой‑первой версии. Цифры, которые циркулируют по обзорам, взяты из материалов вендора, а условия там щедрые: таймаут шесть часов на задачу, контекст 400K, температура 0,95. Когда независимая лаборатория LayerLens прогнала прошлое поколение GLM со стандартным промптингом и без кастомного скаффолдинга, результат обвалился почти вдвое.
Но есть область, где GLM действительно первый в мире, и это не общий кодинг. На CyberGym — бенчмарке поиска уязвимостей — GLM-5.3 берёт 84,5%, опережая GPT-5.6 Sol с 83,6% и Claude Opus 5 с 78,2%. И настоящая причина, по которой разработчики уходят туда на security‑задачах, не в баллах, а в отказах: практики на Hacker News независимо друг от друга пишут, что Claude отказывается работать с задачами, хоть как‑то смежными с безопасностью, даже когда речь про собственный код.
Цена при этом отличается радикально и проверяется по API напрямую: GLM-5.3-Flash — $0,075 за миллион входных токенов и $0,25 за выходные. Opus 5 — $5 и $25. Разрыв в 66 и 100 раз соответственно.
Подключается GLM к Claude Code одной переменной окружения — Z.ai держит Anthropic‑совместимый эндпоинт, и все три уровня моделей маппятся на GLM автоматически.
И здесь нужно предупреждение, которое важнее всех цифр выше. Anthropic не разрешает использовать свою подписку через сторонние харнессы. Речь именно про обратное направление — ходить в Claude из чужого клиента. Схема же «Claude Code как клиент, GLM как модель» использует ключ Z.ai и подписки Anthropic не касается — это принципиально разные вещи, и путать их не стоит.
Способ четвёртый: Fugu, которую все описывают неправильно
Fugu от Sakana AI обычно представляют как роутер, который отправляет запрос в модель подешевле, когда задача простая. Это неверно: маршрутизация Fugu вообще не учитывает стоимость.
Как она устроена на самом деле. Fugu — семейство моделей‑оркестраторов: модель понимает запрос и динамически собирает агентный каркас из пула фронтир‑моделей, отдавая наружу интерфейс одной модели. Разметка для обучения строилась так: каждая модель пула прогонялась на задаче несколько раз, замерялась точность против эталона, средние награды превращались в распределение. То есть выбор делается по предсказанной точности, а не по цене. Экономия, если и случается, — побочный эффект.
Вторая стадия обучения шла на реальных многоходовых траекториях из кодинг‑ассистентов, и Sakana прямо называет Claude Code, Codex и OpenCode. То есть модель натаскана именно на этот сценарий.
Практическая часть: claude-fugu — не отдельный клиент, а обёртка вокруг настоящего Claude Code. Скрипт из официального репозитория подменяет ANTHROPIC_BASE_URL на api.sakana.ai и кладёт туда ключ Sakana. Из этой механики прямо следует, что подписка Claude при этом не используется — платите вы Sakana. Тарифы: Standard $20 в месяц, Pro $100 (заявлено «10× Standard»), Max $200 (“20× Standard”).
Что при этом не опубликовано и о чём стоит знать до оплаты: абсолютные лимиты подписки нигде не названы, только относительные множители; что происходит при исчерпании месячного лимита — не описано; полный список моделей в пуле не раскрыт. И отдельно: Sakana не оказывает услуги пользователям в ЕС, Великобритании и Швейцарии; статус России в условиях не упомянут ни как разрешённый, ни как запрещённый.
Ещё одна деталь для честности: в бенчмарках техотчёта под таблицей есть оговорка, которую в пересказах обычно теряют — все результаты, кроме собственных, взяты из заявлений вендоров, Sakana конкурентов не перезамеряла.
Чего делать не стоит
Три идеи, которые выглядят логично и не работают.
Поднять несколько параллельных подключений к одной модели ради ёмкости. Проверял на OpenRouter: при перегрузке приходит ошибка 429 с прямым указанием причины — маршруты делят общий пул у провайдера. Независимой ёмкости это не даёт, только раскладывает ту же квоту по нескольким дверям.
Скачать веса и поднять флагманскую модель локально. Цифры с Hacker News: GLM в трёхбитном квантовании — это 288 гигабайт весов, и на связке RTX Pro 6000 с 64 гигабайтами оперативной памяти выдаёт 0,7 токена в секунду. Для интерактивной работы это неприменимо.
Рассчитывать на banked reset у Codex как на инструмент. Он промо‑бенефит: не покупается, не выдаётся поддержкой, сгорает за 30 дней. Приятный бонус, если прилетел, но не элемент плана.
Чек‑лист на ближайшие дни
[ ] Посмотреть
/usageдо 31 августа и запомнить цифры — после отмены промо сравнивать будет не с чем[ ] Почистить
CLAUDE.md: новый токенизатор берёт с него в 1,445 раза больше, и платится это при каждом запуске[ ] Проверить, не тянут ли лимит из общего пула чат Claude и Cowork параллельно с Claude Code
[ ] Перевести массовые механические прогоны на Haiku полем
modelво frontmatter субагента[ ] Попробовать
opusplan— и замерить на своей нагрузке, не съедает ли сброс кэша всю экономию[ ] Если работаете урывками — учесть, что на usage credits кэш живёт 5 минут против часа на подписке
[ ] Если рассматриваете Codex — начать с
/import, он перенесёт навыки, субагентов, хуки и MCP‑конфиг одной командой[ ] Не ставить эксперименты с новыми моделями на критичной задаче: 80% доступности означает, что каждый пятый запрос не дойдёт
Про инженерные эксперименты с агентами и автоматизацией пишу в канале «Готовим ИИшницу».
Если захочется повторить что‑то из описанного, а затык окажется не в идее, а в установке — у меня есть Ника, агент‑помощник по настройке Claude Code: t.me/vibecodeguidebot. Там же моя конфигурация целиком, установщик и короткий видео‑гайд. Бесплатно, без регистрации.

