Я трачу миллиард+ токенов в день (я проверяла статистику по Minimax / GPT), запуская порой по 7–9 потоков агентов в течении 12 часов.
Как мне удается не разориться? Как то, что я делаю, не разваливается, а как‑то работает?
Прошлая статья: https://habr.com/ru/articles/1030414/
С 1 мая прошло не просто 3 месяца. Прошло несколько эпох качества ИИ агентов и обвязки вокруг них. Сменилось несколько парадигм. Суб агенты перестали быть эффективными, западные фронтиры не упали в грязь лицом перед китаем, и многое другое.
Обо всем по порядку.
Модели стали умнее, улучшилась глубина понимания, по сравнению с 1 мая 2026 года.
Сегодняшние хорошие подписки и модели в них: (как и в прошлый раз, я не буду писать о Claude и Google моделях в связи с их блокировками аккаунтов пользователей, все о них вы можете узнать от любителей этих линеек)
GPT 5.6 / 6
Kimi 3 / 2.7
Minimax M3 (без 2.7)
Qwen 3.8 Max / Flash Next
Deep Seek V4 Flash (а может быть и Pro)
Подписки, рассматриваемые в статье: Grok, GPT, OpenCode Go, Ollama Cloud, Qwen, Minimax, Kimi
GPT
OpenAI поступили невероятно умно, выпустив три отдельные модели под разную сложность задач. А присыпали сверху этот торт выходом Astra. Что у них получилось?
GPT 5.6 Luna — младшая модель семейства. А вот ее интеллект весьма высок:

При этом, Luna, подобно Deep Seek V4 Flash, имеет очень низкую цену, по сравнению с рядом стоящими моделями. Теперь мы можем пользоваться подпиской GPT за 20$ долго, запуская по 2–3 Luna каждый день, доверяя ей все свои основные задачи. Посмотрите, где в этом списке стоит Kimi 2.7 — помните, на момент статьи 1 мая, она была передовой?
Если в мае мы доверяли свои лучшие и сложнейшие задачи таким моделям, как Kimi 2.7 / GPT 5.4, и говорили «торт», то сейчас с этим справляются Luna / Deep Seek V4 Flash / Minimax M3.
У GPT есть неочевидный, а может быть очевидный, лайфхак — у их веб чата есть коннектор к Google Disk. Для локального агента можно сделать скилл с скриптами для Google Disk (понадобится настроить еще приложение для доступа по API, но это решаемо).
Общаетесь с GPT Astra / GPT 5.6 Sol в веб чате при подписке в 20$, обсуждая все самые сложные и тонкие моменты и аспекты своих задач. Просите выгрузить анализ в документ на гугл диске. Кидаете ссылку на документ в локальный агент GPT 5.6 Luna.
Вы можете таким образом неограниченно использовать GPT Astra / GPT 5.6 Sol, оставляя рутину младшей модели. Передача работает и в обратную сторону — просим Luna записать свой вопрос / контекст задачи в гугл документ, отдаем ссылку в веб интерфейс. У меня около 20 папок с несколькими чатами в них на веб интерфейсе GPT. Все отсортировано по цветам, иконкам и наименованиям. Я рекомендую вам хорошо организовывать проекты по папкам, чтобы не путаться и пользоваться системой в удовольствие.
Итак, мы рассмотрели подписку GPT за 20$. Добавлю, что если у вас достаточно денег, и вы планируете покупать 5 маленьких подписок за 20$, можете смело купить GPT Pro. Это даст вам 7–9 потоков Luna в сутки и 50 запросов к GPT Astra Pro в веб чате в неделю. Это один из лучших вариантов на данный момент.
Minimax M3 — мой верный друг и рабочая лошадка.
В таблице лидеров он стоит на краю. Он действительно топорнее Luna / Deep Seek v4 Flash / Qwen. Но у него есть преимущество. Лимиты намного больше, чем у всех остальных подписок. Единственное ограничение — 5 часовое окно.
Я всегда держу эту подписку и оставляю Minimax все долгие рутинные задачи, не связанные сколько с кодом, сколько с devops, тем самым экономя остальные подписки. Скорость имеет значение — Luna быстрая, а MInimax еще быстрее (но быстрее всех Deep Seek V4 Flash). Minimax действительно отлично берет на себя всю рутину, забирая наш расход токенов у приоритетных подписок.
Kimi 3 / 2.7
У меня смешанные чувства. Kimi была в лидерах, но долго от них ничего не слышно. Их подписка начинается с 40$ (потому что та за 20$ обладает очень скромными лимитами и не вызывает интерес). То есть, вдвое дороже, чем 20$ — обычная цена начальной подписки у других. При этом Kimi 3 ест подписку с большим аппетитом, медленнее чем Sol, но достаточно быстро. А Kimi 2.7 уже отстает от конкурентов. Поэтому, я ставлю ее минимум на 4 место по приоритету покупки. Не могу сказать, что это плохой выбор. Скорее — он в принципе такой же, как купить Qwen и Ollama Cloud вместе. Но при этом есть некоторые минусы — Kimi откровенно суховата, она отлично делает и понимает дизайн, бренд, но я доверяла ей задачи по верстке (agent browser), и она долго молотила токенами, пытаясь подвинуть пару кнопок. А Luna все поняла быстро. Поэтому рекомендую, погоняйте Kimi на своем классе задач, прежде чем платить сразу 40$.
Ollama Cloud / Deep Seek V4 Flash
С недавнего времени Ollama Cloud перешли на прозрачную систему тарификации подписки — за 20$ они просто дают 60$ на токены. Все равно круто.
Deep Seek V4 Flash уже не тот, что в мае. Теперь Deep Seek V4 Flash круче или такой же, как Deep Seek V4 Pro в мае. Это отличная модель для всего, и с подпиской Ollama Cloud вы получаете огромную скорость токенов и медленный расход лимитов. Один жирный минус — на Ollama Cloud модель, которая не понимает картинки. Лично мне неудобно. Нельзя кинуть скриншот. Это часто бывает нужно.
Qwen
Qwen 3.8 Max тоже с большим аппетитом ест подписку за 18$. Впрочем, как и все флагманы, и когда у нас трудная задача, которая по зубам только Sol / Kimi 3 / Qwen Max, приходится потерпеть. (Или использовать веб версию GPT через Google Disk, как я описала выше).
А вот Qwen 3.8 Flash это потрясающе! По моим ощущениям, она бодра и прекрасна как GPT 5.6 Luna. Я запускала часть задач на Luna, часть на Qwen 3.8 Flash, совершенно не задумываясь, какая какой. Единственным критерием было — какой из подписок сейчас меньше по расходу — той моделе и достается очередная задача.
Теперь об остальных.
Grok
Увы, нет младших моделей, Grok 4.6 очень уверенно и быстро ест подписку, быстрее, чем флагманы на других. Стоит 30$. Не могу посоветовать для локального агента. Но Grok вышел на сцену звездой с другой стороны.
Если говорить о генеративных моделях, то генерация видео в его подписке (плохо дается текст на видео, а вот русская озвучка — прекрасная) — это 400 видео роликов по 15 секунд в качестве 720p. За 30$ ни одна площадка и провайдер не дают такой щедрости. Seedance и прочие стоят примерно по 0.3$ за ролик в среднем. Поэтому с точки зрения поиска генеративной модели — Grok — потрясающе выгоден для тех, кто генерирует картинки и видео. А работа в их редакторе с этим — тоже супер. У них большое поле, куда накидываются видео и картинки, и можно организовывать большую работу, подобно как организовывают макеты в Sketch / Figma / Photoshop.
OpenCode Go
Всего 10$. Выгодно с точки зрения аварийной подписки. Когда вдруг на 5–6 день подписок у вас закончилось все, а 5 часовое окно Minimax тоже исчерпано. И чтобы выжить в эти 2–3 часа, пока ждем обратно Minimax, можно погонять самую недорогую подписку из всех.
При этом я пробовала там Deep Seek V4 Flash с поддержкой картинок — подписка съедалась медленнее. Пробовала Qwen 3.8 Flash — уже намного лучше, медленнее. Не могу сказать, что ее на долго хватит. Рекомендую именно как критическое окно в момент, когда надо переждать до сброса лимитов.
Генеративные модели
Раз уж я коснулась темы генерации видео, сделаю короткий абзац по генерации картинок, звуков, голосов.
Krea — 9$, 5000 токенов, генерация одной картинки приличной моделью стоит 1–5 токенов, то есть 1000 изображений в месяц. Для очень хорошего качества есть модели подороже на той же Krea.
Локальная генерация с Comfy UI.
SDLX — неплохо. Flux 2 Klein 4b (дает коммерческую лицензию, 9b не дает) — хорошо, лучше чем SDLX на нереалистичном стиле.
Генерация звуков, музыки:


В целом неплохо. Мне для игровых пет проектов пока достаточно.
А вот генерация русских голосов это швах. Не выразительно, с неверными ударениями (Qwen 3 TTS). Поэтому я плачу 5$ за audio пакет minimax, и поскольку у меня есть подписка Minimax за 20$ — я получаю там хорошие лимиты по генерации фраз.
Я пользовалась связкой GPT / Qwen / Minimax, умеренно хватало на 1 миллиард токенов в день (В сумме 60$).
Сейчас у меня GPT Pro (100$), Minimax и OpenCode Go на всякий случай (130$).

