Comments 23
Тоже есть проблемы с токенами, попробую, может поможет.
Отличная статья, а во сколько вы оцениваете вам бы обошлось это не по подписке, а по api pricing? 5.7 миллиардов токенов - не уверен, что у вас там за модель, но по ходу пару десятков тысяч долларов пришлось бы отдать?
Страшно бесят эти лимиты на про тарифе. Вчера решил купить про тариф и попробовать клауд, в целом действительно интересно работает, но даже часа не уходит, чтобы поработать на нем нормально, лимит через полчаса слетает даже на соннете. Может я что-то не так делаю, но огромная загадка как все им пользуются. Неужели все на максе, а точнее как токены докупаются и как часто? Пока не разобрался что и как преимущество пока у ChatGPT.
Pro аккаунт действительно плохо подходит крупным задачам, если использовать его в режиме вайбкодинга, но за полчаса у меня ни разу не получалось израсходовать.
Чтобы снизить расходы, надо чаще очищать контекст.
Обычнно для крупных проектов пишу краткий ТЗ, прошу расписать подробно - сделать общий файл и отдельные файлы на каждый шаг. Потом проверяю, правлю (чаще всего не вручную, а с помощью Клода). А дальше прошу выполнить по одному шагу за раз, перед каждым шагом делаю /clear.

у мну 2 миллиарда за месяц, и это на аккаунте без автономных агентов еще
Я смотрела, я трачу около миллиарда токенов... в день. Упс.)
Я скоро напишу вторую статью обновление, как я это делаю.
О_О это на про подписке или макс?
Если вкратце.
GPT 5.6 Luna - 20$
Minimax M3 - 20$
Qwen 3.8 flash next - 18$
Когда мне нужен GPT 5.6 Sol, я иду в веб версию, там у меня десятки проектов, и есть интеграция с Google Drive, на котором у меня тоже организованы папки проектов. В локальном агенте у меня тоже есть скилл google drive. Я общаюсь с GPT 5.6 Sol в вебе, прошу его сделать гугл доку, иду в локальный агент и кидаю ссылку на гугл доку.
Простите, вы интернет переписываете? :)
Просто свой опыт)
У меня 60 пет проектов, которые я разделила по 6 виртуальным организациям.
Вот те, что я активно применяю каждый день:
Starframe - все про утилиты.
Portalis - возможность встраивать терминал в приложения на Go.
Automata - мой личный harness поверх Pi, с возможностью сохранять контекст по папкам, делать вложенные папки сессий в боковой панеле в терминале. TUI.
Warp - библиотека для grid/flex TUI поверх bubble tea.
Cue TTY - playwright-cli для TUI - агенты могут играться с терминальными апами, по тому же принципу, как это делают через agent browser или playwright-cli.
Dream Frame - сервер и клиент, который встраивается в код игры или three приложения, предоставляя playwright cli like апи для агента - тот может видеть описание рендера кадра, делать скриншоты игры и управлять игроком.
Rune Map - сервер и клиент, который встраивается в код игры, предоставляя внутренние игровые данные - ресурсы, жизнь, положение персонажей, карту, позволяя агенту видеть состояние игры и управлять игроком.
View Print - крутая штука, playwright-cli на стероидах, но свой, позволяет агенту видеть каскады css на элементах, запрашивать указанные части DOM без полной вложенности. Создано для верстки - агент читает макеты и точечно смотрит страницу. Умеет вызывать скрипты, нажимать кнопки и все что нужно, чтобы верстать в том числе попапы и выпадающие списки.
Human Horizon - все экспериментальное интересненькое.
Code Keeper - смотрит мусорные файлы и кривые конфигурации в Go/TS проектах, проверяет покрытие теста. health-check для моих проектов.
Test Warden - его и запускает Code Keeper для проверки тестов.
Проверяет наличие unit тестов каждой функции, e2e, интеграционные тесты. Интегрирован с AI.
Code Check - Набор AI пайплайнов для:
- генерируем файл тестов на каждый .ts/.go файл
- генерируем спеку на каждый файл кода
- генерируем документацию по спекам, на vitepress на двух языках.
- проверяем проблемы и ошибки в коде.
- генерируем общие спеки кода.
Weft - автоматизация ИИ через typescript - удобные weave, flow функции для построения цепочек TS кода и вызовов нужной модели с нужным промтом, параллельно или последовательно.
ИИ - все, связанное с моделями:
TTS - Qwen, Vosk, Cartesia, GPT озвучка, тестирую какие лучше/дешевле
Aura - локальный ИИ на стероидах, быстрая модель через CTranslate2 переводит любой язык в английский, и обратно, - ИИ типа Qwen 2b/0.8b видит только английский, от чего на русском начинает работать сильно лучше. Проект по real time ИИ локально на CPU. Есть прототип, умеет говорить погоду, текущее время и говорить, что у него хорошее настроение.
Everwake - прототип, создание виртуальной симуляции в образовательных целях - солнечная система, земля, государства, территории, в будущем - информация о течении финансов, ресурсов, добыча и так далее.
https://everwake.space
Как это связано с ИИ? я планирую поселить там колонию ИИ существ.)
Computer Use - текущие мультимодальные ИИ так себе читают точное расположение пикселей и промахиваются по кнопкам - я исследую Owl, OmniParser и прочие специализированные модели для анализа скриншотов, соединяя LLM с готовыми json координатами и тулами по управлению ПК и смартфонами.
Life Line - что-то полезное для людей
Emma - локальный агент на CPU, способный быть полезным, как Алиса, и при этом не забывать факты, как Алиса. Выше писала про Aura.
Empty Set - игровая студия
Мое хобби - всю жизнь хотела делать игры и делаю одну.
Between Worlds - MMORPG, где все стычки и споры решаются посредством выбранной настольной игры. Хочу дух Ori, Heroes 3.
Бизнес проекты
https://helpsi.ru
Психологическая поддержка. Я дистиллировала десятки книг по психологии и психиатрии и сделала три линии ИИ - один ИИ работает только с психологическим портретом и говорит следующий ход, второй проверяет риски (самоповреждение, попытка сменить задачу агента), получая только последние 1-3 сообщения, и сам чат бот, который получает всю переписку + информацию от аналитика.
https://nisharadar.ru
Найти хорошую нишу для торговли на wildberries
Luma Coach
Как Мира (психологическая поддержка), но про коучинг
Nanny Lumi - делаю приложение все в одном для детей, когда есть и графики кормления, сна (банально и везде есть), и создание сказок, где герой ребенок (кое у кого такое есть), и живая собеседница, и способность читать сказки как своим голосом так и голосами родителей, отвечать на вопросы про динозавров и про все на свете, с контролем безопасности и этичности.
Study Reels - озвучивает лекцию и генерирует (у меня огромный парк локальных ИИ по генерации, Comfy UI, голоса, звук, видео) слайды, с фоновыми изображениями, показывает текст, подсвечивает озвученные предложения. Удобный способ визуалам не читать текст лекции, а слушать, видеть картинки и читать с экрана по одному абзацу за слайд. Для обучения.
Latent Current - пишу агрегатор для ИИ новостей, сайт-портал.
Я нейроманьяк.)
Выход — 0,03B против 5,75B входа, это полпроцента.
Не совсем так. Чтение из кеша стоит копейки - этим амортизируется разрастание истории. У вас чистый вход это запись в кеш - 0,20B. То есть соотношение выход/вход около 15%. Выход стоит в несколько раз дороже входа.
Справедливо, спасибо — «полпроцента» это доля в токенах, а не в деньгах, и в статье я это не развёл.
По тарифам Opus 5 ($5/$25 за Mtok, чтение кеша $0.50, запись $6.25) выходит: чтение 5,75B → $2875 (59%), запись 0,20B → $1250 (26%), выход 0,03B → $750 (15%). Ваша цифра сходится.
Вывод от этого не меняется, но становится точнее: 85% стоимости — вход, и режется он не длиной ответов, а длиной сессии. Плюс у выхода есть вторая цена, которой нет у ответа как такового: всё, что модель написала, ложится в контекст и потом читается заново на каждом следующем шаге. Так что «короче отвечать» помогает, но пока сессия живёт 800 запросов, эти 15% не там, где горит.
Добавлю пересчёт в статью как UPD.
Эту статью модель тоже вычитала.
А судя по тексту она полностью её написала!
Вывод «выход — полпроцента» держится на том, что токены в таблице сложены без веса, а тарифицируются они по-разному: чтение кеша идет по 0.1 базовой ставки за вход, запись — по 1.25, выход — по 5. Пересчитала вашу же таблицу в этих единицах: 5.75B чтения дают 0.58, 0.20B записи — 0.25, 0.03B выхода — 0.15, то есть выход не полпроцента, а около четверти от стоимости чтения, а запись кеша — почти половина. На квадратичный вывод про марафонские сессии это никак не влияет, а вот «просить отвечать короче бессмысленно» из этих цифр уже не следует. Ваш скрипт умеет складывать расход по тарифам, или в нем везде сырые токены?
Всё верно, и это уже поправлено в статье — UPD в конце раздела с таблицей, цифры сходятся с вашими до второго знака.
Скрипт в статье складывает сырые токены. Взвешенный вариант — три строки поверх него:
const W = {read: 0.1, write: 1.25, out: 5};const cost = read*W.read + write*W.write + out*W.out;
По моим данным получается: чтение 60,2%, запись 26,3%, выход 13,5%. Заодно пересчитал главный вывод в тех же единицах: сессии длиннее 300 запросов дают 62,5% стоимости вместо 67% в токенах — просадка есть, но вывод держится.
Про «просить отвечать короче»: соглашусь, что формулировка была слишком широкой, но конкретно у меня этот рычаг маленький не из-за тарифа, а из-за объёма. Средний ответ — 895 токенов на запрос: это агентная работа, где модель в основном читает и правит файлы, а не пишет текст. Сократить его вдвое — это 7% счёта, и то если инструкция «покороче» не добавит лишний шаг: каждый лишний шаг тянет полный контекст, а он у меня был 201k. На чат-нагрузке, где ответы длинные, ваш вывод был бы верен и без оговорок.
Жесткая остановка сессии скорее вредна. В текущей сесси у модели есть контекст, в новой сессии модель пойдёт снова перечитывать и изучать всё что ей нужно, что тоже стоит денег
Цена у перезапуска действительно есть, вопрос в том, с чем её сравнивать.
Новая сессия у меня стартует не с нуля: есть конспект предыдущей на пять строк и карта кода с диапазонами строк, так что модель читает один-два нужных фрагмента, а не изучает проект заново. Стартовый контекст выходит 50–65k плюс 10–20k на чтение — разово. А на 150-м шаге старой сессии каждый следующий запрос идёт от 200k и выше. Разница ~140k на запрос, то есть перезапуск окупается за три-пять шагов.
Где вы правы: режу не «через 150 шагов посреди мысли», а на границе задачи, и если задача одна большая и не делится — рвать её смысла нет, дороже выйдет. Правило работает ровно потому, что работа заранее нарезана на куски, каждый из которых закрывается за одну сессию.
5,75 миллиарда токенов за полгода: как я перестал жечь контекст в Claude Code