Комментарии 29
Статья устарела на год, то есть на вечность
А сколько токенов сэкономил автор на написание этой статьи?
Именно здесь заключается самый главный вопрос. Это не просто уточнение, а Y. Иногда нужно понимать **длинное тире** "банальное сравнение" перед тобой или настоящий эксперт.
используйте скиллы ponytail и cave, graph для большого проекта. будет вам счастье
Да, для разработки это уже следующий уровень. Ponytail особенно интересный вариант: там сама идея в том, чтобы заставить агента сначала искать самое простое решение и только потом писать новый код.
Для больших проектов граф контекста тоже выглядит логичнее, чем бесконечно тащить весь проект в один чат. Надо будет отдельно потестировать эту связку.
Автор, расскажите, почему все агрегаторы так упорото пытаются народ подсадить именно на подписку? Чем таким намазана эта подписка, что вы не хотите предаставлять другие варианты оплаты? Чем вас не удовлетворяет единичные, случайные оплаты без строгой фиксации суммы? Я вот не хочу кому попало передавать свои реквизиты, чтобы этот кто попало снимал с моей карты суммы, которые посчитает нужным. Вас развилось слишком много (дело, видно, доходное), альтернатива, кого выбирать есть. Где более гибкие варианты оплаты, туда и уходим.
Какие есть советы по уменьшению расходования токенов моделей? Просто вроде модели всё улучшаются и улучшаются, я ставлю скиллы для экономии токенов и большего сохранения памяти, а лимиты как улетали, так и улетают, как вы справляетесь с этим?
А зачем вроде 200 долларов за глаза хватает в клоде , а в кодексе так вообще лимиты космос так они ещё и по три раза на неделе их сбрасывают, или вы прямо супер много проектов ведёте?
У меня в клоде подписка за 20 долларов, хватает впритык. Кодексом не пользовался, он сильно лучше клода?
Если $200 стабильно хватает под ваш сценарий, то проблема для вас действительно почти не существует :)
Но расход очень зависит от задач. Небольшие запросы и короткие coding-сессии могут есть совсем немного, а длинные агенты по большому проекту с постоянно растущим контекстом уходят в лимиты заметно быстрее.
Так что статья скорее для тех, кто регулярно смотрит на сообщение «лимит закончился» и не понимает, куда он опять делся.
под мой не хватает но большинству разрабов скажем так в рынке таких 90 процентов хватит
у меня сейчас по подпискам получается 2 клода , кодекс , грок, и антигравити итого вроде 1100 баксов , еще был композер от курсора , но я так понимаю оно не особо актуально так как его заменил грок и после покупки все данные забрал и частично уже выложил их в грок 4.6 и полностью их применит в грок 4.7
для тех кто не знает куда он делся настройте логгирование расхода лимитов в целом чтобы смотреть по времени и по каждой задаче логи ведите , это пишется за ппять минут в люой иишке для любой иишки через прогрессбар и вуаля ты всегда знаешь куда потратил деньги , так же можно хистори вью ппоставить какой нить или аналог https://habr.com/ru/articles/1068362/
эспериментировать, зависит от задачи. Иногда более слабая и дешевая модель подойдет для решения задачи: Sonnet 5 лучше, чем Sonnet 4.5, а какие-то простые задачами и дешевый Haiku сделает. Иногда стоит наоборот выбрать модель подороже и поумнее и она потратит на решение меньше токенов, чем более слабая.
да ничего там не наэкспериментируешь , на хайку ничего не напрогаешь толкового, если смотреть глобально опус против сонета то сонет дешевле и его больше но с учетом, что он хуже у него тупо больше итераций уходит и по итогу +- одно и тоже и проще сразу опусом .
Из таких вариантов только разве что использовать кодекс на 5.6-luna на high там можно еще + по лимитам влезть куда то в подписке за 20 баксов так как в луне прямо неплохо они все подкрутили, а потом уронили ее цену в 5 раз
хайку подходит для генерации тестовых данных, для быстрого саммари по тексту (когда надо быстро и можно принять риск среднего качества и небольшой потери контекста), хайку справится и с самыми простыми решениями, где надо выбирать например из двух вариантов по четко сформулированным критериям, и где 20% ошибок допустимы в обмен на скорость и цену. У дешевых моделей есть своя зона применения и не стоит их недооценивать.
да все это делается в веб версии где нет таких жестких лимитов , хайку так себе даже для выбора по криетриям, та же лена уделывает ее как ходячего
в общем такие специфичные вещи вы говорите которыми пользуется пару процентов людей, но и те не сидят на подписках за 20 абксов
Вот с самой идеей согласны. Единственное, 20% ошибок я бы не делала универсально допустимой цифрой :)
Но если ошибка дешёвая, легко проверяется или результат всё равно проходит следующий этап валидации, то платить за самую сильную модель действительно нет особого смысла. У дешёвых моделей своя вполне нормальная зона применения.
Для серьёзного кодинга с Haiku спорить не будем: там экономия действительно легко съедается дополнительными итерациями.
Но за пределами такого сценария экспериментировать как раз есть с чем. Классификация, суммаризация, простые преобразования данных, рутинные подзадачи для агентов вполне могут нормально уходить на дешёвые модели.
Luna сейчас тоже хороший пример. После снижения стоимости она стала гораздо интереснее именно как рабочая лошадка для рутинных этапов, а сложные куски можно отдавать более сильной модели.
да не сьедается она на хайку ты на ней ничего не напрограмируешь, то есть ты просрешь все бабло и ноль результата , это не луна же , особо эксериментировать смысла нет , сол, опус , фабл стоят не дорого и можно туппо на них сидеть и будет ок сразу и не надо тратить лишние дни и работыть в разы медленнее экспериментируя, пока есть дешман подписки клода и чатгтп в которых они ппродают токен в 30 и больше раз дешевле, нет вообще смысла думать о цене токенов, любое апи за деньги им проигрывает как стоячим по цене
а, так вы предлагаете покупать ворованные и прочего рода серые токены? Ну да, ага, "дешевый Fable".
Да, хороший нюанс. Смотреть только на цену токена вообще не очень полезно, важнее стоимость решённой задачи.
На простой задаче дешёвая модель может дать тот же результат за меньшие деньги. На сложной всё бывает наоборот: более сильная модель дороже за токен, но делает меньше итераций и в итоге обходится дешевле.
Так что универсального «всегда берите самую дешёвую» здесь точно нет.
Самое заметное у нас: не держать один чат бесконечно долго и не тащить в каждый запрос весь накопленный контекст.
Для больших задач лучше периодически делать краткое резюме текущего состояния и продолжать уже с ним, а постоянные материалы складывать в Projects/knowledge base, где работает кеширование. Ещё помогает объединять связанные задачи в один нормальный запрос вместо десятка коротких уточнений.
И со скиллами есть нюанс: они не всегда экономят лимит. Если скилл каждый раз добавляет большой объём инструкций или контекста, эффект может быть обратным.
Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расход