Сдается мне, что многие богатенькие 💰вайбкодеры😎 как бы хвастаются тем, что используют только топовые модели на максималках. Типа работать на дешевом китайце это зашквар. 🤦♂️ Что ж, вся индустрия тяжелого люкса живет за счет людского тщеславия.
Anthropic и OpenAI вполне бы уже могли открыть бутики где-нибудь на Rodeo Drive или 5th Avenue и продавать какие-нибудь брилльянтовые подписки — еще бы и очередь стояла.
На самом деле результат работы агента отнюдь не напрямую зависит от качества модели. Далеко не всегда нужно сжигать дорогие токены, чтобы получить годный результат.
Не надо выбирать LLM по цене токена или результату на обычном benchmark'е. Для агентных систем надо считать стоимость успешно выполненной задачи.
Почему:
🔹 дешевая модель может быть менее способна планировать; 🔹 поэтому она делает больше tool calls; 🔹 чаще ошибается; 🔹 запускает дополнительные итерации; 🔹 дольше работает; 🔹 потребляет больше контекста;
В итоге первоначальная экономия на токенах исчезает.
На мой взгляд, совершенно незаслуженно забыт Composer от Cursor. Это мог бы быть контр-пример к тезисам статьи.
По сути, Composer 2.5 этот тот же Kimi, то есть дешевая простая модель. Но Cursor дообучил его — не на общих темах по программированию, а конкретно на реальных агентских треках. И сейчас это вполне себе годная рабочая лошадка, по качеству сопоставимая с Opus 4.7 (как говорят)
Специально я тесты не гонял, жалко тратить токены на такое баловство. Но по ощущениям, Composer и планирует отлично, и код пишет, и всякий devops шарит. Выбираю более крутую модель только когда надо прям архитектуру продумать. Или когда Cursor дает заманчивые скидки — чисто попробовать.