Комментарии 8
Задачи детские, извините. Проблемы с дешёвыми моделями начинаются на уровнях интеграций ежа с ужом, когда в контексте надо держать и "понимать" не только проект и соответствующие API, но и логику процесса и прочее.
Вот буквально свежий кейс - 3 дня с горем пополам двигал проект дешёвым Spark 1.3 , т.к. опуса и астру выжег ещё в начале недели. Спарк неплохой кстати, вот такие мелкие задачки как в статье на раз делает. А вот с задачей покрупнее убил полтора дня, собрать целостно не мог систему. Уже готов был расчехлять IDE и лезть смотреть, что же там всё таки происходит =) Но вот с утра свежий лимит Астры подъехал и она за час перестроила всё это рукоблудство Спарка и сходу проект взлетел. И нет, сам бы я всё это недели делал, реально нетривиально там.
Согласен, и по моим цифрам это тоже видно, если присмотреться. На четырёх задачах из пяти младшая модель решила всё, но потратила 100 ходов и 39 тысяч токенов вывода против 85 ходов и 23 тысяч у старшей. То есть даже там, где она справляется, она идёт к ответу длиннее. На мелкой задаче это лишние десять секунд. На вашей интеграции, видимо, это и есть те самые полтора дня.
А на чём именно Spark ломался: терял логику между файлами или чинил одно и ломал соседнее?
Как бы это сказать. Субъективно "не видел задачу в целом" и поэтому "чинил" проблемы местечково, не оглядываясь на последствия сверху. Да, это не то, что вообще ожидаемо требовать от ЛЛМки, но просто вот такое дело, что Астра с таким уровнем "мышления" уже справляется. Фейбл тоже, но у него свои тараканы.
Опять же, субъективно. Такие вещи замерять вообще непонятно как. Собирать разломанный сложный стенд и давать его "чинить" всем подряд?
В статье не указано (или я это не нашел), на каких настройках (Low / Medium / High / Extra High / Max) проверялись модели. Цена решения того же Опуса в режиме Low и Max может отличаться и в 5 и в 10 раз. А следовательно все выводы по сравнению цены между разными моделями трудно оценивать.
Старшие модели для таких простых задач, вероятно нужно сразу ставить в режим Low, а у младших моделей возможно уровень размышлений можно и поднять. И тогда в выводах может получиться уже другая раскладка - например, Сонет на высоких настройках долго думал и не решил, а Опус на низких отработал быстрее и решил. По цене одинаково, а значит используем Опус.
Справедливо, в статье этого нет, моя недоработка. Все сорок прогонов шли на дефолте клиента, а это high (посмотрел в теле запроса: output_config.effort = high у всех).
Вашу гипотезу проверил, прогнал три старшие модели на low, те же пять задач по два раза:
Sonnet 5: 9/10 за 450 с на high → 8/10 за 244 с на low (пятая задача оба раза мимо) Opus 5: 10/10 за 557 с → 10/10 за 210 с Fable 5.1: 10/10 за 341 с → 10/10 за 232 с
То есть вы правы: Opus на low из самого медленного стал самым быстрым и всё решил, а Sonnet на low ошибся там же, где младшая. Цена у Opus упала примерно на треть, а не в разы: на таких мелких задачах основные деньги уходят на входной префикс агента, а не на размышления.
Добавлю это апдейтом в статью, спасибо.
Если под рутиной понимать мелкие задачи, в пустом проекте из 10 файлов, то может быть цена и отличается на треть. Но в моем понимании рутина - это любая задача, которая не требует каких-то архитектурных решений и особых знаний от llm. Такие задачи могут решаться десятками ежедневно внутри проекта, в котором могут быть сотни или несколько тысяч файлов. И вот в этом случае разница уровне размышления уже реально будет отличаться в разы. В подтверждение в интернете есть куча графиков с замерами. Иногда даже между соседними уровнями high и extra high разница в итоговой цене может быть двухкратная.
В Вашем эксперименте рутиные задачи решены за 23-39тыс токенов. В моей практике чаще встречаются рутиные задачи, каждая из которых от одного до нескольких миллионов токенов. И вот в таких задача префикс в общем объеме незаметен.
Цена у Opus упала примерно на треть, а не в разы: на таких мелких задачах основные деньги уходят на входной префикс агента, а не на размышления.

Нужна ли умная модель для рутины? Дал четырём моделям пять одинаковых задач и сравнил