Комментарии 9
Спасибо, что дали не только «кто лучше», но и ходы, токены и стоимость — обычно как раз этой части и не хватает.
Мы гоняли похожий эксперимент, только задача была другого класса: не «сделай фичу», а «найди причину». Три агента, один и тот же тормоз в проде учётной системы на MS SQL, одинаковый стартовый контекст и доступ только на чтение. Ждали разброса в качестве решения, а получили другое: три разных ответа о причине. Все три технически защитимы, подтвердился на замере один.
Отсюда наблюдение, которое, кажется, дополняет ваши цифры. На задачах с проверяемым ответом самая говорящая метрика — не токены и не время, а сходятся ли агенты между собой. Сошлись — задача оказалась проще, чем выглядела. Разошлись — вы только что узнали про задачу больше, чем даёт любой бенчмарк.
И камень в свой же огород: один прогон на агента — ещё не замер. У нас продолжение как раз на этом и застопорилось. Пока не прогонишь каждого по нескольку раз, нечестно утверждать, что разница между агентами больше, чем разброс между запусками одного и того же. Подозреваю, тут та же дыра: 24 минуты у codex и 24 у claude code выглядят слишком одинаково, чтобы на них опираться.
Было бы интересно как справиться Кими через Claude Code
У Кими k3 три уровня effort - low, high и max. По крайней мере на сегодняшний день, по крайней мере в Kimi code.
Один из плюсов Codex - щедрые лимиты. На подписке за 20$ насыпают достаточно щедро. Плюс бывает восстанавливают лимиты раньше обещаного, что вообще удивительно. Правда я за день могу израсходовать этот недельный лимит, но нужно учитывать что я даю обширные промты (по 400-500 строк). И так с утра до самого вечера. Обычно всегда хватает на сутки
Если работать размеренно, то в целом за 20$ это прям очень выгодно
Не катастрофа, что кто-то что-то не сделал с первого раза. Вторым, третьим промптом все можно изменить и добавить. Codex за $20 топ.
Возможно Claude по API отличается от подписочного через VSCode (а может я стать читал криво), но я повторю свой недавний комментарий в другом посте на хабре:
У меня одного Claude постоянно врёт, сочиняет, ошибается, додумывает от себя, лезет куда не надо и игнорирует инструкции? Последние полгода Codex выглядит гораздо адекватнее и последовательнее. Я использую их параллельно на одних и тех же проектах, чтобы получать второе мнение, и количество признаний в духе «да, здесь я был неправ» от Claude просто зашкаливает.
Хорошее сравнение готовых агентских систем, но не моделей в чистом виде.
Есть существенная поправка к условиям: Kimi K3 позволяет выбирать уровень рассуждений — низкий, высокий или максимальный; по умолчанию используется высокий. Поэтому говорить, что уровень рассуждений у Kimi невозможно настроить, неверно. В ИИ‑области, правда, всё постоянно меняется, но я так знаюю С исходными настройками Claude тоже стоило бы разобраться подробнее: максимальный уровень мог сохраниться в конфигурации, а не быть стандартным значением.
Самое интересное продолжение уже предложили выше в комментариях: запустить одну модель через разные агентские оболочки. Например, K3 через родной Kimi Code и через Claude Code. По три запуска на одинаковых копиях проекта, с одинаковой постановкой задачи и заранее подготовленными приёмочными тестами — тогда станет понятнее, где проявляются свойства модели, а где поведение оболочки/обвязки.
Небольшая придирка к server-only: его подмена заглушкой в Vitest не снимает защиту в рабочей сборке, а только позволяет импортировать модуль во время тестов. Недостаток в другом: такие тесты сами по себе не обнаружат ошибочный импорт серверного кода в клиентскую часть. Это нужно отдельно проверять сборкой.
А вот защиту от повторного создания заявки через поле unique и обработку ответа 409 Claude действительно добавил очень к месту.
И все начинает упираться в качественную постановку задачи
А вообще я даже рад, до ИИ мало кто умел написать нормально ТЗ, а виноват в последствиях чаще был именно исполнитель. Теперь страдать будет недалекий "заказчик", только сжигая уже не исполнителя, а свои деньги на попытки ИИ угадывать что он хотел.

Сравнение Codex, Claude Code и Kimi. Кто лучше на практических задачах