Comments 18
Спасибо, что дали не только «кто лучше», но и ходы, токены и стоимость — обычно как раз этой части и не хватает.
Мы гоняли похожий эксперимент, только задача была другого класса: не «сделай фичу», а «найди причину». Три агента, один и тот же тормоз в проде учётной системы на MS SQL, одинаковый стартовый контекст и доступ только на чтение. Ждали разброса в качестве решения, а получили другое: три разных ответа о причине. Все три технически защитимы, подтвердился на замере один.
Отсюда наблюдение, которое, кажется, дополняет ваши цифры. На задачах с проверяемым ответом самая говорящая метрика — не токены и не время, а сходятся ли агенты между собой. Сошлись — задача оказалась проще, чем выглядела. Разошлись — вы только что узнали про задачу больше, чем даёт любой бенчмарк.
И камень в свой же огород: один прогон на агента — ещё не замер. У нас продолжение как раз на этом и застопорилось. Пока не прогонишь каждого по нескольку раз, нечестно утверждать, что разница между агентами больше, чем разброс между запусками одного и того же. Подозреваю, тут та же дыра: 24 минуты у codex и 24 у claude code выглядят слишком одинаково, чтобы на них опираться.
Сходимость показывает только то что на гитхабе в обучающей выборке было много одинаковых решений этой проблемы. Шаг вправо, шаг влево - и начнутся галлюцинации
Справедливо, формулировку надо поправить: сходимость говорит не «задача проще», а «задача типовее» — плотный паттерн в обучающей выборке. Это разные вещи, и ваша версия точнее.
Косвенно это видно и в разбросе. У нас подтвердилась причина, которой в типовых рецептах нет: запрос был не медленный, он стоял в ожиданиях. А «медленный запрос» тянет за собой индексы и планы — и туда же тянет агентов. Механизм ровно ваш, просто с другой стороны: к типовому их сносит всегда, и правильный ответ находится тогда, когда он вне плотной части выборки.
А три агента по одному прогону — это не замер, а анекдот, тут я сам себе первый рецензент.
Было бы интересно как справиться Кими через Claude Code
У Кими k3 три уровня effort - low, high и max. По крайней мере на сегодняшний день, по крайней мере в Kimi code.
Один из плюсов Codex - щедрые лимиты. На подписке за 20$ насыпают достаточно щедро. Плюс бывает восстанавливают лимиты раньше обещаного, что вообще удивительно. Правда я за день могу израсходовать этот недельный лимит, но нужно учитывать что я даю обширные промты (по 400-500 строк). И так с утра до самого вечера. Обычно всегда хватает на сутки
Если работать размеренно, то в целом за 20$ это прям очень выгодно
Не катастрофа, что кто-то что-то не сделал с первого раза. Вторым, третьим промптом все можно изменить и добавить. Codex за $20 топ.
Возможно Claude по API отличается от подписочного через VSCode (а может я стать читал криво), но я повторю свой недавний комментарий в другом посте на хабре:
У меня одного Claude постоянно врёт, сочиняет, ошибается, додумывает от себя, лезет куда не надо и игнорирует инструкции? Последние полгода Codex выглядит гораздо адекватнее и последовательнее. Я использую их параллельно на одних и тех же проектах, чтобы получать второе мнение, и количество признаний в духе «да, здесь я был неправ» от Claude просто зашкаливает.
У Клода адекватность сильно зависит от размера контекста. Если скормить ему весь репозиторий разом, он начинает терять фокус и нести отсебятину
У меня с точностью до наоборот. Claude гораздо лучше следует ограничениям, если они изложены чётко и недвусмысленно.
К тому же стилистика сообщений у Codex ужасная, он повторяет одну и ту же мысль многократно в разных формулировках, растягивая короткие ответы на десяток абзацев. При этом инструкции вида "излагай мысли последовательно, без повторов и не относящейся к заданному вопросу информации" он полностью игнорирует, продолжая лить воду в колоссальных объёмах. Мне физически неприятно читать такое.
Хорошее сравнение готовых агентских систем, но не моделей в чистом виде.
Есть существенная поправка к условиям: Kimi K3 позволяет выбирать уровень рассуждений — низкий, высокий или максимальный; по умолчанию используется высокий. Поэтому говорить, что уровень рассуждений у Kimi невозможно настроить, неверно. В ИИ‑области, правда, всё постоянно меняется, но я так знаюю С исходными настройками Claude тоже стоило бы разобраться подробнее: максимальный уровень мог сохраниться в конфигурации, а не быть стандартным значением.
Самое интересное продолжение уже предложили выше в комментариях: запустить одну модель через разные агентские оболочки. Например, K3 через родной Kimi Code и через Claude Code. По три запуска на одинаковых копиях проекта, с одинаковой постановкой задачи и заранее подготовленными приёмочными тестами — тогда станет понятнее, где проявляются свойства модели, а где поведение оболочки/обвязки.
Небольшая придирка к server-only: его подмена заглушкой в Vitest не снимает защиту в рабочей сборке, а только позволяет импортировать модуль во время тестов. Недостаток в другом: такие тесты сами по себе не обнаружат ошибочный импорт серверного кода в клиентскую часть. Это нужно отдельно проверять сборкой.
А вот защиту от повторного создания заявки через поле unique и обработку ответа 409 Claude действительно добавил очень к месту.
И все начинает упираться в качественную постановку задачи
А вообще я даже рад, до ИИ мало кто умел написать нормально ТЗ, а виноват в последствиях чаще был именно исполнитель. Теперь страдать будет недалекий "заказчик", только сжигая уже не исполнителя, а свои деньги на попытки ИИ угадывать что он хотел.
Кодекс типичный мидл) Наворотил лишнего, прикрутил какую-то свою авторизацию и даже не спросил, надо ли оно проекту))
Codex sol можно и больше 256k контекст поставить. Становится лучше.
Сравнение Codex, Claude Code и Kimi. Кто лучше на практических задачах