Pull to refresh

Comments 18

Спасибо, что дали не только «кто лучше», но и ходы, токены и стоимость — обычно как раз этой части и не хватает.

Мы гоняли похожий эксперимент, только задача была другого класса: не «сделай фичу», а «найди причину». Три агента, один и тот же тормоз в проде учётной системы на MS SQL, одинаковый стартовый контекст и доступ только на чтение. Ждали разброса в качестве решения, а получили другое: три разных ответа о причине. Все три технически защитимы, подтвердился на замере один.

Отсюда наблюдение, которое, кажется, дополняет ваши цифры. На задачах с проверяемым ответом самая говорящая метрика — не токены и не время, а сходятся ли агенты между собой. Сошлись — задача оказалась проще, чем выглядела. Разошлись — вы только что узнали про задачу больше, чем даёт любой бенчмарк.

И камень в свой же огород: один прогон на агента — ещё не замер. У нас продолжение как раз на этом и застопорилось. Пока не прогонишь каждого по нескольку раз, нечестно утверждать, что разница между агентами больше, чем разброс между запусками одного и того же. Подозреваю, тут та же дыра: 24 минуты у codex и 24 у claude code выглядят слишком одинаково, чтобы на них опираться.

Сходимость показывает только то что на гитхабе в обучающей выборке было много одинаковых решений этой проблемы. Шаг вправо, шаг влево - и начнутся галлюцинации

Справедливо, формулировку надо поправить: сходимость говорит не «задача проще», а «задача типовее» — плотный паттерн в обучающей выборке. Это разные вещи, и ваша версия точнее.

Косвенно это видно и в разбросе. У нас подтвердилась причина, которой в типовых рецептах нет: запрос был не медленный, он стоял в ожиданиях. А «медленный запрос» тянет за собой индексы и планы — и туда же тянет агентов. Механизм ровно ваш, просто с другой стороны: к типовому их сносит всегда, и правильный ответ находится тогда, когда он вне плотной части выборки.

А три агента по одному прогону — это не замер, а анекдот, тут я сам себе первый рецензент.

Было бы интересно как справиться Кими через Claude Code

У меня тоже есть такое желание попробовать одну модель, но разные cli, чтобы сравнить харнесс. Если руки дойдут, обязательно поделюсь результатом.

У Кими k3 три уровня effort - low, high и max. По крайней мере на сегодняшний день, по крайней мере в Kimi code.

Так и есть, отключать/менять ризонинг нельзя у k2.7

Один из плюсов Codex - щедрые лимиты. На подписке за 20$ насыпают достаточно щедро. Плюс бывает восстанавливают лимиты раньше обещаного, что вообще удивительно. Правда я за день могу израсходовать этот недельный лимит, но нужно учитывать что я даю обширные промты (по 400-500 строк). И так с утра до самого вечера. Обычно всегда хватает на сутки

Если работать размеренно, то в целом за 20$ это прям очень выгодно

Не катастрофа, что кто-то что-то не сделал с первого раза. Вторым, третьим промптом все можно изменить и добавить. Codex за $20 топ.

Возможно Claude по API отличается от подписочного через VSCode (а может я стать читал криво), но я повторю свой недавний комментарий в другом посте на хабре:

У меня одного Claude постоянно врёт, сочиняет, ошибается, додумывает от себя, лезет куда не надо и игнорирует инструкции? Последние полгода Codex выглядит гораздо адекватнее и последовательнее. Я использую их параллельно на одних и тех же проектах, чтобы получать второе мнение, и количество признаний в духе «да, здесь я был неправ» от Claude просто зашкаливает.

У Клода адекватность сильно зависит от размера контекста. Если скормить ему весь репозиторий разом, он начинает терять фокус и нести отсебятину

У меня с точностью до наоборот. Claude гораздо лучше следует ограничениям, если они изложены чётко и недвусмысленно.

К тому же стилистика сообщений у Codex ужасная, он повторяет одну и ту же мысль многократно в разных формулировках, растягивая короткие ответы на десяток абзацев. При этом инструкции вида "излагай мысли последовательно, без повторов и не относящейся к заданному вопросу информации" он полностью игнорирует, продолжая лить воду в колоссальных объёмах. Мне физически неприятно читать такое.

А что у вас в AGENTS.md, если не серкет?

Хорошее сравнение готовых агентских систем, но не моделей в чистом виде.

Есть существенная поправка к условиям: Kimi K3 позволяет выбирать уровень рассуждений — низкий, высокий или максимальный; по умолчанию используется высокий. Поэтому говорить, что уровень рассуждений у Kimi невозможно настроить, неверно. В ИИ‑области, правда, всё постоянно меняется, но я так знаюю С исходными настройками Claude тоже стоило бы разобраться подробнее: максимальный уровень мог сохраниться в конфигурации, а не быть стандартным значением.

Самое интересное продолжение уже предложили выше в комментариях: запустить одну модель через разные агентские оболочки. Например, K3 через родной Kimi Code и через Claude Code. По три запуска на одинаковых копиях проекта, с одинаковой постановкой задачи и заранее подготовленными приёмочными тестами — тогда станет понятнее, где проявляются свойства модели, а где поведение оболочки/обвязки.

Небольшая придирка к server-only: его подмена заглушкой в Vitest не снимает защиту в рабочей сборке, а только позволяет импортировать модуль во время тестов. Недостаток в другом: такие тесты сами по себе не обнаружат ошибочный импорт серверного кода в клиентскую часть. Это нужно отдельно проверять сборкой.

А вот защиту от повторного создания заявки через поле unique и обработку ответа 409 Claude действительно добавил очень к месту.

По три запуска на одинаковых копиях проекта

Если запускать модели не на своем оборудовании, то велика вероятность, что после первого раза на стороне LLM-провайдера закешируют и эксперимент получится нечистый.

И все начинает упираться в качественную постановку задачи

А вообще я даже рад, до ИИ мало кто умел написать нормально ТЗ, а виноват в последствиях чаще был именно исполнитель. Теперь страдать будет недалекий "заказчик", только сжигая уже не исполнителя, а свои деньги на попытки ИИ угадывать что он хотел.

Кодекс типичный мидл) Наворотил лишнего, прикрутил какую-то свою авторизацию и даже не спросил, надо ли оно проекту))

Codex sol можно и больше 256k контекст поставить. Становится лучше.

Sign up to leave a comment.

Articles