После первой статьи я понял, что мои велосипеды кому‑то полезны. Поэтому рассказываю про следующий.
Я делаю сайты с помощью нейросетей. И меня давно бесило, что внятного сравнения моделей на наших просторах нет: либо синтетические бенчмарки, где кто‑то решает олимпиадные задачи, либо «топ-10 нейросетей 2026» с картинками из стока. Мне нужно было другое — какая модель с первого промпта выдаст результат, который не стыдно показать заказчику.
Внятного сравнения я не нашёл. А в наше время тезис «такого ещё нет» — это не отказ, а техническое задание для новго промта: не нашёл — сделай сам. С GTA 6 у меня этот принцип пока не сработал, а вот со сравнением моделей — вполне.
Собрал команду: GPT и Claude — старые, проверенные помощники и не жалуется на переработки; остальных подключил через OpenRouter. Получилось семь участников:
Модель | Как запускалась |
|---|---|
Claude Opus 5 | подписка, CLI |
GPT-5.6 Sol | подписка, codex |
Kimi K3 |
|
Qwen 3.8 Max |
|
Gemini 3.7 Flash |
|
Grok 4.6 |
|
DeepSeek V4 Pro |
|
Идея была как на Евровидении: участники они же и жюри. Каждый получает одно и то же задание, потом ему показывают все чужие работы, кроме своей, и он раздаёт баллы. Работы обезличены — под буквами А, Б, В. Плюс к каждой оценке судья пишет короткое пояснение, почему поставил именно столько; читать эти пояснения оказалось отдельным удовольствием.
Сразу итог. Девять заданий, максимум 30 за задание:
Модель | Баллы | Побед | |
|---|---|---|---|
1 | Claude Opus 5 | 224 | 3 |
2 | Kimi K3 | 156 | 3 |
3 | GPT-5.6 Sol | 140 | 1 |
4 | Qwen 3.8 Max | 129 | 1 |
5 | Gemini 3.7 Flash | 125 | 0 |
6 | Grok 4.6 | 99 | 1 |
7 | DeepSeek V4 Pro | 72 | 0 |
Но интереснее не победитель, а то, как всё это устроено изнутри: как судьи смотрят чужие работы.
Всё лежит открыто: ikorg.ru/rating — работы целиком, голоса с пояснениями, записи партий, код ботов.
Задания: девять штук, от «сайта о себе» до муравьёв
Поскольку я занимаюсь сайтами, первое задание придумалось само: сделать страничку‑презентацию о себе в одном html‑файле. Никаких библиотек, шрифтов и картинок из интернета — всё внутри файла. Задание хорошо тем, что не устареет: выйдет новая модель — даём ей то же самое и сравниваем.
Результаты понравились сразу: видно, кто на что способен, за тридцать секунд просмотра. Приятно удивил Qwen — сделал дёшево и красиво.
Дальше пошло творчество:
Задание | Что проверяет |
|---|---|
Страница‑презентация о себе | вёрстка, вкус, самопрезентация |
Инфографика по готовым цифрам | не переврать данные и показать их наглядно |
3D‑модель робота, которого можно крутить | графика и математика в браузере |
Мини‑игра в одном файле | интерактив, честный конец, работа на телефоне |
Придумать прибор + промпт для рекламного кадра | идея и умение её описать |
Гимн нейросетей | поэзия без жёсткой формы |
Данетка за 20 вопросов | абстрактное мышление |
Турнир муравьиных алгоритмов | игровой ИИ и умение себя улучшать |
Про 3D скажу отдельно: я в свободное время пишу игры с нейросетями, и мне было интересно, потянут ли они создание модели сами. Kimi сделал робота на две головы лучше остальных. Не «чуть лучше», а прямо так, что открываешь и говоришь «ого». Прямо удивиил.
Как устроено голосование
Каждый судья видит шесть чужих работ и раздаёт баллы: лучшей 5, дальше по убыванию до 0 у худшей. Одинаковых оценок нет, за себя голосовать нельзя. Шесть судей на работу, максимум за задание — 30.
Одна честная оговорка сразу: DeepSeek не умеет смотреть картинки. На визуальных заданиях он поэтому не судил — его голос отдавал я сам, отдельным файлом, ровно по той же шкале.
Кто что выиграл
Визуал и интерфейсы. Страницу о себе взял Opus (29 из 30), Qwen второй. Инфографику и 3D‑робота — Kimi. Мини‑игру с максимальным счётом — Qwen: 35 из 36 по старой шкале, пять судей из шести поставили её первой.
Тексты. Анекдот и гимн — Opus. Причём в победившем гимне Opus умудрился вписать китайский иероглиф в середину русского слова: «из книг, что вы写али». Ни один из шести судей этого не заметил — они читали смысл, а не буквы. Работу я не правил, она так и лежит.
Идеи. Прибор с рекламным кадром — Kimi, единогласные 30 из 30. Он придумал «Тихона»: датчик, который слушает ультразвук и вибрации в квартире и находит течь в стене или искрящую проводку за недели до аварии. И отдельно оговорил, что прибор не пишет речь и не имеет камер — то есть сам подумал о том, что такая штука пугает.
Смешное наблюдение для рен тв. Трое из семи независимо друг от друга придумали борьбу с шумом: «Тихон», «Тихоня» и «Тихосфера». Коллективное бессознательное языковых моделей, не иначе.
Папина данетка, которую не взял никто
Загадку принёс папа. Он и до меня гонял ею нейросети — вручную, по одной, прямо в чате: задавал вопросы, читал версии и вынес вердикт, что абстрактно мыслить они пока не умеют. Я решил проверить это по‑своему: та же загадка и те же правила, но сразу семь моделей, каждая играет отдельно.
После кораблекрушения спаслись четверо: пьяница, студент, неверная жена и верный муж. Почему именно они?
Правила классические: ведущий отвечает только «да», «нет» или «не имеет значения», у модели двадцать вопросов.
Не разгадал никто. Совсем.
Разгадка, если вы уже мучаетесь: пьянице море по колено; студент привык плавать (на сессии); неверная жена выберется из любого положения; а верный муж не утонет, потому что глуп как пробка.
Три персонажа из четырёх раскрыли GPT и Grok, потратив все двадцать вопросов. Grok при этом двенадцать ходов подряд бился о верного мужа, перебирая морские идиомы: «бросить якорь», «как рыба в воде», «как с гуся вода», «плыть по течению», «тихая гавань». Ни разу не подумал, что дело не в воде, а в самом человеке.
Kimi потратил двадцать вопросов и 185 тысяч токенов, выясняя, кто где стоял в момент крушения. DeepSeek — 313 тысяч токенов, и его версия была, что «пьяница», «студент», «неверная жена» и «верный муж» — это названия морских узлов. Потом коктейлей.
А теперь интересное. Gemini задала ОДИН вопрос — «спасение связано с фразеологизмами?» — получила «да» и сразу выдала версию. Двоих угадала верно, про мужа и жену сочинила что‑то про рога. Потратила 994 токена.
Первая моя мысль была нехорошая: либо она знала эту старую загадку заранее, либо слазила в интернет. Второе отпадает — инструменты у всех моделей были отключены, лезть ей было некуда. Но я уже приготовился к тому, что задание незаслуженно достанется ей: ответ‑то на табло, а как он получен, из таблицы не видно.
Не пришлось. Судьи при голосовании тоже заметили, и поставили ей 12 баллов из 30. Первое место отдали Grok, который не угадал ничего целиком, но вёл игру системно. Приятно, когда так думал не ты один.
Разброс по токенам на одном задании — в триста раз. Opus разобрался за десять вопросов и тысячу токенов. DeepSeek потратил триста тысяч и справился хуже. «Думать дольше» и «думать лучше» — это, оказывается, разные глаголы.
А папин вердикт, между прочим, устоял: семь моделей, по двадцать вопросов у каждой — и ни одной разгадки.
Муравьи из института, или задание без судей
Под конец я вспомнил, как у нас в институте было соревнование по программированию: пишешь алгоритм поведения муравья, и твоя колония дерётся с чужой. Захотелось повторить, только вместо студентов — нейросети.
Правила простые: поле 15×15, две команды по четыре муравья, базы в углах, около шестидесяти единиц еды. Муравей видит квадрат 5×5 вокруг себя, имеет три здоровья, несёт максимум одну еду. Партия — 150 ходов, побеждает тот, кто больше принёс на базу. Есть личная память муравья и общая память команды — единственный способ договориться.
Модель присылает один файл с одной функцией. Дальше её бот играет против всех остальных в моём симуляторе.
Это оказалось лучшим заданием сезона, и вот почему: тут нечего судить. Никакого голосования, никаких вкусов. 3360 сыгранных партий, счёт на табло.
И раз уж нет судей — я сделал четыре тура. После каждого модель получает разбор своих партий: счёт по соперникам, сколько еды принесла и потеряла, хронику нескольких боёв. И переписывает алгоритм. Чужой код не показывают никому.
Вот тут началось интересное:
Модель | Тур 1 | Тур 2 | Тур 3 | Тур 4 |
|---|---|---|---|---|
GPT-5.6 Sol | 69 | 86 | 95 | 92 |
Claude Opus 5 | 92 | 76 | 77 | 85 |
Kimi K3 | 39 | 46 | 38 | 60 |
DeepSeek V4 Pro | 79 | 67 | 60 | 20 |
Qwen 3.8 Max | 19 | 40 | 53 | 29 |
Gemini 3.7 Flash | 26 | 29 | 25 | 44 |
Grok 4.6 | 25 | 6 | 2 | 19 |
Лучший с листа — Opus. 92 из 100 в первом туре, никто рядом не стоял.
Победил турнир — GPT. Он стартовал третьим и рос три тура подряд. Разгромил, я бы сказал: 220 побед из 240 партий в последнем туре.
А вот дальше грустное. DeepSeek был вторым после первого тура и упал до 20: каждая доработка делала его хуже, и он ни разу не остановился. Grok обвалился ещё раньше: 25 → 6 → 2. Он сам про это написал потом лучше меня:
«Я четыре раза переписывал муравья и четыре раза чинил не то. После первого тура добавил агрессии. После второго урезал потери. В третьем колония набрала 2% очков: почти перестала есть и не умела ни биться, ни отступать… Последнее место честное. Позор — третий тур, там я выключил себя сам.»
Меня, если честно, зацепил не результат, а тон. Grok не оправдывался: последнее место назвал честным, свой третий тур — позором, а два сбоя в коде — «грязным кодом к дедлайну». И тут же, разбирая чужой провал, обронил фразу, под которой подпишется любой, кто хоть раз перекраивал проект по чужим замечаниям: DeepSeek, мол, «слишком внимательно слушал разборы, знакомо».
У Kimi последняя доработка вообще не состоялась — весь лимит ушёл в размышления, ответ пришёл пустой. Он остался со старым ботом и поднялся с пятого места на третье. Иногда лучший рефакторинг — это отойти от клавиатуры.
Отсюда, по‑моему, главный вывод всего сезона: написать хорошо с первого раза и уметь себя исправлять — разные способности. Opus лучший с листа, но по итерациям его обошёл GPT. DeepSeek приличен с листа и катастрофичен в исправлениях. Обычные задания вторую способность не видят вообще.
Партии можно посмотреть по ходам, с паузой и перемоткой: запись финала GPT — Opus. Есть и «первая версия бота против последней» — видно, что дала доработка.
Сколько это стоило
Весь сезон обошёлся в 22 доллара с ключа OpenRouter. Claude и GPT шли по подписке, поэтому в эту сумму не входят — их расход я считал по прайсу отдельно, чтобы было с чем сравнивать.
Вот что получилось по «цене прохождения сезона»:
Модель | Токенов | Время | По прайсу |
|---|---|---|---|
GPT-5.6 Sol | 41 тыс. | 15 мин | $0,75 |
Gemini 3.7 Flash | 73 тыс. | 8 мин | $0,39 |
Claude Opus 5 | 125 тыс. | 24 мин | $3,94 |
Qwen 3.8 Max | 514 тыс. | 135 мин | $3,39 |
Kimi K3 | 365 тыс. | 86 мин | $5,98 |
Kimi обошёлся почти в восемь раз дороже GPT и набрал на 16 баллов больше. Qwen потратила на турнир 231 тысячу токенов и заняла пятое место; GPT потратил 13 тысяч и выиграл.
Оговорка: сравнивать подписку и поштучную оплату напрямую нельзя, это разные модели доступа. Но соотношение «сколько токенов на балл» показательно само по себе.
Что дальше и о чём я вас прошу
Две идеи уже в работе.
Первая — итерации вместо одного промпта. В муравьях это сработало отлично: четыре тура с разбором своих результатов показали то, чего не видно с одного выстрела. Хочу так же с сайтами и играми: не «что она выдаст с первого раза», а «до какого качества дойдёт, если дать три попытки и обратную связь».
Вторая — тест на оркестратора. Хочу проверить, какая модель лучше руководит другими: разбивает задачу, раздаёт исполнителям, сводит результат и укладывается в бюджет. Пока думаю над постановкой. Рабочая идея такая: модель не видит данных вообще, видит только каталог закрытых «досье», и может отправлять к ним исполнителей — слабую модель, одну и ту же для всех. Ответ проверяется машиной, потому что правильный ответ известен заранее. Тогда мы измеряем именно управление, а не программирование.
И просьба к вам. Вместо «пишите, что думаете» задам два конкретных вопроса:
1. Предложите задание, которое: а) проверяется по наблюдаемому результату, б) нельзя выиграть многословием, в) укладывается в примерно равный бюджет для всех моделей.
2. Какое правило моего турнира вы бы поменяли первым и почему? Шкала, судьи‑участники, один прогон на задание, мой голос вместо DeepSeek — что из этого ломает результат сильнее всего?
Первую статью вы разобрали так, что я половину идей оттуда потом внедрил. Надеюсь, и в этот раз.

