Обновить

Комментарии 16

В след. раз добавьте, пожалуйста, z.ai

по своему опыту работы с glm предположу, что там будет вообще нерабочий проект. Т.е. даже не последнее место, а "сошел с дистанции". Возможно у той модели проблемы именно с кодингом.

И в рейтинге не хватает Kimi/Composer

Попробовал по вашему совету z.ai. Вчера на моем запросе нейросеть зависала, а сегодня долго думала и выдала результат, который может посоперничать с Claude за первое место: https://leshkin.github.io/battle-city-ai-generate/10-07-2026/z-ai.html Впечатлен! Постараюсь обновить статью попозже. Спасибо!

почему первое место? Здесь враги топчутся на месте, а у claude ездят по экрану

Да, согласен, больше подходит второе место. Визуализация отличная, даже звуки есть, но интеллект противника хромает.

Она, к сожалению часто перегружена и уговаривает воспользоваться моделью попроще. Проявите упорство - оно того стоит.

:Жаль новый Грок 4.5 только вышел и ещё не попал в бесплатную зону на сайте.

Есть еще бесплатные kimi и stepfun. Сделайте тоже). + В карму)

Я тестирую на другом промпте и у меня алиса тоже не дописывает код. Гигачат хуже китайских, но хоть условно играбельно.

Не хватает информации о версии моделей. Gemini pro/flash? Claude sonnet/opus/fable? И т.д. про остальных ии.

Все настройки по умолчанию, как если бы вы зашли на сайт нейросети в первый раз. У Claude кроме выбора модели (сейчас там по умолчанию Sonnet 5) есть еще выбор уровня Effort (по умолчанию стоит Medium), у других нейросетей свои настройки. Для целей этого сравнения я посчитал это лишней информацией.

Вы ссылаетесь на статью, опубликованную почти 7 месяцев назад, как версия была у всех ии из той подборки? На эту статью вы будете ссылаться ещё через полгода, как читателю поможет знание, что вы тестировали модель по умолчанию? У меня в Gemini по умолчанию Pro, чтобы пройти ваш квест по отгадыванию модели, я должен создать новый аккаунт и сходить проверить, что там сегодня открывается по умолчанию, а где гарантии, что вчера или полгода назад была эта же версия модели? А если нейминг моделей изменится и их станет больше или меньше, каким образом можно будет угадать, что вы тестировали?

Для примера, игра по вашему промту из статьи от Gemini Pro 3.1, который доступен абсолютно бесплатно. Не идеальная, но явно не хуже того, что у вас на первом месте. А в статье что-то нерабочее от безымянного Gemini. Через полгода вы напишете, что Gemini в прошлый раз ничего не смог сделать, и будете правы лишь частично. Без указания моделей такое сравнение не то что бессмысленно, а вводит в заблуждение.

https://drop-a5345082-b76.viruseg.workers.dev

Stepfun 3.7 справился, выдал рабочую игру, без деревьев и воды правда :-) Думаю на уровне 2 места.

Qwopus 3.6 27b вообще красиво всё сделал

Помню в школе в 10 классе мой одноклассник написал на паскале игру танчики. Тогда я испытал примерно такое же чувство которое испытал сегодня играя в танчики от ИИ. Смесь удивления, восхищения, лёгкой зависти и грусти, что я так не смогу. Но сегодня добавилось еще кое-что. Мне сложно описать, это чувство что-то среднее между жадностью, алчностью и жаждой халявы. И немного стыда. Стыда, который я часто испытываю, когда надо провести траблшутинг, или разобраться в новом направлении, а я использую LLM для экономии времени. Для сисадмина ИИ очень крутое подспорье, чтобы сделать всё быстро и красиво.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации