Комментарии 5
самопроверка это интересная фишка но вопрос в том насколько модель действительно проверяет себя а не просто генерирует более уверенный текст, и работает ли это за пределами кодовых задач где можно запустить тесты?
Как был grok x.ai на 4-5 местах в агентском программировании так и остаётся где-то рядом с qwen z.ai, с переменным успехом обгоняя Gemini
Первые 3 места крепко держат Claude, GPT и выскочка Kimi
Хотя тут неплохие независимые оценки
https://artificialanalysis.ai/articles/grok-4-6-benchmarks-and-analysis
Ну, посмотрим что остальные рейтинги скажут, не все вышли ещё
https://andchir.github.io/llm_coding_test/results_2026-08-08_site/index.html
https://andchir.github.io/llm_coding_test/results_2026-08-08_dino/index.html
По моим тестам GLM-5.2 всех побивает по соотношению цена/качество. У Grok'a прогресса вообще не видно.
Интересное сравнение, но если упор идет на ожидание готового результата по промпту из примерно 10 слов, то как-будто бы таких нейронок нет и, по-моему скромному мнению, таковых не появится в ближайшие годы. Любой готовый продукт требует внимательного анализа со всех сторон для удобной дальнейшей поддержки и модернизации, а не лишь бы красиво выглядело, а что там под капотом - упустим из виду (это подходит больше к генераторам изображений/видео). Все-таки раз уж мы рассматриваем такого рода проекты, то будет резонно сравнивать их подход в коде, а не в готовом результате по очень скромным по описанию промптам. Иначе какая разница, если на средней паршивости проект вы потратите условные 5 долларов вместо 20, но с каждым не самым крупным обновлением та же самая нейронка будет переписывать львиную долю кода, тратя при этом все больше и больше ресурсов, т.к. фундамент на любое изменение так и норовит расколоться:)


Встречаем Grok 4.6