Обновить

Комментарии 5

самопроверка это интересная фишка но вопрос в том насколько модель действительно проверяет себя а не просто генерирует более уверенный текст, и работает ли это за пределами кодовых задач где можно запустить тесты?

Как был grok x.ai на 4-5 местах в агентском программировании так и остаётся где-то рядом с qwen z.ai, с переменным успехом обгоняя Gemini

Первые 3 места крепко держат Claude, GPT и выскочка Kimi

Хотя тут неплохие независимые оценки

https://artificialanalysis.ai/articles/grok-4-6-benchmarks-and-analysis

Ну, посмотрим что остальные рейтинги скажут, не все вышли ещё

Интересное сравнение, но если упор идет на ожидание готового результата по промпту из примерно 10 слов, то как-будто бы таких нейронок нет и, по-моему скромному мнению, таковых не появится в ближайшие годы. Любой готовый продукт требует внимательного анализа со всех сторон для удобной дальнейшей поддержки и модернизации, а не лишь бы красиво выглядело, а что там под капотом - упустим из виду (это подходит больше к генераторам изображений/видео). Все-таки раз уж мы рассматриваем такого рода проекты, то будет резонно сравнивать их подход в коде, а не в готовом результате по очень скромным по описанию промптам. Иначе какая разница, если на средней паршивости проект вы потратите условные 5 долларов вместо 20, но с каждым не самым крупным обновлением та же самая нейронка будет переписывать львиную долю кода, тратя при этом все больше и больше ресурсов, т.к. фундамент на любое изменение так и норовит расколоться:)

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации