Обновить

Grok 4.7, GPT-6 Astra, Claude и китайские модели, кто эффективнее?

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели8.4K
Всего голосов 2: ↑2 и ↓0+4
Комментарии7

Комментарии 7

Статья уже неактуальна, так как ещё два дня назад вышли новые модели Opus 5.5 и GPT-6 Sol.

Аналогично с дипсик. Заметно улучшенный DeepSeek V4.1 Flash вышел в начале сентября, в статье пишут про DeepSeek V4 Flash.

Почемуто упущен важный тест Agi Arc 3, вот где видно какая модель реально умеет думать, а какя тупая, разрывы там мама не горюй. И на сложных задачах кодирования это тоже очень заметно.

Как думаете, какая модель лучше думает?

Мой опыт и доска лидеров подтверждает что на данный момент это Астра. Кстати тест легко гуглится по "agi arc 3" -> Leaderbord verified. Обновляется не быстро, потому что прогнать все тесты дорого, на Астре порядка 40к баксов. Но больше всех удивила Гемини 3.8 флеш, по сообразительности как Опус 5, а весь прогон обошелся 10 раз дешевше!

вот я пользуюсь астрой, но некие умные люди подсказывали что не просто астра- а астра medium в приоритете...видимо по всяким там соотношениям скорость качество цена. конечно зависит от задачи.. пробовал по разному- high иногда думает в три раза дольше- а эффект как у medium..но опять же не факт что у меня задача сопоставимая..

Qwen3.8 Max от Alibaba, снимок 2 сентября, картинки на входе, веса закрыты

Нет, открыты

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации