Pull to refresh

Comments 8

Статья уже неактуальна, так как ещё два дня назад вышли новые модели Opus 5.5 и GPT-6 Sol.

Аналогично с дипсик. Заметно улучшенный DeepSeek V4.1 Flash вышел в начале сентября, в статье пишут про DeepSeek V4 Flash.

Как с языка сняли, на деле он очень продуктивен и быстр. При работе через api выходит очень дёшево, и, на мой взгляд, не сильно уступает в продуктивности моделям тех же антропиков/open ai.

Почемуто упущен важный тест Agi Arc 3, вот где видно какая модель реально умеет думать, а какя тупая, разрывы там мама не горюй. И на сложных задачах кодирования это тоже очень заметно.

Как думаете, какая модель лучше думает?

Мой опыт и доска лидеров подтверждает что на данный момент это Астра. Кстати тест легко гуглится по "agi arc 3" -> Leaderbord verified. Обновляется не быстро, потому что прогнать все тесты дорого, на Астре порядка 40к баксов. Но больше всех удивила Гемини 3.8 флеш, по сообразительности как Опус 5, а весь прогон обошелся 10 раз дешевше!

вот я пользуюсь астрой, но некие умные люди подсказывали что не просто астра- а астра medium в приоритете...видимо по всяким там соотношениям скорость качество цена. конечно зависит от задачи.. пробовал по разному- high иногда думает в три раза дольше- а эффект как у medium..но опять же не факт что у меня задача сопоставимая..

Qwen3.8 Max от Alibaba, снимок 2 сентября, картинки на входе, веса закрыты

Нет, открыты

Sign up to leave a comment.

Articles