Комментарии 11
И так всё понятно.
Давайте уже 5 версию. Это через полгода примерно после прошлой, весной sonnet, летом opus.
Думаю, еще будут Sonnet 4.7 и Opus 4.7.
И так всё понятно.
Ну, если брать конкретно данный бенчмарк, то ситуация немного сложнее, чем преподносит нам статья. Если потыкать разные временные рамки длинной в полмесяца (например, 15 ноября - 1 декабря), то можно найти такие, где тот же Opus 4.5 уступает Sonnet 4.5 или даже GPT-5 medium, либо же вроде и стоит на первом месте, но отрыв от более старых моделей там совсем маленький. Да, здесь сильно влияет то, что в рамках полумесяца размер выборки обычно маленький, но даже на больших интервалах (1 октября - 1 декабря, 1 октября - 1 января) у Opus 4.5 отрыв не сказать что большой. Могут ещё влиять нерешаемые/плохо сформулированные задачи, но это по большей части касается pass@5 и не совсем (или совсем не) подходит для pass@1.
В общем, результаты тут немного сложны для интерпретации и имеют кучу нюансов.
Давайте уже 5 версию.
Судя по этому бенчмарку и другим (включая результаты от самих Anthropic), куда более вероятно, что следующей версией будет 4.6
Это через полгода примерно после прошлой, весной sonnet, летом opus.
У Anthropic же примерно со времен релиза Sonnet 3.5 крупные выпуски новых моделей (или крупные обновления существующих) выходят плюс-минус раз в 3-4 месяца, разве нет?
Тот случай когда haiku-4.5 пишет код лучше меня) решил на нем лимиты экономить, да так и остался.
Стоило бы не обрезать таблицу, а сказать, что в ТОП-10 моделей попала открытая GLM-4.7. И она действительно хороша. А сразу за ней - DeepSeek V3.2. Так что открытые модели идут довольно близко к премьер лиге, а если еще брать учет, что некоторые предоставляют инференс со скорость 1000+ токенов/сек для этих моделей - кто знает, как оно там все повернется дальше.

>Gemini 3 Flash Preview обходится в четыре раза дешевле Opus при отставании лишь в 3 процентных пункта
Если "полное говно" и "около-лидер" отличаются на 3% возникает много вопросов к качеству теста.
Хорошо, что включили минимакс 2.1. Но почему-то нет немотрона 3, qwen3 next и glm 4.6v и glm 4.6v flash. Они скорее всего будут в районе минимакса, но стоимость токена у них будет в десятки раз меньше как и системные требования.
Еще было бы интересно посмотреть те же модели но с учетом агентной обертки. Например у меня квен кодер с фидбеком и мутацией промпта минимаксом/немотроном решает вообще все задачи которые я ему даю.
Интересно, почему Gemini flash, выше pro?

Claude Opus 4.5 возглавил рейтинг ИИ-программистов SWE-rebench с результатом 63%