Comments 5
конечно не AGI - т.к. человеку никто не стирает ежесуточно память, а ему по сути стирают, он из прошлого помнит только то, что успел записать
Вы тут не совсем правы. ЛЛМ прерасно видит текущий день, всю прошлую статистику по дням, может делать записи так же по дням их получать. Информации более чем достаточно для принятия решений. Т.е даже просто в процессе симуляции данные собираются сами собой для последующего анализа и выводов.
Так же из эволюции ценообразования моделей в процессе симуляции, изменения меню, проведению экспериментов по локациям и прочим другим действиям можно смело сказать что они не начинают каждый день с чистого листа и "им стирают память".
И думаю вы в курсе про ограничение контекста текущих ЛЛМ и то как они экспонтенциально "глупеют" при его наполнении уже на 50-70%. Бенчмарк был спроектирован как раз таким образом, чтобы не перегружать модель контекстом, он тестирует не это. Средний объем конктекста в процессе симуляции у модели 30-50 тыс. токенов, что хорошо тянут модели с любым количеством параметров.
Интересно, видел посты про этот бенчмарк на редите несколько раз, вот уж не думал, его кто-то русскоговорящий делает.
Как все-таки модели быстро эволюционируют. Еще в начале года только топовые закрытые модели могли какую-то прибыль делать, все остальные, включая самые большие открытые модели стабильно банкротились, а теперь уже куча открытых моделей делают хорошие прибыли, а Опус 5 вообще в отрыв ушел.
Странно что у Gpt 5.6 результат даже ниже 5.5.
Да, по развитию моделей вы все правильно сказали. Но пока открытые модели значительно прокачались в навыках разработки, но все еще сильно проигрывают в бенчмарке фронтир моделям американских лабораторий. Возможно, к концу года появится 1-2 открытые модели которые пробьют порог в 50к$ в бенчмарке, очень хотелось бы.
про gpt 5.6 который оказался хуже 5.5 - да, всё так. Меня это тоже немного удивило. Но когда я после теста попользовался активно 5.6 sol по подписке Pro в режимах Max и Ultra и для решения довольно тривиальной задачи у него ушло 3 недельных лимита токенов (у меня накопились сбросы лимита в аккаунте) за 6 часов - посмотрев на результат я отменил подписку на Gpt и остался только с Claude на данный момент. Кстати это не еденичный случай - Opus 4.7 тоже показал себя немного хуже чем 4.6, но в топ он не попал тк было сделано не много прогонов. 4.8 потом отыгрался.
Claude Opus 5 — новый лидер в FoodTruck Bench. Рассказываю, как у него это получилось