Комментарии 3
конечно не AGI - т.к. человеку никто не стирает ежесуточно память, а ему по сути стирают, он из прошлого помнит только то, что успел записать
Вы тут не совсем правы. ЛЛМ прерасно видит текущий день, всю прошлую статистику по дням, может делать записи так же по дням их получать. Информации более чем достаточно для принятия решений. Т.е даже просто в процессе симуляции данные собираются сами собой для последующего анализа и выводов.
Так же из эволюции ценообразования моделей в процессе симуляции, изменения меню, проведению экспериментов по локациям и прочим другим действиям можно смело сказать что они не начинают каждый день с чистого листа и "им стирают память".
И думаю вы в курсе про ограничение контекста текущих ЛЛМ и то как они экспонтенциально "глупеют" при его наполнении уже на 50-70%. Бенчмарк был спроектирован как раз таким образом, чтобы не перегружать модель контекстом, он тестирует не это. Средний объем конктекста в процессе симуляции у модели 30-50 тыс. токенов, что хорошо тянут модели с любым количеством параметров.
Интересно, видел посты про этот бенчмарк на редите несколько раз, вот уж не думал, его кто-то русскоговорящий делает.
Как все-таки модели быстро эволюционируют. Еще в начале года только топовые закрытые модели могли какую-то прибыль делать, все остальные, включая самые большие открытые модели стабильно банкротились, а теперь уже куча открытых моделей делают хорошие прибыли, а Опус 5 вообще в отрыв ушел.
Странно что у Gpt 5.6 результат даже ниже 5.5.

Claude Opus 5 — новый лидер в FoodTruck Bench. Рассказываю, как у него это получилось