Обновить

Reasoning-модели нужно измерять по-новому. Представляем публичный лидерборд MERA Reason

Уровень сложностиПростой
Время на прочтение12 мин
Охват и читатели7.3K
Всего голосов 8: ↑7 и ↓1+9
Комментарии3

Комментарии 3

Посмотрел ваш лидерборд, не увидел в каком режиме использовались модели для бенча, чистая или в агентском режиме ?
Считаю это важным, так как к примеру по моим тестам, в агентском режиме у меня Gemma-4 12b на тесте ARC-AGI-1 решает 8/10 сложных задач, когда чистая модель показывает 0/10

Спасибо за комментарий! Вы совершенно правильно пишите, что агентный режим, когда есть некоторый harness вокруг модели очень разительно отличается от результатов прямого замера самой LLM. Это дополнительная по сути ось для замера, так как сравнивать чистые и агентные режимы напрямую некорректно. Наш борд и кодовая база поддерживают сейчас только формат прямого замера LLM, чтобы понимать качество чисто самих фундаментальных моделей.

Как считается общий балл? Опус вроде как во всех тестах сильнее всех, и только один тест завалил (и то неиполностью) Что может говорить о том что этот тест прошел как-то неправильно

Я уже присылал вам в чат запрос что по программированию было ровно то же самое в вашем рейтинге (на сайте) что 4b модель обгоняла 35b современную. Такие нестыковки не внушают доверия...

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации