Comments 2
Посмотрел ваш лидерборд, не увидел в каком режиме использовались модели для бенча, чистая или в агентском режиме ?
Считаю это важным, так как к примеру по моим тестам, в агентском режиме у меня Gemma-4 12b на тесте ARC-AGI-1 решает 8/10 сложных задач, когда чистая модель показывает 0/10
Спасибо за комментарий! Вы совершенно правильно пишите, что агентный режим, когда есть некоторый harness вокруг модели очень разительно отличается от результатов прямого замера самой LLM. Это дополнительная по сути ось для замера, так как сравнивать чистые и агентные режимы напрямую некорректно. Наш борд и кодовая база поддерживают сейчас только формат прямого замера LLM, чтобы понимать качество чисто самих фундаментальных моделей.
Sign up to leave a comment.
Reasoning-модели нужно измерять по-новому. Представляем публичный лидерборд MERA Reason