Комментарии 24
интересный подход, маленькая модель для конкретной задачи а не универсальный монстр. а как решаешь проблему что специализированная модель быстро устаревает при изменении предметной области - просто дообучаешь или сразу меняешь на новую?
Привет! Спасибо за комментарий. Да, действительно, в продуктовых задачах бывает так, что специализированная модель быстро устаревает при изменении конъюнктуры рынка. Тем не менее, в нашем случае модели были обучены под формальные задачи с неизменными правилами, поэтому тут дрейфа как такового нет. Возможен только сдвиг распределения - данный кейс мы рассмотрели в рамках исследования.
респект автору за то, что не стали пиарить только удачные прогоны. обычно в таких работах все гладко, а у тебя потом модель сыпется на первом же продакшн-запросе. здесь же прямо видно, где они мучались и что в итоге отрезали. это, кстати, помогает больше, чем любые таблички с accuracy
хороший материал, сохранил себе. плюс, что не остановились на голых цифрах, а прошлись по каждому компоненту - почему он дает прирост и на каких типах примеров начинает тормозить. тут есть над чем поразмышлять архитектурно
Давно искал такой разбор именно по маленьким рекурсивным моделям. обычно либо про большие LLM, где инфраструктура стоит как крыло самолета, либо просто абстрактный матан
оо, не увидел статью до этого, похоже, сегодня будет нормальное чтиво на вечер
Жирный респект что не стали делать очередное "вот наши цифры, смотрите SOTA", а нормально показали, где модель реально выигрывает, а где уже начинаются ограничения
Сохраню. Хочу отдельно посмотреть на ARC-AGI-2, потому что там уже не совсем история про тупой перебор, и интересно, насколько такой маленький reasoner реально умеет выцеплять закономерность.
прочитано от и до. сасибо за труд, получилось очень мощное исследование
Хороший материал для того, чтобы немного переосмыслить сам подход к reasoning-моделям. Не факт, что будущее именно за такими архитектурами, но направление точно выглядит достаточно интересным, чтобы за ним последить
вот после такого материала как раз остается ощущение, что есть над чем подумать:)
про стабильность прям жизненно. у меня похожая история была с маленькими моделями — на одном запуске все красиво, на другом те же параметры и уже совсем другие цифры
Здравствуйте! Скажите пожалуйста, а верно ли, что на обработку естественного языка такой подход не масштабируется?
Single Task Algorithmic Reasoning Models: как с помощью маленькой модели обойти большую LLM?