Что такое GeoRA? Рассказывают сотрудники лаборатории искусственного интеллекта компании «Криптонит».
В этом году группа китайских исследователей представила новый подход для эффективной настройки больших языковых моделей (LLM) в режиме обучения с подкреплением и проверяемыми наградами (RLVR).
Авторы показывают, что обычные методы параметрической тонкой настройки (PEFT), включая низкоранговую адаптацию (LoRA), не всегда эффективны в RLVR. Они не учитывают геометрию скрытого пространства (LSC), из-за чего обучение становится менее эффективным.
Метод GeoRA (Geometry-Aware Low-Rank Adaptation) призван устранить этот недостаток. Его ключевая идея в том, чтобы учитывать геометрическую структуру модели. RLVR-обновления часто лежат в анизотропном и сжимаемом подпространстве весов. Работа с ним не должна ломать основные признаки, уже выученные моделью.
Напомним, что LoRA обучает лишь небольшие низкоранговые матрицы вместо всех весов модели, поэтому она популярна в задачах экономного дообучения. GeoRA сохраняет эту идею, но добавляет сингулярное разложение (SVD, Singular Value Decomposition) и строит адаптер не прямо из исходной матрицы, а из геометрически ограниченного подпространства весов.
В GeoRA используется SVD для получения сингулярных компонент, которые и позволяют выделить главные направления обновления. Поэтому GeoRA одновременно обучает компактный адаптер и замораживает остаточные компоненты, что делает оптимизацию более устойчивой.
В результате достигается баланс между размером обновляемой части модели и стабильностью оптимизации. Вдобавок, GeoRA требует меньше вычислений, так как затрагивает мало параметров при обучении, а модель сходится быстрее.
Авторы проверили GeoRA на моделях Qwen и Llama с 1,5 – 32 млрд параметров, используя групповую относительную оптимизацию политики (GRPO) как основной RLVR-алгоритм. На математических бенчмарках GeoRA стабильно обошёл LoRA, PiSSA и MiLoRA, а также показал хорошие результаты на задачах по медицине и программированию.








