LAARA против LoRA: адаптивный ранг по слоям для эффективного файнтюнинга
Исследователи представили LAARA — фреймворк для экономного дообучения нейросетей, который раздаёт разным слоям трансформера разный ранг адаптера. В отличие от LoRA с единым рангом, LAARA оценивает важность слоёв через диагональные оценки Фишера прямо во время обучения. На бенчмарках GLUE и MathInstruct он не уступает LoRA, AdaLoRA, DyLoRA и Bitfit, используя заметно меньше обучаемых параметров.
AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
Исследователи 23 июля 2026 года опубликовали на arXiv фреймворк LAARA (Layer-Aware Adaptive Rank Allocation) для параметр-эффективного дообучения: он раздаёт каждому слою трансформера собственный ранг адаптера и на бенчмарках GLUE и MathInstruct не уступает методам LoRA, AdaLoRA, DyLoRA и Bitfit при заметно меньшем числе обучаемых параметров.
Что не так с обычным LoRA
LoRA присваивает всем слоям трансформера одинаковый ранг адаптера, хотя разные слои требуют разной степени адаптации, — и авторы LAARA доказывают теоретически и эмпирически, что такое равномерное распределение фундаментально неоптимально. Ранг — это размерность низкоранговой добавки, которую метод дообучения вставляет вместо правки всех весов модели. Когда ранг одинаков везде, часть слоёв получает избыточную ёмкость, а часть — недостаточную. Именно на этом наблюдении и построен весь подход LAARA.
Как работает LAARA
LAARA распределяет ранги динамически и без перебора вариантов (search-free), опираясь на лёгкие диагональные оценки Фишера, которые вычисляются прямо во время обучения. Оценка Фишера показывает, насколько каждый параметр важен для задачи, и по ней фреймворк решает, какому слою дать больше ранга, а какому — меньше.
- Проблема: единый ранг адаптера у LoRA для всех слоёв неоптимален
- Метод: диагональные оценки Фишера (diagonal Fisher) для важности слоёв во время обучения
- Четыре механизма: projection-wise нормализация, логарифмическое сжатие, смешанная оценка важности адаптеров, демпфер vote-to-change
- Бенчмарки: GLUE (понимание языка) и MathInstruct (математические инструкции)
- Базовые методы для сравнения: LoRA, AdaLoRA, DyLoRA, Bitfit
Механизм vote-to-change сглаживает решения о смене ранга, чтобы распределение оставалось стабильным и не дёргалось на каждом шаге обучения.
Что это даёт разработчикам
LAARA позволяет дообучать большие модели дешевле: по данным arXiv, фреймворк стабильно достигает или превосходит качество четырёх популярных методов, но тратит существенно меньше обучаемых параметров. Меньше параметров — меньше памяти на адаптеры и быстрее итерации при кастомизации модели под конкретную задачу. Код LAARA выложен в открытый доступ, так что подход можно проверить на своих данных.
«Распределение ранга по
Фишеру даёт принципиальную и эффективную основу для адаптивного параметр-эффективного дообучения», — говорится в аннотации статьи на arXiv.
Что это значит
Адаптивное распределение ранга по слоям — практичный способ выжать из LoRA-подобных методов больше качества при меньших затратах. Для команд, которые массово дообучают модели, это прямая экономия памяти и вычислений без потери точности.
Частые вопросы
Чем LAARA отличается от LoRA?
LoRA даёт всем слоям одинаковый ранг адаптера, а LAARA рассчитывает его для каждого слоя отдельно по диагональным оценкам Фишера во время обучения. За счёт этого LAARA держит то же или лучшее качество на GLUE и MathInstruct при меньшем числе обучаемых параметров.
Где взять код LAARA?
Авторы выложили реализацию LAARA в открытый доступ (ссылка указана в самой статье на arXiv). Это позволяет воспроизвести эксперименты и сравнить метод с LoRA, AdaLoRA, DyLoRA и Bitfit на своих задачах.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.