arXiv cs.LG→ оригинал

LAARA против LoRA: адаптивный ранг по слоям для эффективного файнтюнинга

Исследователи представили LAARA — фреймворк для экономного дообучения нейросетей, который раздаёт разным слоям трансформера разный ранг адаптера. В отличие от LoRA с единым рангом, LAARA оценивает важность слоёв через диагональные оценки Фишера прямо во время обучения. На бенчмарках GLUE и MathInstruct он не уступает LoRA, AdaLoRA, DyLoRA и Bitfit, используя заметно меньше обучаемых параметров.

AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
LAARA против LoRA: адаптивный ранг по слоям для эффективного файнтюнинга
Источник: arXiv cs.LG. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи 23 июля 2026 года опубликовали на arXiv фреймворк LAARA (Layer-Aware Adaptive Rank Allocation) для параметр-эффективного дообучения: он раздаёт каждому слою трансформера собственный ранг адаптера и на бенчмарках GLUE и MathInstruct не уступает методам LoRA, AdaLoRA, DyLoRA и Bitfit при заметно меньшем числе обучаемых параметров.

Что не так с обычным LoRA

LoRA присваивает всем слоям трансформера одинаковый ранг адаптера, хотя разные слои требуют разной степени адаптации, — и авторы LAARA доказывают теоретически и эмпирически, что такое равномерное распределение фундаментально неоптимально. Ранг — это размерность низкоранговой добавки, которую метод дообучения вставляет вместо правки всех весов модели. Когда ранг одинаков везде, часть слоёв получает избыточную ёмкость, а часть — недостаточную. Именно на этом наблюдении и построен весь подход LAARA.

Как работает LAARA

LAARA распределяет ранги динамически и без перебора вариантов (search-free), опираясь на лёгкие диагональные оценки Фишера, которые вычисляются прямо во время обучения. Оценка Фишера показывает, насколько каждый параметр важен для задачи, и по ней фреймворк решает, какому слою дать больше ранга, а какому — меньше.

  • Проблема: единый ранг адаптера у LoRA для всех слоёв неоптимален
  • Метод: диагональные оценки Фишера (diagonal Fisher) для важности слоёв во время обучения
  • Четыре механизма: projection-wise нормализация, логарифмическое сжатие, смешанная оценка важности адаптеров, демпфер vote-to-change
  • Бенчмарки: GLUE (понимание языка) и MathInstruct (математические инструкции)
  • Базовые методы для сравнения: LoRA, AdaLoRA, DyLoRA, Bitfit

Механизм vote-to-change сглаживает решения о смене ранга, чтобы распределение оставалось стабильным и не дёргалось на каждом шаге обучения.

Что это даёт разработчикам

LAARA позволяет дообучать большие модели дешевле: по данным arXiv, фреймворк стабильно достигает или превосходит качество четырёх популярных методов, но тратит существенно меньше обучаемых параметров. Меньше параметров — меньше памяти на адаптеры и быстрее итерации при кастомизации модели под конкретную задачу. Код LAARA выложен в открытый доступ, так что подход можно проверить на своих данных.

«Распределение ранга по

Фишеру даёт принципиальную и эффективную основу для адаптивного параметр-эффективного дообучения», — говорится в аннотации статьи на arXiv.

Что это значит

Адаптивное распределение ранга по слоям — практичный способ выжать из LoRA-подобных методов больше качества при меньших затратах. Для команд, которые массово дообучают модели, это прямая экономия памяти и вычислений без потери точности.

Частые вопросы

Чем LAARA отличается от LoRA?

LoRA даёт всем слоям одинаковый ранг адаптера, а LAARA рассчитывает его для каждого слоя отдельно по диагональным оценкам Фишера во время обучения. За счёт этого LAARA держит то же или лучшее качество на GLUE и MathInstruct при меньшем числе обучаемых параметров.

Где взять код LAARA?

Авторы выложили реализацию LAARA в открытый доступ (ссылка указана в самой статье на arXiv). Это позволяет воспроизвести эксперименты и сравнить метод с LoRA, AdaLoRA, DyLoRA и Bitfit на своих задачах.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…