LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения
Исследователи показали LISA — модуль замены механизма внимания для языковых моделей. Он объединяет линейное внимание и «молниеносный индексатор», который отбирает только важные токены и снижает сложность вычислений с O(n²) до O(nM). На моделях DeepSeek-distilled-Qwen метод дал 50% ускорения вывода при контексте 16K токенов и +5,6% к качеству рассуждений — без обучения с нуля.
AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
Исследователи представили LISA (Linear-Indexed Sparse Attention) — модуль замены механизма внимания, который в июле 2026 года показал ускорение вывода на 50% при контексте в 16 тысяч токенов и рост качества рассуждений на 5,6%, не требуя обучения модели с нуля. Работа опубликована на arXiv (2607.19358).
Как работает LISA
LISA встраивается в существующую модель как plug-and-play замена стандартного self-attention и объединяет две параллельные ветви. Первая — Linear Attention со сложностью O(n), которая отвечает за «долгую память» и дальние зависимости. Вторая — механизм Lightning Indexer, который отбирает top-M самых важных токенов из всего контекста и передаёт их в Sparse Self-Attention. Ветви сводятся через gating-механизм.
- Название: LISA (Linear-Indexed Sparse Attention), препринт arXiv 2607.19358
- Сложность вывода снижается с O(n²) до O(nM), где M намного меньше n
- Два компонента: Linear Attention (O(n) память) + Lightning Indexer + Sparse Self-Attention
- Не требует предобучения с нуля — модуль встраивается в готовую модель
- Тесты — на моделях DeepSeek-distilled-Qwen
Почему это важно для inference
Стандартный self-attention имеет квадратичную сложность O(n²), из-за чего стоимость вывода резко растёт на длинных последовательностях. Это стало узким местом для моделей с длинными цепочками рассуждений (long chain-of-thought) вроде DeepSeek-R1 (Дипсик-R1): парадигма test-time scaling заставляет их генерировать всё более длинный контекст рассуждений, а вместе с ним растут и издержки. По оценке авторов, именно это ограничивает вывод long-CoT-моделей в продакшене.
LISA атакует проблему архитектурно, а не за счёт более мощного железа. Заменяя часть полного внимания разреженным и линейным, метод переводит генерацию n токенов из режима O(n²) в режим O(nM) — при том что M (число отобранных токенов) заметно меньше длины контекста n.
Что показали тесты
На моделях семейства DeepSeek-distilled-Qwen LISA дала 50% ускорения вывода при контексте 16K токенов и одновременно подняла средний результат на reasoning-бенчмарках на 5,6% — включая AIME и MATH-500. То есть метод не просто ускоряет, но и не проседает по качеству.
Обучение построено в две стадии. На первой в модель интегрируется линейное внимание для дальних зависимостей, дополненное механизмом скользящего окна (sliding-window); оно оптимизируется дистилляцией знаний, чтобы приблизить распределение полного self-attention «замороженной» модели-учителя. На второй стадии статичное скользящее окно заменяет Indexer, обучаемый через новую функцию потерь — per-head KL-дивергенцию, которая выравнивает его выбор токенов с паттернами внимания учителя.
«LISA обеспечивает 50% ускорения вывода при контексте 16K токенов,
одновременно улучшая средний результат на 5,6% на бенчмарках рассуждений, включая AIME и MATH-500», — говорится в аннотации исследования на arXiv.
Что это значит
Длинные рассуждения дорого обходятся именно из-за квадратичного внимания, и LISA показывает путь удешевить их без переобучения модели с нуля — достаточно встроить модуль в готовую сеть. Для команд, которые деплоят reasoning-модели в продакшене, это прямой способ срезать издержки на inference, не жертвуя точностью.
Частые вопросы
Что такое LISA?
LISA (Linear-Indexed Sparse Attention) — модуль замены механизма внимания для языковых моделей. Он объединяет линейное внимание и разреженное внимание с отбором важных токенов, снижая сложность вывода с O(n²) до O(nM).
Нужно ли переобучать модель для LISA?
Нет, обучение с нуля не требуется. LISA — plug-and-play замена self-attention; она встраивается в готовую модель и настраивается в две стадии через дистилляцию знаний от модели-учителя.
Насколько LISA ускоряет вывод?
По данным аннотации, на моделях DeepSeek-distilled-Qwen метод даёт 50% ускорения вывода при контексте 16K токенов и при этом повышает среднее качество рассуждений на 5,6% на бенчмарках AIME и MATH-500.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.