Spectral-LSH: сжатие промптов до 16× без дообучения для ускорения LLM-инференса
Исследователи представили Spectral-LSH — метод сжатия длинных промптов для языковых моделей без дообучения. Он группирует похожие токены через SimHash в спектральном пространстве внимания и сокращает вход в 8–16 раз. При сжатии 16× Qwen2.5-14B снижает коэффициент перплексии с 9,533 до 3,427 — качество сохраняется там, где простое разбиение текста на блоки его теряет.
AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
Исследователи представили Spectral-LSH — метод сжатия длинных промптов для больших языковых моделей, который работает без дообучения и сокращает входной текст в 8–16 раз, сохраняя качество там, где простые методы его теряют. Препринт вышел на arXiv (номер 2607.19368) в июле 2026 года.
Зачем сжимать промпты
Длинные промпты дорого обрабатывать, потому что затраты на внимание (attention) на этапе prefill растут квадратично — как O(N²) от длины последовательности. Spectral-LSH решает это до того, как промпт попадает в модель: он находит близкие по смыслу токены и сливает их в «макро-токены», уменьшая длину входа ещё на подступах к вычислениям.
Ключевые факты из препринта:
- Метод training-free — не требует дообучения модели
- Работает как препроцессор, до входа в LLM
- Тестировался на Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct и Qwen2.5-14B-Instruct
- Датасет для оценки — C4
- Коэффициенты сжатия ρ проверяли в диапазоне от 4× до 16×
Как устроен метод
Spectral-LSH аппроксимирует главные компоненты неявного оператора attention-ядра через метод подпространства Крылова (Krylov) вместе с random features. Это позволяет обойтись без явного построения матрицы внимания размером O(N²) — самой дорогой части при длинном контексте. Затем в полученном «спектральном» пространстве внимания применяется SimHash: похожие токены хешируются в одни корзины и агрегируются в макро-токены с сохранением причинного порядка позиций, чтобы модель не теряла структуру последовательности.
Где проходит фазовый переход
Главный результат — фазовый переход по коэффициенту сжатия, о котором пишут авторы. Ниже ρ = 4× локальная избыточность токенов мала, и лёгкий chunking (простое разбиение на блоки) даёт лучший баланс скорости и качества. Выше ρ = 8× спектральный путь начинает сохранять качество, которое chunking теряет.
При ρ = 16× разрыв особенно заметен: по данным препринта, Qwen2.5-7B в адаптивном режиме снижает коэффициент перплексии (PPL) с 353,409 до 196,963, а Qwen2.5-14B — с 9,533 до 3,427. Чем ниже перплексия, тем меньше искажается предсказание модели после сжатия.
«Наши эксперименты выявляют фазовый переход по коэффициенту сжатия», —
говорится в аннотации исследования на arXiv.
Что показал стресс-тест
На небольшом стресс-тесте с длинным контекстом из структурированных данных — фрагментов в стиле JSON, кода и таблиц — локальный LSH улучшил каждую метрику по сравнению с chunking при сжатии 8×. Адаптивный бэкенд объединяет оба режима: chunking при низком сжатии и спектральную кластеризацию при высоком. При этом самым быстрым по итоговой задержке остаётся именно chunking — за качество на высоких коэффициентах приходится платить временем.
Что это значит
Spectral-LSH показывает, что агрессивное сжатие промптов (8× и выше) можно делать без потери качества и без дообучения модели — если группировать токены по спектру внимания, а не резать текст на блоки. Для инференса длинных контекстов это прямой путь к меньшим затратам на вычисления.
Частые вопросы
Что такое Spectral-LSH?
Это training-free метод сжатия входных промптов для языковых моделей: он группирует похожие токены через хеширование SimHash в спектральном пространстве внимания и сливает их в макро-токены, сокращая длину входа в 4–16 раз. Дообучение модели не требуется.
На каких моделях тестировали метод?
Авторы оценивали Spectral-LSH на Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct и Qwen2.5-14B-Instruct на датасете C4, а также на стресс-тесте со структурированными данными в стиле JSON, кода и таблиц.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.