arXiv cs.AI→ оригинал

Spectral-LSH: сжатие промптов до 16× без дообучения для ускорения LLM-инференса

Исследователи представили Spectral-LSH — метод сжатия длинных промптов для языковых моделей без дообучения. Он группирует похожие токены через SimHash в спектральном пространстве внимания и сокращает вход в 8–16 раз. При сжатии 16× Qwen2.5-14B снижает коэффициент перплексии с 9,533 до 3,427 — качество сохраняется там, где простое разбиение текста на блоки его теряет.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
Spectral-LSH: сжатие промптов до 16× без дообучения для ускорения LLM-инференса
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи представили Spectral-LSH — метод сжатия длинных промптов для больших языковых моделей, который работает без дообучения и сокращает входной текст в 8–16 раз, сохраняя качество там, где простые методы его теряют. Препринт вышел на arXiv (номер 2607.19368) в июле 2026 года.

Зачем сжимать промпты

Длинные промпты дорого обрабатывать, потому что затраты на внимание (attention) на этапе prefill растут квадратично — как O(N²) от длины последовательности. Spectral-LSH решает это до того, как промпт попадает в модель: он находит близкие по смыслу токены и сливает их в «макро-токены», уменьшая длину входа ещё на подступах к вычислениям.

Ключевые факты из препринта:

  • Метод training-free — не требует дообучения модели
  • Работает как препроцессор, до входа в LLM
  • Тестировался на Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct и Qwen2.5-14B-Instruct
  • Датасет для оценки — C4
  • Коэффициенты сжатия ρ проверяли в диапазоне от 4× до 16×

Как устроен метод

Spectral-LSH аппроксимирует главные компоненты неявного оператора attention-ядра через метод подпространства Крылова (Krylov) вместе с random features. Это позволяет обойтись без явного построения матрицы внимания размером O(N²) — самой дорогой части при длинном контексте. Затем в полученном «спектральном» пространстве внимания применяется SimHash: похожие токены хешируются в одни корзины и агрегируются в макро-токены с сохранением причинного порядка позиций, чтобы модель не теряла структуру последовательности.

Где проходит фазовый переход

Главный результат — фазовый переход по коэффициенту сжатия, о котором пишут авторы. Ниже ρ = 4× локальная избыточность токенов мала, и лёгкий chunking (простое разбиение на блоки) даёт лучший баланс скорости и качества. Выше ρ = 8× спектральный путь начинает сохранять качество, которое chunking теряет.

При ρ = 16× разрыв особенно заметен: по данным препринта, Qwen2.5-7B в адаптивном режиме снижает коэффициент перплексии (PPL) с 353,409 до 196,963, а Qwen2.5-14B — с 9,533 до 3,427. Чем ниже перплексия, тем меньше искажается предсказание модели после сжатия.

«Наши эксперименты выявляют фазовый переход по коэффициенту сжатия», —

говорится в аннотации исследования на arXiv.

Что показал стресс-тест

На небольшом стресс-тесте с длинным контекстом из структурированных данных — фрагментов в стиле JSON, кода и таблиц — локальный LSH улучшил каждую метрику по сравнению с chunking при сжатии 8×. Адаптивный бэкенд объединяет оба режима: chunking при низком сжатии и спектральную кластеризацию при высоком. При этом самым быстрым по итоговой задержке остаётся именно chunking — за качество на высоких коэффициентах приходится платить временем.

Что это значит

Spectral-LSH показывает, что агрессивное сжатие промптов (8× и выше) можно делать без потери качества и без дообучения модели — если группировать токены по спектру внимания, а не резать текст на блоки. Для инференса длинных контекстов это прямой путь к меньшим затратам на вычисления.

Частые вопросы

Что такое Spectral-LSH?

Это training-free метод сжатия входных промптов для языковых моделей: он группирует похожие токены через хеширование SimHash в спектральном пространстве внимания и сливает их в макро-токены, сокращая длину входа в 4–16 раз. Дообучение модели не требуется.

На каких моделях тестировали метод?

Авторы оценивали Spectral-LSH на Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct и Qwen2.5-14B-Instruct на датасете C4, а также на стресс-тесте со структурированными данными в стиле JSON, кода и таблиц.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…