arXiv cs.AI→ оригинал

OpenEvoShield: защита мультиагентных LLM-систем от эволюционирующих инъекций

Исследователи выложили на arXiv OpenEvoShield — систему непрерывной защиты для мультиагентных LLM-систем. Она отражает атаки, где вредоносные инструкции расползаются между агентами через их переписку, а сами атаки постоянно эволюционируют. За 100 раундов тестов на 5 бенчмарках метод обошёл прежние подходы и поймал большинство новых атак при низком проценте ложных срабатываний.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
OpenEvoShield: защита мультиагентных LLM-систем от эволюционирующих инъекций
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи в июле 2026 года опубликовали на arXiv фреймворк OpenEvoShield — систему непрерывной защиты для мультиагентных систем на базе больших языковых моделей (LLM-MAS), которая за 100 раундов развёртывания распознаёт большинство ранее не встречавшихся атак-инъекций при низком уровне ложных срабатываний.

Против каких атак

OpenEvoShield защищает LLM-MAS от инъекции вредоносных инструкций через межагентную коммуникацию — когда злоумышленник подсовывает одному агенту команду, а тот распространяет вредоносное поведение по всей системе через переписку с другими агентами. По описанию авторов, такие атаки «дважды динамичны»: злоумышленники дорабатывают стратегии инъекций против уже развёрнутой защиты, а поведение нормальных агентов дрейфует по мере расширения системы. Именно поэтому статичные защиты, обученные один раз, быстро теряют точность.

Как устроена защита

OpenEvoShield построен как co-evolutionary continual defense — защита, которая эволюционирует вместе с атаками, а не остаётся замороженной после обучения. Согласно препринту, фреймворк собран из четырёх модулей.

  • M1 — асимметричный контроллер скоростей: разделяет быстрое обучение на стороне атаки и медленное на стороне нормального поведения по двум сигналам дрейфа
  • M2 — обновление границы нормы: медленно поддерживает динамическую поведенческую границу «нормальных» агентов
  • M3 — ансамбль политик с регуляризацией EWC: быстро адаптируется к новым угрозам без катастрофического забывания старых
  • M4 — энергетический детектор разной гранулярности: объединяет признаки уровня узла, подграфа и графа, чтобы отнести новую атаку к аномалиям вне обучающего распределения
  • Тестирование — 100 раундов развёртывания на 5 бенчмарках и 4 топологиях мультиагентных систем

Почему обычная защита ломается?

Обычная защита ломается потому, что рассматривает развёртывание как «закрытый мир» и теряет точность, как только распределение атак или нормального поведения выходит за пределы обучающей выборки. По данным arXiv, OpenEvoShield решает это через раздельные скорости обучения: сторона атаки подстраивается быстро, а граница нормы обновляется медленно, что не даёт системе принять постепенный дрейф за атаку. На 100 раундах эксперименты показали, что метод обгоняет и статичные, и continual-базовые подходы.

«OpenEvoShield превосходит статические и continual-базовые методы,

обнаруживая большинство ранее не встречавшихся атак при низком уровне ложных срабатываний», — говорится в аннотации препринта на arXiv.

Что это значит

По мере того как компании собирают из LLM-агентов рабочие конвейеры, безопасность межагентной переписки становится отдельной инженерной задачей. OpenEvoShield показывает направление: защита должна учиться непрерывно и в реальном времени, отличая эволюцию атак от естественного дрейфа системы.

Частые вопросы

Что такое атака через межагентную коммуникацию?

Это когда злоумышленник внедряет вредоносную инструкцию в сообщение одного агента, и та распространяется по системе, пока агенты обмениваются данными. По описанию авторов, это ключевая угроза для мультиагентных LLM-систем в задачах, критичных к безопасности.

На чём тестировали OpenEvoShield?

Согласно препринту, метод прогнали через 100 раундов развёртывания на 5 бенчмарках и 4 топологиях мультиагентных систем. В этих условиях он обошёл статичные и continual-базовые подходы, поймав большинство новых атак при низком проценте ложных срабатываний.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…