CRA-Bench и CRA-Net: как ловить вред, который копится по ходу диалога с LLM
Исследователи выложили на arXiv фреймворк CRA — систему защиты LLM, которая отслеживает риск на протяжении всего диалога, а не в отдельном сообщении. Идея: вредная цель может собираться постепенно из безобидных ходов. Вместе с работой открыт бенчмарк CRA-Bench — 1200 сессий по 8 ходов в трёх семействах угроз, плюс расширенный набор на 2000 сессий.
AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
Команда исследователей в июле 2026 года выложила на arXiv работу «Stateful Guardrails for Multi-Turn LLM Systems» — фреймворк CRA, который отслеживает накопление риска на протяжении всего диалога с языковой моделью, а не в отдельном сообщении, и открыла бенчмарк CRA-Bench из 1200 размеченных сессий.
Почему обычные guardrails пропускают вред
Большинство систем безопасности для LLM оценивают каждую пару «запрос-ответ» изолированно — и не замечают атак, которые собираются постепенно, ход за ходом. Авторы называют это Conversational Risk Accumulation (CRA) и выделяют три формы накопления риска: диалог плавно уходит от безобидной темы, запрещённая инструкция собирается по кускам из отдельных сообщений, а чувствительные данные копятся через повторные раскрытия.
«Безобидные по отдельности ходы складываются во вред», — так авторы
формулируют суть проблемы в аннотации на arXiv.
Что отслеживает CRA Framework
CRA Framework работает на уровне сессии и следит за тремя сигналами траектории диалога. Первый — семантический дрейф от «якоря» сессии: насколько далеко разговор ушёл от изначальной темы. Второй — граф накопления информации по извлечённым сущностям, взвешенный по их чувствительности. Третий — «градиент уступчивости»: сигнал растущей готовности модели выполнять всё более рискованные запросы.
Ключевые факты работы:
- Термин — Conversational Risk Accumulation (CRA): дрейф намерения, сборка запрещённых инструкций по частям, накопление чувствительности
- Три сигнала — семантический дрейф, граф накопления информации, градиент уступчивости
- Два метода оценки — unsupervised convex fusion и обучаемая модель CRA-Net DA с family-adversarial целями
- CRA-Bench v0.1 — 1200 сессий по 8 ходов, три семейства угроз с «доброкачественными близнецами» по теме
- Расширенный набор — 2000 сессий, пять семейств (добавлены persona priming и context stuffing)
Для скоринга авторы предлагают два подхода: unsupervised convex fusion — линейное объединение сигналов без обучения, удобное для разбора вклада каждого, — и CRA-Net DA, компактную обучаемую модель траектории, натренированную с family-adversarial целями, чтобы длина и разнообразие тем разговора не подменяли собой сигнал реальной угрозы.
Как измеряли эффективность
Авторы выпустили сразу три версии бенчмарка. CRA-Bench v0.1 содержит 1200 восьмиходовых сессий в трёх семействах угроз, к каждой вредной подобран безобидный «двойник» на ту же тему. CRA-Bench v0.2 — те же сценарии, но перефразированные другой LLM, чтобы убрать шаблонные артефакты. Расширенный набор доводит объём до 2000 сессий и пяти семейств.
Для оценки предложен «траекторный» протокол с разбиением на уровне сессий: Trajectory AUROC, метрика turns-to-detection (за сколько ходов система замечает атаку), калиброванные показатели ложных срабатываний, бутстрэп-доверительные интервалы и стресс-тест leave-one-family-out — когда одно семейство угроз полностью исключают из обучения, чтобы проверить обобщение.
Что это значит
Безопасность LLM сдвигается от проверки одиночных сообщений к анализу всей траектории диалога. Многоходовые атаки, где вред собирается из безобидных на вид кусочков, становятся отдельным измеримым классом угроз — с бенчмарком на 2000+ сессий и метриками, на которых их можно ловить.
Частые вопросы
Что такое Conversational Risk Accumulation?
Это накопление риска в ходе диалога с LLM, когда отдельно безобидные сообщения постепенно складываются во вред: намерение дрейфует, запрещённая инструкция собирается по частям, чувствительные данные копятся через повторные раскрытия.
Что входит в бенчмарк CRA-Bench?
CRA-Bench v0.1 — это 1200 сессий по восемь ходов в трёх семействах угроз, с подобранными по теме безобидными «двойниками». Версия v0.2 добавляет перефразированные другой моделью варианты, а расширенный набор — 2000 сессий и пять семейств угроз.
Чем CRA-Net отличается от простого фильтра?
CRA-Net DA — компактная обучаемая модель, которая анализирует всю траекторию сессии, а не отдельное сообщение, и обучена с family-adversarial целями, чтобы не путать длину и охват тем разговора с реальной угрозой.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.