Prefix-GRPO: метод обучения малых языковых моделей-агентов на префиксах траекторий
Исследователи представили Prefix-GRPO — метод обучения с подкреплением для малых языковых моделей-агентов. Вместо того чтобы копировать поведение сильной модели-учителя одним махом, он разбивает её траектории на префиксы, воспроизводит их в среде для восстановления промежуточного состояния и дообучает модель онлайн с наградой за задачу. На трёх средах — TextCraft, BabyAI и ALFWorld — подход обошёл и классическую дистилляцию, и стандартный RL.
AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
Исследователи предложили Prefix-GRPO — метод обучения с подкреплением, который в июле 2026 года опубликовали на arXiv (cs.LG). Он помогает малым языковым моделям-агентам учиться на траекториях сильной модели-учителя, не превращая их в одноразовую имитацию, и на трёх средах — TextCraft, BabyAI и ALFWorld — обходит и классическую дистилляцию, и стандартный RL.
Почему дистилляция буксует в долгих задачах
Прямая дистилляция сводит богатое многоходовое поведение учителя к одношаговым целям для имитации — и это неэффективно там, где ранние решения определяют будущие состояния и награды. Малые модели привлекательны как основа для интерактивных агентов: они дешёвые и быстрые. Но когда агент должен пройти длинную цепочку действий (собрать предмет, дойти до цели, выполнить инструкцию), обучение «повторяй ответ учителя» теряет причинно-следственную структуру: модель заучивает финальные реплики, но не понимает, как учитель дошёл до нужного состояния.
Как устроен Prefix-GRPO
Prefix-GRPO разбивает каждую траекторию учителя на два компонента: replay-aligned prefix queries (префиксы для воспроизведения) и online continuations (онлайн-продолжения). Каждый префикс проигрывается в среде заново, чтобы восстановить валидное промежуточное состояние, после чего ученик продолжает взаимодействие сам и получает награду за задачу.
Ключевое отличие от response-only GRPO в том, что метод применяет обрезанные (clipped) обновления политики и к историческим токенам ассистента внутри воспроизведённого префикса. Старые log-вероятности этих токенов оценивает отдельный SFT-чекпойнт, полученный дистилляцией политики. За счёт этого обучение префиксу и обучение продолжению объединяются в единую форму оптимизации политики.
- Метод: Prefix-GRPO, обучение с подкреплением поверх GRPO
- Идея: траектория учителя = префикс для реплея + онлайн-продолжение
- Отличие: clipped-обновления и для токенов ассистента внутри префикса
- Оценка старых log-вероятностей — через policy-distilled SFT-чекпойнт
- Тестовые среды: TextCraft, BabyAI, ALFWorld (3 бенчмарка)
Что показали эксперименты
На всех трёх средах Prefix-GRPO улучшил агентов на малых моделях по сравнению и с дистилляцией, и со стандартными RL-базлайнами. Отдельная серия ablation-экспериментов проверила, что именно даёт прирост: один только реплей префиксов оказался недостаточен без явной оптимизации токенов внутри них.
Одного воспроизведения префиксов недостаточно без явной оптимизации
токенов внутри префикса.
— формулировка из аннотации исследования на arXiv. Иными словами, восстановить промежуточное состояние среды мало — нужно ещё и обновлять политику на исторических токенах, иначе метод не даёт полного эффекта. Реализация и скрипты для воспроизведения результатов, по данным авторов, выложены в открытый доступ на GitHub.
Что это значит
Prefix-GRPO — попытка перенести часть «интеллекта» больших моделей-учителей в компактные модели без потери многоходовой логики поведения. Если подход масштабируется за пределы игровых сред, дешёвые локальные агенты смогут решать длинные задачи заметно лучше, чем при обычной дистилляции.
Частые вопросы
Что такое Prefix-GRPO?
Это фреймворк обучения с подкреплением для малых языковых моделей-агентов. Он разбивает траектории модели-учителя на префиксы, воспроизводит их в среде для восстановления промежуточного состояния и дообучает ученика в онлайн-взаимодействии с наградой за задачу.
Чем Prefix-GRPO отличается от обычного GRPO?
В отличие от response-only GRPO, который обновляет политику только на новых ответах, Prefix-GRPO применяет обрезанные обновления и к историческим токенам ассистента внутри воспроизведённого префикса, оценивая их старые log-вероятности через отдельный policy-distilled SFT-чекпойнт.
Где протестировали метод?
Авторы проверили Prefix-GRPO на трёх средах для агентов — TextCraft, BabyAI и ALFWorld — где он обошёл дистилляцию и стандартные RL-базлайны. Код и скрипты воспроизведения доступны на GitHub.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.