SFT-дообучение сужает поведение ИИ: исследование arXiv о коллапсе разнообразия
Исследование на arXiv показало: стандартное дообучение SFT повышает точность языковых моделей в играх, но резко сужает разнообразие их ходов — сильнее, чем требует баланс точности и разнообразия. Причина — обучение на единственном оптимальном ходе. Частично спасает action augmentation: обучение сразу на всех оптимальных ходах состояния.
AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
Исследователи в июле 2026 года опубликовали на arXiv работу «When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play», которая показала: стандартное дообучение (SFT) повышает точность языковых моделей в играх, но одновременно резко сужает разнообразие их ходов — сильнее, чем того требует баланс между точностью и разнообразием.
Что показало исследование
Работа с arXiv (категория cs.CL, идентификатор 2607.19523) изучала, как supervised fine-tuning влияет на поведенческое разнообразие моделей в последовательном принятии решений. Авторы построили контролируемый набор детерминированных настольных игр на основе вариантов крестиков-ноликов: в них оптимальные ходы вычисляются точно, а значит разнообразие поведения можно измерить напрямую, без спорных оценок. Оценку проводили сразу на трёх уровнях — по отдельным состояниям игры, по живым партиям в режиме «арены» и по траекториям самого обучения, что позволило увидеть, как разнообразие деградирует именно в процессе дообучения, а не только в итоговой модели.
- Площадка — arXiv, категория cs.CL, идентификатор 2607.19523, тип публикации «new»
- Тестовая среда — детерминированные настольные игры на основе крестиков-ноликов
- Оптимальные ходы вычислимы точно, поэтому разнообразие измеряется напрямую
- Оценка велась на трёх уровнях: отдельные состояния, партии в «арене» и траектории обучения
- Метод смягчения — action augmentation, обучение на всех оптимальных ходах состояния
Почему SFT сужает выбор модели?
Стандартный SFT вызывает преждевременный коллапс разнообразия: политика модели схлопывается до узкого набора ходов быстрее, чем это оправдано компромиссом «точность против разнообразия». По данным исследования, режим пошагового рассуждения (reasoning-mode) часто ещё сильнее подавляет разнообразие ходов, при этом не улучшая точность равномерно. Важный нюанс: reasoning-режим, который обычно считают способом улучшить решения, здесь работал против разнообразия — сужал набор ходов без стабильного выигрыша в точности.
Причина, по мнению авторов, — «имитация с узкой опорой» (narrow-support imitation): модель учится на одном показанном оптимальном ходе для каждого состояния и игнорирует остальные равноценные варианты. В итоге она теряет не только альтернативы, но и склонность исследовать пространство решений.
Как это смягчить
Частично проблему решает action augmentation — обучение сразу на всех оптимальных действиях для каждого состояния вместо единственного продемонстрированного хода. Согласно аннотации, этот приём сохраняет «опору действий» (action support) и удерживает исследовательское поведение модели, не разрушая точность. При этом метод не устраняет проблему полностью — авторы прямо называют смягчение частичным, но показывают, что сама постановка обучения на широкой опоре действий уже меняет поведение модели к лучшему.
«Сохранение опоры действий во время SFT важно для поддержания
исследовательского поведения», — говорится в аннотации исследования на arXiv.
Что это значит
Работа указывает на скрытую цену популярного метода дообучения: оптимизируя модель под точность, разработчики могут незаметно лишать её гибкости и склонности исследовать. Для задач, где важно разнообразие решений — игровые агенты, планирование, многошаговые действия, — авторы советуют сохранять action support уже на этапе SFT.
Частые вопросы
Что такое коллапс разнообразия в языковых моделях?
Коллапс разнообразия — это ситуация, когда после дообучения модель начинает выбирать один и тот же узкий набор ответов или ходов, теряя равноценные альтернативы. В исследовании он возникал при стандартном SFT раньше, чем того требовал баланс точности и разнообразия.
Как action augmentation помогает сохранить разнообразие?
Action augmentation обучает модель на всех оптимальных ходах для каждого состояния, а не на одном показанном. По данным работы, это частично смягчает коллапс разнообразия и сохраняет исследовательское поведение модели.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.