S2T-RLHF: почему в RLHF награда по предложениям стабильнее, чем по токенам
Новый метод S2T-RLHF нацелен на давнюю проблему RLHF — нестабильность обучения. Вместо того чтобы дробить награду до отдельных токенов, он сначала распределяет её по предложениям ответа, а внутри каждого делает лишь ограниченную корректировку. По данным авторов, это повышает стабильность обучения без переобучения reward-модели и сохраняет качество выравнивания под предпочтения.
AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
В июле 2026 года на arXiv появилась работа, описывающая S2T-RLHF — метод обучения языковых моделей на человеческих предпочтениях, который распределяет награду сначала по предложениям ответа, а затем по отдельным токенам, чтобы сделать нестабильный процесс RLHF заметно устойчивее.
Почему RLHF нестабилен
Стандартный RLHF нестабилен потому, что модель получает единственную скалярную награду за весь ответ, а эта оценка затем «размазывается» по обновлениям политики на уровне отдельных токенов. Из-за этого неясно, какая именно часть ответа заслужила высокую или низкую оценку — задача распределения «заслуги» (credit assignment) внутри ответа остаётся неоднозначной.
Preference-модель, обученная на парных сравнениях ответов, оценивает ответ только целиком, а не по словам. Сигнал предпочтения задан лишь на уровне всего ответа (response level), поэтому его механический перенос на отдельные токены вносит дополнительный шум и раскачивает обучение.
Что предлагает S2T-RLHF
S2T-RLHF (sentence-to-token) вводит промежуточный уровень между всем ответом и отдельным токеном — предложение. Метод сначала раскладывает награду за весь ответ по предложениям, а внутри каждого предложения делает лишь ограниченную (bounded) корректировку по токенам. Важная деталь: для этого не нужно ни переобучать reward-модель, ни готовить отдельную разметку наград на уровне токенов.
- Три уровня гранулярности: весь ответ → предложение → токен
- Награда сначала делится по предложениям, затем ограниченно уточняется по токенам
- Не требует переобучения reward-модели
- Не требует token-level supervision — отдельной разметки наград по токенам
- Проверено на нескольких датасетах и разных настройках оптимизации
По данным авторов, при таком подходе обучение становится стабильнее и устойчивее, при этом качество выравнивания под предпочтения (preference alignment) остаётся конкурентным — то есть за стабильность не приходится платить точностью.
Почему предложение, а не токен
Предложение выбрано как промежуточный масштаб, потому что оно сохраняет смысловую целостность и при этом устойчивее к шуму, чем отдельный токен. Авторы прямо оспаривают распространённое допущение, что чем мельче дробление награды — тем лучше идёт оптимизация.
«Когда сигналы предпочтений зашумлены и заданы только на уровне
ответа, чрезмерно мелкозернистое уточнение награды может усилить неопределённость и дестабилизировать обучение», — говорится в статье на arXiv.
Вместо погони за максимально дробной наградой авторы формулируют granularity-aware принцип: дизайн награды должен быть ориентирован на стабильность, а не на предельную точность распределения. Уровень предложения балансирует семантическую связность с устойчивостью к token-level шуму.
Что это значит
RLHF остаётся основным способом настроить большие языковые модели под человеческие предпочтения, но его нестабильность — постоянная головная боль инженеров. S2T-RLHF предлагает недорогой рецепт: не гнаться за максимально дробной наградой, а выбрать разумный промежуточный масштаб — предложение. Если результаты воспроизведутся на других задачах и моделях, «уровень предложения» может закрепиться как дефолтная гранулярность в preference-обучении.
Частые вопросы
Что такое RLHF?
RLHF (reinforcement learning from human feedback) — обучение с подкреплением на человеческой обратной связи. Модель дообучают под предпочтения людей: reward-модель, натренированная на сравнениях ответов, выдаёт награду, по которой корректируется политика генерации.
Нужна ли для S2T-RLHF дополнительная разметка?
Нет. По описанию метода, S2T-RLHF работает без переобучения reward-модели и без token-level supervision. Это значит, что не нужна ни новая обучающая разметка наград по токенам, ни отдельная тренировка оценщика — метод переиспользует уже имеющийся сигнал предпочтений.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.