arXiv cs.LG→ оригинал

Гибридное обучение VLA-моделей: качество онлайн-RL за половину вычислений

Новый препринт на arXiv (июль 2026 года) предлагает гибрид offline-online для обучения крупных vision-language-action (VLA) моделей. Онлайн-RL здесь регуляризуют offline-данными или offline-обученной эталонной политикой. Итог — та же устойчивость к ситуациям вне обучающего распределения, что и у чистого RL, но при вдвое меньшем бюджете обучения.

AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
Гибридное обучение VLA-моделей: качество онлайн-RL за половину вычислений
Источник: arXiv cs.LG. Коллаж: Hamidun News.
◐ Слушать статью

В июле 2026 года на arXiv появился препринт (arXiv:2607.19399), который предлагает объединить offline- и online-обучение с подкреплением для крупных vision-language-action (VLA) моделей и получить качество чистого онлайн-RL примерно за половину вычислительного бюджета.

Почему онлайн-RL дороже, но лучше

Онлайн-обучение с подкреплением (online RL) стабильно даёт более сильные стратегии, чем offline-методы, — с этого наблюдения авторы и начинают. Особенно велика разница на данных вне обучающего распределения (out-of-distribution, OOD): в непривычных сценах модель должна действовать там, где похожих примеров в обучении не было.

Модели, обученные только имитацией (imitation learning) или через supervised fine-tuning (SFT), на таких OOD-сценах часто «плывут»: они хорошо повторяют виденное, но плохо обобщают на новое. Сами VLA-модели по изображению и текстовой инструкции предсказывают действие — этим они и отличаются от обычных языковых моделей. Онлайн-RL, наоборот, учится на собственных действиях и их последствиях, поэтому держится увереннее.

Авторы ссылаются на недавнее исследование, которое ввело OOD-ориентированный бенчмарк и показало: обученные через RL VLA-политики заметно лучше в OOD и немного лучше в пределах распределения (in-distribution), чем те же модели после SFT. Плата за это преимущество — дорогое онлайн-взаимодействие и большой бюджет обучения.

Что именно предложили авторы

Исследователи проверяют, можно ли соединить достоинства обоих подходов в гибридной offline-online схеме. Идея — регуляризовать онлайн-RL за счёт offline-надзора, чтобы не терять устойчивость, но и не платить полную цену за онлайн-обучение.

Надзор вводят двумя способами: либо напрямую через offline-данные, либо через offline-обученную эталонную политику (reference policy), которая удерживает RL от расхождения в процессе обучения. Эталонная политика работает как мягкий якорь: RL свободно улучшает стратегию, но offline-надзор не даёт ей уходить в нестабильные решения.

  • Препринт: arXiv:2607.19399, опубликован в июле 2026 года
  • Объект — крупномасштабные vision-language-action (VLA) модели, отображающие зрение и язык в действия
  • Метод — онлайн-RL, регуляризованный offline-данными или offline-обученной эталонной политикой
  • Сравнение — с чистым offline-обучением и стандартным RL на OOD-бенчмарке
  • Итог — качество, близкое к стандартному RL, при примерно вдвое меньшем бюджете обучения

Все варианты тестировали на одном и том же OOD-бенчмарке и сравнивали с двумя крайностями: обучением только offline и стандартным онлайн-RL.

Сколько экономит гибрид?

Гибрид достигает качества, близкого к стандартному RL, расходуя примерно половину бюджета обучения, — это главный результат работы. Практически это значит, что до того же уровня можно дойти вдвое дешевле по вычислениям — или за тот же бюджет обучить более сильную модель. При этом сильная OOD-устойчивость сохраняется, а не приносится в жертву скорости.

Само по себе offline-обучение, по данным авторов, обеспечивает лишь ограниченное OOD-качество. Но как только offline-надзор встроен внутрь RL, устойчивость к нестандартным ситуациям остаётся высокой, а обучение идёт примерно вдвое эффективнее. Важный нюанс: это не компромисс «быстрее, но хуже» — выигрыш в скорости не съедает качество.

«Вместо компромисса между скоростью и OOD-качеством гибридный подход

сохраняет сильную устойчивость вне распределения и одновременно достигает выигрыша в эффективности», — говорится в аннотации исследования на arXiv.

Что это значит

Обучение крупных VLA-моделей — одно из самых ресурсоёмких направлений в робо-ИИ, и та же точность за половину бюджета означает ощутимую экономию для лабораторий и команд, которые тренируют агентов действия. Речь о моделях для роботов и агентов, которые действуют в физическом или программном окружении, где заранее собрать данные на все случаи невозможно, — поэтому устойчивость к OOD особенно ценна. Подход снимает выбор между надёжностью в необычных сценариях и скоростью обучения — а значит, делает онлайн-RL практичнее для реальных задач.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…