Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы
МТС в RnD-направлении Physical AI разрабатывает VLA-политику (Vision-Language-Action) для полноростового гуманоида. Главная проблема: робот уверенно берёт предмет со стола в статичной сцене, но начинает промахиваться, когда объект едет по конвейеру. Полноростовой робот при этом должен ещё и делать шаги, удерживая баланс тела, — а это многократно усложняет расчёт движений.
AI-обработка оригинала Habr AI; редакция Hamidun News
22 июля 2026 года ML-инженер МТС Дания опубликовала в корпоративном блоге на Habr разбор того, как в RnD-направлении Physical AI компании учат полноростового гуманоида брать предметы, движущиеся по конвейеру, с помощью VLA-политики (Vision-Language-Action, «зрение — язык — действие»).
В чём главная проблема
Гуманоид уверенно берёт предмет со стола, но начинает промахиваться, когда тот же предмет едет по конвейеру, — именно на этой задаче сосредоточена команда МТС. В статичной сцене объект неподвижен, освещение стабильно, а камера направлена в рабочую зону, поэтому современные VLA-модели показывают высокое качество управления. Как только предмет приходит в движение, привычная точность захвата пропадает: модель, обученная на неподвижных сценах, не успевает за меняющейся геометрией задачи.
По словам инженера, это не единичный сбой, а системное ограничение подхода, который отлично работает в лабораторных демонстрациях, но плохо переносится на реальный конвейер.
Робот уверенно берёт предмет со стола, но начинает промахиваться,
когда предмет едет по конвейеру.
— Дания, ML-инженер MTC Web Services
Чем динамическая сцена сложнее статичной
Динамическая среда добавляет сразу два уровня сложности: движется сам объект и движется робот, который должен под него подстроиться. Большинство эффектных демонстраций роботов до сих пор снимают в статике — предметы аккуратно разложены на столе, сцена почти не меняется. Реальные задачи в быту и на производстве так не выглядят: как минимум объекты едут по конвейеру, и захват нужно рассчитывать с учётом их скорости и траектории.
Ключевые вводные проекта:
- Команда — RnD-направление Physical AI в MTC Web Services
- Технология — VLA-политика (Vision-Language-Action) для гуманоида
- Автор разбора — Дания, ML-инженер МТС
- Фокус — захват предметов, движущихся по конвейеру, а не лежащих на столе
- Дата публикации разбора — 22 июля 2026 года
Почему гуманоиду тяжелее, чем манипулятору
Полноростовому роботу приходится не только тянуться к предмету, но и удерживать баланс всего тела. Закреплённый манипулятор решает более простую задачу: у него зафиксировано основание, и вся модель отвечает только за движение руки. Гуманоид же для того же захвата вынужден делать шаги и компенсировать смещение центра тяжести дополнительными движениями корпуса.
Каждое такое движение меняет положение камеры и руки относительно предмета, который в этот момент тоже едет. В результате расчёт движений усложняется многократно: модель должна одновременно предсказывать траекторию объекта, планировать захват и поддерживать устойчивость робота. Именно эту связку команда МТС сейчас и пытается собрать в рамках направления Physical AI.
Что это значит
Переход от статичных демонстраций к работе с движущимися объектами — один из главных барьеров на пути гуманоидов из лаборатории на реальное производство. Разбор МТС показывает, что даже базовая операция «взять предмет» перестаёт быть тривиальной, как только сцена оживает, и что промышленное применение VLA-роботов упирается не в силу захвата, а в динамику среды.
Частые вопросы
Что такое VLA-политика?
VLA (Vision-Language-Action) — это модель управления роботом, которая связывает зрение, языковую инструкцию и действие: робот «видит» сцену, понимает задачу и планирует движение. В статичных сценах, по данным разбора МТС, такие модели показывают высокое качество захвата.
Почему динамическая среда сложнее для гуманоида?
Потому что двигается и предмет, и сам робот. Полноростовому гуманоиду для захвата приходится делать шаги и удерживать баланс тела дополнительными движениями, поэтому расчёт движений усложняется многократно по сравнению с закреплённым манипулятором.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.