Mistral AI News→ оригинал

Robostral Navigate от Mistral: робот видит через одну камеру и путешествует сам

Mistral AI представила Robostral Navigate — первую модель компании для автономной навигации роботов. Модель на 8 млрд параметров ориентируется только по одной RGB-камере, без лидара и датчиков глубины, и показывает 76,6% успешных попыток на тесте R2R-CE для незнакомых сред — на 4,5 пункта выше лучшей мультисенсорной системы. Обучили её на 400 000 траекторий из 6000 симулированных сцен.

AI-обработка оригинала Mistral AI News; редакция Hamidun News
Robostral Navigate от Mistral: робот видит через одну камеру и путешествует сам
Источник: Mistral AI News. Коллаж: Hamidun News.
◐ Слушать статью

Mistral AI представила Robostral Navigate — свою первую модель для автономной навигации роботов, которая ориентируется в пространстве по видео с одной обычной RGB-камеры и показывает 76,6% успешных попыток на тесте R2R-CE для сред, не встречавшихся при обучении.

Что умеет модель

Robostral Navigate — это модель на 8 миллиардов параметров, которая по кадру с камеры и текстовой инструкции ведёт робота через сложную обстановку: офис, жилое или коммерческое здание, уличное пространство. Инструкция может звучать так: «Выйди из лобби, пройди по коридору, зайди в кладовую и остановись напротив второй полки» — и модель проводит робота через весь маршрут самостоятельно, без участия человека.

  • Успешность 79,4% на валидации R2R-CE на знакомых сценах и 76,6% на невиданных
  • Превосходство над лучшим однокамерным подходом — на 9,7 пункта, над лучшей системой с лидаром или несколькими камерами — на 4,5 пункта
  • Работает на колёсных, шагающих и летающих роботах, устойчива к различиям в параметрах камер
  • Обучающий датасет — около 400 000 траекторий, собранных в 6000 симулированных сценах

Как модель находит дорогу

Robostral Navigate предсказывает не метрическое смещение, а точку на изображении: координаты цели в текущем кадре камеры и нужную ориентацию по прибытии. Такой способ навигации «через указание» устойчив к смене оптики и масштаба сцены — в отличие от команд на основе метрических расстояний. Когда цель выходит за пределы поля зрения, модель переключается на смещения в локальных координатах робота, например: «Продвинься на 2 метра вперёд, на 1,5 метра влево и поверни на 25 градусов влево».

Как обучали Robostral Navigate

Модель построена полностью внутри Mistral AI и не опирается на открытые vision-language модели — она инициализирована на основе собственной модели компании, специализированной на задачах указания, счёта и локализации объектов. Ключевой элемент обучения — метод на основе prefix-caching: он сжимает целый эпизод в одну последовательность и позволяет обучаться на всех временных шагах за один проход, снижая число обучающих токенов в 22 раза по сравнению с обучением на отдельных шагах. После этапа supervised-обучения модель дополнительно улучшают через онлайн reinforcement learning на алгоритме CISPO, который позволяет ей учиться на собственных ошибках и восстанавливаться после неудач.

«Сегодня мы представляем

Robostral Navigate — нашу первую модель для воплощённой навигации», — говорится в официальном блоге Mistral AI.

Что это значит

Навигация по единственной камере без лидара и датчиков глубины снижает стоимость и сложность роботов для складов, доставки, гостиниц и производства — Mistral AI прямо называет эти отрасли в числе первых бенефициаров технологии.

Частые вопросы

На каких роботах работает Robostral Navigate?

Модель работает на колёсных, шагающих и летающих роботах и обобщается на разные размеры платформ — это подтверждает Mistral AI в описании модели.

Сколько данных потребовалось для обучения?

Компания собрала около 400 000 траекторий в 6000 симулированных сценах — весь пайплайн генерации данных построен целиком в симуляции, без использования реальных роботов на этапе сбора данных.

Насколько Robostral Navigate точнее конкурентов?

На тесте R2R-CE для невиданных сред модель обгоняет лучший однокамерный подход на 9,7 пункта и лучшую систему с несколькими камерами или датчиком глубины — на 4,5 пункта, при итоговых 76,6% успешных попыток.

Чем метрика R2R-CE отличается от обычных тестов навигации?

R2R-CE (Room-to-Room in Continuous Environments) проверяет, как модель следует текстовым инструкциям в средах, которые не входили в обучающую выборку, — именно на этом сценарии Robostral Navigate показывает результат 76,6%, а не на знакомых сценах, где итог ещё выше.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…