Physical AIVLA-агент для SO-101

Учим робота видеть сцену, понимать задачу и превращать её в точные физические действия.

Большие вызовы 2026
Vision · Language · Action
Захват роботизированной руки SO-101 с жёлтым кубом
600+ демонстраций

Что такое VLA
и при чём здесь SO-101?

VVisionвидит объекты и пространство
LLanguageпонимает инструкцию человека
AActionуправляет движениями робота

VLA-модель получает изображение, команду и состояние манипулятора, а на выходе формирует последовательность действий.

SO—101

Роботизированная рука с 6 степенями свободы. Используется для сбора демонстраций и обучения моделей управления роботами.

Роботизированная рука SO-101

Проблема

Физический труд всё ещё остаётся ручным.

В неструктурированных пространствах среда постоянно меняется. Детерминированные алгоритмы не умеют адаптироваться к таким условиям.

Ручной труд

Люди по-прежнему сами находят, переносят и сортируют объекты.

Среда меняется

Положение объектов и препятствий постоянно меняется.

Нужны адаптивные модели

VLA объединяет зрение, язык и действие, позволяя роботу работать в меняющейся среде.

Целевая задача

Pick. Move. Place.

P

Pick

Найти объект и надёжно захватить его.

M

Move

Переместить объект по устойчивой траектории.

P

Place

Точно положить объект в целевую область.

Сейчас, с учётом доступных ресурсов, с помощью VLA мы решаем конкретную задачу: взять объект, переместить его и точно положить в заданную область.

Идея решения

От сложной задачи к простым действиям

VLM разбирает сложную инструкцию на короткие понятные шаги. VLA получает одну простую задачу за раз и выполняет её как специалист.

Команда

«Перенеси серый куб
к зелёному»

VLM · планировщик
найти кубвзятьперенестиположить
VLA · специалист

action chunk

VLM превращает задачу в простые команды.VLA точно исполняет каждую из них.

Сбор данных и fine-tuning

600+

демонстраций

Мы записали более 600 эпизодов перемещения объекта к объекту и дообучили VLA на реальном поведении SO-101.

Схема установки с роботизированной рукой и двумя камерами

В финальной сборке данных мы учли ракурсы камер, глубину сцены и усилие захвата. Эти наблюдения помогли выстроить устойчивую методологию записи движений и fine-tuning.

Роботизированная рука SO-101
Итог

Робот понимает задачу
и доводит движение
до результата.

Подготовлен MVP VLA-агента для SO-101, который выполняет базовые сценарии pick, move и place.

✓ распознаёт сцену✓ строит действие✓ перемещает объект

Команда

Евангелина Леонтьева

Евангелина Леонтьева

Тимлид, ML

Евгений Галагоза

Евгений Галагоза

Robotics ML

Николай Зыков

Николай Зыков

Продакт-менеджер

Шамиль Габдуллин

Шамиль Габдуллин

Robotics ML

Иван Булаев

Иван Булаев

Копирайтер

Иван Копылов

Иван Копылов

Преподаватель

Егор Островенко

Егор Островенко

Преподаватель

Вячеслав Чертан

Вячеслав Чертан

Преподаватель

Увеличенное фото