Робот сообразил использовать банан вместо щетки

Управляющая им модель обучилась действию по одной демонстрации

Инженеры из американского стартапа Generalist AI представили мультимодальную фундаментальную модель GEN-1.5 для управления роботами. Она осваивает новые физические действия по одной короткой демонстрации, помещенной в контекстное окно, или с помощью небольшой донастройки градиентным методом за один или несколько шагов. Во время тестов робот под управлением GEN-1.5 продемонстрировал способность импровизации. Например, он использовал банан вместо щетки, чтобы собрать кубики в чашу. Описание опубликовано в блоге компании.

Исторически алгоритмы управления роботами представляли собой заранее заданные программы, которые идеально подходят, например, для работы на заводском конвейере, но могут дать сбой, если вдруг происходит какая-либо неожиданная ситуация. С развитием машинного обучения, в особенности нейросетей, появилась возможность обучать роботов методом проб и ошибок в симуляции и на заранее записанных демонстрациях. Вместо жестко заданной последовательности инструкций такие системы учатся самостоятельно выбирать действия в зависимости от текущего состояния окружающей среды и благодаря этому способны адаптироваться к некоторым изменениям условий. Однако для освоения новых навыков им обычно требуется дополнительное обучение на большом объеме данных, а способность действовать в существенно отличающихся ситуациях остается ограниченной.

Поворотный момент наступил с выходом модели GPT-3, которая оказалась способна решать незнакомые задачи по одному или нескольким примерам, подающимся прямо в контекстное окно без градиентного обновления внутренних весов. Робототехники давно пытались добиться аналогичной способности в физическом мире, и, похоже, разработчикам из американского стартапа Generalist AI это удалось. Компания представила большую воплощенную нейросетевую модель GEN-1.5 для управления роботами. Ее более восьми месяцев обучали на записях взаимодействий с физическими объектами и окружающим миром, собранных в жилых домах, на складах, фабриках и в других средах. Благодаря мультимодальности она может одновременно обрабатывать видео, показания сенсоров, текстовые команды и данные о положении частей робота. В контексте она способна удерживать около 30 секунд данных и генерировать на выходе команды для приводов с частотой 100 герц.

Оказалось, что для обучения робота под управлением GEN-1.5 новому действию зачастую хватает лишь короткой демонстрационной записи, помещенной в ее контекстное окно. Разработчики назвали это «физическим промптингом» по аналогии с большими языковыми моделями. Модели достаточно от 3 до 12 секунд видео с камер и записи сенсомоторных данных о движениях манипуляторов. Этот фрагмент можно создать в компьютерной симуляции, или человек может показать его на камеру. При этом GEN-1.5 не копирует движения буквально. Благодаря обобщению опыта, полученного на стадии предварительного обучения, она определяет цель продемонстрированного действия и пытается воспроизвести ее уже с помощью собственного «тела» в текущем окружении. Поэтому робот может выполнить задачу даже при другом положении или размере предметов.

В тестах GEN-1.5 управляла стационарным роботом с двумя руками-манипуляторами. Робот должен был выполнять манипуляции с различными предметами на столе — например, складывать объекты в чашу, открывать и закрывать застежки–молнии или извлекать денежные купюры из кошелька. В режиме физического промптинга после одной демонстрации, помещенной в контекстное окно без дополнительного обучения модели, робот успешно справлялся с заданием в среднем в 59 процентах случаев со стандартным отклонением в 10 процентов. При небольшой донастройке модели результаты заметно улучшались. Например, после десяти шагов градиентного спуска на пяти минутах данных, соответствующих примерно 50 демонстрациям, средняя доля успешных попыток поднималась до 83 процентов со стандартным отклонением в 9 процентов. Даже одного шага дообучения на одной минуте данных достаточно, чтобы на отдельной тестовой задаче достичь 66,5 процента успешных выполнений.

Отдельно разработчики проверяли, насколько модель способна выходить за пределы показанных ей траекторий. Например, GEN-1.5 дообучили на пяти минутах демонстраций, в которых человек щеткой сметал кубик в чашу, а в реальном тесте положили перед роботом вместо щетки банан. Модель «догадалась» использовать банан в качестве импровизированной щетки. В случае, если щетку заменяли на совок, робот менял стратегию: он подхватывал кубик совком и сбрасывал его в чашу. В тестах на открывание банки с откручивающейся крышкой модель задействовала обе руки, хотя в обучающих примерах использовалась только одна. После десяти шагов донастройки на открывание банок GEN-1.5 смогла перенести этот навык на незнакомые бутылки и другие емкости, самостоятельно меняя точки захвата и движения рук в зависимости от их формы. Кроме этого, модель оказалась способна объединять несколько отдельных физических промптов в последовательность действий. Иными словами, если в контекстное окно поместить две фрагмента разных действий без перехода между ними, робот выполнит обе задачи, добавив необходимые промежуточные движения, например, меняя положение рук и перехватывая предметы.

В качестве промптов модель может использовать демонстрации, выполненные в симуляции, хотя, по словам разработчиков, в предварительном обучении она не получала таких данных. А еще — наблюдать за тем, как человек показывает нужное действие руками перед камерами робота, и воспроизводить его с помощью манипуляторов. Пока эти возможности ограничены сравнительно простыми и короткими задачами, а навыки, освоенные непосредственно из контекста, остаются менее устойчивыми, чем после небольшого дообучения. Авторы рассчитывают, что дальнейшее масштабирование предварительного обучения позволит еще сильнее сократить объем данных и вычислений, необходимых для освоения новых задач.

Иногда требуется захватить и переместить не один маленький предмет, а большое количество крупных и мягких объектов. Для этого случая инженеры из исследовательского подразделения компании Toyota разработали человекоподобного робота Punyo. Он может брать сразу несколько предметов двумя руками, прижимая их к груди.