Они нужны для беспилотного транспорта и других систем Physical AI
Сбер представил семейство генеративных моделей Kandinsky WM 1.0, предназначенных для создания физически правдоподобных видеосцен. Они востребованы для обучения беспилотного транспорта, роботов и других систем Physical AI. Как сообщается в поступившем в редакцию N + 1 пресс-релизе компании, код и веса моделей уже опубликованы под лицензией MIT и будут доступны разработчикам бесплатно.
Physical AI — это системы искусственного интеллекта, которые взаимодействуют с физическим миром: автомобилями и пешеходами, другими роботами, промышленным оборудованием. Основа их обучения — работа с большими массивами видеоданных. Однако сбор таких данных дорог и трудоемок, а некоторые сценарии — например, аварии, случаи экстремальной погоды или отказа оборудования — и вовсе невозможно записать в реальных условиях. Дообучить робота-погрузчика или беспилотное такси в процессе работы тоже не получится: это не просто дорого, но зачастую еще и опасно.
Использовать для обучения Physical AI видео, сгенерированные другими нейросетями, раньше было затруднительно из-за большого количества ошибок: искажения геометрии, перспективы и появления «мягких» деформирующихся объектов. Решить эту проблему смогли разработчики Сбера под руководством Дениса Димитрова. Они разработали семейство моделей, специально предназначенных для создания физически правдоподобных видеосцен. Новые модели основаны на Kandinsky 5.0 Video Lite, но дообучены на нескольких миллионах видео с камер роботов, беспилотных автомобилей и записях промышленных процессов. По данным разработчиков, это позволило уменьшить типичные ошибки генерации видео.
В результате модели Kandinsky WM научились генерировать физически достоверные видео длительностью около пяти секунд, содержащие отдельные действия и ситуации: манипуляции с предметами, дорожные сцены и этапы производственных процессов. Ролики можно использовать для обучения систем компьютерного зрения и симуляторов беспилотного транспорта. Для улучшения автомобильных сцен разработчики применили дополнительный этап обучения с подкреплением: Kandinsky WM генерировали ролики, а другие нейросети оценивали сохранность формы объектов, геометрию сцены и естественность движения и давали обратную связь.
Модели Kandinsky WM 1.0 уже доступны в открытом репозитории проекта Kandinsky. Как сообщается в пресс-релизе, институт AIRI использует их в дорожном симуляторе. Центр робототехники Сбера применяет новые модели и для обучения собственных роботов.
Ранее мы рассказывали, как студенты Массачусетского технологического института использовали нейросеть Claude для управления человеческой рукой.
Один специалист может присматривать одновременно за тремя устройствами
Управление по контролю качества пищевых продуктов и лекарственных средств США FDA одобрило к применению первую полностью автоматизированную систему для забора крови из вены, говорится в пресс-релизе ведомства. Роботизированное устройство Aletta самостоятельно выполняет все этапы забора крови: инструктирует пациента, накладывает турникет, обрабатывает кожу антисептиком, находит вену, берет кровь, накладывает пластырь, утилизирует иглу и меняет пробирки. Подходящий сосуд оно определяет с помощью спектроскопии в ближнем инфракрасном спектре и УЗИ с допплерографией. Если подходящая вена не найдена, попытка венепункции не предпринимается. В ходе продолжающихся клинических испытаний A.D.O.P.T., в которых уже приняли участие более 600 пациентов, частота успешного забора крови с первой попытки составила 95 процентов (не меньше, чем при проведении процедуры человеком), доля гемолизированных образцов — 0,6 процента, уровень удовлетворенности пациентов — 98 процентов.