
Тактильная манипуляция остается одним из самых больших препятствий на пути к успешному выполнению роботами широкого спектра повседневных задач. Чувство осязания может стать ключом к решению этой проблемы, однако нехватка качественных данных долгое время сдерживала прогресс. В последние годы академические лаборатории и стартапы начали активно создавать новые тактильные датасеты и методы их использования.
Прогресс в области VLA моделей
За последние несколько лет модели, основанные на взаимодействии визуальных, языковых и действий (VLA), значительно улучшили способность роботов выполнять сложные задачи с объектами и в средах, с которыми они никогда не сталкивались ранее. Эти модели, предварительно обученные на огромных объемах изображений, видео и текстов, а затем дообученные на меньшем количестве демонстраций телеправления, могут направлять роботов в выполнении различных повседневных задач — от складывания белья до работы с кухонными приборами, используя лишь видеопоток и инструкции на естественном языке.
Тем не менее, роботы по-прежнему испытывают трудности с задачами, требующими тонкой ручной манипуляции, такими как работа с деформируемыми материалами или манипуляции с мелкими объектами, например, подключение USB-кабеля или поворот ключа в замке. Это отчасти связано с тем, что VLA игнорируют один из основных источников информации, на который полагаются люди в таких ситуациях: тактильную обратную связь.
Манипуляция как у людей
"Большинство тонких манипуляций люди могут выполнять с закрытыми глазами", — говорит Тревор Даррелл, профессор компьютерных наук в Университете Калифорнии, Беркли. "Понимание силы, скольжения и точного захвата невозможно достичь с помощью традиционных визуальных сенсоров". Однако эффективное использование тактильных сенсоров представляет собой сложную задачу. Данные тактильных сенсоров имеют совершенно иные характеристики по сравнению с изображениями, на которых обычно обучаются VLA, и тактильные датасеты значительно отстают от интернет-объемов многих визуальных и языковых датасетов.
Чтобы обойти это ограничение, команда Даррелла разработала метод, позволяющий сначала предварительно обучить модель на существующих датасетах, а затем дать ей чувство осязания, обучив специализированную подмодель на 100 часах высококачественных тактильных данных, включая демонстрации распространенных действий, таких как протирание, захват, поворот или наливание с использованием более чем 200 различных предметов домашнего обихода.
Применение тактильных данных
Использование тактильных данных оказалось непростым. Цель заключалась в том, чтобы робот мог использовать тактильный сигнал для коррекции своего захвата в реальном времени во время манипуляции объектами. Однако это требует времени реакции, превышающего возможности большинства моделей VLA. Это несоответствие представляет собой значительную проблему, и команда использовала отдельные подмодели, известные как "эксперты", для обработки высокоуровневых действий и низкоуровневого тактильного управления, чтобы обеспечить достаточную скорость для полезной тактильной обратной связи.
Эксперт по действиям генерирует планы движения, в то время как тактильный эксперт, работающий в четыре раза быстрее, использует тактильную обратную связь для корректировки плана движения в реальном времени на основе того, что робот ощущает в процессе. Модель была дообучена на около 100 демонстрациях телеправления относительно сложных манипуляционных задач, таких как вкручивание лампочки, нанесение зубной пасты на щетку или перенос яйца между подносами, при этом она достигла средней успешности 65 процентов по 12 задачам — почти вдвое больше, чем у лучшей модели VLA.
Разнообразие данных
Одним из ограничений, признает Даррелл, является то, что его данные получены с помощью единственного экземпляра робототехники. Роботизированные руки варьируются от полностью артикулированных пятифингерных конструкций до простых захватов, и тактильные сенсоры могут основываться на принципиально разных физических явлениях, от измерения изменений сопротивления до записи изображений деформирующейся мягкой гелевой подушки. Это делает большинство исследований в области тактильного ИИ специфичными для сенсоров, говорит Ченгбо Юань, магистрант Университета Цинхуа в Пекине, и затрудняет обмен данными и передачу знаний между группами.
Юань недавно решил решить эту проблему, агрегировав более 3000 часов тактильных данных роботов из общедоступных датасетов, охватывающих 21 тип сенсора и различные конструкции роботов. Юань говорит, что они были вдохновлены такими инициативами, как сотрудничество Open X-Embodiment, которое объединило данные от многих роботов и привело к моделям, которые обобщаются на аппаратное обеспечение, не использовавшееся в обучении. Команда Юаня затем разработала модель, независимую от аппаратного обеспечения, которая может обучаться на этих разнообразных данных, преобразуя выходные данные каждого сенсора в общий формат и сопоставляя их с помеченными позициями на шаблоне человеческой руки. Эта модель оказалась гораздо более успешной, чем базовая модель, даже на аппаратном обеспечении, с которым она никогда не сталкивалась ранее. Юань связывает это с тем, что модель приобрела "некую общую тактильную осведомленность", обучаясь на таких разнообразных установках.
Масштабирование данных
Несмотря на многообещающие результаты, Юань считает, что необходимо больше тактильных данных, и его группа сейчас возглавляет сотрудничество из 80 учреждений для сбора более крупного набора телеправленных демонстраций с использованием стандартизированного подхода к сбору и обработке тактильных данных. Тем временем, Университет Фудань в Шанхае и его спин-офф NeoteAI уже создали тактильный датасет, который в десять раз больше предыдущих усилий. Используя запатентованный сенсор, прикрепленный к различным роботизированным рукам и ручному захвату, управляемому людьми, они собрали более 30 000 часов демонстраций с синхронизированными визуальными и тактильными данными.
Исследователи использовали эти данные для обучения модели, которая не только реагирует на прикосновение, но и проактивно предсказывает, что робот должен ощущать, чтобы помочь направлять и оценивать действия, значительно улучшая производительность. Шуньлин Лу, постдокторский исследователь в Университете Фудань и технический директор NeoteAI, говорит, что результаты являются ясным доказательством того, что доступ к крупномасштабным и разнообразным тактильным данным приводит к значительным улучшениям в производительности. Политики манипуляции с роботами с тактильным компонентом показывают улучшенные результаты в различных реальных задачах.
Другой подход к масштабированию тактильных данных может заключаться в использовании огромных объемов визуальных данных, уже собранных в робототехнике. Исследователи Университета Южной Калифорнии в Лос-Анджелесе недавно выпустили модель, которая научилась выводить тактильную информацию из визуальных данных, обучаясь на более чем 2700 демонстрациях повседневной манипуляции с использованием ручного захвата, который записывает как тактильные данные, так и изображения с камеры на устройстве. Модель научилась устанавливать ассоциации между изображениями захвата, соприкасающегося с объектами, и количеством давления, ощущаемого тактильными сенсорами в этот момент, что дало возможность даже роботам без тактильных сенсоров иметь примитивное чувство осязания, которое, как показали исследователи, особенно полезно для задач, связанных с контактами. Однако их более широкая амбиция заключается в использовании генератора для добавления тактильных данных в существующие визуальные датасеты.
Неясно, сколько тактильных данных потребуется для прорывов в тонких задачах. На данный момент основным вкладом обучения с использованием тактильных данных было то, что роботы стали более эффективными в обучении задачам, которые уже доступны, таким как подъем и размещение объектов, говорит Юань, и он подозревает, что могут потребоваться новые алгоритмы для решения задач, которые действительно невозможно выполнить без осязания.
Лон Ченг из Китайской академии наук в Пекине также считает, что сырые данные не являются панацеей. "Данные хороши", — говорит он. "Но как их правильно использовать — это другая проблема". Проблема, по его словам, заключается в том, что визуальные данные предоставляют непрерывный, высокоскоростной поток пикселей, в то время как тактильные сигналы являются разрозненными и прерывистыми, поэтому модели учатся игнорировать их. Его решение, которое будет представлено на IROS 2026 в этом месяце, заключается в модели, которая предсказывает, что робот будет чувствовать только по визуальным данным, а затем сравнивает это с реальной тактильной информацией. Большой разрыв между двумя сигналами означает, что сенсор обнаруживает что-то, что робот иначе пропустил бы, поэтому эти неожиданные сигналы усиливаются, а предсказуемые — ослабляются. В пяти задачах, связанных с контактами, этот подход показал среднюю успешность 62.8 процента против 28.2 процента для той же модели без осязания.
Лу более уверен, что масштабирование данных может принести аналогичные преимущества, как это было замечено в таких областях, как язык и визуализация. Он предполагает, что около 100 000 часов, собранных в разнообразных реальных условиях, а не в лаборатории, могут открыть новые возможности. В любом случае, в этой области уже есть первые признаки того, что более крупные тактильные датасеты и более умные способы их использования могут значительно повысить эффективность роботов в решении самых сложных задач. "Я думаю, что тактильный интеллект — это следующий шаг для физического ИИ", — говорит Лу.
Комментарии (0)