Pegasus 1.6: Новый уровень понимания видео для физического ИИ


С каждым годом физический мир все больше цифровизируется, и компании, занимающиеся искусственным интеллектом, сталкиваются с задачей обработки огромных объемов сложного видео. TwelveLabs Inc. представила свою новую модель Pegasus 1.6, которая значительно улучшает возможности понимания и навигации в сложных реальных условиях. Основатель и CEO TwelveLabs, Дже Ли, отметил: "Наша миссия всегда заключалась в том, чтобы помочь машинам понять, как работает мир через видео. Физический ИИ — это следующее выражение этой миссии".

Преобразование видео в структурированные знания

Pegasus 1.6 позволяет преобразовывать необработанное видео в структурированные, проверяемые знания, что дает возможность командам по робототехнике и физическому ИИ обучаться на реальном человеческом опыте, а не начинать с нуля. TwelveLabs, основанная в 2021 году, разработала "полноценную платформу видеоинтеллекта", используя модели Marengo и Pegasus, которые способны видеть и понимать видео так же, как это делает человек, но за гораздо более короткое время.

Фокус на эгоцентрическом видео

Новая версия Pegasus 1.6 делает акцент на эгоцентрическом видео, которое снимается с точки зрения человека, выполняющего работу. Это может быть, например, процесс приготовления пищи, сборка деталей на заводе или дистанционное управление роботом. "Мы не требуем от команд робототехники использования определенной камеры или проприетарного оборудования для захвата видео", — добавил Ли. "Важно лишь зафиксировать действия и взаимодействия, происходящие с точки зрения оператора". Pegasus 1.6 также может работать с существующими видеоданными и позволяет анализировать неподвижные изображения наряду с видео. "Одна из причин, по которой мы сосредоточились на эгоцентрическом видео, заключается в том, что его гораздо проще собирать и масштабировать, чем данные телеприсутствия", — признал Ли.

Поддержка пяти рабочих процессов

Pegasus 1.6 поддерживает пять рабочих процессов, основанных на модели, ориентированной на видео:
  • Сегментация и маркировка действий: автоматическая генерация точных временных меток для задач, шагов, объектов и взаимодействий рук с объектами из необработанного видео.
  • Маркировка плотных заголовков: создание богатого описательного языка для пространственных отношений и контекста сцены, что помогает роботам понимать естественный язык.
  • Оценка качества: автоматическая оценка и фильтрация низкокачественного видео по четкости действий и стабильности перед передачей на ручную проверку.
  • Поиск и кураторство: возможность выявления редких событий и дубликатов в видеоархиве с помощью простых поисковых запросов на естественном языке.
  • Обозначение согласия и соблюдения норм: автоматическое обнаружение лиц и конфиденциальных данных в видео перед их использованием в дальнейших разработках.
  • Улучшения и новые возможности

    Pegasus 1.6 строится на уже существующих возможностях понимания видео, которые TwelveLabs разработала для предприятий с большими видеобиблиотеками. Новая версия расширяет функциональность Pegasus 1.5, которая привлекла новых клиентов. TwelveLabs также внедрила временную метадату (Time-Based Metadata, TBM), позволяющую пользователям определять пользовательскую схему и автоматически получать структурированную метадату с временными метками из видеоконтента. Это особенно полезно для контекстуального понимания, так как люди часто комментируют свои действия в эгоцентрических клипах. Pegasus 1.6 также улучшила распознавание объектов для более последовательного отслеживания рук, объектов и инструментов в разных клипах и предлагает более быструю и экономичную обработку для высоких объемов видеонагрузки.

    Сотрудничество с разработчиками робототехники

    TwelveLabs продолжает расширять свои сотрудничества с разработчиками робототехники. "Мы работаем с лабораториями робототехники и командами данных, которые используют видео для увеличения доступных данных для обучения роботов", — сказал Ли. Основное внимание уделяется задачам манипуляции и ловкости, таким как упаковка, сборка и уборка, а также более специализированным промышленным приложениям, таким как контроль качества полупроводников. Основная цель — сделать большие объемы видео с человеческим поведением полезными для обучения, что гораздо более масштабируемо, чем данные телеприсутствия.

    Комментарии (0)

    Войдите, чтобы оставлять комментарии.
    Пока нет комментариев. Будьте первым!