
В последние годы наблюдается значительный прогресс в области мультимодальных моделей, которые способны обрабатывать как текст, так и изображения. Одним из ярких примеров таких разработок является NeoMME — новая семья мультимодальных кодировщиков с параметрами 260M и 800M, которая предлагает уникальный подход к обработке визуальных и текстовых данных.
Архитектура NeoMME
NeoMME (произносится как "ни-о-ми") представляет собой многоязычный мультимодальный кодировщик, который использует единую архитектуру Transformer для обработки текстовых токенов и изображений. В отличие от многих существующих моделей, NeoMME не требует отдельного предобученного визуального кодировщика или автогрессивной языковой модели. Вместо этого он использует один двунаправленный Transformer, который обрабатывает как текстовые токены, так и необработанные изображения.
Преимущества единой архитектуры
Такой подход позволяет избежать избыточности в параметрах и вычислительных ресурсах, необходимых для работы с двумя отдельными моделями. NeoMME обрабатывает изображения и текст в одном вычислительном потоке, что упрощает предварительное обучение, тонкую настройку и развертывание модели.
Обучение и предобучение
NeoMME был обучен с нуля с использованием маскированной дискретной диффузионной цели. В процессе предобучения модель обрабатывает около 524 миллиардов токенов, включая 290 миллиардов токенов из текстовых примеров. Это количество значительно меньше, чем у аналогичных моделей, таких как ModernBERT, что позволило использовать оптимизатор NorMuon для повышения эффективности обучения.
Маскированное обучение
В процессе предобучения для текстовых примеров применяется случайная маскация токенов, что заставляет модель учиться восстанавливать недостающие слова, основываясь на контексте. Это особенно важно для мультимодальных примеров, где изображения остаются видимыми, что позволяет модели учиться связывать текстовые и визуальные данные.
NeoMME-Retriever
Для оценки производительности NeoMME была разработана версия NeoMME-Retriever, которая оптимизирована для визуального поиска документов. Эта модель использует методику, основанную на изображениях страниц, что позволяет избегать сложных этапов предварительной обработки, связанных с извлечением текста из PDF-документов.
Двухголовая архитектура
NeoMME-Retriever включает две совместно обученные головы: одну для плотных векторов и другую для позднего взаимодействия. Плотные векторы обеспечивают компактные представления, которые хорошо работают с методами приближенного поиска, в то время как позднее взаимодействие позволяет сохранить локальные соответствия между токенами запроса и областями изображения.
Производительность и эффективность
NeoMME-Retriever демонстрирует высокую производительность на различных бенчмарках, таких как ViDoRe v3. Модель с 260M параметрами достигает nDCG@10 на уровне 0.523, что является самым высоким результатом среди моделей с параметрами ниже 800M. При этом она использует в 14 раз меньше параметров, чем аналогичные модели. Модель с 800M параметрами достигает nDCG@10 на уровне 0.556.
Оптимизация хранения
Для уменьшения объема хранимых данных в позднем взаимодействии применяются методы иерархического пуллинга токенов и асимметричной квантизации. Это позволяет сократить размер индекса позднего взаимодействия с 1.5 MB до 6 kB на страницу, что составляет 255-кратное уменьшение объема при сохранении более 95% качества.
Быстрая обработка и внедрение
NeoMME-Retriever обеспечивает высокую скорость кодирования изображений, достигая 51 страницы в секунду на графическом процессоре NVIDIA L40S, что почти в два раза быстрее, чем у других моделей. Это делает NeoMME-Retriever подходящим инструментом для быстрого индексирования больших мультимодальных корпусов.
Заключение
NeoMME представляет собой значительный шаг вперед в области мультимодальных и многоязычных кодировщиков. Его уникальная архитектура, основанная на едином двунаправленном Transformer, позволяет эффективно обрабатывать текст и изображения, обеспечивая высокую производительность и экономию ресурсов. Все модели NeoMME доступны на платформе Hugging Face Transformers под лицензией Apache 2.0, что открывает новые возможности для разработчиков и исследователей в области мультимодальных технологий.
Комментарии (0)