Новые энкодеры LFM2.5: скорость и качество на первом месте

На платформе Hugging Face появились два новых энкодера: LFM2.5-Encoder-230M и LFM2.5-Encoder-350M. Эти модели обеспечивают высокое качество, сопоставимое с более крупными аналогами, но при этом сохраняют скорость обработки даже при увеличении длины входных данных. Это означает, что вы можете выполнять задачи на уровне документов, используя уже имеющееся оборудование, даже если это всего лишь CPU.

Основные преимущества LFM2.5-Encoders

Эти энкодеры предлагают ряд значительных преимуществ:
  • Качество: они показывают результаты, сопоставимые или даже превосходящие более крупные энкодеры на таких задачах, как GLUE, SuperGLUE и многоязычные задачи.
  • Контекст: поддержка контекста до 8192 токенов с медленным увеличением задержки при увеличении длины входных данных.
  • Скорость на CPU: LFM2.5-Encoder-230M примерно в 3.7 раза быстрее ModernBERT-base при работе с длинными контекстами.
  • Эти возможности открывают новые горизонты для разработки таких приложений, как маршрутизаторы намерений, линтеры политик, детекторы PII и текстовые классификаторы, которые могут работать эффективно и экономично в течение всего дня.

    Зачем мы создали универсальный энкодер

    В прошлом месяце мы выпустили LFM2.5-Retrievers, предназначенные для многоязычного поиска. LFM2.5-Encoders происходят из той же семьи, но имеют более широкий спектр применения. Они предобучены с использованием маскированной языковой модели, что позволяет их дообучать для задач классификации, токен-уровневых задач и поиска. Энкодеры играют ключевую роль во многих современных приложениях NLP, таких как классификаторы, маршрутизаторы намерений и фильтры безопасности.

    Как построены энкодеры

    Энкодеры инициализируются из соответствующих декодеров LFM2: LFM2.5-230M и LFM2.5-350M. Затем каждый декодер преобразуется в двунаправленный энкодер с несколькими изменениями:
  • Двунаправленная маска внимания: каждый токен видит токены с обеих сторон.
  • Некausal свертки: свертки дополнены симметрично, чтобы каждый токен учитывал соседей с обеих сторон.
  • Маскированное языковое моделирование: во время обучения маскируется 30% токенов.
  • Обучение моделей проходит в два этапа: сначала они обучаются на коротком контексте, а затем адаптируются к длинному контексту в 8192 токена.

    Результаты бенчмарков

    Каждая модель была дообучена на всех задачах, и результаты были зафиксированы. LFM2.5-Encoder-350M занимает четвертое место среди 14 моделей, при этом три модели выше нее значительно больше по размеру. LFM2.5-Encoder-230M превосходит ModernBERT-base и все модели EuroBERT, оставаясь при этом меньше большинства из них.

    Скорость вывода на CPU и GPU

    Энкодеры LFM2.5 наследуют высокую скорость вывода от LFM2. На CPU LFM2.5-Encoder-230M оказывается самым быстрым на всех длинах последовательностей. При длине 8192 токена ModernBERT-base требует более минуты на один проход, в то время как LFM2.5-Encoder-230M справляется с этой задачей за 28 секунд. На GPU наблюдается аналогичная картина, хотя с меньшим отрывом. Это означает, что для длинных входных данных LFM2.5-Encoders являются более быстрым выбором, особенно на CPU.

    Демо LFM2.5-Encoders

    Мы разработали несколько демонстраций, используя дообученные LFM2.5-Encoders, которые работают в режиме CPU-only на Hugging Face:
  • Маршрутизация без обучения: определите свои собственные маршруты в виде свободного текста.
  • Линтинг политик без обучения: проверьте текст на соответствие правилам вашей компании.
  • Проверка орфографии: исправление опечаток токен за токеном.
  • Обнаружение PII: выявление и удаление 40 видов личной информации на 16 языках.
  • Генерация текста с маскированной диффузией: работа в качестве чат-бота, который генерирует текст, итеративно снимая маски.
  • Как использовать и дообучать LFM2.5-Encoders

    LFM2.5-Encoder подходит для задач, требующих высокой производительности, таких как классификация, маршрутизация, извлечение или оценка, которые должны оставаться экономичными и быстрыми. Для таких задач дообученный энкодер будет меньше, быстрее и значительно дешевле в эксплуатации, чем генеративная LLM. Выбор между двумя размерами:
  • LFM2.5-Encoder-350M: выбирайте, когда важна точность.
  • LFM2.5-Encoder-230M: выбирайте для более ограниченного оборудования или большей пропускной способности.
  • Начало работы с LFM2.5-Encoders

    Обе модели открыты и доступны на Hugging Face. Вы можете:
  • Скачать: LFM2.5-Encoder-230M и LFM2.5-Encoder-350M.
  • Попробовать: запустить демонстрации в браузере без необходимости в настройке.
  • Дообучить: адаптировать энкодер к вашей задаче с помощью нашего руководства по дообучению.
  • Мы с нетерпением ждем, что вы создадите с помощью этих новых инструментов.

    Комментарии (0)

    Войдите, чтобы оставлять комментарии.
    Пока нет комментариев. Будьте первым!