Революция в поисковой оптимизации: Google предлагает новый подход к ранжированию с помощью Autoregressive Ranking


Недавно Google опубликовал исследовательскую работу, посвященную обучению языковой модели (LLM) для замены текущих архитектур ранжирования в поисковых системах. Исследователи предлагают использовать метод Autoregressive Ranking (ARR) в качестве замены традиционным двухступенчатым системам ранжирования.

Традиционные системы ранжирования: Dual Encoders и Cross Encoders

В традиционных системах ранжирования поисковых запросов обычно используется двухступенчатая архитектура, состоящая из Dual Encoder (DE) и Cross Encoder (CE). Dual Encoder преобразует запросы и документы в векторы, что позволяет быстро извлекать вероятные документы. Эти модели относительно недороги с точки зрения вычислительных ресурсов и работают быстро. Выбранные кандидаты затем передаются Cross Encoder, который оценивает и ранжирует страницы, отобранные Dual Encoder. Хотя Dual Encoders эффективны и быстры, их точность в ранжировании документов ограничена. Именно поэтому в ранжировании используются Cross Encoders, которые обладают большей мощностью, но являются слишком ресурсоемкими для массового извлечения данных. Поэтому они применяются на втором этапе для ранжирования отобранных документов.

Autoregressive Ranking: новый подход к ранжированию

Исследователи предлагают заменить двухступенчатую систему новым методом, названным Autoregressive Ranking (ARR). Работа, посвященная этому подходу, называется "Autoregressive Ranking: Bridging the Gap Between Dual and Cross Encoders". Исследование проводилось специалистами из Google DeepMind, Университета Массачусетса в Амхерсте и Университета Техаса в Остине. Данная замена представляет собой радикальное изменение, так как предполагает использование одной языковой модели для генерации ранжированного списка документов. Если этот метод будет внедрен, последствия для SEO и AEO могут быть значительными.

Обучение модели ранжирования: SToICaL

Первый шаг в создании модели ранжирования заключается в ее обучении. Исследователи разработали метод, названный SToICaL (Simple Token-Item Calibrated Loss), который обучает LLM ранжировать документы. Обучение происходит двумя способами: документы, которые должны занимать более высокие позиции, получают больший вес, а те, что должны быть ниже, — меньший. Второй аспект заключается в том, что ранжирование, предоставленное обучающими данными, используется для увеличения вероятности выбора токенов, ведущих к более высокоранжированным документам. Таким образом, LLM обучается различать релевантные документы и подавлять ранжирование нерелевантных. Исследователи отмечают: "Мы предлагаем SToICaL, обобщенную потерю, учитывающую ранжирование для дообучения LLM. Используя переоценку на уровне элементов и маргинализацию префиксного дерева, мы распределяем вероятность по токенам docID в зависимости от их истинной релевантности."

Результаты тестирования

Исследователи протестировали новую систему, чтобы оценить, действительно ли она улучшает производительность ранжирования по сравнению с обычным предсказанием следующего токена, используя два набора данных: WordNet и ESCI Shopping Queries. Они также сравнили ARR с традиционными Dual Encoders и Cross Encoders в отдельном тесте на WordNet. Результаты показали, что Autoregressive Ranking (ARR) продемонстрировал хорошие результаты, хотя не по всем метрикам. Исследователи отметили, что SToICaL улучшил способности ARR в ранжировании. Они подчеркнули, что их метод, учитывающий ранжирование, "значительно улучшает метрики ранжирования за пределами топ-1". Метод SToICaL помог ARR успешно ранжировать нерелевантные документы ниже релевантных. В экспериментах на WordNet исследователи утверждают, что их методы, учитывающие ранжирование, "драматически снижают" ошибки ранжирования. В сравнении с Cross Encoder, ARR показал схожие результаты, но значительно превзошел Dual Encoder. Однако в одном из тестов на поиске товаров версия метода показала ухудшение в ранжировании наиболее релевантного результата первым, несмотря на общее улучшение ранжирования.

Заключение и выводы

Исследователи пришли к выводу, что Dual Encoders (DE) становятся ограниченными по мере увеличения числа документов для ранжирования, поскольку для представления каждого возможного ранжирования размер вектора должен соответственно увеличиваться. В отличие от этого, ARR не имеет таких ограничений и теоретически может ранжировать произвольное количество документов. Они объясняют: "Мы предоставляем теоретическую основу для превосходной выразительной способности ARR по сравнению с DE. Строгий анализ геометрии встраивания, необходимой для ранжирования, показывает, что для достижения любого порядка 𝑘 документов DE должен линейно увеличивать размер встраивания с 𝑘. В отличие от этого, мы доказываем, что модель ARR с постоянным скрытым размером теоретически достаточна для ранжирования произвольного числа документов." Тем не менее, это теоретический результат, который не обязательно подтверждает, что ARR будет работать таким образом в реальных поисковых системах. Однако эксперименты показали, что подход улучшает производительность ранжирования и становится более эффективным в удержании нерелевантных документов ниже релевантных. Исследователи подводят итог: "В данной работе мы установили теоретическую основу для Autoregressive Ranking, доказав, что в то время как DE требуют увеличения размерности встраивания с ростом корпуса, модели ARR, генерирующие много токенов docID, могут решать полные задачи ранжирования с постоянной скрытой размерностью, при выполнении мягкого условия на ранг матрицы встраивания для токенов docID."

Основные выводы

Некоторые SEO-специалисты утверждают, что поисковые технологии изменились из-за искусственного интеллекта. Однако данная работа показывает, что Dual Encoders и Cross Encoders все еще играют свою роль в процессе ранжирования. Это свидетельствует о том, что мы еще не достигли момента, когда "все изменилось", но исследование демонстрирует, что Google приближается к дню, когда поиск действительно изменится кардинально.

Комментарии (0)

Войдите, чтобы оставлять комментарии.
Пока нет комментариев. Будьте первым!