Как Papers with Code революционизирует доступ к исследованиям в области ИИ


В последние три месяца команда Papers with Code активно работает над обновлением платформы, целью которой является упрощение доступа к открытым исследованиям в области искусственного интеллекта. Это позволяет исследователям легко находить артефакты, связанные с научными статьями, отслеживать достижения в различных областях ИИ и делиться интересными находками, создавая таким образом основу для дальнейших исследований и разработок.

Гибридная система поиска

Создание доступного инструмента для поиска исследований требует мощного поискового движка, который может быстро находить релевантные работы. В Papers with Code реализована гибридная система поиска, которая сочетает в себе преимущества как ключевого, так и векторного поиска. Ключевой поиск позволяет находить точные упоминания, в то время как векторный поиск находит более размытые, семантически схожие термины. Это решение было основано на предыдущем опыте команды, которая разрабатывала системы на основе RAG для клиентов.

Архитектура и технологии

Papers with Code использует базу данных PostgreSQL, что обеспечивает быстрые возможности полнотекстового поиска. Для работы с плотными встраиваниями используется pgvector, а алгоритм взаимного ранжирования (RRF) объединяет результаты обоих подходов. В системе поддерживаются встраивания более чем 110,000 актуальных статей, полученных из arXiv и Daily Papers.

Этапы работы с корпусом

Система разделяет процесс на два этапа: оффлайн-формирование корпуса и онлайн-сервис поиска. Оффлайн-работа выполняется с использованием Jobs, которые обрабатывают большие объемы данных, а онлайн-поиск осуществляется через защищенный Inference Endpoint. Если этот эндпоинт недоступен, система автоматически переходит на полнотекстовый поиск.

Контракт на встраивание

Для обеспечения надежности встраивания каждая статья кодируется в виде: нормализованное название + нормализованный аннотация. В процессе генерации векторов фиксируются различные параметры, включая репозиторий модели и точную ревизию. В производственной среде используется модель Qwen/Qwen3-Embedding-0.6B с 256-мерными векторами, что позволяет обеспечить быструю работу поиска.

Хранение и управление данными

Хранение данных осуществляется с помощью Storage Buckets, которые обеспечивают связь между различными системами. Это позволяет организовать артефакты под неизменяемыми префиксами, что обеспечивает воспроизводимость и безопасность повторных попыток. Каждое завершенное задание имеет свой маркер, позволяющий пропускать уже проверенную работу при перезапуске.

Инференс и семантический поиск

Для обработки пользовательских запросов используется Inference Endpoint, который принимает текст запроса и возвращает нормализованный вектор. Поиск осуществляется с использованием косинусного расстояния, что позволяет быстро находить релевантные статьи. В пилотном проекте с 5000 статьями индекс Qwen показал высокую точность и низкую задержку.

Гибридный поиск

Гибридный поиск объединяет результаты из лексического и семантического поиска, что позволяет улучшить качество поиска. Ранжирование осуществляется с использованием алгоритма RRF, который сочетает ранги из обеих систем. Это обеспечивает высокую вероятность того, что статьи, которые высоко ранжируются в обеих системах, будут также высоко оценены в гибридном поиске.

Обновление данных

Система постоянно обновляется, так как новые статьи поступают, аннотации корректируются, а новые версии arXiv становятся актуальными. Для этого используется часовой процесс, который выбирает измененные статьи и отправляет их на тот же Inference Endpoint для обновления векторов.

Рекомендации и выводы

Система также позволяет рекомендовать связанные статьи на страницах статей, что делает доступ к информации более удобным. Команда Papers with Code извлекла несколько ключевых уроков из своего опыта, включая необходимость разделения задач по производительности и чувствительности к задержкам, а также важность четкого контракта на хранение данных. Платформа Papers with Code продолжает развиваться, и пользователи могут попробовать поиск на сайте или воспользоваться интерфейсом чата для получения рекомендаций и обратной связи.

Комментарии (0)

Войдите, чтобы оставлять комментарии.
Пока нет комментариев. Будьте первым!