
В последние три месяца команда Papers with Code активно работает над обновлением платформы, целью которой является упрощение доступа к открытым исследованиям в области искусственного интеллекта. Это позволяет исследователям легко находить артефакты, связанные с научными статьями, отслеживать достижения в различных областях ИИ и делиться интересными находками, создавая таким образом основу для дальнейших исследований и разработок.
Гибридная система поиска
Создание доступного инструмента для поиска исследований требует мощного поискового движка, который может быстро находить релевантные работы. В Papers with Code реализована гибридная система поиска, которая сочетает в себе преимущества как ключевого, так и векторного поиска. Ключевой поиск позволяет находить точные упоминания, в то время как векторный поиск находит более размытые, семантически схожие термины. Это решение было основано на предыдущем опыте команды, которая разрабатывала системы на основе RAG для клиентов.
Архитектура и технологии
Papers with Code использует базу данных PostgreSQL, что обеспечивает быстрые возможности полнотекстового поиска. Для работы с плотными встраиваниями используется pgvector, а алгоритм взаимного ранжирования (RRF) объединяет результаты обоих подходов. В системе поддерживаются встраивания более чем 110,000 актуальных статей, полученных из arXiv и Daily Papers.
Этапы работы с корпусом
Система разделяет процесс на два этапа: оффлайн-формирование корпуса и онлайн-сервис поиска. Оффлайн-работа выполняется с использованием Jobs, которые обрабатывают большие объемы данных, а онлайн-поиск осуществляется через защищенный Inference Endpoint. Если этот эндпоинт недоступен, система автоматически переходит на полнотекстовый поиск.
Контракт на встраивание
Для обеспечения надежности встраивания каждая статья кодируется в виде: нормализованное название + нормализованный аннотация. В процессе генерации векторов фиксируются различные параметры, включая репозиторий модели и точную ревизию. В производственной среде используется модель Qwen/Qwen3-Embedding-0.6B с 256-мерными векторами, что позволяет обеспечить быструю работу поиска.
Хранение и управление данными
Хранение данных осуществляется с помощью Storage Buckets, которые обеспечивают связь между различными системами. Это позволяет организовать артефакты под неизменяемыми префиксами, что обеспечивает воспроизводимость и безопасность повторных попыток. Каждое завершенное задание имеет свой маркер, позволяющий пропускать уже проверенную работу при перезапуске.
Инференс и семантический поиск
Для обработки пользовательских запросов используется Inference Endpoint, который принимает текст запроса и возвращает нормализованный вектор. Поиск осуществляется с использованием косинусного расстояния, что позволяет быстро находить релевантные статьи. В пилотном проекте с 5000 статьями индекс Qwen показал высокую точность и низкую задержку.
Гибридный поиск
Гибридный поиск объединяет результаты из лексического и семантического поиска, что позволяет улучшить качество поиска. Ранжирование осуществляется с использованием алгоритма RRF, который сочетает ранги из обеих систем. Это обеспечивает высокую вероятность того, что статьи, которые высоко ранжируются в обеих системах, будут также высоко оценены в гибридном поиске.
Обновление данных
Система постоянно обновляется, так как новые статьи поступают, аннотации корректируются, а новые версии arXiv становятся актуальными. Для этого используется часовой процесс, который выбирает измененные статьи и отправляет их на тот же Inference Endpoint для обновления векторов.
Рекомендации и выводы
Система также позволяет рекомендовать связанные статьи на страницах статей, что делает доступ к информации более удобным. Команда Papers with Code извлекла несколько ключевых уроков из своего опыта, включая необходимость разделения задач по производительности и чувствительности к задержкам, а также важность четкого контракта на хранение данных.
Платформа Papers with Code продолжает развиваться, и пользователи могут попробовать поиск на сайте или воспользоваться интерфейсом чата для получения рекомендаций и обратной связи.
Комментарии (0)