Назначение#

Продукт Platform V Vector DB (далее - Vector DB) — специализированная (векторная) база данных, которая предназначена для хранения и эффективного поиска векторов (векторных данных). Она используется в приложениях, где требуется работать с высокоразмерными данными, например, в задачах машинного обучения, компьютерного зрения, обработки естественного языка и рекомендательных систем. Векторные базы данных играют ключевую роль во множестве приложений, требующих поиска по сходству, таких как рекомендательные системы, контент-базированное извлечение изображений и персонализированный поиск. Используя свои эффективные методы индексации и поиска, векторные базы данных обеспечивают более быстрое и точное получение результатов по неструктурированным данным, уже представленными в виде векторов, что помогает выводить перед пользователями самые релевантные результаты их запросов.

Vector DB (VDB) позволяет решить следующие задачи:

  • персонализация и рекомендательные системы;

  • поиск изображений/видео по содержанию;

  • семантический поиск документов;

  • классификация и кластеризация данных;

  • обработка естественного языка (NLP);

  • финансовый анализ и риск-менеджмент;

  • мобильные и веб-приложения с интеллектуальным поиском.

Состав продукта#

В состав Vector DB (VDB) входит компонент Qdrant (QDNT).

Qdrant (QDNT)#

Qdrant является движком поиска по подобию векторов, который предоставляет готовую к производству службу с удобным API для хранения, поиска и управления точками (векторами) с дополнительной полезной нагрузкой. Полезная нагрузка — дополнительные фрагменты информации, которые могут помочь уточнить запрос, а также получить полезную информацию для предоставления пользователям.

В традиционных базах данных OLTP и OLAP данные организованы в виде строк и столбцов (и называются таблицами), а запросы выполняются на основе значений этих столбцов. Однако в некоторых приложениях, включая распознавание изображений, обработку естественного языка и системы рекомендаций, данные часто представляются в виде векторов в пространстве высокой размерности, и именно эти векторы плюс идентификатор и полезная нагрузка являются элементами, которые хранятся в Коллекциях внутри векторной базы данных.

Векторные базы данных оптимизированы для хранения и запроса этих многомерных векторов эффективно, и они часто используют специализированные структуры данных и методы индексирования, такие как иерархические навигационные малые миры (HNSW), используемые для реализации приближенных ближайших соседей, и квантование продуктов среди прочих. Эти базы данных позволяют выполнять быстрый семантический поиск сходства, позволяя пользователям находить векторы, наиболее близкие к заданному запросу-вектору согласно некоторой метрике расстояния. Наиболее распространенными метриками расстояний являются Евклидово расстояние, Косинусное сходство и Скалярное произведение.