Назначение#
Продукт Platform V Vector DB (далее - Vector DB) — специализированная (векторная) база данных, которая предназначена для хранения и эффективного поиска векторов (векторных данных). Она используется в приложениях, где требуется работать с высокоразмерными данными, например, в задачах машинного обучения, компьютерного зрения, обработки естественного языка и рекомендательных систем. Векторные базы данных играют ключевую роль во множестве приложений, требующих поиска по сходству, таких как рекомендательные системы, контент-базированное извлечение изображений и персонализированный поиск. Используя свои эффективные методы индексации и поиска, векторные базы данных обеспечивают более быстрое и точное получение результатов по неструктурированным данным, уже представленными в виде векторов, что помогает выводить перед пользователями самые релевантные результаты их запросов.
Vector DB (VDB) позволяет решить следующие задачи:
персонализация и рекомендательные системы;
поиск изображений/видео по содержанию;
семантический поиск документов;
классификация и кластеризация данных;
обработка естественного языка (NLP);
финансовый анализ и риск-менеджмент;
мобильные и веб-приложения с интеллектуальным поиском.
Состав продукта#
В состав Vector DB (VDB) входит компонент Qdrant (QDNT).
Qdrant (QDNT)#
Qdrant является движком поиска по подобию векторов, который предоставляет готовую к производству службу с удобным API для хранения, поиска и управления точками (векторами) с дополнительной полезной нагрузкой. Полезная нагрузка — дополнительные фрагменты информации, которые могут помочь уточнить запрос, а также получить полезную информацию для предоставления пользователям.
В традиционных базах данных OLTP и OLAP данные организованы в виде строк и столбцов (и называются таблицами), а запросы выполняются на основе значений этих столбцов. Однако в некоторых приложениях, включая распознавание изображений, обработку естественного языка и системы рекомендаций, данные часто представляются в виде векторов в пространстве высокой размерности, и именно эти векторы плюс идентификатор и полезная нагрузка являются элементами, которые хранятся в Коллекциях внутри векторной базы данных.
Векторные базы данных оптимизированы для хранения и запроса этих многомерных векторов эффективно, и они часто используют специализированные структуры данных и методы индексирования, такие как иерархические навигационные малые миры (HNSW), используемые для реализации приближенных ближайших соседей, и квантование продуктов среди прочих. Эти базы данных позволяют выполнять быстрый семантический поиск сходства, позволяя пользователям находить векторы, наиболее близкие к заданному запросу-вектору согласно некоторой метрике расстояния. Наиболее распространенными метриками расстояний являются Евклидово расстояние, Косинусное сходство и Скалярное произведение.