Глоссарий#
Термины и определения#
Термин |
Определение |
|---|---|
API (Application Programming Interface) |
Программный интерфейс как набор правил и процедур, который позволяет программам взаимодействовать друг с другом |
CBA (Certificate-Based Authentication) |
Метод аутентификации пользователей, устройств и серверов в цифровой среде, основанный на использовании цифровых сертификатов, выпущенных доверенным органом (Certificate Authority, CA) |
CN (Common Name) |
Поле в сертификате X.509, которое используется для идентификации субъекта сертификата. В контексте аутентификации через клиентские сертификаты (mTLS) CN часто играет роль идентификатора пользователя или сервиса, на основе которого определяются его привилегии (роли) |
Elasticsearch |
Распределенный поисковый и аналитический движок, обеспечивающий быструю индексацию и поиск данных в реальном времени |
Grafana |
Инструмент визуализации и мониторинга, который позволяет создавать интерактивные дашборды и визуализировать метрики и логи из различных источников данных, таких как Prometheus, Graphite, Elasticsearch и другие |
HNSW (Hierarchical Navigable Small World) |
Алгоритм индексации, используемый для эффективного поиска похожих векторов в высокоразмерных пространствах. Он обеспечивает баланс между скоростью и точностью при работе с большими наборами данных |
IDF (Inverse Document Frequency) |
Мера, которая оценивает редкость слова в коллекции документов. Она используется для определения важности слова в контексте всей коллекции |
IDM (Identity and Access Management) |
Комплексная система или процесс, направленный на управление пользователями, их ролями, привилегиями и доступом к ресурсам в организации |
JWT-токен |
Открытый стандарт для представления и безопасной передачи данных между клиентом и сервером в формате JSON, состоящий из трех частей (header, payload, signature), разделенных точкой |
Memmap-хранилище |
Способ хранения, при котором используется виртуальное адресное пространство, связанное с файлом на диске |
LDAP (Lightweight Directory Access Protocol) |
Стандартный протокол для работы с каталогами информации, которые хранят данные в виде древовидной структуры (например, пользователи, группы, устройства, настройки) |
ML (Machine Learning) |
Область искусственного интеллекта, которая позволяет системам обучаться на данных и делать прогнозы или принимать решения без явного программировании |
NLP (Natural Language Processing) |
Область искусственного интеллекта, которая занимается анализом, пониманием и генерацией текста или речи на естественных языках (например, русском, английском и т.д.) |
nDCG (Normalized Discounted Cumulative Gain) |
Метрика для оценки качества ранжирования результатов в системах поиска и рекомендательных системах. Она учитывает релевантность документов и их позицию в списке, а также нормализует результаты для сравнения с идеальным случаем |
OLAP (Online Analytical Processing) |
Технология аналитической обработки данных, позволяющая выполнять сложные запросы и анализ больших объемов данных |
OLTP (Online Transaction Processing) |
Технология обработки транзакций в режиме реального времени, ориентированная на операции с данными, такие как создание, обновление, удаление и чтение записей |
PAM (POSIX Authentication Module) |
Стандарт аутентификации в Unix-системах, используемый для интеграции с внешними системами (например, LDAP, Active Directory) |
Prometheus |
Система мониторинга и временных рядов с открытым исходным кодом, предназначенная для сбора метрик, хранения данных и предоставления отчетов в реальном времени |
Python |
Высокоуровневый язык программирования общего назначения, ориентированный на удобство чтения и разработки, поддерживающий несколько парадигм программирования, включая объектно-ориентированное, процедурное и функциональное программирование |
RAG (Retrieval-Augmented Generation) |
Подход в области искусственного интеллекта, при котором модель генерирует ответы, используя не только свои внутренние знания, но и информацию, извлеченную из внешних источников (например, баз данных, документов, википедии) |
REST |
Архитектурный стиль взаимодействия компонентов распределенной системы, основанный на использовании стандартных HTTP методов (GET, POST, PUT, DELETE и др.) для управления ресурсами |
Secman |
Система управления конфиденциальными данными, обеспечивающая безопасное хранение, управление и доступ к криптографическим ключам, паролям и другим чувствительным сведениям |
SDK (Software Development Kit) |
Набор инструментов, библиотек, примеров кода и руководств, позволяющих разработчикам создавать программные приложения на определенной платформе |
URL |
Строка, идентифицирующая ресурс в интернете, включающая в себя схему доступа (например, http или https), доменное имя хоста, путь к файлу и, возможно, параметры запроса |
WAL (Write-Ahead Log) |
Vеханизм, используемый в базах данных для обеспечения устойчивости к сбоям и атомарности операций |
YAML |
Формат сериализации данных, предназначенный для удобного и читаемого представления структурированных данных |
Zip-архив |
Формат сжатия данных, обеспечивающий высокую степень компрессии за счет использования алгоритма сжатия LZ77 |
АС (Авторизационная Система) |
Механизм контроля доступа, который определяет, какие действия может выполнять пользователь |
Бинарный файл |
Файл, хранящий данные в двоичном формате, то есть в виде последовательности байтов, где каждый байт представляет собой 8 бит информации. Бинарный файл обычно не может быть запущен самостоятельно, но может быть частью другого исполняемого файла или программы, которая его интерпретирует |
База данных |
Структурированное хранилище данных, организованное для эффективного хранения, поиска и извлечения информации |
Вектор |
Многомерное представление данных, например, изображение, звук, документ, видео и т.д |
Евклидово расстояние |
Способ измерения расстояния между двумя точками в пространстве, аналогично тому, как измеряется расстояние между двумя местами на карте. Оно рассчитывается путем нахождения квадратного корня суммы квадратов разностей координат двух точек. Эта метрика расстояния также широко применяется в машинном обучении для оценки степени сходства или различия между двумя векторами |
Квантование |
Необязательная функция в Vector DB, которая позволяет эффективно хранить и искать многомерные векторы. Преобразовывая исходные векторы в новые представления, квантование сжимает данные при сохранении относительных расстояний между векторами близкими к оригинальным |
Клиенты |
Языки программирования, которые можно использовать для подключения |
Коллекция |
Именованный набор точек (векторы с полезной нагрузкой), среди которых можно осуществлять поиск. Вектор каждой точки в пределах одной коллекции должен иметь одну и ту же размерность и сравниваться по единой метрике. Можно использовать именованные векторы, чтобы хранить несколько векторов в одной точке, причем у каждого из них могут быть собственные требования к размерности и метрике |
Косинусное сходство |
Способ измерения схожести векторов. Упрощенно говоря, оно отражает, имеют ли векторы одинаковое направление (похожие) или находятся далеко друг от друга. Часто используется с текстовыми представлениями для сравнения того, насколько близки друг другу два документа или предложения. Результат варьируется от -1 до 1, где -1 означает полное несходство двух векторов, а 1 указывает на максимальное сходство |
Метрики расстояний |
Математическая функция для измерения сходства между векторами. Должны быть выбраны одновременно с созданием коллекции. Выбор метрики зависит от способа получения векторов и, в частности, от нейронной сети, которая будет использоваться для кодирования новых запросов |
Мультитенант |
Архитектурный паттерн, при котором одна копия программного обеспечения или инфраструктуры обслуживает несколько клиентов (арендаторов), изолируя их данные и ресурсы |
Оперативное хранилище |
Способ хранения при котором все векторы находятся в оперативной памяти. Обладает максимальной скоростью, поскольку доступ к диску требуется только для обеспечения постоянства данных |
Полезная нагрузка |
Объект формата JSON с дополнительными данными, которые можно добавить к вектору |
Прокрутка |
Форма представления информации, при которой содержимое (текст, изображение) двигается (прокручивается) в вертикальном или горизонтальном направлении |
ПУЗ (Пользовательская Учетная Запись) |
Четная запись, созданная для физического или юридического лица, которое взаимодействует с системой через интерфейс, API или интеграции |
Репликация данных |
Набор технологий копирования и распространения данных и объектов баз данных между базами данных, а также синхронизации баз данных для поддержания согласованности |
Скалярное произведение |
Способ измерить степень сходства между двумя векторами. В отличие от косинусного сходства, она учитывает длину векторов. Это может иметь значение, например, когда векторные представления документов строятся на основе частот терминов (слов). Сходство по скалярному произведению вычисляется путем умножения соответствующих значений в двух векторах и последующего суммирования полученных произведений. Чем больше сумма, тем более похожими являются два вектора. Если нормализовать векторы (все числа в сумме равны 1), сходство по скалярному произведению станет равным косинусному сходству |
Снепшот |
Моментальный снимок состояния виртуального диска или машины, который позволяет в любой момент вернуть систему к сохраненной конфигурации |
Тенант |
Изолированная среда для предоставления облачных услуг, где каждый клиент (арендатор) имеет свои собственные конфигурации и данные, отделенные от других клиентов |
Точки |
Центральные сущности, с которыми работает Vector DB. Каждая точка состоит из вектора, необязательного идентификатора и полезной нагрузки |
ТУЗ (Техническая Учетная Запись) |
Учетная запись, созданная для автоматизированных процессов, сервисов или приложений, а не для физических пользователей |
УЗ (Учетная Запись) |
Cущность, которая имеет права на выполнение операций (например, создание коллекций, чтение данных) |
Фронтенд |
Часть программного обеспечения или системы, которая взаимодействует непосредственно с пользователем, обрабатывая и отображая данные |
Хранилище |
Инфраструктура или сервис, предназначенный для хранения данных |
Шард |
Отдельный фрагмент базы данных или набора данных, который физически хранится на отдельном сервере или узле |
Шардирование |
Процесс разделения большой базы данных или набора данных на меньшие фрагменты (шарды), которые распределяются по нескольким серверам |
Эмбеддинг |
Математическое представление объекта в виде вектора, где каждый элемент вектора кодирует определенные признаки объекта. Эти векторы сохраняются в Vector DB и используются для поиска ближайших соседей (nearest neighbors) на основе метрик сходства (Cosine, Euclidean и др.). Vector DB не генерирует эмбеддинги сам — они создаются внешними моделями |