Мониторинг состояния и производительности#
Мониторинг состояния и производительности реализует следующие сценарии:
Основной сценарий: проверка метрик через HTTP API#
Администратор / ТУЗ Мониторинга отправляет запрос на получение метрик:
curl http://localhost:6333/collectionsVector DB возвращает данные о состоянии коллекций (время ответа, использование памяти, количество шардов).
Администратор анализирует метрики в Prometheus/Grafana для выявления проблем (ТУЗ отвечает за поддержку актуального состояния метрик т.е. запрашивает / обновляет метрики).
При обнаружении высокой нагрузки Администратор настраивает балансировку между шардами или увеличивает количество реплик.
Альтернативный сценарий#
Альтернативные сценарии отсутствуют.
Исключительный сценарий: ошибка получения метрик из-за сбоя узла#
Администратор / ТУЗ Мониторинга запрашивает метрики, но Vector DB возвращает ошибку
500 Internal Server Error.Администратор проверяет логи
journalctl, анализирует и устраняет причину сбоя.Администратор перезапускает узел.