Мониторинг состояния и производительности#

Мониторинг состояния и производительности реализует следующие сценарии:

Основной сценарий: проверка метрик через HTTP API#

  1. Администратор / ТУЗ Мониторинга отправляет запрос на получение метрик:

    curl http://localhost:6333/collections
    
  2. Vector DB возвращает данные о состоянии коллекций (время ответа, использование памяти, количество шардов).

  3. Администратор анализирует метрики в Prometheus/Grafana для выявления проблем (ТУЗ отвечает за поддержку актуального состояния метрик т.е. запрашивает / обновляет метрики).

  4. При обнаружении высокой нагрузки Администратор настраивает балансировку между шардами или увеличивает количество реплик.

Альтернативный сценарий#

Альтернативные сценарии отсутствуют.

Исключительный сценарий: ошибка получения метрик из-за сбоя узла#

  1. Администратор / ТУЗ Мониторинга запрашивает метрики, но Vector DB возвращает ошибку 500 Internal Server Error.

  2. Администратор проверяет логи journalctl, анализирует и устраняет причину сбоя.

  3. Администратор перезапускает узел.