Мониторинг EVTP#
Настройка#
Мониторинг выполняется:
самостоятельно администратором EVTP через JMX-порт;
c помощью произвольной системы мониторинга. В качестве системы мониторинга может быть использован компонент EDMN продукта Platform V Synapse Event-domain management (EDM) или любая другая система мониторинга.
Метрики#
Группа метрик «JobManager»#
Название |
Описание |
Размерность |
Основные атрибуты |
Триггер |
|---|---|---|---|---|
org.apache.flink.jobmanager.Status.JVM.CPU.Loadru |
Загрузка CPU |
Если максимальное значение больше 80% - предупреждение, 90% - ошибка |
host=tkles-snaps0001.vm.esrt.cloud.ru |
от 0 до 1 |
org.apache.flink.jobmanager.Status.JVM.CPU.Time |
Время использования CPU |
мс |
host=tkles-snaps0001.vm.esrt.cloud.ru |
Должно быть > 0 |
org.apache.flink.jobmanager.Status.JVM.Memory.Heap.Used |
Использование MemoryHeap |
байт |
host=tkles-snaps0001.vm.esrt.cloud.ru |
Если максимальное значение больше 80% - предупреждение, 90% - ошибка |
org.apache.flink.jobmanager.Status.JVM.Memory.Heap.Committed |
Кол-во памяти, доступное JVM |
байт |
host=tkles-snaps0001.vm.esrt.cloud.ru |
Должно быть не меньше 100 mb |
org.apache.flink.jobmanager.Status.JVM.Memory.Heap.Max |
Максимальное кол-во памяти, доступное JVM |
байт |
host=tkles-snaps0001.vm.esrt.cloud.ru |
Должно быть не больше 10Gb |
Группа метрик «TaskManager»#
Название |
Описание |
Размерность |
Основные атрибуты |
Триггер |
|---|---|---|---|---|
org.apache.flink.jobmanager.numRegisteredTaskManagers |
Кол-во зарегистрированных task-manager |
шт |
host=tkles-snaps0001.vm.esrt.cloud.ru |
Не должно меняться |
org.apache.flink.jobmanager.numRunningJobs |
Кол-во запущенных служб по кластеру |
шт |
host=tkles-snaps0001.vm.esrt.cloud.ru |
Не должно уменьшаться |
org.apache.flink.jobmanager.taskSlotsAvailable |
Кол-во свободных слотов |
шт |
host=tkles-snaps0001.vm.esrt.cloud.ru |
- |
org.apache.flink.jobmanager.taskSlotsTotal |
Всего слотов |
шт |
host=tkles-snaps0001.vm.esrt.cloud.ru |
Не меньше 50 |
org.apache.flink.taskmanager.Status.JVM.CPU.Load |
Загрузка CPU task-manager |
байт |
host=tkles-snaps0001,tm_id=104af92d2483545 |
Если максимальное значение больше 80% - предупреждение, 90% - ошибка |
org.apache.flink.taskmanager.Status.JVM.CPU.Time |
Время использования CPU task-manager |
мс |
host=tkles-snaps0001,tm_id=104af92d2483545043b193c1805f02e0 |
Должно быть больше > 0 |
org.apache.flink.taskmanager.Status.JVM.Memory.Heap.Used |
Используемая память |
байт |
host=tkles-snaps0001,tm_id=104af92d2483545043b193c1805f02e0 |
Если максимальное значение больше 80% - предупреждение, 90% - ошибка |
org.apache.flink.taskmanager.Status.JVM.Memory.Heap.Committed |
Кол-во памяти, гарантированно доступной |
байт |
host=tkles-snaps0001,tm_id=104af92d2483545043b193c1805f02e0 |
Должно быть не больше 10Gb |
org.apache.flink.taskmanager.Status.JVM.Memory.Heap.Max |
Максимальное кол-во памяти, которое может быть использовано |
байт |
host=tkles-snaps0001,tm_id=104af92d2483545043b193c1805f02e0 |
Должно быть не больше 10Gb |
org.apache.flink.taskmanager.job.task.operator.userId.name |
UserId - статическая строковая метрика для обозначения группы Tasks в графе потока обработки флинка и их сопоставления с идентификатором, определенным в параметре |
шт |
job_id=jobIdValue, |
Отсутствует |
Группа метрик «Job»#
Название |
Описание |
Размерность |
Основные атрибуты |
Триггер |
|---|---|---|---|---|
org.apache.flink.jobmanager.job.restartingTime |
Сколько времени занимает перезапуск службы, или как долго длится текущий перезапуск |
мс |
host=tkles-snaps0001.vm.esrt.cloud.ru, job_name=AppTest,job_id=effdc9639a698236fadf1091fc132fca |
Не больше 10 сек |
org.apache.flink.jobmanager.job.uptime |
Время работы службы |
мс |
host=tkles-snaps0001.vm.esrt.cloud.ru, job_name=ALPHA.COMMON.ESBSM.XFERSYNC, job_id=2b005e66b405382d85b0c5b0d0bfaef8 |
Должно быть больше -1 |
org.apache.flink.jobmanager.job.downtime |
Время недоступности службы |
мс |
host=tkles-snaps0001.vm.esrt.cloud.ru,job_name=ALPHA.COMMON.ESBSM.XFERSYNC,job_id=2b005e66b405382d85b0c5b0d0bfaef8 |
Должно быть равно 0 |
org.apache.flink.jobmanager.job.numRestarts |
Кол-во рестартов службы |
шт |
host=tkles-snaps0001.vm.esrt.cloud.ru,job_name=ALPHA.COMMON.ESBSM.XFERSYNC,job_id=2b005e66b405382d85b0c5b0d0bfaef8 |
Не больше 5 раз |
org.apache.flink.jobmanager.job.numberOfFailedCheckpoints |
Кол-во неуспешных проверок |
шт |
host=tkles-snaps0001.vm.esrt.cloud.ru,job_name=ALPHA.COMMON.ESBSM.XFERSYNC,job_id=2b005e66b405382d85b0 |
Не должно увеличиваться |
Shuffle.Netty.Input.Buffers inputQueueLength |
Кол-во входных сообщений в очереди |
шт |
- |
Не должно увеличиваться |
Shuffle.Netty.Output.Buffers outputQueueLength |
Кол-во выходных сообщений в очереди |
шт |
- |
Не должно увеличиваться |
Группа метрик «Task DSL metrics»#
Название |
Описание |
Размерность |
Основные атрибуты |
Триггер |
|---|---|---|---|---|
input Пример 0.event-flow-transformation-transformationStepName.input для трансформацииПример 0.event-flow-aggregation-transformationStepName.input для агрегации |
Количество входящих событий |
шт |
- |
Должно увеличиваться |
output Пример 0.event-flow-transformation-transformationStepName.output для трансформацииПример 0.event-flow-aggregation-transformationStepName.output для агрегации |
Количество исходящих событий в основной поток обработки |
шт |
- |
Должно увеличиваться |
reject Пример 0.event-flow-transformation-transformationStepName.reject для трансформацииПример 0.event-flow-aggregation-transformationStepName.reject для агрегации |
Количество отфильтрованных событий |
шт |
- |
Должно увеличиваться |
error Пример 0.event-flow-transformation-transformationStepName.error для трансформацииПример 0.event-flow-aggregation-transformationStepName.error для агрегации |
Количество событий обработанных с ошибкой |
шт |
- |
Не должно быть |