Мониторинг EVTP#

Настройка#

Мониторинг выполняется:

  • самостоятельно администратором EVTP через JMX-порт;

  • c помощью произвольной системы мониторинга. В качестве системы мониторинга может быть использован компонент EDMN продукта Platform V Synapse Event-domain management (EDM) или любая другая система мониторинга.

Метрики#

Группа метрик «JobManager»#

Название

Описание

Размерность

Основные атрибуты

Триггер

org.apache.flink.jobmanager.Status.JVM.CPU.Loadru

Загрузка CPU

Если максимальное значение больше 80% - предупреждение, 90% - ошибка

host=tkles-snaps0001.vm.esrt.cloud.ru

от 0 до 1

org.apache.flink.jobmanager.Status.JVM.CPU.Time

Время использования CPU

мс

host=tkles-snaps0001.vm.esrt.cloud.ru

Должно быть > 0

org.apache.flink.jobmanager.Status.JVM.Memory.Heap.Used

Использование MemoryHeap

байт

host=tkles-snaps0001.vm.esrt.cloud.ru

Если максимальное значение больше 80% - предупреждение, 90% - ошибка

org.apache.flink.jobmanager.Status.JVM.Memory.Heap.Committed

Кол-во памяти, доступное JVM

байт

host=tkles-snaps0001.vm.esrt.cloud.ru

Должно быть не меньше 100 mb

org.apache.flink.jobmanager.Status.JVM.Memory.Heap.Max

Максимальное кол-во памяти, доступное JVM

байт

host=tkles-snaps0001.vm.esrt.cloud.ru

Должно быть не больше 10Gb

Группа метрик «TaskManager»#

Название

Описание

Размерность

Основные атрибуты

Триггер

org.apache.flink.jobmanager.numRegisteredTaskManagers

Кол-во зарегистрированных task-manager

шт

host=tkles-snaps0001.vm.esrt.cloud.ru

Не должно меняться

org.apache.flink.jobmanager.numRunningJobs

Кол-во запущенных служб по кластеру

шт

host=tkles-snaps0001.vm.esrt.cloud.ru

Не должно уменьшаться

org.apache.flink.jobmanager.taskSlotsAvailable

Кол-во свободных слотов

шт

host=tkles-snaps0001.vm.esrt.cloud.ru

-

org.apache.flink.jobmanager.taskSlotsTotal

Всего слотов

шт

host=tkles-snaps0001.vm.esrt.cloud.ru

Не меньше 50

org.apache.flink.taskmanager.Status.JVM.CPU.Load

Загрузка CPU task-manager

байт

host=tkles-snaps0001,tm_id=104af92d2483545

Если максимальное значение больше 80% - предупреждение, 90% - ошибка

org.apache.flink.taskmanager.Status.JVM.CPU.Time

Время использования CPU task-manager

мс

host=tkles-snaps0001,tm_id=104af92d2483545043b193c1805f02e0

Должно быть больше > 0

org.apache.flink.taskmanager.Status.JVM.Memory.Heap.Used

Используемая память

байт

host=tkles-snaps0001,tm_id=104af92d2483545043b193c1805f02e0

Если максимальное значение больше 80% - предупреждение, 90% - ошибка

org.apache.flink.taskmanager.Status.JVM.Memory.Heap.Committed

Кол-во памяти, гарантированно доступной

байт

host=tkles-snaps0001,tm_id=104af92d2483545043b193c1805f02e0

Должно быть не больше 10Gb

org.apache.flink.taskmanager.Status.JVM.Memory.Heap.Max

Максимальное кол-во памяти, которое может быть использовано

байт

host=tkles-snaps0001,tm_id=104af92d2483545043b193c1805f02e0

Должно быть не больше 10Gb

org.apache.flink.taskmanager.job.task.operator.userId.name

UserId - статическая строковая метрика для обозначения группы Tasks в графе потока обработки флинка и их сопоставления с идентификатором, определенным в параметре userId. Метрика является опциональной. Если в параметрах запуска потокового обработчика указан параметр userId, то такая метрика формируется. Если параметр отсутствует - метрика не формируется.

шт

job_id=jobIdValue,
job_name=jobNameValue,
tm_id=tmIdValue,
task_attempt_id=taskAttemptIdValue,
task_attempt_num=taskAttemptNumValue,
subtask_index=subtaskIndexValue,
task_id=taskIdValue,
operator_name=operatorNameValue,
task_name=taskNameValue,
operator_id=operatorId,
host=hostValue

Отсутствует

Группа метрик «Job»#

Название

Описание

Размерность

Основные атрибуты

Триггер

org.apache.flink.jobmanager.job.restartingTime

Сколько времени занимает перезапуск службы, или как долго длится текущий перезапуск

мс

host=tkles-snaps0001.vm.esrt.cloud.ru, job_name=AppTest,job_id=effdc9639a698236fadf1091fc132fca

Не больше 10 сек

org.apache.flink.jobmanager.job.uptime

Время работы службы

мс

host=tkles-snaps0001.vm.esrt.cloud.ru, job_name=ALPHA.COMMON.ESBSM.XFERSYNC, job_id=2b005e66b405382d85b0c5b0d0bfaef8

Должно быть больше -1

org.apache.flink.jobmanager.job.downtime

Время недоступности службы

мс

host=tkles-snaps0001.vm.esrt.cloud.ru,job_name=ALPHA.COMMON.ESBSM.XFERSYNC,job_id=2b005e66b405382d85b0c5b0d0bfaef8

Должно быть равно 0

org.apache.flink.jobmanager.job.numRestarts

Кол-во рестартов службы

шт

host=tkles-snaps0001.vm.esrt.cloud.ru,job_name=ALPHA.COMMON.ESBSM.XFERSYNC,job_id=2b005e66b405382d85b0c5b0d0bfaef8

Не больше 5 раз

org.apache.flink.jobmanager.job.numberOfFailedCheckpoints

Кол-во неуспешных проверок

шт

host=tkles-snaps0001.vm.esrt.cloud.ru,job_name=ALPHA.COMMON.ESBSM.XFERSYNC,job_id=2b005e66b405382d85b0

Не должно увеличиваться

Shuffle.Netty.Input.Buffers inputQueueLength

Кол-во входных сообщений в очереди

шт

-

Не должно увеличиваться

Shuffle.Netty.Output.Buffers outputQueueLength

Кол-во выходных сообщений в очереди

шт

-

Не должно увеличиваться

Группа метрик «Task DSL metrics»#

Название

Описание

Размерность

Основные атрибуты

Триггер

input Пример 0.event-flow-transformation-transformationStepName.input для трансформацииПример 0.event-flow-aggregation-transformationStepName.input для агрегации

Количество входящих событий

шт

-

Должно увеличиваться

output Пример 0.event-flow-transformation-transformationStepName.output для трансформацииПример 0.event-flow-aggregation-transformationStepName.output для агрегации

Количество исходящих событий в основной поток обработки

шт

-

Должно увеличиваться

reject Пример 0.event-flow-transformation-transformationStepName.reject для трансформацииПример 0.event-flow-aggregation-transformationStepName.reject для агрегации

Количество отфильтрованных событий

шт

-

Должно увеличиваться

error Пример 0.event-flow-transformation-transformationStepName.error для трансформацииПример 0.event-flow-aggregation-transformationStepName.error для агрегации

Количество событий обработанных с ошибкой

шт

-

Не должно быть