Список метрик#
Метрики EVTP#
Метрика |
Описание |
Источник |
Триггеры |
Единица измерения |
MBEAN Name |
Комментарий |
Путь в дереве метрик |
|---|---|---|---|---|---|---|---|
FlinkJobManagerCpuLoad |
Загрузка CPU |
JMX |
Если максимальное значение больше 80% - предупреждение, 90% - ошибка |
% |
org.apache.flink.jobmanager.Status.JVM.CPU.Load:host=* |
The recent CPU usage of the JVM |
|
FlinkJobManagerCpuTime |
Время использования CPU |
JMX |
Должно быть > 0 |
мс |
org.apache.flink.jobmanager.Status.JVM.CPU.Time:host=* |
The CPU time used by the JVM |
|
FlinkJobManagerMemoryHeapUsed |
Использование MemoryHeap |
JMX |
Если максимальное значение больше 80% - предупреждение, 90% - ошибка |
байт |
org.apache.flink.jobmanager.Status.JVM.Memory.Heap.Used:host=* |
The amount of heap memory currently used (in bytes) |
|
FlinkJobManagerMemoryHeapCommitted |
Количество памяти, доступное JVM |
JMX |
Должно быть не меньше 100 Мб |
байт |
org.apache.flink.jobmanager.Status.JVM.Memory.Heap.Committed:host=* |
The amount of heap memory guaranteed to be available to the JVM (in bytes) |
|
FlinkJobManagerMemoryHeapMax |
Максимальное количество памяти, доступное JVM |
JMX |
Должно быть не больше 10Gb |
байт |
org.apache.flink.jobmanager.Status.JVM.Memory.Heap.Max:host=* |
The maximum amount of heap memory that can be used for memory management (in bytes) |
|
FlinkJobManagerJobRestartingTime |
Сколько времени занимает перезапуск Jenkins job или как долго длится текущий перезапуск |
JMX |
Не больше 10 сек |
мс |
org.apache.flink.jobmanager.job.restartingTime:host=,job_name=,job_id=* |
The time it took to restart the job, or how long the current restart has been in progress (in milliseconds) |
|
FlinkJobManagerJobUptime |
Время работы Jenkins job |
JMX |
Должно быть больше -1 |
мс |
org.apache.flink.jobmanager.job.uptime:host=,job_name=,job_id=* |
Returns -1 for completed jobs (in milliseconds) |
|
FlinkJobManagerJobDowntime |
Время недоступности Jenkins job |
JMX |
Должно быть равно 0 |
мс |
org.apache.flink.jobmanager.job.downtime:host=,job_name=,job_id=* |
For jobs currently in a failing/recovering situation, the time elapsed during this outage. Returns 0 for running jobs and -1 for completed jobs (in milliseconds) |
|
FlinkJobManagerJobNumRestarts |
Количество рестартов Jenkins job |
JMX |
Не больше 5 раз |
шт |
org.apache.flink.jobmanager.job.numRestarts:host=,job_name=,job_id=* |
Total number of restarts since this job was submitted, including full restarts and fine-grained restarts |
|
FlinkJobManagerJobNumberOfFailedCheckpoints |
Количество неуспешных контрольных точек |
JMX |
Не должно увеличиваться |
шт |
org.apache.flink.jobmanager.job.numberOfFailedCheckpoints:host=,job_name=,job_id=* |
The number of failed checkpoints |
|
FlinkJobManagerJobLastCheckpointDuration |
Время, потраченное на последнюю контрольную точку |
JMX |
мс |
org.apache.flink.jobmanager.job.lastCheckpointDuration:host=,job_name=,job_id=* |
The time it took to complete the last checkpoint (in milliseconds) |
|
|
FlinkJobManagerNumRegisteredTaskManagers |
Количество зарегистрированных TaskManager |
JMX |
Не должно меняться |
шт |
org.apache.flink.jobmanager.numRegisteredTaskManagers:host=* |
The number of registered taskmanagers |
|
FlinkJobManagerClusterNumRegisteredTaskManagers |
Количество зарегистрированных TaskManager по кластеру |
JMX |
шт |
org.apache.flink.jobmanager.numRegisteredTaskManagers:host=* |
The number of registered taskmanagers |
|
|
FlinkJobManagerClusterNumRunningJobs |
Количество запущенных Jenkins jobs по кластеру |
JMX |
Не должно уменьшаться |
шт |
org.apache.flink.jobmanager.numRunningJobs:host=* |
The number of running jobs |
|
FlinkJobManagerTaskSlotsAvailable |
Количество свободных слотов |
JMX |
шт |
org.apache.flink.jobmanager.taskSlotsAvailable:host=* |
The number of available task slots |
|
|
FlinkJobManagerClusterTaskSlotsAvailable |
Количество свободных слотов по кластеру |
JMX |
шт |
org.apache.flink.jobmanager.taskSlotsAvailable:host=* |
The number of available task slots |
|
|
FlinkJobManagerTaskSlotsTotal |
Всего слотов |
JMX |
Не меньше 50? |
шт |
org.apache.flink.jobmanager.taskSlotsTotal:host=* |
The total number of task slots |
|
FlinkJobManagerClusterTaskSlotsTotal |
Всего слотов по кластеру |
JMX |
шт |
org.apache.flink.jobmanager.taskSlotsTotal:host=* |
The total number of task slots |
|
|
FlinkTaskManagerCpuLoad |
Загрузка CPU TaskManager |
JMX |
Если максимальное значение больше 80% - предупреждение, 90% - ошибка |
байт |
org.apache.flink.taskmanager.Status.JVM.CPU.Load:host=,tm_id= |
The recent CPU usage of the JVM |
|
FlinkTaskManagerCpuTime |
Время использования CPU TaskManager |
JMX |
Должно быть больше 0 |
мс |
org.apache.flink.taskmanager.Status.JVM.CPU.Time:host=,tm_id= |
The CPU time used by the JVM |
|
FlinkTaskManagerMemoryHeapUsed |
Используемая память |
JMX |
Если максимальное значение больше 80% - предупреждение, 90% - ошибка |
байт |
org.apache.flink.taskmanager.Status.JVM.Memory.Heap.Used:host=,tm_id= |
The amount of heap memory currently used (in bytes) |
|
FlinkTaskManagerMemoryHeapCommitted |
Количество гарантированной памяти гарантированно доступной |
JMX |
Должно быть не больше 10Gb |
байт |
org.apache.flink.taskmanager.Status.JVM.Memory.Heap.Committed:host=,tm_id= |
The amount of heap memory guaranteed to be available to the JVM (in bytes) |
|
FlinkTaskManagerMemoryHeapMax |
Максимальное количество памяти, которое может быть использовано |
JMX |
Должно быть не больше 10Gb |
байт |
org.apache.flink.taskmanager.Status.JVM.Memory.Heap.Max:host=,tm_id= |
The maximum amount of heap memory that can be used for memory management (in bytes) |
|
FlinkTaskManagerJobInputQueueLength |
Количество входных сообщений в очереди |
JMX |
Не должно увеличиваться |
шт |
org.apache.flink.taskmanager.job.task.Shuffle.Netty.Input.Buffers.inputQueueLength:task_name=,job_id=,task_attempt_id=,job_name=,tm_id=,task_id=,task_attempt_num=,host=,subtask_index=* |
The number of queued input buffers |
|
FlinkTaskManagerJobOutputQueueLength |
Количество выходных сообщений в очереди |
JMX |
Не должно увеличиваться |
шт |
org.apache.flink.taskmanager.job.task.Shuffle.Netty.Output.Buffers.outputQueueLength:task_name=,job_id=,task_attempt_id=,job_name=,tm_id=,task_id=,task_attempt_num=,host=,subtask_index=* |
The number of queued output buffers |
|
FlinkTaskManagerJobLag |
Максимальный лаг обработки событий |
JMX |
шт |
org.apache.flink.taskmanager.job.task.operator.KafkaSourceReader.KafkaConsumer.records-lag-max:job_id=,job_name=,tm_id=,task_attempt_id=,task_attempt_num=,subtask_index=,task_id=,operator_name=,task_name=,operator_id=,host=* |
|
||
FlinkTaskManagerJobInput |
Количество входящих событий |
JMX |
шт |
org.apache.flink.taskmanager.job.task.operator.input:job_id=,job_name=,tm_id=,task_attempt_id=,task_attempt_num=,subtask_index=,task_id=,operator_name=,task_name=,operator_id=,host=* |
|
||
FlinkTaskManagerJobOutput |
Количество исходящих событий в основной поток обработки |
JMX |
шт |
org.apache.flink.taskmanager.job.task.operator.output:job_id=,job_name=,tm_id=,task_attempt_id=,task_attempt_num=,subtask_index=,task_id=,operator_name=,task_name=,operator_id=,host=* |
|
||
FlinkTaskManagerJobReject |
Количество отфильтрованных событий |
JMX |
шт |
org.apache.flink.taskmanager.job.task.operator.reject:job_id=,job_name=,tm_id=,task_attempt_id=,task_attempt_num=,subtask_index=,task_id=,operator_name=,task_name=,operator_id=,host=* |
|
||
FlinkTaskManagerJobError |
Количество событий, обработанных с ошибкой |
JMX |
шт |
org.apache.flink.taskmanager.job.task.operator.error:job_id=,job_name=,tm_id=,task_attempt_id=,task_attempt_num=,subtask_index=,task_id=,operator_name=,task_name=,operator_id=,host=* |
|
Метрики EVTP tengri#
Метрика |
Описание |
Источник |
Единица измерения |
MBEAN Name |
|---|---|---|---|---|
FlinkInputPerInterval |
Общее число входящих сообщений в Jenkins job за период |
JMX |
шт |
org.apache.flink.taskmanager.job.task.operator.numRecordsOut:job_id=,job_name=,task_attempt_id=,tm_id=,task_attempt_num=,subtask_index=,task_id=,operator_name=,task_name=,operator_id=,host=* |
Метрики EVTD#
Метрика |
Описание |
Источник |
Триггеры |
Единица измерения |
MBEAN Name |
Комментарий |
Путь в дереве метрик |
|---|---|---|---|---|---|---|---|
KafkaLagTopicPartitionEndOffset |
Текущий оффсет по партициям topic ( |
JMX |
шт |
kafka.log:type=Log,name=LogEndOffset,topic=,partition= |
Лаг на топик по консьюмер-группе – какая группа плохо читает/перестала читать |
|
|
KafkaSETopicLag |
Лаг по топик для Kafka SE - показатель отставания между продюсер и консьюмер в Kafka |
JMX |
шт |
kafka.server:type=KafkaConsumerLagsMetrics,name=AggregatedTopicLagMetrics,Consumer-Group=,topic= |
Существует задержка между моментом написания сообщения и моментом его прочтения. Чтение всегда будет отставать от записи, это и есть Consumer Lag |
|
|
KafkaLifeBrokersMessagesInPerSec |
Список живых брокеров |
JMX |
kafka.server:type=BrokerTopicMetrics,name=MessagesInPerSec |
Если метрика обновляется, значит брокер жив |
|
||
KafkaMessagesInPerSec |
Количество сообщений, полученных брокером в секунду. Считается по данными за последнюю минуту |
JMX |
kafka.server:type=BrokerTopicMetrics,name=MessagesInPerSec |
|
|||
KafkaLifeBrokersBrokerState |
Список живых брокеров |
JMX |
kafka.server:type=KafkaServer,name=BrokerState |
0 - Not Running; 1 - Starting; 2 - Recovering from Unclean Shutdown; 3 - Running as Broker; 4 - Running as Controller; 5 - Pending Controlled Shutdown; 6 - Broker Shutting Down |
|
||
KafkaBrokerUptime |
Время жизни брокера |
JMX |
с |
java.lang:type=Runtime |
|
||
KafkaProcessCpuLoad |
Загрузка CPU, память |
JMX |
% |
java.lang:type=OperatingSystem |
|
||
KafkaTotalTimeMs99thPercentile |
Время отправки ответа, в которое укладывается 99 процентов запросов |
JMX |
мс |
kafka.network:type=RequestMetrics,name=TotalTimeMs,request=Produce |
|
||
KafkaMemoryUsage |
Использование памяти |
JMX |
байт |
java.lang:type=Memory |
|
||
KafkaMemoryUsage |
Использование памяти |
JMX |
байт |
java.lang:type=Memory |
|
||
KafkaReplicaMaxLag |
Максимальное отставание в репликации, количество сообщений |
JMX |
шт |
kafka.server:type=ReplicaFetcherManager,name=MaxLag,clientId=Replica |
|
||
KafkaOfflineReplicaCount |
Количество оффлайн реплик |
JMX |
шт |
kafka.server:type=ReplicaManager,name=OfflineReplicaCount |
|
||
KafkaFailedIsrUpdatesPerSec |
Количество неуспешных репликаций в секунду |
JMX |
шт |
kafka.server:type=ReplicaManager,name=FailedIsrUpdatesPerSec |
|
||
KafkaNetworkProcessorAvgIdlePercent |
Простой сетевых обработчиков |
JMX |
% |
kafka.network:type=SocketServer,name=NetworkProcessorAvgIdlePercent |
Метрика снимается раз в минуту и показывает средний процент времени простоя сетевых процессов. 100% означает, что сетевые процессы не загружены |
|
|
KafkaNetworkProcessor |
Количество успешных аутентификаций в секунду |
JMX |
|
|
|||
KafkaNetworkProcessor |
Количество неуспешных аутентификаций в секунду |
JMX |
|
|
|||
KafkaNetworkProcessor |
Количество активных соединений |
JMX |
|
|
|||
KafkaReplicationBytesInPerSec |
Входящая скорость репликации |
JMX |
байт/с |
kafka.server:type=BrokerTopicMetrics,name=ReplicationBytesInPerSec |
|
||
KafkaReplicationBytesOutPerSec |
Исходящая скорость репликации |
JMX |
байт/с |
kafka.server:type=BrokerTopicMetrics,name=ReplicationBytesOutPerSec |
|
||
KafkaFailedProduceRequestsPerSec |
Количество неудачных запросов на брокер |
JMX |
tps |
kafka.server:type=BrokerTopicMetrics,name=FailedProduceRequestsPerSec |
|
||
KafkaFailedFetchRequestsPerSec |
Количество неудачных запросов на брокер |
JMX |
tps |
kafka.server:type=BrokerTopicMetrics,name=FailedFetchRequestsPerSec |
|
||
KafkaActiveControllerCount |
Наличие активного лидера кластера |
JMX |
kafka.controller:type=KafkaController,name=ActiveControllerCount |
|
|||
KafkaPreferredReplicaImbalanceCount |
Количество партиций-лидеров, не являющихся предпочтительными (preferred) |
JMX |
шт |
kafka.controller:type=KafkaController,name=PreferredReplicaImbalanceCount |
В здоровом кластере эта метрика должна быть равна 0. Если она не 0, то требуется инициировать ребалансировку |
|
|
KafkaActiveController |
Является ли брокер контроллером |
JMX |
kafka.controller:type=KafkaController,name=ActiveControllerCount |
Метрика равна 1 на брокере, который является контроллером, на остальных брокерах должна быть равна 0. Первая запущенная node в кластере Kafka становится контроллером. Контроллер кластера отвечает за ведение списка лидеров партиций и координацию смены лидера, если текущий лидер становится недоступным. Если возникает необходимость в смене контроллера, то Zookeeper в случайном порядке выбирает новый контроллер из списка брокеров |
|
||
KafkaGlobalPartitionCount |
Партиции брокера |
JMX |
шт |
kafka.controller:type=KafkaController,name=GlobalPartitionCount |
|
||
KafkaOfflinePartitionsCount |
Партиции Not available |
JMX |
шт |
kafka.controller:type=KafkaController,name=OfflinePartitionsCount |
|
||
KafkaUnderReplicatedPartitions |
Партиции UnderReplicated |
JMX |
шт |
kafka.server:type=ReplicaManager,name=UnderReplicatedPartitions |
|
||
KafkaFetchFollower |
Запросы консьюмеров на получение новых данных |
JMX |
шт |
kafka.network:type=RequestMetrics,name=RequestsPerSec,request=FetchFollower,version=* |
|
||
KafkaFetchConsumer |
Количество запросов от консьюмер на брокер на чтение |
JMX |
шт |
kafka.network:type=RequestMetrics,name=RequestsPerSec,request=FetchConsumer,version=* |
|
||
KafkaProduce |
Количество запросов от продюсер на брокер |
JMX |
шт |
kafka.network:type=RequestMetrics,name=RequestsPerSec,request=Produce,version=* |
|
||
KafkaRequestQueueSize |
Размеры очередей |
JMX |
Не должны увеличиваться |
kafka.network:type=RequestChannel,name=RequestQueueSize |
|
||
KafkaTopicTotalFetchRequestsPerSecCount |
Нагрузка на топик – сколько всего сообщений поступило в topic |
JMX |
шт |
kafka.server:type=BrokerTopicMetrics,name=TotalFetchRequestsPerSec,topic=* |
|
||
KafkaTopicTotalFetchRequestsPerSecOneMinuteRate |
Нагрузка на топик в tps – сколько сообщений поступает в topic за секунду |
JMX |
Среднее должно быть >0 |
tps |
kafka.server:type=BrokerTopicMetrics,name=TotalFetchRequestsPerSec,topic=* |
|
|
KafkaTopicBytesInPerSecCount |
Нагрузка на топик в b/s – сколько всего записано в topic |
JMX |
байт/с |
kafka.server:type=BrokerTopicMetrics,name=BytesInPerSec,topic=* |
|
||
KafkaTopicBytesInPerSecOneMinuteRate |
Нагрузка на топик в b/s – среднее за 1 минуту значение |
JMX |
Среднее должно быть >0 |
байт/с |
kafka.server:type=BrokerTopicMetrics,name=BytesInPerSec,topic=* |
|
|
KafkaTopicBytesOutPerSecCount |
Нагрузка на топик в b/s – какой объем данных читается из topic |
JMX |
байт/с |
kafka.server:type=BrokerTopicMetrics,name=BytesOutPerSec,topic=* |
|
||
KafkaTopicBytesOutPerSecOneMinuteRate |
Нагрузка на топик в b/s – какой объем данных читается из topic - среднее значение за 1 минуту значение |
JMX |
байт/с |
kafka.server:type=BrokerTopicMetrics,name=BytesOutPerSec,topic=* |
|
||
KafkaTopicMessagesInPerSecCount |
Количество сообщений, полученных топик в секунду (tps) |
JMX |
tps |
kafka.server:type=BrokerTopicMetrics,name=MessagesInPerSec,topic=* |
|
||
KafkaTopicMessagesInPerSecOneMinuteRate |
Количество сообщений, полученных топик в секунду. Считается по данными за последнюю минуту (tps) |
JMX |
tps |
kafka.server:type=BrokerTopicMetrics,name=MessagesInPerSec,topic=* |
|
Метрики SEDR#
Метрика |
Источник |
Триггеры |
Единица измерения |
MBEAN Name |
Комментарий |
Путь в дереве метрик |
|---|---|---|---|---|---|---|
Использование памяти |
JMX |
байт |
java.lang:type=Memory |
|
||
Использование памяти |
JMX |
байт |
java.lang:type=Memory |
|
||
Количество полученных консьюмером запросов в секунду |
JMX |
kafka.consumer:type=consumer-fetch-manager-metrics,client-id=* |
|
|||
Общее число отправленных сообщений |
JMX |
шт |
kafka.producer:type=producer-metrics,client-id=* |
The total number of records output from the transformations and sent/put to this task belonging to the named sink connector in this worker, since the task was last restarted |
|
|
Общее число сообщений, отправленных с ошибкой |
JMX |
Не больше 0 |
шт |
kafka.producer:type=producer-metrics,client-id=* |
The number of record processing errors in this task |
|
Средняя задержка запроса |
JMX |
мс |
kafka.producer:type=producer-metrics,client-id=* |
|
||
Максимальная задержка запроса |
JMX |
мс |
kafka.producer:type=producer-metrics,client-id=* |
|
||
Максимальное отставание по количеству записей для любой партиции |
JMX |
шт |
kafka.consumer:type=consumer-fetch-manager-metrics,client-id=* |
Возрастающее значение - лучший показатель того, что группа консьюмеров не поспевает за продюсерами |
|
|
Среднее количество записей, читаемое консьюмером в секунду |
JMX |
tps |
kafka.consumer:type=consumer-fetch-manager-metrics,client-id=* |
|
||
Количество полученных консьюмером запросов в секунду |
JMX |
tps |
kafka.consumer:type=consumer-fetch-manager-metrics,client-id=* |
|
||
Среднее время, необходимое для получения запроса |
JMX |
мс |
kafka.consumer:type=consumer-fetch-manager-metrics,client-id=* |
|
||
Количество партиций, назначенных консьюмеру |
JMX |
шт |
kafka.consumer:type=consumer-coordinator-metrics,client-id=* |
|
||
Количество секунд с последнего heartbeat контролера |
JMX |
с |
kafka.consumer:type=consumer-coordinator-metrics,client-id=* |
|
||
Количество синхронизаций групп в секунду |
JMX |
шт |
kafka.consumer:type=consumer-coordinator-metrics,client-id=* |
Большие значения означают нестабильность группы |
|
|
Количество присоединений к группе в секунду |
JMX |
шт |
kafka.consumer:type=consumer-coordinator-metrics,client-id=* |
Большое значение указывает на то, что группа консьюмеров нестабильна |
|
|
Максимальное время, затрачиваемое на повторное присоединение к группе |
JMX |
kafka.consumer:type=consumer-coordinator-metrics,client-id=* |
Это значение не должно быть намного больше, чем настроенный тайм-аут сессии консьюмера |
|
||
Средняя задержка запроса |
JMX |
мс |
kafka.producer:type=producer-metrics,client-id=* |
|
||
Среднее количество запросов, отправленных в секунду |
JMX |
tps |
kafka.producer:type=producer-metrics,client-id=* |
|
||
Среднее количество байтов, получаемых в секунду со всех серверов |
JMX |
байт/с |
kafka.producer:type=producer-metrics,client-id=* |
|
||
Среднее количество исходящих байтов, отправляемых в секунду на все серверы |
JMX |
байт/с |
kafka.producer:type=producer-metrics,client-id=* |
|
||
Общее количество исходящих байтов, отправляемых на все серверы |
JMX |
байт/с |
kafka.producer:type=producer-metrics,client-id=* |
|
||
Среднее количество байтов, получаемых в секунду по topic |
JMX |
байт/с |
kafka.producer:type=producer-topic-metrics,client-id=,topic= |
|
||
Среднее количество байтов, получаемых по topic |
JMX |
байт/с |
kafka.producer:type=producer-topic-metrics,client-id=,topic= |
|
||
Количество коннекторов на воркере репликатора |
JMX |
Не должно уменьшаться |
шт |
kafka.connect:type=connect-worker-metrics |
The number of connectors run in this worker |
|
Количество коннекторов, стартовавших с ошибкой |
JMX |
Не больше 0 |
шт |
kafka.connect:type=connect-worker-metrics |
The total number of connector starts that failed |
|
Количество успешно запущенных коннекторов |
JMX |
шт |
kafka.connect:type=connect-worker-metrics |
The total number of connector starts that succeeded |
|
|
Количество тасков на одном воркере |
JMX |
Не должно уменьшаться |
шт |
kafka.connect:type=connect-worker-metrics |
The number of tasks run in this worker. Не должно стремиться к бесконечности, должно оставаться на одном уровне или стремиться к 0 |
|
Количество тасков с ошибками |
JMX |
Должно быть 0 |
шт |
kafka.connect:type=connect-worker-metrics |
The total number of task starts that failed |
|
Количество успешно запущенных тасков |
JMX |
шт |
kafka.connect:type=connect-worker-metrics |
The total number of task starts that succeeded |
|
|
Время жизни воркера |
JMX |
Не должно уменьшаться |
c |
java.lang:type=Runtime |
|
|
Количество destroyed тасков на коннекторе |
JMX |
Должно быть 0 |
шт |
kafka.connect:type=connect-worker-metrics,connector=* |
The number of destroyed tasks of the connector on the worker |
|
Количество failed тасков на коннекторе |
JMX |
Должно быть 0 |
шт |
kafka.connect:type=connect-worker-metrics,connector=* |
The number of failed tasks of the connector on the worker |
|
Количество paused тасков на коннекторе |
JMX |
Должно быть 0 |
шт |
kafka.connect:type=connect-worker-metrics,connector=* |
The number of paused tasks of the connector on the worker |
|
Количество running тасков на коннекторе |
JMX |
Должно быть > 0 |
шт |
kafka.connect:type=connect-worker-metrics,connector=* |
The number of running tasks of the connector on the worker. должно стремиться к общему количеству |
|
Количество тасков на коннекторе |
JMX |
Должно быть > 0 |
шт |
kafka.connect:type=connect-worker-metrics,connector=* |
The number of tasks of the connector on the worker. должно оставаться на одном уровне |
|
Кол-во unassigned тасков на коннекторе |
JMX |
Должно быть 0 |
шт |
kafka.connect:type=connect-worker-metrics,connector=* |
The number of unassigned tasks of the connector on the worker |
|
Имя лидера |
JMX |
Длинна должна быть > 0 |
kafka.connect:type=connect-worker-rebalance-metrics |
The name of the group leader. Когда нет лидера, работа не выполняется |
|
|
Выполняется ли сейчас балансировка |
JMX |
0 |
kafka.connect:type=connect-worker-rebalance-metrics |
Whether this worker is currently rebalancing. При балансировке никакая работа не выполняется |
|
|
Тип коннектора |
JMX |
kafka.connect:type=connector-metrics,connector=* |
The type of the connector. One of „source“ or „sink“ |
|
||
Статус работы коннектора |
JMX |
Не равно «Running» |
kafka.connect:type=connector-metrics,connector=* |
The status of the connector. One of „unassigned“, „running“, „paused“, „failed“, or „destroyed“ |
|
|
Максимальное время, затрачиваемое таском для коммита смещения |
JMX |
Не больше 2000 миллисекунд |
мс |
kafka.connect:type=connector-task-metrics,connector=,task= |
|
|
Процент успешно закомиченных смещений |
JMX |
Должен быть 100% |
% |
kafka.connect:type=connector-task-metrics,connector=,task= |
The average percentage of this task’s offset commit attempts that succeeded |
|
Процент времени, который таск провел в ожидании |
JMX |
Должен быть 0% |
% |
kafka.connect:type=connector-task-metrics,connector=,task= |
The fraction of time this task has spent in the pause state |
|
Процент времени, который таск провел в работе |
JMX |
Должен быть 100% |
% |
kafka.connect:type=connector-task-metrics,connector=,task= |
The fraction of time this task has spent in the running state |
|
Статус работы коннектора |
JMX |
Не равно «Running» |
kafka.connect:type=connector-task-metrics,connector=,task= |
The status of the connector task. One of „unassigned“, „running“, „paused“, „failed“, or „destroyed“ |
|
|
Число партиций topic, присвоенных таску |
JMX |
шт |
kafka.connect:type=sink-task-metrics,connector=,task= |
The number of topic partitions assigned to this task belonging to the named sink connector in this worker |
|
|
Число записей, прочитанных из Kafka, но незакомиченных |
JMX |
шт |
kafka.connect:type=sink-task-metrics,connector=,task= |
The number of records that have been read from Kafka but not yet completely committed/flushed/acknowledged by the sink task |
|
|
Среднее количество tps, вычитываемое из Kafka этим таском |
JMX |
tps |
kafka.connect:type=sink-task-metrics,connector=,task= |
The average per-second number of records read from Kafka for this task belonging to the named sink connector in this worker. This is before transformations are applied |
|
|
Всего сообщений вычитано из Kafka таском с момента последнего рестарта |
JMX |
шт |
kafka.connect:type=sink-task-metrics,connector=,task= |
The total number of records read from Kafka by this task belonging to the named sink connector in this worker, since the task was last restarted |
|
|
Среднее количество исходящих записей коннектора |
JMX |
tps |
kafka.connect:type=sink-task-metrics,connector=,task= |
The average per-second number of records output from the transformations and sent/put to this task belonging to the named sink connector in this worker. This is after transformations are applied and excludes any records filtered out by the transformations |
|
|
Всего исходящих записей коннектора |
JMX |
шт |
kafka.connect:type=sink-task-metrics,connector=,task= |
The total number of records output from the transformations and sent/put to this task belonging to the named sink connector in this worker, since the task was last restarted |
|
|
Количество записей в очередь dead letter |
JMX |
Не больше 0 |
шт |
kafka.connect:type=task-error-metrics,connector=,task= |
The number of failed writes to the dead letter queue |
|
Количество попыток записей в очередь dead letter |
JMX |
шт |
kafka.connect:type=task-error-metrics,connector=,task= |
The number of attempted writes to the dead letter queue |
|
|
Время последней ошибки |
JMX |
– |
kafka.connect:type=task-error-metrics,connector=,task= |
The epoch timestamp when this task last encountered an error |
|
|
Всего ошибок на коннекторе |
JMX |
Не больше 0 |
шт |
kafka.connect:type=task-error-metrics,connector=,task= |
The number of errors that were logged |
|
Всего ошибок обработки записи |
JMX |
Не больше 0 |
шт |
kafka.connect:type=task-error-metrics,connector=,task= |
The number of record processing errors in this task |
|
Всего сбоев в обработке записей |
JMX |
Не больше 0 |
шт |
kafka.connect:type=task-error-metrics,connector=,task= |
The number of record processing failures in this task |
|
Всего записей пропущено из-за ошибок |
JMX |
Не больше 0 |
шт |
kafka.connect:type=task-error-metrics,connector=,task= |
The number of records skipped due to errors |
|
Количество повторных операций |
JMX |
Не больше 0 |
шт |
kafka.connect:type=task-error-metrics,connector=,task= |
The number of operations retried |
|
Метрики SMBX#
Метрика |
Источник |
Триггеры |
Единица измерения |
MBEAN Name |
Атрибут |
Путь в дереве метрик |
|---|---|---|---|---|---|---|
Время работы коллекции GarbageCollector |
JMX |
мс |
java.lang:type=GarbageCollector,name=G1 Young Generation |
CollectionTime |
|
|
Кол-во коллекций GarbageCollector |
JMX |
шт |
java.lang:type=GarbageCollector,name=G1 Young Generation |
CollectionCount |
|
|
Процент использования памяти брокером относительно global-max-size |
JMX |
0.7 |
% |
|
AddressMemoryUsagePercentage |
|
Процент использования дискового пространства |
JMX |
0.7 |
% |
|
DiskStoreUsage |
|
Время жизни брокера |
JMX |
сек |
|
UptimeMillis |
|
|
Получено сообщений с момента запуска брокера |
JMX |
шт |
|
TotalMessagesAdded |
|
|
Получено сообщений с момента запуска брокера |
JMX |
шт |
|
TotalMessagesAcknowledged |
|
|
Количество клиентов, подключенных к серверу |
JMX |
шт |
|
ConnectionCount |
|
|
Количество сообщений во всех очередях брокера |
JMX |
шт |
|
TotalMessageCount |
|
|
Количество консьюмеров, потребляющих сообщения со всех очередей брокера |
JMX |
шт |
|
TotalConsumerCount |
|
|
Количество очередей, созданных на брокере |
JMX |
шт |
|
QueueCount |
|
|
Количество адресов, созданных на брокере |
JMX |
шт |
|
AddressCount |
|
|
Состояние брокера, активный - |
JMX |
шт |
|
Active |
|
|
Количество сообщений в очереди |
JMX |
шт |
|
MessageCount |
|
|
Количество сообщений, отправленных в очередь с момента ее создания |
JMX |
шт |
|
MessagesAdded |
|
|
Количество сообщений, забранных из очереди с момента ее создания |
JMX |
шт |
|
MessagesAcknowledged |
|
|
Количество подключенных потребителей |
JMX |
шт |
|
ConsumerCount |
|
|
Размер всех сообщений (включая постоянные и непродолжительные), находящихся в данный момент в этой очереди (включая запланированные, выгружаемые сообщения и сообщения в процессе доставки) |
JMX |
Мб |
|
PersistentSize |
|
|
Процент загруженности адреса |
JMX |
% |
|
AddressLimitPercent |
|
|
Количество предполагаемых байт, используемых всеми очередями, привязанными к данному адресу |
JMX |
Мб |
|
AddressSize |
|
|
Количество сообщений, находящихся в данный момент во всех очередях, привязанных к этому адресу |
JMX |
шт |
|
MessageCount |
|
|
Сумма сообщений в очереди (очередях), включая сообщения, находящиеся в доставке |
JMX |
шт |
|
NumberOfMessages |
|
|
Глобальный максимальный предел для сообщений |
JMX |
Мб |
|
GlobalMaxSize |
|
|
Количество клиентов, которые подключились к этому серверу с момента его запуска |
JMX |
шт |
|
TotalConnectionCount |
|
|
Память, используемая всеми адресами брокера для сообщений, хранящихся в памяти |
JMX |
Мб |
|
AddressMemoryUsage |
|
|
Количество сообщений, не перенаправленных ни в какие привязки |
JMX |
шт |
|
UnRoutedMessageCount |
|
|
Является ли этот адрес подкачивающим (да - „1“, нет - „0“) |
JMX |
|
Paging |
|
||
Количество сообщений, которые эта очередь в данный момент доставляет своим консьюмерам |
JMX |
шт |
|
DeliveringCount |
|
|
Количество сообщений, срок действия которых истек из этой очереди с момента ее создания |
JMX |
шт |
|
MessagesExpired |
|
|
Количество сообщений, удаленных из этой очереди с момента ее создания из-за превышения максимального количества попыток доставки |
JMX |
шт |
|
MessagesKilled |
|
|
Количество запланированных сообщений в этой очереди |
JMX |
шт |
|
ScheduledCount |
|
|
Постоянный размер запланированных сообщений в этой очереди |
JMX |
Мб |
|
ScheduledSize |
|
|
Количество страниц, используемых этим адресом |
JMX |
шт |
|
NumberOfPages |
|
|
Количество направляемых сообщений |
JMX |
шт |
|
RoutedMessageCount |
|
Метрики etcd#
Метрика |
Источник |
Триггер |
Единица измерения |
Tип |
Комментарии |
Путь в дереве метрик |
|---|---|---|---|---|---|---|
Совокупный физический размер хранилища данных в Мб |
Prometheus |
Мб |
gauge |
|
||
Общее количество compacted ключей БД |
Prometheus |
шт |
counter |
|
||
Общее количество ключей |
Prometheus |
шт |
gauge |
|
||
Количество активных в настоящее время наблюдателей |
Prometheus |
Не должно меняться |
шт |
gauge |
|
|
Латенси |
Prometheus |
Должно быть меньше 5 сек |
шт |
summary |
Большие задержки при работе с диском часто указывают на проблемы с диском. Это может привести к большой задержке обработки запросов или сделать кластер нестабильным |
|
Количество вызовов |
Prometheus |
шт |
counter |
Большие задержки при работе с диском часто указывают на проблемы с диском. Это может привести к большой задержке обработки запросов или сделать кластер нестабильным |
|
|
Латенси коммитов, вызываемых серверной частью |
Prometheus |
Должно быть меньше 5 сек |
summary |
Большие задержки при работе с диском часто указывают на проблемы с диском. Это может привести к большой задержке обработки запросов или сделать кластер нестабильным |
|
|
Количество коммитов, вызываемых серверной частью |
Prometheus |
шт |
counter |
|
||
Общее количество Мб, записанных в WAL |
Prometheus |
Мб |
gauge |
|
||
Общее количество кешированных keys/ranges |
Prometheus |
шт |
gauge |
|
||
Общий размер базы данных, физически выделенной в Мб |
Prometheus |
Мб |
gauge |
|
||
Общий размер используемой базы данных в Мб |
Prometheus |
Мб |
gauge |
|
||
Общее количество Мб полученных от grpc клиентов |
Prometheus |
Мб |
counter |
|
||
Общее количество Мб отправленных grpc клиентам |
Prometheus |
Мб |
counter |
|
||
Общее количество клиентских запросов на версию клиента |
Prometheus |
шт |
counter |
|
||
Есть ли лидер или нет: 1 - существует, 0 - нет |
Prometheus |
Должно быть =1 |
gauge |
Указывает, есть ли у участника лидер. Если у участника нет лидера, он полностью недоступен. Если у всех участников в кластере нет лидера, весь кластер полностью недоступен |
|
|
Общее количество неудачных health checks |
Prometheus |
Не должно расти |
шт |
counter |
Чем меньше, тем лучше |
|
Общее количество удачных health checks |
Prometheus |
шт |
counter |
|
||
Общее число ошибок heartbeat лидера (вероятно перегружено из-за медленного диска) |
Prometheus |
Не должно расти |
шт |
counter |
Чем меньше, тем лучше |
|
ID сервера или участника (member) в 16-ричном формате |
Prometheus |
gauge |
|
|||
Является ли данный участник лидером: 1 - да, 0 - нет |
Prometheus |
gauge |
|
|||
Является ли данный участник learner: 1 - да, 0 - нет |
Prometheus |
gauge |
|
|||
Количество замеченных смен лидеров |
Prometheus |
Не должно расти, иначе предупреждение |
раз |
counter |
Подсчитывает количество изменений лидера, которые участник (member) видел с момента запуска. Частая смена лидера существенно влияет на производительность etcd. Это также сигнализирует о нестабильности лидера, возможно, из-за проблем с сетевым подключением или чрезмерной нагрузки на кластер etcd |
|
Общее количество примененных консенсусных предложений |
Prometheus |
раз |
gauge |
Сервер etcd применяет каждое зафиксированное предложение асинхронно. Разница между proposals_committed_total и proposals_applied_total обычно должна быть небольшой (в пределах нескольких тысяч даже при высокой нагрузке). Если разница между ними продолжает расти, это означает, что сервер etcd перегружен. Это может произойти при применении дорогостоящих запросов, таких как запросы с большим диапазоном или большие операции txn |
|
|
Общее количество одобренных консенсусных предложений |
Prometheus |
Не должно падать |
раз |
gauge |
Этот показатель должен со временем увеличиваться, если кластер исправен. Несколько здоровых участников кластера etcd могут иметь одновременно разные суммарные зафиксированные предложения. Это несоответствие может быть связано с восстановлением после старта, отставанием от лидера или тем, что он является лидером и, следовательно, имеет наибольшее количество коммитов. Важно отслеживать эту метрику для всех участников кластера; неизменно большое отставание между отдельным участником и его лидером указывает на то, что участник работает медленно или нездорово |
|
Общее количество неудавшихся предложений |
Prometheus |
Не должно расти |
шт |
counter |
Обычно связаны с двумя проблемами: временные сбои, связанные с выборами лидера, или более длительные простои, вызванные потерей кворума в кластере |
|
Текущее количество обрабатываемых предложений для фиксации. Указывает сколько предложений поставлено в очередь для фиксации |
Prometheus |
шт |
gauge |
Рост количества ожидающих предложений предполагает, что существует большая клиентская нагрузка или участник не может принять предложения |
|
|
Текущий размер квоты внутреннего хранилища в Мб |
Prometheus |
Мб |
gauge |
|
||
Общее количество просмотренных индексов с ошибкой чтения |
Prometheus |
Не должно расти |
шт |
counter |
Чем меньше, тем лучше |
|
Общее количество медленных запросов на применение (вероятно перегруженных из-за медленного диска) |
Prometheus |
шт |
counter |
Чем меньше, тем лучше |
|
|
Общее количество ожидающих чтения индексов не синхронизированных с ведущими или просроченными запросами индекса чтения |
Prometheus |
шт |
counter |
Чем меньше, тем лучше |
|
|
1 - сервер применяет снепшот, 0 - нет |
Prometheus |
gauge |
|
|||
Задержка распространения файла |
Prometheus |
Не должно быть больше 600 сек |
с |
summary |
Слишком большая продолжительность snapshot указывает на проблемы с диском и может привести к нестабильности кластера |
|
Количество снепшот |
Prometheus |
шт |
counter |
|
||
Задержка распространения snapshot v3 |
Prometheus |
Не должно быть больше 600 сек |
с |
summary |
Слишком большая продолжительность snapshot указывает на проблемы с диском и может привести к нестабильности кластера |
|
Количество снепшот v3 |
Prometheus |
шт |
counter |
|
||
Задержка распространения |
Prometheus |
Не должно быть больше 600 сек |
c |
summary |
Слишком большая продолжительность snapshot указывает на проблемы с диском и может привести к нестабильности кластера |
|
Количество |
Prometheus |
шт |
counter |
|
||
Количество Мб, полученных от системы |
Prometheus |
Мб |
gauge |
|
||
Общее время, затраченное пользователем и системным процессором в секундах |
Prometheus |
Должно расти |
c |
counter |
Должно расти |
|
Максимальное количество открытых дескриптеров файлов |
Prometheus |
шт |
gauge |
Если |
|
|
Количество открытых дескриптеров файлов |
Prometheus |
шт |
gauge |
Если |
|
|
Размер резидентной памяти в Мб |
Prometheus |
Мб |
gauge |
|
||
Время начала процесса с эпохи unix в секундах |
Prometheus |
Должно расти |
с |
gauge |
Должно расти |
|
Размер виртуальной памяти в Мб |
Prometheus |
Мб |
gauge |
|
||
Максимальный объем доступной виртуальной памяти в Мб |
Prometheus |
Мб |
gauge |
|
||
Текущее количество обслуживаемых запросов |
Prometheus |
шт |
gauge |
|
Метрики EVTA#
Область действия метрики |
Описание |
Метрика |
MBEAN Name |
Путь в дереве метрик |
|---|---|---|---|---|
EVTA |
Количество перезапусков EVTA |
EvtaRetryCount |
reactive.stream.adapter:name=retry,type=meters count |
|
EVTA |
Количество остановок EVTA вследствие ошибки |
EvtaFailureCount |
reactive.stream.adapter:name=failure,type=meters count |
|
Producer |
Количество успешно отправленных сообщений |
EvtaProducerSendMessageSuccess |
reactive.stream.adapter:name=producerSendMessageSuccess,type=meters OneMinuteRate |
|
Producer |
Количество успешно отправленных сообщений |
EvtaProducerSendMessageSuccess |
reactive.stream.adapter:name=producerSendMessageSuccess,type=meters count |
|
Producer |
Количество сообщений, отправка которых завершилась с ошибкой |
EvtaProducerSendMessageErrorCount |
reactive.stream.adapter:name=producerSendMessageError,type=meters count |
|
Producer |
Время обработки сообщения при отправке |
EvtaProducerMessageProcessTime |
reactive.stream.adapter:name=messageProcessTime,type=timers OneMinuteRate |
|
Producer |
Среднее время обработки сообщения при отправке |
EvtaProducerMessageProcessTime |
reactive.stream.adapter:name=messageProcessTime,type=timers Mean |
|
Producer |
Время получения подтверждения отправки сообщения |
EvtaProducerMessageAcknowledgeTime |
reactive.stream.adapter:name=messageAcknowledgeTime,type=timers OneMinuteRate |
|
Producer |
Среднее время получения подтверждения отправки сообщения |
EvtaProducerMessageAcknowledgeTime |
reactive.stream.adapter:name=messageAcknowledgeTime,type=timers Mean |
|
Consumer |
Количество полученных сообщений |
EvtaConsumerReceiveMessages |
reactive.stream.adapter:name=messageAcknowledgeTime,type=timers OneMinuteRate |
|
Consumer |
Количество полученных сообщений |
EvtaConsumerReceiveMessages |
reactive.stream.adapter:name=messageAcknowledgeTime,type=timers Count |
|
Consumer |
Количество ошибок при приеме сообщений |
EvtaConsumerErrorsCount |
reactive.stream.adapter:name=consumerErrors,type=meters count |
|
Consumer |
Время обработки пачки принятых сообщений |
EvtaConsumerProcessBatch |
reactive.stream.adapter:name=consumerProcessBatch,type=timers OneMinuteRate |
|
Consumer |
Среднее время обработки пачки принятых сообщений |
EvtaConsumerProcessBatch |
reactive.stream.adapter:name=consumerProcessBatch,type=timers Mean |
|
Consumer |
Время между приемом сообщений и началом их отправки |
EvtaConsumerWaitDeliver |
reactive.stream.adapter:name=consumerWaitDeliver,type=timers OneMinuteRate |
|
Consumer |
Среднее время между приемом сообщений и началом их отправки |
EvtaConsumerWaitDeliver |
reactive.stream.adapter:name=consumerWaitDeliver,type=timers Mean |
|
Consumer |
Размер используемого буфера при вычитке из EVTD /SMBX /IBM MQ |
EvtaConsumerBufferSize |
reactive.stream.adapter:name=consumerBufferSize,type=gauges Value |
|
Producer |
Количество успешно отправленных сообщений через gRPC/REST |
EvtaEgressProducerSendMessageSuccess |
reactive.stream.adapter:name=egressProducerSendMessageSuccess,type=meters OneMinuteRate |
|
Producer |
Количество сообщений, отправка которых завершилась с ошибкой через gRPC/REST |
EvtaEgressProducerSendMessageError |
reactive.stream.adapter:name=egressProducerSendMessageError,type=meters OneMinuteRate |
|
Producer |
Время обработки сообщения при отправке через gRPC/REST |
EvtaEgressMessageProcessTime |
reactive.stream.adapter:name=egressMessageProcessTime,type=timers OneMinuteRate |
|
Producer |
Время получения подтверждения отправки сообщения через gRPC/REST |
EvtaEgressMessageAcknowledgeTime |
reactive.stream.adapter:name=egressMessageAcknowledgeTime,type=timers OneMinuteRate |
|
Producer |
Среднее время обработки сообщения при отправке через gRPC/REST |
EvtaEgressMeanMessageProcessTime |
reactive.stream.adapter:name=egressMeanMessageProcessTime,type=gauges Value |
|
Producer |
Среднее время получения подтверждения отправки сообщения через gRPC/REST |
EvtaEgressMeanMessageAcknowledgeTime |
reactive.stream.adapter:name=egressMeanMessageAcknowledgeTime,type=gauges Value |
|
Consumer |
Количество полученных сообщений, прошедших через gRPC/REST |
EvtaEgressConsumerReceiveMessagesOneMinuteRate |
reactive.stream.adapter:name=egressConsumerReceiveMessages,type=meters OneMinuteRate |
|
Consumer |
Количество ошибок при приеме сообщений через gRPC/REST |
EvtaEgressConsumerErrorsOneMinuteRate |
reactive.stream.adapter:name=egressConsumerErrors,type=meters OneMinuteRate |
|
Consumer |
Время обработки пачки принятых сообщений через gRPC/REST |
EvtaEgressConsumerProcessBatch |
reactive.stream.adapter:name=egressConsumerProcessBatch,type=timers OneMinuteRate |
|
Consumer |
Среднее время обработки пачки принятых сообщений через gRPC/REST |
EvtaEgressConsumerProcessBatch |
reactive.stream.adapter:name=egressConsumerProcessBatch,type=timers Mean |
|
Consumer |
Время между приемом сообщений и началом их отправки через gRPC/REST |
EvtaEgressConsumerWaitDeliver |
reactive.stream.adapter:name=egressConsumerWaitDeliver,type=timers OneMinuteRate |
|
Consumer |
Среднее время между приемом сообщений и началом их отправки через gRPC/REST |
EvtaEgressConsumerWaitDeliver |
reactive.stream.adapter:name=egressConsumerWaitDeliver,type=timers Mean |
|
Общие метрики EDMN и Коллекторов#
Категория |
Метрика |
Описание |
Источник |
Единица измерения |
MBEAN Name |
Путь в дереве метрик для EDMN |
Путь в дереве метрик для коллектора |
|---|---|---|---|---|---|---|---|
CPU |
ProcessCpuLoad |
Процент загрузки ЦП процессом коллектора/мониторинга |
JMX |
Мб |
java.lang:type=OperatingSystem |
|
|
CPU |
CpuLoad |
Общий процент загрузки ЦП хоста, на котором развернут коллектор/Мониторинг |
JMX |
Мб |
java.lang:type=OperatingSystem |
|
|
OS |
SystemCpuLoad |
Коэффициент для оценки текущего использования процессора |
JMX |
java.lang:type=OperatingSystem |
|
|
|
OS |
SystemLoadAverage |
Коэффициент для оценки общей загруженности системы, включая ожидание выполнения процессов CPU, дисковых и других процессов |
JMX |
java.lang:type=OperatingSystem |
|
|
|
Threads |
PeakThreadCount |
Пиковое количество потоков, которые существовали с момента старта JVM |
JMX |
шт |
java.lang:type=Threading |
|
|
Threads |
DaemonThreadCount |
Текущее количество фоновых потоков |
JMX |
шт |
java.lang:type=Threading |
|
|
Threads |
ThreadCount |
Текущее общее количество потоков, включая фоновые |
JMX |
шт |
java.lang:type=Threading |
|
|
Threads |
TotalStartedThreadCount |
Общее количество запущенных потоков с момента старта JVM |
JMX |
шт |
java.lang:type=Threading |
|
|
Heap |
HeapMemoryUsageCommited |
Количество памяти, выделенной для кучи в данный момент |
JMX |
Мб |
java.lang:type=Memory |
|
|
Heap |
HeapMemoryUsageInit |
Размер области памяти, выделенной для кучи при инициализации JVM |
JMX |
Мб |
java.lang:type=Memory |
|
|
Heap |
HeapMemoryUsageUsed |
Объем памяти, фактически используемый объектами приложения |
JMX |
Мб |
java.lang:type=Memory |
|
|
Heap |
NonHeapMemoryUsageCommited |
Объем памяти, выделенной JVM в non-heap области |
JMX |
Мб |
java.lang:type=Memory |
|
|
Heap |
NonHeapMemoryUsageUsed |
Объем памяти, используемый JVM в non-heap области |
JMX |
Мб |
java.lang:type=Memory |
|
|
Heap |
HeapMemoryUsagePercentage |
Процент использования памяти кучи |
JMX |
% |
java.lang:type=Memory |
|
|
Memory |
FreePhysicalMemorySize |
Размер свободной оперативной памяти хоста |
JMX |
Мб |
java.lang:type=OperatingSystem |
|
|
Memory |
TotalPhysicalMemorySize |
Общий размер оперативной памяти хоста |
JMX |
Мб |
java.lang:type=OperatingSystem |
|
|
Memory |
PhysicalMemeoryUsagePersentage |
Процент использования оперативной памяти приложением |
JMX |
% |
java.lang:type=OperatingSystem |
|
|
Метрики EDMN#
Метрика |
Описание |
Источник |
Единица измерения |
MBEAN Name |
Путь в дереве метрик |
|---|---|---|---|---|---|
MonitoringUptime |
Время жизни мониторинга |
JMX |
мс |
java.lang:type=Runtime Uptime |
|
Метрики Коллекторов#
Метрика |
Описание |
Единица измерения |
MBEAN Name |
Путь в дереве метрик |
|---|---|---|---|---|
IsAlive |
Liveness-проба Коллектора (значение должно изменяться) |
ru.sbt.fpss.monitoring.collector.component.input.ConfigInput |
|
|
Uptime |
Liveness-проба Коллектора (uptime с момента старта в мс) |
мс |
ru.sbt.fpss.monitoring.collector.component.input.ConfigInput |
|
Counter |
Liveness-проба Коллектора (счетчик с накопительным итогом) |
ru.sbt.fpss.monitoring.collector.component.input.ConfigInput |
|
|
JvmUpime |
Время с момента запуска JVM |
c |
java.lang:type=Runtime |
|
NumberOfInputMetrics |
Количество получаемых метрик |
шт |
ru.sbt.fpss.monitoring.collector:name=INPUT.* |
|
NumberOfOutputMetrics |
Количество отдаваемых метрик |
шт |
ru.sbt.fpss.monitoring.collector:name=OUTPUT.* |
|
TotalNumberOfInputMetrics |
Общее количество получаемых метрик |
шт |
ru.sbt.fpss.monitoring.collector:name=INPUT.TOTAL* |
|
TotalNumberOfOutputMetrics |
Общее количество отдаваемых метрик |
шт |
ru.sbt.fpss.monitoring.collector:name=OUTPUT.TOTAL* |
|
Метрики Prometheus#
Для получения метрик Prometheus, используется HttpInput в EDMN-коллекторе. Метрики Prometheus собираются с помощью REST - запроса GET /metrics.
Метрика |
Описание |
Единица измерения |
Путь в дереве метрик |
|---|---|---|---|
go_memstats_sys_bytes |
Количество байт, полученных из системы |
байт |
|
process_cpu_seconds_total |
Общее время, затраченное пользователем и системным процессором в секундах |
сек |
|
process_max_fds |
Максимальное количество открытых файловых дескрипторов |
шт |
|
process_open_fds |
Количество открытых файловых дескрипторов |
шт |
|
process_resident_memory_bytes |
Объем физической памяти, занятой процессом |
байт |
|
process_start_time_seconds |
Количество времени с момента старта процесса в секундах |
сек |
|
process_virtual_memory_bytes |
Количество виртуальной памяти, занятой процессом |
байт |
|
process_virtual_memory_max_bytes |
Максимальное количество виртуальной памяти, занятой процессом |
байт |
|
promhttp_metric_handler_requests_in_flight |
Текущее количество сканирований метрик |
шт |
|