Recolección de datos, polling time y SLA
NetMonitor obtiene información de los activos monitoreados mediante ciclos de recolección periódicos. Entender cómo funciona este ciclo, qué determina cuándo un activo se declara inalcanzable y cómo se calculan los indicadores de disponibilidad es fundamental para interpretar correctamente el comportamiento de la plataforma.
Polling time
El polling time es el intervalo de tiempo entre ciclos de recolección de datos. Define con qué frecuencia el NetCollector consulta el estado de cada activo monitoreado.
Valor estándar
El polling time estándar de NetMonitor es de 10 minutos.
Esto significa que cada 10 minutos el NetCollector consulta el estado de los activos asignados: verifica su conectividad mediante ICMP y recolecta métricas mediante SNMP u otros protocolos configurados.
El polling time de 10 minutos implica un retardo potencial de hasta un ciclo completo entre el momento en que ocurre una falla y el momento en que NetMonitor la detecta. Si un activo queda inalcanzable en el segundo 1 después de un ciclo de polling, NetMonitor lo detectará en el ciclo siguiente, aproximadamente 10 minutos después.
Este comportamiento es esperado y normal en la configuración estándar. Para activos con requerimientos de detección más rápida, existe la configuración de SLA = 100% descrita más adelante en esta misma página.
Declaración de inalcanzabilidad
Antes de declarar que un activo está inalcanzable, NetMonitor realiza tres intentos de comunicación dentro del mismo ciclo de polling.
Este mecanismo previene falsos positivos generados por pérdidas de paquetes transitorias o latencias elevadas puntuales en la red:
- Primer intento: el colector envía un paquete ICMP y espera respuesta.
- Segundo intento: si no hay respuesta, se realiza un segundo intento.
- Tercer intento: si tampoco hay respuesta, se realiza un tercer y último intento.
Solo si los tres intentos fallan, el activo es considerado inalcanzable en ese ciclo y NetMonitor registra el resultado como no disponible.
Dado que los tres intentos ocurren dentro del mismo ciclo de polling, el retardo de detección no se multiplica por tres. El retardo máximo de detección es de aproximadamente un polling time (10 minutos en configuración estándar), independientemente de los tres intentos.
[Imagen sugerida: diagrama de línea de tiempo mostrando el ciclo de polling, los tres intentos y el registro de resultado]
SLI — Indicador de nivel de servicio
El SLI (Service Level Indicator) es el indicador calculado por NetMonitor para representar la disponibilidad observada de un activo en un período determinado.
Cómo se calcula
El SLI se calcula a partir de los resultados de las evaluaciones de conectividad (ciclos de polling ICMP). En cada ciclo, el resultado puede ser:
- Disponible: el activo respondió al menos uno de los tres intentos.
- No disponible: el activo no respondió a ninguno de los tres intentos.
El SLI se expresa como un porcentaje de ciclos exitosos sobre el total de ciclos evaluados en un período:
SLI = (Ciclos con resultado disponible / Total de ciclos evaluados) × 100
Escala del SLI
El SLI se expresa en una escala de 0 a 100:
| SLI | Interpretación |
|---|---|
| 100 | El activo respondió en el 100% de los ciclos evaluados |
| 98 | El activo estuvo disponible en el 98% de los ciclos (equivale al SLA por defecto) |
| 95 | El activo tuvo un 5% de ciclos con resultado de no disponible |
| 0 | El activo no respondió en ningún ciclo del período evaluado |
El SLI calculado es directamente comparable con el SLA configurado en el Asset Manager para ese activo. Cuando el SLI cae por debajo del SLA, es una señal de que el activo está teniendo problemas de disponibilidad que superan el nivel de tolerancia definido.
SLA — Nivel de servicio configurado
El SLA (Service Level Agreement) configurado en el Asset Manager es el nivel de disponibilidad esperado para ese activo, expresado como porcentaje. No es un acuerdo contractual con un proveedor externo: es el parámetro interno que le indica a NetMonitor qué nivel de disponibilidad se considera aceptable para ese activo en particular.
El SLA es un parámetro de configuración que determina directamente el comportamiento del motor de análisis: qué tipo de eventos puede generar el activo, con qué frecuencia se evalúa su conectividad y qué nivel de tolerancia tiene ante ciclos fallidos.
SLA por defecto
El valor de SLA por defecto en NetMonitor es 98%.
Comportamiento según SLA configurado
SLA = 0%
Un activo con SLA configurado en 0% no genera alarmas por pérdida de conectividad.
Este valor es útil para activos que NetMonitor debe monitorear para recolectar datos (métricas, TRAPs, logs) pero que no tienen un requerimiento de disponibilidad formal: activos de referencia, equipos de laboratorio, dispositivos no críticos o activos en observación.
NetMonitor sigue recolectando datos de estos activos según el polling time estándar, pero las caídas de conectividad no generan alarmas ni notificaciones.
Usar SLA = 0% en activos que no deberían generar ruido operativo pero cuya información métrica sí es relevante. Por ejemplo: equipos de backup, activos en proceso de comisionado, o dispositivos cuya disponibilidad depende de factores externos no controlados por el equipo de operaciones.
SLA entre 0% y 100%
Un activo con SLA configurado entre 0% y 100% (excluyendo ambos extremos) puede generar alarmas por pérdida de conectividad cuando la disponibilidad observada cae por debajo del valor configurado.
El motor de análisis evalúa la cantidad de muestras fallidas y determina si la condición supera el umbral de tolerancia implícito en el SLA. No necesariamente cada ciclo fallido genera una alarma: el sistema evalúa el comportamiento en el contexto del SLA configurado.
Este modo cubre la gran mayoría de los activos de producción: routers, switches, servidores, firewalls, access points y cualquier otro componente cuya disponibilidad sea relevante pero que pueda tolerar ocasionalmente un ciclo fallido sin generar un evento mayor.
SLA = 100%
Un activo con SLA configurado en 100% recibe un tratamiento especial: NetMonitor realiza evaluaciones ICMP con una frecuencia significativamente mayor a la del polling estándar, logrando una detección de fallas cercana al tiempo real.
Este modo está diseñado para activos de altísima criticidad donde cualquier interrupción, por breve que sea, debe ser detectada y notificada de inmediato:
- Firewalls perimetrales de producción
- Routers de borde con SLA contractual con el ISP
- Switches core de un data center
- Servidores de autenticación o DNS críticos
- Equipos de comunicaciones en operación 24/7
La evaluación frecuente de activos con SLA = 100% consume más recursos del NetCollector y genera mayor tráfico de polling en la red. Se recomienda reservar esta configuración para los activos verdaderamente críticos y no aplicarla de forma masiva a toda la infraestructura.
Si se aplica SLA = 100% a un gran número de activos simultáneamente, puede degradarse el rendimiento del colector y aumentar innecesariamente el tráfico de red de monitoreo.
Resumen de comportamiento según SLA
| SLA configurado | Alarmas por disponibilidad | Frecuencia de evaluación ICMP |
|---|---|---|
| 0% | No genera alarmas | Estándar (polling time) |
| > 0% y < 100% | Genera alarmas según tolerancia implícita | Estándar (polling time) |
| 100% | Genera alarmas ante cualquier interrupción | Alta frecuencia (cercana a tiempo real) |
ICMP y SNMP: métricas independientes
Es importante distinguir que NetMonitor realiza dos tipos de verificación sobre los activos, que operan de forma independiente:
Verificación ICMP (conectividad)
Verifica si el activo está encendido y responde en la red. El resultado de esta verificación determina el SLI del activo y es la base para las alarmas de disponibilidad.
Recolección SNMP (métricas y estado)
Recolecta métricas de rendimiento (CPU, memoria, tráfico, errores) y estado de interfaces mediante el protocolo SNMP. Esta recolección opera sobre el polling time estándar, independientemente de la configuración de SLA.
Escenarios posibles
| Resultado ICMP | Resultado SNMP | Interpretación |
|---|---|---|
| Responde | Responde | Activo disponible y respondiendo correctamente |
| Responde | No responde | El dispositivo está en red pero el agente SNMP no responde (posible problema de credenciales, agente caído o interfaz de gestión bloqueada) |
| No responde | No responde | Activo inaccesible desde el colector (apagado, sin red, firewall bloqueando) |
| No responde | Responde | Escenario teóricamente poco probable; podría indicar una ruta asimétrica o un filtrado selectivo de ICMP |
Un activo que no responde a ICMP pero sí a SNMP es un caso inusual que puede indicar un problema de configuración de red o de filtrado de protocolos. Este comportamiento debe investigarse para garantizar que el SLI calculado refleje correctamente la disponibilidad real del activo.
Relación entre polling time, SLI y SLA
El siguiente ejemplo ilustra cómo se relacionan estos conceptos en un período de 24 horas con polling time estándar de 10 minutos:
- Total de ciclos en 24 horas: 144 ciclos (24 × 60 / 10)
- Activo con 3 ciclos fallidos: SLI = 141/144 × 100 ≈ 97.9%
- SLA configurado: 98% → El SLI de 97.9% está por debajo del SLA. NetMonitor puede reportar esto en el análisis de disponibilidad del activo.
Este cálculo muestra que incluso una interrupción breve (30 minutos en el caso de 3 ciclos de 10 minutos) puede impactar el SLI diario de un activo con SLA de 98%.