Saltar al contenido principal

Alarmas, alertas y notificaciones

NetMonitor administra de forma centralizada los eventos operativos que afectan o pueden afectar la disponibilidad, el rendimiento y la operación de los activos monitoreados. Los eventos se organizan en tres grupos:

Objetivo del módulo

Que cada evento detectado por NetMonitor pueda ser registrado, clasificado, notificado, tratado y documentado de forma trazable, sin importar su origen ni severidad.

Capacidades principales del módulo:

  • Detectar condiciones de indisponibilidad en activos de red y servicios críticos
  • Identificar comportamientos anómalos o fuera del umbral configurado
  • Registrar eventos auxiliares útiles para troubleshooting
  • Notificar a los grupos operativos mediante múltiples canales
  • Integrarse con plataformas externas de gestión de incidentes (ITSM)
  • Mantener historial de eventos por activo, emplazamiento, regla o severidad
  • Documentar el tratamiento operativo mediante notas y artículos asociados
  • Confirmar lectura y asignar responsabilidad sobre una alarma o alerta
  • Ejecutar acciones adicionales automáticas sobre activos críticos

Alarma

Las alarmas están orientadas principalmente al personal de operación y mantenimiento. Una alarma se activa cuando NetMonitor detecta una condición que puede afectar la disponibilidad de uno o más activos monitoreados.

El objetivo principal de una alarma es minimizar el downtime.

Ejemplos de condiciones que generan una alarma:

  • Caída de un activo de red
  • Indisponibilidad de un enlace WAN
  • Caída de un enlace de Internet
  • Estado operativo down en una interfaz física
  • Falla de alimentación eléctrica
  • Indisponibilidad de un servicio crítico (DNS, SIP)
  • Ausencia de energía en un nodo o sitio
  • Interrupción de un servicio necesario para la operación

[Imagen sugerida: ejemplo de una alarma activa en el Gestor de Alarmas]


Alerta

Las alertas están orientadas a personal técnico con capacidad de análisis: perfiles de soporte L2, ingeniería u operación avanzada. Una alerta se emite cuando el motor de análisis determina que una variable monitoreada no se comporta de acuerdo con lo esperado.

A diferencia de una alarma, una alerta no necesariamente indica indisponibilidad inmediata. Puede representar una condición temprana de degradación, saturación o comportamiento anómalo.

El objetivo de una alerta es identificar tempranamente condiciones no deseadas antes de que se transformen en una interrupción de servicio.

Ejemplos de condiciones que generan una alerta:

  • CPU por encima de un umbral configurado
  • Uso elevado de memoria o bajo espacio en disco
  • Tráfico anómalo en una interfaz
  • Comportamiento fuera del patrón habitual
  • Servicio degradado sin indisponibilidad total
  • Elevado nivel de sesiones en un firewall
  • Incremento inusual de errores o descartes
  • Métrica de rendimiento fuera del comportamiento esperado

[Imagen sugerida: ejemplo de alerta por umbral de CPU o memoria]


Notificación / Evento auxiliar

Las notificaciones o eventos auxiliares son registros que aportan información útil para el análisis operativo y el troubleshooting. No todos implican una alarma o alerta inmediata, pero pueden ser relevantes para reconstruir una línea de tiempo o identificar una causa raíz.

Fuentes de origen:

  • TRAPs SNMP recibidos desde activos
  • Mensajes syslog
  • Eventos de OpenTelemetry
  • Cambios de estado informados por activos
  • Eventos complementarios emitidos por sistemas integrados
Ejemplo

Un TRAP de cambio de configuración en un switch puede no afectar la disponibilidad en ese momento, pero puede ser clave para explicar una caída posterior de conectividad.


Diferencia entre alarma, alerta y notificación

info

Esta clasificación ayuda a ordenar la operación diaria y evita que eventos informativos tengan el mismo tratamiento que una caída real de servicio.

Tipo de eventoOrientado aCuándo se generaObjetivo principal
AlarmaOperación y mantenimientoCuando puede verse afectada la disponibilidad de un activoReducir el tiempo de inactividad (downtime)
AlertaSoporte técnico / L2 / IngenieríaCuando una variable se aparta del comportamiento esperadoDetectar condiciones no deseadas tempranamente
NotificaciónOperación, soporte y troubleshootingCuando se recibe información útil desde activos o sistemas integradosAportar contexto para análisis operativo

Referencia cruzada