Visor de Incidentes, buenas prácticas y puesta en marcha
Visor de Incidentes
El Visor de Incidentes permite observar la relación entre eventos detectados por NetMonitor y plataformas externas de gestión de incidentes.
Información disponible por incidente:
- Plataforma externa asociada
- Ticket ID
- Activos afectados
- Estado del incidente
- Marca de tiempo
- Evolución del incidente
Workflow típico de incidentes
- Detección — Evento detectado por NetMonitor y creación de ticket externo.
- Confirmación — Confirmación del ticket ID y actualización con información del evento.
- Toma de caso — Confirmación de lectura por operador y actualización del ticket con responsable asignado.
- Normalización — Normalización del evento y actualización del ticket como completado, cancelado o pendiente.
- Cierre — Cierre definitivo desde la plataforma externa por el responsable operativo.
Recomendación
En muchos casos es recomendable que NetMonitor no cierre automáticamente los tickets externos, sino que actualice el estado para que un responsable operativo realice el cierre dentro de la plataforma correspondiente.
[Imagen sugerida: visor de incidentes con ticket externo asociado]
Buenas prácticas
Reglas de notificación
- Crear reglas específicas, no excesivamente amplias
- Usar severidad, categoría y grupo como criterios principales
- Separar eventos informativos de eventos críticos
- Definir canales por equipo operativo
- Configurar rangos horarios cuando corresponda
- Usar canales distintos para horario laboral y guardia
- Probar cada canal antes de asociarlo a reglas críticas
- Evitar duplicidad innecesaria de notificaciones
- Documentar el propósito de cada regla
Canales
- Crear canales por función operativa
- Evitar canales genéricos que reciban todos los eventos
- Usar nombres claros y descriptivos
- Probar el canal luego de cada modificación
- Separar canales de horario laboral y guardia
- Usar Teams o Telegram para eventos que requieren reacción rápida
- Usar correo para reportes o eventos de menor urgencia
- Revisar periódicamente destinatarios obsoletos
Alarmas
- Priorizar eventos de disponibilidad
- Confirmar lectura cuando un operador toma el caso
- Usar notas para documentar causa y resolución
- Revisar activos relacionados antes de escalar
- Validar si existe causa raíz común
- Evitar tratar síntomas independientes si comparten causa
- Verificar si el evento tiene ticket externo asociado
- Registrar acciones realizadas
Alertas
- Analizar tendencia antes de escalar
- Validar si el umbral está correctamente configurado
- Revisar si el comportamiento es recurrente
- Identificar horarios de mayor carga
- Ajustar umbrales cuando existan falsos positivos
- Priorizar alertas que puedan transformarse en indisponibilidad
- Revisar capacidad cuando existan alertas recurrentes
- Utilizar la información para planificación de capacidad
TRAPs
- Limitar el envío de TRAPs innecesarios en los activos
- Configurar solo los OIDs relevantes para operación
- Ajustar la severidad según impacto real
- Personalizar descripciones para que sean comprensibles
- Utilizar absorción para eventos repetitivos
- Guardar manualmente los eventos relevantes
- Clasificar como críticos solo los que requieren prioridad
- Revisar periódicamente los TRAPs más frecuentes
Uso operativo recomendado
Flujo de trabajo diario para equipos de operación y supervisión:
- Revisar diariamente el Gestor de Alarmas
- Priorizar eventos críticos o de disponibilidad
- Confirmar lectura de los eventos tomados
- Verificar activos y emplazamientos afectados
- Consultar historial y eventos similares
- Analizar si existe causa raíz identificable
- Adjuntar notas cuando el evento requiera documentación
- Actualizar o revisar tickets externos asociados
- Verificar normalización del evento
- Revisar recurrencias para detectar problemas repetitivos
- Ajustar reglas o canales si se detectan desvíos operativos
- Revisar periódicamente TRAPs frecuentes
Casos de uso frecuentes
Caída de activo de red
- NetMonitor detecta que el activo no responde
- Se activa una alarma de disponibilidad con ID único
- Se notifica al canal correspondiente
- El operador confirma lectura y revisa activos relacionados
- Se documenta el tratamiento mediante notas
- El evento se normaliza cuando el activo vuelve a responder
- Se registra el cierre o actualización del incidente
CPU alta en firewall
- NetMonitor detecta CPU por encima del umbral configurado
- Se emite una alerta y se notifica al equipo técnico
- El operador revisa tráfico, sesiones y reglas del firewall
- Se documenta el análisis en una nota
- Si el evento se repite, se evalúa capacity planning o ajuste de configuración
Corte de energía en sitio
- NetMonitor detecta falla de alimentación eléctrica
- Se activa una alarma y se notifica al grupo de mantenimiento
- Si el activo es crítico, se ejecuta una acción adicional
- Se puede abrir un ticket externo automáticamente
- Se realiza seguimiento hasta normalización
- Se documenta el evento con causa y acciones tomadas
TRAP de cambio de configuración
- Un activo envía un TRAP SNMP ante un cambio de configuración
- NetMonitor registra el evento e identifica el OID
- Se muestra descripción desde MIB o configuración local
- Según severidad, el evento puede requerir tratamiento
- El operador puede marcarlo como leído o guardarlo
- Si el cambio se relaciona con un incidente, se documenta en una nota
Evento recurrente en un mismo sitio
- El operador detecta repetición de alarmas en el mismo emplazamiento
- Consulta estadísticas y eventos similares con filtro por emplazamiento
- Revisa notas anteriores relacionadas
- Identifica patrón horario o causa común
- Documenta hallazgos y propone acción correctiva
Puesta en marcha recomendada
Checklist para configurar el módulo de Notificaciones en una nueva implementación:
- Revisar activos cargados en Asset Manager
- Definir SLA por tipo de activo
- Marcar activos críticos
- Revisar interfaces declaradas como enlaces
- Definir grupos operativos
- Crear canales de notificación
- Probar cada canal de notificación
- Crear reglas iniciales de notificación
- Validar severidades configuradas
- Revisar firmas activas
- Ajustar umbrales según operación real
- Habilitar recordatorios donde corresponda
- Definir responsables de supervisión
- Documentar procedimientos de tratamiento
- Revisar resultados durante los primeros días de operación