Guía rápida para operadores NOC
Esta guía resume las acciones clave que un operador NOC debe conocer para trabajar eficientemente con NetMonitor. Está diseñada para ser una referencia rápida durante la operación, no un tutorial completo.
Rutina de inicio de turno
Al comenzar un turno, el operador NOC debería realizar las siguientes verificaciones en orden:
1. Revisar el panel Estado General
El panel Estado General muestra la grilla de todos los activos monitoreados con su estado actual. En un vistazo, el operador puede identificar:
- Activos en alarma (rojo): requieren atención inmediata.
- Activos con alerta (amarillo/naranja): requieren seguimiento.
- Activos en estado desconocido (gris): pueden requerir verificación de configuración.
Usar los filtros del panel para concentrarse en activos críticos o en emplazamientos específicos si la infraestructura es grande.
2. Revisar el Gestor de Alarmas
Abrir el Gestor de Alarmas y verificar:
- ¿Hay alarmas activas no reconocidas del turno anterior?
- ¿Hay alarmas que llevan demasiado tiempo abiertas sin resolución?
- ¿Hay patrones de recurrencia (mismos activos que alarman repetidamente)?
Tomar nota de las alarmas que el turno anterior dejó abiertas y verificar si hay novedades.
3. Verificar el estado de los mapas topológicos
Abrir el mapa topológico principal y verificar que el estado visual coincide con lo que muestra el Gestor de Alarmas. Si hay discrepancias, puede haber un retraso en la actualización del mapa o un problema de visualización.
Tratamiento de una alarma
Cuando se recibe una notificación de alarma o se detecta una alarma en el Gestor de Alarmas:
Paso 1: Evaluar la alarma
Antes de actuar:
- ¿Qué activo está en alarma y cuál es su criticidad?
- ¿Cuándo comenzó la alarma?
- ¿Hay más activos en alarma relacionados (misma sucursal, mismo upstream)?
Paso 2: Diagnóstico rápido en NetMonitor
Sin salir de NetMonitor:
- Navegar al activo en alarma → pestaña Chassis → disponibilidad de las últimas 24 horas.
- Verificar la pestaña Asociaciones → ¿hay un upstream que también esté en alarma?
- Si el activo es un switch: pestaña Interfaces → ¿alguna interfaz upstream está Down?
- Usar el Buscador si necesita localizar el activo o un dispositivo relacionado.
Paso 3: Reconocer la alarma
Reconocer la alarma en el Gestor de Alarmas para que el equipo sepa que alguien está trabajando en ella. El reconocimiento detiene los recordatorios de notificación (según la configuración).
Paso 4: Documentar en notas
Si el diagnóstico toma más de unos minutos o implica acción de campo, agregar una nota al activo o al incidente indicando:
- Qué se verificó.
- Qué se encontró.
- Qué acciones se tomaron o se están tomando.
Paso 5: Escalar si corresponde
Ver criterios de escalamiento en la sección siguiente.
Criterios de escalamiento
| Situación | Acción |
|---|---|
| El activo está caído y no hay upstream en alarma que lo justifique | Escalar al equipo de infraestructura o networking |
| Múltiples activos caídos en el mismo sitio | Posible problema de energía o WAN. Escalar con prioridad |
| El activo responde pero tiene anomalías en Chassis (temperatura, CPU muy alta) | Escalar al responsable del activo o equipo de IT |
| Un enlace WAN está caído y el ISP es el probable responsable | Abrir ticket con el proveedor y escalar internamente |
| La alarma no se resuelve en el tiempo máximo definido por el SLA del cliente | Escalar según procedimiento de escalamiento del cliente |
Tormenta de alarmas
Una tormenta de alarmas es cuando múltiples activos generan alarmas simultáneamente. Puede ser abrumadora si no se tiene un proceso claro.
Protocolo ante tormenta de alarmas
- No tratar cada alarma individualmente. Primero, buscar el patrón.
- Identificar la causa raíz: ¿hay un activo central (gateway, switch core, router WAN) en alarma que pueda explicar todas las demás?
- Usar el mapa topológico para visualizar el alcance del problema. Los activos downstream de un activo caído deberían estar marcados como afectados.
- Concentrarse en la causa raíz y trabajar en su resolución. Las alarmas downstream se cerrarán cuando la causa raíz se resuelva.
- Comunicar el estado al equipo y a los stakeholders correspondientes: "Estamos en tormenta de alarmas por caída del core switch X. En investigación."
Comandos rápidos y atajos de NetMonitor
| Acción | Cómo hacerlo |
|---|---|
| Localizar un activo por IP | Buscador → ingresar IP |
| Localizar un dispositivo por MAC | Buscador → ingresar MAC |
| Ver las alarmas activas | Menú principal → Gestor de Alarmas |
| Ver el estado de un enlace WAN | Menú → Gestión de Enlaces → filtrar por tipo WAN |
| Ver la topología del sitio afectado | Menú → Topología → seleccionar mapa del sitio |
| Ver la disponibilidad histórica de un activo | Vista del activo → pestaña Chassis → disponibilidad histórica |