Saltar al contenido principal

Guía rápida para operadores NOC

Esta guía resume las acciones clave que un operador NOC debe conocer para trabajar eficientemente con NetMonitor. Está diseñada para ser una referencia rápida durante la operación, no un tutorial completo.


Rutina de inicio de turno

Al comenzar un turno, el operador NOC debería realizar las siguientes verificaciones en orden:

1. Revisar el panel Estado General

El panel Estado General muestra la grilla de todos los activos monitoreados con su estado actual. En un vistazo, el operador puede identificar:

  • Activos en alarma (rojo): requieren atención inmediata.
  • Activos con alerta (amarillo/naranja): requieren seguimiento.
  • Activos en estado desconocido (gris): pueden requerir verificación de configuración.

Usar los filtros del panel para concentrarse en activos críticos o en emplazamientos específicos si la infraestructura es grande.

2. Revisar el Gestor de Alarmas

Abrir el Gestor de Alarmas y verificar:

  • ¿Hay alarmas activas no reconocidas del turno anterior?
  • ¿Hay alarmas que llevan demasiado tiempo abiertas sin resolución?
  • ¿Hay patrones de recurrencia (mismos activos que alarman repetidamente)?

Tomar nota de las alarmas que el turno anterior dejó abiertas y verificar si hay novedades.

3. Verificar el estado de los mapas topológicos

Abrir el mapa topológico principal y verificar que el estado visual coincide con lo que muestra el Gestor de Alarmas. Si hay discrepancias, puede haber un retraso en la actualización del mapa o un problema de visualización.


Tratamiento de una alarma

Cuando se recibe una notificación de alarma o se detecta una alarma en el Gestor de Alarmas:

Paso 1: Evaluar la alarma

Antes de actuar:

  • ¿Qué activo está en alarma y cuál es su criticidad?
  • ¿Cuándo comenzó la alarma?
  • ¿Hay más activos en alarma relacionados (misma sucursal, mismo upstream)?

Paso 2: Diagnóstico rápido en NetMonitor

Sin salir de NetMonitor:

  1. Navegar al activo en alarma → pestaña Chassis → disponibilidad de las últimas 24 horas.
  2. Verificar la pestaña Asociaciones → ¿hay un upstream que también esté en alarma?
  3. Si el activo es un switch: pestaña Interfaces → ¿alguna interfaz upstream está Down?
  4. Usar el Buscador si necesita localizar el activo o un dispositivo relacionado.

Paso 3: Reconocer la alarma

Reconocer la alarma en el Gestor de Alarmas para que el equipo sepa que alguien está trabajando en ella. El reconocimiento detiene los recordatorios de notificación (según la configuración).

Paso 4: Documentar en notas

Si el diagnóstico toma más de unos minutos o implica acción de campo, agregar una nota al activo o al incidente indicando:

  • Qué se verificó.
  • Qué se encontró.
  • Qué acciones se tomaron o se están tomando.

Paso 5: Escalar si corresponde

Ver criterios de escalamiento en la sección siguiente.


Criterios de escalamiento

SituaciónAcción
El activo está caído y no hay upstream en alarma que lo justifiqueEscalar al equipo de infraestructura o networking
Múltiples activos caídos en el mismo sitioPosible problema de energía o WAN. Escalar con prioridad
El activo responde pero tiene anomalías en Chassis (temperatura, CPU muy alta)Escalar al responsable del activo o equipo de IT
Un enlace WAN está caído y el ISP es el probable responsableAbrir ticket con el proveedor y escalar internamente
La alarma no se resuelve en el tiempo máximo definido por el SLA del clienteEscalar según procedimiento de escalamiento del cliente

Tormenta de alarmas

Una tormenta de alarmas es cuando múltiples activos generan alarmas simultáneamente. Puede ser abrumadora si no se tiene un proceso claro.

Protocolo ante tormenta de alarmas

  1. No tratar cada alarma individualmente. Primero, buscar el patrón.
  2. Identificar la causa raíz: ¿hay un activo central (gateway, switch core, router WAN) en alarma que pueda explicar todas las demás?
  3. Usar el mapa topológico para visualizar el alcance del problema. Los activos downstream de un activo caído deberían estar marcados como afectados.
  4. Concentrarse en la causa raíz y trabajar en su resolución. Las alarmas downstream se cerrarán cuando la causa raíz se resuelva.
  5. Comunicar el estado al equipo y a los stakeholders correspondientes: "Estamos en tormenta de alarmas por caída del core switch X. En investigación."

Comandos rápidos y atajos de NetMonitor

AcciónCómo hacerlo
Localizar un activo por IPBuscador → ingresar IP
Localizar un dispositivo por MACBuscador → ingresar MAC
Ver las alarmas activasMenú principal → Gestor de Alarmas
Ver el estado de un enlace WANMenú → Gestión de Enlaces → filtrar por tipo WAN
Ver la topología del sitio afectadoMenú → Topología → seleccionar mapa del sitio
Ver la disponibilidad histórica de un activoVista del activo → pestaña Chassis → disponibilidad histórica

Próximos pasos