Guía

Un trabajo que avisa

Todos los demás monitores miden desde fuera hacia dentro. Este espera a que lo llamen, porque un trabajo como la copia nocturna falla no ocurriendo, y el silencio es justo lo que una comprobación desde fuera no distingue de la salud.

Paso a paso

  1. Ve a Monitorización web y pulsa + Nuevo monitor, el mismo sitio por el que entra una web.
  2. En Qué vigilar, elige Un trabajo que avisa. Con eso desaparecen la URL, los puntos de presencia y las confirmaciones: no sale nada nuestro hacia ningún sitio, y hay un solo testigo, el propio trabajo.
  3. Nombre: el del trabajo, no el de la máquina donde corre. Copia nocturna es lo que quieres leer a las tres de la mañana.
  4. Se ejecuta cada es la periodicidad que promete el trabajo: 24h si es nocturno, 1h si es cada hora. Durante es el margen de más: cuánto más tarde de lo habitual puede terminar antes de que digamos nada. Se llega tarde con la suma de los dos, nunca con la periodicidad sola, así que un trabajo que empieza a las 02:00 y de vez en cuando tarda veinte minutos más es 24h y 1h.
  5. Pulsa Crear monitor. El reloj arranca ahí y no con la primera llamada: desde ese momento el trabajo tiene una periodicidad más su margen para avisar.
  6. Abre el monitor y pulsa Editar. La URL de aviso está en el formulario con un botón que la copia — esa es la que se pega, no la de aquí abajo.

Lo que copias

La dirección a la que llama el trabajo
https://api.hopmango.com/v1/hb/hmhb_...

La tuya lleva tu propio token, que empieza por hmhb_. Valen GET y POST, y las dos responden un 204 vacío, así que el código de salida de un trabajo nunca depende de interpretar una respuesta; y no hay clave ni cabecera: una línea de crontab o un paso de CI no deberían llevar encima una clave de API. El token es una capacidad, no una contraseña — dice una sola frase sobre un solo monitor y no puede leer nada — y si se filtra, una llamada a la API o a MCP genera otro y la dirección antigua deja de responder en ese instante.

Una línea al final del trabajo. -fsS mantiene a curl callado salvo que falle, -m 10 evita que una llamada lenta retenga el trabajo, y el && es lo importante: el aviso solo sale si el trabajo terminó bien.

0 3 * * * /opt/backup.sh && curl -fsS -m 10 https://api.hopmango.com/v1/hb/hmhb_...

Y para un trabajo que sabe que ha fallado. fail abre el incidente en el acto, sin esperar el margen: esa ventana existe para distinguir el silencio de un mal minuto, y un trabajo que dice que ha fallado no es ninguna de las dos cosas. message va a la cronología del incidente como texto y no se interpreta nunca: ni se analiza, ni se compara con nada, ni se convierte en una severidad. Quinientos caracteres, que son una frase y no una traza. La siguiente llamada correcta lo resuelve.

/opt/backup.sh || curl -fsS -m 10 -X POST \
  -H "Content-Type: application/json" \
  -d '{"status":"fail","message":"backup exited non-zero"}' \
  https://api.hopmango.com/v1/hb/hmhb_...

Cuando deja de llamar

Pasados Se ejecuta cada más Durante, el monitor tiene una ejecución fallida, y una llamada que no llegó abre exactamente el mismo incidente que una web rota: la misma severidad, los mismos canales, la misma escalada, la misma cronología. Tus políticas de aviso ya lo encaminan, y el aviso dice de qué tipo de monitor viene, así que la copia nocturna puede ir a un sitio distinto que la tienda.

Un trabajo que ha dejado de llamar produce una ejecución fallida por periodicidad, no una por minuto: uno que prometía llamar a diario es un fallo al día, que es la cadencia con la que se calcula su disponibilidad. La siguiente llamada resuelve el incidente. Y si marcaste Mostrar en la página de estado pública, sale ahí como cualquier otro monitor: su nombre, su estado y su disponibilidad, nunca la dirección a la que se le llama.

Lo que más se falla

Avisar al principio del trabajo en vez de al final. Una copia que llama nada más despertarse está diciendo «he empezado», y un script que empieza todas las noches y falla todas las noches se queda en verde para siempre. Pon la llamada después del trabajo y encadénala con &&, para que un fallo no llegue nunca hasta ella. La otra mitad del mismo error es dejar el margen en nada: un trabajo que suele acabar a las 02:05 y alguna vez a las 02:40 despierta a alguien por ir lento, que es el aviso que la gente deja de creerse a la tercera.

Por dónde seguir

Y después, adónde va ese incidente y a quién se despierta si no lo coge nadie.