Watchflare docs
Sur cette page

Règles d'alerte et notifications

Seuils d'alerte par hôte : CPU, mémoire, disque, charge, température. Défauts globaux et fenêtre de durée pour filtrer les pics brefs.

Watchflare prévient quand une métrique dépasse un seuil, ou quand une machine passe hors ligne. Les alertes sont évaluées toutes les 30 secondes, et se règlent par hôte. Les notifications partent à l’adresse de Settings → Notifications (par défaut, l’e-mail du premier compte) et vers tous les canaux que vous avez ajoutés.

Le trio alertes / incidents / notifications est détaillé dans Alertes et notifications.

Remarque

L’e-mail exige un SMTP configuré. Voir Notifications e-mail.

Remarque

Discord, Slack, Telegram, Matrix, Ntfy, Gotify, SMTP, HTTP : tout se règle sur Settings > Notifications. Voir Canaux de notification.


Types d’alertes

TypeDescriptionUnité
host_downAucun heartbeat depuis plus de 15 secondesAucune
cpu_usageUsage CPU au-dessus du seuil%
memory_usageUsage mémoire au-dessus du seuil%
disk_usageUsage disque au-dessus du seuil%
load_avgCharge moyenne 1 min au-dessus du seuilAucune
load_avg_5Charge moyenne 5 min au-dessus du seuilAucune
load_avg_15Charge moyenne 15 min au-dessus du seuilAucune
temperatureTempérature CPU au-dessus du seuil°C

Configurer les alertes

Défauts globaux

Dans Settings → Alerts, posez les seuils par défaut. Ils s’appliquent à tous les hôtes, et à chaque nouvel hôte.

Par hôte

  1. Ouvrez la page de détail d’un hôte.
  2. Onglet Alerts.
  3. Activez les types voulus et réglez le seuil pour cette machine.
  4. C’est enregistré tout de suite, sans confirmation.

Les règles par hôte priment. Un serveur de base peut avoir un seuil CPU plus haut qu’une machine statique peu chargée.


Fenêtre de durée

Chaque règle a une durée (5 minutes par défaut). Le seuil doit rester dépassé pendant toute cette fenêtre avant qu’un incident s’ouvre et qu’une notification parte. Un pic de quelques secondes ne suffit pas.

Si la métrique redescend avant la fin, rien ne part.


Incidents

Quand le dépassement tient toute la durée, le Hub ouvre un incident :

  1. Une notification à l’ouverture (seuil franchi).
  2. Une seconde à la résolution (sous le seuil, ou machine de retour).

L’onglet Alerts de chaque hôte liste les incidents : début, fin, seuil, et valeur qui a déclenché.


Machine hors ligne

host_down part quand aucun heartbeat n’est arrivé depuis plus de 15 secondes. Le stale checker tourne toutes les 10 secondes ; une machine passe hors ligne après environ 3 heartbeats manqués (un toutes les 5 secondes).

L’incident se referme tout seul au heartbeat suivant.

Astuce

Une coupure de moins de 15 secondes ne déclenche pas host_down. Un ou deux heartbeats manqués passent inaperçus.


Alertes de température

La température n’est collectée que sur les machines physiques. VM et conteneurs n’ont pas accès aux capteurs : une alerte température sur une VM ne partira jamais.