Règles d'alerte et notifications
Seuils d'alerte par hôte : CPU, mémoire, disque, charge, température. Défauts globaux et fenêtre de durée pour filtrer les pics brefs.
Watchflare prévient quand une métrique dépasse un seuil, ou quand une machine passe hors ligne. Les alertes sont évaluées toutes les 30 secondes, et se règlent par hôte. Les notifications partent à l’adresse de Settings → Notifications (par défaut, l’e-mail du premier compte) et vers tous les canaux que vous avez ajoutés.
Le trio alertes / incidents / notifications est détaillé dans Alertes et notifications.
Remarque
L’e-mail exige un SMTP configuré. Voir Notifications e-mail.
Remarque
Discord, Slack, Telegram, Matrix, Ntfy, Gotify, SMTP, HTTP : tout se règle sur Settings > Notifications. Voir Canaux de notification.
Types d’alertes
| Type | Description | Unité |
|---|---|---|
host_down | Aucun heartbeat depuis plus de 15 secondes | Aucune |
cpu_usage | Usage CPU au-dessus du seuil | % |
memory_usage | Usage mémoire au-dessus du seuil | % |
disk_usage | Usage disque au-dessus du seuil | % |
load_avg | Charge moyenne 1 min au-dessus du seuil | Aucune |
load_avg_5 | Charge moyenne 5 min au-dessus du seuil | Aucune |
load_avg_15 | Charge moyenne 15 min au-dessus du seuil | Aucune |
temperature | Température CPU au-dessus du seuil | °C |
Configurer les alertes
Défauts globaux
Dans Settings → Alerts, posez les seuils par défaut. Ils s’appliquent à tous les hôtes, et à chaque nouvel hôte.
Par hôte
- Ouvrez la page de détail d’un hôte.
- Onglet Alerts.
- Activez les types voulus et réglez le seuil pour cette machine.
- C’est enregistré tout de suite, sans confirmation.
Les règles par hôte priment. Un serveur de base peut avoir un seuil CPU plus haut qu’une machine statique peu chargée.
Fenêtre de durée
Chaque règle a une durée (5 minutes par défaut). Le seuil doit rester dépassé pendant toute cette fenêtre avant qu’un incident s’ouvre et qu’une notification parte. Un pic de quelques secondes ne suffit pas.
Si la métrique redescend avant la fin, rien ne part.
Incidents
Quand le dépassement tient toute la durée, le Hub ouvre un incident :
- Une notification à l’ouverture (seuil franchi).
- Une seconde à la résolution (sous le seuil, ou machine de retour).
L’onglet Alerts de chaque hôte liste les incidents : début, fin, seuil, et valeur qui a déclenché.
Machine hors ligne
host_down part quand aucun heartbeat n’est arrivé depuis plus de 15 secondes. Le stale checker tourne toutes les 10 secondes ; une machine passe hors ligne après environ 3 heartbeats manqués (un toutes les 5 secondes).
L’incident se referme tout seul au heartbeat suivant.
Astuce
Une coupure de moins de 15 secondes ne déclenche pas host_down. Un ou deux heartbeats manqués passent inaperçus.
Alertes de température
La température n’est collectée que sur les machines physiques. VM et conteneurs n’ont pas accès aux capteurs : une alerte température sur une VM ne partira jamais.