feat(monitoring): supervise l'API, la base et l'hôte avec Prometheus et Grafana

L'API exposait /metrics, mais aucun collecteur ne le lisait : monitoring/ ne contenait que des
.gitkeep.

Sous le profil Compose `monitoring` : prometheus, alertmanager, grafana, postgres-exporter,
node-exporter et cadvisor. Tous ont un mem_limit, pour environ 700 Mo au total sur la VM de 8 Go,
et leurs interfaces n'écoutent que sur 127.0.0.1. Le profil est actif en prod via
COMPOSE_PROFILES, donc à chaque déploiement, et se lance à la demande ailleurs
(make monitoring-up).

- Neuf règles d'alerte (API, base, hôte, cibles). Chacune a un cas dans les tests joués par
  `promtool test rules`, en CI comme par make monitoring-check.
- Alertmanager route les alertes par courriel vers Mailpit ; un critical masque le warning de la
  même cible.
- Grafana est provisionné : sources Prometheus et TimescaleDB, et trois tableaux de bord (API,
  données et dérive du modèle, infrastructure).
- Le rôle PostgreSQL `supervision` est en lecture seule sur les seules tables métier
  (db/roles/supervision.sql), posé par make db-ensure-supervision et par stack-up quand le
  profil est actif.
- Le jeton de /metrics passe à Prometheus en secret Compose (APP_METRICS_TOKEN) ;
  provision-host.sh génère ce secret et les deux autres.

Backend :
- un APP_METRICS_TOKEN vide vaut absent ;
- les sondes de santé ne comptent plus dans les métriques ;
- seaux de latence fins autour de 500 ms ;
- un registre Prometheus par application, sans quoi toute application créée après la première
  (dans les tests) ne mesurait rien.

Réf : #26
This commit is contained in:
Johan LEROY
2026-09-23 09:41:12 +02:00
parent 2ed9e1cee4
commit dc952d13aa
28 changed files with 2364 additions and 19 deletions
+43
View File
@@ -0,0 +1,43 @@
# Contrainte : Prometheus ne lit pas les variables d'environnement dans ce fichier - prometheus.yml.
# Le jeton de `/metrics` lui parvient en secret Compose (`metrics_token`, tiré d'APP_METRICS_TOKEN) ;
# vide, l'API n'en exige aucun (app/api/security.py).
global:
scrape_interval: 15s
evaluation_interval: 15s
rule_files:
- /etc/prometheus/rules/*.yml
alerting:
alertmanagers:
- static_configs:
- targets: ["alertmanager:9093"]
scrape_configs:
- job_name: backend
authorization:
type: Bearer
credentials_file: /run/secrets/metrics_token
static_configs:
- targets: ["backend:8000"]
- job_name: prometheus
static_configs:
- targets: ["localhost:9090"]
- job_name: alertmanager
static_configs:
- targets: ["alertmanager:9093"]
- job_name: postgres
static_configs:
- targets: ["postgres-exporter:9187"]
- job_name: node
static_configs:
- targets: ["node-exporter:9100"]
- job_name: cadvisor
static_configs:
- targets: ["cadvisor:8080"]
+103
View File
@@ -0,0 +1,103 @@
# Contrainte : chaque règle a son cas dans tests/enervision.test.yml, joué par `promtool test
# rules` en CI - enervision.yml. Une règle modifiée sans son test fait échouer le job Infra.
# Pourquoi : `critical` réveille (mail immédiat, rappel toutes les heures), `warning` se lit le
# lendemain ; alertmanager.yml masque le warning d'une cible déjà en critical.
groups:
- name: api
rules:
- alert: ApiIndisponible
expr: up{job="backend"} == 0
for: 2m
labels:
severity: critical
annotations:
summary: "L'API ne répond plus"
description: "Prometheus ne joint plus {{ $labels.instance }} depuis 2 minutes."
- alert: ApiErreursServeur
expr: |
sum(rate(http_requests_total{job="backend", status="5xx"}[5m]))
/ sum(rate(http_requests_total{job="backend"}[5m])) > 0.05
for: 5m
labels:
severity: critical
annotations:
summary: "Plus de 5 % de réponses 5xx"
description: "{{ $value | humanizePercentage }} des réponses de l'API sont des erreurs serveur."
- alert: ApiLatenceElevee
expr: |
histogram_quantile(0.95,
sum by (le) (rate(http_request_duration_highr_seconds_bucket{job="backend"}[5m]))
) > 1
for: 10m
labels:
severity: warning
annotations:
summary: "p95 de l'API au-dessus d'une seconde"
description: "Le p95 des réponses vaut {{ $value | humanizeDuration }} depuis 10 minutes."
- name: base
rules:
- alert: BaseIndisponible
expr: pg_up == 0
for: 2m
labels:
severity: critical
annotations:
summary: "PostgreSQL ne répond plus"
description: "L'exportateur ne se connecte plus à la base depuis 2 minutes."
- alert: BaseConnexionsSaturees
expr: |
sum by (instance) (pg_stat_activity_count)
/ max by (instance) (pg_settings_max_connections) > 0.8
for: 5m
labels:
severity: warning
annotations:
summary: "Connexions PostgreSQL au-delà de 80 %"
description: "{{ $value | humanizePercentage }} des connexions autorisées sont ouvertes."
- name: hote
rules:
- alert: HoteMemoireSaturee
expr: 1 - node_memory_MemAvailable_bytes / node_memory_MemTotal_bytes > 0.9
for: 10m
labels:
severity: warning
annotations:
summary: "Mémoire de l'hôte au-delà de 90 %"
description: "{{ $value | humanizePercentage }} de la mémoire est utilisée, recette et prod comprises."
- alert: HoteDisquePlein
expr: |
node_filesystem_avail_bytes{mountpoint="/", fstype!~"tmpfs|overlay"}
/ node_filesystem_size_bytes{mountpoint="/", fstype!~"tmpfs|overlay"} < 0.1
for: 10m
labels:
severity: critical
annotations:
summary: "Moins de 10 % de disque libre"
description: "Il reste {{ $value | humanizePercentage }} d'espace sur la racine de l'hôte."
- alert: HoteCpuSature
expr: 1 - avg by (instance) (rate(node_cpu_seconds_total{mode="idle"}[5m])) > 0.9
for: 15m
labels:
severity: warning
annotations:
summary: "Processeur de l'hôte au-delà de 90 %"
description: "Le processeur est occupé à {{ $value | humanizePercentage }} depuis 15 minutes."
- name: supervision
rules:
- alert: CibleInjoignable
expr: up{job!="backend"} == 0
for: 5m
labels:
severity: warning
annotations:
summary: "Cible de supervision injoignable"
description: "Prometheus ne joint plus {{ $labels.job }} ({{ $labels.instance }}) depuis 5 minutes."
@@ -0,0 +1,112 @@
rule_files:
- ../rules/enervision.yml
evaluation_interval: 1m
tests:
- name: l'API injoignable déclenche une alerte critique au bout de 2 minutes
interval: 1m
input_series:
- series: 'up{job="backend", instance="backend:8000"}'
values: "1 0 0 0 0"
alert_rule_test:
- eval_time: 2m
alertname: ApiIndisponible
exp_alerts: []
- eval_time: 3m
alertname: ApiIndisponible
exp_alerts:
- exp_labels:
severity: critical
job: backend
instance: backend:8000
exp_annotations:
summary: "L'API ne répond plus"
description: "Prometheus ne joint plus backend:8000 depuis 2 minutes."
- name: une API qui répond ne déclenche rien
interval: 1m
input_series:
- series: 'up{job="backend", instance="backend:8000"}'
values: "1x10"
alert_rule_test:
- eval_time: 10m
alertname: ApiIndisponible
exp_alerts: []
- name: dix pour cent de 5xx déclenchent l'alerte d'erreurs serveur
interval: 1m
input_series:
- series: 'http_requests_total{job="backend", handler="/api/v1/sites", method="GET", status="5xx"}'
values: "0+10x20"
- series: 'http_requests_total{job="backend", handler="/api/v1/sites", method="GET", status="2xx"}'
values: "0+90x20"
alert_rule_test:
- eval_time: 12m
alertname: ApiErreursServeur
exp_alerts:
- exp_labels:
severity: critical
exp_annotations:
summary: "Plus de 5 % de réponses 5xx"
description: "10% des réponses de l'API sont des erreurs serveur."
- name: un p95 au-delà d'une seconde déclenche l'alerte de latence
interval: 1m
input_series:
- series: 'http_request_duration_highr_seconds_bucket{job="backend", le="0.5"}'
values: "0x30"
- series: 'http_request_duration_highr_seconds_bucket{job="backend", le="1"}'
values: "0x30"
- series: 'http_request_duration_highr_seconds_bucket{job="backend", le="2"}'
values: "0+10x30"
- series: 'http_request_duration_highr_seconds_bucket{job="backend", le="+Inf"}'
values: "0+10x30"
alert_rule_test:
- eval_time: 20m
alertname: ApiLatenceElevee
exp_alerts:
- exp_labels:
severity: warning
exp_annotations:
summary: "p95 de l'API au-dessus d'une seconde"
description: "Le p95 des réponses vaut 1.95s depuis 10 minutes."
- name: la mémoire de l'hôte au-delà de 90 % déclenche un avertissement
interval: 1m
input_series:
- series: 'node_memory_MemAvailable_bytes{job="node", instance="node-exporter:9100"}'
values: "500000000x15"
- series: 'node_memory_MemTotal_bytes{job="node", instance="node-exporter:9100"}'
values: "10000000000x15"
alert_rule_test:
- eval_time: 12m
alertname: HoteMemoireSaturee
exp_alerts:
- exp_labels:
severity: warning
job: node
instance: node-exporter:9100
exp_annotations:
summary: "Mémoire de l'hôte au-delà de 90 %"
description: "95% de la mémoire est utilisée, recette et prod comprises."
- name: un exportateur muet déclenche l'alerte de cible, pas celle de l'API
interval: 1m
input_series:
- series: 'up{job="postgres", instance="postgres-exporter:9187"}'
values: "0x10"
alert_rule_test:
- eval_time: 6m
alertname: CibleInjoignable
exp_alerts:
- exp_labels:
severity: warning
job: postgres
instance: postgres-exporter:9187
exp_annotations:
summary: "Cible de supervision injoignable"
description: "Prometheus ne joint plus postgres (postgres-exporter:9187) depuis 5 minutes."
- eval_time: 6m
alertname: ApiIndisponible
exp_alerts: []