Compare commits
8
Commits
| Author | SHA1 | Date | |
|---|---|---|---|
|
|
4f69199734 | ||
|
|
016f226fdb | ||
|
|
88f4f9a601 | ||
|
|
7913518c4b | ||
|
|
2ad7692f1c | ||
|
|
a158d6f84c | ||
|
|
7dfd7a7e74 | ||
|
|
8d28113f03 |
@@ -0,0 +1,40 @@
|
|||||||
|
version: 2
|
||||||
|
updates:
|
||||||
|
# Frontend — npm
|
||||||
|
- package-ecosystem: "npm"
|
||||||
|
directory: "/apps/frontend"
|
||||||
|
schedule:
|
||||||
|
interval: "weekly"
|
||||||
|
open-pull-requests-limit: 5
|
||||||
|
groups:
|
||||||
|
frontend-dependencies:
|
||||||
|
patterns:
|
||||||
|
- "*"
|
||||||
|
|
||||||
|
# Backend — uv (lit pyproject.toml / uv.lock)
|
||||||
|
- package-ecosystem: "uv"
|
||||||
|
directory: "/apps/backend"
|
||||||
|
schedule:
|
||||||
|
interval: "weekly"
|
||||||
|
open-pull-requests-limit: 5
|
||||||
|
groups:
|
||||||
|
backend-dependencies:
|
||||||
|
patterns:
|
||||||
|
- "*"
|
||||||
|
|
||||||
|
# Les workflows GitHub Actions eux-mêmes ont aussi des dépendances à jour
|
||||||
|
- package-ecosystem: "github-actions"
|
||||||
|
directory: "/"
|
||||||
|
schedule:
|
||||||
|
interval: "weekly"
|
||||||
|
|
||||||
|
# Si un Dockerfile existe pour le backend
|
||||||
|
- package-ecosystem: "docker"
|
||||||
|
directory: "/apps/backend"
|
||||||
|
schedule:
|
||||||
|
interval: "weekly"
|
||||||
|
|
||||||
|
- package-ecosystem: "docker"
|
||||||
|
directory: "/apps/frontend"
|
||||||
|
schedule:
|
||||||
|
interval: "weekly"
|
||||||
@@ -0,0 +1,59 @@
|
|||||||
|
name: ML
|
||||||
|
|
||||||
|
# Piège : la version de Python vient de ml/.python-version, et doit rester en 3.14 (cf.
|
||||||
|
# .github/workflows/backend.yml, même contrainte).
|
||||||
|
|
||||||
|
on:
|
||||||
|
push:
|
||||||
|
paths:
|
||||||
|
- "ml/**"
|
||||||
|
- ".github/workflows/ml.yml"
|
||||||
|
pull_request:
|
||||||
|
paths:
|
||||||
|
- "ml/**"
|
||||||
|
- ".github/workflows/ml.yml"
|
||||||
|
|
||||||
|
permissions:
|
||||||
|
contents: read
|
||||||
|
|
||||||
|
concurrency:
|
||||||
|
group: ml-${{ github.ref }}
|
||||||
|
cancel-in-progress: true
|
||||||
|
|
||||||
|
jobs:
|
||||||
|
verification:
|
||||||
|
name: Lint, typage et tests
|
||||||
|
runs-on: ubuntu-latest
|
||||||
|
defaults:
|
||||||
|
run:
|
||||||
|
working-directory: ml
|
||||||
|
|
||||||
|
steps:
|
||||||
|
- name: Récupère le dépôt
|
||||||
|
uses: actions/checkout@v4
|
||||||
|
|
||||||
|
- name: Installe uv
|
||||||
|
uses: astral-sh/setup-uv@v5
|
||||||
|
with:
|
||||||
|
enable-cache: true
|
||||||
|
cache-dependency-glob: ml/uv.lock
|
||||||
|
|
||||||
|
- name: Installe l'interpréteur déclaré par .python-version
|
||||||
|
run: uv python install
|
||||||
|
|
||||||
|
- name: Synchronise les dépendances sans dévier du verrou
|
||||||
|
run: uv sync --all-groups --frozen
|
||||||
|
|
||||||
|
- name: Vérifie le formatage
|
||||||
|
run: uv run ruff format --check .
|
||||||
|
|
||||||
|
- name: Analyse statique
|
||||||
|
run: uv run ruff check --output-format=github .
|
||||||
|
|
||||||
|
- name: Typage
|
||||||
|
run: uv run mypy enervision_ml tests
|
||||||
|
|
||||||
|
# Aucun test ne touche PostgreSQL ni MLflow distant : tout tourne sur donnees
|
||||||
|
# synthetiques ou un magasin SQLite local jetable (cf. ml/tests/test_train.py).
|
||||||
|
- name: Tests
|
||||||
|
run: uv run pytest
|
||||||
@@ -58,6 +58,14 @@ data/raw/*
|
|||||||
monitoring/grafana/data/
|
monitoring/grafana/data/
|
||||||
monitoring/prometheus/data/
|
monitoring/prometheus/data/
|
||||||
|
|
||||||
|
# ML : jeu de donnees, modeles entraines et suivi MLflow local, tous generes/volumineux
|
||||||
|
ml/data/
|
||||||
|
ml/models/*
|
||||||
|
!ml/models/.gitkeep
|
||||||
|
ml/mlruns/
|
||||||
|
ml/mlartifacts/
|
||||||
|
ml/mlflow.db
|
||||||
|
|
||||||
# IDE et OS
|
# IDE et OS
|
||||||
.idea/
|
.idea/
|
||||||
.vscode/
|
.vscode/
|
||||||
|
|||||||
@@ -1,15 +1,17 @@
|
|||||||
BACKEND := apps/backend
|
BACKEND := apps/backend
|
||||||
FRONTEND := apps/frontend
|
FRONTEND := apps/frontend
|
||||||
|
ML := ml
|
||||||
|
|
||||||
.DEFAULT_GOAL := help
|
.DEFAULT_GOAL := help
|
||||||
.PHONY: help install install-backend install-frontend dev dev-backend dev-frontend \
|
.PHONY: help install install-backend install-frontend install-ml dev dev-backend dev-frontend \
|
||||||
lint format typecheck test test-cov test-integration check \
|
lint format typecheck test test-cov test-integration check \
|
||||||
openapi docker-build db-up db-down db-reset db-logs db-psql migrate bootstrap-admin
|
openapi docker-build db-up db-down db-reset db-logs db-psql migrate bootstrap-admin \
|
||||||
|
ml-lint ml-typecheck ml-test ml-check ml-train
|
||||||
|
|
||||||
help: ## Liste les cibles disponibles
|
help: ## Liste les cibles disponibles
|
||||||
@grep -E '^[a-zA-Z_-]+:.*?## .*$$' $(MAKEFILE_LIST) | awk 'BEGIN {FS = ":.*?## "}; {printf " \033[36m%-16s\033[0m %s\n", $$1, $$2}'
|
@grep -E '^[a-zA-Z_-]+:.*?## .*$$' $(MAKEFILE_LIST) | awk 'BEGIN {FS = ":.*?## "}; {printf " \033[36m%-16s\033[0m %s\n", $$1, $$2}'
|
||||||
|
|
||||||
install: install-backend install-frontend ## Installe les dépendances backend et frontend
|
install: install-backend install-frontend install-ml ## Installe les dépendances backend, frontend et ML
|
||||||
|
|
||||||
install-backend: ## Installe les dépendances du backend
|
install-backend: ## Installe les dépendances du backend
|
||||||
cd $(BACKEND) && uv sync --all-groups
|
cd $(BACKEND) && uv sync --all-groups
|
||||||
@@ -17,6 +19,9 @@ install-backend: ## Installe les dépendances du backend
|
|||||||
install-frontend: ## Installe les dépendances du frontend
|
install-frontend: ## Installe les dépendances du frontend
|
||||||
cd $(FRONTEND) && npm ci
|
cd $(FRONTEND) && npm ci
|
||||||
|
|
||||||
|
install-ml: ## Installe les dépendances du pipeline ML
|
||||||
|
cd $(ML) && uv sync --all-groups
|
||||||
|
|
||||||
dev: ## Lance toute la stack (backend + frontend) en rechargement à chaud
|
dev: ## Lance toute la stack (backend + frontend) en rechargement à chaud
|
||||||
@trap 'kill 0' EXIT INT TERM; \
|
@trap 'kill 0' EXIT INT TERM; \
|
||||||
$(MAKE) --no-print-directory dev-backend & \
|
$(MAKE) --no-print-directory dev-backend & \
|
||||||
@@ -55,6 +60,20 @@ check: lint typecheck test ## Chaîne de vérification complète
|
|||||||
openapi: ## Régénère apps/backend/openapi.json depuis les routes déclarées
|
openapi: ## Régénère apps/backend/openapi.json depuis les routes déclarées
|
||||||
cd $(BACKEND) && uv run python -m app.cli export-openapi
|
cd $(BACKEND) && uv run python -m app.cli export-openapi
|
||||||
|
|
||||||
|
ml-lint: ## Analyse statique du pipeline ML
|
||||||
|
cd $(ML) && uv run ruff check .
|
||||||
|
|
||||||
|
ml-typecheck: ## Vérifie le typage du pipeline ML
|
||||||
|
cd $(ML) && uv run mypy enervision_ml tests
|
||||||
|
|
||||||
|
ml-test: ## Exécute les tests du pipeline ML (donnees synthetiques, sans base ni serveur MLflow)
|
||||||
|
cd $(ML) && uv run pytest
|
||||||
|
|
||||||
|
ml-check: ml-lint ml-typecheck ml-test ## Chaîne de vérification complète du pipeline ML
|
||||||
|
|
||||||
|
ml-train: ## Entraine le modele LightGBM. CSV=chemin optionnel, sinon lit ML_DATABASE_URL
|
||||||
|
cd $(ML) && uv run python -m enervision_ml.train $(if $(CSV),--csv $(CSV),)
|
||||||
|
|
||||||
docker-build: ## Construit l'image du backend
|
docker-build: ## Construit l'image du backend
|
||||||
docker build -t enervision-backend:local $(BACKEND)
|
docker build -t enervision-backend:local $(BACKEND)
|
||||||
|
|
||||||
|
|||||||
@@ -25,6 +25,7 @@ Ce que la documentation apporte à chacun : [docs/architecture/00-vue-ensemble.m
|
|||||||
| Infra | Terraform (k3s single-node) | `infra/terraform` | Initialise |
|
| Infra | Terraform (k3s single-node) | `infra/terraform` | Initialise |
|
||||||
| CI/CD | GitHub Actions | `.github/workflows` | Backend en place |
|
| CI/CD | GitHub Actions | `.github/workflows` | Backend en place |
|
||||||
| Monitoring | Prometheus, Grafana, Alertmanager | `monitoring` | A initialiser |
|
| Monitoring | Prometheus, Grafana, Alertmanager | `monitoring` | A initialiser |
|
||||||
|
| ML | LightGBM, MLflow | `ml` | Entrainement initialise |
|
||||||
|
|
||||||
Le backend, la base et l'infrastructure (Terraform/k3s) sont initialises a ce stade. Le frontend
|
Le backend, la base et l'infrastructure (Terraform/k3s) sont initialises a ce stade. Le frontend
|
||||||
sert un tableau de bord sur `/dashboard`, dont les données proviennent de fixtures : les endpoints
|
sert un tableau de bord sur `/dashboard`, dont les données proviennent de fixtures : les endpoints
|
||||||
@@ -53,6 +54,7 @@ L'etat detaille de chaque brique et les vues d'architecture sont dans
|
|||||||
├── infra/terraform/
|
├── infra/terraform/
|
||||||
│ ├── modules/ Modules reutilisables
|
│ ├── modules/ Modules reutilisables
|
||||||
│ └── environments/ Racines Terraform, une par environnement
|
│ └── environments/ Racines Terraform, une par environnement
|
||||||
|
├── ml/ Pipeline d'entrainement LightGBM, suivi MLflow
|
||||||
├── monitoring/
|
├── monitoring/
|
||||||
│ ├── prometheus/ Collecte et regles d'alerte
|
│ ├── prometheus/ Collecte et regles d'alerte
|
||||||
│ ├── grafana/ Provisioning et dashboards
|
│ ├── grafana/ Provisioning et dashboards
|
||||||
|
|||||||
@@ -31,6 +31,7 @@ from app.repositories.site import SiteRepository
|
|||||||
from app.repositories.user import UserRepository
|
from app.repositories.user import UserRepository
|
||||||
from app.services.alert import AlertService
|
from app.services.alert import AlertService
|
||||||
from app.services.auth import AuthService, LoginPolicy
|
from app.services.auth import AuthService, LoginPolicy
|
||||||
|
from app.services.reading import ReadingService
|
||||||
from app.services.recommendation import RecommendationService
|
from app.services.recommendation import RecommendationService
|
||||||
from app.services.sensor import SensorService
|
from app.services.sensor import SensorService
|
||||||
from app.services.site import SiteService
|
from app.services.site import SiteService
|
||||||
@@ -168,6 +169,13 @@ def get_stats_service(session: SessionDep) -> StatsService:
|
|||||||
StatsServiceDep = Annotated[StatsService, Depends(get_stats_service)]
|
StatsServiceDep = Annotated[StatsService, Depends(get_stats_service)]
|
||||||
|
|
||||||
|
|
||||||
|
def get_reading_service(session: SessionDep) -> ReadingService:
|
||||||
|
return ReadingService(readings=ReadingRepository(session))
|
||||||
|
|
||||||
|
|
||||||
|
ReadingServiceDep = Annotated[ReadingService, Depends(get_reading_service)]
|
||||||
|
|
||||||
|
|
||||||
def get_sensor_service(session: SessionDep) -> SensorService:
|
def get_sensor_service(session: SessionDep) -> SensorService:
|
||||||
return SensorService(sites=SiteRepository(session), readings=ReadingRepository(session))
|
return SensorService(sites=SiteRepository(session), readings=ReadingRepository(session))
|
||||||
|
|
||||||
|
|||||||
@@ -71,6 +71,14 @@ TAGS: Final[list[dict[str, Any]]] = [
|
|||||||
"description": "Statistiques agrégées de consommation. Accessible à partir du rôle "
|
"description": "Statistiques agrégées de consommation. Accessible à partir du rôle "
|
||||||
"`lecteur`.",
|
"`lecteur`.",
|
||||||
},
|
},
|
||||||
|
{
|
||||||
|
"name": "readings",
|
||||||
|
"description": (
|
||||||
|
"Historique des lectures de consommation. Fenêtre temporelle plafonnée à 90 jours, "
|
||||||
|
"24 dernières heures par défaut si `start`/`end` sont omis. Accessible à partir du "
|
||||||
|
"rôle `lecteur`."
|
||||||
|
),
|
||||||
|
},
|
||||||
{
|
{
|
||||||
"name": "sensors",
|
"name": "sensors",
|
||||||
"description": "État de santé des capteurs par site. Réservé au rôle `admin`.",
|
"description": "État de santé des capteurs par site. Réservé au rôle `admin`.",
|
||||||
|
|||||||
@@ -0,0 +1,54 @@
|
|||||||
|
from datetime import datetime
|
||||||
|
|
||||||
|
from fastapi import APIRouter, HTTPException, Query, status
|
||||||
|
|
||||||
|
from app.api.deps import LecteurDep, ReadingServiceDep
|
||||||
|
from app.api.openapi import REPONSE_VALIDATION, Reponses
|
||||||
|
from app.schemas.errors import ErrorResponse
|
||||||
|
from app.schemas.reading import ReadingResponse
|
||||||
|
from app.services.reading import FenetreInverseeError, FenetreTropLargeError
|
||||||
|
|
||||||
|
router = APIRouter()
|
||||||
|
|
||||||
|
REPONSES_FENETRE: Reponses = {
|
||||||
|
**REPONSE_VALIDATION,
|
||||||
|
400: {
|
||||||
|
"model": ErrorResponse,
|
||||||
|
"description": (
|
||||||
|
"Fenêtre temporelle invalide : `start` postérieur ou égal à `end`, ou écart entre "
|
||||||
|
"les deux supérieur à 90 jours."
|
||||||
|
),
|
||||||
|
},
|
||||||
|
}
|
||||||
|
|
||||||
|
|
||||||
|
@router.get(
|
||||||
|
"",
|
||||||
|
response_model=list[ReadingResponse],
|
||||||
|
summary="Liste l'historique des lectures",
|
||||||
|
responses=REPONSES_FENETRE,
|
||||||
|
)
|
||||||
|
async def list_readings(
|
||||||
|
_: LecteurDep,
|
||||||
|
service: ReadingServiceDep,
|
||||||
|
site_id: str | None = None,
|
||||||
|
start: datetime | None = None,
|
||||||
|
end: datetime | None = None,
|
||||||
|
limit: int = Query(500, ge=1, le=2000),
|
||||||
|
offset: int = Query(0, ge=0),
|
||||||
|
) -> list[ReadingResponse]:
|
||||||
|
try:
|
||||||
|
lectures = await service.list_history(
|
||||||
|
site_id=site_id, start=start, end=end, limit=limit, offset=offset
|
||||||
|
)
|
||||||
|
except FenetreInverseeError as erreur:
|
||||||
|
raise HTTPException(
|
||||||
|
status_code=status.HTTP_400_BAD_REQUEST,
|
||||||
|
detail="`start` doit être strictement antérieur à `end`",
|
||||||
|
) from erreur
|
||||||
|
except FenetreTropLargeError as erreur:
|
||||||
|
raise HTTPException(
|
||||||
|
status_code=status.HTTP_400_BAD_REQUEST,
|
||||||
|
detail="L'écart entre `start` et `end` ne peut pas dépasser 90 jours",
|
||||||
|
) from erreur
|
||||||
|
return [ReadingResponse.model_validate(lecture) for lecture in lectures]
|
||||||
@@ -1,7 +1,17 @@
|
|||||||
from fastapi import APIRouter
|
from fastapi import APIRouter
|
||||||
|
|
||||||
from app.api.openapi import REPONSE_SERVEUR, REPONSES_ADMIN, REPONSES_LECTEUR
|
from app.api.openapi import REPONSE_SERVEUR, REPONSES_ADMIN, REPONSES_LECTEUR
|
||||||
from app.api.v1.endpoints import alerts, auth, health, recommendations, sensors, sites, stats, users
|
from app.api.v1.endpoints import (
|
||||||
|
alerts,
|
||||||
|
auth,
|
||||||
|
health,
|
||||||
|
readings,
|
||||||
|
recommendations,
|
||||||
|
sensors,
|
||||||
|
sites,
|
||||||
|
stats,
|
||||||
|
users,
|
||||||
|
)
|
||||||
|
|
||||||
api_router = APIRouter(responses=REPONSE_SERVEUR)
|
api_router = APIRouter(responses=REPONSE_SERVEUR)
|
||||||
api_router.include_router(health.router, prefix="/health", tags=["health"])
|
api_router.include_router(health.router, prefix="/health", tags=["health"])
|
||||||
@@ -18,6 +28,9 @@ api_router.include_router(
|
|||||||
responses=REPONSES_LECTEUR,
|
responses=REPONSES_LECTEUR,
|
||||||
)
|
)
|
||||||
api_router.include_router(stats.router, prefix="/stats", tags=["stats"], responses=REPONSES_LECTEUR)
|
api_router.include_router(stats.router, prefix="/stats", tags=["stats"], responses=REPONSES_LECTEUR)
|
||||||
|
api_router.include_router(
|
||||||
|
readings.router, prefix="/readings", tags=["readings"], responses=REPONSES_LECTEUR
|
||||||
|
)
|
||||||
api_router.include_router(
|
api_router.include_router(
|
||||||
sensors.router, prefix="/sensors", tags=["sensors"], responses=REPONSES_ADMIN
|
sensors.router, prefix="/sensors", tags=["sensors"], responses=REPONSES_ADMIN
|
||||||
)
|
)
|
||||||
|
|||||||
@@ -1,4 +1,5 @@
|
|||||||
from collections.abc import Sequence
|
from collections.abc import Sequence
|
||||||
|
from datetime import datetime
|
||||||
|
|
||||||
from sqlalchemy import select
|
from sqlalchemy import select
|
||||||
from sqlalchemy.ext.asyncio import AsyncSession
|
from sqlalchemy.ext.asyncio import AsyncSession
|
||||||
@@ -19,3 +20,23 @@ class ReadingRepository:
|
|||||||
.order_by(Reading.site_id, Reading.timestamp.desc())
|
.order_by(Reading.site_id, Reading.timestamp.desc())
|
||||||
)
|
)
|
||||||
return (await self._session.execute(requete)).scalars().all()
|
return (await self._session.execute(requete)).scalars().all()
|
||||||
|
|
||||||
|
async def list_history(
|
||||||
|
self,
|
||||||
|
*,
|
||||||
|
start: datetime,
|
||||||
|
end: datetime,
|
||||||
|
site_id: str | None = None,
|
||||||
|
limit: int,
|
||||||
|
offset: int,
|
||||||
|
) -> Sequence[Reading]:
|
||||||
|
requete = (
|
||||||
|
select(Reading)
|
||||||
|
.where(Reading.timestamp >= start, Reading.timestamp < end)
|
||||||
|
.order_by(Reading.timestamp.desc(), Reading.reading_id.desc())
|
||||||
|
.limit(limit)
|
||||||
|
.offset(offset)
|
||||||
|
)
|
||||||
|
if site_id is not None:
|
||||||
|
requete = requete.where(Reading.site_id == site_id)
|
||||||
|
return (await self._session.scalars(requete)).all()
|
||||||
|
|||||||
@@ -0,0 +1,45 @@
|
|||||||
|
from datetime import datetime
|
||||||
|
from decimal import Decimal
|
||||||
|
from enum import StrEnum
|
||||||
|
from typing import Any
|
||||||
|
|
||||||
|
from pydantic import BaseModel, ConfigDict
|
||||||
|
|
||||||
|
|
||||||
|
class ReadingSource(StrEnum):
|
||||||
|
CSV = "csv"
|
||||||
|
API_CURRENT = "api_current"
|
||||||
|
API_HISTORY = "api_history"
|
||||||
|
|
||||||
|
|
||||||
|
class ReadingDataQuality(StrEnum):
|
||||||
|
GOOD = "good"
|
||||||
|
PARTIAL = "partial"
|
||||||
|
DEGRADED = "degraded"
|
||||||
|
CRITICAL = "critical"
|
||||||
|
|
||||||
|
|
||||||
|
class ReadingResponse(BaseModel):
|
||||||
|
model_config = ConfigDict(from_attributes=True)
|
||||||
|
|
||||||
|
reading_id: int
|
||||||
|
site_id: str
|
||||||
|
timestamp: datetime
|
||||||
|
source: ReadingSource
|
||||||
|
consumption_kw: float | None
|
||||||
|
consumption_kwh: float | None
|
||||||
|
# Piège : `Decimal` (miroir de `Numeric(14, 2)` en base, pour ne pas arrondir un montant)
|
||||||
|
# sérialise en chaîne dans le JSON, pas en nombre — un consommateur qui ferait un `parseFloat`
|
||||||
|
# naïf perdrait la précision que ce choix visait à garder.
|
||||||
|
consumption_euros: Decimal | None
|
||||||
|
voltage_v: float | None
|
||||||
|
current_a: float | None
|
||||||
|
power_factor: float | None
|
||||||
|
temperature_celsius: float | None
|
||||||
|
humidity_percent: float | None
|
||||||
|
solar_irradiance_wm2: float | None
|
||||||
|
is_working_hours: bool | None
|
||||||
|
data_quality: ReadingDataQuality | None
|
||||||
|
null_reasons: list[str] | None
|
||||||
|
imputed_values: dict[str, Any] | None
|
||||||
|
imputation_method: str | None
|
||||||
@@ -0,0 +1,59 @@
|
|||||||
|
from collections.abc import Sequence
|
||||||
|
from datetime import UTC, datetime, timedelta
|
||||||
|
|
||||||
|
from app.models.energy import Reading
|
||||||
|
from app.repositories.reading import ReadingRepository
|
||||||
|
|
||||||
|
FENETRE_PAR_DEFAUT = timedelta(hours=24)
|
||||||
|
FENETRE_MAXIMALE = timedelta(days=90)
|
||||||
|
|
||||||
|
|
||||||
|
class FenetreInverseeError(Exception):
|
||||||
|
"""`start` est postérieur ou égal à `end`."""
|
||||||
|
|
||||||
|
|
||||||
|
class FenetreTropLargeError(Exception):
|
||||||
|
"""L'écart entre `start` et `end` dépasse `FENETRE_MAXIMALE`."""
|
||||||
|
|
||||||
|
|
||||||
|
class ReadingService:
|
||||||
|
def __init__(self, *, readings: ReadingRepository) -> None:
|
||||||
|
self._readings = readings
|
||||||
|
|
||||||
|
async def list_history(
|
||||||
|
self,
|
||||||
|
*,
|
||||||
|
site_id: str | None = None,
|
||||||
|
start: datetime | None = None,
|
||||||
|
end: datetime | None = None,
|
||||||
|
limit: int,
|
||||||
|
offset: int,
|
||||||
|
) -> Sequence[Reading]:
|
||||||
|
debut, fin = self._resoudre_fenetre(start, end)
|
||||||
|
return await self._readings.list_history(
|
||||||
|
site_id=site_id, start=debut, end=fin, limit=limit, offset=offset
|
||||||
|
)
|
||||||
|
|
||||||
|
@staticmethod
|
||||||
|
def _resoudre_fenetre(
|
||||||
|
start: datetime | None, end: datetime | None
|
||||||
|
) -> tuple[datetime, datetime]:
|
||||||
|
# Piège : un datetime naïf (sans fuseau dans la chaîne ISO reçue) fait échouer la
|
||||||
|
# comparaison à `reading.timestamp` (`timestamptz`) au niveau du pilote, en 500 plutôt
|
||||||
|
# qu'un refus propre. On le traite comme de l'UTC plutôt que de le rejeter.
|
||||||
|
debut = _vers_utc(start)
|
||||||
|
fin = _vers_utc(end) or datetime.now(UTC)
|
||||||
|
if debut is None:
|
||||||
|
debut = fin - FENETRE_PAR_DEFAUT
|
||||||
|
|
||||||
|
if debut >= fin:
|
||||||
|
raise FenetreInverseeError
|
||||||
|
if fin - debut > FENETRE_MAXIMALE:
|
||||||
|
raise FenetreTropLargeError
|
||||||
|
return debut, fin
|
||||||
|
|
||||||
|
|
||||||
|
def _vers_utc(instant: datetime | None) -> datetime | None:
|
||||||
|
if instant is None:
|
||||||
|
return None
|
||||||
|
return instant if instant.tzinfo is not None else instant.replace(tzinfo=UTC)
|
||||||
@@ -1228,6 +1228,161 @@
|
|||||||
]
|
]
|
||||||
}
|
}
|
||||||
},
|
},
|
||||||
|
"/api/v1/readings": {
|
||||||
|
"get": {
|
||||||
|
"tags": [
|
||||||
|
"readings"
|
||||||
|
],
|
||||||
|
"summary": "Liste l'historique des lectures",
|
||||||
|
"operationId": "list_readings_api_v1_readings_get",
|
||||||
|
"security": [
|
||||||
|
{
|
||||||
|
"Jeton d'accès": []
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"parameters": [
|
||||||
|
{
|
||||||
|
"name": "site_id",
|
||||||
|
"in": "query",
|
||||||
|
"required": false,
|
||||||
|
"schema": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "string"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Site Id"
|
||||||
|
}
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"name": "start",
|
||||||
|
"in": "query",
|
||||||
|
"required": false,
|
||||||
|
"schema": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "string",
|
||||||
|
"format": "date-time"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Start"
|
||||||
|
}
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"name": "end",
|
||||||
|
"in": "query",
|
||||||
|
"required": false,
|
||||||
|
"schema": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "string",
|
||||||
|
"format": "date-time"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "End"
|
||||||
|
}
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"name": "limit",
|
||||||
|
"in": "query",
|
||||||
|
"required": false,
|
||||||
|
"schema": {
|
||||||
|
"type": "integer",
|
||||||
|
"maximum": 2000,
|
||||||
|
"minimum": 1,
|
||||||
|
"default": 500,
|
||||||
|
"title": "Limit"
|
||||||
|
}
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"name": "offset",
|
||||||
|
"in": "query",
|
||||||
|
"required": false,
|
||||||
|
"schema": {
|
||||||
|
"type": "integer",
|
||||||
|
"minimum": 0,
|
||||||
|
"default": 0,
|
||||||
|
"title": "Offset"
|
||||||
|
}
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"responses": {
|
||||||
|
"200": {
|
||||||
|
"description": "Successful Response",
|
||||||
|
"content": {
|
||||||
|
"application/json": {
|
||||||
|
"schema": {
|
||||||
|
"type": "array",
|
||||||
|
"items": {
|
||||||
|
"$ref": "#/components/schemas/ReadingResponse"
|
||||||
|
},
|
||||||
|
"title": "Response List Readings Api V1 Readings Get"
|
||||||
|
}
|
||||||
|
}
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"500": {
|
||||||
|
"description": "Erreur interne. `correlation` identifie la trace côté serveur, qui n'est pas renvoyée au client.",
|
||||||
|
"content": {
|
||||||
|
"application/json": {
|
||||||
|
"schema": {
|
||||||
|
"$ref": "#/components/schemas/InternalErrorResponse"
|
||||||
|
}
|
||||||
|
}
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"401": {
|
||||||
|
"description": "Jeton absent, illisible, périmé, ou rendu caduc par un changement de rôle ou une désactivation. L'en-tête `WWW-Authenticate` porte la cause dans `error=`.",
|
||||||
|
"content": {
|
||||||
|
"application/json": {
|
||||||
|
"schema": {
|
||||||
|
"$ref": "#/components/schemas/ErrorResponse"
|
||||||
|
}
|
||||||
|
}
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"403": {
|
||||||
|
"description": "Mot de passe provisoire à changer (`detail` vaut `password_change_required`).",
|
||||||
|
"content": {
|
||||||
|
"application/json": {
|
||||||
|
"schema": {
|
||||||
|
"$ref": "#/components/schemas/ErrorResponse"
|
||||||
|
}
|
||||||
|
}
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"422": {
|
||||||
|
"description": "Corps invalide. Le détail nomme le champ fautif et le type d'erreur, jamais la valeur envoyée.",
|
||||||
|
"content": {
|
||||||
|
"application/json": {
|
||||||
|
"schema": {
|
||||||
|
"$ref": "#/components/schemas/ValidationErrorResponse"
|
||||||
|
}
|
||||||
|
}
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"400": {
|
||||||
|
"description": "Fenêtre temporelle invalide : `start` postérieur ou égal à `end`, ou écart entre les deux supérieur à 90 jours.",
|
||||||
|
"content": {
|
||||||
|
"application/json": {
|
||||||
|
"schema": {
|
||||||
|
"$ref": "#/components/schemas/ErrorResponse"
|
||||||
|
}
|
||||||
|
}
|
||||||
|
}
|
||||||
|
}
|
||||||
|
}
|
||||||
|
}
|
||||||
|
},
|
||||||
"/api/v1/sensors/status": {
|
"/api/v1/sensors/status": {
|
||||||
"get": {
|
"get": {
|
||||||
"tags": [
|
"tags": [
|
||||||
@@ -1580,6 +1735,225 @@
|
|||||||
],
|
],
|
||||||
"title": "ReadinessStatus"
|
"title": "ReadinessStatus"
|
||||||
},
|
},
|
||||||
|
"ReadingDataQuality": {
|
||||||
|
"type": "string",
|
||||||
|
"enum": [
|
||||||
|
"good",
|
||||||
|
"partial",
|
||||||
|
"degraded",
|
||||||
|
"critical"
|
||||||
|
],
|
||||||
|
"title": "ReadingDataQuality"
|
||||||
|
},
|
||||||
|
"ReadingResponse": {
|
||||||
|
"properties": {
|
||||||
|
"reading_id": {
|
||||||
|
"type": "integer",
|
||||||
|
"title": "Reading Id"
|
||||||
|
},
|
||||||
|
"site_id": {
|
||||||
|
"type": "string",
|
||||||
|
"title": "Site Id"
|
||||||
|
},
|
||||||
|
"timestamp": {
|
||||||
|
"type": "string",
|
||||||
|
"format": "date-time",
|
||||||
|
"title": "Timestamp"
|
||||||
|
},
|
||||||
|
"source": {
|
||||||
|
"$ref": "#/components/schemas/ReadingSource"
|
||||||
|
},
|
||||||
|
"consumption_kw": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "number"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Consumption Kw"
|
||||||
|
},
|
||||||
|
"consumption_kwh": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "number"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Consumption Kwh"
|
||||||
|
},
|
||||||
|
"consumption_euros": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "string",
|
||||||
|
"pattern": "^(?!^[-+.]*$)[+-]?0*\\d*\\.?\\d*$"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Consumption Euros"
|
||||||
|
},
|
||||||
|
"voltage_v": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "number"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Voltage V"
|
||||||
|
},
|
||||||
|
"current_a": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "number"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Current A"
|
||||||
|
},
|
||||||
|
"power_factor": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "number"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Power Factor"
|
||||||
|
},
|
||||||
|
"temperature_celsius": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "number"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Temperature Celsius"
|
||||||
|
},
|
||||||
|
"humidity_percent": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "number"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Humidity Percent"
|
||||||
|
},
|
||||||
|
"solar_irradiance_wm2": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "number"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Solar Irradiance Wm2"
|
||||||
|
},
|
||||||
|
"is_working_hours": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "boolean"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Is Working Hours"
|
||||||
|
},
|
||||||
|
"data_quality": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"$ref": "#/components/schemas/ReadingDataQuality"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
]
|
||||||
|
},
|
||||||
|
"null_reasons": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"items": {
|
||||||
|
"type": "string"
|
||||||
|
},
|
||||||
|
"type": "array"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Null Reasons"
|
||||||
|
},
|
||||||
|
"imputed_values": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"additionalProperties": true,
|
||||||
|
"type": "object"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Imputed Values"
|
||||||
|
},
|
||||||
|
"imputation_method": {
|
||||||
|
"anyOf": [
|
||||||
|
{
|
||||||
|
"type": "string"
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"type": "null"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"title": "Imputation Method"
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"type": "object",
|
||||||
|
"required": [
|
||||||
|
"reading_id",
|
||||||
|
"site_id",
|
||||||
|
"timestamp",
|
||||||
|
"source",
|
||||||
|
"consumption_kw",
|
||||||
|
"consumption_kwh",
|
||||||
|
"consumption_euros",
|
||||||
|
"voltage_v",
|
||||||
|
"current_a",
|
||||||
|
"power_factor",
|
||||||
|
"temperature_celsius",
|
||||||
|
"humidity_percent",
|
||||||
|
"solar_irradiance_wm2",
|
||||||
|
"is_working_hours",
|
||||||
|
"data_quality",
|
||||||
|
"null_reasons",
|
||||||
|
"imputed_values",
|
||||||
|
"imputation_method"
|
||||||
|
],
|
||||||
|
"title": "ReadingResponse"
|
||||||
|
},
|
||||||
|
"ReadingSource": {
|
||||||
|
"type": "string",
|
||||||
|
"enum": [
|
||||||
|
"csv",
|
||||||
|
"api_current",
|
||||||
|
"api_history"
|
||||||
|
],
|
||||||
|
"title": "ReadingSource"
|
||||||
|
},
|
||||||
"RecommendationResponse": {
|
"RecommendationResponse": {
|
||||||
"properties": {
|
"properties": {
|
||||||
"recommendation_id": {
|
"recommendation_id": {
|
||||||
@@ -2129,6 +2503,10 @@
|
|||||||
"name": "stats",
|
"name": "stats",
|
||||||
"description": "Statistiques agrégées de consommation. Accessible à partir du rôle `lecteur`."
|
"description": "Statistiques agrégées de consommation. Accessible à partir du rôle `lecteur`."
|
||||||
},
|
},
|
||||||
|
{
|
||||||
|
"name": "readings",
|
||||||
|
"description": "Historique des lectures de consommation. Fenêtre temporelle plafonnée à 90 jours, 24 dernières heures par défaut si `start`/`end` sont omis. Accessible à partir du rôle `lecteur`."
|
||||||
|
},
|
||||||
{
|
{
|
||||||
"name": "sensors",
|
"name": "sensors",
|
||||||
"description": "État de santé des capteurs par site. Réservé au rôle `admin`."
|
"description": "État de santé des capteurs par site. Réservé au rôle `admin`."
|
||||||
|
|||||||
@@ -35,6 +35,7 @@ ROUTES_A_ROLE = {
|
|||||||
("GET", "/api/v1/recommendations"),
|
("GET", "/api/v1/recommendations"),
|
||||||
("GET", "/api/v1/recommendations/{recommendation_id}"),
|
("GET", "/api/v1/recommendations/{recommendation_id}"),
|
||||||
("GET", "/api/v1/stats/summary"),
|
("GET", "/api/v1/stats/summary"),
|
||||||
|
("GET", "/api/v1/readings"),
|
||||||
("GET", "/api/v1/sensors/status"),
|
("GET", "/api/v1/sensors/status"),
|
||||||
}
|
}
|
||||||
|
|
||||||
|
|||||||
@@ -0,0 +1,198 @@
|
|||||||
|
from collections.abc import Callable, Iterator
|
||||||
|
from datetime import UTC, datetime
|
||||||
|
from uuid import uuid4
|
||||||
|
|
||||||
|
import pytest
|
||||||
|
from fastapi import FastAPI
|
||||||
|
from httpx import AsyncClient
|
||||||
|
|
||||||
|
from app.api.deps import get_current_principal, get_reading_service
|
||||||
|
from app.core.principal import Principal
|
||||||
|
from app.core.roles import AccountKind, Role
|
||||||
|
from app.models.energy import Reading
|
||||||
|
from app.services.reading import FenetreInverseeError, FenetreTropLargeError
|
||||||
|
|
||||||
|
|
||||||
|
def principal(role: Role = Role.LECTEUR) -> Principal:
|
||||||
|
return Principal(
|
||||||
|
id=uuid4(),
|
||||||
|
email=f"{role.value}@enervision.fr",
|
||||||
|
role=role,
|
||||||
|
kind=AccountKind.HUMAIN,
|
||||||
|
must_change_password=False,
|
||||||
|
)
|
||||||
|
|
||||||
|
|
||||||
|
def reading(reading_id: int = 1, site_id: str = "site-1") -> Reading:
|
||||||
|
return Reading(
|
||||||
|
reading_id=reading_id,
|
||||||
|
site_id=site_id,
|
||||||
|
timestamp=datetime(2026, 9, 16, tzinfo=UTC),
|
||||||
|
source="api_current",
|
||||||
|
consumption_kw=42.5,
|
||||||
|
consumption_kwh=None,
|
||||||
|
consumption_euros=None,
|
||||||
|
voltage_v=230.0,
|
||||||
|
current_a=None,
|
||||||
|
power_factor=None,
|
||||||
|
temperature_celsius=None,
|
||||||
|
humidity_percent=None,
|
||||||
|
solar_irradiance_wm2=None,
|
||||||
|
is_working_hours=True,
|
||||||
|
data_quality="good",
|
||||||
|
null_reasons=None,
|
||||||
|
imputed_values=None,
|
||||||
|
imputation_method=None,
|
||||||
|
raw_data={},
|
||||||
|
)
|
||||||
|
|
||||||
|
|
||||||
|
class FauxService:
|
||||||
|
def __init__(self, leve: Exception | None = None) -> None:
|
||||||
|
self.reading = reading()
|
||||||
|
self.leve = leve
|
||||||
|
self.appels: list[tuple[str | None, str | None, str | None, int, int]] = []
|
||||||
|
|
||||||
|
async def list_history(
|
||||||
|
self,
|
||||||
|
*,
|
||||||
|
site_id: str | None = None,
|
||||||
|
start: datetime | None = None,
|
||||||
|
end: datetime | None = None,
|
||||||
|
limit: int,
|
||||||
|
offset: int,
|
||||||
|
) -> list[Reading]:
|
||||||
|
self.appels.append((site_id, start, end, limit, offset))
|
||||||
|
if self.leve is not None:
|
||||||
|
raise self.leve
|
||||||
|
return [self.reading]
|
||||||
|
|
||||||
|
|
||||||
|
@pytest.fixture
|
||||||
|
def lecteur_connecte(app: FastAPI) -> Iterator[None]:
|
||||||
|
app.dependency_overrides[get_current_principal] = lambda: principal()
|
||||||
|
yield
|
||||||
|
app.dependency_overrides.pop(get_current_principal, None)
|
||||||
|
|
||||||
|
|
||||||
|
@pytest.fixture
|
||||||
|
def servi(app: FastAPI, lecteur_connecte: None) -> Iterator[Callable[..., FauxService]]:
|
||||||
|
def installe(*, leve: Exception | None = None) -> FauxService:
|
||||||
|
service = FauxService(leve=leve)
|
||||||
|
app.dependency_overrides[get_reading_service] = lambda: service
|
||||||
|
return service
|
||||||
|
|
||||||
|
yield installe
|
||||||
|
app.dependency_overrides.pop(get_reading_service, None)
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_readings_returns_the_readings(
|
||||||
|
servi: Callable[..., FauxService], client: AsyncClient
|
||||||
|
) -> None:
|
||||||
|
servi()
|
||||||
|
|
||||||
|
response = await client.get("/api/v1/readings")
|
||||||
|
|
||||||
|
assert response.status_code == 200
|
||||||
|
corps = response.json()
|
||||||
|
assert corps == [
|
||||||
|
{
|
||||||
|
"reading_id": 1,
|
||||||
|
"site_id": "site-1",
|
||||||
|
"timestamp": "2026-09-16T00:00:00Z",
|
||||||
|
"source": "api_current",
|
||||||
|
"consumption_kw": 42.5,
|
||||||
|
"consumption_kwh": None,
|
||||||
|
"consumption_euros": None,
|
||||||
|
"voltage_v": 230.0,
|
||||||
|
"current_a": None,
|
||||||
|
"power_factor": None,
|
||||||
|
"temperature_celsius": None,
|
||||||
|
"humidity_percent": None,
|
||||||
|
"solar_irradiance_wm2": None,
|
||||||
|
"is_working_hours": True,
|
||||||
|
"data_quality": "good",
|
||||||
|
"null_reasons": None,
|
||||||
|
"imputed_values": None,
|
||||||
|
"imputation_method": None,
|
||||||
|
}
|
||||||
|
]
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_readings_transmits_the_filters_and_pagination(
|
||||||
|
servi: Callable[..., FauxService], client: AsyncClient
|
||||||
|
) -> None:
|
||||||
|
service = servi()
|
||||||
|
|
||||||
|
response = await client.get(
|
||||||
|
"/api/v1/readings",
|
||||||
|
params={
|
||||||
|
"site_id": "site-1",
|
||||||
|
"start": "2026-09-01T00:00:00Z",
|
||||||
|
"end": "2026-09-02T00:00:00Z",
|
||||||
|
"limit": 50,
|
||||||
|
"offset": 10,
|
||||||
|
},
|
||||||
|
)
|
||||||
|
|
||||||
|
assert response.status_code == 200
|
||||||
|
assert service.appels == [
|
||||||
|
(
|
||||||
|
"site-1",
|
||||||
|
datetime(2026, 9, 1, tzinfo=UTC),
|
||||||
|
datetime(2026, 9, 2, tzinfo=UTC),
|
||||||
|
50,
|
||||||
|
10,
|
||||||
|
)
|
||||||
|
]
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_readings_returns_400_when_the_window_is_inverted(
|
||||||
|
servi: Callable[..., FauxService], client: AsyncClient
|
||||||
|
) -> None:
|
||||||
|
servi(leve=FenetreInverseeError())
|
||||||
|
|
||||||
|
response = await client.get("/api/v1/readings")
|
||||||
|
|
||||||
|
assert response.status_code == 400
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_readings_returns_400_when_the_window_is_too_large(
|
||||||
|
servi: Callable[..., FauxService], client: AsyncClient
|
||||||
|
) -> None:
|
||||||
|
servi(leve=FenetreTropLargeError())
|
||||||
|
|
||||||
|
response = await client.get("/api/v1/readings")
|
||||||
|
|
||||||
|
assert response.status_code == 400
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_readings_returns_422_for_a_limit_above_the_maximum(
|
||||||
|
servi: Callable[..., FauxService], client: AsyncClient
|
||||||
|
) -> None:
|
||||||
|
servi()
|
||||||
|
|
||||||
|
response = await client.get("/api/v1/readings", params={"limit": 5000})
|
||||||
|
|
||||||
|
assert response.status_code == 422
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_readings_returns_422_for_a_negative_offset(
|
||||||
|
servi: Callable[..., FauxService], client: AsyncClient
|
||||||
|
) -> None:
|
||||||
|
servi()
|
||||||
|
|
||||||
|
response = await client.get("/api/v1/readings", params={"offset": -1})
|
||||||
|
|
||||||
|
assert response.status_code == 422
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_readings_returns_an_empty_list_when_there_is_nothing(
|
||||||
|
lecteur_connecte: None, fake_session: Callable[..., None], client: AsyncClient
|
||||||
|
) -> None:
|
||||||
|
fake_session(result=[])
|
||||||
|
|
||||||
|
response = await client.get("/api/v1/readings")
|
||||||
|
|
||||||
|
assert response.status_code == 200
|
||||||
|
assert response.json() == []
|
||||||
@@ -6,6 +6,8 @@ from sqlalchemy.ext.asyncio import AsyncSession
|
|||||||
|
|
||||||
from app.models.energy import Reading, Site
|
from app.models.energy import Reading, Site
|
||||||
from app.repositories.reading import ReadingRepository
|
from app.repositories.reading import ReadingRepository
|
||||||
|
from tests.repositories.test_site import creer as creer_site
|
||||||
|
from tests.repositories.test_site import identifiant as identifiant_site
|
||||||
|
|
||||||
pytestmark = pytest.mark.integration
|
pytestmark = pytest.mark.integration
|
||||||
|
|
||||||
@@ -25,6 +27,20 @@ def lecture(site_id: str, *, timestamp: datetime, consumption_kw: float) -> Read
|
|||||||
)
|
)
|
||||||
|
|
||||||
|
|
||||||
|
async def creer_lecture(session: AsyncSession, *, site_id: str, **overrides: object) -> Reading:
|
||||||
|
reading = Reading(
|
||||||
|
site_id=site_id,
|
||||||
|
timestamp=overrides.get("timestamp", datetime(2026, 9, 16, tzinfo=UTC)),
|
||||||
|
source=overrides.get("source", "api_current"),
|
||||||
|
consumption_kw=overrides.get("consumption_kw", 10.0),
|
||||||
|
data_quality=overrides.get("data_quality", "good"),
|
||||||
|
raw_data=overrides.get("raw_data", {}),
|
||||||
|
)
|
||||||
|
session.add(reading)
|
||||||
|
await session.flush()
|
||||||
|
return reading
|
||||||
|
|
||||||
|
|
||||||
async def test_latest_by_site_keeps_only_the_most_recent_reading(session: AsyncSession) -> None:
|
async def test_latest_by_site_keeps_only_the_most_recent_reading(session: AsyncSession) -> None:
|
||||||
site_id = identifiant()
|
site_id = identifiant()
|
||||||
maintenant = datetime.now(UTC)
|
maintenant = datetime.now(UTC)
|
||||||
@@ -70,3 +86,110 @@ async def test_latest_by_site_returns_one_row_per_site(session: AsyncSession) ->
|
|||||||
await session.rollback()
|
await session.rollback()
|
||||||
|
|
||||||
assert identifiants == {premier, second}
|
assert identifiants == {premier, second}
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_orders_the_readings_by_timestamp_descending(
|
||||||
|
session: AsyncSession,
|
||||||
|
) -> None:
|
||||||
|
site = await creer_site(session)
|
||||||
|
depot = ReadingRepository(session)
|
||||||
|
ancienne = await creer_lecture(
|
||||||
|
session, site_id=site.site_id, timestamp=datetime(2026, 9, 1, tzinfo=UTC)
|
||||||
|
)
|
||||||
|
recente = await creer_lecture(
|
||||||
|
session, site_id=site.site_id, timestamp=datetime(2026, 9, 15, tzinfo=UTC)
|
||||||
|
)
|
||||||
|
|
||||||
|
resultats = await depot.list_history(
|
||||||
|
start=datetime(2026, 8, 1, tzinfo=UTC),
|
||||||
|
end=datetime(2026, 10, 1, tzinfo=UTC),
|
||||||
|
limit=100,
|
||||||
|
offset=0,
|
||||||
|
)
|
||||||
|
identifiants = [
|
||||||
|
r.reading_id for r in resultats if r.reading_id in (ancienne.reading_id, recente.reading_id)
|
||||||
|
]
|
||||||
|
await session.rollback()
|
||||||
|
|
||||||
|
assert identifiants == [recente.reading_id, ancienne.reading_id]
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_filters_by_site_id(session: AsyncSession) -> None:
|
||||||
|
premier = await creer_site(session)
|
||||||
|
second = await creer_site(session)
|
||||||
|
depot = ReadingRepository(session)
|
||||||
|
voulue = await creer_lecture(session, site_id=premier.site_id)
|
||||||
|
await creer_lecture(session, site_id=second.site_id)
|
||||||
|
|
||||||
|
resultats = await depot.list_history(
|
||||||
|
site_id=premier.site_id,
|
||||||
|
start=datetime(2026, 8, 1, tzinfo=UTC),
|
||||||
|
end=datetime(2026, 10, 1, tzinfo=UTC),
|
||||||
|
limit=100,
|
||||||
|
offset=0,
|
||||||
|
)
|
||||||
|
identifiants = [r.reading_id for r in resultats]
|
||||||
|
await session.rollback()
|
||||||
|
|
||||||
|
assert identifiants == [voulue.reading_id]
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_excludes_readings_outside_the_window(session: AsyncSession) -> None:
|
||||||
|
site = await creer_site(session)
|
||||||
|
depot = ReadingRepository(session)
|
||||||
|
dedans = await creer_lecture(
|
||||||
|
session, site_id=site.site_id, timestamp=datetime(2026, 9, 10, tzinfo=UTC)
|
||||||
|
)
|
||||||
|
await creer_lecture(session, site_id=site.site_id, timestamp=datetime(2026, 8, 1, tzinfo=UTC))
|
||||||
|
await creer_lecture(session, site_id=site.site_id, timestamp=datetime(2026, 10, 1, tzinfo=UTC))
|
||||||
|
|
||||||
|
resultats = await depot.list_history(
|
||||||
|
site_id=site.site_id,
|
||||||
|
start=datetime(2026, 9, 1, tzinfo=UTC),
|
||||||
|
end=datetime(2026, 9, 30, tzinfo=UTC),
|
||||||
|
limit=100,
|
||||||
|
offset=0,
|
||||||
|
)
|
||||||
|
identifiants = [r.reading_id for r in resultats]
|
||||||
|
await session.rollback()
|
||||||
|
|
||||||
|
assert identifiants == [dedans.reading_id]
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_respects_limit_and_offset(session: AsyncSession) -> None:
|
||||||
|
site = await creer_site(session)
|
||||||
|
depot = ReadingRepository(session)
|
||||||
|
lectures = [
|
||||||
|
await creer_lecture(
|
||||||
|
session, site_id=site.site_id, timestamp=datetime(2026, 9, jour, tzinfo=UTC)
|
||||||
|
)
|
||||||
|
for jour in (1, 2, 3)
|
||||||
|
]
|
||||||
|
|
||||||
|
resultats = await depot.list_history(
|
||||||
|
site_id=site.site_id,
|
||||||
|
start=datetime(2026, 8, 1, tzinfo=UTC),
|
||||||
|
end=datetime(2026, 10, 1, tzinfo=UTC),
|
||||||
|
limit=1,
|
||||||
|
offset=1,
|
||||||
|
)
|
||||||
|
identifiants = [r.reading_id for r in resultats]
|
||||||
|
await session.rollback()
|
||||||
|
|
||||||
|
assert identifiants == [lectures[1].reading_id]
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_returns_an_empty_list_when_there_is_nothing(
|
||||||
|
session: AsyncSession,
|
||||||
|
) -> None:
|
||||||
|
depot = ReadingRepository(session)
|
||||||
|
|
||||||
|
resultats = await depot.list_history(
|
||||||
|
site_id=identifiant_site(),
|
||||||
|
start=datetime(2026, 8, 1, tzinfo=UTC),
|
||||||
|
end=datetime(2026, 10, 1, tzinfo=UTC),
|
||||||
|
limit=100,
|
||||||
|
offset=0,
|
||||||
|
)
|
||||||
|
|
||||||
|
assert list(resultats) == []
|
||||||
|
|||||||
@@ -0,0 +1,153 @@
|
|||||||
|
from datetime import UTC, datetime, timedelta
|
||||||
|
|
||||||
|
import pytest
|
||||||
|
|
||||||
|
from app.models.energy import Reading
|
||||||
|
from app.services.reading import (
|
||||||
|
FENETRE_MAXIMALE,
|
||||||
|
FENETRE_PAR_DEFAUT,
|
||||||
|
FenetreInverseeError,
|
||||||
|
FenetreTropLargeError,
|
||||||
|
ReadingService,
|
||||||
|
)
|
||||||
|
|
||||||
|
|
||||||
|
def reading(reading_id: int = 1, site_id: str = "site-1") -> Reading:
|
||||||
|
return Reading(
|
||||||
|
reading_id=reading_id,
|
||||||
|
site_id=site_id,
|
||||||
|
timestamp=datetime(2026, 9, 16, tzinfo=UTC),
|
||||||
|
source="api_current",
|
||||||
|
consumption_kw=10.0,
|
||||||
|
data_quality="good",
|
||||||
|
raw_data={},
|
||||||
|
)
|
||||||
|
|
||||||
|
|
||||||
|
class FakeRepository:
|
||||||
|
def __init__(self, readings: list[Reading]) -> None:
|
||||||
|
self._readings = readings
|
||||||
|
self.appels: list[tuple[str | None, datetime, datetime, int, int]] = []
|
||||||
|
|
||||||
|
async def list_history(
|
||||||
|
self,
|
||||||
|
*,
|
||||||
|
start: datetime,
|
||||||
|
end: datetime,
|
||||||
|
site_id: str | None = None,
|
||||||
|
limit: int,
|
||||||
|
offset: int,
|
||||||
|
) -> list[Reading]:
|
||||||
|
self.appels.append((site_id, start, end, limit, offset))
|
||||||
|
return self._readings
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_returns_the_repository_readings() -> None:
|
||||||
|
service = ReadingService(readings=FakeRepository([reading(1), reading(2)]))
|
||||||
|
|
||||||
|
lectures = await service.list_history(limit=500, offset=0)
|
||||||
|
|
||||||
|
assert [r.reading_id for r in lectures] == [1, 2]
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_relays_the_site_id_limit_and_offset() -> None:
|
||||||
|
depot = FakeRepository([])
|
||||||
|
service = ReadingService(readings=depot)
|
||||||
|
debut = datetime(2026, 9, 1, tzinfo=UTC)
|
||||||
|
fin = datetime(2026, 9, 2, tzinfo=UTC)
|
||||||
|
|
||||||
|
await service.list_history(site_id="site-1", start=debut, end=fin, limit=50, offset=10)
|
||||||
|
|
||||||
|
assert depot.appels == [("site-1", debut, fin, 50, 10)]
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_defaults_to_the_last_24_hours_when_no_window_is_given() -> None:
|
||||||
|
depot = FakeRepository([])
|
||||||
|
service = ReadingService(readings=depot)
|
||||||
|
avant = datetime.now(UTC)
|
||||||
|
|
||||||
|
await service.list_history(limit=500, offset=0)
|
||||||
|
|
||||||
|
apres = datetime.now(UTC)
|
||||||
|
_, debut, fin, _, _ = depot.appels[0]
|
||||||
|
assert avant <= fin <= apres
|
||||||
|
assert fin - debut == FENETRE_PAR_DEFAUT
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_defaults_end_to_now_when_only_start_is_given() -> None:
|
||||||
|
depot = FakeRepository([])
|
||||||
|
service = ReadingService(readings=depot)
|
||||||
|
debut = datetime.now(UTC) - timedelta(hours=1)
|
||||||
|
avant = datetime.now(UTC)
|
||||||
|
|
||||||
|
await service.list_history(start=debut, limit=500, offset=0)
|
||||||
|
|
||||||
|
apres = datetime.now(UTC)
|
||||||
|
_, debut_transmis, fin, _, _ = depot.appels[0]
|
||||||
|
assert debut_transmis == debut
|
||||||
|
assert avant <= fin <= apres
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_defaults_start_to_24_hours_before_end_when_only_end_is_given() -> None:
|
||||||
|
depot = FakeRepository([])
|
||||||
|
service = ReadingService(readings=depot)
|
||||||
|
fin = datetime(2026, 9, 16, tzinfo=UTC)
|
||||||
|
|
||||||
|
await service.list_history(end=fin, limit=500, offset=0)
|
||||||
|
|
||||||
|
_, debut, fin_transmise, _, _ = depot.appels[0]
|
||||||
|
assert fin_transmise == fin
|
||||||
|
assert debut == fin - FENETRE_PAR_DEFAUT
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_normalizes_naive_datetimes_to_utc() -> None:
|
||||||
|
depot = FakeRepository([])
|
||||||
|
service = ReadingService(readings=depot)
|
||||||
|
|
||||||
|
await service.list_history(
|
||||||
|
start=datetime(2026, 9, 1), end=datetime(2026, 9, 2), limit=500, offset=0
|
||||||
|
)
|
||||||
|
|
||||||
|
_, debut, fin, _, _ = depot.appels[0]
|
||||||
|
assert debut == datetime(2026, 9, 1, tzinfo=UTC)
|
||||||
|
assert fin == datetime(2026, 9, 2, tzinfo=UTC)
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_raises_when_start_is_after_end() -> None:
|
||||||
|
service = ReadingService(readings=FakeRepository([]))
|
||||||
|
|
||||||
|
with pytest.raises(FenetreInverseeError):
|
||||||
|
await service.list_history(
|
||||||
|
start=datetime(2026, 9, 2, tzinfo=UTC),
|
||||||
|
end=datetime(2026, 9, 1, tzinfo=UTC),
|
||||||
|
limit=500,
|
||||||
|
offset=0,
|
||||||
|
)
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_raises_when_start_equals_end() -> None:
|
||||||
|
service = ReadingService(readings=FakeRepository([]))
|
||||||
|
instant = datetime(2026, 9, 1, tzinfo=UTC)
|
||||||
|
|
||||||
|
with pytest.raises(FenetreInverseeError):
|
||||||
|
await service.list_history(start=instant, end=instant, limit=500, offset=0)
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_raises_when_the_window_exceeds_the_maximum_span() -> None:
|
||||||
|
service = ReadingService(readings=FakeRepository([]))
|
||||||
|
debut = datetime(2026, 1, 1, tzinfo=UTC)
|
||||||
|
fin = debut + FENETRE_MAXIMALE + timedelta(seconds=1)
|
||||||
|
|
||||||
|
with pytest.raises(FenetreTropLargeError):
|
||||||
|
await service.list_history(start=debut, end=fin, limit=500, offset=0)
|
||||||
|
|
||||||
|
|
||||||
|
async def test_list_history_accepts_a_window_exactly_at_the_maximum_span() -> None:
|
||||||
|
depot = FakeRepository([])
|
||||||
|
service = ReadingService(readings=depot)
|
||||||
|
debut = datetime(2026, 1, 1, tzinfo=UTC)
|
||||||
|
fin = debut + FENETRE_MAXIMALE
|
||||||
|
|
||||||
|
await service.list_history(start=debut, end=fin, limit=500, offset=0)
|
||||||
|
|
||||||
|
assert depot.appels == [(None, debut, fin, 500, 0)]
|
||||||
@@ -0,0 +1,101 @@
|
|||||||
|
# 0005 - Modèle de prédiction de consommation : LightGBM
|
||||||
|
|
||||||
|
- Statut : accepté
|
||||||
|
- Date : 2026-09-17
|
||||||
|
|
||||||
|
## Contexte
|
||||||
|
|
||||||
|
Le schéma `prediction` contraint déjà la forme de la solution (deux cibles de régression,
|
||||||
|
`consumption_kw` instantané et `consumption_kwh` sur `period_minutes`, un statut
|
||||||
|
`insufficient_data` à détecter explicitement), mais aucun modèle n'était choisi. Trois
|
||||||
|
contraintes non négociables cadrent le choix, discutées dans l'issue #89 :
|
||||||
|
|
||||||
|
1. **EC06** (grille de notation individuelle) exige un modèle **entraîné, versionné avec
|
||||||
|
MLflow**, exposé via un endpoint fonctionnel, avec **surveillance du drift** en production.
|
||||||
|
2. **Aucun GPU dédié** : l'infra tourne on-premise sur une VM à 4 CPU / 8 Gio RAM (ou
|
||||||
|
`Standard_B2s`/`B2ms` côté Azure, 2 vCPU max) — Azure Machine Learning est de toute façon
|
||||||
|
bloqué par la politique Azure du projet.
|
||||||
|
3. **Délai serré** : le jalon J3 arrive à échéance le lendemain de la décision, J4 concentre déjà
|
||||||
|
26 issues sur 4 jours. Un modèle long à mettre en œuvre retarde la chaîne complète (service de
|
||||||
|
scoring #37, moteur de recommandations #38, tests ML #44/#45, tous bloqués par ce choix).
|
||||||
|
|
||||||
|
Le jeu de données est déjà disponible (`all_sites_combined.csv`, fourni par le formateur) : 7
|
||||||
|
sites, 2 ans au pas horaire (~17 500 lignes/site), avec `temperature_celsius`,
|
||||||
|
`humidity_percent`, `solar_irradiance_wm2` en régresseurs exogènes et des features calendaires
|
||||||
|
déjà dérivées.
|
||||||
|
|
||||||
|
## Options comparées
|
||||||
|
|
||||||
|
| Critère | Prophet | LightGBM/XGBoost | NeuralProphet | SARIMA | Holt-Winters | Mistral (LLM) |
|
||||||
|
|---|---|---|---|---|---|---|
|
||||||
|
| Saisonnalités multiples (jour/semaine/an) | Oui, nativement | Oui, via features engineered | Oui, nativement, + autorégression | Une seule, lourd à régler (SARIMAX) | Une seule, aucune | Non conçu pour ça |
|
||||||
|
| Régresseurs exogènes | Oui, mais doivent être connus dans le futur au moment de la prédiction | Oui, via lags/moyennes glissantes sur le passé | Oui, natif | Difficile en multivarié | Aucun support | Contexte de prompt seulement, non appris |
|
||||||
|
| Coût de calcul (VM sans GPU) | Faible | Faible | Élevé (deep learning) | Faible | Faible | Élevé à prohibitif |
|
||||||
|
| Versionnable MLflow | Oui, nativement | Oui, nativement | Pas de support direct | Oui, générique | Pas de support direct | Rien à versionner (pas un modèle entraîné) |
|
||||||
|
| Granularité | Un modèle par site (ou par site × métrique) | Un seul modèle global sur tous les sites | Un par site | Un par site | Un par site | — |
|
||||||
|
| Effort avant l'échéance | Faible | Moyen (feature engineering) | Élevé | Moyen à élevé | Faible en soi | Élevé, ou factice |
|
||||||
|
|
||||||
|
## Décision
|
||||||
|
|
||||||
|
**LightGBM, un seul modèle global** couvrant tous les sites, plutôt qu'un modèle par site
|
||||||
|
(Prophet) ou par famille de site. Cible : `consumption_kwh`, avec `period_minutes` comme feature
|
||||||
|
d'entrée plutôt que comme étape d'agrégation post-prédiction. Suivi et versioning via **MLflow**
|
||||||
|
(tracking + registre de modèles), sur le magasin local par défaut dans un premier temps —
|
||||||
|
l'hébergement sur l'infra k3s reste une question ouverte, non bloquante pour démarrer.
|
||||||
|
|
||||||
|
Raisons retenues, au-delà du tableau ci-dessus :
|
||||||
|
|
||||||
|
- **Un modèle global plutôt qu'un modèle par site** évite la fragilité des sites les moins
|
||||||
|
fournis en historique : ils bénéficient de ce qu'apprennent les autres sites, ce qu'un Prophet
|
||||||
|
par site ne permet pas.
|
||||||
|
- **Aucune dépendance à une prévision météo future.** Prophet exige que ses régresseurs
|
||||||
|
(`add_regressor`) soient connus au moment prédit ; `temperature_celsius`,
|
||||||
|
`humidity_percent` et `solar_irradiance_wm2` sont des mesures passées, pas des prévisions, et
|
||||||
|
aucune source de prévision météo n'existe dans le projet. LightGBM s'en sort avec des features
|
||||||
|
de lag/moyenne glissante calculées sur l'historique déjà présent dans `reading`, cf.
|
||||||
|
`ml/enervision_ml/features.py` — un choix qui vaut aussi bien à l'entraînement qu'au futur
|
||||||
|
scoring.
|
||||||
|
- **Apprentissage direct sur `consumption_kwh`** avec `period_minutes` en feature, sans étape
|
||||||
|
d'agrégation intermédiaire que la sortie continue de Prophet aurait demandée.
|
||||||
|
- **Coût de calcul compatible avec l'infra on-premise sans GPU.**
|
||||||
|
|
||||||
|
Débat complet, comparatif détaillé et décision finale : issue #89 (Johan, phyri0s,
|
||||||
|
ValentinDeFaria), actée en réunion d'équipe du 2026-09-17 et validée par l'ensemble de l'équipe.
|
||||||
|
|
||||||
|
## Conséquences
|
||||||
|
|
||||||
|
- Le pipeline d'entraînement (`ml/`, ce commit) lit `reading` + `site` par connexion PostgreSQL
|
||||||
|
directe et construit ses features par lags/moyennes glissantes plutôt que par régresseurs
|
||||||
|
contemporains, cf. `docs/ML-START.md`.
|
||||||
|
- Le rôle PostgreSQL dédié `enervision_ml` (lecture seule sur `reading`/`site`) n'est pas encore
|
||||||
|
provisionné : dette déjà assumée par l'ADR 0003 pour les comptes ETL/ML, `ML_DATABASE_URL`
|
||||||
|
pointe pour l'instant vers la même base que le backend applicatif en développement.
|
||||||
|
- Le service de scoring (#37), le moteur de recommandations (#38) et les tests de dérive
|
||||||
|
(#44/#45) restent à construire ; ils consommeront le même module `enervision_ml.features`, qui
|
||||||
|
doit rester strictement identique entre entraînement et scoring pour éviter un train/serve skew
|
||||||
|
silencieux.
|
||||||
|
- La surveillance de drift exigée par EC06 n'est pas encore implémentée : ce ticket ne livre que
|
||||||
|
l'entraînement et son suivi MLflow (paramètres, métriques, artefact modèle), pas le monitoring
|
||||||
|
en production.
|
||||||
|
- L'hébergement de MLflow sur l'infra k3s reste une question ouverte ; le magasin SQLite local
|
||||||
|
(`ml/mlflow.db`, ignoré par git) suffit pour l'instant à comparer des runs sur un poste.
|
||||||
|
|
||||||
|
## Alternatives écartées
|
||||||
|
|
||||||
|
- **Prophet** : proposition initiale, écartée après débat pour les raisons ci-dessus (modèle par
|
||||||
|
site, dépendance à une météo future indisponible, agrégation kWh en post-traitement). Reste un
|
||||||
|
candidat solide si un jour le projet doit produire une décomposition tendance/saisonnalité
|
||||||
|
explicable pour un usage différent.
|
||||||
|
- **Mistral (LLM)** : aucun produit dédié aux séries temporelles ; interroger un LLM généraliste
|
||||||
|
ne constitue pas un modèle entraîné et versionnable au sens MLflow, et le fine-tuning est hors
|
||||||
|
budget de calcul et hors délai.
|
||||||
|
- **SARIMA** : ne gère pas nativement plusieurs régresseurs exogènes ; réglage (p,d,q,P,D,Q) plus
|
||||||
|
long que le délai disponible.
|
||||||
|
- **NeuralProphet** : fait tout ce que fait Prophet et apprend en plus des motifs autorégressifs,
|
||||||
|
mais coûte plus cher en calcul (pas de GPU disponible) et n'a pas d'outil MLflow direct — piste
|
||||||
|
d'évolution possible, non engageante à ce stade.
|
||||||
|
- **Holt-Winters** : écarté d'entrée, pas seulement différé — aucun support de régresseurs
|
||||||
|
exogènes, alors que la météo et l'irradiance sont nécessaires ici.
|
||||||
|
- **CatBoost** : même famille que LightGBM, gère nativement les colonnes catégorielles (comme
|
||||||
|
`site_type`) sans encodage manuel. Non rejeté, différé : candidat à comparer si LightGBM
|
||||||
|
plafonne en précision.
|
||||||
@@ -74,9 +74,10 @@ collecteur ne vient le lire.
|
|||||||
|
|
||||||
| Domaine | Technologie | Emplacement | Statut | Ce qui existe réellement |
|
| Domaine | Technologie | Emplacement | Statut | Ce qui existe réellement |
|
||||||
|---|---|---|---|---|
|
|---|---|---|---|---|
|
||||||
| Backend | FastAPI, Python 3.14 | `apps/backend` | `En cours` | Factory, configuration, journalisation, 2 sondes de santé, `/metrics`, contrat OpenAPI versionné, routes `sites` et `recommendations` en lecture (endpoints → services → repositories → models) |
|
| Backend | FastAPI, Python 3.14 | `apps/backend` | `En cours` | Factory, configuration, journalisation, 2 sondes de santé, `/metrics`, contrat OpenAPI versionné, routes `sites`, `alerts`, `recommendations`, `stats/summary` et `readings` en lecture (endpoints → services → repositories → models) |
|
||||||
| Frontend | Angular 22, Node 24 | `apps/frontend` | `En cours` | Tableau de bord sur route `/dashboard`, deux services HTTP, graphiques Chart.js, données servies par des fixtures |
|
| Frontend | Angular 22, Node 24 | `apps/frontend` | `En cours` | Tableau de bord sur route `/dashboard`, deux services HTTP, graphiques Chart.js, données servies par des fixtures |
|
||||||
| Base | PostgreSQL 17 + TimescaleDB | `db` | `Fait` | Bootstrap de l'extension, base de test, chaîne Alembic. Schéma applicatif créé (`site`, `dataset`, `reading` en hypertable, `prediction`, `alert`, `recommendation`) |
|
| Base | PostgreSQL 17 + TimescaleDB | `db` | `Fait` | Bootstrap de l'extension, base de test, chaîne Alembic. Schéma applicatif créé (`site`, `dataset`, `reading` en hypertable, `prediction`, `alert`, `recommendation`) |
|
||||||
|
| ML | LightGBM, MLflow | `ml` | `En cours` | Pipeline d'entraînement (features par lags/moyennes glissantes, baseline de persistance saisonnière, suivi MLflow local), voir [ADR 0005](../adr/0005-modele-prediction-lightgbm.md) et [ML-START.md](../../ML-START.md). Scoring, endpoint et surveillance de dérive pas encore construits |
|
||||||
| Infra | Terraform, k3s single-node | `infra/terraform` | `En cours` | Module d'installation du cluster. Jamais appliqué, aucune ressource Kubernetes déclarée |
|
| Infra | Terraform, k3s single-node | `infra/terraform` | `En cours` | Module d'installation du cluster. Jamais appliqué, aucune ressource Kubernetes déclarée |
|
||||||
| Monitoring | Prometheus, Grafana, Alertmanager | `monitoring` | `Cible` | Rien, hors le `/metrics` exposé par l'API |
|
| Monitoring | Prometheus, Grafana, Alertmanager | `monitoring` | `Cible` | Rien, hors le `/metrics` exposé par l'API |
|
||||||
| ETL | Apache Airflow | `etl/airflow` | `Cible` | Rien |
|
| ETL | Apache Airflow | `etl/airflow` | `Cible` | Rien |
|
||||||
|
|||||||
@@ -146,6 +146,7 @@ Deux fichiers d'environnement, deux usages : `.env` à la racine alimente `docke
|
|||||||
| GET | `/api/v1/recommendations` | Liste les recommandations. `lecteur` | 401, 403, 500 |
|
| GET | `/api/v1/recommendations` | Liste les recommandations. `lecteur` | 401, 403, 500 |
|
||||||
| GET | `/api/v1/recommendations/{recommendation_id}` | Décrit une recommandation. `lecteur` | 401, 403, 404, 422, 500 |
|
| GET | `/api/v1/recommendations/{recommendation_id}` | Décrit une recommandation. `lecteur` | 401, 403, 404, 422, 500 |
|
||||||
| GET | `/api/v1/stats/summary` | Résume la consommation instantanée du parc. `lecteur` | 401, 403, 500 |
|
| GET | `/api/v1/stats/summary` | Résume la consommation instantanée du parc. `lecteur` | 401, 403, 500 |
|
||||||
|
| GET | `/api/v1/readings` | Historique des lectures, filtrable par `site_id`, fenêtre `start`/`end` (24h par défaut, 90 jours maximum) et paginé par `limit`/`offset`. `lecteur` | 400, 401, 403, 422, 500 |
|
||||||
| GET | `/api/v1/sensors/status` | État de santé des capteurs par site, dérivé de la dernière lecture. `admin` | 401, 403, 500 |
|
| GET | `/api/v1/sensors/status` | État de santé des capteurs par site, dérivé de la dernière lecture. `admin` | 401, 403, 500 |
|
||||||
| GET | `/metrics` | Format Prometheus, hors du schéma. Jeton requis si `APP_METRICS_TOKEN` est posé | |
|
| GET | `/metrics` | Format Prometheus, hors du schéma. Jeton requis si `APP_METRICS_TOKEN` est posé | |
|
||||||
| GET | `/docs`, `/redoc`, `/openapi.json` | Hors du schéma. Fermés en `staging` et en `prod` | |
|
| GET | `/docs`, `/redoc`, `/openapi.json` | Hors du schéma. Fermés en `staging` et en `prod` | |
|
||||||
@@ -159,21 +160,33 @@ Les codes de la dernière colonne sont ceux que le schéma **déclare**, et le f
|
|||||||
donc de modifier la liste dans ce fichier de test.
|
donc de modifier la liste dans ce fichier de test.
|
||||||
|
|
||||||
`GET /sites` et `GET /sites/{site_id}` sont la première route métier, et le gabarit repris pour
|
`GET /sites` et `GET /sites/{site_id}` sont la première route métier, et le gabarit repris pour
|
||||||
`GET /alerts` puis pour les suivantes (`reading`, `dataset`, `prediction`, `recommendation`) : les
|
`GET /alerts` puis pour les suivantes (`dataset`, `prediction`) : les quatre couches
|
||||||
quatre couches `endpoints → services → repositories → models` y sont toutes présentes, sur des
|
`endpoints → services → repositories → models` y sont toutes présentes, sur des tables déjà créées
|
||||||
tables déjà créées par la révision Alembic `e6d2026091501`. Elles n'exigent que le rôle `lecteur`,
|
par la révision Alembic `e6d2026091501`. Elles n'exigent que le rôle `lecteur`, contrairement aux
|
||||||
contrairement aux routes d'administration qui exigent `admin`. `SiteRepository` lit par
|
routes d'administration qui exigent `admin`. `SiteRepository` lit par `AsyncSession.scalar()` (une
|
||||||
`AsyncSession.scalar()` (une ligne) et `AsyncSession.scalars()` (plusieurs lignes) plutôt que par
|
ligne) et `AsyncSession.scalars()` (plusieurs lignes) plutôt que par `execute()`, ce qui la rend
|
||||||
`execute()`, ce qui la rend testable par la fixture `fake_session` au niveau endpoint sans base
|
testable par la fixture `fake_session` au niveau endpoint sans base réelle. `GET /recommendations`
|
||||||
réelle. `GET /recommendations` et `GET /recommendations/{recommendation_id}` reprennent le même
|
et `GET /recommendations/{recommendation_id}` reprennent le même gabarit à la lettre,
|
||||||
gabarit à la lettre, `recommendation_id` étant un entier plutôt qu'un texte. Une recommandation ne
|
`recommendation_id` étant un entier plutôt qu'un texte. Une recommandation ne porte pas `site_id` :
|
||||||
porte pas `site_id` : elle remonte à un site par sa seule `alert_id`, `alert` n'étant pas encore
|
elle remonte à un site par sa seule `alert_id`, `alert` n'étant pas encore exposée. `GET
|
||||||
exposée. `GET /stats/summary` et `GET /sensors/status` agrègent chacune deux repositories
|
/stats/summary` et `GET /sensors/status` agrègent chacune deux repositories (`SiteRepository`,
|
||||||
(`SiteRepository`, `ReadingRepository`) dans un service dédié plutôt que d'exposer une table :
|
`ReadingRepository`) dans un service dédié plutôt que d'exposer une table : elles n'entrent donc
|
||||||
elles n'entrent donc pas dans ce gabarit route-par-table. Le contrat détaillé pour le frontend est
|
pas dans ce gabarit route-par-table. Le contrat détaillé pour le frontend est dans
|
||||||
dans
|
|
||||||
[31-contrat-authentification.md](31-contrat-authentification.md).
|
[31-contrat-authentification.md](31-contrat-authentification.md).
|
||||||
|
|
||||||
|
`GET /readings` reprend le même gabarit mais s'en écarte sur un point : `reading` est l'hypertable,
|
||||||
|
donc la seule table métier pouvant porter des années d'historique, ce que `docs/architecture/
|
||||||
|
owasp-traceabilite.md` documentait comme un risque ouvert (API4, aucune pagination plafonnée ni
|
||||||
|
fenêtre temporelle maximale). `ReadingService` porte donc une couche de validation absente des
|
||||||
|
autres routes de lecture : `start`/`end` sont optionnels (24 dernières heures par défaut si les
|
||||||
|
deux sont omis, l'un défaut par rapport à l'autre sinon), l'écart entre les deux est plafonné à 90
|
||||||
|
jours (`FENETRE_MAXIMALE`), et `limit`/`offset` (défaut 500, plafond 2000) empêchent qu'une fenêtre
|
||||||
|
large mais peu dense reste malgré tout coûteuse. Un dépassement de plafond répond `400` (règle
|
||||||
|
métier, portée par le service) plutôt que `422` (réservé à la validation structurelle de FastAPI,
|
||||||
|
par exemple `limit` hors bornes). Un datetime sans fuseau dans `start`/`end` est traité comme de
|
||||||
|
l'UTC plutôt que rejeté : le comparer tel quel à `reading.timestamp` (`timestamptz`) échouerait
|
||||||
|
côté pilote, en `500` plutôt qu'un refus propre.
|
||||||
|
|
||||||
### `/health/ready`
|
### `/health/ready`
|
||||||
|
|
||||||
Cette sonde porte une garde décrite dans l'[ADR 0001](../adr/0001-postgresql-timescaledb.md) : un
|
Cette sonde porte une garde décrite dans l'[ADR 0001](../adr/0001-postgresql-timescaledb.md) : un
|
||||||
@@ -249,7 +262,7 @@ Les modèles de `app/schemas/errors.py` décrivent ce que les gestionnaires renv
|
|||||||
### Ajouter une route métier
|
### Ajouter une route métier
|
||||||
|
|
||||||
Checklist pour toute nouvelle route sur le gabarit `sites`/`alerts`/`recommendations`/`stats`/
|
Checklist pour toute nouvelle route sur le gabarit `sites`/`alerts`/`recommendations`/`stats`/
|
||||||
`sensors` (`reading`, `dataset`, `prediction`) :
|
`readings`/`sensors` (`dataset`, `prediction`) :
|
||||||
|
|
||||||
1. Composer ses `responses=` depuis `app/api/openapi.py` : `REPONSES_LECTEUR`/`REPONSES_ADMIN`
|
1. Composer ses `responses=` depuis `app/api/openapi.py` : `REPONSES_LECTEUR`/`REPONSES_ADMIN`
|
||||||
au niveau de l'`include_router()` du routeur, `REPONSE_VALIDATION` et les codes locaux
|
au niveau de l'`include_router()` du routeur, `REPONSE_VALIDATION` et les codes locaux
|
||||||
@@ -326,7 +339,9 @@ Trois fichiers méritent d'être connus avant de toucher à l'authentification :
|
|||||||
agir sur le site B. C'est la limite connue du modèle, et le risque BOLA du top 10 API.
|
agir sur le site B. C'est la limite connue du modèle, et le risque BOLA du top 10 API.
|
||||||
- **Rôles PostgreSQL cantonnés** pour l'ETL et le travail d'apprentissage, plus le `REVOKE` sur
|
- **Rôles PostgreSQL cantonnés** pour l'ETL et le travail d'apprentissage, plus le `REVOKE` sur
|
||||||
`audit_log`. Dette assumée, décrite dans les ADR 0003 et 0004.
|
`audit_log`. Dette assumée, décrite dans les ADR 0003 et 0004.
|
||||||
- **Pagination et fenêtrage** des lectures de séries temporelles, qui conditionnent la forme des
|
- **Pagination et fenêtrage** : posés sur `GET /readings` (fenêtre plafonnée à 90 jours,
|
||||||
endpoints métier. Sans plafond dur, une requête sur dix ans d'historique suffit à faire tomber
|
`limit`/`offset` plafonné à 2000), mais toujours en `limit`/`offset` simple — pas de curseur ni
|
||||||
l'API.
|
de plan de secours si un `offset` élevé sur une fenêtre dense devient lent en pratique.
|
||||||
|
`statement_timeout` reste absent au niveau de la connexion, donc rien n'empêche une requête
|
||||||
|
individuelle de tourner longtemps si les plafonds au-dessus d'elle s'avéraient insuffisants.
|
||||||
- **Politique de versionnement de l'API** au-delà du préfixe `/api/v1`.
|
- **Politique de versionnement de l'API** au-delà du préfixe `/api/v1`.
|
||||||
|
|||||||
@@ -22,6 +22,7 @@ lecture seule ; plusieurs lignes resteront à compléter une fois les endpoints
|
|||||||
| Argon2id m=19456 t=2 p=1, re-hachage passif quand les paramètres changent | `app/core/hashing.py` | A02 Cryptographic Failures, A07 Identification and Authentication Failures |
|
| Argon2id m=19456 t=2 p=1, re-hachage passif quand les paramètres changent | `app/core/hashing.py` | A02 Cryptographic Failures, A07 Identification and Authentication Failures |
|
||||||
| Message et temps de réponse identiques quelle que soit la cause de l'échec, haché leurre sur adresse inconnue | `app/services/auth.py` | A07, API2 |
|
| Message et temps de réponse identiques quelle que soit la cause de l'échec, haché leurre sur adresse inconnue | `app/services/auth.py` | A07, API2 |
|
||||||
| Limitation de débit à fenêtre glissante sur trois clés, évaluée avant le hachage | `app/services/auth.py`, `app/repositories/login_attempt.py` | A07, API4 Unrestricted Resource Consumption |
|
| Limitation de débit à fenêtre glissante sur trois clés, évaluée avant le hachage | `app/services/auth.py`, `app/repositories/login_attempt.py` | A07, API4 Unrestricted Resource Consumption |
|
||||||
|
| `GET /readings` : fenêtre temporelle plafonnée à 90 jours (24h par défaut), `limit`/`offset` plafonné à 2000, refus `400` si la fenêtre est inversée ou trop large | `app/services/reading.py` | API4 |
|
||||||
| Absence de verrouillage de compte, qui serait un déni de service | ADR 0002 | API4 |
|
| Absence de verrouillage de compte, qui serait un déni de service | ADR 0002 | API4 |
|
||||||
| Jeton de rafraîchissement opaque, haché en base, rotation avec détection de réutilisation | `app/services/auth.py`, `app/repositories/refresh_token.py` | A07, API2 |
|
| Jeton de rafraîchissement opaque, haché en base, rotation avec détection de réutilisation | `app/services/auth.py`, `app/repositories/refresh_token.py` | A07, API2 |
|
||||||
| Séparation structurelle accès / rafraîchissement, impossible à confondre | ADR 0002 | API2 |
|
| Séparation structurelle accès / rafraîchissement, impossible à confondre | ADR 0002 | API2 |
|
||||||
@@ -50,7 +51,7 @@ règles Bandit. Ajouter Bandit à la CI serait redondant, contrairement à ce qu
|
|||||||
| Item | État | Raison |
|
| Item | État | Raison |
|
||||||
|---|---|---|
|
|---|---|---|
|
||||||
| **API1 Broken Object Level Authorization** | **ouvert** | Les rôles sont globaux, il n'y a pas de portée par site : `GET /sites/{site_id}` et `GET /recommendations/{recommendation_id}` répondent à tout compte `lecteur` pour n'importe quel site ou recommandation, sans vérifier une affectation compte-site qui n'existe pas encore. Un opérateur du site A pourra agir sur le site B dès que les endpoints d'écriture métier existeront. Correctif prévu : table d'affectation compte-site, contrôle d'appartenance dans la même dépendance que le contrôle de rôle. |
|
| **API1 Broken Object Level Authorization** | **ouvert** | Les rôles sont globaux, il n'y a pas de portée par site : `GET /sites/{site_id}` et `GET /recommendations/{recommendation_id}` répondent à tout compte `lecteur` pour n'importe quel site ou recommandation, sans vérifier une affectation compte-site qui n'existe pas encore. Un opérateur du site A pourra agir sur le site B dès que les endpoints d'écriture métier existeront. Correctif prévu : table d'affectation compte-site, contrôle d'appartenance dans la même dépendance que le contrôle de rôle. |
|
||||||
| **API4, lectures de séries temporelles** | **ouvert** | Pas encore d'endpoint métier, donc ni pagination plafonnée, ni fenêtre temporelle maximale, ni `statement_timeout`. C'est la façon la plus probable dont la démonstration tombera : une requête sur dix ans d'historique suffit. |
|
| **API4, lectures de séries temporelles** | **partiel** | `GET /readings` plafonne la fenêtre temporelle (90 jours) et la pagination (`limit` ≤ 2000), voir plus haut. Reste ouvert : pagination en `limit`/`offset` simple plutôt qu'en curseur (un `offset` élevé sur une fenêtre dense reste coûteux), et aucun `statement_timeout` au niveau de la connexion pour borner une requête individuelle si les plafonds au-dessus s'avéraient insuffisants. |
|
||||||
| **API8 Security Misconfiguration, transport** | **ouvert** | Pas de TLS, donc ni HSTS, ni cookie `Secure` réellement posé en production. Ils appartiennent au terminateur TLS, qui n'existe pas. |
|
| **API8 Security Misconfiguration, transport** | **ouvert** | Pas de TLS, donc ni HSTS, ni cookie `Secure` réellement posé en production. Ils appartiennent au terminateur TLS, qui n'existe pas. |
|
||||||
| **API10 Unsafe Consumption of APIs** | **ouvert, et spécifique à ce projet** | L'API Mock de l'école n'a aucune authentification, tourne en HTTP clair sur le réseau de l'école, et expose un endpoint mutatif à quiconque. Sa réponse doit être traitée comme une entrée hostile : bornes physiques, taille de tableau plafonnée, timeout, et frontière d'anti-corruption. La conséquence la plus sérieuse n'est pas la fausse alerte, c'est l'empoisonnement du jeu d'entraînement du modèle de prédiction. |
|
| **API10 Unsafe Consumption of APIs** | **ouvert, et spécifique à ce projet** | L'API Mock de l'école n'a aucune authentification, tourne en HTTP clair sur le réseau de l'école, et expose un endpoint mutatif à quiconque. Sa réponse doit être traitée comme une entrée hostile : bornes physiques, taille de tableau plafonnée, timeout, et frontière d'anti-corruption. La conséquence la plus sérieuse n'est pas la fausse alerte, c'est l'empoisonnement du jeu d'entraînement du modèle de prédiction. |
|
||||||
| **A08 Software and Data Integrity Failures** | **partiel** | La CI vérifie le code mais n'analyse ni les dépendances ni les images. `.terraform.lock.hcl` reste ignoré par git, ce qui contredit une chaîne d'approvisionnement maîtrisée. |
|
| **A08 Software and Data Integrity Failures** | **partiel** | La CI vérifie le code mais n'analyse ni les dépendances ni les images. `.terraform.lock.hcl` reste ignoré par git, ce qui contredit une chaîne d'approvisionnement maîtrisée. |
|
||||||
|
|||||||
@@ -0,0 +1 @@
|
|||||||
|
3.14
|
||||||
@@ -0,0 +1,88 @@
|
|||||||
|
# ML EnerVision
|
||||||
|
|
||||||
|
Pipeline d'entrainement du modele de prevision de consommation energetique. Contexte complet :
|
||||||
|
[ADR 0005](../docs/adr/0005-modele-prediction-lightgbm.md) (choix du modele) et
|
||||||
|
[ML-START.md](../ML-START.md) (mecanisme d'acces aux donnees).
|
||||||
|
|
||||||
|
| Element | Choix |
|
||||||
|
|--------------|-----------------------------------------------|
|
||||||
|
| Python | 3.14 |
|
||||||
|
| Gestionnaire | uv (`uv.lock` fait foi) |
|
||||||
|
| Modele | LightGBM (regression, un seul modele global) |
|
||||||
|
| Suivi | MLflow (parametres, metriques, artefact) |
|
||||||
|
| Lint/format | ruff |
|
||||||
|
| Typage | mypy en mode strict |
|
||||||
|
| Tests | pytest, donnees synthetiques uniquement |
|
||||||
|
|
||||||
|
Projet Python independant de `apps/backend` : le service FastAPI n'a aucune raison d'embarquer
|
||||||
|
LightGBM/MLflow en dependance de production juste pour un script d'entrainement lance a la main.
|
||||||
|
|
||||||
|
## Installation
|
||||||
|
|
||||||
|
```bash
|
||||||
|
uv sync --all-groups
|
||||||
|
```
|
||||||
|
|
||||||
|
## Donnees
|
||||||
|
|
||||||
|
Deux sources, qui produisent le meme schema en sortie de `enervision_ml.data` (voir le module
|
||||||
|
pour le detail) :
|
||||||
|
|
||||||
|
- **CSV** (`--csv`), chemin de demarrage : lit directement `ml/data/all_sites_combined.csv`, le
|
||||||
|
jeu de donnees fourni pour le jalon J3. Ce dossier est ignore par git (gros fichier, local a
|
||||||
|
chaque poste) : recuperer le CSV et `dataset_metadata.json` aupres de l'equipe et les placer
|
||||||
|
dans `ml/data/` avant d'entrainer sur cette source.
|
||||||
|
- **PostgreSQL** (par defaut, sans `--csv`) : connexion directe a `reading` + `site` via
|
||||||
|
`ML_DATABASE_URL`, le chemin cible decrit dans `ML-START.md`. Le role PostgreSQL dedie
|
||||||
|
`enervision_ml` (lecture seule) n'est pas encore provisionne (dette assumee, cf. ADR 0003 et
|
||||||
|
ADR 0005) ; en attendant, pointer `ML_DATABASE_URL` vers la meme base que le backend suffit en
|
||||||
|
developpement.
|
||||||
|
|
||||||
|
## Entrainement
|
||||||
|
|
||||||
|
```bash
|
||||||
|
uv run python -m enervision_ml.train --csv data/all_sites_combined.csv
|
||||||
|
# ou, une fois la base peuplee et ML_DATABASE_URL positionnee :
|
||||||
|
uv run python -m enervision_ml.train
|
||||||
|
```
|
||||||
|
|
||||||
|
Ecrit le modele entraine dans `models/lightgbm-consumption.txt` (`Booster.save_model()`, dossier
|
||||||
|
ignore par git) et journalise la run dans MLflow : parametres, MAE/RMSE/MAPE du modele **et** de
|
||||||
|
la baseline de persistance saisonniere (consommation de la meme heure, une semaine avant), et
|
||||||
|
l'artefact modele. Sans `MLFLOW_TRACKING_URI`, MLflow ecrit dans un magasin SQLite local
|
||||||
|
(`./mlflow.db`, ignore par git) : `uv run mlflow ui` pour le consulter.
|
||||||
|
|
||||||
|
`--test-fraction` (0.15 par defaut) fixe la part la plus recente de l'historique reservee a la
|
||||||
|
validation. La coupure est **chronologique**, jamais un tirage aleatoire de lignes : un tirage
|
||||||
|
aleatoire laisserait des lignes de validation "voir" des lignes d'entrainement via leurs
|
||||||
|
lags/moyennes glissantes, une fuite qui masquerait un surapprentissage.
|
||||||
|
|
||||||
|
## Commandes
|
||||||
|
|
||||||
|
```bash
|
||||||
|
uv run ruff check . # lint
|
||||||
|
uv run ruff format . # format
|
||||||
|
uv run mypy enervision_ml tests # typage strict
|
||||||
|
uv run pytest # tests
|
||||||
|
```
|
||||||
|
|
||||||
|
Depuis la racine du monorepo, via le `Makefile` : `make install-ml`, `make ml-lint`,
|
||||||
|
`make ml-typecheck`, `make ml-test`, `make ml-check`, `make ml-train` (`CSV=chemin` optionnel).
|
||||||
|
|
||||||
|
## Ou ecrire les tests
|
||||||
|
|
||||||
|
Aucun test ne touche PostgreSQL ni un serveur MLflow distant : `enervision_ml.data.load_from_csv`
|
||||||
|
et le chargement CSV de test suffisent a exercer `build_features` sur des donnees reelles ou
|
||||||
|
synthetiques, et `enervision_ml.train.train()` accepte un `tracking_uri` SQLite isole (`tmp_path`
|
||||||
|
pytest) pour un test de bout en bout sans effet de bord. `enervision_ml.data.load_from_database`
|
||||||
|
n'est pas encore couvert : il n'existe aucune base PostgreSQL a interroger en CI ni dans cet
|
||||||
|
environnement de developpement pour le moment.
|
||||||
|
|
||||||
|
## Piege a connaitre
|
||||||
|
|
||||||
|
`enervision_ml.features.build_features` est **le seul endroit** qui doit construire les features
|
||||||
|
du modele, a l'entrainement comme au futur scoring (service #37, pas encore construit). Si les
|
||||||
|
deux divergent meme legerement (une fenetre de moyenne glissante calculee differemment, par
|
||||||
|
exemple), le modele recoit en production des features qui ne ressemblent plus a ce qu'il a
|
||||||
|
appris, et ses predictions deviennent silencieusement mauvaises sans qu'aucune erreur ne se
|
||||||
|
declenche. Ne jamais reecrire cette logique ailleurs : importer `enervision_ml.features`.
|
||||||
@@ -0,0 +1,16 @@
|
|||||||
|
"""Baseline de persistance saisonniere, la barre a depasser pour justifier LightGBM.
|
||||||
|
|
||||||
|
Predit la consommation de l'heure cible par celle de la meme heure, une semaine avant
|
||||||
|
(`consumption_kwh_lag_168h`) : une consommation energetique horaire est dominee par le cycle
|
||||||
|
hebdomadaire (jours ouvres contre week-end), donc ce naif-la est deja un concurrent serieux.
|
||||||
|
"""
|
||||||
|
|
||||||
|
import pandas as pd
|
||||||
|
|
||||||
|
from enervision_ml.features import TARGET_COLUMN
|
||||||
|
|
||||||
|
SEASONAL_LAG_COLUMN = f"{TARGET_COLUMN}_lag_168h"
|
||||||
|
|
||||||
|
|
||||||
|
def seasonal_persistence_predictions(features: pd.DataFrame) -> pd.Series:
|
||||||
|
return features[SEASONAL_LAG_COLUMN]
|
||||||
@@ -0,0 +1,38 @@
|
|||||||
|
"""Configuration minimale du pipeline, lue depuis l'environnement.
|
||||||
|
|
||||||
|
Pas de `BaseSettings` Pydantic ici : contrairement a `apps/backend`, ce n'est pas un service qui
|
||||||
|
tourne en continu mais un script CLI lance a la main (cf. `docs/ML-START.md`), donc pas de
|
||||||
|
surface de configuration a valider au demarrage d'un processus long.
|
||||||
|
"""
|
||||||
|
|
||||||
|
import os
|
||||||
|
|
||||||
|
# Piege : ce n'est pas `DATABASE_URL` (celui du backend applicatif, proprietaire du schema).
|
||||||
|
# `docs/ML-START.md` et l'ADR 0003 designent un role PostgreSQL dedie et restreint en lecture,
|
||||||
|
# `enervision_ml`, non encore provisionne (dette assumee). Reutiliser `DATABASE_URL` par defaut
|
||||||
|
# ferait tourner l'entrainement avec les droits d'ecriture complets de l'application, en
|
||||||
|
# silence.
|
||||||
|
ML_DATABASE_URL_ENV = "ML_DATABASE_URL"
|
||||||
|
|
||||||
|
MLFLOW_EXPERIMENT_NAME = "consumption-forecast"
|
||||||
|
MLFLOW_TRACKING_URI_ENV = "MLFLOW_TRACKING_URI"
|
||||||
|
|
||||||
|
|
||||||
|
def database_url() -> str:
|
||||||
|
valeur = os.environ.get(ML_DATABASE_URL_ENV)
|
||||||
|
if not valeur:
|
||||||
|
raise RuntimeError(
|
||||||
|
f"{ML_DATABASE_URL_ENV} n'est pas defini. Elle doit pointer vers un role "
|
||||||
|
"PostgreSQL en lecture seule sur `reading`/`site` (voir docs/ML-START.md)."
|
||||||
|
)
|
||||||
|
return valeur
|
||||||
|
|
||||||
|
|
||||||
|
def mlflow_tracking_uri() -> str | None:
|
||||||
|
"""`None` laisse MLflow choisir son magasin local par defaut.
|
||||||
|
|
||||||
|
Piege : ce n'est plus `./mlruns` en clair depuis MLflow 3 (magasin fichier "maintenance
|
||||||
|
mode", refuse une URI `file:` explicite sauf `MLFLOW_ALLOW_FILE_STORE=true`), mais une base
|
||||||
|
SQLite locale (`./mlflow.db`).
|
||||||
|
"""
|
||||||
|
return os.environ.get(MLFLOW_TRACKING_URI_ENV)
|
||||||
@@ -0,0 +1,68 @@
|
|||||||
|
"""Chargement des donnees d'entrainement.
|
||||||
|
|
||||||
|
Deux chemins, qui doivent produire le meme schema de sortie (colonnes `site_id`, `timestamp`,
|
||||||
|
`consumption_kwh`, `temperature_celsius`, `humidity_percent`, `solar_irradiance_wm2`,
|
||||||
|
`is_working_hours`, `site_type`, `capacity_kw`), consomme ensuite par `enervision_ml.features` :
|
||||||
|
|
||||||
|
- `load_from_database` : le chemin cible decrit dans `docs/ML-START.md`, connexion PostgreSQL
|
||||||
|
directe (`reading` + `site`), pas par l'API. C'est celui qu'utilisera le pipeline en
|
||||||
|
production, une fois le role PostgreSQL dedie `enervision_ml` provisionne (dette assumee,
|
||||||
|
documentee dans `CLAUDE.md` et l'ADR 0003 : pour l'instant, la meme chaine de connexion que le
|
||||||
|
backend applicatif convient en developpement).
|
||||||
|
- `load_from_csv` : chemin de demarrage, tant que la base locale n'est pas peuplee. Lit
|
||||||
|
directement `ml/data/all_sites_combined.csv` (jeu de donnees fourni pour le jalon J3, cf.
|
||||||
|
issue #89), le meme fichier que celui consomme par
|
||||||
|
`apps/backend/app/etl/historical_import.py`. `capacity_kw` n'existe pas dans ce CSV : la
|
||||||
|
colonne est renvoyee a `NaN`, que LightGBM gere nativement comme valeur manquante.
|
||||||
|
"""
|
||||||
|
|
||||||
|
from pathlib import Path
|
||||||
|
|
||||||
|
import pandas as pd
|
||||||
|
from sqlalchemy import text
|
||||||
|
from sqlalchemy.engine import Connectable
|
||||||
|
|
||||||
|
OUTPUT_COLUMNS = [
|
||||||
|
"site_id",
|
||||||
|
"timestamp",
|
||||||
|
"consumption_kwh",
|
||||||
|
"temperature_celsius",
|
||||||
|
"humidity_percent",
|
||||||
|
"solar_irradiance_wm2",
|
||||||
|
"is_working_hours",
|
||||||
|
"site_type",
|
||||||
|
"capacity_kw",
|
||||||
|
]
|
||||||
|
|
||||||
|
_READING_QUERY = text(
|
||||||
|
"""
|
||||||
|
SELECT
|
||||||
|
r.site_id,
|
||||||
|
r.timestamp,
|
||||||
|
r.consumption_kwh,
|
||||||
|
r.temperature_celsius,
|
||||||
|
r.humidity_percent,
|
||||||
|
r.solar_irradiance_wm2,
|
||||||
|
r.is_working_hours,
|
||||||
|
s.site_type,
|
||||||
|
s.capacity_kw
|
||||||
|
FROM reading r
|
||||||
|
JOIN site s ON s.site_id = r.site_id
|
||||||
|
ORDER BY r.site_id, r.timestamp
|
||||||
|
"""
|
||||||
|
)
|
||||||
|
|
||||||
|
|
||||||
|
def load_from_database(connection: Connectable) -> pd.DataFrame:
|
||||||
|
"""Lit l'historique complet `reading` + `site` depuis PostgreSQL."""
|
||||||
|
frame = pd.read_sql(_READING_QUERY, connection)
|
||||||
|
return frame[OUTPUT_COLUMNS]
|
||||||
|
|
||||||
|
|
||||||
|
def load_from_csv(csv_path: Path) -> pd.DataFrame:
|
||||||
|
"""Lit le jeu de donnees CSV historique (chemin de demarrage, hors base)."""
|
||||||
|
frame = pd.read_csv(csv_path, parse_dates=["timestamp"])
|
||||||
|
frame["capacity_kw"] = float("nan")
|
||||||
|
frame["is_working_hours"] = frame["is_working_hours"].astype(bool)
|
||||||
|
|
||||||
|
return frame[OUTPUT_COLUMNS]
|
||||||
@@ -0,0 +1,129 @@
|
|||||||
|
"""Construction des features pour le modele de consommation.
|
||||||
|
|
||||||
|
Module partage entre l'entrainement et le futur scoring (cf. `docs/ML-START.md`) : la fonction
|
||||||
|
qui construit les features doit rester strictement identique des deux cotes, sous peine de
|
||||||
|
"train/serve skew" silencieux (le modele recoit en production des features qui ne ressemblent
|
||||||
|
plus a ce qu'il a appris).
|
||||||
|
"""
|
||||||
|
|
||||||
|
from collections.abc import Sequence
|
||||||
|
|
||||||
|
import pandas as pd
|
||||||
|
|
||||||
|
# Cible de l'entrainement : consommation en kWh, jamais consumption_kw (absent des lectures
|
||||||
|
# historiques CSV, cf. `apps/backend/app/etl/historical_import.py`).
|
||||||
|
TARGET_COLUMN = "consumption_kwh"
|
||||||
|
|
||||||
|
# Decalages horaires utilises pour les lags et moyennes glissantes : une heure avant, un jour
|
||||||
|
# avant (meme heure), une semaine avant (meme heure, meme jour) - saisonnalites usuelles d'une
|
||||||
|
# consommation energetique horaire.
|
||||||
|
LAG_HOURS: Sequence[int] = (1, 24, 168)
|
||||||
|
ROLLING_WINDOWS_HOURS: Sequence[int] = (24, 168)
|
||||||
|
|
||||||
|
STATIC_FEATURE_COLUMNS: Sequence[str] = ("site_type", "capacity_kw")
|
||||||
|
|
||||||
|
CALENDAR_FEATURE_COLUMNS: Sequence[str] = (
|
||||||
|
"hour",
|
||||||
|
"day_of_week",
|
||||||
|
"month",
|
||||||
|
"is_weekend",
|
||||||
|
"is_working_hours",
|
||||||
|
)
|
||||||
|
|
||||||
|
WEATHER_COLUMNS: Sequence[str] = (
|
||||||
|
"temperature_celsius",
|
||||||
|
"humidity_percent",
|
||||||
|
"solar_irradiance_wm2",
|
||||||
|
)
|
||||||
|
|
||||||
|
|
||||||
|
def build_features(frame: pd.DataFrame) -> pd.DataFrame:
|
||||||
|
"""Construit la matrice de features a partir de lectures brutes triees par site.
|
||||||
|
|
||||||
|
`frame` doit porter au minimum : `site_id`, `timestamp`, `consumption_kwh`,
|
||||||
|
`is_working_hours`, les trois colonnes meteo, et les colonnes statiques de site
|
||||||
|
(`site_type`, `capacity_kw`). Une ligne par `(site_id, timestamp)`, sans doublon.
|
||||||
|
|
||||||
|
Piege : la meteo n'entre dans les features que decalee (lag/moyenne glissante), jamais a
|
||||||
|
l'instant cible. A l'entrainement comme au scoring, la meteo au moment predit n'est pas une
|
||||||
|
mesure mais une prevision que le projet n'a pas — l'utiliser telle quelle romprait le
|
||||||
|
contrat entre entrainement et usage reel (la feature ne serait tout simplement plus
|
||||||
|
disponible en production). Cf. debat d'architecture dans l'issue #89.
|
||||||
|
"""
|
||||||
|
travail = frame.sort_values(["site_id", "timestamp"]).reset_index(drop=True)
|
||||||
|
|
||||||
|
calendrier = _calendar_features(travail["timestamp"])
|
||||||
|
decalees = _lagged_features(travail)
|
||||||
|
|
||||||
|
features = pd.concat(
|
||||||
|
[
|
||||||
|
travail[["site_id", "timestamp"]],
|
||||||
|
travail[list(STATIC_FEATURE_COLUMNS)],
|
||||||
|
calendrier,
|
||||||
|
travail[["is_working_hours"]],
|
||||||
|
decalees,
|
||||||
|
travail[[TARGET_COLUMN]],
|
||||||
|
],
|
||||||
|
axis=1,
|
||||||
|
)
|
||||||
|
|
||||||
|
# `period_minutes` : resolution temporelle de la cible. Les lectures historiques sont toutes
|
||||||
|
# au pas horaire (cf. `dataset_metadata.json`, `frequency: "1h""), donc une constante pour
|
||||||
|
# l'instant. Exposee comme feature plutot que supposee implicitement, pour que le modele
|
||||||
|
# puisse un jour apprendre sur d'autres resolutions sans reentrainement de zero.
|
||||||
|
features["period_minutes"] = 60
|
||||||
|
|
||||||
|
return features
|
||||||
|
|
||||||
|
|
||||||
|
def feature_columns() -> list[str]:
|
||||||
|
"""Liste ordonnee des colonnes d'entree du modele (hors identifiants et cible)."""
|
||||||
|
lag_columns = [f"consumption_kwh_lag_{h}h" for h in LAG_HOURS]
|
||||||
|
rolling_columns = [
|
||||||
|
f"{colonne}_rolling_mean_{fenetre}h"
|
||||||
|
for colonne in (TARGET_COLUMN, *WEATHER_COLUMNS)
|
||||||
|
for fenetre in ROLLING_WINDOWS_HOURS
|
||||||
|
]
|
||||||
|
weather_lag_columns = [f"{colonne}_lag_1h" for colonne in WEATHER_COLUMNS]
|
||||||
|
|
||||||
|
return [
|
||||||
|
*STATIC_FEATURE_COLUMNS,
|
||||||
|
*CALENDAR_FEATURE_COLUMNS,
|
||||||
|
"period_minutes",
|
||||||
|
*lag_columns,
|
||||||
|
*rolling_columns,
|
||||||
|
*weather_lag_columns,
|
||||||
|
]
|
||||||
|
|
||||||
|
|
||||||
|
def _calendar_features(timestamps: pd.Series) -> pd.DataFrame:
|
||||||
|
instants = pd.to_datetime(timestamps)
|
||||||
|
|
||||||
|
return pd.DataFrame(
|
||||||
|
{
|
||||||
|
"hour": instants.dt.hour,
|
||||||
|
"day_of_week": instants.dt.dayofweek,
|
||||||
|
"month": instants.dt.month,
|
||||||
|
"is_weekend": instants.dt.dayofweek.isin([5, 6]).astype(int),
|
||||||
|
}
|
||||||
|
)
|
||||||
|
|
||||||
|
|
||||||
|
def _lagged_features(travail: pd.DataFrame) -> pd.DataFrame:
|
||||||
|
par_site = travail.groupby("site_id", sort=False)
|
||||||
|
colonnes: dict[str, pd.Series] = {}
|
||||||
|
|
||||||
|
for decalage in LAG_HOURS:
|
||||||
|
colonnes[f"{TARGET_COLUMN}_lag_{decalage}h"] = par_site[TARGET_COLUMN].shift(decalage)
|
||||||
|
|
||||||
|
for colonne in (TARGET_COLUMN, *WEATHER_COLUMNS):
|
||||||
|
decale = par_site[colonne].shift(1)
|
||||||
|
for fenetre in ROLLING_WINDOWS_HOURS:
|
||||||
|
colonnes[f"{colonne}_rolling_mean_{fenetre}h"] = decale.groupby(
|
||||||
|
travail["site_id"]
|
||||||
|
).transform(lambda serie, fenetre=fenetre: serie.rolling(fenetre, min_periods=1).mean())
|
||||||
|
|
||||||
|
for colonne in WEATHER_COLUMNS:
|
||||||
|
colonnes[f"{colonne}_lag_1h"] = par_site[colonne].shift(1)
|
||||||
|
|
||||||
|
return pd.DataFrame(colonnes, index=travail.index)
|
||||||
@@ -0,0 +1,24 @@
|
|||||||
|
"""Metriques de regression partagees entre le modele et la baseline."""
|
||||||
|
|
||||||
|
import numpy as np
|
||||||
|
import pandas as pd
|
||||||
|
from sklearn.metrics import mean_absolute_error, root_mean_squared_error
|
||||||
|
|
||||||
|
|
||||||
|
def regression_metrics(y_true: pd.Series, y_pred: pd.Series) -> dict[str, float]:
|
||||||
|
"""MAE, RMSE et MAPE (en %), sur les paires non nulles des deux series."""
|
||||||
|
valides = y_true.notna() & y_pred.notna()
|
||||||
|
reel = y_true[valides]
|
||||||
|
predit = y_pred[valides]
|
||||||
|
|
||||||
|
# MAPE diverge a consommation nulle : les mesures a zero (site a l'arret) sont exclues de ce
|
||||||
|
# seul ratio, pas des autres metriques.
|
||||||
|
non_nul = reel != 0
|
||||||
|
mape = float(np.mean(np.abs((reel[non_nul] - predit[non_nul]) / reel[non_nul])) * 100)
|
||||||
|
|
||||||
|
return {
|
||||||
|
"mae": float(mean_absolute_error(reel, predit)),
|
||||||
|
"rmse": float(root_mean_squared_error(reel, predit)),
|
||||||
|
"mape": mape,
|
||||||
|
"n_observations": int(valides.sum()),
|
||||||
|
}
|
||||||
@@ -0,0 +1,245 @@
|
|||||||
|
"""Entrainement du modele LightGBM de prevision de consommation energetique.
|
||||||
|
|
||||||
|
CLI autonome, sur le meme gabarit que `apps/backend/app/etl/historical_import.py`
|
||||||
|
(argparse, connexion directe a la base). Cf. `docs/ML-START.md`, section 1.
|
||||||
|
|
||||||
|
uv run python -m enervision_ml.train --csv ../ml/data/all_sites_combined.csv
|
||||||
|
uv run python -m enervision_ml.train # lit ML_DATABASE_URL
|
||||||
|
|
||||||
|
Le modele entraine est ecrit en fichier (`Booster.save_model()`) et suivi par MLflow (parametres,
|
||||||
|
metriques, artefact). La base ne stocke jamais le modele lui-meme, seulement une reference vers
|
||||||
|
lui (`prediction.model_reference`, pose par le futur service de scoring - hors perimetre ici).
|
||||||
|
"""
|
||||||
|
|
||||||
|
import argparse
|
||||||
|
from pathlib import Path
|
||||||
|
from typing import Any
|
||||||
|
|
||||||
|
import lightgbm as lgb
|
||||||
|
import mlflow
|
||||||
|
import mlflow.lightgbm
|
||||||
|
import pandas as pd
|
||||||
|
from sqlalchemy import create_engine
|
||||||
|
|
||||||
|
from enervision_ml import config
|
||||||
|
from enervision_ml.baseline import seasonal_persistence_predictions
|
||||||
|
from enervision_ml.data import load_from_csv, load_from_database
|
||||||
|
from enervision_ml.features import TARGET_COLUMN, build_features, feature_columns
|
||||||
|
from enervision_ml.metrics import regression_metrics
|
||||||
|
|
||||||
|
CATEGORICAL_FEATURES = ["site_type"]
|
||||||
|
|
||||||
|
LIGHTGBM_PARAMS: dict[str, Any] = {
|
||||||
|
"objective": "regression",
|
||||||
|
"metric": "mae",
|
||||||
|
"learning_rate": 0.05,
|
||||||
|
"num_leaves": 63,
|
||||||
|
"min_data_in_leaf": 50,
|
||||||
|
"feature_fraction": 0.8,
|
||||||
|
"bagging_fraction": 0.8,
|
||||||
|
"bagging_freq": 1,
|
||||||
|
"verbosity": -1,
|
||||||
|
}
|
||||||
|
|
||||||
|
NUM_BOOST_ROUND = 1000
|
||||||
|
EARLY_STOPPING_ROUNDS = 50
|
||||||
|
DEFAULT_TEST_FRACTION = 0.15
|
||||||
|
|
||||||
|
|
||||||
|
def load_raw_frame(csv_path: Path | None) -> pd.DataFrame:
|
||||||
|
"""Lit les lectures brutes, depuis le CSV de demarrage ou depuis PostgreSQL."""
|
||||||
|
if csv_path is not None:
|
||||||
|
return load_from_csv(csv_path)
|
||||||
|
|
||||||
|
engine = create_engine(config.database_url())
|
||||||
|
try:
|
||||||
|
return load_from_database(engine)
|
||||||
|
finally:
|
||||||
|
engine.dispose()
|
||||||
|
|
||||||
|
|
||||||
|
def chronological_split(
|
||||||
|
features: pd.DataFrame, test_fraction: float
|
||||||
|
) -> tuple[pd.DataFrame, pd.DataFrame]:
|
||||||
|
"""Coupe par date de coupure, jamais par tirage aleatoire de lignes.
|
||||||
|
|
||||||
|
Une coupure aleatoire laisserait des lignes d'apres la coupure "voir" des lignes d'avant via
|
||||||
|
leurs lags/moyennes glissantes, une fuite qui masquerait un surapprentissage a l'evaluation.
|
||||||
|
"""
|
||||||
|
coupure = features["timestamp"].quantile(1 - test_fraction)
|
||||||
|
entrainement = features[features["timestamp"] < coupure]
|
||||||
|
validation = features[features["timestamp"] >= coupure]
|
||||||
|
return entrainement, validation
|
||||||
|
|
||||||
|
|
||||||
|
def prepare_dataset(frame: pd.DataFrame, columns: list[str]) -> tuple[pd.DataFrame, pd.Series]:
|
||||||
|
typee = frame.copy()
|
||||||
|
typee["site_type"] = typee["site_type"].astype("category")
|
||||||
|
return typee[columns], typee[TARGET_COLUMN]
|
||||||
|
|
||||||
|
|
||||||
|
def train(
|
||||||
|
*,
|
||||||
|
csv_path: Path | None,
|
||||||
|
model_output: Path,
|
||||||
|
test_fraction: float = DEFAULT_TEST_FRACTION,
|
||||||
|
tracking_uri: str | None = None,
|
||||||
|
) -> tuple[dict[str, float], dict[str, float]]:
|
||||||
|
"""Execute le pipeline complet et rend (metriques du modele, metriques de la baseline)."""
|
||||||
|
raw = load_raw_frame(csv_path)
|
||||||
|
features = build_features(raw)
|
||||||
|
columns = feature_columns()
|
||||||
|
|
||||||
|
# Les premieres 168h par site n'ont pas de lag hebdomadaire complet : ni entrainables, ni
|
||||||
|
# comparables a la baseline saisonniere qui en depend.
|
||||||
|
utilisable = features.dropna(subset=[TARGET_COLUMN, f"{TARGET_COLUMN}_lag_168h"])
|
||||||
|
|
||||||
|
entrainement, validation = chronological_split(utilisable, test_fraction)
|
||||||
|
if entrainement.empty or validation.empty:
|
||||||
|
raise ValueError(
|
||||||
|
"Fenetre d'entrainement ou de validation vide : jeu de donnees trop court pour "
|
||||||
|
f"test_fraction={test_fraction}."
|
||||||
|
)
|
||||||
|
|
||||||
|
X_train, y_train = prepare_dataset(entrainement, columns)
|
||||||
|
X_valid, y_valid = prepare_dataset(validation, columns)
|
||||||
|
|
||||||
|
train_set = lgb.Dataset(
|
||||||
|
X_train,
|
||||||
|
label=y_train,
|
||||||
|
categorical_feature=CATEGORICAL_FEATURES,
|
||||||
|
free_raw_data=False,
|
||||||
|
)
|
||||||
|
valid_set = lgb.Dataset(
|
||||||
|
X_valid,
|
||||||
|
label=y_valid,
|
||||||
|
reference=train_set,
|
||||||
|
categorical_feature=CATEGORICAL_FEATURES,
|
||||||
|
free_raw_data=False,
|
||||||
|
)
|
||||||
|
|
||||||
|
booster = lgb.train(
|
||||||
|
LIGHTGBM_PARAMS,
|
||||||
|
train_set,
|
||||||
|
num_boost_round=NUM_BOOST_ROUND,
|
||||||
|
valid_sets=[valid_set],
|
||||||
|
callbacks=[
|
||||||
|
lgb.early_stopping(EARLY_STOPPING_ROUNDS, verbose=False),
|
||||||
|
lgb.log_evaluation(period=0),
|
||||||
|
],
|
||||||
|
)
|
||||||
|
|
||||||
|
predictions = pd.Series(
|
||||||
|
booster.predict(X_valid, num_iteration=booster.best_iteration),
|
||||||
|
index=X_valid.index,
|
||||||
|
)
|
||||||
|
model_metrics = regression_metrics(y_valid, predictions)
|
||||||
|
baseline_metrics = regression_metrics(y_valid, seasonal_persistence_predictions(validation))
|
||||||
|
|
||||||
|
model_output.parent.mkdir(parents=True, exist_ok=True)
|
||||||
|
booster.save_model(str(model_output))
|
||||||
|
|
||||||
|
_log_to_mlflow(
|
||||||
|
tracking_uri=tracking_uri,
|
||||||
|
booster=booster,
|
||||||
|
model_metrics=model_metrics,
|
||||||
|
baseline_metrics=baseline_metrics,
|
||||||
|
n_train=len(X_train),
|
||||||
|
n_valid=len(X_valid),
|
||||||
|
test_fraction=test_fraction,
|
||||||
|
model_output=model_output,
|
||||||
|
)
|
||||||
|
|
||||||
|
return model_metrics, baseline_metrics
|
||||||
|
|
||||||
|
|
||||||
|
def _log_to_mlflow(
|
||||||
|
*,
|
||||||
|
tracking_uri: str | None,
|
||||||
|
booster: lgb.Booster,
|
||||||
|
model_metrics: dict[str, float],
|
||||||
|
baseline_metrics: dict[str, float],
|
||||||
|
n_train: int,
|
||||||
|
n_valid: int,
|
||||||
|
test_fraction: float,
|
||||||
|
model_output: Path,
|
||||||
|
) -> None:
|
||||||
|
uri = tracking_uri or config.mlflow_tracking_uri()
|
||||||
|
if uri is not None:
|
||||||
|
mlflow.set_tracking_uri(uri)
|
||||||
|
mlflow.set_experiment(config.MLFLOW_EXPERIMENT_NAME)
|
||||||
|
|
||||||
|
with mlflow.start_run():
|
||||||
|
mlflow.log_params(
|
||||||
|
{
|
||||||
|
**LIGHTGBM_PARAMS,
|
||||||
|
"num_boost_round": booster.best_iteration or NUM_BOOST_ROUND,
|
||||||
|
"test_fraction": test_fraction,
|
||||||
|
"n_train": n_train,
|
||||||
|
"n_valid": n_valid,
|
||||||
|
}
|
||||||
|
)
|
||||||
|
mlflow.log_metrics({f"model_{cle}": valeur for cle, valeur in model_metrics.items()})
|
||||||
|
mlflow.log_metrics({f"baseline_{cle}": valeur for cle, valeur in baseline_metrics.items()})
|
||||||
|
mlflow.lightgbm.log_model(booster, name="model")
|
||||||
|
mlflow.log_artifact(str(model_output))
|
||||||
|
|
||||||
|
|
||||||
|
def parse_args() -> argparse.Namespace:
|
||||||
|
parser = argparse.ArgumentParser(description="Entrainement du modele LightGBM EnerVision")
|
||||||
|
|
||||||
|
parser.add_argument(
|
||||||
|
"--csv",
|
||||||
|
type=Path,
|
||||||
|
default=None,
|
||||||
|
help=(
|
||||||
|
"Chemin vers le CSV historique (chemin de demarrage). Omis, lit ML_DATABASE_URL "
|
||||||
|
"et se connecte directement a PostgreSQL (reading + site)."
|
||||||
|
),
|
||||||
|
)
|
||||||
|
parser.add_argument(
|
||||||
|
"--model-output",
|
||||||
|
type=Path,
|
||||||
|
default=Path("models/lightgbm-consumption.txt"),
|
||||||
|
help="Chemin d'ecriture du modele entraine. Defaut : models/lightgbm-consumption.txt.",
|
||||||
|
)
|
||||||
|
parser.add_argument(
|
||||||
|
"--test-fraction",
|
||||||
|
type=float,
|
||||||
|
default=DEFAULT_TEST_FRACTION,
|
||||||
|
help=(
|
||||||
|
"Part la plus recente de l'historique reservee a la validation. "
|
||||||
|
f"Defaut : {DEFAULT_TEST_FRACTION}."
|
||||||
|
),
|
||||||
|
)
|
||||||
|
parser.add_argument(
|
||||||
|
"--mlflow-tracking-uri",
|
||||||
|
default=None,
|
||||||
|
help="Surcharge MLFLOW_TRACKING_URI. Omis, magasin SQLite local (./mlflow.db).",
|
||||||
|
)
|
||||||
|
|
||||||
|
return parser.parse_args()
|
||||||
|
|
||||||
|
|
||||||
|
def main() -> None:
|
||||||
|
args = parse_args()
|
||||||
|
|
||||||
|
model_metrics, baseline_metrics = train(
|
||||||
|
csv_path=args.csv,
|
||||||
|
model_output=args.model_output,
|
||||||
|
test_fraction=args.test_fraction,
|
||||||
|
tracking_uri=args.mlflow_tracking_uri,
|
||||||
|
)
|
||||||
|
|
||||||
|
print("Modele LightGBM :", model_metrics)
|
||||||
|
print("Baseline saisonniere (t-168h) :", baseline_metrics)
|
||||||
|
|
||||||
|
if model_metrics["mae"] < baseline_metrics["mae"]:
|
||||||
|
gain = (1 - model_metrics["mae"] / baseline_metrics["mae"]) * 100
|
||||||
|
print(f"LightGBM bat la baseline de {gain:.1f}% de MAE.")
|
||||||
|
else:
|
||||||
|
print("LightGBM ne bat pas la baseline saisonniere sur ce decoupage.")
|
||||||
|
|
||||||
|
|
||||||
|
if __name__ == "__main__":
|
||||||
|
main()
|
||||||
@@ -0,0 +1,79 @@
|
|||||||
|
[project]
|
||||||
|
name = "enervision-ml"
|
||||||
|
version = "0.1.0"
|
||||||
|
description = "Pipeline d'entrainement et de scoring du modele de prediction EnerVision (LightGBM)"
|
||||||
|
requires-python = ">=3.14,<3.15"
|
||||||
|
dependencies = [
|
||||||
|
"pandas>=3.0.5",
|
||||||
|
"sqlalchemy>=2.0.52",
|
||||||
|
"psycopg[binary]>=3.2",
|
||||||
|
"lightgbm>=4.6",
|
||||||
|
"scikit-learn>=1.7",
|
||||||
|
"mlflow>=3.0",
|
||||||
|
]
|
||||||
|
|
||||||
|
[dependency-groups]
|
||||||
|
dev = [
|
||||||
|
"ruff>=0.16.7",
|
||||||
|
"mypy>=2.3.1",
|
||||||
|
"pytest>=9.1.1",
|
||||||
|
"pandas-stubs>=3.0.5.260914",
|
||||||
|
]
|
||||||
|
|
||||||
|
[build-system]
|
||||||
|
requires = ["hatchling>=1.32.0"]
|
||||||
|
build-backend = "hatchling.build"
|
||||||
|
|
||||||
|
[tool.hatch.build.targets.wheel]
|
||||||
|
packages = ["enervision_ml"]
|
||||||
|
|
||||||
|
[tool.ruff]
|
||||||
|
line-length = 100
|
||||||
|
target-version = "py314"
|
||||||
|
src = ["enervision_ml", "tests"]
|
||||||
|
|
||||||
|
[tool.ruff.lint]
|
||||||
|
select = [
|
||||||
|
"E", "W",
|
||||||
|
"F",
|
||||||
|
"I",
|
||||||
|
"N",
|
||||||
|
"UP",
|
||||||
|
"B",
|
||||||
|
"C4",
|
||||||
|
"SIM",
|
||||||
|
"TID",
|
||||||
|
"RUF",
|
||||||
|
"S",
|
||||||
|
"PT",
|
||||||
|
]
|
||||||
|
# N806 : `X`/`y` (donnees/cible) est la convention scikit-learn/LightGBM, pas une variable mal
|
||||||
|
# nommee.
|
||||||
|
ignore = ["B008", "N806"]
|
||||||
|
|
||||||
|
[tool.ruff.lint.per-file-ignores]
|
||||||
|
"tests/**/*.py" = ["S101"]
|
||||||
|
|
||||||
|
[tool.ruff.lint.isort]
|
||||||
|
known-first-party = ["enervision_ml"]
|
||||||
|
|
||||||
|
[tool.ruff.format]
|
||||||
|
quote-style = "double"
|
||||||
|
|
||||||
|
[tool.mypy]
|
||||||
|
python_version = "3.14"
|
||||||
|
strict = true
|
||||||
|
warn_unreachable = true
|
||||||
|
|
||||||
|
[[tool.mypy.overrides]]
|
||||||
|
module = ["tests.*"]
|
||||||
|
disallow_untyped_defs = false
|
||||||
|
|
||||||
|
[[tool.mypy.overrides]]
|
||||||
|
module = ["lightgbm.*", "mlflow.*", "sklearn.*"]
|
||||||
|
ignore_missing_imports = true
|
||||||
|
|
||||||
|
[tool.pytest.ini_options]
|
||||||
|
testpaths = ["tests"]
|
||||||
|
addopts = "-q --strict-markers -m 'not integration'"
|
||||||
|
markers = ["integration: requiert une base PostgreSQL joignable"]
|
||||||
@@ -0,0 +1,11 @@
|
|||||||
|
import pandas as pd
|
||||||
|
|
||||||
|
from enervision_ml.baseline import SEASONAL_LAG_COLUMN, seasonal_persistence_predictions
|
||||||
|
|
||||||
|
|
||||||
|
def test_seasonal_persistence_predictions_returns_the_168h_lag_column() -> None:
|
||||||
|
features = pd.DataFrame({SEASONAL_LAG_COLUMN: [1.0, 2.0, 3.0], "autre_colonne": [9, 9, 9]})
|
||||||
|
|
||||||
|
predictions = seasonal_persistence_predictions(features)
|
||||||
|
|
||||||
|
assert predictions.tolist() == [1.0, 2.0, 3.0]
|
||||||
@@ -0,0 +1,96 @@
|
|||||||
|
from datetime import UTC, datetime, timedelta
|
||||||
|
from typing import cast
|
||||||
|
|
||||||
|
import pandas as pd
|
||||||
|
|
||||||
|
from enervision_ml.features import TARGET_COLUMN, build_features, feature_columns
|
||||||
|
|
||||||
|
|
||||||
|
def make_site_reading(
|
||||||
|
site_id: str, *, heures: int, depart: datetime, valeur: float = 10.0
|
||||||
|
) -> pd.DataFrame:
|
||||||
|
instants = [depart + timedelta(hours=h) for h in range(heures)]
|
||||||
|
return pd.DataFrame(
|
||||||
|
{
|
||||||
|
"site_id": site_id,
|
||||||
|
"timestamp": instants,
|
||||||
|
TARGET_COLUMN: [valeur + h for h in range(heures)],
|
||||||
|
"temperature_celsius": [15.0] * heures,
|
||||||
|
"humidity_percent": [50.0] * heures,
|
||||||
|
"solar_irradiance_wm2": [0.0] * heures,
|
||||||
|
"is_working_hours": [True] * heures,
|
||||||
|
"site_type": "office",
|
||||||
|
"capacity_kw": 100.0,
|
||||||
|
}
|
||||||
|
)
|
||||||
|
|
||||||
|
|
||||||
|
def two_site_frame(heures: int = 200) -> pd.DataFrame:
|
||||||
|
depart = datetime(2026, 1, 1, tzinfo=UTC)
|
||||||
|
return pd.concat(
|
||||||
|
[
|
||||||
|
make_site_reading("site-a", heures=heures, depart=depart, valeur=10.0),
|
||||||
|
make_site_reading("site-b", heures=heures, depart=depart, valeur=1000.0),
|
||||||
|
],
|
||||||
|
ignore_index=True,
|
||||||
|
)
|
||||||
|
|
||||||
|
|
||||||
|
def test_build_features_returns_every_declared_feature_column() -> None:
|
||||||
|
features = build_features(two_site_frame())
|
||||||
|
|
||||||
|
manquantes = set(feature_columns()) - set(features.columns)
|
||||||
|
|
||||||
|
assert manquantes == set()
|
||||||
|
|
||||||
|
|
||||||
|
def test_build_features_sets_a_constant_period_minutes() -> None:
|
||||||
|
features = build_features(two_site_frame())
|
||||||
|
|
||||||
|
assert (features["period_minutes"] == 60).all()
|
||||||
|
|
||||||
|
|
||||||
|
def test_build_features_lag_1h_matches_the_previous_hour_of_the_same_site() -> None:
|
||||||
|
features = build_features(two_site_frame(heures=200))
|
||||||
|
site_a = features[features["site_id"] == "site-a"].reset_index(drop=True)
|
||||||
|
|
||||||
|
assert site_a.loc[10, f"{TARGET_COLUMN}_lag_1h"] == site_a.loc[9, TARGET_COLUMN]
|
||||||
|
|
||||||
|
|
||||||
|
def test_build_features_lag_168h_is_nan_before_a_full_week_of_history() -> None:
|
||||||
|
features = build_features(two_site_frame(heures=200))
|
||||||
|
site_a = features[features["site_id"] == "site-a"].reset_index(drop=True)
|
||||||
|
|
||||||
|
assert pd.isna(site_a.loc[100, f"{TARGET_COLUMN}_lag_168h"])
|
||||||
|
assert not pd.isna(site_a.loc[168, f"{TARGET_COLUMN}_lag_168h"])
|
||||||
|
|
||||||
|
|
||||||
|
def test_build_features_never_leaks_lags_across_sites() -> None:
|
||||||
|
# site-b demarre a 1000 : si un lag de site-a s'y glissait, la valeur sortirait de son
|
||||||
|
# echelle (10, 11, 12, ...).
|
||||||
|
features = build_features(two_site_frame(heures=200))
|
||||||
|
site_b = features[features["site_id"] == "site-b"].reset_index(drop=True)
|
||||||
|
|
||||||
|
assert cast(float, site_b.loc[5, f"{TARGET_COLUMN}_lag_1h"]) >= 1000.0
|
||||||
|
|
||||||
|
|
||||||
|
def test_build_features_rolling_mean_excludes_the_current_hour() -> None:
|
||||||
|
# Valeurs constantes sauf la derniere ligne : si la moyenne glissante incluait l'heure
|
||||||
|
# courante, la constante ne resterait pas stable jusqu'au bout.
|
||||||
|
depart = datetime(2026, 1, 1, tzinfo=UTC)
|
||||||
|
frame = make_site_reading("site-a", heures=200, depart=depart, valeur=10.0)
|
||||||
|
frame[TARGET_COLUMN] = 10.0
|
||||||
|
frame.loc[frame.index[-1], TARGET_COLUMN] = 10_000.0
|
||||||
|
|
||||||
|
features = build_features(frame).reset_index(drop=True)
|
||||||
|
|
||||||
|
assert features.loc[len(features) - 1, f"{TARGET_COLUMN}_rolling_mean_24h"] == 10.0
|
||||||
|
|
||||||
|
|
||||||
|
def test_build_features_computes_calendar_fields_from_the_timestamp() -> None:
|
||||||
|
depart = datetime(2026, 1, 3, 6, tzinfo=UTC) # un samedi, 6h
|
||||||
|
features = build_features(make_site_reading("site-a", heures=1, depart=depart))
|
||||||
|
|
||||||
|
assert features.loc[0, "hour"] == 6
|
||||||
|
assert features.loc[0, "day_of_week"] == 5
|
||||||
|
assert features.loc[0, "is_weekend"] == 1
|
||||||
@@ -0,0 +1,45 @@
|
|||||||
|
import pandas as pd
|
||||||
|
import pytest
|
||||||
|
|
||||||
|
from enervision_ml.metrics import regression_metrics
|
||||||
|
|
||||||
|
|
||||||
|
def test_regression_metrics_computes_mae_and_rmse_on_known_values() -> None:
|
||||||
|
y_true = pd.Series([10.0, 20.0, 30.0])
|
||||||
|
y_pred = pd.Series([12.0, 18.0, 33.0])
|
||||||
|
|
||||||
|
resultat = regression_metrics(y_true, y_pred)
|
||||||
|
|
||||||
|
assert resultat["mae"] == pytest.approx(7 / 3)
|
||||||
|
assert resultat["n_observations"] == 3
|
||||||
|
|
||||||
|
|
||||||
|
def test_regression_metrics_ignores_rows_with_a_missing_value() -> None:
|
||||||
|
y_true = pd.Series([10.0, None, 30.0])
|
||||||
|
y_pred = pd.Series([12.0, 18.0, None])
|
||||||
|
|
||||||
|
resultat = regression_metrics(y_true, y_pred)
|
||||||
|
|
||||||
|
assert resultat["n_observations"] == 1
|
||||||
|
assert resultat["mae"] == 2.0
|
||||||
|
|
||||||
|
|
||||||
|
def test_regression_metrics_excludes_zero_actuals_from_mape_only() -> None:
|
||||||
|
y_true = pd.Series([0.0, 10.0])
|
||||||
|
y_pred = pd.Series([5.0, 12.0])
|
||||||
|
|
||||||
|
resultat = regression_metrics(y_true, y_pred)
|
||||||
|
|
||||||
|
assert resultat["n_observations"] == 2
|
||||||
|
assert resultat["mape"] == pytest.approx(20.0)
|
||||||
|
|
||||||
|
|
||||||
|
def test_metrics_are_zero_for_a_perfect_prediction() -> None:
|
||||||
|
y_true = pd.Series([10.0, 20.0])
|
||||||
|
y_pred = pd.Series([10.0, 20.0])
|
||||||
|
|
||||||
|
resultat = regression_metrics(y_true, y_pred)
|
||||||
|
|
||||||
|
assert resultat["mae"] == 0.0
|
||||||
|
assert resultat["rmse"] == 0.0
|
||||||
|
assert resultat["mape"] == 0.0
|
||||||
@@ -0,0 +1,76 @@
|
|||||||
|
from datetime import UTC, datetime, timedelta
|
||||||
|
from pathlib import Path
|
||||||
|
|
||||||
|
import numpy as np
|
||||||
|
import pandas as pd
|
||||||
|
|
||||||
|
from enervision_ml.features import TARGET_COLUMN, build_features, feature_columns
|
||||||
|
from enervision_ml.train import chronological_split, prepare_dataset, train
|
||||||
|
|
||||||
|
|
||||||
|
def make_frame(site_id: str, *, heures: int, depart: datetime) -> pd.DataFrame:
|
||||||
|
instants = [depart + timedelta(hours=h) for h in range(heures)]
|
||||||
|
rng = np.random.default_rng(42)
|
||||||
|
|
||||||
|
return pd.DataFrame(
|
||||||
|
{
|
||||||
|
"site_id": site_id,
|
||||||
|
"timestamp": instants,
|
||||||
|
TARGET_COLUMN: 100.0 + 10.0 * np.sin(np.arange(heures) / 24) + rng.normal(0, 1, heures),
|
||||||
|
"temperature_celsius": 15.0,
|
||||||
|
"humidity_percent": 50.0,
|
||||||
|
"solar_irradiance_wm2": 0.0,
|
||||||
|
"is_working_hours": True,
|
||||||
|
"site_type": "office",
|
||||||
|
"capacity_kw": 100.0,
|
||||||
|
}
|
||||||
|
)
|
||||||
|
|
||||||
|
|
||||||
|
def test_chronological_split_puts_the_most_recent_rows_in_validation() -> None:
|
||||||
|
depart = datetime(2026, 1, 1, tzinfo=UTC)
|
||||||
|
features = make_frame("site-a", heures=200, depart=depart)
|
||||||
|
|
||||||
|
entrainement, validation = chronological_split(features, test_fraction=0.2)
|
||||||
|
|
||||||
|
assert entrainement["timestamp"].max() < validation["timestamp"].min()
|
||||||
|
# La coupure vient d'un quantile sur les dates : une approximation du taux demande, pas un
|
||||||
|
# decompte exact de lignes.
|
||||||
|
assert abs(len(validation) - 0.2 * len(features)) <= 2
|
||||||
|
|
||||||
|
|
||||||
|
def test_prepare_dataset_types_site_type_as_a_pandas_category() -> None:
|
||||||
|
depart = datetime(2026, 1, 1, tzinfo=UTC)
|
||||||
|
features = build_features(make_frame("site-a", heures=200, depart=depart))
|
||||||
|
|
||||||
|
X, y = prepare_dataset(features, feature_columns())
|
||||||
|
|
||||||
|
assert X["site_type"].dtype.name == "category"
|
||||||
|
assert y.name == TARGET_COLUMN
|
||||||
|
|
||||||
|
|
||||||
|
def test_train_runs_end_to_end_on_synthetic_data_and_beats_a_dummy_baseline(
|
||||||
|
tmp_path: Path,
|
||||||
|
) -> None:
|
||||||
|
depart = datetime(2026, 1, 1, tzinfo=UTC)
|
||||||
|
frame = pd.concat(
|
||||||
|
[
|
||||||
|
make_frame("site-a", heures=400, depart=depart),
|
||||||
|
make_frame("site-b", heures=400, depart=depart),
|
||||||
|
],
|
||||||
|
ignore_index=True,
|
||||||
|
)
|
||||||
|
csv_path = tmp_path / "synthetic.csv"
|
||||||
|
frame.to_csv(csv_path, index=False)
|
||||||
|
|
||||||
|
model_metrics, baseline_metrics = train(
|
||||||
|
csv_path=csv_path,
|
||||||
|
model_output=tmp_path / "model.txt",
|
||||||
|
test_fraction=0.2,
|
||||||
|
tracking_uri=f"sqlite:///{tmp_path / 'mlflow.db'}",
|
||||||
|
)
|
||||||
|
|
||||||
|
assert (tmp_path / "model.txt").exists()
|
||||||
|
assert model_metrics["n_observations"] > 0
|
||||||
|
assert model_metrics["mae"] >= 0
|
||||||
|
assert baseline_metrics["n_observations"] == model_metrics["n_observations"]
|
||||||
Generated
+1977
File diff suppressed because it is too large
Load Diff
Reference in New Issue
Block a user