diff --git a/data/test.parquet.dvc b/data/test.parquet.dvc index 33dacd8..c1eedd1 100644 --- a/data/test.parquet.dvc +++ b/data/test.parquet.dvc @@ -1,5 +1,5 @@ outs: -- md5: 2f70e749c483c8c74cde844a69d52631 - size: 114542933 +- md5: 6ecb52ceb1d8322a91454aca4d902646 + size: 68171008 hash: md5 path: test.parquet diff --git a/data/train.parquet.dvc b/data/train.parquet.dvc index 12f2515..0f80ea5 100644 --- a/data/train.parquet.dvc +++ b/data/train.parquet.dvc @@ -1,5 +1,5 @@ outs: -- md5: b08dfd4b6aa3f59d68220a35110df0b0 - size: 216998722 +- md5: 24bf315461302605f8fd229eb263f499 + size: 115206905 hash: md5 path: train.parquet diff --git a/data/validation.parquet.dvc b/data/validation.parquet.dvc index 9cdfd10..ae6e557 100644 --- a/data/validation.parquet.dvc +++ b/data/validation.parquet.dvc @@ -1,5 +1,5 @@ outs: -- md5: 24bf315461302605f8fd229eb263f499 - size: 115206905 +- md5: 5b3f656605f48a8aabeb5b21a6ae27ca + size: 48074392 hash: md5 path: validation.parquet diff --git a/lab/constants.py b/lab/constants.py index 162d3d4..f777a6f 100644 --- a/lab/constants.py +++ b/lab/constants.py @@ -24,7 +24,7 @@ class SplitStrategy(StrEnum): # Strategie de split active : pilote a la fois le decoupage produit par split/cli.py # et le parametre "split_strategy" logge dans MLflow. On la modifie (et on committe) # a chaque changement de version de dataset pour synchroniser DVC et Git. -CHOSEN_SPLIT_STRATEGY = SplitStrategy.FULL_HISTORY +CHOSEN_SPLIT_STRATEGY = SplitStrategy.RECENT_HISTORY DatasetPart = Literal["train", "test", "validation"]