diff --git a/argo/params.yaml b/argo/params.yaml index 483df1a..f999c67 100644 --- a/argo/params.yaml +++ b/argo/params.yaml @@ -8,7 +8,7 @@ # guarantee consistent S3 paths across steps. # --- Input ---------------------------------------------------------------- -input_file: s3://projet-budget-famille/data/workflow_inputs/BDF_data_tickets_appli_20260320_a_codif.csv +input_file: s3://projet-budget-famille/data/workflow_inputs/BDF_data_saisie_vague1_a_codif.csv #input_file: "" # mode evaluation text_column: NAT_DEP # label column to classify diff --git a/docs/_quarto.yml b/docs/_quarto.yml index 0bdb301..950fff2 100644 --- a/docs/_quarto.yml +++ b/docs/_quarto.yml @@ -41,6 +41,8 @@ website: text: Glossaire - href: slides.qmd text: Présentation + - href: ressources.qmd + text: Les ressources sidebar: style: docked search: true diff --git a/preprocessing/src/data/load_data.py b/preprocessing/src/data/load_data.py index 4540be6..708bbb6 100644 --- a/preprocessing/src/data/load_data.py +++ b/preprocessing/src/data/load_data.py @@ -187,7 +187,7 @@ def load_input_file(path: str, con) -> pd.DataFrame: if ext.endswith(".parquet"): df = con.sql(f"SELECT * FROM read_parquet('{path}')").to_df() else: - df = con.sql(f"SELECT * FROM read_csv_auto('{path}', delim=';')").to_df() + df = con.sql(f"SELECT * FROM read_csv_auto('{path}', delim=';', nullstr='NA')").to_df() return df