Développer des modèles en utilisant des techniques avancées de statistiques et d'apprentissage automatique pour fournir des informations et accompagner le processus décisionnel
Déterminer une représentation des données à l'aide de techniques d'ingénierie de caractéristiques (feature engineering) pour entraîner un modèle répondant à la problématique
Entraîner un modèle d'apprentissage supervisé ou non-supervisé à l'aide d'un ensemble de données représentées et en ajustant ses hyperparamètres pour améliorer ses performances et sa capacité à répondre de manière généralisée à une problématique
Établir une stratégie pour la création d'un modèle d'apprentissage en concevant ou réutilisant des modèles pré-entraînés (utilisant le transfert d'apprentissage), et entraîner ces modèles dans le but de résoudre une problématique métier spécifique
Evaluer les modèles d'apprentissage établis en utilisant des techniques de validations croisées et des métriques de performances afin de déterminer le modèle le plus adapté à la problématique métier
Communiquer les résultats des modèles en détaillant les liens avec les objectifs et en faisant preuve d'éthique et de transparence sur leurs limites afin d'accompagner les processus décisionnels
Assurer une veille technologique par des stratégies de surveillance des tendances et des innovations dans le domaine des sciences de la donnée afin de développer des idées novatrices et accompagner la résolution de problèmes
Modalités d'évaluation
Présentation de la mission en entreprise - Partie Ingénierie de caractéristiques (Feature Engineering) : Mission en situation réelle - Individuel. Le candidat, à partir des données transformées après ETL, applique des techniques dites de feature engineering, pour venir enrichir les données existantes de nouvelles variables ne figurant pas dans l'ensemble d'apprentissage, afin de les rendre exploitables par un modèle d'apprentissage qui viendra répondre à la problématique fixée. Les techniques utilisables sont : encodage (ex: One-Hot Encoding), mathématiques (ex: Transformations logarithmiques, scaling, normalisation...etc.), gestion des données manquantes, gestion des valeurs aberrantes (outliers), extraction de caractéristiques. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Analyse des données - Partie Ingénierie de caractéristiques (Feature Engineering) : En autonomie - Groupe de deux à trois candidats - Soutenance individuelle. Le candidat, à partir des données transformées fournies par le référent, applique des techniques dites de "feature engineering", pour venir enrichir les données existantes de nouvelles variables ne figurant pas dans l'ensemble d'apprentissage, afin de les rendre exploitables par un modèle d'apprentissage qui viendra répondre à la problématique fixée. Les techniques utilisables sont :encodage (ex: One-Hot Encoding), mathématiques (ex: Transformations logarithmiques, scaling, normalisation...etc.), gestion des données manquantes, gestion des valeurs aberrantes (outliers), extraction de caractéristiques. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie Ingénierie de caractéristiques (Feature Engineering) : En autonomie - Individuel. Le candidat, à partir des données transformées fournies par le référent, applique des techniques dites de "feature engineering", pour venir enrichir les données existantes de nouvelles variables ne figurant pas dans l'ensemble d'apprentissage, afin de les rendre exploitables par un modèle d'apprentissage qui viendra répondre à la problématique fixée. Les techniques utilisables sont :encodage (ex: One-Hot Encoding), mathématiques (ex: Transformations logarithmiques, scaling, normalisation...etc.), gestion des données manquantes, gestion des valeurs aberrantes (outliers), extraction de caractéristiques. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie Sélection et entraînement des Modèles d'apprentissage : Mission en situation réelle - Individuel. Le candidat, à partir de données transformées par ETL et enrichies par un processus de "feature engineering", identifie l'ensemble des modèles d'apprentissage (supervisé ou non) permettant de répondre à une problématique d'aide à la décision, et les entraînes pour qu'ils puissent fournir des informations à partir de données généralisées. Le candidat ajuste les hyper-paramètres des modèles en fonction d'évaluation de leurs performances, dans un processus itératif. Les modèles d'apprentissage possibles : Clustering, arbre de décision, régression (logistique, linéraire...etc.), Deep Learning, etc. Les techniques d'optimisation des hyperparamètres peuvent être : Grid Search, Random Search, Optimisation Bayesienne, etc. Lors de sa soutenance, le candidat justifie le choix des modèles et présente leur processus d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie Sélection et entraînement des Modèles d'apprentissage : En autonomie - Individuel. Le candidat, à partir de données transformées par ETL et enrichies par un processus de "feature engineering", identifie l'ensemble des modèles d'apprentissage (supervisé ou non) permettant de répondre à une problématique d'aide à la décision, et les entraînes pour qu'ils puissent fournir des informations à partir de données généralisées. Le candidat ajuste les hyper-paramètres des modèles en fonction d'évaluation de leurs performances, dans un processus itératif. Les modèles d'apprentissage possibles : Clustering, arbre de décision, régression (logistique, linéraire...etc.), Deep Learning, etc. Les techniques d'optimisation des hyperparamètres peuvent être : Grid Search, Random Search, Optimisation Bayesienne, etc. Lors de sa soutenance, le candidat justifie le choix des modèles et présente leur processus d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie Création des Modèles d'apprentissage : Mission en situation réelle - Individuel. Le candidat établit une stratégie pour la création d'un modèle d'apprentissage en concevant ou réutilisant des modèles pré-entraînés (utilisant le transfert d'apprentissage). Lors de sa soutenance, le candidat devra présenter sa stratégie de création de modèle, en mettant en avant les choix de conception et de réutilisation des modèles pré-entraînés. Il devra également exposer les performances obtenues par ses modèles sur les données de test, ainsi qu'une analyse des résultats et leur pertinence par rapport à la problématique métier. Une justification claire de ses décisions et de ses approches sera également attendue. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie création des Modèles d'apprentissage : En autonomie - Individuel. Le candidat établit une stratégie pour la création d'un modèle d'apprentissage en concevant ou réutilisant des modèles pré-entraînés (utilisant le transfert d'apprentissage). Lors de sa soutenance, le candidat devra présenter sa stratégie de création de modèle, en mettant en avant les choix de conception et de réutilisation des modèles pré-entraînés. Il devra également exposer les performances obtenues par ses modèles sur les données de test, ainsi qu'une analyse des résultats et leur pertinence par rapport à la problématique métier. Une justification claire de ses décisions et de ses approches sera également attendue. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieures à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie Evaluation des Modèles d'apprentissage : Mission en situation réelle - Individuel. Le candidat quantifie la précision de modèles d'apprentissage et la représentativité des données d'entrées à l'aide de métriques et des techniques d'évaluation de leurs performances respectives. Il identifie des situations précises concernant l'apprentissage des modèles : Overfitting (Sur-apprentissage), Underfitting (Sous-apprentissage), Goodfitting (Apprentissage correct), Unrepresentative Dataset (Données non représentatives). Finalement, il préconise des modifications à apporter, que ce soit au niveau des choix de modèles, des choix de données, des paramétrages, dans un processus itératif d'entraînement. Les métriques/techniques d'évaluation employées : Courbes d'apprentissage, Cross-Validation, courbe ROC (Receiver Operating Caracteristic), AUC (Area Under the Curve), F1-Score, Score de silhouettes, etc. Lors de sa soutenance, le candidat présente les métriques/techniques exploitées pour justifier la performance de ces modèles tout au long du processus itératif d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet DataScience - Partie Evaluation de Modèles d'apprentissage : En autonomie - Individuel. Le candidat quantifie la précision de modèles d'apprentissage et la représentativité des données d'entrées à l'aide de métriques et des techniques d'évaluation de leurs performances respectives. Il identifie des situations précises concernant l'apprentissage des modèles : Overfitting (Sur-apprentissage), Underfitting (Sous-apprentissage), Goodfitting (Apprentissage correct), Unrepresentative Dataset (Données non représentatives). Finalement, il préconise des modifications à apporter, que ce soit au niveau des choix de modèles, des choix de données, des paramétrages, dans un processus itératif d'entraînement.Les métriques/techniques d'évaluation employées : Courbes d'apprentissage, Cross-Validation, courbe ROC (Receiver Operating Caracteristic), AUC (Area Under the Curve), F1-Score, Score de silhouettes, etc. Lors de sa soutenance, le candidat présente les métriques/techniques exploitées pour justifier la performance de ces modèles tout au long du processus itératif d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieures à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie extraction et présentation des résultats : Mission en situation réelle - Individuel. Le candidat replace des résultats produits par des modèles d'apprentissages entraînés dans le contexte d'une problématique d'aide à la décision. Il les mets en lien et fournit une explication compréhensible par un corpus décisionnaire qui ne possède pas de notion de datascience. Pour cela, il vulgarise son discours, et s'appuie sur des faits, des rapports, des outils visuels (graphiques, KPI...), et en adoptant le vocabulaire du métier. Il fait preuve d'éthique et de transparence face à son auditoire, pour s'assurer de la compréhension par tous. La soutenance est partie intégrante de l'évaluation de cette compétence. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie extraction et présentation des résultats : En autonomie - Individuel. Le candidat replace des résultats produits par des modèles d'apprentissages entraînés dans le contexte d'une problématique d'aide à la décision. Il les mets en lien et fournit une explication compréhensible par un corpus décisionnaire qui ne possède pas de notion de datascience. Pour cela, il vulgarise son discours, et s'appuie sur des faits, des rapports, des outils visuels (graphiques, KPI...), et en adoptant le vocabulaire du métier. Il fait preuve d'éthique et de transparence face à son auditoire, pour s'assurer de la compréhension par tous. La soutenance est partie intégrante de l'évaluation de cette compétence. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieures à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Echange avec le jury sur des sujets d'actualités : Mission en situation réelle - Individuel. Lors d'un échange avec le jury, le candidat se voit poser des questions sur des sujets d'actualités autour de la data science et en lien avec la mission effectuée. Il doit y répondre en démontrant sa connaissance du sujet et des contextes qui y sont liés. Il présente en outre les outils et méthodes qu'il exploite pour assurer sa veille technologique (suivi des actualités, journaux, forums, conférences, recherche...etc.). Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification.