Éligible CPF
Oui, mobilisable au CPF
Une certification active au RNCP / RS est mobilisable au Compte Personnel de Formation.
Prise en charge apprentissage (NPEC)
Donnée non disponible
Aucun niveau de prise en charge publié pour ce code dans le référentiel NPEC.
11
Certifiés
64 %
Insertion globale 6 mois
—
Dans le métier 2 ans
| Promotion | Certifiés | dont VAE | Insertion 6 mois | Métier 2 ans |
|---|---|---|---|---|
| 2023 | 11 | 0 | 64 % | — |
| 2022 | 21 | 0 | 60 % | — |
| 2021 | 16 | 0 | 64 % | — |
+ 1 organisme partenaire habilité à préparer / délivrer.
Télécharger la liste complète (Excel)Modalités d'évaluation : Présentation de la mission en entreprise - Partie définition du besoin : Mission en situation réelle - Individuel. Le candidat doit présenter le cahier des charges issue de la problématique soumise par l'entreprise. Ce cahier des charges établit des objectifs chiffrés et les contraintes liées au projet (techniques, technologiques, budgétaires, juridiques, délais, politiques...). Au travers de sa présentation, le candidat démontre sa compréhension du besoin métier et du contexte dans lequel il s'inscrit, de ces interlocuteurs, ainsi que les objectifs fixés. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie Etat de l'Art : Mission en situation réelle - Individuel. Le candidat présente l'existant en entreprise et son historique, en matière d'acquisition, d'intégration et d'exploitation des données. Il identifie les caractéristiques en lien avec la problématique pour pouvoir y répondre. Si l'infrastructure initiale ne permet pas de répondre à la problématique, il propose des solutions techniques et/ou méthodologiques pour pallier à ce manque. Il justifie ses choix par un argumentaire technique mais aussi temporel, budgétaire, managérial, juridique, etc. Lors de sa soutenance, le candidat doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière les éléments du contexte, de la problématique et des éléments de justification. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science réalisé en Centre - Partie choix de la solution technique : En autonomie - Projet individuel. Face à une problématique imposée par l'évaluateur et des données fournies, le candidat doit présenter une liste de solutions potentielles, leurs caractéristiques spécifiques et leur capacité à répondre au besoin. Il doit exposer les limites de chacune des solutions et justifier le choix de l'une d'entre-elles par un argumentaire technique mais aussi temporel, budgétaire, managériale, juridique, etc. Lors de sa soutenance, le candidat doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière les éléments du contexte, de la problématique et des éléments de justification. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification.
Repérés par proximité sémantique. Utile pour situer votre offre, vos concurrents et d'éventuelles passerelles.
Source : répertoires nationaux France Compétences (open data data.gouv.fr), schéma v4.1. Adéqua restitue la donnée telle qu'enregistrée ; il n'est pas un service public et n'emporte aucun agrément.
Certifiés
11
Insertion 6 mois
64%
Métier 2 ans
—
Modalités d'évaluation : Présentation de la mission en entreprise - Partie cartographie : Mission en situation réelle - Présentation individuelle. Le candidat présente l'ensemble des flux de données ainsi que leur structure, leurs sources, leurs caractéristiques, leur conformité aux normes RGPD, etc., dans la structure d'accueil à l'aide d'outils standards et des modèles logiques. Il s'appuie sur sa production pour identifier les éléments permettant de répondre à la problématique et, le cas échéant, justifie une transformation de ces données afin qu'elles puissent être exploitées dans ce cadre. Lors de sa soutenance, le candidat doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Intégration des données - Partie cartographie : En autonomie - En groupe de deux à trois candidats - Soutenances individuelles. Le groupe se voit proposer un jeu de données brutes (différents formats, structures...etc.) dans une problématique d'intégration de celles-ci. Ils doivent exposer les éléments permettant leur mise en relation et justifiant un jeu de données unifié et standardisé, à l'aide d'outils standards et de modèles logiques. Lors de sa soutenance, le candidat doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie supervision technique : Mission en situation réelle - Individuel. Le candidat, en collaboration avec des équipes technique, suit et participe à la mise en place des systèmes d'acquisition, de transfert et de stockage des données (data lake) afin de répondre à la problématique d'intégration, tout en assurant le respect des normes de sécurité et juridiques telles que les normes RGPD. Il s'appuie sur une expression écrite de ses besoins, des outils de gestion de projet et une posture professionnelle, ouverte et transparente pour mener à bien le projet. Il supervise les tests de ces infrastructures et produit une synthèse en conséquence. Lors de sa soutenance, le candidat présente sa démarche, le lien avec la problématique, les différentes phases du projet, les résultats des tests, et expose la synthèse de ses travaux. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie ETL : Mission en situation réelle - Individuel. Le candidat, à partir d'un ensemble de données brutes (ex: data lake) fourni par la structure d'accueil, et s'appuyant sur une conception technique vis-à-vis d'une problématique donnée, met en place un pipeline ETL permettant d'extraire des données les caractéristiques répondant à la problématique et de les transformer en vue d'une exploitation. Il utilise pour cela des outils standards (Talend, Alteryx...etc.). Lors de sa soutenance, le candidat présente le pipeline en question avec les différentes étapes d'extraction et de transformation, et leurs justifications. Il présente le jeu de données en sortie. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Intégration des données - Partie ETL : Mission en situation réelle - Groupe de deux à trois candidats - Soutenance individuelle. Le candidat, à partir d'un ensemble de données brutes (ex: data lake) qu'il a constitué, et s'appuyant sur une conception technique vis-à-vis d'une problématique donnée, met en place un pipeline ETL permettant d'extraire des données les caractéristiques répondant à la problématique et de les transformer en vue d'une exploitation. Il utilise pour cela des outils standards (Talend, Alteryx...etc.). Lors de sa soutenance, le candidat présente le pipeline en question avec les différentes étapes d'extraction et de transformation, et leurs justifications. Il présente le jeu de données en sortie. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet DataScience - Partie ETL : En autonomie - Individuel. Le candidat, à partir d'un ensemble de données brutes (ex: data lake) qu'il a constitué, et s'appuyant sur une conception technique vis-à-vis d'une problématique donnée, met en place un pipeline ETL permettant d'extraire des données les caractéristiques répondant à la problématique et de les transformer en vue d'une exploitation. Il utilise pour cela des outils standards (Talend, Alteryx...etc.). Lors de sa soutenance, le candidat présente le pipeline en question avec les différentes étapes d'extraction et de transformation, et leurs justifications. Il présente le jeu de données en sortie. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification.
Modalités d'évaluation : Présentation de la mission en entreprise - Partie analyse des données : Mission en situation réelle - Individuel. Le candidat, à partir des données transformées, applique, pour mettre en valeur des informations en lien avec la problématique, un ensemble de techniques statistiques telles que : Matrices de corrélation, ACP (Analyse par Composante Principale), Test ANOVA (Analyse de la Variance), Analyse univariée, Analyse multivariée. Il en présente les informations extraites et les analyses qui peuvent en découler. À travers ses travaux, il démontre sa maîtrise des différentes techniques et de leur contexte d'application, et est capable de présenter leurs limites. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Analyse des données : En autonomie - Groupe de deux à trois candidats - Soutenance individuelle. Le candidat, à partir des données transformées, applique, pour mettre en valeur des informations en lien avec la problématique, un ensemble de techniques statistiques telles que : Matrices de corrélation, ACP (Analyse par Composante Principale), Test ANOVA (Analyse de la Variance), Analyse univariée, Analyse multivariée. Il en présente les informations extraites et les analyses qui peuvent en découler. À travers ses travaux, il démontre sa maîtrise des différentes techniques et de leur contexte d'application, et est capable de présenter leurs limites. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie analyse des données : En autonomie - Individuel. Le candidat, à partir des données transformées, applique, pour mettre en valeur des informations en lien avec la problématique, un ensemble de techniques statistiques telles que : Matrices de corrélation, ACP (Analyse par Composante Principale), Test ANOVA (Analyse de la Variance), Analyse univariée, Analyse multivariée. Il en présente les informations extraites et les analyses qui peuvent en découler. À travers ses travaux, il démontre sa maîtrise des différentes techniques et de leur contexte d'application, et est capable de présenter leurs limites. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie visualisation des données : Mission en situation réelle - Individuel. Le candidat à l'aide d'outils standards, doit concevoir et déployer des tableaux de bord permettant une visualisation d'informations, de KPI, afin de mettre en place une démarche de "data storytelling" (une interprétation vulgarisée) auprès des décisionnaires. Ces informations sont issues des données transformées et/ou des analyses qui en ont été faites. Les outils utilisés servent la création de rapports et de représentation de données (Power BI, Tableaux...etc.). L'ensemble des productions respecte les principes de l'accessibilité numérique pour favoriser l'inclusivité, conformément au référentiel RG2A (Référentiel Général d'Amélioration de l'Accessibilité). Lors de sa soutenance, le candidat présente ses travaux, les informations issues de ces tableaux de bord, et les exploite dans un data storytelling en lien avec la problématique de la mission. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Visualisation des données : En autonomie - Groupe de deux à trois candidats - Soutenance individuelle. Le candidat à l'aide d'outils standards, doit concevoir et déployer des tableaux de bord permettant une visualisation d'informations, de KPI, afin de mettre en place une démarche de "data storytelling" (une interprétation vulgarisée) auprès des décisionnaires. Ces informations sont fournies par l'encadrant du projet. Le contexte dont celles-ci sont issues, soient les données transformées et/ou des analyses, est précisé. Les outils utilisés servent la création de rapports et de représentation de données (Power BI, Tableaux...etc.). L'ensemble des productions respecte les principes de l'accessibilité numérique pour favoriser l'inclusivité, conformément au référentiel RG2A (Référentiel Général d'Amélioration de l'Accessibilité). Lors de sa soutenance, le candidat présente ses travaux, les informations issues de ces tableaux de bord, et les exploite dans un data storytelling en lien avec la problématique du projet. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie visualisation des données : En autonomie - Individuel. Le candidat à l'aide d'outils standards, doit concevoir et déployer des tableaux de bord permettant une visualisation d'informations, de KPI, afin de mettre en place une démarche de "data storytelling" (une interprétation vulgarisée) auprès des décisionnaires. Ces informations sont issues des données transformées et/ou des analyses qui en ont été faites. Les outils utilisés servent la création de rapports et de représentation de données (Power BI, Tableaux...etc.). L'ensemble des productions respecte les principes de l'accessibilité numérique pour favoriser l'inclusivité, conformément au référentiel RG2A (Référentiel Général d'Amélioration de l'Accessibilité). Lors de sa soutenance, le candidat présente ses travaux, les informations issues de ces tableaux de bord, et les exploite dans un data storytelling en lien avec la problématique du projet. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification.
Modalités d'évaluation : Présentation de la mission en entreprise - Partie Ingénierie de caractéristiques (Feature Engineering) : Mission en situation réelle - Individuel. Le candidat, à partir des données transformées après ETL, applique des techniques dites de feature engineering, pour venir enrichir les données existantes de nouvelles variables ne figurant pas dans l'ensemble d'apprentissage, afin de les rendre exploitables par un modèle d'apprentissage qui viendra répondre à la problématique fixée. Les techniques utilisables sont : encodage (ex: One-Hot Encoding), mathématiques (ex: Transformations logarithmiques, scaling, normalisation...etc.), gestion des données manquantes, gestion des valeurs aberrantes (outliers), extraction de caractéristiques. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Analyse des données - Partie Ingénierie de caractéristiques (Feature Engineering) : En autonomie - Groupe de deux à trois candidats - Soutenance individuelle. Le candidat, à partir des données transformées fournies par le référent, applique des techniques dites de "feature engineering", pour venir enrichir les données existantes de nouvelles variables ne figurant pas dans l'ensemble d'apprentissage, afin de les rendre exploitables par un modèle d'apprentissage qui viendra répondre à la problématique fixée. Les techniques utilisables sont :encodage (ex: One-Hot Encoding), mathématiques (ex: Transformations logarithmiques, scaling, normalisation...etc.), gestion des données manquantes, gestion des valeurs aberrantes (outliers), extraction de caractéristiques. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie Ingénierie de caractéristiques (Feature Engineering) : En autonomie - Individuel. Le candidat, à partir des données transformées fournies par le référent, applique des techniques dites de "feature engineering", pour venir enrichir les données existantes de nouvelles variables ne figurant pas dans l'ensemble d'apprentissage, afin de les rendre exploitables par un modèle d'apprentissage qui viendra répondre à la problématique fixée. Les techniques utilisables sont :encodage (ex: One-Hot Encoding), mathématiques (ex: Transformations logarithmiques, scaling, normalisation...etc.), gestion des données manquantes, gestion des valeurs aberrantes (outliers), extraction de caractéristiques. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie Sélection et entraînement des Modèles d'apprentissage : Mission en situation réelle - Individuel. Le candidat, à partir de données transformées par ETL et enrichies par un processus de "feature engineering", identifie l'ensemble des modèles d'apprentissage (supervisé ou non) permettant de répondre à une problématique d'aide à la décision, et les entraînes pour qu'ils puissent fournir des informations à partir de données généralisées. Le candidat ajuste les hyper-paramètres des modèles en fonction d'évaluation de leurs performances, dans un processus itératif. Les modèles d'apprentissage possibles : Clustering, arbre de décision, régression (logistique, linéraire...etc.), Deep Learning, etc. Les techniques d'optimisation des hyperparamètres peuvent être : Grid Search, Random Search, Optimisation Bayesienne, etc. Lors de sa soutenance, le candidat justifie le choix des modèles et présente leur processus d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie Sélection et entraînement des Modèles d'apprentissage : En autonomie - Individuel. Le candidat, à partir de données transformées par ETL et enrichies par un processus de "feature engineering", identifie l'ensemble des modèles d'apprentissage (supervisé ou non) permettant de répondre à une problématique d'aide à la décision, et les entraînes pour qu'ils puissent fournir des informations à partir de données généralisées. Le candidat ajuste les hyper-paramètres des modèles en fonction d'évaluation de leurs performances, dans un processus itératif. Les modèles d'apprentissage possibles : Clustering, arbre de décision, régression (logistique, linéraire...etc.), Deep Learning, etc. Les techniques d'optimisation des hyperparamètres peuvent être : Grid Search, Random Search, Optimisation Bayesienne, etc. Lors de sa soutenance, le candidat justifie le choix des modèles et présente leur processus d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie Création des Modèles d'apprentissage : Mission en situation réelle - Individuel. Le candidat établit une stratégie pour la création d'un modèle d'apprentissage en concevant ou réutilisant des modèles pré-entraînés (utilisant le transfert d'apprentissage). Lors de sa soutenance, le candidat devra présenter sa stratégie de création de modèle, en mettant en avant les choix de conception et de réutilisation des modèles pré-entraînés. Il devra également exposer les performances obtenues par ses modèles sur les données de test, ainsi qu'une analyse des résultats et leur pertinence par rapport à la problématique métier. Une justification claire de ses décisions et de ses approches sera également attendue. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie création des Modèles d'apprentissage : En autonomie - Individuel. Le candidat établit une stratégie pour la création d'un modèle d'apprentissage en concevant ou réutilisant des modèles pré-entraînés (utilisant le transfert d'apprentissage). Lors de sa soutenance, le candidat devra présenter sa stratégie de création de modèle, en mettant en avant les choix de conception et de réutilisation des modèles pré-entraînés. Il devra également exposer les performances obtenues par ses modèles sur les données de test, ainsi qu'une analyse des résultats et leur pertinence par rapport à la problématique métier. Une justification claire de ses décisions et de ses approches sera également attendue. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieures à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie Evaluation des Modèles d'apprentissage : Mission en situation réelle - Individuel. Le candidat quantifie la précision de modèles d'apprentissage et la représentativité des données d'entrées à l'aide de métriques et des techniques d'évaluation de leurs performances respectives. Il identifie des situations précises concernant l'apprentissage des modèles : Overfitting (Sur-apprentissage), Underfitting (Sous-apprentissage), Goodfitting (Apprentissage correct), Unrepresentative Dataset (Données non représentatives). Finalement, il préconise des modifications à apporter, que ce soit au niveau des choix de modèles, des choix de données, des paramétrages, dans un processus itératif d'entraînement. Les métriques/techniques d'évaluation employées : Courbes d'apprentissage, Cross-Validation, courbe ROC (Receiver Operating Caracteristic), AUC (Area Under the Curve), F1-Score, Score de silhouettes, etc. Lors de sa soutenance, le candidat présente les métriques/techniques exploitées pour justifier la performance de ces modèles tout au long du processus itératif d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet DataScience - Partie Evaluation de Modèles d'apprentissage : En autonomie - Individuel. Le candidat quantifie la précision de modèles d'apprentissage et la représentativité des données d'entrées à l'aide de métriques et des techniques d'évaluation de leurs performances respectives. Il identifie des situations précises concernant l'apprentissage des modèles : Overfitting (Sur-apprentissage), Underfitting (Sous-apprentissage), Goodfitting (Apprentissage correct), Unrepresentative Dataset (Données non représentatives). Finalement, il préconise des modifications à apporter, que ce soit au niveau des choix de modèles, des choix de données, des paramétrages, dans un processus itératif d'entraînement.Les métriques/techniques d'évaluation employées : Courbes d'apprentissage, Cross-Validation, courbe ROC (Receiver Operating Caracteristic), AUC (Area Under the Curve), F1-Score, Score de silhouettes, etc. Lors de sa soutenance, le candidat présente les métriques/techniques exploitées pour justifier la performance de ces modèles tout au long du processus itératif d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieures à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie extraction et présentation des résultats : Mission en situation réelle - Individuel. Le candidat replace des résultats produits par des modèles d'apprentissages entraînés dans le contexte d'une problématique d'aide à la décision. Il les mets en lien et fournit une explication compréhensible par un corpus décisionnaire qui ne possède pas de notion de datascience. Pour cela, il vulgarise son discours, et s'appuie sur des faits, des rapports, des outils visuels (graphiques, KPI...), et en adoptant le vocabulaire du métier. Il fait preuve d'éthique et de transparence face à son auditoire, pour s'assurer de la compréhension par tous. La soutenance est partie intégrante de l'évaluation de cette compétence. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie extraction et présentation des résultats : En autonomie - Individuel. Le candidat replace des résultats produits par des modèles d'apprentissages entraînés dans le contexte d'une problématique d'aide à la décision. Il les mets en lien et fournit une explication compréhensible par un corpus décisionnaire qui ne possède pas de notion de datascience. Pour cela, il vulgarise son discours, et s'appuie sur des faits, des rapports, des outils visuels (graphiques, KPI...), et en adoptant le vocabulaire du métier. Il fait preuve d'éthique et de transparence face à son auditoire, pour s'assurer de la compréhension par tous. La soutenance est partie intégrante de l'évaluation de cette compétence. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieures à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Echange avec le jury sur des sujets d'actualités : Mission en situation réelle - Individuel. Lors d'un échange avec le jury, le candidat se voit poser des questions sur des sujets d'actualités autour de la data science et en lien avec la mission effectuée. Il doit y répondre en démontrant sa connaissance du sujet et des contextes qui y sont liés. Il présente en outre les outils et méthodes qu'il exploite pour assurer sa veille technologique (suivi des actualités, journaux, forums, conférences, recherche...etc.). Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification.
Modalités d'évaluation : Présentation de la mission en entreprise - Echange avec le jury sur la collaboration avec les équipes : Mission en situation réelle - Individuel. Lors d'un échange avec le jury, le candidat se voit poser des questions sur les échanges et les interactions qu'il a pu avoir avec des interlocuteurs dans l'entreprise et/ou externes à celle-ci. Il doit y répondre en présentant le contexte de ces interactions, et en démontrant sa capacité à s'adapter à ses interlocuteurs, en adoptant une posture qui favorise la transmission des informations et l'engagement dans le projet. Il explique les outils et les méthodes employées lors de la communication de ses travaux et résultats. Les difficultés rencontrées dans les échanges et leur résolution sont exposées. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie définition de la gestion du projet : Mission en situation réelle - Individuel. Le candidat doit présenter, à partir du cahier des charges validé par l'entreprise, la stratégie et les outils de développement du projet. Il doit présenter : le planning (ex: Gantt) du développement du projet, les responsabilités de chacun des interlocuteurs du projet, les indicateurs clés et des outils de gestion pour suivre l'avancement du projet et le respect des contraintes, les outils de communication et d'échanges avec le client et les interlocuteurs pour anticiper les problématiques liées au projet. Les candidats ont pour contraintes : d'assurer le respect des budgets, des niveaux de qualités, et des délais associés au projet, de favoriser le travail collaboratif, d'adopter une posture professionnelle et inclusive dans les échanges qu'ils peuvent avoir, et de démontrer leur capacité à exploiter des outils standards de gestion de projet. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification.
RNCP39590BC01Analyser les besoins métiers de la structure en matière d'accompagnement décisionnel afin d'établir une stratégie globale de transformation de la donnée prenant en compte les contraintes sociales, économiques et environnementales
Évaluation : Présentation de la mission en entreprise - Partie définition du besoin : Mission en situation réelle - Individuel. Le candidat doit présenter le cahier des charges issue de la problématique soumise par l'entreprise. Ce cahier des charges établit des objectifs chiffrés et les contraintes liées au projet (techniques, technologiques, budgétaires, juridiques, délais, politiques...). Au travers de sa présentation, le candidat démontre sa compréhension du besoin métier et du contexte dans lequel il s'inscrit, de ces interlocuteurs, ainsi que les objectifs fixés. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie Etat de l'Art : Mission en situation réelle - Individuel. Le candidat présente l'existant en entreprise et son historique, en matière d'acquisition, d'intégration et d'exploitation des données. Il identifie les caractéristiques en lien avec la problématique pour pouvoir y répondre. Si l'infrastructure initiale ne permet pas de répondre à la problématique, il propose des solutions techniques et/ou méthodologiques pour pallier à ce manque. Il justifie ses choix par un argumentaire technique mais aussi temporel, budgétaire, managérial, juridique, etc. Lors de sa soutenance, le candidat doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière les éléments du contexte, de la problématique et des éléments de justification. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science réalisé en Centre - Partie choix de la solution technique : En autonomie - Projet individuel. Face à une problématique imposée par l'évaluateur et des données fournies, le candidat doit présenter une liste de solutions potentielles, leurs caractéristiques spécifiques et leur capacité à répondre au besoin. Il doit exposer les limites de chacune des solutions et justifier le choix de l'une d'entre-elles par un argumentaire technique mais aussi temporel, budgétaire, managériale, juridique, etc. Lors de sa soutenance, le candidat doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière les éléments du contexte, de la problématique et des éléments de justification. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification.
RNCP39590BC02Piloter la remontée et l'intégrité des données en collaborant avec les équipes techniques en vue de leur exploitation
Évaluation : Présentation de la mission en entreprise - Partie cartographie : Mission en situation réelle - Présentation individuelle. Le candidat présente l'ensemble des flux de données ainsi que leur structure, leurs sources, leurs caractéristiques, leur conformité aux normes RGPD, etc., dans la structure d'accueil à l'aide d'outils standards et des modèles logiques. Il s'appuie sur sa production pour identifier les éléments permettant de répondre à la problématique et, le cas échéant, justifie une transformation de ces données afin qu'elles puissent être exploitées dans ce cadre. Lors de sa soutenance, le candidat doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Intégration des données - Partie cartographie : En autonomie - En groupe de deux à trois candidats - Soutenances individuelles. Le groupe se voit proposer un jeu de données brutes (différents formats, structures...etc.) dans une problématique d'intégration de celles-ci. Ils doivent exposer les éléments permettant leur mise en relation et justifiant un jeu de données unifié et standardisé, à l'aide d'outils standards et de modèles logiques. Lors de sa soutenance, le candidat doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie supervision technique : Mission en situation réelle - Individuel. Le candidat, en collaboration avec des équipes technique, suit et participe à la mise en place des systèmes d'acquisition, de transfert et de stockage des données (data lake) afin de répondre à la problématique d'intégration, tout en assurant le respect des normes de sécurité et juridiques telles que les normes RGPD. Il s'appuie sur une expression écrite de ses besoins, des outils de gestion de projet et une posture professionnelle, ouverte et transparente pour mener à bien le projet. Il supervise les tests de ces infrastructures et produit une synthèse en conséquence. Lors de sa soutenance, le candidat présente sa démarche, le lien avec la problématique, les différentes phases du projet, les résultats des tests, et expose la synthèse de ses travaux. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie ETL : Mission en situation réelle - Individuel. Le candidat, à partir d'un ensemble de données brutes (ex: data lake) fourni par la structure d'accueil, et s'appuyant sur une conception technique vis-à-vis d'une problématique donnée, met en place un pipeline ETL permettant d'extraire des données les caractéristiques répondant à la problématique et de les transformer en vue d'une exploitation. Il utilise pour cela des outils standards (Talend, Alteryx...etc.). Lors de sa soutenance, le candidat présente le pipeline en question avec les différentes étapes d'extraction et de transformation, et leurs justifications. Il présente le jeu de données en sortie. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Intégration des données - Partie ETL : Mission en situation réelle - Groupe de deux à trois candidats - Soutenance individuelle. Le candidat, à partir d'un ensemble de données brutes (ex: data lake) qu'il a constitué, et s'appuyant sur une conception technique vis-à-vis d'une problématique donnée, met en place un pipeline ETL permettant d'extraire des données les caractéristiques répondant à la problématique et de les transformer en vue d'une exploitation. Il utilise pour cela des outils standards (Talend, Alteryx...etc.). Lors de sa soutenance, le candidat présente le pipeline en question avec les différentes étapes d'extraction et de transformation, et leurs justifications. Il présente le jeu de données en sortie. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet DataScience - Partie ETL : En autonomie - Individuel. Le candidat, à partir d'un ensemble de données brutes (ex: data lake) qu'il a constitué, et s'appuyant sur une conception technique vis-à-vis d'une problématique donnée, met en place un pipeline ETL permettant d'extraire des données les caractéristiques répondant à la problématique et de les transformer en vue d'une exploitation. Il utilise pour cela des outils standards (Talend, Alteryx...etc.). Lors de sa soutenance, le candidat présente le pipeline en question avec les différentes étapes d'extraction et de transformation, et leurs justifications. Il présente le jeu de données en sortie. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification.
RNCP39590BC03Explorer et analyser des ensembles de données afin de fournir des connaissances ("insights") exploitables et de soutenir la prise de décision
Évaluation : Présentation de la mission en entreprise - Partie analyse des données : Mission en situation réelle - Individuel. Le candidat, à partir des données transformées, applique, pour mettre en valeur des informations en lien avec la problématique, un ensemble de techniques statistiques telles que : Matrices de corrélation, ACP (Analyse par Composante Principale), Test ANOVA (Analyse de la Variance), Analyse univariée, Analyse multivariée. Il en présente les informations extraites et les analyses qui peuvent en découler. À travers ses travaux, il démontre sa maîtrise des différentes techniques et de leur contexte d'application, et est capable de présenter leurs limites. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Analyse des données : En autonomie - Groupe de deux à trois candidats - Soutenance individuelle. Le candidat, à partir des données transformées, applique, pour mettre en valeur des informations en lien avec la problématique, un ensemble de techniques statistiques telles que : Matrices de corrélation, ACP (Analyse par Composante Principale), Test ANOVA (Analyse de la Variance), Analyse univariée, Analyse multivariée. Il en présente les informations extraites et les analyses qui peuvent en découler. À travers ses travaux, il démontre sa maîtrise des différentes techniques et de leur contexte d'application, et est capable de présenter leurs limites. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie analyse des données : En autonomie - Individuel. Le candidat, à partir des données transformées, applique, pour mettre en valeur des informations en lien avec la problématique, un ensemble de techniques statistiques telles que : Matrices de corrélation, ACP (Analyse par Composante Principale), Test ANOVA (Analyse de la Variance), Analyse univariée, Analyse multivariée. Il en présente les informations extraites et les analyses qui peuvent en découler. À travers ses travaux, il démontre sa maîtrise des différentes techniques et de leur contexte d'application, et est capable de présenter leurs limites. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie visualisation des données : Mission en situation réelle - Individuel. Le candidat à l'aide d'outils standards, doit concevoir et déployer des tableaux de bord permettant une visualisation d'informations, de KPI, afin de mettre en place une démarche de "data storytelling" (une interprétation vulgarisée) auprès des décisionnaires. Ces informations sont issues des données transformées et/ou des analyses qui en ont été faites. Les outils utilisés servent la création de rapports et de représentation de données (Power BI, Tableaux...etc.). L'ensemble des productions respecte les principes de l'accessibilité numérique pour favoriser l'inclusivité, conformément au référentiel RG2A (Référentiel Général d'Amélioration de l'Accessibilité). Lors de sa soutenance, le candidat présente ses travaux, les informations issues de ces tableaux de bord, et les exploite dans un data storytelling en lien avec la problématique de la mission. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Visualisation des données : En autonomie - Groupe de deux à trois candidats - Soutenance individuelle. Le candidat à l'aide d'outils standards, doit concevoir et déployer des tableaux de bord permettant une visualisation d'informations, de KPI, afin de mettre en place une démarche de "data storytelling" (une interprétation vulgarisée) auprès des décisionnaires. Ces informations sont fournies par l'encadrant du projet. Le contexte dont celles-ci sont issues, soient les données transformées et/ou des analyses, est précisé. Les outils utilisés servent la création de rapports et de représentation de données (Power BI, Tableaux...etc.). L'ensemble des productions respecte les principes de l'accessibilité numérique pour favoriser l'inclusivité, conformément au référentiel RG2A (Référentiel Général d'Amélioration de l'Accessibilité). Lors de sa soutenance, le candidat présente ses travaux, les informations issues de ces tableaux de bord, et les exploite dans un data storytelling en lien avec la problématique du projet. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie visualisation des données : En autonomie - Individuel. Le candidat à l'aide d'outils standards, doit concevoir et déployer des tableaux de bord permettant une visualisation d'informations, de KPI, afin de mettre en place une démarche de "data storytelling" (une interprétation vulgarisée) auprès des décisionnaires. Ces informations sont issues des données transformées et/ou des analyses qui en ont été faites. Les outils utilisés servent la création de rapports et de représentation de données (Power BI, Tableaux...etc.). L'ensemble des productions respecte les principes de l'accessibilité numérique pour favoriser l'inclusivité, conformément au référentiel RG2A (Référentiel Général d'Amélioration de l'Accessibilité). Lors de sa soutenance, le candidat présente ses travaux, les informations issues de ces tableaux de bord, et les exploite dans un data storytelling en lien avec la problématique du projet. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification.
RNCP39590BC04Développer des modèles en utilisant des techniques avancées de statistiques et d'apprentissage automatique pour fournir des informations et accompagner le processus décisionnel
Évaluation : Présentation de la mission en entreprise - Partie Ingénierie de caractéristiques (Feature Engineering) : Mission en situation réelle - Individuel. Le candidat, à partir des données transformées après ETL, applique des techniques dites de feature engineering, pour venir enrichir les données existantes de nouvelles variables ne figurant pas dans l'ensemble d'apprentissage, afin de les rendre exploitables par un modèle d'apprentissage qui viendra répondre à la problématique fixée. Les techniques utilisables sont : encodage (ex: One-Hot Encoding), mathématiques (ex: Transformations logarithmiques, scaling, normalisation...etc.), gestion des données manquantes, gestion des valeurs aberrantes (outliers), extraction de caractéristiques. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Analyse des données - Partie Ingénierie de caractéristiques (Feature Engineering) : En autonomie - Groupe de deux à trois candidats - Soutenance individuelle. Le candidat, à partir des données transformées fournies par le référent, applique des techniques dites de "feature engineering", pour venir enrichir les données existantes de nouvelles variables ne figurant pas dans l'ensemble d'apprentissage, afin de les rendre exploitables par un modèle d'apprentissage qui viendra répondre à la problématique fixée. Les techniques utilisables sont :encodage (ex: One-Hot Encoding), mathématiques (ex: Transformations logarithmiques, scaling, normalisation...etc.), gestion des données manquantes, gestion des valeurs aberrantes (outliers), extraction de caractéristiques. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie Ingénierie de caractéristiques (Feature Engineering) : En autonomie - Individuel. Le candidat, à partir des données transformées fournies par le référent, applique des techniques dites de "feature engineering", pour venir enrichir les données existantes de nouvelles variables ne figurant pas dans l'ensemble d'apprentissage, afin de les rendre exploitables par un modèle d'apprentissage qui viendra répondre à la problématique fixée. Les techniques utilisables sont :encodage (ex: One-Hot Encoding), mathématiques (ex: Transformations logarithmiques, scaling, normalisation...etc.), gestion des données manquantes, gestion des valeurs aberrantes (outliers), extraction de caractéristiques. Lors de sa soutenance, le candidat présente et justifie l'ensemble des techniques qu'il a appliqué et les résultats obtenus. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie Sélection et entraînement des Modèles d'apprentissage : Mission en situation réelle - Individuel. Le candidat, à partir de données transformées par ETL et enrichies par un processus de "feature engineering", identifie l'ensemble des modèles d'apprentissage (supervisé ou non) permettant de répondre à une problématique d'aide à la décision, et les entraînes pour qu'ils puissent fournir des informations à partir de données généralisées. Le candidat ajuste les hyper-paramètres des modèles en fonction d'évaluation de leurs performances, dans un processus itératif. Les modèles d'apprentissage possibles : Clustering, arbre de décision, régression (logistique, linéraire...etc.), Deep Learning, etc. Les techniques d'optimisation des hyperparamètres peuvent être : Grid Search, Random Search, Optimisation Bayesienne, etc. Lors de sa soutenance, le candidat justifie le choix des modèles et présente leur processus d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie Sélection et entraînement des Modèles d'apprentissage : En autonomie - Individuel. Le candidat, à partir de données transformées par ETL et enrichies par un processus de "feature engineering", identifie l'ensemble des modèles d'apprentissage (supervisé ou non) permettant de répondre à une problématique d'aide à la décision, et les entraînes pour qu'ils puissent fournir des informations à partir de données généralisées. Le candidat ajuste les hyper-paramètres des modèles en fonction d'évaluation de leurs performances, dans un processus itératif. Les modèles d'apprentissage possibles : Clustering, arbre de décision, régression (logistique, linéraire...etc.), Deep Learning, etc. Les techniques d'optimisation des hyperparamètres peuvent être : Grid Search, Random Search, Optimisation Bayesienne, etc. Lors de sa soutenance, le candidat justifie le choix des modèles et présente leur processus d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie Création des Modèles d'apprentissage : Mission en situation réelle - Individuel. Le candidat établit une stratégie pour la création d'un modèle d'apprentissage en concevant ou réutilisant des modèles pré-entraînés (utilisant le transfert d'apprentissage). Lors de sa soutenance, le candidat devra présenter sa stratégie de création de modèle, en mettant en avant les choix de conception et de réutilisation des modèles pré-entraînés. Il devra également exposer les performances obtenues par ses modèles sur les données de test, ainsi qu'une analyse des résultats et leur pertinence par rapport à la problématique métier. Une justification claire de ses décisions et de ses approches sera également attendue. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie création des Modèles d'apprentissage : En autonomie - Individuel. Le candidat établit une stratégie pour la création d'un modèle d'apprentissage en concevant ou réutilisant des modèles pré-entraînés (utilisant le transfert d'apprentissage). Lors de sa soutenance, le candidat devra présenter sa stratégie de création de modèle, en mettant en avant les choix de conception et de réutilisation des modèles pré-entraînés. Il devra également exposer les performances obtenues par ses modèles sur les données de test, ainsi qu'une analyse des résultats et leur pertinence par rapport à la problématique métier. Une justification claire de ses décisions et de ses approches sera également attendue. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieures à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie Evaluation des Modèles d'apprentissage : Mission en situation réelle - Individuel. Le candidat quantifie la précision de modèles d'apprentissage et la représentativité des données d'entrées à l'aide de métriques et des techniques d'évaluation de leurs performances respectives. Il identifie des situations précises concernant l'apprentissage des modèles : Overfitting (Sur-apprentissage), Underfitting (Sous-apprentissage), Goodfitting (Apprentissage correct), Unrepresentative Dataset (Données non représentatives). Finalement, il préconise des modifications à apporter, que ce soit au niveau des choix de modèles, des choix de données, des paramétrages, dans un processus itératif d'entraînement. Les métriques/techniques d'évaluation employées : Courbes d'apprentissage, Cross-Validation, courbe ROC (Receiver Operating Caracteristic), AUC (Area Under the Curve), F1-Score, Score de silhouettes, etc. Lors de sa soutenance, le candidat présente les métriques/techniques exploitées pour justifier la performance de ces modèles tout au long du processus itératif d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet DataScience - Partie Evaluation de Modèles d'apprentissage : En autonomie - Individuel. Le candidat quantifie la précision de modèles d'apprentissage et la représentativité des données d'entrées à l'aide de métriques et des techniques d'évaluation de leurs performances respectives. Il identifie des situations précises concernant l'apprentissage des modèles : Overfitting (Sur-apprentissage), Underfitting (Sous-apprentissage), Goodfitting (Apprentissage correct), Unrepresentative Dataset (Données non représentatives). Finalement, il préconise des modifications à apporter, que ce soit au niveau des choix de modèles, des choix de données, des paramétrages, dans un processus itératif d'entraînement.Les métriques/techniques d'évaluation employées : Courbes d'apprentissage, Cross-Validation, courbe ROC (Receiver Operating Caracteristic), AUC (Area Under the Curve), F1-Score, Score de silhouettes, etc. Lors de sa soutenance, le candidat présente les métriques/techniques exploitées pour justifier la performance de ces modèles tout au long du processus itératif d'entraînement. Il doit adapter une posture professionnelle et exploiter un support de présentation mettant en lumière ses productions et leurs justifications. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieures à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie extraction et présentation des résultats : Mission en situation réelle - Individuel. Le candidat replace des résultats produits par des modèles d'apprentissages entraînés dans le contexte d'une problématique d'aide à la décision. Il les mets en lien et fournit une explication compréhensible par un corpus décisionnaire qui ne possède pas de notion de datascience. Pour cela, il vulgarise son discours, et s'appuie sur des faits, des rapports, des outils visuels (graphiques, KPI...), et en adoptant le vocabulaire du métier. Il fait preuve d'éthique et de transparence face à son auditoire, pour s'assurer de la compréhension par tous. La soutenance est partie intégrante de l'évaluation de cette compétence. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation du projet Data Science - Partie extraction et présentation des résultats : En autonomie - Individuel. Le candidat replace des résultats produits par des modèles d'apprentissages entraînés dans le contexte d'une problématique d'aide à la décision. Il les mets en lien et fournit une explication compréhensible par un corpus décisionnaire qui ne possède pas de notion de datascience. Pour cela, il vulgarise son discours, et s'appuie sur des faits, des rapports, des outils visuels (graphiques, KPI...), et en adoptant le vocabulaire du métier. Il fait preuve d'éthique et de transparence face à son auditoire, pour s'assurer de la compréhension par tous. La soutenance est partie intégrante de l'évaluation de cette compétence. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieures à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Echange avec le jury sur des sujets d'actualités : Mission en situation réelle - Individuel. Lors d'un échange avec le jury, le candidat se voit poser des questions sur des sujets d'actualités autour de la data science et en lien avec la mission effectuée. Il doit y répondre en démontrant sa connaissance du sujet et des contextes qui y sont liés. Il présente en outre les outils et méthodes qu'il exploite pour assurer sa veille technologique (suivi des actualités, journaux, forums, conférences, recherche...etc.). Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification.
RNCP39590BC05Piloter des projets en communiquant avec les parties prenantes et en guidant les membres de l'équipe pour atteindre des objectifs spécifiques
Évaluation : Présentation de la mission en entreprise - Echange avec le jury sur la collaboration avec les équipes : Mission en situation réelle - Individuel. Lors d'un échange avec le jury, le candidat se voit poser des questions sur les échanges et les interactions qu'il a pu avoir avec des interlocuteurs dans l'entreprise et/ou externes à celle-ci. Il doit y répondre en présentant le contexte de ces interactions, et en démontrant sa capacité à s'adapter à ses interlocuteurs, en adoptant une posture qui favorise la transmission des informations et l'engagement dans le projet. Il explique les outils et les méthodes employées lors de la communication de ses travaux et résultats. Les difficultés rencontrées dans les échanges et leur résolution sont exposées. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification. Présentation de la mission en entreprise - Partie définition de la gestion du projet : Mission en situation réelle - Individuel. Le candidat doit présenter, à partir du cahier des charges validé par l'entreprise, la stratégie et les outils de développement du projet. Il doit présenter : le planning (ex: Gantt) du développement du projet, les responsabilités de chacun des interlocuteurs du projet, les indicateurs clés et des outils de gestion pour suivre l'avancement du projet et le respect des contraintes, les outils de communication et d'échanges avec le client et les interlocuteurs pour anticiper les problématiques liées au projet. Les candidats ont pour contraintes : d'assurer le respect des budgets, des niveaux de qualités, et des délais associés au projet, de favoriser le travail collaboratif, d'adopter une posture professionnelle et inclusive dans les échanges qu'ils peuvent avoir, et de démontrer leur capacité à exploiter des outils standards de gestion de projet. Évalué par un jury d'au moins trois professionnels issus du domaine de l'informatique et/ou de l'industrie, dont au moins 50% de Data Scientist professionnels, et extérieurs à la structure d'accueil et de la structure de certification.
+ 1 organisme(s) partenaire(s) habilité(s).
NSF : 326
ROME : M1805
Formacode : 31026, 31052, 31067
Source : France Compétences (data.gouv.fr), schéma v4.1 · restitué par Adéquaenadequa.fr