Une fois que vous avez appris ce qu'est l'apprentissage automatique - et les façons dont le gouvernement peut l'utiliser - il est temps d'approfondir le fonctionnement du processus. Que vous envisagiez de collaborer avec des experts pour concevoir une intervention ou que vous cherchiez simplement à comprendre et à explorer l'approche, il est essentiel que vous maîtrisiez les bases de la conception et de l'exécution d'un projet d'apprentissage automatique.

Apolitical s'est entretenu avec le Dr Crina Grosan, maître de conférences au Département d'informatique de l'Université Brunel et spécialiste de l'intelligence artificielle et de l'apprentissage automatique. Grosan a de l'expérience dans l'enseignement de l'apprentissage automatique aux décideurs politiques, par exemple, elle dirige actuellement une masterclass de la UK Government Digital Service Academy . Elle a partagé ses conseils pour gérer un projet d'apprentissage automatique, divisé en cinq étapes clés:

  1. Définition du problème
  2. Préparer les données
  3. Explorer les données et formuler une hypothèse
  4. Générer votre modèle d'apprentissage automatique
  5. Évaluer et affiner votre modèle

Grosan utilise un scénario pour montrer comment exécuter un projet de machine learning en termes pratiques, de la collecte de données à la génération et à l'amélioration de votre modèle de machine learning.

«Un exemple que je donne à mes élèves est les données sur les résultats des tests dans les arrondissements londoniens», a déclaré Grosan. «Je leur donne les résultats, ainsi que d'autres ensembles de données sur les arrondissements, notamment les taux d'emploi, les niveaux de revenu et le positionnement géographique. Ensuite, je leur demande s'ils peuvent identifier des problèmes et si les données peuvent leur dire quoi que ce soit. »

1. Définition du problème

Le problème peut être défini avant ou après avoir préparé et exploré les données, selon la situation.

Problème = la question ou le problème que vous essayez de résoudre

Dans certains cas, vous commencez par un problème, puis cherchez à collecter des données pertinentes pour y remédier ou le résoudre.

Dans l'exemple des résultats des tests pour les enfants, vous pourriez commencer par le problème que les enfants dans les arrondissements en particulier obtiennent de mauvais résultats par rapport à ceux des autres arrondissements. La prochaine étape serait de collecter et d'explorer des données pour découvrir pourquoi.

Dans d'autres scénarios, vous commencez avec des données mais sans problème clair. Ensuite, en effectuant une analyse exploratoire des données, vous trouvez le problème que vous souhaitez résoudre puis formulez une hypothèse à tester.

Hypothèse = la supposition que vous souhaitez tester

Par exemple, vous pourriez déjà avoir des données sur les résultats des tests des enfants, les taux de chômage, les niveaux de revenu et le positionnement géographique, ainsi que divers autres indicateurs par arrondissement. Vous pouvez ensuite explorer les liens entre ces indicateurs afin d'identifier un problème.

Par exemple, vous pourriez constater que les enfants ont tendance à avoir de mauvais résultats dans les arrondissements où les taux de chômage sont élevés. Sur cette base, vous pourriez formuler une hypothèse: la mauvaise performance des étudiants est liée aux taux de chômage de l'arrondissement.

2. Préparation des données

La préparation peut être décomposée en deux parties: collecte et prétraitement .

Collecte = le processus de collecte de données

Prétraitement = transformer les données brutes en un format compréhensible et structuré

Tout d'abord, vous collectez les données . Si vous avez plusieurs sources, intégrez-les en combinant différents ensembles de données.

Ensuite, vous commencez le prétraitement des données. L'objectif est de transformer les données en un format compréhensible qui peut être utilisé pour l'apprentissage automatique.

Cela signifie nettoyer les données car il peut y avoir beaucoup de bruit - essentiellement des données sans signification et redondantes. Vous devrez supprimer les valeurs aberrantes, les répétitions et les incohérences et normaliser les données.

Par exemple, il se peut qu'une personne ait 120 ans alors que tous les autres dans l'ensemble de données n'ont pas plus de 70 ans. Dans ce cas, la personne de 120 ans peut être une valeur aberrante et peut donc être éliminée pour éviter de fausser l'ajout que vous veux faire.

Vous devez également supprimer les incohérences. Par exemple, après avoir mis en correspondance divers ensembles de données en les comparant les uns aux autres, vous pouvez constater que vous avez deux numéros de téléphone différents pour le même nom. Si le numéro de téléphone est important pour l'analyse, nettoyez le mauvais.

Il existe également des moyens de normaliser les données. Il se pourrait que pour certains enregistrements, vous ayez des valeurs de l'ordre de millions. Pour d'autres, vous pouvez avoir des valeurs comprises entre 0 et 1. Cela signifie que, lorsque vous combinez ces ensembles de valeurs, les plus petites ne contribueront pas au résultat car elles sont insignifiantes par rapport aux grandes valeurs. C'est pourquoi vous les normalisez afin qu'ils soient tous dans la même plage - dans ce cas, en les faisant tous entre 0 et 1.

3. Explorer les données et formuler une hypothèse

L'étape suivante consiste à effectuer une analyse exploratoire des données dont vous disposez.

Analyse exploratoire = recherche initiale de données à l'aide de statistiques pour trouver des modèles

Par exemple, vous pourriez trouver le pourcentage de réussite des enfants par arrondissement.

Vous pouvez également commencer à créer des tracés visuels pour cartographier les connexions entre les indicateurs dans les données.

Indicateur = une caractéristique mesurable à partir des données

Par exemple, les liens entre les résultats des tests et les niveaux de revenu, les taux de chômage ou le positionnement géographique.

Cette analyse vous aidera à comprendre le problème et à formuler une ou plusieurs hypothèses.

4. Génération de votre modèle d'apprentissage automatique

Vous êtes maintenant prêt à commencer à construire votre modèle .

Modèle = Un système d'apprentissage automatique basé sur des relations mathématiques

Le modèle devrait tester votre hypothèse: dans ce cas, il étudiera la relation entre les résultats des tests des enfants et les taux de chômage.

Sur la base des données dont vous disposez dans d'autres arrondissements, avec votre modèle d'apprentissage automatique, vous pouvez prédire que si le chômage se situe entre w et x, les résultats des élèves se situeront entre y et z.

Dans cet exemple, les taux de chômage sont «l' indicateur » et les résultats des tests sont la « sortie » . "

Sortie = valeur générée par le modèle sur la base de relations mathématiques

La relation entre le (s) indicateur (s) et le (s) résultat (s) peut être exprimée de diverses manières, par exemple en règle - «si l'indicateur est x, le résultat sera y» - ou sous forme de formule mathématique. En utilisant la relation générée par votre modèle, vous pourrez évaluer la précision de votre hypothèse.

Dans ce cas, vous pourrez déterminer s'il existe un lien entre les résultats des tests et les taux de chômage et, dans l'affirmative, quel est ce lien.

Une fois que vous avez confirmé votre hypothèse, vous pouvez ensuite utiliser votre modèle pour générer des prédictions. Chaque fois que vous modifiez l'une des valeurs d'indicateur, votre modèle sera en mesure de générer de nouvelles valeurs de sortie, en fonction de la relation entre les deux. Cela vous permet d'enquêter sur des questions telles que: si vous abaissez le taux de chômage à x, quel effet cela aura-t-il sur les résultats du test?

Par conséquent, plutôt que d'apporter immédiatement des changements dans la vie réelle, vous pouvez les simuler avec l'apprentissage automatique pour faire des prédictions. Cela aide à orienter les interventions qui peuvent être mises en pratique ultérieurement. Peut-être, dans certains arrondissements, des mesures pourraient-elles être prises pour stimuler l'emploi, ce qui pourrait améliorer les résultats des enfants.

5. Évaluer et affiner votre modèle

Vous pouvez entrer des données connues dans votre modèle d'apprentissage automatique pour évaluer sa précision.

Évaluation = Évaluation de la précision de votre modèle d'apprentissage automatique

Par exemple, si vous connaissez le taux de chômage d'un arrondissement et les résultats moyens des examens, vous pouvez saisir le taux de chômage pour tester les résultats moyens des examens générés par le modèle. Appliquez le modèle d'apprentissage automatique avec différentes valeurs jusqu'à ce que vous soyez satisfait des résultats qu'il vous donne. C'est ce qu'on appelle la « formation ».

Formation = Tester et améliorer votre modèle d'apprentissage automatique

Votre modèle sera approximatif et ne sera jamais exact pour tous les indicateurs de données dont vous disposez. Utilisez donc des mesures de performances pour évaluer la proximité du modèle avec la réalité.

Mesures de performances = mesures pour évaluer votre modèle d'apprentissage automatique

Pour en revenir à l'exemple, pour certains arrondissements, la précision peut être proche de 100%, mais pour d'autres, elle pourrait être pire. Pourtant, vous pouvez mesurer un niveau de performance global dans tous les arrondissements.

Les niveaux de performance peuvent également vous aider à tester la validité de votre hypothèse. Parfois, nous repérons des relations qui n'existent pas. Par exemple, il se pourrait que la corrélation entre de faibles résultats aux tests et des taux de chômage élevés soit une coïncidence ou que de faibles résultats aux tests provoquent en fait un chômage élevé plutôt que l'inverse. Dans de tels cas, un faible taux de précision pendant la formation peut invalider votre hypothèse.

Cependant, une faible précision ne signifie pas nécessairement que votre hypothèse n'est pas valide. Il se peut que les paramètres du modèle d'apprentissage automatique ne soient pas les bons. Essayez de les changer ou testez quelques autres modèles au cas où le premier ne conviendrait pas au problème à résoudre. Cependant, si aucun de ces changements ne conduit à des améliorations, vous devrez peut-être abandonner votre hypothèse et en tester une autre à la place.

Et lorsque vous évaluez votre modèle, n'oubliez pas de considérer le type de technologie que vous utilisez pour exécuter les algorithmes d'apprentissage automatique.

Par exemple, si vous vous précipitez pour prendre une décision, vous devrez peut-être utiliser une méthode qui ne prend pas beaucoup de temps. Ou si vous ne disposez pas d'ordinateurs très performants, vous pouvez en choisir un qui s'exécute sur un ordinateur avec une spécification simple. Heureusement, il existe plusieurs méthodes, alors assurez-vous de choisir celle qui vous convient.

Alors, comment pouvez-vous améliorer le niveau de performance de votre modèle? En modifiant certains paramètres de la relation du modèle, vous pouvez obtenir une meilleure approximation de la réalité. C'est ce qu'on appelle le raffinement .

Raffinement = Amélioration de la précision de votre modèle d'apprentissage automatique

L'évaluation et le raffinement vont de pair - continuez d'évaluer et d'affiner jusqu'à ce que vous soyez satisfait de vos résultats. - Anna Goulden

(Crédit photo: Unsplash)


N'oubliez pas de partager vos propres réflexions avec l'auteur en laissant un commentaire ci-dessous