Introduction à l’intelligence artificielle et à la régression linéaire : Machine Learning, prédiction et moindres carrés

1. A propos du cours

  1. Auteur : V. Monbet – Université de Rennes, UFR Mathématiques
  2. Type : Cours universitaire d’intelligence artificielle, de Machine Learning et de régression linéaire
  3. Langue : Français
  4. Licence : Non précisée dans le document

2. Prérequis

  1. Posséder des connaissances de base en mathématiques et savoir manipuler des expressions algébriques.
  2. Connaître les notions élémentaires d’algèbre linéaire, notamment les vecteurs, les matrices et le calcul matriciel, qui seront nécessaires pour poursuivre l’étude des réseaux de neurones.
  3. Connaître les notions fondamentales d’analyse mathématique, en particulier les fonctions et le calcul des dérivées.
  4. Posséder quelques notions de probabilités et statistiques afin de comprendre les variables aléatoires, la moyenne, la variance, l’estimation et les incertitudes.
  5. Savoir interpréter un nuage de points, une droite et les relations pouvant exister entre deux variables quantitatives.
  6. Des notions élémentaires de programmation et de traitement de données sont utiles pour mettre en pratique les méthodes présentées, même si le document développe principalement leurs fondements mathématiques.

3. Publique cible

Ce cours s’adresse principalement aux étudiants en mathématiques, informatique, statistiques, sciences des données et disciplines scientifiques souhaitant découvrir les outils fondamentaux de l’intelligence artificielle. Il convient également aux apprenants désirant comprendre les bases mathématiques du Machine Learning, de la régression et, à terme, des réseaux de neurones.

4. Outils matériels et logiciels

4.1 Outils matériels

  1. Un ordinateur de bureau ou portable permettant d’effectuer des calculs et d’exécuter éventuellement des programmes de traitement de données.
  2. Un écran offrant un affichage confortable des graphiques, nuages de points, équations et représentations mathématiques.
  3. Une connexion Internet peut être utile pour consulter les jeux de données, ressources et références complémentaires mentionnés dans le support.
  4. Aucun matériel informatique spécialisé ou processeur graphique puissant n’est indispensable pour étudier la régression linéaire simple présentée dans ce cours.

4.2 Outils logiciels

  1. Un environnement permettant d’effectuer des calculs mathématiques et statistiques.
  2. Un langage scientifique tel que Python peut être utilisé pour reproduire les calculs et expérimentations présentés dans le cours.
  3. Des bibliothèques Python telles que NumPy, Matplotlib et éventuellement scikit-learn peuvent servir à manipuler les données, représenter les nuages de points et expérimenter les modèles de régression.
  4. Un environnement comme Jupyter Notebook, JupyterLab, Spyder ou Visual Studio Code peut faciliter la mise en pratique des concepts étudiés.
  5. Un lecteur PDF et un navigateur Web permettent de consulter le support et les ressources externes citées.

5. Champs d'applications

  1. Intelligence artificielle et compréhension de ses principaux outils.
  2. Machine Learning et apprentissage de modèles à partir de données.
  3. Deep Learning et préparation à l’étude des réseaux de neurones artificiels.
  4. Régression linéaire pour expliquer les relations entre des variables quantitatives.
  5. Prédiction de valeurs inconnues à partir d’observations disponibles.
  6. Analyse de données scientifiques, industrielles, économiques et environnementales.
  7. Modélisation de phénomènes tels que le prix d’un logement en fonction de sa superficie ou les ventes en fonction des investissements publicitaires.
  8. Analyse des relations entre des variables physiques, comme la vitesse d’un véhicule et sa distance de freinage.
  9. Validation des modèles et mesure de leurs performances prédictives.
  10. Préparation à l’étude mathématique des réseaux de neurones, de l’optimisation et de la descente de gradient.

6. Courte description

Ce cours introduit les principaux concepts de l’intelligence artificielle, du Machine Learning et du Deep Learning, puis développe la régression linéaire simple : modélisation, estimation par les moindres carrés, fonction de perte, prédiction, validation du modèle et erreur quadratique moyenne.

7. Longue description du cours

Ce support intitulé Introduction aux outils de l’intelligence artificielle propose une entrée progressive dans les fondements de l’intelligence artificielle et du Machine Learning en mettant particulièrement l’accent sur les outils mathématiques nécessaires à leur compréhension. Le document est organisé autour de deux grandes parties : une introduction générale à l’intelligence artificielle, suivie d’une étude détaillée de la régression linéaire simple, considérée comme l’un des ingrédients fondamentaux de l’apprentissage automatique.

La première partie cherche tout d’abord à préciser ce que recouvre réellement la notion d’intelligence artificielle. Le cours s’éloigne de la représentation populaire selon laquelle l’intelligence artificielle serait essentiellement associée aux robots humanoïdes. Il présente plutôt l’IA comme un ensemble de méthodes permettant à une machine d’imiter certaines capacités de l’intelligence humaine et d’accomplir des tâches pouvant aller d’opérations relativement simples à des problèmes beaucoup plus complexes.

Plusieurs applications de l’intelligence artificielle permettent d’illustrer cette diversité. Le document évoque la génération de contenus créatifs, la musique et les arts visuels, mais aussi des applications beaucoup plus directement intégrées dans la vie quotidienne et dans l’activité économique. Les assistants virtuels intelligents constituent un premier exemple : des systèmes comme Siri, Alexa ou Google Assistant utilisent des technologies issues de l’IA pour permettre à leurs utilisateurs d’effectuer différentes tâches. Dans le domaine de la santé, l’IA peut contribuer à améliorer la précision des diagnostics et à optimiser les plans de traitement grâce à l’analyse de grandes quantités de données médicales.

D’autres applications sont présentées dans l’industrie et la finance. Les algorithmes d’IA peuvent intervenir dans le contrôle qualité en recherchant des régularités ou des anomalies dans les données de production afin d’identifier des problèmes potentiels. Dans le secteur financier, l’analyse automatique d’importants volumes de données peut être utilisée pour la détection de la fraude. Ces exemples montrent que l’intelligence artificielle ne constitue pas un domaine purement théorique mais un ensemble de technologies applicables à de nombreux secteurs.

Le cours explique ensuite le principe général du fonctionnement d’un système d’IA fondé sur l’apprentissage. De grandes quantités de données d’apprentissage sont analysées afin d’identifier des corrélations et des modèles qui pourront ensuite être utilisés pour effectuer des prédictions sur de nouvelles données. Un système entraîné à partir de textes peut par exemple apprendre à produire des échanges linguistiques, tandis qu’un système de reconnaissance d’images peut apprendre à identifier des objets après avoir analysé un grand nombre d’exemples.

Le Machine Learning est ensuite présenté comme un sous-domaine de l’intelligence artificielle consacré au développement et à l’étude d’algorithmes statistiques capables d’apprendre à partir de données et de généraliser leurs résultats à des observations inédites. Cette capacité de généralisation constitue un principe essentiel : l’objectif n’est pas simplement de mémoriser les données ayant servi à construire le modèle, mais de pouvoir exploiter les connaissances acquises afin de traiter de nouvelles situations.

Le document introduit également le Deep Learning, présenté comme une catégorie du Machine Learning utilisant des réseaux de neurones artificiels. Inspirés du fonctionnement des neurones biologiques, ces réseaux comportent plusieurs couches de neurones artificiels connectés. Le cours annonce ainsi la direction générale de l’enseignement : l’objectif final est de comprendre les réseaux de neurones en s’appuyant progressivement sur leurs fondements mathématiques.

Trois familles d’outils mathématiques sont alors mises en évidence. L’algèbre linéaire intervient notamment à travers le calcul matriciel ; l’optimisation utilise le calcul des dérivées et les algorithmes d’optimisation numérique ; les probabilités et statistiques interviennent dans l’estimation, la prise en compte des incertitudes et la validation des méthodes développées. Le plan annoncé conduit de la régression linéaire univariée à la régression multivariée, puis à l’optimisation par descente du gradient et enfin aux réseaux de neurones profonds complètement connectés.

La deuxième grande partie du support étudie en détail la régression linéaire univariée. Son objectif consiste à expliquer ou à prédire une variable quantitative à partir d’une autre variable quantitative. Plusieurs exemples concrets permettent de comprendre immédiatement l’intérêt de cette méthode : expliquer le prix d’un appartement en fonction de sa superficie, prédire la hauteur d’un arbre à partir de sa circonférence, étudier les variations des ventes d’un produit en fonction de l’investissement publicitaire ou encore expliquer un niveau de pollution à partir d’une variable météorologique.

Lorsqu’on dispose de deux variables mesurées, plusieurs questions peuvent être posées : les variables sont-elles linéairement liées ? Quelle est la force de cette relation ? Peut-on prédire la variable d’intérêt en observant uniquement la variable explicative ? Le cours illustre cette problématique à partir d’un exemple composé de 50 mesures concernant la vitesse de véhicules et leur distance de freinage. Un nuage de points permet de visualiser les observations et conduit naturellement à rechercher une droite représentant au mieux la relation entre les deux variables.

La modélisation linéaire repose sur des observations notées par des couples formés d’une variable explicative et d’une variable à expliquer. Le modèle suppose que la variable cible peut être approximativement décrite par une fonction affine de la variable explicative. Deux paramètres doivent alors être déterminés : l’ordonnée à l’origine, également appelée intercept ou bias, et le coefficient directeur, également appelé pente, slope ou weight.

Le cours enrichit ensuite cette représentation par un modèle probabiliste. Une composante aléatoire est ajoutée au modèle afin de représenter les différences entre les observations réelles et la relation théorique. Ces erreurs peuvent provenir du bruit de mesure, du bruit de transmission, de la variabilité d’échantillonnage ou d’autres phénomènes non pris en compte directement par le modèle. Cette formulation permet d’établir un lien clair entre modélisation statistique et apprentissage automatique.

Trois objectifs fondamentaux sont alors distingués : le learning, qui consiste à estimer les paramètres inconnus à partir des observations ; la prediction, qui consiste à utiliser les paramètres estimés pour prédire la valeur de la variable cible correspondant à une nouvelle observation ; et la validation, qui vise à déterminer si le modèle obtenu possède réellement de bonnes performances prédictives.

L’estimation des paramètres est développée à travers la méthode des moindres carrés. Les graphiques du support permettent de visualiser les écarts entre les observations et la droite de régression. Pour chaque observation, l’erreur correspond à la différence entre la valeur réellement observée et celle prédite par la droite. Plutôt que de simplement additionner ces écarts, la méthode utilise leurs carrés et cherche la droite qui minimise la somme des carrés des erreurs.

Cette quantité conduit à définir une fonction de perte, également appelée fonction de coût. L’apprentissage du modèle consiste alors à rechercher les paramètres pour lesquels cette fonction est minimale. Le support développe mathématiquement cette optimisation en calculant les dérivées de la fonction par rapport aux paramètres du modèle, puis en résolvant le système d’équations obtenu. Cette démarche montre concrètement pourquoi les notions de dérivation et d’optimisation sont centrales en Machine Learning.

Une fois les coefficients estimés, la droite de régression peut être utilisée pour effectuer des prédictions. Le cours définit un prédicteur comme une fonction qui associe à une nouvelle observation de la variable explicative une estimation de la variable à expliquer. Les valeurs prédites correspondent alors aux points situés sur la droite de régression. Une question essentielle apparaît cependant : comment déterminer si ces prédictions sont suffisamment fiables ?

Le document introduit pour cela le principe de validation croisée. Les données disponibles sont séparées en deux parties. L’ensemble d’apprentissage, ou train set, sert à entraîner le modèle et à estimer ses paramètres. L’ensemble de validation ou de test, ou test set, est conservé afin de mesurer les performances du modèle sur des données qui n’ont pas servi directement à son apprentissage. Le support illustre notamment un découpage comportant environ 80 % des observations pour l’apprentissage et 20 % pour la validation.

La performance prédictive est finalement évaluée au moyen de l’erreur quadratique moyenne, ou Mean Square Error. Cette mesure calcule la moyenne des carrés des différences entre les valeurs prédites et les valeurs réellement observées dans l’ensemble de test. Plus cette erreur est faible, meilleures sont les performances du modèle. Cette dernière étape complète le processus d’apprentissage : définir un modèle, apprendre ses paramètres à partir des données, produire des prédictions puis évaluer objectivement leur qualité.

Le cours conclut que la régression linéaire constitue un ingrédient de base de l’intelligence artificielle. La régression linéaire simple permet de modéliser la relation entre une variable explicative et une variable cible, les paramètres étant appris par minimisation de la fonction de perte des moindres carrés. Le modèle obtenu peut ensuite servir à effectuer des prédictions sur de nouvelles observations, tandis que la validation et l’erreur quadratique moyenne permettent d’en mesurer les performances. Ces concepts constituent ainsi une préparation directe à l’étude de modèles plus complexes, notamment la régression multivariée, l’optimisation par descente de gradient et les réseaux de neurones.

8. Aperçu du document

 

Leave a Reply

Your email address will not be published. Required fields are marked *