Le réseau de neurones convolutif
Un filtre qui glisse, une carte d’indices, une hiérarchie de formes. Comment les réseaux ont appris à voir, expliqué en deux minutes.
Des pixels entrent, une structure sort.
Une photo est une grille de nombres : des millions de pixels, chacun une valeur de luminosité. Donnés bruts au neurone de l’épisode précédent, il voit du bruit, pas des formes. Il ne sait pas où le chat finit et où le mur commence. Un réseau convolutif règle ça en regardant l’image comme vous le faites : non pas pixel par pixel, mais zone par zone, à la recherche de motifs qui se répètent.
Un filtre qui glisse.
L’outil est une petite grille de poids appelée noyau, disons 3 par 3. On la pose sur un coin de l’image, on multiplie chaque pixel par le poids correspondant et on additionne : un nombre sort, un indice. Puis on la glisse d’un pas vers la droite et on recommence, encore et encore, jusqu’à couvrir toute l’image. Le résultat est une nouvelle grille appelée carte de caractéristiques : claire là où le motif est présent, sombre là où il est absent.
Des contours, puis des parties, puis des objets.
Un noyau ne peut traquer qu’un seul motif. La première couche apprend des noyaux pour les contours : verticaux, horizontaux, diagonaux. La suivante lit ces cartes et combine les contours en textures et en coins. Plus profond encore, des parties apparaissent : une roue, une oreille, une feuille. Les dernières couches assemblent les parties en objets. Chaque étage hérite du travail du précédent, et c’est pourquoi un CNN lit une image comme une phrase, indice après indice.
Les maths, simplement.
Tout ce que calcule une convolution tient en trois lignes : une somme pondérée locale, la même somme répétée à chaque position, et un sous-échantillonnage qui ne garde que les indices les plus forts.
y(i,j) = Σₘ Σₙ x(i+m, j+n) · k(m,n) + b
carte de caractéristiques = y pour tout (i,j)
max pooling : garder le max de chaque zone
Un noyau, partout.
L’astuce qui fait tout marcher : le même noyau glisse sur toute l’image, donc ses quelques poids sont réutilisés à chaque position. Une oreille de chat en haut à gauche marque exactement comme une oreille de chat en bas à droite. C’est l’invariance par translation, et c’est aussi pourquoi les CNN sont peu coûteux : un noyau 3 par 3 a neuf poids, que l’image contienne mille pixels ou un milliard. L’entraînement n’a qu’à apprendre ces petites grilles, couche après couche.