L'apprentissage automatique regroupe des techniques statistiques permettant aux logiciels d'identifier des tendances dans les données et d'effectuer des prédictions sans programmation explicite pour chaque cas. Dans la gestion des flux de données, il est appliqué à des tâches telles que la prédiction des attributs produits manquants, la mise en correspondance des annonces entre catalogues, la prévision de la demande et le signalement des erreurs de données – des tâches trop lentes ou incohérentes pour être gérées uniquement par des règles manuelles fixes. Plutôt que de remplacer purement et simplement les règles de flux, l'apprentissage automatique fonctionne généralement en complément, traitant les cas ambigus qu'une règle rigide ne pourrait pas identifier ou pour lesquels elle pourrait mal fonctionner.
Pourquoi l'apprentissage automatique est important pour la gestion des flux de données
Les catalogues comportant des milliers, voire des millions de références, présentent inévitablement des lacunes : catégories manquantes, incohérences dans les tailles, attributs incomplets ou titres ne correspondant pas aux recherches des clients. Corriger ces erreurs manuellement est impossible à grande échelle, et les règles métier statiques ne couvrent que les tendances initialement prévues. Les modèles d'apprentissage automatique, entraînés sur les données existantes des catalogues et des ventes, peuvent déduire un attribut manquant à partir de produits similaires, prédire la catégorie d'un nouvel article ou estimer les variations de la demande en fonction de la saisonnalité et de l'historique des prix, comblant ainsi les lacunes à une échelle impossible à atteindre manuellement. Ceci a un impact direct sur le chiffre d'affaires : les attributs renseignés par le modèle doivent rester suffisamment précis pour répondre aux exigences des différents canaux de distribution et correspondre à l'intention d'achat, sous peine de voir l'automatisation remplacer un type d'erreur par un autre.
Comment fonctionne l'apprentissage automatique dans les flux de données
La plupart des applications d'apprentissage automatique liées aux flux de données commencent par un modèle entraîné – basé sur l'historique des données produits, les résultats de vente ou les listes de produits concurrents collectées – qui attribue un score ou prédit la valeur de chaque article transitant par le système. Il peut s'agir de prédire un type de produit manquant, d'estimer les prix optimaux ou de faire correspondre la référence d'un marchand à l'entrée canonique du catalogue d'une place de marché, une tâche étroitement liée à la correspondance hybride , qui combine souvent l'évaluation par apprentissage automatique avec une logique basée sur des règles pour les cas où le modèle est moins sûr de lui. Ces mêmes techniques sous-jacentes permettent la prévision de la demande , où des modèles entraînés sur l'historique des ventes et la saisonnalité prédisent la demande future, et la normalisation , où les modèles peuvent standardiser les tailles, les couleurs ou les unités de mesure incohérentes entre les fournisseurs beaucoup plus rapidement que les tableaux de correspondance manuels. Étant donné que la sortie du modèle est probabiliste et non certaine, la plupart des systèmes de production définissent des seuils de confiance : seules les prédictions supérieures à un certain score sont automatiquement appliquées, les cas moins fiables étant soumis à une vérification humaine.
Exemple : Champs prédits par apprentissage automatique dans un flux de produits
<item>
<g:id>SKU-40217</g:id>
<title>Ceramic Pour-Over Coffee Dripper - Speckled White</title>
<link>https://example-shop.com/products/ceramic-pour-over-dripper</link>
<g:price>34.00 USD</g:price>
<g:product_type>Home & Kitchen > Coffee & Tea > Drip Coffee Makers</g:product_type>
<g:google_product_category>Kitchen & Dining > Kitchen Appliances</g:google_product_category>
<custom_label_0>ml_category_confidence:0.91</custom_label_0>
<custom_label_1>ml_predicted_field:product_type</custom_label_1>
</item>
Ici, product_type et google_product_category ont été renseignées par un modèle plutôt que par saisie manuelle, et le score de confiance dans l'étiquette personnalisée permet aux règles en aval de décider si cette prédiction est suffisamment fiable pour être publiée telle quelle.
Concepts associés
L'apprentissage automatique sous-tend plusieurs autres disciplines de gestion des flux plutôt que d'en être dissocié : il est le moteur d'une grande partie des prévisions de la demande modernes, il alimente la normalisation automatisée lorsque les catalogues nécessitent des valeurs cohérentes à grande échelle, et il est fréquemment combiné à une logique déterministe dans la correspondance hybride pour harmoniser les annonces provenant de différentes sources. Les équipes souhaitant appliquer ces techniques à leurs propres catalogues trouveront un guide pratique dans « Utiliser l'IA pour une gestion et une automatisation plus intelligentes des flux e-commerce » , qui explique comment l'automatisation basée sur les modèles s'intègre aux règles de flux traditionnelles.