Le matching hybride est une méthode d'identification et de catégorisation des produits qui combine plusieurs techniques de correspondance : la recherche d'identifiants exacts comme le GTIN ou le MPN, associée à une comparaison plus approximative basée sur les attributs des titres, images et descriptions, au lieu de s'appuyer sur une seule méthode. Il est utilisé lorsque les identifiants structurés sont manquants, incohérents ou peu fiables dans un catalogue, ce qui est fréquent dans les flux de données produits réels, car aucune méthode de correspondance ne peut, à elle seule, s'avérer suffisante. Il en résulte un processus de correspondance nettement plus robuste face à des données produits incomplètes ou erronées que la simple correspondance d'identifiants.

Pourquoi la correspondance hybride est importante pour la qualité des données produit

De nombreux catalogues réels ne comportent pas de GTIN ou de MPN complets pour chaque article : les produits artisanaux, les marques de distributeur, les articles reconditionnés et les références rares de petits fabricants en sont souvent totalement dépourvus. Cela compromet tout système de correspondance reposant uniquement sur des identifiants précis. Les plateformes d'achat et les comparateurs de prix doivent néanmoins regrouper correctement ces produits, les faire correspondre aux entrées de catalogue existantes ou dédupliquer les annonces entre vendeurs. Le recours à une correspondance hybride permet donc de maintenir un flux utilisable même lorsque la méthode basée sur des identifiants complets échoue. Ceci a un impact direct sur les performances du flux : un produit qui ne peut être correctement associé risque d'être signalé, d'être affiché à un prix erroné par rapport à la concurrence ou de présenter des résultats enrichis de qualité inférieure. Tous ces problèmes sont évitables si la logique de correspondance prévoit une solution de repli plutôt qu'une dépendance absolue à des données parfaites.

Comment fonctionne le jumelage hybride

Un système de correspondance hybride privilégie généralement la méthode stricte (recherche par GTIN, MPN ou marque et identifiant) et ne recourt à la comparaison approximative des titres, attributs et images qu'en cas d'échec ou d'absence de correspondance fiable. Avant toute comparaison, une normalisation est généralement nécessaire, car la correspondance approximative basée sur des incohérences de casse, d'abréviations ou de formats d'unités produit des résultats peu fiables ; un système comparant 5 lb à 5 lb nécessite une normalisation de ces valeurs pour que le score de similarité soit pertinent. Les implémentations plus avancées exploitent également des données de référence structurées, semblables à un graphe de connaissances, en utilisant les relations entre catégories et les paires marque-attribut connues pour lever l'ambiguïté des correspondances que la seule comparaison des titres ne permettrait pas d'identifier avec certitude.

Exemple : Correspondance hybride dans un flux de produits

<item>
  <g:id>SKU-68204</g:id>
  <title>Handwoven Wool Throw Blanket - Natural Oatmeal, 50x60in</title>
  <link>https://example-shop.com/products/handwoven-wool-throw-oatmeal</link>
  <g:price>84.00 USD</g:price>
  <g:availability>in stock</g:availability>
  <g:brand>Loomcraft Studio</g:brand>
  <g:identifier_exists>false</g:identifier_exists>
</item>

Avec identifier_exists Si la valeur est « false », il n'y a pas de GTIN ni de MPN sur lesquels faire correspondre les données. Un processus de correspondance hybride utilise alors le champ de marque, ainsi que le titre normalisé et les attributs de dimension, pour trouver ou confirmer une correspondance dans le catalogue — le scénario précis que cette technique est censée gérer.

Concepts associés

La correspondance hybride repose fortement sur une normalisation en amont, car la comparaison approximative n'est efficace que si les données qui l'alimentent sont cohérentes. Elle s'appuie souvent sur des données de référence de type graphe de connaissances pour résoudre les correspondances ambiguës que les attributs seuls ne permettent pas de trancher. Cette technique facilite également indirectement la segmentation , car le regroupement précis des produits similaires ou dupliqués constitue souvent la première étape vers la création de segments clairs et fiables à partir d'un catalogue autrement complexe.