Dopasowanie hybrydowe to podejście do identyfikacji i kategoryzacji produktów, które łączy wiele technik dopasowywania – dokładne wyszukiwanie identyfikatorów, takich jak GTIN lub MPN, wraz z rozmytym, opartym na atrybutach porównaniem tytułów, obrazów i opisów – zamiast polegać na jednej metodzie. Jest ono stosowane, gdy brakuje ustrukturyzowanych identyfikatorów, są one niespójne lub zawodne w całym katalogu, co jest na tyle powszechne w rzeczywistych plikach danych produktowych, że żadna pojedyncza metoda dopasowywania nie jest skuteczna. W rezultacie proces dopasowywania jest zauważalnie bardziej odporny na nieuporządkowane lub niekompletne dane produktowe niż samo dopasowywanie identyfikatorów.

Dlaczego hybrydowe dopasowywanie ma znaczenie dla jakości danych o produktach

Wiele prawdziwych katalogów nie ma czystych numerów GTIN lub MPN dla każdego produktu — produkty rękodzielnicze, produkty marek własnych, odnowione produkty i kody SKU z długim ogonem od mniejszych producentów często ich w ogóle nie mają — co psuje każdy system dopasowywania oparty wyłącznie na dokładnych identyfikatorach. Platformy zakupowe i porównywarki nadal muszą poprawnie grupować te produkty, dopasowywać je do istniejących wpisów w katalogu lub usuwać duplikaty ofert u różnych sprzedawców, więc powrót do hybrydowego dopasowywania sprawia, że ​​plik danych jest użyteczny nawet w przypadku awarii ścieżki z czystym identyfikatorem. Ma to bezpośrednie znaczenie dla wydajności pliku danych: produkt, którego nie można poprawnie dopasować, ryzykuje oznaczenie, błędną cenę w porównaniu z konkurencją lub wyświetlanie z obniżonymi wynikami rozszerzonymi, a wszystkich tych sytuacji można uniknąć, jeśli logika dopasowywania opiera się na mechanizmie awaryjnym, a nie na ścisłej zależności od idealnych danych.

Jak działa dopasowywanie hybrydowe

Hybrydowy system dopasowywania zazwyczaj najpierw próbuje ścisłej ścieżki — wyszukiwania GTIN, MPN lub marki z identyfikatorem — i powraca do rozmytego porównania tytułów, atrybutów i obrazów dopiero wtedy, gdy to się nie powiedzie lub nie zwróci pewnego dopasowania. Przed jakimkolwiek porównaniem zazwyczaj najpierw należy przeprowadzić normalizację, ponieważ rozmyte dopasowanie w przypadku niespójnej wielkości liter, skrótów lub formatów jednostek daje mało wiarygodne wyniki; system porównujący 5 funtów z 5 funtami wymaga znormalizowania tych wartości do tej samej formy, zanim ocena podobieństwa będzie miała jakiekolwiek znaczenie. Bardziej zaawansowane implementacje wykorzystują również ustrukturyzowane dane referencyjne przypominające graf wiedzy, wykorzystując relacje kategorii i znane pary marka-atrybut do ujednoznacznienia dopasowań, które same porównanie tytułów dałoby błędny wynik.

Przykład: dopasowanie hybrydowe w kanale produktów

<item>
  <g:id>SKU-68204</g:id>
  <title>Handwoven Wool Throw Blanket - Natural Oatmeal, 50x60in</title>
  <link>https://example-shop.com/products/handwoven-wool-throw-oatmeal</link>
  <g:price>84.00 USD</g:price>
  <g:availability>in stock</g:availability>
  <g:brand>Loomcraft Studio</g:brand>
  <g:identifier_exists>false</g:identifier_exists>
</item>

Z identifier_exists jeśli ustawisz wartość false, nie ma numeru GTIN ani MPN do dopasowania, więc hybrydowy proces dopasowywania wraca do pola marki oraz znormalizowanych atrybutów tytułu i wymiarów, aby znaleźć lub potwierdzić dopasowanie katalogu — to dokładnie taki scenariusz, który jest w stanie obsłużyć ta technika.

Powiązane pojęcia

Dopasowanie hybrydowe w dużym stopniu opiera się na normalizacji przeprowadzanej od początku, ponieważ porównanie rozmyte jest tak dobre, jak spójność danych, które je zasilają, i często opiera się na danych referencyjnych w stylu grafu wiedzy , aby rozstrzygać niejednoznaczne dopasowania, których same atrybuty nie są w stanie rozstrzygnąć. Technika ta pośrednio wspiera również segmentację , ponieważ dokładne grupowanie podobnych lub zduplikowanych produktów jest często pierwszym krokiem do zbudowania przejrzystych, rzetelnych segmentów z nieuporządkowanego katalogu.