Dopasowanie hybrydowe to podejście do identyfikacji i kategoryzacji produktów, które łączy wiele technik dopasowywania – dokładne wyszukiwanie identyfikatorów, takich jak GTIN lub MPN, wraz z rozmytym, opartym na atrybutach porównaniem tytułów, obrazów i opisów – zamiast polegać na jednej metodzie. Jest ono stosowane, gdy brakuje ustrukturyzowanych identyfikatorów, są one niespójne lub zawodne w całym katalogu, co jest na tyle powszechne w rzeczywistych plikach danych produktowych, że żadna pojedyncza metoda dopasowywania nie jest skuteczna. W rezultacie proces dopasowywania jest zauważalnie bardziej odporny na nieuporządkowane lub niekompletne dane produktowe niż samo dopasowywanie identyfikatorów.
Dlaczego hybrydowe dopasowywanie ma znaczenie dla jakości danych o produktach
Wiele prawdziwych katalogów nie ma czystych numerów GTIN lub MPN dla każdego produktu — produkty rękodzielnicze, produkty marek własnych, odnowione produkty i kody SKU z długim ogonem od mniejszych producentów często ich w ogóle nie mają — co psuje każdy system dopasowywania oparty wyłącznie na dokładnych identyfikatorach. Platformy zakupowe i porównywarki nadal muszą poprawnie grupować te produkty, dopasowywać je do istniejących wpisów w katalogu lub usuwać duplikaty ofert u różnych sprzedawców, więc powrót do hybrydowego dopasowywania sprawia, że plik danych jest użyteczny nawet w przypadku awarii ścieżki z czystym identyfikatorem. Ma to bezpośrednie znaczenie dla wydajności pliku danych: produkt, którego nie można poprawnie dopasować, ryzykuje oznaczenie, błędną cenę w porównaniu z konkurencją lub wyświetlanie z obniżonymi wynikami rozszerzonymi, a wszystkich tych sytuacji można uniknąć, jeśli logika dopasowywania opiera się na mechanizmie awaryjnym, a nie na ścisłej zależności od idealnych danych.
Jak działa dopasowywanie hybrydowe
Hybrydowy system dopasowywania zazwyczaj najpierw próbuje ścisłej ścieżki — wyszukiwania GTIN, MPN lub marki z identyfikatorem — i powraca do rozmytego porównania tytułów, atrybutów i obrazów dopiero wtedy, gdy to się nie powiedzie lub nie zwróci pewnego dopasowania. Przed jakimkolwiek porównaniem zazwyczaj najpierw należy przeprowadzić normalizację, ponieważ rozmyte dopasowanie w przypadku niespójnej wielkości liter, skrótów lub formatów jednostek daje mało wiarygodne wyniki; system porównujący 5 funtów z 5 funtami wymaga znormalizowania tych wartości do tej samej formy, zanim ocena podobieństwa będzie miała jakiekolwiek znaczenie. Bardziej zaawansowane implementacje wykorzystują również ustrukturyzowane dane referencyjne przypominające graf wiedzy, wykorzystując relacje kategorii i znane pary marka-atrybut do ujednoznacznienia dopasowań, które same porównanie tytułów dałoby błędny wynik.
Przykład: dopasowanie hybrydowe w kanale produktów
<item>
<g:id>SKU-68204</g:id>
<title>Handwoven Wool Throw Blanket - Natural Oatmeal, 50x60in</title>
<link>https://example-shop.com/products/handwoven-wool-throw-oatmeal</link>
<g:price>84.00 USD</g:price>
<g:availability>in stock</g:availability>
<g:brand>Loomcraft Studio</g:brand>
<g:identifier_exists>false</g:identifier_exists>
</item>
Z identifier_exists jeśli ustawisz wartość false, nie ma numeru GTIN ani MPN do dopasowania, więc hybrydowy proces dopasowywania wraca do pola marki oraz znormalizowanych atrybutów tytułu i wymiarów, aby znaleźć lub potwierdzić dopasowanie katalogu — to dokładnie taki scenariusz, który jest w stanie obsłużyć ta technika.
Powiązane pojęcia
Dopasowanie hybrydowe w dużym stopniu opiera się na normalizacji przeprowadzanej od początku, ponieważ porównanie rozmyte jest tak dobre, jak spójność danych, które je zasilają, i często opiera się na danych referencyjnych w stylu grafu wiedzy , aby rozstrzygać niejednoznaczne dopasowania, których same atrybuty nie są w stanie rozstrzygnąć. Technika ta pośrednio wspiera również segmentację , ponieważ dokładne grupowanie podobnych lub zduplikowanych produktów jest często pierwszym krokiem do zbudowania przejrzystych, rzetelnych segmentów z nieuporządkowanego katalogu.