Поток данных — это структурированный файл (обычно XML, CSV или JSON), который упаковывает записи о товарах или контенте продавца в строки стандартизированных полей, обновляемых по расписанию, чтобы каждая последующая система считывала одну и ту же актуальную информацию, вместо того чтобы полагаться на ручной ввод данных. Он находится между внутренними системами компании и внешними платформами, которым нужны данные о товарах, выступая в качестве связующего звена между ними. Потоки данных являются исходным материалом для более специфичных для каналов форматов, включая товарные фиды, которые фактически используют Google Shopping или Meta.
Почему поток данных важен для управления потоками данных
Поток данных имеет важное значение, поскольку это единственная точка, где становятся видны и исправимы несоответствия в базовых бизнес-данных до того, как они достигнут канала продаж. Исходные системы, такие как ERP или PIM, часто хранят информацию о товарах непоследовательно — разные команды вводят размеры, категории или описания немного по-разному — и поток данных является контрольной точкой, где это расхождение либо обнаруживается и исправляется, либо отправляется напрямую на торговую площадку. Платформы управления потоками данных используют этот этап для применения нормализации и обогащения записей метаданными , что гораздо дешевле исправить один раз, на уровне потока данных, чем независимо отслеживать ошибки на каждом канале продаж компании. Розничные продавцы, которые пропускают этот шаг, как правило, обнаруживают последствия позже в виде отклоненных объявлений или более низких позиций в поисковой выдаче.
Как работает поток данных
Поток данных генерируется путем извлечения записей о товарах из мест их хранения, сопоставления каждого внутреннего поля с ожидаемой схемой назначения и вывода результата в виде файла или конечной точки, которую можно повторно загрузить по расписанию. На этапе генерации также происходит преобразование: единицы измерения конвертируются, названия категорий сопоставляются с таксономией канала, недостающие поля заполняются из источников обогащения, а дубликаты или снятые с производства товары отфильтровываются. Поскольку один и тот же базовый поток данных часто предоставляет несколько различных выходных данных для конкретных каналов — поток в формате Google, поток в формате Meta, поток партнерской сети — очистка базового потока данных один раз означает, что каждый последующий поток данных о товарах наследует ту же точность, вместо того чтобы требовать отдельных исправлений.
Пример: строка данных в формате XML.
<item>
<g:id>SKU-40217</g:id>
<title>Ceramic Pour-Over Coffee Dripper - Matte White</title>
<link>https://example-shop.com/products/ceramic-pour-over-dripper</link>
<g:price>28.50 USD</g:price>
<g:availability>in stock</g:availability>
<g:gtin>00812345678903</g:gtin>
<g:brand>Kettle & Ash</g:brand>
<g:product_type>Home > Kitchen > Coffee & Tea</g:product_type>
</item>
Каждое поле здесь отражает решение, принятое на предыдущем этапе обработки данных: g:product_type отражает сопоставление категорий, применяемое в процессе нормализации. g:gtin Отражает поле метаданных, полученное из базы данных товаров, а наличие каждого обязательного атрибута свидетельствует о прохождении этапа проверки, который был выполнен до того, как эта запись была допущена к включению в окончательный результат.
Связанные концепции
Исходный поток данных редко бывает чистым — как правило, для стандартизации несоответствующих значений и заполнения метаданных, содержащих фактические атрибуты, по которым канал ранжируется, требуется нормализация, прежде чем он будет готов стать потоком данных, специфичным для данного канала. Полное пошаговое описание того, что должен содержать корректно сформированный поток данных, см. в нашем руководстве по стандартным параметрам XML-потоков данных.