Отправить сообщение

На этом сайте используются файлы cookie.
Подробнее

На Хабре вышла статья Tevian о мультимодальных моделях в e‑commerce

К новостям

Мы опубликовали на Хабре статью «Как мультимодальные модели научились понимать товар, а не картинку».

multimodal-models-ecommerce-tevian

В материале разбираем, как развивались технологии визуального поиска и поиска товаров по фото в e‑commerce: от моделей компьютерного зрения и CLIP до мультимодальных моделей, которые объединяют изображения, текстовые описания и атрибуты товарных карточек в единое представление товара.

От визуального поиска к пониманию товара

Рассказываем, почему для точного поиска конкретного SKU недостаточно визуального сходства, как модели работают с несколькими фотографиями одного товара и шумными данными каталога и зачем современным системам product understanding нужны текстовые и визуальные признаки одновременно.

Отдельно рассматриваем развитие мультимодальных подходов на примере e-CLIP, MOON, MOON2.0, AFMRL и MOON3.0 и то, как они решают задачу fine-grained product understanding — различения визуально похожих товаров по детальным характеристикам.

Читать статью на Хабре