На этом сайте используются файлы cookie.
Подробнее
Мы опубликовали на Хабре статью «Как мультимодальные модели научились понимать товар, а не картинку».
В материале разбираем, как развивались технологии визуального поиска и поиска товаров по фото в e‑commerce: от моделей компьютерного зрения и CLIP до мультимодальных моделей, которые объединяют изображения, текстовые описания и атрибуты товарных карточек в единое представление товара.
От визуального поиска к пониманию товара
Рассказываем, почему для точного поиска конкретного SKU недостаточно визуального сходства, как модели работают с несколькими фотографиями одного товара и шумными данными каталога и зачем современным системам product understanding нужны текстовые и визуальные признаки одновременно.
Отдельно рассматриваем развитие мультимодальных подходов на примере e-CLIP, MOON, MOON2.0, AFMRL и MOON3.0 и то, как они решают задачу fine-grained product understanding — различения визуально похожих товаров по детальным характеристикам.