Как победить хаос в данных и спасти юнит-экономику: кейс о том, почему ваши менеджеры тратят миллионы, а ИИ решает это за копейки
Давайте начистоту. Большинство предпринимателей и директоров по маркетингу одержимы внешними показателями: стоимостью клика (CPC), конверсией посадочных...
Эпидемия «грязных данных»: почему ваш маркетинг сливает бюджеты
Давайте начистоту. Большинство предпринимателей и директоров по маркетингу одержимы внешними показателями: стоимостью клика (CPC), конверсией посадочных страниц и CTR объявлений. Мы готовы неделями спорить о цвете кнопки на сайте, но упорно игнорируем то, что происходит под капотом нашего бизнеса — в базах данных, CRM и ERP-системах. А там обычно царит первозданный хаос.
Представьте классическую картину: у вас крупная сеть, франшиза или просто бизнес со 150 представительствами. В каждом офисе сидит свой условный «дядя Вася», который заносит товары в базу так, как ему подсказывает сердце. В итоге один и тот же кабель, подшипник или крем для лица в одном филиале значится как «Кабель медный 3х2.5», во втором — «Провод ВВГнг 3*2,5», а в третьем — просто «Каб. 3х2,5 (ГОСТ)».
Для обычного SQL-запроса типа JOIN это три абсолютно разных товара. Для вашей сквозной аналитики — это три разные сущности. В результате вы не можете нормально посчитать маржинальность, настроить автоматические рекомендации на сайте, запустить персонализированный ретаргетинг или банально оптимизировать закупки. Вы тратите миллионы на трафик, а ваша юнит-экономика трещит по швам просто потому, что ваши данные «грязные». И решать эту проблему ручным трудом менеджеров — это самый дорогой и глупый способ слить бюджет.
Кейс на 209 000 позиций: когда классические алгоритмы бессильны
Недавно на Вечерней школе Слёрма дата-инженер Дмитрий Дунаев разобрал великолепный кейс, который идеально иллюстрирует эту боль. Задача была масштабной: сопоставить 209 тысяч наименований товаров, разбросанных по 150 представительствам. Все они были записаны по-разному.
Попытка решить задачу в лоб — через стандартное объединение таблиц (JOIN) — дала жалкий 1% совпадений. Остальные 99% товаров зависли в воздухе. Что делает бизнес в такой ситуации обычно? Правильно, сажает отдел продаж или контент-менеджеров на телефон и заставляет их вручную сверять списки.
В данном кейсе один такой звонок для уточнения позиции занимал у менеджера в среднем 5 минут. А теперь включите базовую математику: 209 000 позиций умножаем на 5 минут. Получаем почти 17 400 часов чистой работы. Даже если платить сотруднику по минимальной ставке, стоимость такой «ручной» чистки базы данных улетает в космос, а сама задача растягивается на годы, за которые ассортимент успеет обновиться трижды. Это классический пример операционной неэффективности, которая тихо убивает маржинальность бизнеса.
Анатомия решения: как подружить Fuzzy-поиск, эмбеддинги и LLM
Вместо того чтобы нанимать армию аутсорсеров, инженеры построили элегантную трехэтапную систему фильтрации и сопоставления данных. И это именно тот подход, который я называю «умной автоматизацией». Вместо того чтобы пихать дорогую языковую модель (LLM) во все щели, разработчики создали гибридный конвейер.
Этап 1: Fuzzy-поиск (нечеткое сравнение)
На первом этапе глупо использовать нейросети — это долго и дорого. Здесь отлично справляются классические алгоритмы нечеткого поиска (например, расстояние Левенштейна или сходство Джаро-Винклера). Они быстро отсекают очевидные совпадения и опечатки, группируя похожие строки по чисто механическим признакам. Это позволяет бесплатно и мгновенно сузить выборку.
Этап 2: Векторные эмбеддинги
Когда буквы разные, но смысл один (например, «смартфон» и «телефон умный»), механический поиск пасует. Тут в дело вступают эмбеддинги. Текстовые названия товаров переводятся в многомерные векторы чисел, отражающие их семантический смысл. Специальная векторная база данных ищет товары, которые находятся близко друг к другу в этом смысловом пространстве. Это позволяет отсеять еще часть хаоса и сформировать пул наиболее вероятных кандидатов на совпадение.
Этап 3: LLM как финальный арбитр
И только на самом последнем этапе, когда круг сузился до нескольких неочевидных вариантов, к работе подключается большая языковая модель (LLM). Ей не нужно анализировать все 209 000 товаров. Ей дают конкретную пару или тройку названий и просят ответить на один вопрос: «Это один и тот же товар или разные?». Благодаря этому затраты на API и токены снижаются в тысячи раз, а точность стремится к идеалу.
Битва 15 моделей: почему большинство ИИ-решений — это слив бюджета
Самый интересный инсайт доклада Дмитрия Дунаева — это тестирование моделей. Разработчики протестировали 15 различных LLM, чтобы найти идеальный баланс. И это важнейший урок для любого бизнеса, который пытается внедрять ИИ.
Большинство компаний совершают две ошибки: либо берут самую дорогую и мощную модель (например, GPT-4), переплачивая гигантские деньги за избыточную мощность, либо пытаются сэкономить и внедряют слабую open-source модель, которая начинает «галлюцинировать» и путать товары.
Из 15 протестированных моделей нужный баланс критериев показала только одна. Модель должна была обладать тремя качествами:
- Низкая стоимость токена: при обработке сотен тысяч позиций цена имеет решающее значение.
- Высокая скорость ответа (latency): бизнес не может ждать неделями, пока модель обработает базу.
- Понимание технического контекста на русском языке: модель должна понимать разницу между аббревиатурами, ГОСТами и специфическими сокращениями.
В итоге победу одержала модель, которая смогла точно сопоставить сложные технические наименования, не разорив компанию на оплате облачных вычислений. Это доказывает: в ИИ-проектах побеждает не тот, у кого «самая умная» модель, а тот, кто умеет считать экономику каждого запроса.
Экономика решения: считаем чистую прибыль, а не хайп
Давайте переведем этот технический кейс на язык денег и маркетинга. Что получил бизнес в результате внедрения этой связки?
Во-первых, колоссальную экономию на ФОТ. Менеджеры избавились от необходимости совершать бесконечные пятиминутные звонки для сверки позиций. Их время перенаправили на реальные продажи и работу с клиентами. Юнит-экономика отдела продаж мгновенно оздоровилась: стоимость целевого действия снизилась, а выработка на одного сотрудника выросла.
Во-вторых, чистые данные для маркетинга. Теперь, когда все 209 000 товаров приведены к единому знаменателю, компания может:
- Запустить точную сквозную аналитику и видеть реальную маржу по каждой позиции в разрезе регионов.
- Настроить товарные рекомендации на сайте, которые действительно работают (система больше не предложит купить тот же кабель под другим названием).
- Оптимизировать складские запасы, избавившись от затоваривания «дублями» продуктов.
Чек-лист «Ленивого Маркетолога»: когда вам нужен ИИ-агент, а когда — нет
Я всегда призываю к здоровому скепсису. ИИ — это не волшебная таблетка, и пихать его во все процессы подряд — верный способ слить бюджет. Вот простой чек-лист, который поможет понять, стоит ли вам городить сложную систему с эмбеддингами и LLM, или лучше решить задачу старыми методами.
Строить ИИ-агента стоит, если:
- Объем данных превышает 50 000 позиций. Вручную или простыми скриптами такой объем качественно не обработать.
- Данные постоянно обновляются. Если к вам каждый день прилетают тысячи новых позиций от разных поставщиков, ручная модерация станет вечным и дорогим процессом.
- Цена ошибки не критична для жизни людей. Если ИИ ошибется в сопоставлении кабеля — это неприятно, но поправимо. Если речь идет о дозировке лекарств — ИИ без жесткого контроля человека использовать нельзя.
- У вас есть понятная бизнес-цель. Вы точно знаете, как чистые данные увеличат вашу прибыль (например, через рост LTV или снижение CAC).
Лучше сэкономить деньги и отказаться от ИИ, если:
- Ваша база — меньше 10 000 строк. Обычный Excel, пара формул ВПР (VLOOKUP) и один толковый фрилансер за выходные решат эту задачу дешевле и быстрее.
- У вас нет ИТ-инфраструктуры. Если ваши данные хранятся в разрозненных файлах на компьютерах сотрудников, сначала наведите порядок в хранении, а уже потом внедряйте ИИ.
Вместо эпилога: прагматичный взгляд на автоматизацию
Эра хайпа вокруг ИИ проходит, и наступает эра прагматизма. Побеждают не те компании, которые громче всех кричат о внедрении нейросетей, а те, кто тихо и цинично использует эти инструменты для оптимизации своих внутренних процессов.
Кейс с сопоставлением 209 000 товаров — это отличный пример того, как технологии на стыке DevOps, Data Engineering и AI решают приземленные, скучные, но критически важные для бизнеса задачи. Чистите свои данные, считайте деньги, не переплачивайте за лишние технологии и помните: лучший маркетинг — это тот, который опирается на точные цифры, а не на интуицию уставших менеджеров.
Больше практики, реальных цифр и разборов без воды:
⚡ Telegram-канал: t.me/lenivymarketolog — оперативные инсайты, тренды и аналитика без воды
💼 Группа ВКонтакте: vk.ru/lenivymarketolog — кейсы, статьи и практические руководства
🌐 Профиль в MAX: max.ru/id781624934797_biz — экспертный бизнес-блог и статьи