На главную

Как победить хаос в данных и спасти юнит-экономику: кейс о том, почему ваши менеджеры тратят миллионы, а ИИ решает это за копейки

Давайте начистоту. Большинство предпринимателей и директоров по маркетингу одержимы внешними показателями: стоимостью клика (CPC), конверсией посадочных...

31 августа 2026 г.
Как победить хаос в данных и спасти юнит-экономику: кейс о том, почему ваши менеджеры тратят миллионы, а ИИ решает это за копейки

Эпидемия «грязных данных»: почему ваш маркетинг сливает бюджеты

Давайте начистоту. Большинство предпринимателей и директоров по маркетингу одержимы внешними показателями: стоимостью клика (CPC), конверсией посадочных страниц и CTR объявлений. Мы готовы неделями спорить о цвете кнопки на сайте, но упорно игнорируем то, что происходит под капотом нашего бизнеса — в базах данных, CRM и ERP-системах. А там обычно царит первозданный хаос.

Представьте классическую картину: у вас крупная сеть, франшиза или просто бизнес со 150 представительствами. В каждом офисе сидит свой условный «дядя Вася», который заносит товары в базу так, как ему подсказывает сердце. В итоге один и тот же кабель, подшипник или крем для лица в одном филиале значится как «Кабель медный 3х2.5», во втором — «Провод ВВГнг 3*2,5», а в третьем — просто «Каб. 3х2,5 (ГОСТ)».

Для обычного SQL-запроса типа JOIN это три абсолютно разных товара. Для вашей сквозной аналитики — это три разные сущности. В результате вы не можете нормально посчитать маржинальность, настроить автоматические рекомендации на сайте, запустить персонализированный ретаргетинг или банально оптимизировать закупки. Вы тратите миллионы на трафик, а ваша юнит-экономика трещит по швам просто потому, что ваши данные «грязные». И решать эту проблему ручным трудом менеджеров — это самый дорогой и глупый способ слить бюджет.

Кейс на 209 000 позиций: когда классические алгоритмы бессильны

Недавно на Вечерней школе Слёрма дата-инженер Дмитрий Дунаев разобрал великолепный кейс, который идеально иллюстрирует эту боль. Задача была масштабной: сопоставить 209 тысяч наименований товаров, разбросанных по 150 представительствам. Все они были записаны по-разному.

Попытка решить задачу в лоб — через стандартное объединение таблиц (JOIN) — дала жалкий 1% совпадений. Остальные 99% товаров зависли в воздухе. Что делает бизнес в такой ситуации обычно? Правильно, сажает отдел продаж или контент-менеджеров на телефон и заставляет их вручную сверять списки.

В данном кейсе один такой звонок для уточнения позиции занимал у менеджера в среднем 5 минут. А теперь включите базовую математику: 209 000 позиций умножаем на 5 минут. Получаем почти 17 400 часов чистой работы. Даже если платить сотруднику по минимальной ставке, стоимость такой «ручной» чистки базы данных улетает в космос, а сама задача растягивается на годы, за которые ассортимент успеет обновиться трижды. Это классический пример операционной неэффективности, которая тихо убивает маржинальность бизнеса.

Анатомия решения: как подружить Fuzzy-поиск, эмбеддинги и LLM

Вместо того чтобы нанимать армию аутсорсеров, инженеры построили элегантную трехэтапную систему фильтрации и сопоставления данных. И это именно тот подход, который я называю «умной автоматизацией». Вместо того чтобы пихать дорогую языковую модель (LLM) во все щели, разработчики создали гибридный конвейер.

Этап 1: Fuzzy-поиск (нечеткое сравнение)

На первом этапе глупо использовать нейросети — это долго и дорого. Здесь отлично справляются классические алгоритмы нечеткого поиска (например, расстояние Левенштейна или сходство Джаро-Винклера). Они быстро отсекают очевидные совпадения и опечатки, группируя похожие строки по чисто механическим признакам. Это позволяет бесплатно и мгновенно сузить выборку.

Этап 2: Векторные эмбеддинги

Когда буквы разные, но смысл один (например, «смартфон» и «телефон умный»), механический поиск пасует. Тут в дело вступают эмбеддинги. Текстовые названия товаров переводятся в многомерные векторы чисел, отражающие их семантический смысл. Специальная векторная база данных ищет товары, которые находятся близко друг к другу в этом смысловом пространстве. Это позволяет отсеять еще часть хаоса и сформировать пул наиболее вероятных кандидатов на совпадение.

Этап 3: LLM как финальный арбитр

И только на самом последнем этапе, когда круг сузился до нескольких неочевидных вариантов, к работе подключается большая языковая модель (LLM). Ей не нужно анализировать все 209 000 товаров. Ей дают конкретную пару или тройку названий и просят ответить на один вопрос: «Это один и тот же товар или разные?». Благодаря этому затраты на API и токены снижаются в тысячи раз, а точность стремится к идеалу.

Битва 15 моделей: почему большинство ИИ-решений — это слив бюджета

Самый интересный инсайт доклада Дмитрия Дунаева — это тестирование моделей. Разработчики протестировали 15 различных LLM, чтобы найти идеальный баланс. И это важнейший урок для любого бизнеса, который пытается внедрять ИИ.

Большинство компаний совершают две ошибки: либо берут самую дорогую и мощную модель (например, GPT-4), переплачивая гигантские деньги за избыточную мощность, либо пытаются сэкономить и внедряют слабую open-source модель, которая начинает «галлюцинировать» и путать товары.

Из 15 протестированных моделей нужный баланс критериев показала только одна. Модель должна была обладать тремя качествами:

  • Низкая стоимость токена: при обработке сотен тысяч позиций цена имеет решающее значение.
  • Высокая скорость ответа (latency): бизнес не может ждать неделями, пока модель обработает базу.
  • Понимание технического контекста на русском языке: модель должна понимать разницу между аббревиатурами, ГОСТами и специфическими сокращениями.

В итоге победу одержала модель, которая смогла точно сопоставить сложные технические наименования, не разорив компанию на оплате облачных вычислений. Это доказывает: в ИИ-проектах побеждает не тот, у кого «самая умная» модель, а тот, кто умеет считать экономику каждого запроса.

Экономика решения: считаем чистую прибыль, а не хайп

Давайте переведем этот технический кейс на язык денег и маркетинга. Что получил бизнес в результате внедрения этой связки?

Во-первых, колоссальную экономию на ФОТ. Менеджеры избавились от необходимости совершать бесконечные пятиминутные звонки для сверки позиций. Их время перенаправили на реальные продажи и работу с клиентами. Юнит-экономика отдела продаж мгновенно оздоровилась: стоимость целевого действия снизилась, а выработка на одного сотрудника выросла.

Во-вторых, чистые данные для маркетинга. Теперь, когда все 209 000 товаров приведены к единому знаменателю, компания может:

  • Запустить точную сквозную аналитику и видеть реальную маржу по каждой позиции в разрезе регионов.
  • Настроить товарные рекомендации на сайте, которые действительно работают (система больше не предложит купить тот же кабель под другим названием).
  • Оптимизировать складские запасы, избавившись от затоваривания «дублями» продуктов.

Чек-лист «Ленивого Маркетолога»: когда вам нужен ИИ-агент, а когда — нет

Я всегда призываю к здоровому скепсису. ИИ — это не волшебная таблетка, и пихать его во все процессы подряд — верный способ слить бюджет. Вот простой чек-лист, который поможет понять, стоит ли вам городить сложную систему с эмбеддингами и LLM, или лучше решить задачу старыми методами.

Строить ИИ-агента стоит, если:

  • Объем данных превышает 50 000 позиций. Вручную или простыми скриптами такой объем качественно не обработать.
  • Данные постоянно обновляются. Если к вам каждый день прилетают тысячи новых позиций от разных поставщиков, ручная модерация станет вечным и дорогим процессом.
  • Цена ошибки не критична для жизни людей. Если ИИ ошибется в сопоставлении кабеля — это неприятно, но поправимо. Если речь идет о дозировке лекарств — ИИ без жесткого контроля человека использовать нельзя.
  • У вас есть понятная бизнес-цель. Вы точно знаете, как чистые данные увеличат вашу прибыль (например, через рост LTV или снижение CAC).

Лучше сэкономить деньги и отказаться от ИИ, если:

  • Ваша база — меньше 10 000 строк. Обычный Excel, пара формул ВПР (VLOOKUP) и один толковый фрилансер за выходные решат эту задачу дешевле и быстрее.
  • У вас нет ИТ-инфраструктуры. Если ваши данные хранятся в разрозненных файлах на компьютерах сотрудников, сначала наведите порядок в хранении, а уже потом внедряйте ИИ.

Вместо эпилога: прагматичный взгляд на автоматизацию

Эра хайпа вокруг ИИ проходит, и наступает эра прагматизма. Побеждают не те компании, которые громче всех кричат о внедрении нейросетей, а те, кто тихо и цинично использует эти инструменты для оптимизации своих внутренних процессов.

Кейс с сопоставлением 209 000 товаров — это отличный пример того, как технологии на стыке DevOps, Data Engineering и AI решают приземленные, скучные, но критически важные для бизнеса задачи. Чистите свои данные, считайте деньги, не переплачивайте за лишние технологии и помните: лучший маркетинг — это тот, который опирается на точные цифры, а не на интуицию уставших менеджеров.


Больше практики, реальных цифр и разборов без воды:

⚡ Telegram-канал: t.me/lenivymarketolog — оперативные инсайты, тренды и аналитика без воды

💼 Группа ВКонтакте: vk.ru/lenivymarketolog — кейсы, статьи и практические руководства

🌐 Профиль в MAX: max.ru/id781624934797_biz — экспертный бизнес-блог и статьи

М
Автор: Черниенко
Маркетолог, специалист по перфоманс-трафику и росту продуктов.