После запуска CRM-кампании компания обычно видит:
- сколько сообщений было отправлено
- сколько клиентов их получили
- сколько человек открыли письмо
- сколько перешли по ссылке
- сколько получателей совершили покупку
- какую выручку принесли эти покупки.
Эти показатели помогают понять, что происходило после коммуникации. Но они не отвечают на главный бизнес-вопрос:
Какая часть результата появилась именно благодаря CRM-автоматизации?
Если клиент получил письмо, а через два дня сделал заказ, между этими событиями существует временная связь. Но временная связь еще не доказывает, что письмо стало причиной покупки.
Возможно, клиент:
- и так собирался сделать заказ
- регулярно покупает каждый месяц
- увидел рекламу в другом канале
- пришел по рекомендации
- участвовал в общей акции
- получил звонок менеджера
- случайно совершил покупку в период, который система считает окном атрибуции.
Поэтому выручка получателей и дополнительная выручка — разные показатели.
Чтобы измерить реальный эффект CRM-автоматизации, необходимо оценить не только то, что произошло после кампании, но и то, что произошло бы с этими же клиентами без нее.
Именно вокруг этого вопроса строится причинно-следственная аналитика.
1. Главная проблема: мы не можем одновременно наблюдать два будущих
Представим одного клиента.
Он соответствует условиям CRM-сценария развития второй покупки. Мы отправляем ему предложение, и через пять дней он делает заказ.
Нам хотелось бы сравнить два результата:
- Что произошло после отправки сообщения.
- Что произошло бы с этим же клиентом в тот же период, если бы сообщение не было отправлено.
Но мы можем наблюдать только один вариант реальности.
Если клиент получил сообщение, мы уже не можем увидеть его поведение в полностью тех же обстоятельствах без сообщения. Если не получил — не узнаем наверняка, как он отреагировал бы на него.
Ненаблюдаемый результат называется контрфактическим.
Причинный эффект для клиента можно представить как разницу:
результат при воздействии − результат без воздействия.
На индивидуальном уровне эта разница обычно недоступна. Поэтому аналитика оценивает средний эффект для сопоставимых групп клиентов.
2. Атрибуция и причинный эффект — не одно и то же
В CRM-системах часто используется атрибуция.
Она связывает покупку с предшествующей коммуникацией по заданному правилу:
- последняя коммуникация перед покупкой
- последнее открытие
- последний переход
- покупка в течение 24 или 48 часов
- первый контакт
- распределение результата между несколькими касаниями.
Например:
Клиент открыл письмо и совершил покупку в течение 48 часов — покупка атрибутируется email-кампании.
Это полезное операционное правило. Оно помогает:
- распределять выручку между каналами
- строить дашборды
- сравнивать кампании
- анализировать путь клиента
- видеть покупки после коммуникаций.
Но атрибуция не создает контрфактический результат. Она не показывает, совершил бы клиент покупку без сообщения.
Bloomreach, например, использует в своих стандартных отчетах модель last touch: выручка относится к последнему взаимодействию в пределах выбранного окна атрибуции. Это именно модель распределения результата между касаниями, а не экспериментальная оценка причинного эффекта. Bloomreach: Revenue attribution
Поэтому корректно говорить:
20 млн тенге выручки было атрибутировано кампании по выбранной модели.
Но без контрольной группы некорректно утверждать:
Кампания создала 20 млн тенге дополнительной выручки.
Часть этой суммы могла появиться и без кампании.
3. Три уровня оценки CRM-кампании
Результаты полезно разделять на три уровня.
Технический уровень
Показывает, сработал ли канал:
- сообщения сформированы
- отправка состоялась
- сообщения доставлены
- отсутствуют критические ошибки
- ссылки работают
- персонализация отображается корректно.
Поведенческий уровень
Показывает, что клиенты делали после коммуникации:
- открывали
- переходили
- посещали сайт
- просматривали товары
- добавляли товары в корзину
- совершали покупки.
Причинный бизнес-уровень
Показывает, насколько поведение изменилось именно из-за воздействия:
- дополнительная конверсия
- дополнительные покупатели
- дополнительные заказы
- дополнительная выручка
- дополнительная маржа
- изменение частоты
- изменение retention
- изменение LTV.
Все три уровня необходимы, но отвечают на разные вопросы.
Высокий open rate не гарантирует дополнительной выручки. Низкий click rate не всегда означает отсутствие бизнес-эффекта. А большая выручка получателей может быть связана с тем, что в кампанию изначально попали самые активные клиенты.
4. Почему сравнение получателей и неполучателей часто вводит в заблуждение
Допустим, мы сравнили:
- клиентов, которым доставлено сообщение
- клиентов, которым сообщение не доставлено.
У первой группы конверсия оказалась выше.
Можно ли считать разницу эффектом кампании?
Не обязательно.
Недоставленные сообщения чаще встречаются у клиентов:
- с устаревшими контактами
- с низкой активностью
- с давно неиспользуемыми аккаунтами
- с ошибками адресов
- без подтвержденного канала.
Такая группа изначально может покупать реже.
Еще опаснее сравнивать:
- открывших письмо
- не открывших письмо.
Открытие происходит уже после назначения коммуникации. Клиенты сами выбирают, открывать ли сообщение, и этот выбор связан с их интересом к бренду.
Люди, которые открывают письма, могут изначально быть:
- более активными
- более лояльными
- более заинтересованными
- чаще посещающими сайт
- более склонными к покупке.
Если они покупают чаще, невозможно понять, что стало причиной: письмо или их исходная заинтересованность.
Поэтому для оценки эффекта группы формируются до воздействия, а не после реакции на него.
5. Контролируемый эксперимент
Наиболее надежный способ измерить эффект CRM-автоматизации — случайным образом разделить подходящих клиентов на группы.
Тестовая группа
Получает исследуемое воздействие:
- сообщение
- цепочку сообщений
- персонализированное предложение
- новый канал
- измененную логику сценария.
Контрольная группа
Не получает исследуемое воздействие либо продолжает получать прежний вариант, если оценивается изменение уже существующего процесса.
После этого сравнивается поведение групп.
Случайное распределение необходимо, чтобы до начала эксперимента группы в среднем были сопоставимы:
- по покупательской активности
- давности последней покупки
- среднему чеку
- категориям
- стране
- доступности каналов
- склонности к покупке
- другим наблюдаемым и ненаблюдаемым характеристикам.
Если группы достаточно велики и распределение выполнено корректно, систематической разницей между ними становится исследуемое воздействие.
Именно поэтому разницу в результатах можно интерпретировать как средний эффект кампании с учетом статистической неопределенности.
Контролируемые A/B-эксперименты используются для оценки причинного влияния изменений: пользователи случайно назначаются в контрольную и тестовую группы, после чего сравниваются заранее определенные показатели. Microsoft Research: A/B Testing Across Products
6. Сначала определяется аудитория, затем выполняется разделение
Очень важно правильно расположить эксперимент внутри CRM-сценария.
Сначала должны быть проверены общие условия:
- клиент соответствует бизнес-аудитории
- имеет необходимый контакт
- дал требуемое согласие
- не является тестовым профилем
- не находится под глобальным исключением
- может получить предложение
- не совершил целевое действие до начала эксперимента.
Только после этого подходящие клиенты случайно распределяются между тестовой и контрольной группами.
Иначе группы могут оказаться несопоставимыми.
Например:
- Все клиенты разделены на тест и контроль.
- В тестовой ветке перед отправкой исключены клиенты без email.
- В контрольной ветке такого исключения нет.
Тогда в тестовой группе останутся только достижимые клиенты, а в контрольной — и достижимые, и недостижимые. Это уже разные аудитории.
Bloomreach также рекомендует помещать общие условия до A/B-разделения и явно исключать клиентов без требуемого контакта или согласия из обеих групп. Bloomreach: A/B testing
Правильная последовательность:
формирование подходящей аудитории → проверка доступности воздействия → случайное распределение → воздействие или контроль → измерение результата.
7. Что именно получает контрольная группа
Контроль — это не всегда «полное отсутствие коммуникаций».
Он зависит от исследуемого вопроса.
Отсутствие нового сценария
Если нужно понять, создает ли новая автоматизация дополнительный результат:
- тестовая группа получает сценарий
- контрольная не получает его
- остальные процессы остаются одинаковыми.
Текущий вариант против нового
Если существующая коммуникация уже является частью обязательного процесса:
- контрольная группа получает текущую версию
- тестовая — новую
- измеряется эффект изменения.
Так можно тестировать:
- новую логику
- новую персонализацию
- другой канал
- измененный интервал
- новый ассортиментный алгоритм.
Несколько вариантов
Можно сравнивать:
- контроль без воздействия
- вариант A
- вариант B
- вариант C.
Но увеличение числа вариантов распределяет аудиторию между большим количеством групп. Для надежного вывода потребуется больше данных или более длительный эксперимент.
Постоянная holdout-группа
Иногда часть клиентов надолго исключается из определенного класса коммуникаций.
Такая группа позволяет измерять совокупный эффект всей системы автоматизаций, а не отдельной кампании.
Например:
- 95% аудитории участвует в CRM-программе
- 5% остается в постоянном holdout
- через несколько месяцев сравниваются частота, удержание, выручка и LTV.
Постоянный holdout дает более целостную оценку, но имеет коммерческую стоимость: часть клиентов намеренно не получает потенциально полезные воздействия. Размер и срок такой группы должны быть обоснованы.
8. Единица рандомизации
Перед экспериментом необходимо определить, что именно случайно распределяется между группами.
Это может быть:
- клиент
- учетная запись
- домохозяйство
- компания
- магазин
- регион
- устройство
- заказ.
Для CRM чаще всего используется клиент.
Но бывают исключения.
Если несколько профилей относятся к одному человеку, он может попасть одновременно в тестовую и контрольную группы. Если члены одного домохозяйства используют общий аккаунт или влияют на покупки друг друга, рандомизация по отдельным людям тоже может нарушить независимость.
Выбор более крупной единицы — например, магазина или региона — снижает риск взаимного влияния, но уменьшает фактическое количество независимых наблюдений.
Сто тысяч клиентов в ста магазинах — это не всегда сто тысяч независимых единиц, если воздействие назначается на уровне магазина.
Поэтому единица рандомизации определяется тем уровнем, на котором:
- назначается воздействие
- возможна контаминация
- измеряется результат
- принимается бизнес-решение.
9. Гипотеза и показатели определяются до запуска
До начала эксперимента необходимо зафиксировать гипотезу.
Хорошая гипотеза содержит:
- аудиторию
- воздействие
- ожидаемый результат
- период
- основную метрику.
Например:
Для клиентов, совершивших одну завершенную покупку и не совершивших вторую в течение 14 дней, персонализированный CRM-сценарий увеличит конверсию во вторую покупку в течение следующих 30 дней по сравнению с отсутствием сценария.
После этого определяются показатели.
Основная метрика
Один показатель, по которому принимается главное решение:
- конверсия
- количество покупателей
- частота
- удержание
- выручка на клиента
- валовая прибыль на клиента.
Вторичные метрики
Помогают понять механизм эффекта:
- посещения
- просмотры
- добавления в корзину
- время до покупки
- количество категорий
- средний чек.
Защитные метрики
Показывают нежелательные последствия:
- отписки
- жалобы
- возвраты
- скидочные расходы
- снижение маржи
- рост коммуникационной нагрузки
- снижение результата других каналов.
Microsoft в рекомендациях по надежным экспериментам также начинает процесс с формулирования простой проверяемой гипотезы и заранее выбранных метрик успеха. Microsoft Research: Patterns of Trustworthy Experimentation
10. Окно измерения
Необходимо определить, в течение какого периода после назначения воздействия учитывается результат.
Например:
- покупка в течение 7 дней
- вторая покупка в течение 30 дней
- удержание через 90 дней
- выручка в течение трех месяцев.
Слишком короткое окно не успеет захватить отложенный эффект. Слишком длинное увеличит влияние других факторов:
- следующих кампаний
- сезонности
- промо
- изменения цен
- новых продуктов
- естественных покупок.
Окно должно соответствовать механике сценария и естественному циклу поведения.
Для расходуемого товара эффект напоминания может проявиться через несколько недель. Для брошенной корзины релевантное окно обычно короче.
Важно не подбирать окно после просмотра результатов. Если проверить 1, 3, 7, 14, 30 и 60 дней, а затем выбрать только период с наиболее выгодной разницей, вероятность случайного «успеха» существенно возрастет.
Основное окно фиксируется заранее. Дополнительные периоды можно исследовать, но их следует обозначать как дополнительный анализ.
11. Uplift и increment
Рассмотрим эксперимент:
- целевая группа — 10 000 клиентов
- контрольная группа — 10 000 клиентов
- в тестовой группе купили 800 человек
- в контрольной — 500.
Конверсия целевой группы:
Конверсия контрольной группы:
Абсолютный uplift
Абсолютный uplift показывает разницу между вероятностями целевого действия.
Относительный uplift
Относительно контрольного уровня конверсия выросла на 60%.
Это не означает рост на 60 процентных пунктов. Формулировки необходимо различать:
- рост с 5% до 8%
- увеличение на 3 процентных пункта
- относительное увеличение на 60%.
Инкрементальные покупатели
Если бы целевая группа в отсутствие кампании вела себя как контрольная, в ней ожидалось бы:
Фактически купили 800 человек.
Оценка дополнительного числа покупателей:
Таким образом:
- 800 покупателей совершили покупку в тестовой группе
- примерно 500 из них могли купить и без кампании
- оценочный инкремент — 300 дополнительных покупателей.
Если после проверки результата сценарий распространить на 100 000 сопоставимых клиентов, ожидаемый инкремент составит около 3 000 покупателей:
Такое масштабирование допустимо только при условии, что новая аудитория, период и условия сопоставимы с экспериментом.
12. Инкрементальная выручка
Количество покупателей — не единственный результат. Кампания может влиять на:
- вероятность покупки
- количество заказов
- состав корзины
- средний чек
- скидку
- категорию
- сроки покупки.
Поэтому выручку лучше оценивать непосредственно на одного назначенного клиента.
Предположим:
| Показатель | Тест | Контроль |
|---|---|---|
| Клиенты | 10 000 | 10 000 |
| Покупатели | 800 | 500 |
| Выручка | 24 млн ₸ | 14 млн ₸ |
| Выручка на назначенного клиента | 2 400 ₸ | 1 400 ₸ |
Разница:
Оценка инкрементальной выручки в тестовой группе:
Такой расчет учитывает одновременно изменение конверсии и суммы покупок.
Нельзя автоматически умножать число дополнительных покупателей на средний чек всей тестовой группы. Клиенты, чью покупку действительно вызвала кампания, могут иметь другой средний чек, чем клиенты, которые купили бы в любом случае.
Разница в выручке на случайно назначенного клиента является более прямой оценкой.
13. Выручка еще не равна прибыли
Даже положительная инкрементальная выручка не гарантирует экономической эффективности.
Необходимо учесть:
- себестоимость товаров
- валовую маржу
- скидки
- промокоды
- стоимость канала
- стоимость бонусов
- возвраты
- операционные расходы
- влияние на будущие покупки.
Пример:
- инкрементальная выручка — 10 млн ₸
- себестоимость дополнительных товаров — 6 млн ₸
- скидки — 1,5 млн ₸
- стоимость коммуникации — 0,2 млн ₸
- дополнительные операционные расходы — 0,3 млн ₸.
Оценка дополнительного финансового результата:
Поэтому для кампаний со скидками и дорогими каналами предпочтительно измерять:
- маржинальную прибыль на клиента
- contribution margin
- окупаемость
- стоимость дополнительной покупки
- стоимость дополнительного покупателя.
14. Ускорение покупки и создание новой покупки
CRM-сценарий может не создать дополнительный заказ, а только приблизить его.
Например:
- без сообщения клиент купил бы через 20 дней
- после сообщения купил через 7 дней
- на горизонте 14 дней кампания выглядит успешной
- на горизонте 30 дней количество покупок в группах сравнивается.
Это называется эффектом переноса покупки вперед, или pull-forward effect.
Для бизнеса ускорение тоже может иметь ценность:
- раньше поступают деньги
- снижается риск оттока
- клиент быстрее переходит к следующему этапу
- улучшается оборачиваемость.
Но его нельзя выдавать за дополнительную покупку.
Чтобы различить эти эффекты, анализируют несколько горизонтов:
- краткосрочный
- основной
- расширенный.
Если uplift высок в первые семь дней, но исчезает через 30–60 дней, сценарий, вероятно, ускоряет покупки. Если разница сохраняется, появляется основание говорить о дополнительном объеме.
15. Каннибализация и перераспределение спроса
Рост целевой категории не всегда означает рост бизнеса в целом.
Сценарий может:
- увеличить продажи категории A
- одновременно снизить продажи категории B
- переключить клиента с более маржинального товара на менее маржинальный
- перенести покупку из офлайн-канала в онлайн
- заменить заказ по полной цене заказом со скидкой
- изменить состав корзины без изменения общей суммы.
Поэтому для ассортиментных сценариев необходимо измерять:
- продажи целевого товара
- продажи всей категории
- продажи соседних категорий
- общую выручку
- маржу
- количество уникальных категорий
- общий объем покупок клиента.
Иначе локально успешная кампания может просто перераспределить уже существующий спрос.
16. Статистическая неопределенность
Даже при случайном разделении группы не будут иметь абсолютно одинаковые результаты.
Если подбросить монету 100 раз, необязательно получится ровно 50 орлов и 50 решек. Аналогично контрольная и тестовая группы могут различаться случайно.
Поэтому вместе с оценкой эффекта необходимо учитывать неопределенность.
Доверительный интервал
Он показывает диапазон значений, совместимых с наблюдаемыми данными при выбранной статистической модели.
Например:
Оценочный uplift — +3 п.п.; доверительный интервал: от +1,2 до +4,8 п.п.
Это означает, что данные поддерживают положительный эффект, но его точный размер неизвестен.
Если интервал включает ноль:
от −0,5 до +2,4 п.п.,
данных недостаточно, чтобы надежно отличить положительный эффект от отсутствия эффекта или небольшого отрицательного результата.
Статистическая и бизнес-значимость
Статистически значимое изменение может быть слишком маленьким для бизнеса.
Например:
- uplift — +0,05 п.п.
- результат статистически надежен из-за огромной аудитории
- стоимость внедрения превышает экономический эффект.
И наоборот:
- наблюдаемый uplift — +5 п.п.
- аудитория мала
- интервал очень широк
- результат перспективен, но требует дополнительного теста.
Поэтому решение учитывает одновременно:
- направление эффекта
- размер
- неопределенность
- экономическую ценность
- стоимость реализации
- риски.
Bloomreach также рекомендует оценивать результаты A/B-тестов вместе со статистической значимостью и не принимать решения при недостаточном размере выборки. Bloomreach: A/B test basic evaluation
17. Размер выборки и минимально обнаружимый эффект
До эксперимента необходимо оценить, сколько клиентов потребуется.
Размер выборки зависит от:
- базовой конверсии
- минимального эффекта, который важно обнаружить
- допустимого риска ложного вывода
- требуемой статистической мощности
- соотношения тестовой и контрольной групп
- вариативности показателя.
Чем ниже базовая конверсия и меньше ожидаемый эффект, тем больше нужна аудитория.
Если покупку совершают 0,2% клиентов, различить 0,2% и 0,22% значительно сложнее, чем различить 10% и 15%.
Минимально обнаружимый эффект
Перед тестом полезно задать:
Какое минимальное изменение будет достаточно ценным, чтобы внедрять сценарий?
Если бизнесу интересен только рост не менее чем на 1 процентный пункт, эксперимент должен иметь достаточную мощность для обнаружения такого изменения.
Иначе после теста можно получить неопределенный результат просто потому, что аудитория была слишком мала.
В экспериментальной практике размер выборки связывается с базовой метрикой, уровнем значимости, требуемой мощностью и минимальным обнаружимым эффектом. Microsoft Research: Beyond Power Analysis
18. Почему нельзя останавливать тест при первом хорошем результате
Если ежедневно проверять результат и завершить эксперимент в момент, когда он стал положительным, возрастает вероятность принять случайное колебание за эффект.
Например:
- в первый день лидирует тест
- во второй — контроль
- на третий разница становится значимой
- на пятый исчезает
- через две недели стабилизируется около нуля.
Эксперимент должен работать в течение заранее определенного периода и охватывать полные бизнес-циклы:
- будни и выходные
- дни зарплат
- регулярные промо
- типичную сезонность
- ожидаемый срок реакции.
Bloomreach также рекомендует заранее определять продолжительность A/B-теста и охватывать как минимум один, а лучше два полных бизнес-цикла. Bloomreach: A/B testing
Если эксперимент требуется остановить досрочно по техническим или этическим причинам, это решение документируется, а анализ учитывает изменившийся дизайн.
19. Проверка корректности разделения
До анализа результата нужно убедиться, что эксперимент действительно был выполнен по плану.
Соотношение групп
Если настроено разделение 50/50, фактические размеры должны быть близки к этому отношению.
Существенное отклонение называется Sample Ratio Mismatch.
Оно может указывать на:
- ошибку рандомизации
- разные фильтры после разделения
- потерю событий
- дублирование профилей
- неодинаковую обработку веток
- технический сбой.
При наличии необъясненного Sample Ratio Mismatch оценивать эффект опасно. Microsoft рассматривает такую проверку как один из основных инструментов контроля экспериментов. Microsoft Research: Sample Ratio Mismatch
Сопоставимость исходных характеристик
Дополнительно проверяются показатели до воздействия:
- историческая частота
- выручка
- средний чек
- давность покупки
- категории
- страны
- доступность каналов.
Небольшие случайные различия допустимы. Систематический перекос может указывать на проблему формирования групп.
20. Анализ по назначенной группе, а не только по доставке
Основной анализ эксперимента обычно выполняется по первоначальному назначению:
- все клиенты, назначенные в тест, остаются тестом
- все назначенные в контроль остаются контролем.
Даже если часть тестовой группы:
- не получила сообщение
- не открыла его
- столкнулась с ошибкой доставки.
Такой подход оценивает эффект реальной политики:
Что произойдет, если для подходящих клиентов запустить этот сценарий?
Если оставить в тесте только получивших или открывших сообщение, случайное распределение нарушится.
При этом отдельно можно диагностировать:
- доставку
- просмотр
- переход
- ошибки.
Но анализ «только среди открывших» отвечает уже на другой вопрос и требует дополнительных предположений.
21. Пересечение с другими кампаниями
Во время эксперимента клиенты продолжают жить внутри общей CRM-системы.
Они могут получать:
- регулярные рассылки
- сервисные сообщения
- промо
- push-уведомления
- рекламу
- другие автоматические сценарии.
Это не всегда делает эксперимент недействительным. Если остальные воздействия распределяются между тестом и контролем примерно одинаково, их влияние в среднем компенсируется.
Проблема возникает, если исследуемая кампания меняет вероятность других воздействий или если сценарии непосредственно конфликтуют.
Например:
- тестовая группа получает скидку и исключается из другого промо
- контрольная продолжает получать промо
- один сценарий блокирует другой
- разные предложения влияют на одну категорию.
Тогда измеряется не только эффект сообщения, а эффект всей возникшей комбинации.
Пересечения следует:
- фиксировать
- отслеживать
- исключать при явном конфликте
- учитывать в интерпретации
- при необходимости проектировать общий эксперимент.
Исследования Microsoft показывают, что одновременные A/B-тесты часто могут сосуществовать, но при логически связанных изменениях взаимодействие между экспериментами становится существенным и требует изоляции или специального дизайна. Microsoft Research: A/B Interactions
22. Техническое задание на аналитику
Надежная оценка начинается до запуска кампании.
Сначала анализируются:
- конфигурация CRM-проекта
- бизнес-цель
- структура данных
- события
- KPI
- целевые действия
- экспериментальный дизайн
- доступные периоды истории.
После этого формируется техническое задание на извлечение и обработку данных.
Что должно быть зафиксировано
Эксперимент
- идентификатор
- название
- дата начала и окончания
- гипотеза
- единица рандомизации
- пропорции групп
- версия сценария.
Назначение
- идентификатор клиента
- группа
- время назначения
- условия соответствия
- параметры сценария
- страна и сегмент.
Воздействие
- попытка отправки
- доставка
- канал
- время
- версия сообщения
- технический статус
- причина подавления или ошибки.
Результаты
- целевое событие
- время
- идентификатор заказа
- статус
- сумма
- валюта
- товары
- категории
- возвраты и отмены.
Исторические показатели
- покупки до эксперимента
- выручка
- частота
- средний чек
- этап жизненного цикла
- принадлежность к сегментам.
Процесс работы
- Формализуется бизнес-вопрос.
- Определяются метрики и окно измерения.
- Проектируется тестовая и контрольная группы.
- Согласовываются события и идентификаторы.
- Формируется техническое задание на SQL-выгрузку.
- Аналитики извлекают необходимые данные.
- Проверяются полнота и корректность.
- Удаляются технические дубли.
- Восстанавливается принадлежность клиентов к группам.
- Рассчитываются показатели.
- Оценивается неопределенность.
- Анализируются сегменты и защитные метрики.
- Формируются выводы и рекомендации.
- На основании результата модифицируется CRM-сценарий.
23. Проверка данных перед расчетом
Перед анализом необходимо проверить:
- уникален ли клиент внутри эксперимента
- не попал ли он в несколько вариантов
- совпадает ли фактическое распределение с заданным
- не потеряны ли события контрольной группы
- корректны ли даты
- правильно ли применен часовой пояс
- не дублируются ли заказы
- исключены ли отмененные и тестовые транзакции
- одинаково ли определена покупка для обеих групп
- не изменялся ли сценарий во время эксперимента
- не нарушено ли окно измерения.
Нельзя исправлять группы по-разному.
Например, удалить крупных покупателей только из тестовой группы — значит разрушить эксперимент.
Работа с выбросами должна опираться на заранее определенное или симметрично применяемое правило:
- ограничение показателя
- winsorization
- робастная метрика
- отдельный анализ
- исключение технических аномалий.
Качество данных является фундаментальным условием надежного A/B-анализа: корректная рандомизация не спасает от потерянных событий или неправильного расчета метрик. Microsoft Research: Data Quality for Trustworthy A/B Testing
24. Когда случайный контроль невозможен
Не всегда компания может выделить контрольную группу.
Причины могут быть разными:
- коммуникация обязательна
- аудитория слишком мала
- изменение уже запущено
- решение применяется ко всем регионам
- невозможно исключить часть клиентов
- исторически эксперимент не был предусмотрен.
В таком случае используются наблюдательные методы.
Они могут улучшить оценку, но требуют дополнительных предположений. По надежности они обычно уступают корректно проведенному случайному эксперименту.
Сравнение до и после
Сравнивается показатель:
- до запуска
- после запуска.
Например:
- до кампании конверсия была 5%
- после стала 8%
- наблюдаемый рост — 3 п.п.
Но одновременно могли измениться:
- сезон
- цены
- ассортимент
- реклама
- экономика
- конкуренты
- состав клиентской базы.
Поэтому простой pre/post-анализ показывает изменение во времени, но не изолирует причину.
Сопоставленная контрольная группа
Для участников кампании подбираются похожие клиенты, которые ее не получили:
- по прошлой частоте
- сумме покупок
- давности
- категориям
- стране
- активности.
Это уменьшает различия по известным характеристикам, но не контролирует факторы, которых нет в данных.
Difference-in-Differences
Метод сравнивает не уровни, а изменения в двух группах.
Пример:
| Группа | До | После | Изменение |
|---|---|---|---|
| Тестовая | 5% | 8% | +3 п.п. |
| Контрольная | 4% | 5% | +1 п.п. |
Оценка эффекта:
Или эквивалентно:
Главное предположение: без кампании группы изменялись бы параллельно. Его нельзя гарантировать одним наличием данных до запуска. Нужно исследовать предыдущую динамику и объяснить, почему контроль отражает подходящий контрфактический тренд.
Прерванный временной ряд
Анализируется динамика показателя до и после вмешательства:
- изменился ли уровень
- изменился ли тренд
- отличается ли наблюдаемое значение от прогноза.
Метод требует достаточно длинной и стабильной истории и чувствителен к другим событиям, произошедшим одновременно.
Синтетический контроль и Causal Impact
Контрфактический прогноз строится из временных рядов, которые связаны с целевым показателем, но не подверглись воздействию.
Байесовские структурные модели временных рядов могут учитывать тренд, сезонность и контрольные переменные. Но результат зависит от важного предположения: связь между контрольными рядами и целевым показателем сохранялась бы после вмешательства, а сами контрольные ряды не были затронуты кампанией. Brodersen et al.: Inferring causal impact using Bayesian structural time-series models
Наблюдательные методы не превращают историю в настоящий эксперимент. Они оценивают эффект при выполнении конкретных предположений, которые должны быть явно названы и проверены настолько, насколько это возможно.
25. Uplift-моделирование
Обычная прогнозная модель отвечает на вопрос:
Кто с высокой вероятностью совершит покупку?
Но клиенты с высокой вероятностью могут купить и без коммуникации.
Uplift-модель пытается ответить на другой вопрос:
У кого вероятность покупки сильнее всего изменится именно из-за воздействия?
Можно условно выделить четыре типа клиентов:
Убеждаемые
Покупают после воздействия, но с меньшей вероятностью купили бы без него. Это основная целевая группа.
Естественные покупатели
Купят независимо от коммуникации. Воздействие может быть для них лишним.
Не реагирующие
Не купят ни при воздействии, ни без него.
Клиенты с отрицательной реакцией
Без коммуникации могли бы купить, но воздействие снижает вероятность: например, раздражает, создает недоверие или предлагает ненужную скидку.
Стандартная propensity-модель часто находит естественных покупателей. Uplift-модель стремится найти тех, чье поведение изменяется под воздействием.
Но для ее обучения нужны данные с надежным разделением на воздействие и контроль. Если обучить модель только на получателях, она не сможет отделить склонность к покупке от эффекта коммуникации.
Uplift-моделирование отличается от обычного прогнозирования именно тем, что оценивает изменение реакции, вызванное воздействием, а не просто вероятность целевого события. Zhao et al.: Uplift Modeling for Multiple Treatments
26. Эффект по сегментам
Средний uplift может скрывать существенные различия.
Например:
| Сегмент | Тест | Контроль | Uplift |
|---|---|---|---|
| Новые клиенты | 9% | 5% | +4 п.п. |
| Регулярные | 12% | 11% | +1 п.п. |
| Риск оттока | 3% | 4% | −1 п.п. |
В среднем кампания может быть положительной, но для сегмента риска оттока — отрицательной.
Полезно исследовать эффект по:
- странам
- языкам
- этапам жизненного цикла
- категориям первой покупки
- активности
- частоте
- ценовым сегментам
- доступным каналам.
Но чем больше разрезов проверяется, тем выше вероятность случайно найти красивый результат.
Поэтому ключевые сегменты лучше определять заранее. Неожиданные различия после теста можно использовать для новых гипотез, которые затем подтверждаются отдельным экспериментом.
27. Долгосрочный эффект
Краткосрочная кампания может иметь отложенные последствия.
Положительные:
- формирование привычки
- переход к регулярным покупкам
- знакомство с новой категорией
- увеличение удержания
- рост LTV.
Отрицательные:
- усталость от коммуникаций
- рост отписок
- ожидание скидок
- снижение маржи
- каннибализация будущего спроса
- перенос покупки без изменения общего объема.
Поэтому зрелая система измерения включает разные горизонты:
- непосредственная реакция
- основное окно конверсии
- повторная покупка
- удержание
- накопленная выручка и маржа
- LTV.
Долгосрочная оценка особенно важна для CRM-сценариев, цель которых заключается не в одной транзакции, а в изменении покупательской траектории.
28. Как интерпретировать результат
После анализа возможны не только «успех» и «провал».
Надежный положительный эффект
Сценарий можно масштабировать, продолжая мониторинг.
Положительная оценка с высокой неопределенностью
Нужен более крупный или длительный тест.
Практически нулевой эффект
Сценарий не создает достаточной дополнительной ценности. Его можно отключить или переработать.
Отрицательный эффект
Следует проверить:
- качество реализации
- аудиторию
- предложение
- частоту
- канал
- временной интервал
- конфликт с другими сценариями.
Конверсия растет, экономика ухудшается
Необходимо изменить скидочную или ассортиментную механику.
Эффект есть только в отдельных сегментах
Сценарий можно сузить и повторно проверить на релевантной аудитории.
Эффект краткосрочный и исчезает позже
Вероятно, кампания ускоряет покупку, а не создает дополнительную.
Результат эксперимента — это не оценка работы команды. Отрицательный или нулевой эффект тоже создает ценность: компания перестает тратить ресурсы на механику, которая не работает, и получает данные для следующей гипотезы.
29. Цикл развития CRM-автоматизации
Правильно организованная работа выглядит так:
- Определяется бизнес-проблема.
- Формулируется гипотеза.
- Проектируется CRM-сценарий.
- Определяются показатели и контрольная группа.
- Настраиваются события и идентификаторы.
- Сценарий проходит техническое тестирование.
- Запускается эксперимент.
- Проверяется качество данных.
- Рассчитывается причинный эффект.
- Анализируются сегменты и экономика.
- Принимается решение.
- Логика сценария модифицируется.
- Запускается новый тест.
Таким образом, CRM развивается не на основании субъективного ощущения, что сообщение «должно сработать», а на основании последовательного накопления подтвержденных знаний.
Типичные ошибки при оценке CRM-кампаний
Считать всю выручку получателей результатом кампании
Часть клиентов купила бы без воздействия.
Сравнивать открывших и не открывших
Эти группы самостоятельно сформировались после отправки и изначально различаются по активности.
Создавать контроль из недоставленных сообщений
Недоставленные клиенты часто систематически отличаются от достижимых.
Делить группы до проверки общей аудитории
Контроль и тест получают разные правила соответствия.
Менять пропорции во время эксперимента
Ранее назначенные клиенты сохраняют историю участия, и оценка может исказиться.
Останавливать тест при первом положительном результате
Случайное колебание принимается за стабильный эффект.
Проверять десятки метрик и показывать только успешную
Чем больше сравнений, тем выше вероятность случайной находки.
Игнорировать отмены и возвраты
Технически созданный заказ считается полноценным бизнес-результатом.
Анализировать только краткосрочное окно
Ускорение покупки ошибочно принимается за дополнительную покупку.
Не учитывать скидки и маржу
Рост выручки может сопровождаться снижением прибыли.
Применять сложный causal-метод без проверки предположений
Название метода не делает оценку причинной автоматически.
С какими задачами можно обратиться к нам
К нам можно обратиться, если необходимо:
- разработать методологию оценки CRM-сценариев
- спроектировать тестовую и контрольную группы
- определить KPI и целевые действия
- настроить A/B-разделение в Bloomreach Engagement
- разработать события и параметры для аналитики
- сформировать техническое задание на SQL-выгрузку
- проверить качество экспериментальных данных
- рассчитать uplift и increment
- оценить инкрементальную выручку и маржу
- отличить атрибуцию от причинного эффекта
- проанализировать кампанию без готового контроля
- применить Difference-in-Differences или временные модели
- исследовать эффект по сегментам
- оценить долгосрочное влияние
- выявить каннибализацию
- построить систему регулярной CRM-аналитики
- модифицировать сценарии по результатам измерения.
Мы можем подключиться как к полному циклу оценки, так и к отдельному этапу: проектированию эксперимента, подготовке требований, обработке выгрузок, расчету показателей или интерпретации результатов.
Что получает бизнес
Результатом становится не отчет с open rate и выручкой получателей, а система доказательного управления CRM:
- формализованные гипотезы
- корректные контрольные группы
- согласованные KPI
- технические требования к данным
- воспроизводимые расчеты
- оценка статистической неопределенности
- расчет дополнительного результата
- понимание экономики сценария
- выводы по отдельным сегментам
- рекомендации по развитию автоматизации.
Такая система помогает компании отвечать на действительно важные вопросы:
- создает ли сценарий новые покупки или только сопровождает естественные
- какие клиенты меняют поведение благодаря коммуникации
- какие предложения работают
- где скидка действительно необходима
- какой канал создает дополнительный результат
- какие автоматизации следует масштабировать
- какие следует изменить или отключить
- как CRM влияет на удержание и долгосрочную ценность клиента.
Главная задача CRM-аналитики — не приписать кампании как можно больше выручки.
Ее задача — как можно точнее определить, какую дополнительную ценность создала автоматизация, насколько надежна эта оценка и какое решение на ее основании должен принять бизнес.