Реальные данные
MathMeUp
0:00 / 0:00
Реальные данные
5 просмотров · 7 дней назад
MathMeUp
1,71 тыс. подписчиков
5 просмотров · 7 дней назад
Шестнадцать видеороликов за десять недель, которые я выдумал, где я знал правду, потому что сам её написал.
К этому видео нет ключа с ответами. Сорок реальных месяцев: ежемесячные расходы американской страховой компании на телевизионную рекламу и полученные ею котировки, с января 2002 по апрель 2005 года,
опубликовано Хайндманом и Атанасопулосом в книге «Прогнозирование: принципы и практика» (данные предоставлены Дейвом Рейли, «Автоматические системы прогнозирования»). Один канал. Так обычно выглядят реальные данные — и я нигде не смог найти реального, общедоступного, многоканального еженедельного набора данных; данные Робин, Меридиана и PyMC-Marketing — все они смоделированы.
РЕАЛЬНЫЕ ДАННЫЕ. Четыре месяца являются точными копиями четырёх других, до каждой записанной цифры. Модель не может объяснить, почему. Клиент может. Первое, что делают реальные данные, — это заставляют вас написать электронное письмо.
СТРОКА ВИДЕО 1. Цитаты = -0,24 + 1,69 ТВ. Корреляция 0,93. На вымышленных данных
это хорошее соответствие. На реальных данных это первое, чему следует не доверять:
рекламодатель, который тратит деньги, когда ожидается спрос, создает именно такую картину.
Остатки приходят волнами. Автокорреляция с задержкой 1 0,65, восемь знаковых серий, где
независимый шум дает около 21. Во всех видеороликах до сих пор предполагались независимые
ошибки. Регрессия изменений на изменения, а не уровней на уровни: наклон 1,35,
а не 1,69.
Модель AR(1), написанная от руки. Одна строка, которую серия никогда не писала: среднее значение этого
месяца — это линия плюс ро, умноженное на промах прошлого месяца. Ро 0,85. Влияние телевидения
снижается с 1,70 до 1,36 — на пятую часть — и разница в плюс-минус
сужается, потому что новый шум каждый месяц составляет 0,58, а не 0,93. Что повлияло на это
медленный дрейф котировок и доли телевидения за эти годы: независимая модель
приписывает все это телевидению; модель AR(1) позволяет ошибке влиять на это. Является ли этот
дрейф результатом влияния телевидения или рынка, сорок месяцев сказать нельзя. Модель «исключения одного»
предпочитает модель AR(1) на 17 плюс-минус 4 — что говорит о том, что волны реальны,
а не о том, какой наклон правильный.
КТО КОГО ВЕДУТ. Телевидение, затем котировки 0,49; котировки, затем телевидение 0,58. Проверьте это в рамках
модели, где телевидение считается экзогенным фактором: разрыв такого размера в этом направлении — это событие, происходящее раз в
один раз из восьми. Она склоняется к тому, что котировки опережают телевидение. Она не указывает.
Предположение об экзогенности видео 5 на реальных данных: единственное, на чём опирается модель,
что нельзя проверить изнутри данных.
ПЕРЕНОС И ИЗГИБ. Adstock: лямбда 0,06 - шесть процентов переносов на ежемесячном
разрешении, и априорное распределение не позволит ему быть равным нулю. Хилл: прямая линия находится
внутри 90%-ной полосы в каждой точке; P(единица по 6 стоит больше, чем единица по 10)
= 0,92 - подсказка, а не вывод. Метод «исключения одного»: ничто не сравнится с линией.
ЧЕГО НЕТ В ТАБЛИЦЕ. Сезонность за 3,3 года: недостаточно для соответствия. Цена,
конкуренты, остальная часть маркетинга: отсутствуют. В основном отсутствуют реальные данные.
ОТЧЕТ. ТВ 1,36 котировок на единицу, 94%-ный интервал [1,22, 1,50], ошибки AR(1).
Перенос невелик. Кривизна не видна. Направление не определено. Пять вопросов клиенту. Отчет в основном содержит то, что данные не смогли сказать.
Это не ошибка анализа. Это сам анализ.
Подробнее о том, как мы это делаем: https://www.partnersinsights.org
Часть 17 серии о моделировании маркетингового микса. Записано в прямом эфире в блокноте.
#MarketingMixModeling #MMM #RealData #Bayesian #PyMC #Autocorrelation #DataScience