Перейти к содержимому

Калибровка с помощью эксперимента

MathMeUp

0:00 / 0:00

Калибровка с помощью эксперимента

6 просмотров · 7 дней назад
MathMeUp
1,69 тыс. подписчиков
6 просмотров · 7 дней назад
В прошлом видео я сказал, что модель говорит о четырех, а географический тест — о двух. Это были предположения, сделанные до арифметических вычислений. Вот реальные цифры. Модель из видео 11: ТВ стоит 3,47 плюс-минус 0,44. Истина, которую я знаю, а модель — нет, — 3,0. Модель завышена на 0,47 — примерно на одну из своих собственных плюс-минус. Не ошибается. Но и не верна. ЭКСПЕРИМЕНТ. Шестнадцать рынков. Четыре недели без изменений — предварительный период. Затем четыре недели, когда на восьми рынках ТВ показывали шесть единиц в неделю, а на восьми — ни одной. Для каждого рынка — изменение по сравнению с предварительным периодом; усреднить изменения в каждом сегменте; взять разницу. Это разница разностей, и именно так интерпретируется реальный географический тест. Подъем: 2,53 на единицу ТВ, плюс-минус 0,48. Минус на 0,47. СОГЛАСНЫ ЛИ ОНИ? Разница составляет 0,94. Общий разброс — 0,65. Это 1,5 сигма — ниже общепринятой линии 2. Ничто здесь не говорит о том, что два источника измеряют разные вещи, и формула смешивания вот-вот будет исходить из предположения, что это не так. СМЕСЬ, НА САМОМ ДЕЛЕ. Формула из видео 6 с реальными числами с обеих сторон — впервые. Тест используется в качестве априорного распределения (2,53, точность 4,38); модель — это вероятность (3,47, точность 5,20). С учетом точности: 3,04 плюс-минус 0,32. Тест получил 46% голосов. Модель изменилась на 0,43. Разница в плюс-минус сократилась на 26%. До: отклонение на 0,47. После: отклонение на 0,04. КАК ЖЕ ЭТО БЫЛО УДАЧНО? Перезапустите географический тест двадцать тысяч раз. Медианная калиброванная ошибка составляет 0,21; в этом запуске 0,04 находится на 9-м процентиле. Этот тест показал низкое значение по сравнению с моделью, показавшей высокое значение, и они отменили результат — и дважды ему повезло, потому что его плюс-минус был на 97-м процентиле результатов, и он все равно показал хороший результат. Что обычно дает калибровка: более точный результат, чем при использовании одной только модели, в 91% запусков, и снижение неопределенности в среднем на 38%. В девяти случаях из десяти это помогает, примерно на треть. Подробнее о том, как мы это делаем: https://www.partnersinsights.org СООБЩИТЕ ОБОИХ РЕЗУЛЬТАТАХ. Без эксперимента — 3,47 плюс-минус 0,44. С ним — 3,04 плюс-минус 0,32. Разница точно равна доле теста, умноженной на расхождение — поэтому небольшая разница имеет значение только в том случае, если тест был достаточно сильным, чтобы повлиять на модель. Этот тест изменил результат на целый плюс-минус. Эксперимент изменил модель. Он не подтвердил её. Это разные предложения. ТЕСТ, КОТОРЫЙ НЕ СОГЛАШАЕТСЯ — сценарий, который я, собственно, и озвучивал. Предположим, тест показал 2,00 плюс-минус 0,40. Это 2,5 сигма от модели: разрыв такого размера возникает один раз из семидесяти пяти, если они действительно читают одно и то же число. В любом случае, смешаем, и получим 2,67 плюс-минус 0,30 — аккуратно, уверенно и опирается на предположение, которое теперь под вопросом. Что делать вместо этого: сначала нужно найти причину, по которой они различаются. Перенос четырехнедельного окна, которое невозможно увидеть. Другой сезон. Потратить шесть против модели, подобранной по шкале от одного до десяти. Или модели, которая неверна. Если вы найдете такую ​​причину, исправьте источник. Если вы ничего не нашли, смешайте с погрешностью плюс-минус, допускающей возможные расхождения: 2,72 плюс или минус 0,74. Почти тот же центр, в два с половиной раза шире. Если ни один из источников не является предвзятым, наивное смешивание не ошиблось в том, где именно. Оно ошиблось в том, насколько оно достоверно. СКОЛЬКО СТОИТ ТЕСТ. Два рынка с каждой стороны, 17% голосов. Восемь, 46%. Тридцать два, 77%. Погрешность теста уменьшается вдвое каждый раз, когда она увеличивается вчетверо, и вероятность модели против него падает в четыре раза. Достаточно большой тест делает модель почти ничего. Смешивание выполняет взвешивание; оно не поддерживает актуальность модели. Видео 1 построило линию вручную и сообщило одно число для ТВ. Видео 13 сообщает 3,04 плюс-минус 0,32, с распределением, диагностикой того, нашла ли прогулка это число, и экспериментом внутри априорного распределения. На этом завершается вопрос, заданный в видео 1. Но это не завершает серию. Часть 13 серии о моделировании маркетингового микса. Вручную, без кода. #MarketingMixModeling #Bayesian #GeoTest #Calibration #Incrementality #DataScience #MMM