A/B-тест офера: скільки заявок треба, щоб повірити цифрі

9 хвилин читання
Два варианта лендинга на экране ноутбука с графиком конверсии и цифрами CR для A/B теста

5% проти 3% на ста візитах — це різниця в дві заявки. Скільки заявок треба для висновку, коли зупиняти тест і чому переможець за заявками часто програє в грошах.

Варіант Б дав 5% конверсії, варіант А — 3%. На папері це +67%, можна вимикати старий лендинг. Тепер подивіться, що стоїть за відсотками: по 100 візитів на варіант, 5 заявок проти 3. Одна людина передумала б заповнювати форму — і замість 5:3 стало б 4:3, тобто перевага впала б удвічі. Рішення про офер щойно ухвалив один випадковий клік.

Рахуйте заявки, а не візити

Візити — це знаменник. Рішення живе в чисельнику. Поки заявок мало, будь-яка різниця у відсотках — це коливання від двох-трьох людей.

Груба формула, яка дає правильний порядок цифр:

n ≈ 16 · p · (1 − p) / (p₁ − p₂)²

де p — середня конверсія двох варіантів, n — скільки візитів треба на кожен варіант. Це оцінка для стандартних налаштувань: 95% значущості й 80% потужності. Точний калькулятор дасть трохи інші числа, але порядок величини — той самий.

Таблиця нижче — та сама формула для типової товарної бази:

| Базова конверсія | Гіпотеза | Візитів на варіант | Заявок разом |
|---|---|---|---|
| 3% | 3% → 6% (у два рази) | ~760 | ~68 |
| 3% | 3% → 4,5% (+50%) | ~2 600 | ~195 |
| 5% | 5% → 10% (у два рази) | ~450 | ~68 |
| 5% | 5% → 7,5% (+50%) | ~1 500 | ~190 |
| 5% | 5% → 6% (+20%) | ~8 300 | ~910 |

Що звідси забрати:

  • різниця в рази коштує близько сімдесяти заявок сумарно — за темпу близько 700-800 візитів на добу це два дні;
  • різниця на 50% — це вже 1,5-3 тис. візитів на варіант, тобто в кілька разів довше;
  • різниця на 20% — близько 8 тис. візитів на варіант, а для більшості зв'язок це означає «ніколи».

Робоче правило: поки на варіант не набралося приблизно тридцяти заявок (це половина від сімдесяти з таблиці), у цифри можна не дивитися взагалі — на менших числах не видно навіть різниці в рази.

Заявка — ще не продаж

На накладеному платежі тест закінчується не там, де ви його бачите. Заявка — це намір; гроші приносить підтверджений і викуплений заказ. І саме ті зміни, що найлегше піднімають конверсію, найчастіше б'ють по апруву: квіз замість форми, чотири поля замість семи, «2 за ціною 1». Залишити номер стало легше — отже, серед тих, хто залишив, більше випадкових.

Звідси три наслідки:

  • Фіксуйте апрув окремо по кожному варіанту й порівнюйте не конверсію, а конверсію × апрув.
  • Закладайте лаг прозвону. Поки колцентр не догнав тест, у вас є тільки половина результату: різниця в заявках може бути справжньою, а в підтверджених замовленнях — зникнути.
  • Для тестів ціни й комплекту метрика ще на крок далі — гроші на візит: конверсія × апрув × маржа з замовлення. Припустимо, за однакового апруву варіант А дає 4% при маржі 900 ₴ з замовлення — це 36 ₴ з візиту; варіант Б дає 6% при маржі 500 ₴ — це 30 ₴. За заявками виграв Б, за грошима — А.

Дешевша ціна майже завжди виграє за заявками. Питання лише в тому, чи виграє вона за грошима.

Не зупиняйте тест тоді, коли результат подобається

На малих числах конверсія стрибає постійно. Якщо дивитися на неї часто й дозволяти собі зупинку в будь-який момент, рано чи пізно один варіант вирветься вперед — і саме в цю хвилину рука тягнеться натиснути «стоп»: є переможець. Те саме станеться, якщо запустити тест двох абсолютно однакових сторінок: зупиняє вас не різниця, а вигідне коливання.

Оголошені 5% хибних спрацювань стосуються одного погляду в кінці тесту, а не серії поглядів дорогою. Кожна проміжна перевірка з правом зупинки додає шансів помилитися, і реальна частка хибних «перемог» стає помітно вищою за декларовану.

Лікується одним рядком, написаним до старту:

Тест іде до 70 заявок сумарно або до вечора вівторка — що настане пізніше. До цього моменту рішень не ухвалюю.

Кількість заявок беріть із таблиці вище — під свою базову конверсію.

Одна зміна за раз

Переписали заголовок, поставили іншу ціну, замінили головне фото й додали таймер. Конверсія виросла на третину. Що саме спрацювало — невідомо, і на наступний товар ви перенесете, найімовірніше, не той елемент.

Гірший сценарій — коли фактори тягнуть у різні боки. Новий заголовок дав +50%, нова ціна забрала −20%: 1,5 × 0,8 = 1,2, ви бачите приємні +20% і так і не дізнаєтеся, що ціну чіпати не варто було.

Виняток один: концепція проти концепції — старий лендинг проти повністю нового підходу. Це нормальний тест, але й висновок з нього такий самий загальний: який підхід сильніший, а не який елемент працює.

Черга тестів

Порядок диктує бюджет, а не важливість елемента. З формули видно: ваш трафік ловить різницю в рази і майже ніколи — різницю в одиницях відсотків. Тож у чергу стають зміни, після яких різниця в рази взагалі можлива.

| Що змінюємо | Чому саме тут |
|---|---|
| Офер і перший екран: що продаємо, кому, за скільки, що людина отримає | сторінка починає продавати іншому попиту — тут різниця в рази реальна |
| Ціна й комплектація: 1 шт, 2+1, набір, доставка за наш рахунок | змінює і конверсію, і маржу; міряти грошима на візит, а не заявками |
| Шлях до заявки: квіз замість форми, менше полів | конверсію піднімає легко, апрув — опускає; без обліку апруву цей тест краще не запускати |
| Соцдокази: відгуки, до/після, таймер, залишок | ефект тут зазвичай менший за ваш власний шум — ставте як гігієну, а не як тест |
| Колір кнопки, шрифт, мікротексти | вимір коштує бюджету, за який перевіряють кілька оферів |

Новий товар — перший тест про офер, другий про ціну й комплект. Решта має сенс, коли зв'язка вже жива.

Як ділити трафік

Головне: спліт має бути на стороні сторінки. Один URL, який сам випадково показує варіант А або Б. Тоді година доби, джерело, креатив і день тижня падають на обидва варіанти однаково. Ніч не «дістається варіанту А», дешеві пуші не «збираються у варіанті Б» — рандомізація розводить їх порівну.

Що при цьому все одно псує тест:

  • Два різні посилання у двох кампаніях. Ось тут страшилки справджуються: кампанії відкручуються по-різному й ловлять різні аудиторії, тож порівнюєте ви налаштування кампаній, а не сторінки. Немає спліту на стороні сторінки — немає тесту.
  • Перерозподіл трафіку посеред тесту. Спокуса «дати переможцю більше» ламає розрахунок: 50/50 і не чіпати до кінця.
  • Дуже різні джерела в одному тесті. Зміщення вони не дають, але збільшують розкид усередині кожного варіанту, тож заявок треба більше. Дивіться підсумок і окремо розріз по джерелах.

Креативи міняти можна: при спліті 50/50 новий креатив приходить на обидва варіанти однаково, а тримати вигоряючу зв'язку заради чистоти експерименту дорожче за перезапуск тесту. Важливо інше — не міняти їх у ту саму хвилину, коли ви дивитеся на проміжний результат, і не заливати зовсім іншу аудиторію в останні години: усередниться вона вже не встигне.

Повні доби й будні разом із вихідними потрібні заради переносимості, а не заради чесності порівняння. Переможець, знайдений на самій лише нічній аудиторії, не зобов'язаний вигравати вдень: заміряли ви його коректно, але на вужчому зрізі, ніж той, на який лийте потім.

Три можливі кінцівки

Заявок набралося стільки, скільки оголосили, різниця значуща. Переможець є. Перевірте його ще й по апруву, перш ніж переносити на всі зв'язки.

Заявок набралося скільки треба, різниці немає. Різниці в рази точно немає. Вона може ховатися в десятках відсотків, але такий тест коштує тисячі візитів на варіант — рішення те саме: беріть наступний офер із черги.

Заявок менше, ніж оголосили. Тест просто не відбувся. Це не «слабка гіпотеза» і взагалі не результат, це відсутність даних. І навіть у чесно добраному тесті зі стандартними налаштуваннями потужність — 80%: приблизно раз із п'яти справжній переможець залишається непоміченим. Відсутність доказу не є доказом відсутності.

В аналітиці LandEmpire варіанти порівнюються двостороннім z-тестом різниці часток, а трафік розкладається по джерелах аж до sub1; поки заявок мало, сервіс прямо каже, що висновок робити рано, замість того щоб показати відсоток переваги. Читати такий звіт варто в тому самому порядку: спочатку — чи набралася оголошена кількість заявок, і тільки потім — на чиєму боці різниця.

Два дні — це мінімум, а не норма

Вечір нульового дня. Одна гіпотеза, сформульована реченням: «Офер “2 за ціною 1 + доставка за наш рахунок” дасть більше заявок, ніж “−50% на другий”». Другий варіант відрізняється тільки офером і першим екраном. Правило зупинки написане, заявки долітають з обох варіантів.

Дні 1-2. Ллєте рівно й цілодобово. Статистику відкриваєте раз на день — переконатися, що обидва варіанти живі й форма працює. Не для рішень.

Вечір другого дня. Дивитеся, чи набралася оголошена кількість заявок, і читаєте висновок. Потім чекаєте прозвону: переможця оголошуєте після апруву.

Двох днів вистачає рівно на одне: перевірити гіпотезу, від якої ви очікуєте різницю в рази, — і то за умови рівного відкручування цілодобово й тих самих 700-800 візитів на добу. Гіпотеза на 50% — це в кілька разів більше візитів і, за того самого темпу, в кілька разів довший тест. Слабша — зазвичай не про ваш бюджет.

Що зробити сьогодні

  1. Відкрийте поточний тест і порахуйте заявки на кожен варіант, а не візити. Менше тридцяти — висновків немає, тест ще не почався.
  2. Порахуйте за формулою, скільки заявок треба саме вам, і запишіть правило зупинки одним реченням — до старту, а не після.
  3. Перевірте, що спліт зроблено на стороні сторінки: один URL, а не два посилання у двох кампаніях.
  4. Додайте до звіту колонку «апрув» по кожному варіанту, а для тестів ціни — гроші на візит.
  5. Складіть чергу з трьох гіпотез по оферу. Перша йде в роботу сьогодні.

Зберіть такий лендінг самі — за вечір

У LandEmpire є готові шаблони під товарку, заявки падають у Telegram, домен підключається за пару хвилин, а статистика за UTM показує, звідки прийшла кожна заявка. Стартовий тариф безкоштовний — картка на старті не потрібна.

Створити лендінг безкоштовно

Читайте також

7 хвилин читання

Заявка натиснута, а її немає: де губляться ліди між кнопкою і CRM

Між натиснутою кнопкою і дзвінком менеджера — пʼять ланок, і кожна ламається по-своєму. Як перевірити кожну самому і за якими цифрами видно, де саме тече бюджет.

  • заявки
  • ліди
  • форма заявки
5 хвилин читання

A/B-тест лендингу: коли зупинитись і довіряти цифрам

Зупинив тест на 50 лідах — злив бюджет. Чекав 3 тижні — втратив час. Розбираємо, коли спліт-тест справді завершений і як не помилитись з рішенням.

  • a/b тест
  • спліт-тест
  • тестування конверсії

Решта статей — у блозі.

Корисне в конструкторі

Розділи LandEmpire, які стосуються цієї теми напряму — щоб не шукати їх потім по сайту.