A/B-тест лендингу: скільки трафіку треба і як не повірити випадковості

5 хвилин читання
A/B-тест лендингу: скільки трафіку треба і як не повірити випадковості

30 заявок проти 34 — це не перемога, а шум. Пояснюємо статистичну значущість без формул, даємо орієнтири по обсягу вибірки і порядок, у якому варто тестувати блоки товарного лендинга.

Класична сцена: баєр запускає дві версії лендинга, через день бачить 30 заявок проти 34 і вимикає першу. «Друга краща на 13 %». Насправді він щойно прийняв рішення на основі шуму — і, цілком можливо, вимкнув кращий варіант. Розберемо, скільки трафіку потрібно насправді і як не повірити випадковості.

Статистична значущість простими словами

Уявіть, що ви кинули монету десять разів і отримали шість орлів. Чи означає це, що монета крива? Ні. Шість із десяти — звичайне коливання. А от 600 орлів із 1000 — це вже майже точно не випадковість.

З лендингами так само. Різниця в конверсії між двома версіями складається з двох частин: справжнього ефекту ваших змін і випадкового шуму. Статистична значущість — це відповідь на єдине питання: наскільки ймовірно, що ми побачили б таку різницю, навіть якби версії були абсолютно однаковими?

Прийнята межа — 95 %. Якщо тест показує значущість 95 %, це означає: шанс, що різниця вигадана випадковістю, менший за 5 %. Нижче 90 % — рішення приймати рано, скільки б вам не хотілося.

Ключове, що варто засвоїти: чим менша вибірка, тим більший шум. На 50 візитах шум перекриває будь-який реальний ефект. На 2000 — уже майже ні.

Чому 30 проти 34 не означає нічого

Візьмемо цифри з початку. Версія A: 500 візитів, 30 заявок, конверсія 6,0 %. Версія B: 500 візитів, 34 заявки, конверсія 6,8 %.

Виглядає як перемога B на 13 % відносно. Але при таких обсягах природний розкид кожної з версій — плюс-мінус кілька заявок просто через те, які саме люди зайшли на сторінку сьогодні. Якби ви розділили один і той самий лендинг навпіл і показували половині трафіку одну його копію, а половині — іншу, ви б регулярно бачили такі самі «перемоги» на 10–15 %. Це відомий фокус: A/A-тест, у якому обидві версії ідентичні, теж часто показує «переможця».

Тому правило залізне: доки калькулятор значущості не показав 95 %, у вас немає переможця. У вас є два числа.

Скільки трафіку потрібно

Точна відповідь залежить від базової конверсії та розміру різниці, яку ви хочете спіймати. Загальна логіка така: чим менша різниця, тим більша потрібна вибірка, і залежність тут не лінійна, а квадратична.

Орієнтири для товарки з конверсією в заявку близько 5–10 %:

  • різниця 20–30 % (наприклад, з 6 % до 7,5 %) — приблизно 300–1000 візитів на кожну версію;
  • різниця 50 % і більше (з 6 % до 9 %) — вистачить і 200–400 візитів на версію, такий ефект видно швидко;
  • різниця 5–10 % — потрібні тисячі візитів на версію, і зазвичай це не той тест, який варто ставити.

Звідси практичний висновок: не тестуйте дрібниці. Колір кнопки і формулювання підпису дають ефект у кілька відсотків, який ви не зможете виміряти за розумний час. Тестуйте те, що змінює картинку сильно.

Ще два правила по часу:

  • Крутіть тест мінімум тиждень цілими днями. Трафік у вівторок і в неділю поводиться по-різному, а тест, зупинений у середу ввечері, ловить хвіст одного дня.
  • Не підглядайте щогодини з правом зупинити. Чим частіше ви дивитеся на проміжний результат і готові натиснути «стоп», тим вища ймовірність зупинитися саме на випадковому піку.

Одна гіпотеза за раз

Найпоширеніша помилка після передчасної зупинки — змінити в другій версії відразу все: інший заголовок, інше фото, інша ціна, інша форма. Версія B виграла — і що саме спрацювало? Невідомо. Перенести знахідку на наступний офер неможливо.

Правильно: одна зміна = один тест. Так ви накопичуєте не випадкові перемоги, а власну бібліотеку знань про свою нішу.

Виняток один: якщо конверсія зовсім погана і сторінку треба переробляти цілком, тестуйте «стара версія проти повністю нової». Але тоді й висновок буде відповідний — «нова краща», без пояснень чому.

Що тестувати в товарці першим

Порядок за силою впливу, від найсильнішого до найслабшого.

1. Оффер, ціна, комплект. Найпотужніший важіль. «1 штука за 690 ₴» проти «2 штуки за 990 ₴», ціна 690 проти 790, наявність або відсутність подарунка. Тут різниця буває в рази, і саме тому цей тест дає результат найшвидше. Блок вибору комплекту збирається в редакторі без коду.

2. Перший екран. Заголовок, головне фото, наявність відео, місце ціни. Це те, що бачать усі 100 % відвідувачів, тож будь-яка зміна тут працює на весь трафік.

3. Форма. Кількість полів, текст на кнопці, фраза про оплату при отриманні над кнопкою. Різниця між формою з двох полів і формою з п'яти буває суттєвою. Деталі — у розборі форми замовлення з Новою Поштою.

4. Соціальні докази і структура. Порядок блоків, відгуки, гарантії, таймер.

5. Дрібниці оформлення. Колір, шрифт, іконки. Тестувати можна, коли у вас тисячі візитів на день, і не раніше.

І окремо: у товарці з післяплатою переможець за заявками не завжди переможець за грошима. Версія з агресивним таймером може дати більше заявок і гірший викуп. Тому фінальний висновок робіть за підтвердженими й викупленими замовленнями — статус повертається з CRM у кабінет, і в аналітиці видно не тільки кількість заявок. Чому це критично, добре видно в unit-економіці товарки.

Як це працює в LandEmpire

A/B-тест вбудований: ви створюєте другу версію сторінки, трафік ділиться автоматично, а система сама рахує статистичну значущість — не треба зводити цифри в таблиці й шукати калькулятор.

Кількість одночасних версій залежить від тарифу: Start — 2 версії, Pro — до 4, Business — до 6. Умови планів — на сторінці тарифів.

Порада щодо кількості: більше версій — не завжди краще. Чотири варіанти при тому самому трафіку означають вчетверо менше візитів на кожен і, відповідно, вчетверо довший тест. Дві версії на старті — розумний вибір; чотири й шість мають сенс, коли трафіку багато.

Чек-лист коректного тесту

  • Одна гіпотеза, одна зміна.
  • Версії показуються одночасно, а не по черзі.
  • Мінімум тиждень і цілі дні.
  • Мінімум кілька сотень візитів на версію.
  • Значущість 95 % — і тільки тоді рішення.
  • Фінальний висновок — за викупленими замовленнями, а не за заявками.
  • Результат записаний: що міняли, які цифри, який висновок.

Що далі

A/B-тест не робить лендинг кращим сам по собі — він лише не дає вам обманути себе. Створіть дві версії сторінки, дайте їм рівний трафік і дочекайтеся, поки система покаже значущість.

Створити лендинг безкоштовно

Як це зроблено в LandEmpire

Зберіть такий лендінг самі — за вечір

У LandEmpire є готові шаблони під товарку, заявки падають у Telegram, домен підключається за пару хвилин, а статистика за UTM показує, звідки прийшла кожна заявка. Стартовий тариф безкоштовний — картка на старті не потрібна.

Створити лендінг безкоштовно

Читайте також

6 хвилин читання

sub1–sub5: що це, як розмічати трафік і читати аналітику до креативу

Схема розмітки, яку не соромно показати команді: sub1 — креатив, sub2 — адсет, sub3 — плейсмент, sub4 — гео. Плюс шаблон посилання і як бачити, який креатив дає заявки, що викуповують.

  • sub1
  • аналітика
  • арбітраж
7 хвилин читання

Постбек із лендингу в CPA-мережу: sub1–sub5, {clickid} і як не втратити конверсії

Постбек повертає заявку з лендинга назад у трекер разом із міткою креативу. Розбираємо S2S, макроси {clickid} і sub1–sub5, налаштування в LandEmpire і сім помилок, через які губляться конверсії.

  • постбек
  • sub1
  • арбітраж
6 хвилин читання

Як вибрати офер для товарки: 7 критеріїв і чек-лист перед запуском

Маржа ×3–4, вага і габарит, сезон, конкуренція на Prom, простота пояснення, юридичні обмеження та постачальник. Плюс тест на 100 заявок і чек-лист, який рятує бюджет ще до запуску.

  • офер
  • товарка
  • арбітраж

Решта статей — у блозі.

Корисне в конструкторі

Розділи LandEmpire, які стосуються цієї теми напряму — щоб не шукати їх потім по сайту.