A/B-тест офера: скільки заявок треба, щоб повірити цифрі

5% проти 3% на ста візитах — це різниця в дві заявки. Скільки заявок треба для висновку, коли зупиняти тест і чому переможець за заявками часто програє в грошах.
Варіант Б дав 5% конверсії, варіант А — 3%. На папері це +67%, можна вимикати старий лендинг. Тепер подивіться, що стоїть за відсотками: по 100 візитів на варіант, 5 заявок проти 3. Одна людина передумала б заповнювати форму — і замість 5:3 стало б 4:3, тобто перевага впала б удвічі. Рішення про офер щойно ухвалив один випадковий клік.
Рахуйте заявки, а не візити
Візити — це знаменник. Рішення живе в чисельнику. Поки заявок мало, будь-яка різниця у відсотках — це коливання від двох-трьох людей.
Груба формула, яка дає правильний порядок цифр:
n ≈ 16 · p · (1 − p) / (p₁ − p₂)²
де p — середня конверсія двох варіантів, n — скільки візитів треба на кожен варіант. Це оцінка для стандартних налаштувань: 95% значущості й 80% потужності. Точний калькулятор дасть трохи інші числа, але порядок величини — той самий.
Таблиця нижче — та сама формула для типової товарної бази:
| Базова конверсія | Гіпотеза | Візитів на варіант | Заявок разом |
|---|---|---|---|
| 3% | 3% → 6% (у два рази) | ~760 | ~68 |
| 3% | 3% → 4,5% (+50%) | ~2 600 | ~195 |
| 5% | 5% → 10% (у два рази) | ~450 | ~68 |
| 5% | 5% → 7,5% (+50%) | ~1 500 | ~190 |
| 5% | 5% → 6% (+20%) | ~8 300 | ~910 |
Що звідси забрати:
- різниця в рази коштує близько сімдесяти заявок сумарно — за темпу близько 700-800 візитів на добу це два дні;
- різниця на 50% — це вже 1,5-3 тис. візитів на варіант, тобто в кілька разів довше;
- різниця на 20% — близько 8 тис. візитів на варіант, а для більшості зв'язок це означає «ніколи».
Робоче правило: поки на варіант не набралося приблизно тридцяти заявок (це половина від сімдесяти з таблиці), у цифри можна не дивитися взагалі — на менших числах не видно навіть різниці в рази.
Заявка — ще не продаж
На накладеному платежі тест закінчується не там, де ви його бачите. Заявка — це намір; гроші приносить підтверджений і викуплений заказ. І саме ті зміни, що найлегше піднімають конверсію, найчастіше б'ють по апруву: квіз замість форми, чотири поля замість семи, «2 за ціною 1». Залишити номер стало легше — отже, серед тих, хто залишив, більше випадкових.
Звідси три наслідки:
- Фіксуйте апрув окремо по кожному варіанту й порівнюйте не конверсію, а конверсію × апрув.
- Закладайте лаг прозвону. Поки колцентр не догнав тест, у вас є тільки половина результату: різниця в заявках може бути справжньою, а в підтверджених замовленнях — зникнути.
- Для тестів ціни й комплекту метрика ще на крок далі — гроші на візит: конверсія × апрув × маржа з замовлення. Припустимо, за однакового апруву варіант А дає 4% при маржі 900 ₴ з замовлення — це 36 ₴ з візиту; варіант Б дає 6% при маржі 500 ₴ — це 30 ₴. За заявками виграв Б, за грошима — А.
Дешевша ціна майже завжди виграє за заявками. Питання лише в тому, чи виграє вона за грошима.
Не зупиняйте тест тоді, коли результат подобається
На малих числах конверсія стрибає постійно. Якщо дивитися на неї часто й дозволяти собі зупинку в будь-який момент, рано чи пізно один варіант вирветься вперед — і саме в цю хвилину рука тягнеться натиснути «стоп»: є переможець. Те саме станеться, якщо запустити тест двох абсолютно однакових сторінок: зупиняє вас не різниця, а вигідне коливання.
Оголошені 5% хибних спрацювань стосуються одного погляду в кінці тесту, а не серії поглядів дорогою. Кожна проміжна перевірка з правом зупинки додає шансів помилитися, і реальна частка хибних «перемог» стає помітно вищою за декларовану.
Лікується одним рядком, написаним до старту:
Тест іде до 70 заявок сумарно або до вечора вівторка — що настане пізніше. До цього моменту рішень не ухвалюю.
Кількість заявок беріть із таблиці вище — під свою базову конверсію.
Одна зміна за раз
Переписали заголовок, поставили іншу ціну, замінили головне фото й додали таймер. Конверсія виросла на третину. Що саме спрацювало — невідомо, і на наступний товар ви перенесете, найімовірніше, не той елемент.
Гірший сценарій — коли фактори тягнуть у різні боки. Новий заголовок дав +50%, нова ціна забрала −20%: 1,5 × 0,8 = 1,2, ви бачите приємні +20% і так і не дізнаєтеся, що ціну чіпати не варто було.
Виняток один: концепція проти концепції — старий лендинг проти повністю нового підходу. Це нормальний тест, але й висновок з нього такий самий загальний: який підхід сильніший, а не який елемент працює.
Черга тестів
Порядок диктує бюджет, а не важливість елемента. З формули видно: ваш трафік ловить різницю в рази і майже ніколи — різницю в одиницях відсотків. Тож у чергу стають зміни, після яких різниця в рази взагалі можлива.
| Що змінюємо | Чому саме тут |
|---|---|
| Офер і перший екран: що продаємо, кому, за скільки, що людина отримає | сторінка починає продавати іншому попиту — тут різниця в рази реальна |
| Ціна й комплектація: 1 шт, 2+1, набір, доставка за наш рахунок | змінює і конверсію, і маржу; міряти грошима на візит, а не заявками |
| Шлях до заявки: квіз замість форми, менше полів | конверсію піднімає легко, апрув — опускає; без обліку апруву цей тест краще не запускати |
| Соцдокази: відгуки, до/після, таймер, залишок | ефект тут зазвичай менший за ваш власний шум — ставте як гігієну, а не як тест |
| Колір кнопки, шрифт, мікротексти | вимір коштує бюджету, за який перевіряють кілька оферів |
Новий товар — перший тест про офер, другий про ціну й комплект. Решта має сенс, коли зв'язка вже жива.
Як ділити трафік
Головне: спліт має бути на стороні сторінки. Один URL, який сам випадково показує варіант А або Б. Тоді година доби, джерело, креатив і день тижня падають на обидва варіанти однаково. Ніч не «дістається варіанту А», дешеві пуші не «збираються у варіанті Б» — рандомізація розводить їх порівну.
Що при цьому все одно псує тест:
- Два різні посилання у двох кампаніях. Ось тут страшилки справджуються: кампанії відкручуються по-різному й ловлять різні аудиторії, тож порівнюєте ви налаштування кампаній, а не сторінки. Немає спліту на стороні сторінки — немає тесту.
- Перерозподіл трафіку посеред тесту. Спокуса «дати переможцю більше» ламає розрахунок: 50/50 і не чіпати до кінця.
- Дуже різні джерела в одному тесті. Зміщення вони не дають, але збільшують розкид усередині кожного варіанту, тож заявок треба більше. Дивіться підсумок і окремо розріз по джерелах.
Креативи міняти можна: при спліті 50/50 новий креатив приходить на обидва варіанти однаково, а тримати вигоряючу зв'язку заради чистоти експерименту дорожче за перезапуск тесту. Важливо інше — не міняти їх у ту саму хвилину, коли ви дивитеся на проміжний результат, і не заливати зовсім іншу аудиторію в останні години: усередниться вона вже не встигне.
Повні доби й будні разом із вихідними потрібні заради переносимості, а не заради чесності порівняння. Переможець, знайдений на самій лише нічній аудиторії, не зобов'язаний вигравати вдень: заміряли ви його коректно, але на вужчому зрізі, ніж той, на який лийте потім.
Три можливі кінцівки
Заявок набралося стільки, скільки оголосили, різниця значуща. Переможець є. Перевірте його ще й по апруву, перш ніж переносити на всі зв'язки.
Заявок набралося скільки треба, різниці немає. Різниці в рази точно немає. Вона може ховатися в десятках відсотків, але такий тест коштує тисячі візитів на варіант — рішення те саме: беріть наступний офер із черги.
Заявок менше, ніж оголосили. Тест просто не відбувся. Це не «слабка гіпотеза» і взагалі не результат, це відсутність даних. І навіть у чесно добраному тесті зі стандартними налаштуваннями потужність — 80%: приблизно раз із п'яти справжній переможець залишається непоміченим. Відсутність доказу не є доказом відсутності.
В аналітиці LandEmpire варіанти порівнюються двостороннім z-тестом різниці часток, а трафік розкладається по джерелах аж до sub1; поки заявок мало, сервіс прямо каже, що висновок робити рано, замість того щоб показати відсоток переваги. Читати такий звіт варто в тому самому порядку: спочатку — чи набралася оголошена кількість заявок, і тільки потім — на чиєму боці різниця.
Два дні — це мінімум, а не норма
Вечір нульового дня. Одна гіпотеза, сформульована реченням: «Офер “2 за ціною 1 + доставка за наш рахунок” дасть більше заявок, ніж “−50% на другий”». Другий варіант відрізняється тільки офером і першим екраном. Правило зупинки написане, заявки долітають з обох варіантів.
Дні 1-2. Ллєте рівно й цілодобово. Статистику відкриваєте раз на день — переконатися, що обидва варіанти живі й форма працює. Не для рішень.
Вечір другого дня. Дивитеся, чи набралася оголошена кількість заявок, і читаєте висновок. Потім чекаєте прозвону: переможця оголошуєте після апруву.
Двох днів вистачає рівно на одне: перевірити гіпотезу, від якої ви очікуєте різницю в рази, — і то за умови рівного відкручування цілодобово й тих самих 700-800 візитів на добу. Гіпотеза на 50% — це в кілька разів більше візитів і, за того самого темпу, в кілька разів довший тест. Слабша — зазвичай не про ваш бюджет.
Що зробити сьогодні
- Відкрийте поточний тест і порахуйте заявки на кожен варіант, а не візити. Менше тридцяти — висновків немає, тест ще не почався.
- Порахуйте за формулою, скільки заявок треба саме вам, і запишіть правило зупинки одним реченням — до старту, а не після.
- Перевірте, що спліт зроблено на стороні сторінки: один URL, а не два посилання у двох кампаніях.
- Додайте до звіту колонку «апрув» по кожному варіанту, а для тестів ціни — гроші на візит.
- Складіть чергу з трьох гіпотез по оферу. Перша йде в роботу сьогодні.
Зберіть такий лендінг самі — за вечір
У LandEmpire є готові шаблони під товарку, заявки падають у Telegram, домен підключається за пару хвилин, а статистика за UTM показує, звідки прийшла кожна заявка. Стартовий тариф безкоштовний — картка на старті не потрібна.
Створити лендінг безкоштовно