A/B-тест лендинга: сколько трафика нужно и как не поверить случайности

5 минут чтения
A/B-тест лендингу: скільки трафіку треба і як не повірити випадковості

30 заявок против 34 — это не победа, а шум. Объясняем статистическую значимость без формул, даём ориентиры по объёму выборки и порядок, в котором стоит тестировать блоки товарного лендинга.

Классическая сцена: байер запускает две версии лендинга, через день видит 30 заявок против 34 и выключает первую. «Вторая лучше на 13 %». На самом деле он только что принял решение на основе шума — и, вполне возможно, выключил лучший вариант. Разберём, сколько трафика нужно на самом деле и как не поверить случайности.

Статистическая значимость простыми словами

Представьте, что вы подбросили монету десять раз и получили шесть орлов. Значит ли это, что монета кривая? Нет. Шесть из десяти — обычное колебание. А вот 600 орлов из 1000 — это уже почти точно не случайность.

С лендингами то же самое. Разница в конверсии между двумя версиями складывается из двух частей: настоящего эффекта ваших изменений и случайного шума. Статистическая значимость — это ответ на единственный вопрос: насколько вероятно, что мы увидели бы такую разницу, даже если бы версии были абсолютно одинаковыми?

Принятая граница — 95 %. Если тест показывает значимость 95 %, это значит: шанс, что разница выдумана случайностью, меньше 5 %. Ниже 90 % — решение принимать рано, сколько бы вам ни хотелось.

Ключевое, что стоит усвоить: чем меньше выборка, тем больше шум. На 50 визитах шум перекрывает любой реальный эффект. На 2000 — уже почти нет.

Почему 30 против 34 не значит ничего

Возьмём цифры из начала. Версия A: 500 визитов, 30 заявок, конверсия 6,0 %. Версия B: 500 визитов, 34 заявки, конверсия 6,8 %.

Выглядит как победа B на 13 % относительно. Но при таких объёмах естественный разброс каждой из версий — плюс-минус несколько заявок просто из-за того, какие именно люди зашли на страницу сегодня. Если бы вы разделили один и тот же лендинг пополам и показывали половине трафика одну его копию, а половине — другую, вы бы регулярно видели такие же «победы» на 10–15 %. Это известный фокус: A/A-тест, в котором обе версии идентичны, тоже часто показывает «победителя».

Поэтому правило железное: пока калькулятор значимости не показал 95 %, у вас нет победителя. У вас есть два числа.

Сколько трафика нужно

Точный ответ зависит от базовой конверсии и размера разницы, которую вы хотите поймать. Общая логика такая: чем меньше разница, тем больше нужна выборка, и зависимость здесь не линейная, а квадратичная.

Ориентиры для товарки с конверсией в заявку около 5–10 %:

  • разница 20–30 % (например, с 6 % до 7,5 %) — примерно 300–1000 визитов на каждую версию;
  • разница 50 % и больше (с 6 % до 9 %) — хватит и 200–400 визитов на версию, такой эффект виден быстро;
  • разница 5–10 % — нужны тысячи визитов на версию, и обычно это не тот тест, который стоит ставить.

Отсюда практический вывод: не тестируйте мелочи. Цвет кнопки и формулировка подписи дают эффект в несколько процентов, который вы не сможете измерить за разумное время. Тестируйте то, что меняет картинку сильно.

Ещё два правила по времени:

  • Крутите тест минимум неделю целыми днями. Трафик во вторник и в воскресенье ведёт себя по-разному, а тест, остановленный в среду вечером, ловит хвост одного дня.
  • Не подглядывайте каждый час с правом остановить. Чем чаще вы смотрите на промежуточный результат и готовы нажать «стоп», тем выше вероятность остановиться именно на случайном пике.

Одна гипотеза за раз

Самая распространённая ошибка после преждевременной остановки — изменить во второй версии сразу всё: другой заголовок, другое фото, другая цена, другая форма. Версия B выиграла — и что именно сработало? Неизвестно. Перенести находку на следующий оффер невозможно.

Правильно: одно изменение = один тест. Так вы накапливаете не случайные победы, а собственную библиотеку знаний о своей нише.

Исключение одно: если конверсия совсем плохая и страницу надо переделывать целиком, тестируйте «старая версия против полностью новой». Но тогда и вывод будет соответствующий — «новая лучше», без объяснений почему.

Что тестировать в товарке первым

Порядок по силе влияния, от самого сильного к самому слабому.

1. Оффер, цена, комплект. Самый мощный рычаг. «1 штука за 690 ₴» против «2 штуки за 990 ₴», цена 690 против 790, наличие или отсутствие подарка. Здесь разница бывает в разы, и именно поэтому этот тест даёт результат быстрее всего. Блок выбора комплекта собирается в редакторе без кода.

2. Первый экран. Заголовок, главное фото, наличие видео, место цены. Это то, что видят все 100 % посетителей, поэтому любое изменение здесь работает на весь трафик.

3. Форма. Количество полей, текст на кнопке, фраза про оплату при получении над кнопкой. Разница между формой из двух полей и формой из пяти бывает существенной. Детали — в разборе формы заказа с Новой Почтой.

4. Социальные доказательства и структура. Порядок блоков, отзывы, гарантии, таймер.

5. Мелочи оформления. Цвет, шрифт, иконки. Тестировать можно, когда у вас тысячи визитов в день, и не раньше.

И отдельно: в товарке с наложенным платежом победитель по заявкам не всегда победитель по деньгам. Версия с агрессивным таймером может дать больше заявок и худший выкуп. Поэтому финальный вывод делайте по подтверждённым и выкупленным заказам — статус возвращается из CRM в кабинет, и в аналитике видно не только количество заявок. Почему это критично, хорошо видно в unit-экономике товарки.

Как это работает в LandEmpire

A/B-тест встроен: вы создаёте вторую версию страницы, трафик делится автоматически, а система сама считает статистическую значимость — не надо сводить цифры в таблицы и искать калькулятор.

Количество одновременных версий зависит от тарифа: Start — 2 версии, Pro — до 4, Business — до 6. Условия планов — на странице тарифов.

Совет по количеству: больше версий — не всегда лучше. Четыре варианта при том же трафике означают вчетверо меньше визитов на каждый и, соответственно, вчетверо более длинный тест. Две версии на старте — разумный выбор; четыре и шесть имеют смысл, когда трафика много.

Чек-лист корректного теста

  • Одна гипотеза, одно изменение.
  • Версии показываются одновременно, а не по очереди.
  • Минимум неделя и целые дни.
  • Минимум несколько сотен визитов на версию.
  • Значимость 95 % — и только тогда решение.
  • Финальный вывод — по выкупленным заказам, а не по заявкам.
  • Результат записан: что меняли, какие цифры, какой вывод.

Что дальше

A/B-тест не делает лендинг лучше сам по себе — он лишь не даёт вам обмануть себя. Создайте две версии страницы, дайте им равный трафик и дождитесь, пока система покажет значимость.

Создать лендинг бесплатно

Как это сделано в LandEmpire

Соберите такой лендинг сами — за вечер

В LandEmpire есть готовые шаблоны под товарку, заявки падают в Telegram, домен подключается за пару минут, а статистика по UTM показывает, откуда пришла каждая заявка. Стартовый тариф бесплатный — карта на старте не нужна.

Создать лендинг бесплатно

Читайте также

6 минут чтения

sub1–sub5: что это, как размечать трафик и читать аналитику до креатива

Схема разметки, которую не стыдно показать команде: sub1 — креатив, sub2 — адсет, sub3 — плейсмент, sub4 — гео. Плюс шаблон ссылки и как видеть, какой креатив даёт заявки, которые выкупают.

  • sub1
  • аналитика
  • арбітраж
7 минут чтения

Постбэк с лендинга в CPA-сеть: sub1–sub5, {clickid} и как не потерять конверсии

Постбэк возвращает заявку с лендинга обратно в трекер вместе с меткой креатива. Разбираем S2S, макросы {clickid} и sub1–sub5, настройку в LandEmpire и семь ошибок, из-за которых теряются конверсии.

  • постбек
  • sub1
  • арбітраж
6 минут чтения

Как выбрать оффер для товарки: 7 критериев и чек-лист перед запуском

Маржа ×3–4, вес и габарит, сезон, конкуренция на Prom, простота объяснения, юридические ограничения и поставщик. Плюс тест на 100 заявок и чек-лист, который спасает бюджет ещё до запуска.

  • оффер
  • товарка
  • арбітраж

Остальные статьи — в блоге.

Полезное в конструкторе

Разделы LandEmpire, которые касаются этой темы напрямую, — чтобы не искать их потом по сайту.