A/B-тест офера: сколько заявок нужно, чтобы верить цифре

5% против 3% на ста визитах — это разница в две заявки. Сколько заявок нужно для вывода, когда останавливать тест и почему победитель по заявкам часто проигрывает в деньгах.
Вариант Б дал 5% конверсии, вариант А — 3%. На бумаге это +67%, можно выключать старый лендинг. Теперь посмотрите, что стоит за процентами: по 100 визитов на вариант, 5 заявок против 3. Один человек передумал бы заполнять форму — и вместо 5:3 стало бы 4:3, то есть преимущество упало бы вдвое. Решение об офере только что принял один случайный клик.
Считайте заявки, а не визиты
Визиты — это знаменатель. Решение живёт в числителе. Пока заявок мало, любая разница в процентах — это колебание от двух-трёх человек.
Грубая формула, которая даёт правильный порядок цифр:
n ≈ 16 · p · (1 − p) / (p₁ − p₂)²
где p — средняя конверсия двух вариантов, n — сколько визитов нужно на каждый вариант. Это оценка для стандартных настроек: 95% значимости и 80% мощности. Точный калькулятор даст немного другие числа, но порядок величины — тот же.
Таблица ниже — та же формула для типичной товарной базы:
| Базовая конверсия | Гипотеза | Визитов на вариант | Заявок всего |
|---|---|---|---|
| 3% | 3% → 6% (в два раза) | ~760 | ~68 |
| 3% | 3% → 4,5% (+50%) | ~2 600 | ~195 |
| 5% | 5% → 10% (в два раза) | ~450 | ~68 |
| 5% | 5% → 7,5% (+50%) | ~1 500 | ~190 |
| 5% | 5% → 6% (+20%) | ~8 300 | ~910 |
Что отсюда взять:
- разница в разы стоит около семидесяти заявок суммарно — при темпе около 700-800 визитов в сутки это два дня;
- разница на 50% — это уже 1,5-3 тыс. визитов на вариант, то есть в несколько раз дольше;
- разница на 20% — около 8 тыс. визитов на вариант, а для большинства связок это означает «никогда».
Рабочее правило: пока на вариант не набралось примерно тридцати заявок (это половина от семидесяти из таблицы), в цифры можно вообще не смотреть — на меньших числах не видно даже разницы в разы.
Заявка — ещё не продажа
На наложенном платеже тест заканчивается не там, где вы его видите. Заявка — это намерение; деньги приносит подтверждённый и выкупленный заказ. И именно те изменения, которые легче всего поднимают конверсию, чаще всего бьют по апруву: квиз вместо формы, четыре поля вместо семи, «2 по цене 1». Оставить номер стало проще — значит, среди тех, кто оставил, больше случайных.
Отсюда три следствия:
- Фиксируйте апрув отдельно по каждому варианту и сравнивайте не конверсию, а конверсию × апрув.
- Закладывайте лаг прозвона. Пока колцентр не догнал тест, у вас есть только половина результата: разница в заявках может быть настоящей, а в подтверждённых заказах — исчезнуть.
- Для тестов цены и комплекта метрика ещё на шаг дальше — деньги на визит: конверсия × апрув × маржа с заказа. Допустим, при одинаковом апруве вариант А даёт 4% при марже 900 ₴ с заказа — это 36 ₴ с визита; вариант Б даёт 6% при марже 500 ₴ — это 30 ₴. По заявкам выиграл Б, по деньгам — А.
Более низкая цена почти всегда выигрывает по заявкам. Вопрос только в том, выигрывает ли она по деньгам.
Не останавливайте тест тогда, когда результат нравится
На малых числах конверсия прыгает постоянно. Если смотреть на неё часто и позволять себе остановку в любой момент, рано или поздно один вариант вырвется вперёд — и именно в эту минуту рука тянется нажать «стоп»: есть победитель. То же самое произойдёт, если запустить тест двух абсолютно одинаковых страниц: останавливает вас не разница, а выгодное колебание.
Объявленные 5% ложных срабатываний касаются одного взгляда в конце теста, а не серии взглядов по дороге. Каждая промежуточная проверка с правом остановки добавляет шансов ошибиться, и реальная доля ложных «побед» становится заметно выше декларируемой.
Лечится одной строкой, написанной до старта:
Тест идёт до 70 заявок суммарно или до вечера вторника — что наступит позже. До этого момента решений не принимаю.
Количество заявок берите из таблицы выше — под свою базовую конверсию.
Одно изменение за раз
Переписали заголовок, поставили другую цену, заменили главное фото и добавили таймер. Конверсия выросла на треть. Что именно сработало — неизвестно, и на следующий товар вы перенесёте, скорее всего, не тот элемент.
Худший сценарий — когда факторы тянут в разные стороны. Новый заголовок дал +50%, новая цена забрала −20%: 1,5 × 0,8 = 1,2, вы видите приятные +20% и так и не узнаете, что цену трогать не стоило.
Исключение одно: концепция против концепции — старый лендинг против полностью нового подхода. Это нормальный тест, но и вывод из него такой же общий: какой подход сильнее, а не какой элемент работает.
Очередь тестов
Порядок диктует бюджет, а не важность элемента. Из формулы видно: ваш трафик ловит разницу в разы и почти никогда — разницу в единицах процентов. Поэтому в очередь встают изменения, после которых разница в разы вообще возможна.
| Что меняем | Почему именно здесь |
|---|---|
| Офер и первый экран: что продаём, кому, за сколько, что человек получит | страница начинает продавать другому спросу — здесь разница в разы реальна |
| Цена и комплектация: 1 шт, 2+1, набор, доставка за наш счёт | меняет и конверсию, и маржу; мерить деньгами на визит, а не заявками |
| Путь к заявке: квиз вместо формы, меньше полей | конверсию поднимает легко, апрув — опускает; без учёта апруву этот тест лучше не запускать |
| Соцдоказательства: отзывы, до/после, таймер, остаток | эффект здесь обычно меньше вашего собственного шума — ставьте как гигиену, а не как тест |
| Цвет кнопки, шрифт, микротексты | измерение стоит бюджета, за который проверяют несколько оферов |
Новый товар — первый тест про офер, второй про цену и комплект. Остальное имеет смысл, когда связка уже живёт.
Как делить трафик
Главное: сплит должен быть на стороне страницы. Один URL, который сам случайно показывает вариант А или Б. Тогда час суток, источник, креатив и день недели падают на оба варианта одинаково. Ночь не «достаётся варианту А», дешёвые пуши не «собираются в варианте Б» — рандомизация разводит их поровну.
Что при этом всё равно портит тест:
- Две разные ссылки в двух кампаниях. Вот здесь страшилки сбываются: кампании откручиваются по-разному и ловят разные аудитории, так что сравниваете вы настройки кампаний, а не страницы. Нет сплита на стороне страницы — нет теста.
- Перераспределение трафика посреди теста. Соблазн «дать победителю больше» ломает расчёт: 50/50 и не трогать до конца.
- Очень разные источники в одном тесте. Смещения они не дают, но увеличивают разброс внутри каждого варианта, так что заявок нужно больше. Смотрите итог и отдельно срез по источникам.
Креативы менять можно: при сплите 50/50 новый креатив приходит на оба варианта одинаково, а держать выгорающую связку ради чистоты эксперимента дороже, чем перезапустить тест. Важно другое — не менять их в ту же минуту, когда вы смотрите на промежуточный результат, и не заливать совсем другую аудиторию в последние часы: усредниться она уже не успеет.
Полные сутки и будни вместе с выходными нужны ради переносимости, а не ради честности сравнения. Победитель, найденный только на ночной аудитории, не обязан выигрывать днём: замерили вы его корректно, но на более узком срезе, чем тот, на который льёте потом.
Три возможных финала
Заявок набралось столько, сколько объявили, разница значима. Победитель есть. Проверьте его ещё и по апруву, прежде чем переносить на все связки.
Заявок набралось сколько нужно, разницы нет. Разницы в разы точно нет. Она может прятаться в десятках процентов, но такой тест стоит тысячи визитов на вариант — решение то же: берите следующий офер из очереди.
Заявок меньше, чем объявили. Тест просто не состоялся. Это не «слабая гипотеза» и вообще не результат, это отсутствие данных. И даже в честно собранном тесте со стандартными настройками мощность — 80%: примерно раз из пяти настоящий победитель остаётся незамеченным. Отсутствие доказательства не является доказательством отсутствия.
В аналитике LandEmpire варианты сравниваются двусторонним z-тестом разницы долей, а трафик раскладывается по источникам вплоть до sub1; пока заявок мало, сервис прямо говорит, что делать вывод рано, вместо того чтобы показать процент преимущества. Читать такой отчёт стоит в том же порядке: сначала — набралось ли объявленное количество заявок, и только потом — на чьей стороне разница.
Два дня — это минимум, а не норма
Вечер нулевого дня. Одна гипотеза, сформулированная предложением: «Офер "2 по цене 1 + доставка за наш счёт" даст больше заявок, чем "−50% на второй"». Второй вариант отличается только офером и первым экраном. Правило остановки написано, заявки прилетают с обоих вариантов.
Дни 1-2. Льёте ровно и круглосуточно. Статистику открываете раз в день — убедиться, что оба варианта живы и форма работает. Не для решений.
Вечер второго дня. Смотрите, набралось ли объявленное количество заявок, и читаете вывод. Потом ждёте прозвона: победителя объявляете после апрува.
Двух дней хватает ровно на одно: проверить гипотезу, от которой вы ожидаете разницу в разы, — и то при условии равного откручивания круглосуточно и тех же 700-800 визитов в сутки. Гипотеза на 50% — это в несколько раз больше визитов и, при том же темпе, в несколько раз более долгий тест. Слабее — обычно не про ваш бюджет.
Что сделать сегодня
- Откройте текущий тест и посчитайте заявки на каждый вариант, а не визиты. Меньше тридцати — выводов нет, тест ещё не начался.
- Посчитайте по формуле, сколько заявок нужно именно вам, и запишите правило остановки одним предложением — до старта, а не после.
- Проверьте, что сплит сделан на стороне страницы: один URL, а не две ссылки в двух кампаниях.
- Добавьте в отчёт колонку «апрув» по каждому варианту, а для тестов цены — деньги на визит.
- Составьте очередь из трёх гипотез по оферу. Первая идёт в работу сегодня.
Соберите такой лендинг сами — за вечер
В LandEmpire есть готовые шаблоны под товарку, заявки падают в Telegram, домен подключается за пару минут, а статистика по UTM показывает, откуда пришла каждая заявка. Стартовый тариф бесплатный — карта на старте не нужна.
Создать лендинг бесплатно