Логотип seo-prodvizhenie-biznesa.ru
+7 (921) 333-77-45

A/B-тестирование: что это такое и как проводится

A/B-тестирование: что это такое и как проводится
Анатолий Кузнецов
Анатолий Кузнецов
SEO-оптимизатор с 20-летним стажем. Автор блога seo-prodvizhenie-biznesa.ru о продвижении и доработке сайтов.

A/B-тестирование заменяет спор о вкусах измерением: вместо того чтобы доказывать, какой заголовок сильнее, вы показываете половине посетителей один вариант, половине другой и смотрите, где чаще оставляют заявку. Метод простой на словах и коварный на практике — большая часть тестов, которые я вижу в проектах, отвечает не на тот вопрос, который задавали, или заканчивается раньше, чем данных набралось достаточно для вывода.

В SEO и работе с конверсией я с 2005 года, и главная польза сплит-тестов не в том, что они находят выигрышные кнопки. Она в том, что они регулярно опровергают уверенные мнения — включая моё. Ниже — как устроен тест изнутри, сколько нужно данных, чтобы результату можно было верить, что тестировать в первую очередь и какие ошибки делают результат непригодным, даже когда цифры выглядят убедительно.

Что именно сравнивает сплит-тест

Механика теста укладывается в четыре шага. Берётся страница в текущем виде — это контрольный вариант. Создаётся её копия с одним изменением — это тестовый вариант. Входящий трафик делится случайным образом на два потока, каждый видит свою версию. Через заданный срок сравнивают долю посетителей, совершивших целевое действие, в одной и в другой группе.

Ключевое слово здесь — «одним изменением». Если вы поменяли сразу заголовок, картинку и текст кнопки, а конверсия выросла, вы знаете только то, что новый вариант в целом лучше. Вы не знаете, что сработало, не можете перенести находку на другие страницы и не можете исключить, что один из трёх элементов на самом деле мешал, а два других вытянули результат вопреки ему.

Второе ключевое свойство — параллельность. Обе версии работают одновременно, в один и тот же период. Именно это отличает тест от простого сравнения «до и после». Когда вы меняете страницу и сравниваете прошлый месяц с текущим, в сравнение вмешиваются сезон, день недели, рекламная активность, действия конкурентов и погода в прямом смысле слова — для многих ниш это реальный фактор. Параллельный показ убирает всё перечисленное, потому что обе группы живут в одинаковых условиях.

Третье свойство — случайность распределения. Посетитель попадает в группу по жребию, а не по признаку. Если разделить трафик по источникам — поиску показываем один вариант, рекламе другой, — вы сравните не варианты страницы, а два разных типа аудитории, и результат окажется бессмысленным.

Тест начинается с гипотезы, а не с элемента

Самая распространённая ошибка новичка — начинать с вопроса «какую кнопку поставить». Начинать надо с утверждения, которое можно опровергнуть. Рабочая форма гипотезы состоит из трёх частей: что меняем, какого эффекта ждём, почему этого ждём.

Пример правильной формулировки: «Если вынести телефон и форму заявки в первый экран, доля обращений вырастет, потому что по записи сеансов видно, что треть посетителей не долистывает до контактов». Здесь есть действие, измеримое ожидание и основание. Пример неправильной: «Давайте попробуем синюю кнопку вместо зелёной» — тут нет ни ожидания, ни основания, и результат в любую сторону ничему вас не научит.

Основания для гипотез берутся не из головы. Источники, которые дают их в избытке:

  • Записи сеансов и карты кликов. Видно, где люди останавливаются, что пытаются нажать и на каком блоке закрывают вкладку.
  • Отчёты по формам. Какое поле люди начинают заполнять и бросают — обычно это лишнее поле, которое можно убрать.
  • Вопросы, которые задают менеджеру. Если один и тот же вопрос повторяется — ответа на него нет на странице.
  • Поисковые подсказки и Вордстат. Показывают, какие уточнения важны людям: цена, сроки, гарантия, доставка в регион.
  • Сравнение с конкурентами по выдаче. Не для копирования, а для поиска блоков, которых у вас нет вовсе.
  • Отчёты по устройствам. Разрыв конверсии между мобильными и настольными почти всегда указывает на конкретную проблему вёрстки.
  • Что такое мультиссылка, и как она создается

Сколько данных нужно, чтобы верить результату

Это тот раздел, из-за которого большинство тестов бесполезны. Разница в цифрах между вариантами появляется всегда — даже если сравнить страницу саму с собой, доли не совпадут, потому что посетители разные. Вопрос в том, отличается ли результат сильнее, чем обычный случайный разброс.

Если нужны детали, смотрите «Что такое рейтинг домена или DR (Domain Rating)».

Зависимость такая: чем ниже базовая конверсия и чем меньше ожидаемый прирост, тем больше нужно наблюдений. Ниже — ориентировочный объём на каждый вариант, при котором можно рассчитывать на надёжный вывод.

Базовая конверсия Ищем прирост в 20% Ищем прирост в 50%
1% около 40 000 посетителей на вариант около 6 500
2% около 20 000 около 3 200
3% около 13 000 около 2 100
5% около 7 600 около 1 200
10% около 3 600 около 600

Помогу с продвижением: заказать продвижение сайта — вывожу сайты в топ Яндекса белыми методами.

Из таблицы следует неприятный, но полезный вывод. Сайту с двумя тысячами визитов в месяц и конверсией в два процента искать прирост в двадцать процентов бессмысленно: нужный объём наберётся за полтора года, за которые изменится всё остальное. Такому сайту доступны только тесты грубых изменений — когда меняется не оттенок кнопки, а сам подход к странице, и ожидаемый эффект измеряется десятками процентов.

Второе ограничение — время. Даже при достаточном трафике тест не стоит останавливать раньше двух полных недель. Причина в недельном цикле: в будни и выходные приходят разные люди с разным намерением, и тест, закончившийся в четверг после старта в понедельник, измеряет не варианты страницы, а состав аудитории конкретных дней. Правило простое: тест длится целое число недель, минимум две, и завершается в тот же день недели, в который начался.

О методах, которые работают вдолгую и не вредят сайту:

Значимость простыми словами

Инструменты тестирования показывают показатель достоверности — чаще всего в виде процента уверенности. Смысл у него такой: насколько маловероятно получить наблюдаемую разницу случайно, если на самом деле варианты одинаковы. Порог в 95% принят как рабочий компромисс — он означает, что примерно в одном случае из двадцати вы примете случайное колебание за реальный эффект.

Отсюда следует правило, которое чаще всего нарушают: нельзя подглядывать в результат каждый день и останавливать тест в момент, когда цифра «достигла» порога. Показатель достоверности колеблется по ходу набора данных, и при ежедневных проверках он рано или поздно случайно перескочит порог почти в любом тесте. Срок окончания назначается заранее, до старта, и результат смотрится в назначенный день.

Второе правило касается объёма выигрыша. Разница в полпроцента, даже статистически подтверждённая, обычно не стоит внедрения: пока вы её проверяли, изменился сезон, ассортимент и реклама. Практический ориентир — тесты имеет смысл ставить на изменения, от которых вы ждёте прироста хотя бы в пятнадцать-двадцать процентов относительно текущей конверсии.

Подробнее об этом — в статье «Google Trends — что это такое».

Что тестировать в первую очередь

Порядок задаёт не интерес, а произведение двух величин: сколько людей увидит изменение и насколько сильно оно способно повлиять на решение. Отсюда очерёдность.

Что меняем Потенциал влияния Сложность подготовки Когда браться
Оффер и заголовок первого экрана Высокий Низкая В первую очередь
Наличие и способ подачи цены Высокий Средняя В первую очередь
Состав полей формы Высокий Низкая В первую очередь
Структура страницы, порядок блоков Высокий Высокая После первых трёх
Доказательства: отзывы, работы, документы Средний Средняя Во вторую очередь
Текст на кнопке Низкий Низкая Когда крупное исчерпано
Цвета и оттенки элементов Низкий Низкая Практически никогда

Нижние строки таблицы объясняют, почему у многих остаётся ощущение, что сплит-тесты не работают. Тестируют то, что легко поменять, а не то, что влияет на решение. Цвет кнопки способен дать разницу в доли процента, и на реальном трафике малого сайта эта разница неотличима от шума. Наличие цены на странице способно изменить конверсию в разы — и такой тест даёт результат на несравнимо меньшем объёме данных.

Отдельно про формы. Каждое дополнительное обязательное поле снижает долю отправок, и это самый предсказуемый эффект во всём наборе. Тест «форма из двух полей против формы из пяти» почти всегда выигрывает короткая — вопрос лишь в том, сколько качества обращений вы теряете вместе с ростом количества. Поэтому оценивать такой тест надо не по числу заявок, а по числу дошедших до сделки.

A/B, многовариантный тест и последовательное сравнение

Помимо классического сплита существуют соседние методы, и путаница между ними приводит к неверным ожиданиям.

Метод Как устроен Что требует Когда применим
A/B-тест Два варианта, отличие в одном элементе Умеренный трафик Основной рабочий инструмент
A/B/n Три и более вариантов одного элемента Трафик кратно больше Когда есть несколько равных идей оффера
Многовариантный тест Сочетания нескольких элементов сразу Очень большой трафик Крупные магазины и сервисы
Последовательное сравнение Поменяли и смотрим на период после Ничего, кроме аналитики Когда параллельный тест невозможен

Многовариантный тест выглядит соблазнительно — проверить сразу всё, — но требует объёма данных, растущего с числом сочетаний. Три элемента по два варианта дают восемь комбинаций, и каждой нужен свой объём наблюдений. На сайте малого бизнеса такой тест не завершится никогда.

Если нужна помощь по теме — курсы SEO-оптимизации.

Последовательное сравнение — не тест, а наблюдение, и относиться к нему нужно соответственно. Если параллельный тест невозможен из-за низкого трафика, сравнивайте период с периодом, но соблюдайте условия: одинаковая длительность, сопоставимый сезон, отсутствие изменений в рекламе, и сравнивайте не одну цифру, а динамику. Вывод из такого сравнения всегда слабее, и решение на его основе принимается с оговоркой.

Не навредит ли тест позициям в поиске

Вопрос возникает всегда, и опасение обоснованно только при неправильной реализации. Само по себе тестирование поиску не мешает — это обычная практика, и поисковые системы прямо говорят, что не считают её нарушением. Проблемы начинаются, когда тест реализован так, что робот видит другую картину, чем люди.

Тему разбирал отдельно: «Основные веб-показатели сайта — что это такое и как их измерить».

  • Роботу и людям должно показываться одно и то же. Специальная выдача исходного варианта поисковым роботам — это подмена содержимого, и она наказуема.
  • Если варианты лежат на разных адресах, тестовый закрывается указанием на основной как на канонический, чтобы в поиск не попал дубль.
  • Тест должен быть конечным. Постоянно работающий сплит на ключевых страницах — повод для вопросов и источник нестабильности данных.
  • Скрипт тестирования не должен задерживать отрисовку. Мигание страницы при подмене варианта ухудшает и восприятие, и показатели скорости.
  • Смысл страницы в вариантах не меняется. Тестировать оформление и структуру — нормально; подменять тему страницы — уже другая история.
  • Что такое мультиссылка, и как она создается

Самая частая техническая беда — именно мигание. Страница успевает отрисоваться в исходном виде, затем скрипт подменяет блоки, и посетитель видит рывок. Это ухудшает измеряемую скорость загрузки и портит впечатление ровно в тот момент, когда человек решает, оставаться ему или нет. Лечится переносом подмены на сторону сервера или ранней загрузкой скрипта.

Ошибки, из-за которых результат нельзя использовать

  • Остановка теста в момент «хорошей» цифры. Срок назначается заранее; досрочная остановка превращает случайное колебание в вывод.
  • Неполные недели. Состав аудитории в будни и выходные разный, поэтому длительность кратна семи дням.
  • Разные условия для групп. Один вариант получает трафик из рекламы, другой из поиска — сравниваются аудитории, а не страницы.
  • Изменённый посреди теста вариант. Любая правка обнуляет набранные данные, тест начинается заново.
  • Измерение не той цели. Клик по кнопке вместо отправленной заявки: кликов стало больше, обращений столько же.
  • Запуск на фоне распродажи или рекламной кампании. Аудитория меняется, и разница между вариантами тонет во внешнем эффекте.
  • Перенос вывода на другие страницы без проверки. Выигравший на карточке товара заголовок может проиграть на странице услуги.
  • Игнорирование мобильных отдельно. Часто вариант выигрывает на настольных и проигрывает на телефонах, а общая цифра показывает ничью.
  • Что такое мультиссылка, и как она создается

Последний пункт стоит взять в привычку. Перед тем как объявить результат, разложите его хотя бы по типу устройства и по источнику трафика. Ничья в общей цифре нередко скрывает два противоположных результата, и именно в этом разложении находится самое полезное — какой аудитории новый вариант подходит, а какой мешает.

Что делать, когда трафика на тест не хватает

Для большинства сайтов малого бизнеса это основной сценарий, и притворяться, что тест возможен, вредно. Работающие замены:

  1. Тестируйте крупное. Не оттенок кнопки, а полную переработку первого экрана или появление цены. Крупный эффект виден на малом объёме.
  2. Считайте по шагам воронки, а не по итогу. Переходов к форме заметно больше, чем заявок, и на промежуточном шаге данные набираются быстрее.
  3. Соберите тест по группе однотипных страниц. Двадцать карточек с новым шаблоном против двадцати со старым дают суммарный объём, недостижимый на одной странице.
  4. Используйте качественные методы. Пять записей сеансов и три разговора с клиентами находят проблемы, которые цифрами вы будете ловить полгода.
  5. Внедряйте очевидное без теста. Отсутствие цен, нерабочая форма на телефоне, отсутствие контактов — это не гипотезы, а дефекты. Их чинят, а не проверяют.

Частые вопросы

Сколько должен длиться тест? Минимум две полные недели и до набора расчётного объёма наблюдений. Если расчётный объём набирается за три дня — всё равно ждите две недели, чтобы захватить недельный цикл.

Можно ли тестировать несколько элементов сразу? Можно, если трафика хватает на многовариантный тест. На обычном сайте — нет: вы получите результат, из которого невозможно извлечь причину.

Что делать, если разницы не обнаружилось? Это тоже результат, и полезный. Он означает, что изменённый элемент не влияет на решение вашей аудитории, и деньги на его доработку тратить не нужно. Следующая гипотеза должна касаться более крупного элемента.

Нужно ли пересчитывать выигравший вариант через полгода? Аудитория, ассортимент и конкуренты меняются, поэтому давние выводы стареют. Проверять заново стоит те решения, на которых держится основная конверсия, примерно раз в год.

Считать конверсию по посетителям или по визитам? По посетителям. Один и тот же человек должен видеть один и тот же вариант при повторных заходах — иначе он попадёт в обе группы и испортит обе.

Годится ли тест для оценки SEO-изменений? Для оценки правок, влияющих на поведение, — да. Для оценки влияния на позиции — нет: позиции меняются медленно и зависят от множества внешних причин, поэтому там работает сравнение групп страниц с контрольной выборкой, а не сплит-тест.

Коротко

  • Сплит-тест сравнивает два варианта одной страницы параллельно, при случайном делении трафика и отличии ровно в одном элементе — иначе причина успеха останется неизвестной.
  • Тест начинается с гипотезы вида «меняю то-то, жду такого эффекта, потому что вижу вот это в данных», а не с выбора элемента для правки.
  • Необходимый объём наблюдений растёт при низкой базовой конверсии и малом ожидаемом приросте; при двух процентах конверсии и цели в плюс двадцать процентов речь идёт о десятках тысяч посетителей на вариант.
  • Срок теста назначается заранее и кратен неделе; остановка в момент «красивой» цифры превращает случайное колебание в ложный вывод.
  • Порядок тем задаётся влиянием: оффер, цена и состав полей формы дают эффект, ради которого стоит тестировать; оттенки кнопок — нет.
  • При нехватке трафика тестируйте крупные изменения, считайте по промежуточным шагам воронки и собирайте тест по группе однотипных страниц.
  • Что такое мультиссылка, и как она создается

Если непонятно, что тестировать первым и хватит ли вашего трафика на осмысленный вывод, приходите на SEO-консультацию: посмотрим статистику и воронку вашего сайта, выделим гипотезы с наибольшим потенциалом и отделим их от того, что нужно просто починить без всяких тестов.

Увеличьте позиции и продажи вашего сайта

Профессиональное SEO-продвижение с гарантией результата. Выберите подходящую услугу:

Анатолий Кузнецов — SEO-оптимизатор

Остались вопросы по продвижению?

Меня зовут Анатолий Кузнецов, я SEO-оптимизатор с 20-летним стажем. Разберу ваш сайт, отвечу на вопросы и подскажу, что улучшить для роста позиций в Яндексе и Google.

Связаться со мной →

Комментарии

Руслан Пряхин

Таблица с объёмом выборки отрезвляет. У нас 3000 визитов в месяц на посадочную, конверсия около 2%. Получается, любой тест на нюансы у нас невозможен в принципе. Полгода назад агентство продало нам «программу тестирования» из двенадцати гипотез — теперь понимаю, что это было.

Анатолий Кузнецов автор

Вывод правильный, но не бросайте тестирование совсем — поменяйте масштаб гипотез. При вашем трафике доступны только те изменения, от которых вы ждёте не плюс двадцать процентов, а рост в полтора-два раза: появление цены там, где её нет, замена абстрактного оффера на конкретный, сокращение формы с пяти полей до двух. Такие эффекты видны на паре тысяч посетителей. Второе: перенесите измерение на промежуточный шаг — доля дошедших до формы или до раздела с ценами набирается в разы быстрее, чем доля заявок, и по ней уже можно принимать решения. Третье: соберите тест не на одной странице, а на группе однотипных, если они у вас есть, — суммарный трафик даст нужный объём. А двенадцать гипотез на нюансы при таком трафике действительно не проверить, тут вы правы.

Капитолина Остроухова

Про мигание страницы — наболевшее. У нас скрипт подменял первый экран после отрисовки, и на телефонах это выглядело как перезагрузка. Показатель скорости упал, а мы полтора месяца искали причину в картинках.

Агния Побединская

Не соглашусь насчёт цвета кнопки. Есть же известные исследования, где смена цвета давала прирост в десятки процентов. Почему вы записываете это в бесполезное?

Анатолий Кузнецов автор

Такие результаты действительно встречаются, но почти всегда в них менялся не цвет, а заметность. Кнопка была бледная и сливалась с фоном, стала контрастной — и это уже не про оттенок, а про то, видит человек призыв к действию или нет. Если ваша кнопка сейчас не выделяется на странице, тест не нужен: делайте её контрастной, это дефект вёрстки, а не гипотеза. А вот выбор между двумя одинаково заметными оттенками — то самое, что даёт разницу в доли процента и требует десятков тысяч посетителей на вариант. Ещё один довод: эффектные примеры с огромным приростом обычно относятся к сервисам с миллионным трафиком, где и полпроцента стоит денег, и объём выборки набирается за сутки. Переносить их выводы на сайт с тремя тысячами визитов нельзя ни по механике, ни по арифметике.

Аркадий Панарин

Совет раскладывать результат по устройствам сэкономил нам внедрение вредного варианта. Общая цифра показывала небольшой плюс, а по факту на настольных был заметный рост, на телефонах — падение. Телефоны у нас две трети трафика.

Евгений Окулов

Вопрос про две версии на разных адресах. Если тестовый вариант закрыт каноническим указанием на основной, посетители из поиска ведь всё равно попадут только на основной. Тогда тестовый получает трафик только из рекламы — и группы становятся несравнимыми?

Анатолий Кузнецов автор

Вы нащупали реальную проблему такой схемы. Правильно она работает так: все посетители, откуда бы они ни пришли, попадают на основной адрес, и уже там скрипт или сервер случайным образом отправляет часть на тестовый. Тогда деление остаётся случайным, а канонический адрес нужен только для того, чтобы тестовая копия не попала в поиск как самостоятельная страница. Плохо, когда трафик разводят по адресам снаружи — раздают ссылки на разные версии в разных каналах: вот в этом случае вы действительно сравниваете аудитории. Ещё удобнее вариант без второго адреса вообще: подмена блоков на стороне сервера по признаку, записанному посетителю при первом визите. Тогда и адрес один, и человек при повторных заходах видит ту же версию.

Жанна Прибылова

Отдельное спасибо за пункт про очевидные дефекты, которые не надо тестировать. У нас полгода обсуждали, «проверить ли гипотезу» о добавлении цен на страницы услуг. Цен не было вообще, а менеджеры каждый день отвечали на вопрос о стоимости в первом сообщении.

Прасковья Перелыгина

Уточню про кратность неделе. У нас пик заявок приходится на понедельник и вторник, дальше спад. Если тест начать в среду и закончить через две недели в среду — недельный цикл же соблюдён? Или начинать обязательно с понедельника?

Анатолий Кузнецов автор

Со среды по среду через две недели — цикл соблюдён, и день старта роли не играет. Важно только, чтобы в интервал вошло целое число полных недель, тогда каждый день недели попадёт в выборку одинаковое число раз. Со стартом в понедельник просто удобнее считать и сверять с отчётами, но это вопрос привычки, а не корректности. Что действительно стоит проверить при вашем распределении заявок — попадают ли оба понедельника в тест целиком, без обрезки по времени суток. Если тест запущен в среду в три часа дня, а остановлен через две недели в девять утра, у вас получится не ровно две недели, и первый день будет представлен неполно. Ставьте старт и остановку на одно и то же время суток.

Ксения Прянишникова

Про короткую форму и качество обращений — подтверждаю на своём опыте. Сократили с шести полей до двух, заявок стало заметно больше, а вот доля пустых и случайных выросла так, что менеджер перестал справляться. Считать надо действительно по дошедшим до сделки.

Тимур Перевалов

Добавлю про запуск на фоне рекламы. Мы стартовали тест одновременно с началом сезонной кампании и получили красивый рост в обеих группах. Разницы между вариантами не было никакой, зато отчёт наверх выглядел прекрасно, пока кто-то не спросил про контрольную группу.

Наталья Пшеничникова

Вопрос практический: чем считать значимость, если инструмент тестирования её не показывает? У нас самописная подмена вариантов, на выходе просто два числа заявок и два числа посетителей. Формулу искать или есть способ проще?

Анатолий Кузнецов автор

Формулу искать не надо, для двух вариантов есть бесплатные калькуляторы значимости — вбиваете четыре числа и получаете и достоверность, и доверительный интервал по каждому варианту. Смотреть советую именно на интервалы, а не только на итоговый процент: если интервалы двух вариантов заметно перекрываются, разницы у вас нет, как бы ни выглядели сами цифры. Второе: посчитайте нужный объём выборки заранее, до старта, тем же калькулятором в обратную сторону — иногда сразу видно, что тест не завершится за разумный срок, и лучше поменять гипотезу, чем ждать. Третье, чисто практическое: раз подмена самописная, убедитесь, что посетителю при повторном заходе выпадает та же версия, иначе один человек попадёт в обе группы и оба числа поедут.

Лев Осокин

Про источники гипотез — самый недооценённый раздел. Вопросы, которые люди задают менеджеру в первом сообщении, дали нам четыре гипотезы за один вечер разбора переписки. Никакая карта кликов столько не даёт.

Прохор Привалов

По поводу устаревания выводов. У нас выигравший три года назад вариант первого экрана до сих пор стоит как догма, менять его никто не даёт — «он же выиграл тест». За три года поменялись и аудитория, и конкуренты, и сам продукт. Аргумент про срок годности выводов заберу в работу.

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

 Нажимая «оставить комментарий» вы принимаетеправила конфиденциальности 

Прокрутить вверх