Точность синтетических респондентов измеряется одним способом: сверкой с живыми людьми. Fair Lab провёл более 100 сравнительных тестов с участием свыше 12 000 живых и цифровых респондентов. Совпадение по выбору лидирующего варианта составило 87%, по топ-3 вариантам — 80%, по ключевым инсайтам — 85%.
Коротко
- Валидация — это воспроизведение уже проведённых живых исследований на тех же аудиториях и материалах, а не проверка «правдоподобности» ответов.
- 87% по лидеру означает: в 87 тестах из 100 вариант, который цифровые респонденты поставили на первое место, выбрали и живые люди.
- Метод надёжен в относительных оценках (какой вариант сильнее) и требует осторожности в абсолютных (сколько именно процентов купят).
- Мы публикуем не только совпадения, но и известные смещения: без этого цифра точности ничего не значит.
Как мы измеряем точность
Есть соблазн оценивать цифровых респондентов по тому, насколько убедительно они пишут. Это ловушка: языковая модель по определению пишет убедительно, и правдоподобный ответ ничего не говорит о том, ответили бы так живые люди. Поэтому мы измеряем точность иначе.
Берём исследование, которое уже проведено на живых респондентах: те же материалы, та же анкета, та же целевая аудитория. Формируем цифровых респондентов под тот же сегмент и проводим тест заново. Затем сравниваем результаты по трём параметрам: какой вариант вышел на первое место, какие три варианта вошли в топ, и какие ключевые инсайты, барьеры и мотивы всплыли в открытых ответах.
Таких сравнительных тестов проведено более 100, суммарно в них участвовали свыше 12 000 живых и цифровых респондентов. Задачи разные: концепции, креативы, нейминг, инсайты; аудитории тоже разные, от массовых FMCG-сегментов до узких B2B.
Три цифры и что они означают
- 87% по лидеру — В 87% тестов вариант, который цифровые респонденты поставили на первое место, совпал с выбором живых людей.
- 80% по топ-3 — В 80% тестов тройка сильнейших вариантов совпала с тройкой по живому исследованию.
- 85% по инсайтам — В 85% тестов ключевые инсайты, барьеры и мотивы из открытых ответов совпали с выводами живого исследования.
- 12 000+ респондентов — Суммарный объём выборок в 100+ сравнительных тестах, живых и цифровых.
Обратите внимание, что все три цифры — про сравнение вариантов и про смыслы, а не про абсолютные значения. Это не случайно. Мы не утверждаем, что если 42% цифровых респондентов выбрали концепцию А, то ровно 42% живых людей сделают то же. Мы утверждаем, что если концепция А сильнее концепции Б у цифровых респондентов, то с высокой вероятностью она сильнее и у живых. Именно это нужно на раннем этапе, когда решается, какую идею развивать.
Синтетический тест отвечает на вопрос «какой вариант сильнее и почему». На вопрос «сколько именно купят» отвечает полевое исследование.
Почему 87%, а не 100%
Оставшиеся 13% — не шум и не случайность, у них есть структура. Часть расхождений связана с известными смещениями метода: цифровые респонденты лучше живых осведомлены о брендах, рациональнее там, где решение опирается на личный физический опыт, и хуже воспроизводят сильное личное разочарование. Часть — с задачами, где живые люди сами отвечают нестабильно: при повторном опросе на людях лидер тоже меняется, и это ограничение не синтетики, а самого вопроса.
Мы считаем важным публиковать и эти границы. Цифра точности без описания ограничений — маркетинг, а не методология. Подробный разбор смещений вынесен в отдельную статью.
Как эти цифры соотносятся с рынком
Крупные исследовательские холдинги измеряют похожие вещи и приходят к похожим выводам. Kantar сообщает, что его технология усиления данных достигает точности 94–95% относительно реальных данных. Ipsos в работе со Стэнфордом называет ответы синтетических панелей статистически неотличимыми от ответов реальных участников. NielsenIQ формулирует осторожнее: синтетические респонденты убедительно воспроизводят человеческие ответы при условии качественных данных, но подходят скорее для ранних этапов, чем для финальных решений.
Цифры разных компаний нельзя сравнивать напрямую: методики валидации отличаются, и «точность 95%» у одного означает не то же, что «87% по лидеру» у другого. Общий вывод при этом одинаковый: метод работает как инструмент раннего сигнала, и именно так мы рекомендуем его применять.
Что это значит для того, кто принимает решение
Если у вас три концепции и десять дней до запуска, синтетический тест с вероятностью 87% укажет на ту же, что показала бы фокус-группа через три недели. Если у вас десять названий, он с вероятностью 80% отберёт ту же тройку. И в 85% случаев назовёт те же барьеры, о которых вы узнали бы из открытых ответов живых людей. Этого достаточно, чтобы отсеять слабое и сосредоточить полевое исследование на сильном. Этого недостаточно, чтобы отменить полевое исследование там, где решение стоит десятки миллионов и опирается на абсолютные цифры.
Валидация у нас не разовое мероприятие. Каждый новый тип задачи и каждый новый рынок проходят ту же процедуру сверки с живыми данными, и цифры в этой статье будут обновляться по мере накопления тестов.