Использование ИИ в исследованиях пользовательского опыта: что работает, что не работает и где проходит граница допустимого.

Использование ИИ в исследованиях пользовательского опыта: что работает, что не работает и где проходит граница допустимого.

Проблемным местом никогда не было собеседование.

Все статьи об ИИ и исследованиях пользователей начинаются одинаково: исследования — это медленно, ИИ ускоряет их. Такая формулировка не ошибочна, но она настолько неточна, что бесполезна, когда вы в понедельник утром решаете, что именно нужно изменить.

Вот более точная версия. Проведение модерируемого интервью занимает шестьдесят минут и всегда будет занимать, потому что человек должен говорить шестьдесят минут. То, что раньше занимало четыре дня, было всем. женщин-заключенных Это включает в себя транскрибирование, разметку, поиск момента, когда три участника сказали одно и то же, используя три разных слова, и преобразование этой информации в то, на что менеджер по продукту мог бы отреагировать до завершения спринта.

Именно туда ушло время, и именно в этом заключается сила языковых моделей. Они сопоставляют шаблоны с текстом. Синтез исследований — это задача сопоставления шаблонов с текстом. Соответствие реально.

Но то же самое свойство, которое делает их хорошими в синтезе, делает их опасными в этом деле. Модель, которая находит закономерности, найдет их независимо от того, существуют они или нет, и она опишет те, которые она придумала, с той же уверенностью, что и существующие. В исследованиях уверенная ошибочная тема хуже, чем отсутствие темы, потому что ошибочная тема все равно формируется.

Так что вопрос не будь то Использовать ИИ в исследованиях пользователей. Все уже это делают. Вопрос в том, какие этапы процесса вы передаете на автоматизацию, что проверяете, прежде чем доверять результатам, и от автоматизации чего вообще отказываетесь. Именно об этом и пойдет речь в этой статье.

Где ИИ действительно заслуживает своего места

Мы сопоставляем ИИ с этапами исследовательского процесса, а не рассматриваем его как единое решение. Разные этапы имеют совершенно разные профили рисков.

ЭтапЧто ИИ делает хорошоЧто в нём не такНаше правило
Подбор и отбор персоналаРазработка анкет для предварительного отбора респондентов, выявление противоречивых ответов в анкетах, определение потенциальных респондентов-профессионалов.Фильтрация позволяет отсеять наиболее компетентных участников, исключая недовольных пользователей, которые вам больше всего нужны.Только помощь. Окончательный состав комиссии утверждается человеком.
Руководство по обсуждениюСоздание первого черновика на основе исследовательского вопроса, предложение дополнительных уточняющих вопросов, проверка на наличие наводящих вопросов.Создаёт типовые руководства, проверяющие уже имеющиеся знания.Программа ускоренного написания черновиков. Исследователь переписывает как минимум половину текста.
МодерацияВедение заметок в режиме реального времени, добавление тегов в реальном времени, предложение вопросов модератору.Не может распознать нерешительность, дискомфорт или паузу перед вежливой ложью.Никогда не будет автономным. Инструмент поддержки для модератора-человека.
транскрипцияРазделение говорящих, добавление временных меток, первичная обработка.Точность транскрипции на турецком языке резко снижается при использовании терминологии из предметной области, названий брендов и переключении кодов.Автоматизируйте процесс, а затем выборочно проверьте 10% результатов по аудиоданным.
Кодирование и разметкаБыстрое и последовательное применение существующего кодового справочника к сотням стенограммИзобретение новых кодов в процессе работы над корпусом данных; объединение отдельных проблем в одно удобное обозначение.Автоматизируйте процесс с помощью фиксированного, созданного человеком кодового словаря.
СинтезГруппировка, выявление закономерностей взаимодействия между участниками, написание первого нарратива.Путает частоту с важностью; сглаживает острые углы для несогласного участника.Только черновик. Каждая тема отслеживается до исходного кода перед выпуском.
Непрерывный анализ обратной связиОтзывы в App Store, заявки в службу поддержки, дословные записи NPS, журналы чатов в таком объеме, что команда не может прочитать их вручную.Система оценки эмоционального состояния плохо распознает сарказм и культурную непрямоту.Высокоэффективная автоматизация с выборочными проверками.
Создание артефактовПерсоны, карты пути клиента, деревья возможностей на основе проверенных данных.Создает правдоподобные артефакты из слабых или отсутствующих доказательств.Только на основе проверенных исследований, никогда не на основе знаний модели о мире.

Две строки в этой таблице имеют более высокое значение, чем все остальные вместе взятые.

Программирование в больших масштабах. Если у вас есть кодовая книга, написанная человеком, то её последовательное применение к 40 стенограммам — это именно тот вид утомительной работы, требующей строгого соблюдения правил, в которой надёжны модели. Именно здесь и заключается большая часть времени, которое можно восстановить.

Анализ непрерывной обратной связи. Большинство компаний хранят тысячи отзывов в магазинах приложений, заявок в службу поддержки и дословных ответов на опросы, которые никто не читал с момента их появления. Это наиболее выгодное и наименее рискованное применение ИИ во всей дисциплине, поскольку вы не заменяете проводимые исследования — вы читаете данные, которые раньше выбрасывались. Мы подробно рассматриваем это в [ссылка на статью]. Как ИИ может превратить отзывы пользователей в полезные рекомендации по улучшению продукта.

Четыре типа отказов, которые мы постоянно выявляем

Это не теоретические риски. Это конкретные проблемы, которые возникают в реальных проектах, примерно в порядке убывания частоты их выявления.

1. Частота, маскирующаяся под важность.

Если попросить модель обобщить двадцать интервью, она выделит то, что говорилось чаще всего. Но ценность исследования обычно заключается не в наиболее часто встречающемся ответе. Она заключается в одном участнике, который полностью отказался от предложенного варианта, или в двух, которые независимо друг от друга описали одно и то же обходное решение, или в сегменте, участники которого так и не дошли до шага, который обсуждали все остальные.

Модель, обобщающая результаты исследования процесса оформления заказа, покажет, что вопрос о прозрачности стоимости доставки поднимался неоднократно. Она не покажет, что единственные два участника, завершившие покупку, уже были авторизованы — а это фактический результат, который в корпусе данных отображается лишь как отсутствие информации.

Наша проверка: Мы задаём прямой вопрос о позиции меньшинства. «Какой участник не согласился с формирующимся консенсусом, и что он сказал?» Если модель не может назвать ни одного такого участника, мы рассматриваем полученное резюме как неполное, а не как свидетельство согласия.

2. Умелое изобретение

Модели выдают цитаты, которые звучат в точности как слова участника, приписываемые участнику, который этого не говорил. Нечасто. Но достаточно часто. И этот недостаток незаметен при внимательном рассмотрении, потому что сфабрикованная цитата звучит лучше, чем настоящая — реальные люди говорят фрагментарно.

Наша проверка: Каждая цитата, попадающая в презентацию клиента, содержит ссылку на стенограмму и метку времени. Если её невозможно найти в исходном аудиофайле, она не отправляется. Это механическое правило, а не решение, принятое на основе субъективной оценки, потому что именно субъективная оценка здесь и является причиной сбоя.

3. Сикофантический синтез

Предоставьте модели свою гипотезу, а затем данные, и синтез подтвердит вашу гипотезу. Предоставьте те же данные с противоположной гипотезой, и синтез подтвердит её. Это самый дорогостоящий вид неудачи в консалтинге, поскольку он приводит к получению именно того результата, который хотел клиент, но при этом сводит на нет причину, по которой он вас нанял.

Наша проверка: В заданиях на синтез никогда не содержится гипотеза. Модель получает корпус и исследовательский вопрос, ничего больше. Когда мы хотим проверить гипотезу, мы запускаем её как отдельный, состязательный этап: «найти наиболее убедительные доказательства в этом корпусе». против которого выступает большинство исследователей в области общественного здравоохранения. следующее утверждение."

4. Синтетические пользователи

Наиболее уверенно рекламируемое, но наименее защищаемое приложение: генерация симулированных участников и проведение интервью с ними вместо реальных людей. Оно быстро создает правдоподобные стенограммы, и именно в правдоподобности заключается проблема. Модель, обученная в интернете, покажет вам, что представляет собой тот или иной персонаж. звучит какЭто краткое описание того, как о таких людях пишут, а не того, как они себя ведут, когда проверка вашей формы отклоняет их адрес с третьей попытки.

Синтетические пользователи полезны лишь для одной цели: для отработки плана обсуждения перед тем, как задействовать реального участника. Мы используем их именно для этого. Мы не используем их в качестве доказательств и не представляем результаты их работы как выводы исследования. Если поставщик предлагает вам исследовательскую программу без участия людей, он продает вам очень дорогой способ подтвердить то, во что вы уже верите.

Наш рабочий протокол

Это реальная последовательность событий, а не её идеализированная версия.

1. Кодовую книгу сначала пишут люди. Прежде чем какая-либо модель будет работать с расшифровкой интервью, исследователь вручную читает от трех до пяти интервью и создает структуру кодирования. Эта структура основана на данных данного исследования, а не на общей таксономии UX. Все последующие этапы наследуют свое качество от этого шага, поэтому мы никогда не сжимаем этот этап.

2. Модель применяет фрейм, и только фрейм. Фиксированная кодовая книга, без добавления новых категорий в процессе выполнения. Когда модель сталкивается с чем-то, что не охватывается рамками, она помечает это как неклассифицированное, вместо того чтобы принудительно подгонять. Неклассифицированные данные часто оказываются наиболее интересным результатом всего выполнения.

3. Проведите двойное кодирование 15% выборки. Одни и те же стенограммы кодируются независимо человеком и моделью, и мы измеряем процент расхождений. Если он ниже 10%, мы продолжаем. Если выше 20%, ошибка в кодовой книге, а не в модели — мы возвращаемся к первому шагу. Процент расхождений — это диагностический показатель качества кадра, и такой подход позволил нам сэкономить больше средств, чем использование его в качестве критерия качества инструментов.

4. Черновик синтезирующего текста без указания гипотезы в задании. Модель получает корпус данных и исследовательский вопрос. Она формирует кластеры и первое повествование.

5. Прохождение проверки отслеживаемости. Каждое утверждение в черновике связывается как минимум с двумя участниками, с указанием времени. Утверждения, которые невозможно отследить, удаляются, а не смягчаются. Утверждение, поддержанное ровно одним участником, обозначается как единичное наблюдение, что является законным и часто ценным фактом для отчета, но не в качестве темы.

6. Триангуляция на основе поведенческих данных. Заявленное поведение и наблюдаемое поведение постоянно расходятся. Мы сверяем результаты интервью с записями сессий и данными тепловых карт — кликами в состоянии ярости, неактивными кликами, точками отказа — прежде чем что-либо попадёт к клиенту. Когда участники говорят, что фильтр работает нормально, а записи показывают, что они от него отказались, побеждают записи. Именно здесь качественные исследования, проводимые с помощью ИИ, с наибольшей вероятностью могут оказаться неэффективными, поскольку поведенческим данным всё равно, насколько связным было повествование.

7. Рекомендацию составляет человек. Полученные данные можно собрать с помощью ассистентов. Что с ними делать в данной организации, с учетом этих ограничений и данного плана действий, — это решение, которое принимает тот, кто присутствовал на интервью.

То, что мы не автоматизируем

Краткий список, и мы твердо его придерживаемся.

  • Модерация интервью с уязвимыми или находящимися в состоянии стресса пользователями. Здравоохранение, финансовые трудности, исследования в области доступности. Работа модератора в этой сфере частично заключается в обеспечении безопасности, и это не подлежит делегированию.
  • Рекомендация. См. шаг семь.
  • Оценка доступности. Автоматизированные инструменты, включая наши собственные. инструмент аудита WCAG — Выявляет примерно треть проблем, соответствующих стандартам WCAG. Остальные требуют ручного тестирования с использованием вспомогательных технологий. Любой поставщик, заявляющий о полной автоматизированной защите, описывает сканирование, а не аудит.
  • Решение о том, что не стоит изучать. На этапе определения масштабов исследования создается или уничтожается большая часть его ценности, и это стратегический диалог, а не задача по обобщению результатов.

Заметка о турецкоязычных исследованиях

Большинство опубликованных руководств по исследованиям с использованием ИИ написаны и проверены на английском языке, а разрыв в производительности реален и недостаточно обсуждается.

Качество транскрипции на турецком языке заметно ухудшается в области названий брендов, отраслевого жаргона и переключения кодов между английским и турецким языками, что совершенно нормально для стамбульских команд, занимающихся разработкой продуктов и электронной коммерцией. Классификация настроений плохо справляется с турецкой косвенностью — вежливая оговорка, предшествующая серьезной жалобе, часто воспринимается классификатором, обученным преимущественно на английском языке, как нейтральная или положительная. Агглютинативное морфологическое строение также означает, что подходы к анализу частоты ключевых слов в открытых опросах дают крайне неудовлетворительные результаты, поскольку одно и то же понятие встречается в десятке вариантов, которые токенизатор рассматривает как несвязанные.

Практические последствия: повысьте уровень выборочной проверки транскрипции выше 10%, которые вы использовали бы для английского языка, никогда не полагайтесь на автоматическую оценку тональности как на самостоятельный сигнал в турецких корпусах и проверяйте любой классификатор на размеченном вручную турецком образце, прежде чем доверять его результатам в больших объемах. Мы используем собственный набор данных для проверки именно по этой причине.

Как определить, работает ли оно?

Скорость — неподходящий показатель. Все становятся быстрее; вопрос в том, выдерживает ли результат проверку временем. Мы отслеживаем три показателя:

Показатель выживаемости Insight. Какая доля результатов, представленных в исследовательском отчете, оставалась достоверной спустя шесть месяцев? Измерить это непросто, но все неудобства того стоят.

Уровень расхождения между результатами, полученными человеком, и результатами, полученными с помощью модели. Начиная с третьего шага, описанного выше, отслеживайте изменения во времени. Рост разногласий обычно означает, что область исследования изменилась, а кодовая книга осталась неизменной.

Время от последнего интервью до первой проверяемой гипотезы. Это тот показатель, который действительно повышает эффективность ИИ. Если раньше синтез занимал восемь дней, а теперь два, это означает два дополнительных цикла экспериментов в квартал — что и является реальным экономическим обоснованием, и оно вполне оправдано. Просто большинство поставщиков не предлагают такой подход.

Углубляясь

Данная статья представляет собой общий обзор. Четыре сопутствующие статьи подробно описывают отдельные этапы:

Часто задаваемые вопросы

Может ли искусственный интеллект полностью заменить пользовательские интервью? Нет. Это может заменить часть работы, связанной с интервью — транскрипцию, кодирование, предварительный анализ — и может помочь вам подготовиться к ним лучше. Но это не может предоставить данные о поведении людей, поскольку у него нет доступа к информации об их поведении. Имитированные участники рассказывают, как эти люди описаны в тексте, что совсем другое дело и часто вводит в заблуждение.

Сколько времени на самом деле экономит исследование с использованием ИИ? По нашему опыту, экономия сосредоточена почти исключительно в синтезе и кодировании, где она является существенной. Полевые исследования, набор участников и согласование интересов заинтересованных сторон остаются неизменными. Реалистично ожидать, что в исследовании с модерацией период после полевых исследований значительно сократится, а общая продолжительность проекта уменьшится гораздо меньше — поскольку полевые исследования всегда были самым длительным этапом.

Можно ли считать синтетических пользователей законными? В качестве инструмента для подготовки к обсуждению и для проверки формулировок вопросов в опросе — да. В качестве доказательства результатов исследования — нет. Разница важна: одно — это вспомогательное средство для подготовки, другое — сфабрикованные данные, помеченные как результаты исследования.

В чём заключается наибольший риск? Уверенный, беглый, но ошибочный результат — и, в частности, его версия, которая согласуется с тем, во что команда уже верила. Сфабрикованные цитаты выявляются правилами отслеживания. Подхалимский синтез сложнее, потому что он приводит к результату, который устраивает всех. Единственная надежная защита — это отделение гипотезы от задания на синтез и проведение явного состязательного анализа.

Насколько эффективно исследования с использованием ИИ применяются в Турции? Не является универсальным решением. Точность транскрипции, классификация настроений и методы анализа частоты ключевых слов ухудшаются на турецком языке по сравнению с английским. Он пригоден для использования, и мы применяем его ежедневно, но требует более высоких показателей выборки, проверенных классификаторов и исследователя, владеющего этим языком.

Хотите получить второе мнение о вашем исследовательском процессе?

Если вы проводите исследования с использованием ИИ и хотите узнать, выдержат ли ваши результаты проверку, или вы решаете, что автоматизировать, а что защитить, мы проанализируем ваш текущий процесс и четко укажем, в чем заключается риск.

 


Çağdaş Polat
Написано

Çağdaş Polat

Чагдаш Полат — соучредитель компании Switas, где он руководит консалтингом в области технологий и развития бизнеса для брендов в сферах электронной коммерции, туризма, здравоохранения и государственного сектора. Выпускник факультета компьютерных наук, за последнее десятилетие перешедший из разработки программного обеспечения на руководящие должности в области маркетинга, разработки продуктов и стратегии, он теперь консультирует компании по вопросам CRO (оптимизации конверсии), аналитики и построения систем роста, которые выдерживают проверку измерения.


Статьи по теме

Свитас, как показано на

Magnify: Масштабирование маркетинга влияния с Энгином Юртдакулом

Ознакомьтесь с нашим примером использования Microsoft Clarity.

Мы отметили Microsoft Clarity как продукт, разработанный с учетом практических задач в реальных условиях настоящими специалистами по продуктам, которые понимают проблемы, с которыми сталкиваются такие компании, как Switas. Такие функции, как отслеживание кликов и ошибок JavaScript, оказались бесценными для выявления проблем и технических неполадок у пользователей, что позволило внести целенаправленные улучшения, напрямую повлиявшие на пользовательский опыт и коэффициенты конверсии.