Штучний інтелект у дослідженні користувачів: що працює, що не працює та де ми проводимо межу

Штучний інтелект у дослідженні користувачів: що працює, що не працює та де ми проводимо межу

Вузьким місцем ніколи не було інтерв'ю

Кожна стаття про штучний інтелект та дослідження користувачів починається однаково: дослідження повільні, штучний інтелект робить їх швидкими. Таке формулювання не є неправильним, але воно достатньо неточне, щоб бути марним, коли ви вирішуєте, що насправді змінити в понеділок вранці.

Ось точніша версія. Проведення модерованого інтерв'ю займає шістдесят хвилин і завжди буде, тому що людина має говорити шістдесят хвилин. Те, що раніше займало чотири дні, було... навколо це — транскрибування, позначання тегами, пошук моменту, коли троє учасників сказали одне й те саме трьома різними словниками, та перетворення цього на щось, над чим менеджер продукту міг би відреагувати до завершення спринту.

Саме на це пішов час, і саме в цьому сильні мовні моделі. Вони є проблемою зіставлення зі зразками, а не тексту. Синтез досліджень — це проблема зіставлення зі зразками, а не тексту. Відповідність реальна.

Але та сама властивість, яка робить їх хорошими в синтезі, робить їх у ньому небезпечними. Модель, яка знаходить закономірності, знайде закономірності незалежно від того, чи існують вони, і описуватиме ті, що вона винайшла, точно в тому ж впевненому регістрі, що й ті, що вже існують. У дослідженнях впевнена неправильна тема гірша, ніж її відсутність, тому що неправильна тема створюється.

Отже питання не в тому, Чи використовувати штучний інтелект у дослідженнях користувачів. Усі вже це роблять. Питання в тому, які частини процесу ви передаєте, що перевіряєте, перш ніж довіряти результату, і що взагалі відмовляєтеся автоматизувати. Саме про це ця стаття.

Де ШІ насправді заслужує своє місце

Ми порівнюємо ШІ з дослідницьким процесом поетапно, а не розглядаємо його як окреме рішення. Різні етапи мають дуже різні профілі ризику.

СтажуванняЩо ШІ робить добреЩо виходить не такНаше правило
Набір та відбірСкладання скринінгових запитань, виявлення суперечливих відповідей у ​​відповідях скринінгових запитань, позначання ймовірних професійних респондентівНадмірні фільтри для учасників, які люблять красномовство; відсіювання розчарованих користувачів, які вам найбільше потрібніТільки допомога. Людина затверджує остаточну панель.
Посібник з обговоренняСтворення першого варіанту дослідницького питання, пропонування подальших зондуючих питань, перевірка на навідні питанняСтворює загальні посібники, які перевіряють те, що вже відомоПрискорювач чернетки. Дослідник переписує щонайменше половину.
презентаціяВедення нотаток у режимі реального часу, додавання тегів у реальному часі, пропонування зондів модератору-людиніНе можу розпізнати вагання, дискомфорт або паузу перед ввічливою брехнеюНіколи не автономний. Інструмент підтримки для модератора-людини.
TranscriptionРозділення динаміків, позначення часу, очищення першого проходженняТочність турецької транскрипції різко падає через використання доменного жаргону, назв брендів та перемикання кодівАвтоматизуйте, а потім вибірково перевірте 10% на відповідність аудіо.
Кодування та тегуванняШвидке та послідовне застосування існуючої кодової книги до сотень транскриптівВинахід нових кодів у середині корпусу; об'єднання окремих проблем в одну зручну назвуАвтоматизуйте за допомогою фіксованої кодової книги, створеної людиною.
СинтезКластеризація, виявлення моделей взаємодії між учасниками, складання першого наративуПлутає частоту з важливістю; загладжує незгодного учасникаТільки чернетка. Кожну тему відстежують до джерела перед відправкою.
Безперервний аналіз зворотного зв'язкуОгляди магазинів додатків, заявки на підтримку, дослівні звіти про NPS, журнали чатів у такому обсязі, який жодна команда не може прочитати вручнуОцінка настроїв погано розпізнає сарказм та культурну непрямістьВисокоефективна автоматизація з вибірковими перевірками.
Будівля артефактівПерсони, карти подорожей, дерева можливостей з перевірених вхідних данихСтворює правдоподібні артефакти з нечітких або відсутніх доказівТільки з перевірених досліджень, ніколи зі світових знань моделі.

Два рядки в цій таблиці мають більшу цінність, ніж решта разом узяті.

Кодування у великому масштабі. Якщо у вас є книга кодів, написана людиною, її послідовне застосування до 40 транскриптів – це саме той тип виснажливих робочих моделей, що дотримуються правил. Саме на цьому насправді і полягає найбільша частина часу, який можна відновити.

Безперервний аналіз зворотного зв'язку. Більшість компаній спираються на тисячі оглядів магазинів додатків, заявок на підтримку та дослівних описів опитувань, які ніхто не читав з моменту їх появи. Це найприбутковіше та найменш ризиковане використання штучного інтелекту в усій дисципліні, оскільки ви не замінюєте дослідження, які проводилися раніше, а читаєте дані, які викидалися. Ми детально розглядаємо це в Як штучний інтелект може перетворити відгуки користувачів на практичну інформацію про продукт.

Чотири режими відмови, які ми постійно вловлюємо

Це не теоретичні ризики. Це конкретні проблеми, які виникають у реальних проектах, приблизно в порядку спадання частоти їх виявлення.

1. Частота маскується під важливість

Попросіть модель підсумувати двадцять інтерв'ю, і вона виведе на перший план те, що говорили найчастіше. Але цінність дослідження зазвичай полягає не в модальній відповіді. Вона полягає в одному учаснику, який повністю відмовився від потоку, або в двох, які незалежно описали той самий обхідний шлях, або в сегменті, який так і не дійшов до кроку, який обговорювали всі інші.

Модель, що підсумовує дослідження оформлення замовлення, покаже вам, що питання прозорості вартості доставки згадувалося неодноразово. Вона не покаже, що єдині два учасники, які завершили покупку, вже були авторизовані — що є фактичним висновком, і що в корпусі даних відображається лише як відсутність.

Наша перевірка: Ми прямо запитуємо про позицію меншості. «Хто з учасників не погоджувався з консенсусом, що склався, і що він сказав?» Якщо модель не може назвати такого учасника, ми розглядаємо резюме як неповне, а не як доказ згоди.

2. Вільний винахід

Моделі створюють цитати, які звучать точно так само, як те, що сказав би учасник, якщо приписати учаснику, який цього не казав. Не часто. Досить часто. І цей недолік непомітний при розгляді, бо вигадана цитата читається краще за справжню — реальні люди говорять фрагментарно.

Наша перевірка: Кожна цитата, яка потрапляє до клієнтської колоди, містить посилання на транскрипт і позначку часу. Якщо її неможливо знайти у вихідному аудіо, вона не надсилається. Це механічне правило, а не судження, тому що саме судження тут не спрацьовує.

3. Підлабузницький синтез

Дайте моделі вашу гіпотезу, а потім ваші дані, і синтез підтвердить вашу гіпотезу. Дайте їй ті самі дані з протилежною гіпотезою, і синтез підтвердить це. Це найдорожчий спосіб відмови в консалтинговому контексті, оскільки він створює саме той результат, якого хотів клієнт, руйнуючи при цьому причину, через яку вони вас найняли.

Наша перевірка: Запити на синтез ніколи не містять гіпотези. Модель отримує корпус і дослідницьке питання, нічого більше. Коли ми хочемо перевірити гіпотезу, ми запускаємо її як окремий, змагальний прохід: «знайдіть найпереконливіші докази в цьому корпусі» проти наступне твердження».

4. Синтетичні користувачі

Найбільш впевнено просувається та найменш захищений додаток: створення симульованих учасників та інтерв'ювання їх замість людей. Він швидко створює правдоподібні стенограми, і саме правдоподібність є проблемою. Модель, навчена в Інтернеті, підкаже вам, що таке персона. Схоже, що є коротким описом того, як про таких людей пишуть, а не того, як вони поводяться, коли ваша перевірка форми відхиляє їхню адресу з третьої спроби.

Синтетичні користувачі корисні для однієї речі: для репетиції посібника з обговорення, перш ніж ви витратите на нього реального учасника. Ми використовуємо їх саме для цього. Ми не використовуємо їх як докази та не повідомляємо про їхні результати як про результати дослідження. Якщо постачальник пропонує вам дослідницьку програму без участі людей, він продає вам дуже дорогий спосіб підтвердити те, у що ви вже вірите.

Наш робочий протокол

Це фактична послідовність, а не ідеалізована.

1. Люди спочатку пишуть кодову книгу. Перш ніж будь-яка модель торкнеться стенограми, дослідник читає від трьох до п'яти інтерв'ю та вручну створює фрейм коду. Фрейм береться з даних цього дослідження, а не із загальної таксономії UX. Усе, що відбувається далі, успадковує свою якість від цього кроку, тому саме цей крок ми ніколи не стискаємо.

2. Модель застосовує каркас, і тільки каркас. Фіксована кодова книга, жодних нових категорій під час запуску. Коли модель зустрічає щось, чого фрейм не охоплює, вона позначає це як некласифіковане, а не примусово підганяє. Некласифікована купа часто є найцікавішим результатом усього запуску.

3. Подвійне кодування 15% вибірки. Ті самі транскрипти кодуються людиною та моделлю незалежно, і ми вимірюємо коефіцієнт розбіжностей. Менше 10% – і ми продовжуємо. Вище 20% – і кодова книга неправильна, а не модель – ми повертаємося до першого кроку. Коефіцієнт розбіжностей – це діагностика фрейму, і таке ставлення до нього заощадило нам більше, ніж ставлення до нього як до показника якості інструментів.

4. Чернетка синтезу без гіпотези в підказці. Модель отримує корпус даних та дослідницьке питання. Вона створює кластери та перший наратив.

5. Перевірка відстежуваності. Кожне твердження в чернетці пов'язане щонайменше з двома учасниками з позначками часу. Твердження, які неможливо відстежити, видаляються, а не пом'якшуються. Твердження, підтримане лише одним учасником, позначається як окреме спостереження, що є законним і часто цінним для повідомлення, але не як тема.

6. Тріангуляція з поведінковими даними. Заявлена ​​поведінка та спостережувана поведінка постійно розходяться. Ми звіряємо результати інтерв'ю із записами сесій та даними теплових карт — кліки гніву, неактивні кліки, точки відключення — перш ніж щось дійде до клієнта. Коли учасники кажуть, що фільтр працює добре, а записи показують, що вони відмовляються від фільтра, записи перемагають. Саме тут, найімовірніше, буде виявлено якісну роботу на основі штучного інтелекту, оскільки поведінковим даним байдуже, наскільки зв'язним був наратив.

7. Рекомендацію пише людина. Результати можна зібрати за допомогою. Що з ними робити в цій організації, з цими обмеженнями та цією дорожньою картою, вирішує хтось, хто брав участь у співбесідах.

Що ми не автоматизуємо

Короткий список, і ми його міцно дотримуємося.

  • Модерація інтерв'ю з вразливими або проблемними користувачами. Охорона здоров'я, фінансові труднощі, дослідження доступності. Робота модератора там частково є обов'язком піклування, і це не можна делегувати.
  • Рекомендація. Див. крок сьомий.
  • Оцінювання доступності. Автоматизовані інструменти, включаючи наші власні Інструмент аудиту WCAG — виявляє приблизно третину проблем WCAG. Решта потребує ручного тестування за допомогою допоміжних технологій. Будь-який постачальник, який заявляє про повне автоматизоване покриття, описує сканування, а не аудит.
  • Вирішення того, що не досліджувати. Визначення обсягу досліджень – це те, де створюється або знищується найбільша цінність дослідження, і це стратегічна розмова, а не завдання підсумовування.

Примітка щодо турецькомовних досліджень

Більшість опублікованих рекомендацій щодо досліджень за допомогою штучного інтелекту написані та перевірені англійською мовою, а розрив у продуктивності є реальним та недостатньо обговорюваним.

Турецька транскрипція помітно погіршується навколо назв брендів, галузевого жаргону та перемикання англо-турецьких кодів, що є цілком нормальним явищем у стамбульських командах з розробки продуктів та електронної комерції. Класифікація настроїв погано справляється з турецькою непрямістю — ввічлива застереження, що передує серйозній скарзі, часто читається як нейтральне або позитивне для класифікатора, навченого переважно англійською мовою. Аглютинативна морфологія також означає, що підходи до частоти ключових слів до даних відкритих опитувань погано враховуються, оскільки одне поняття з'являється в десятку флективних форм, які токенізатор розглядає як непов'язані.

Практичні наслідки: підвищте рівень вибіркової перевірки транскрипції вище 10%, який ви використовуєте для англійської мови, ніколи не покладайтеся на автоматичну перевірку настроїв як окремий сигнал у турецьких корпусах та перевіряйте будь-який класифікатор на зразку з турецькою міткою, перш ніж довіряти його результатам у великих обсягах. Саме з цієї причини ми використовуємо власний набір для перевірки.

Як дізнатися, чи працює це

Швидкість — це неправильний показник. Усі стають швидшими; питання в тому, чи витримує результат контакт із реальністю. Три показники, які ми насправді відстежуємо:

Рівень виживання Insight. Яка частина висновків, наведених у дослідницькому звіті, все ще вважалася актуальною через шість місяців? Це незручно виміряти, але це варте кожної частинки дискомфорту.

Рівень розбіжностей між людиною та моделлю. З кроку три вище. Відстежуйте це з часом. Зростання розбіжностей зазвичай означає, що область дослідження змінилася, а книга кодів – ні.

Час від останнього інтерв'ю до першої перевіреної гіпотези. Це число, яке ШІ справді переміщує. Якщо раніше синтез займав вісім днів, а тепер два, то це два додаткові експериментальні цикли на квартал — що є фактичним бізнес-кейсом, і він гарний. Просто більшість постачальників не наводять такого кею.

Заглиблення

Ця стаття є оглядом. Чотири супутні статті детально висвітлюють окремі етапи:

Часті питання

Чи може ШІ повністю замінити інтерв'ю з користувачами? Ні. Він може замінити частину роботи, пов’язаної з інтерв’ю — транскрипцію, кодування, синтез першого проходження — і може допомогти вам підготуватися до кращих інтерв’ю. Він не може генерувати докази про поведінку людей, оскільки не має доступу до їхньої поведінки. Учасники-симулятори розповідають вам, як такі люди описані в тексті, що є зовсім іншою річчю, і часто вона вводить в оману.

Скільки часу насправді економлять дослідження за допомогою штучного інтелекту? За нашим досвідом, економія майже повністю зосереджена на синтезі та кодуванні, де вона є суттєвою. Польові дослідження, рекрутинг та узгодження із зацікавленими сторонами залишаються незмінними. Реалістичним очікуванням для модерованого дослідження є те, що фаза після польових досліджень значно скоротиться, тоді як загальна тривалість проекту зменшиться набагато менше, оскільки польові дослідження завжди були довгостроковим етапом.

Чи є коли-небудь легітимними користувачі синтетичних речовин? Як інструмент для репетиції посібників з обговорення та як спосіб перевірки формулювань опитування під тиском – так. Як доказ у результатах дослідження – ні. Різниця важлива: одне – це допоміжний засіб для підготовки, інше – це сфабриковані дані з позначкою дослідження.

Який найбільший ризик? Впевнений, вільний, неправильний результат — і зокрема та його версія, яка узгоджується з тим, у що команда вже вірила. Сфабриковані цитати викриваються правилами відстеження. Підлабузницький синтез складніший, оскільки він створює результат, яким усі задоволені. Єдиний надійний захист — це відокремлення гіпотези від підказки до синтезу та виконання явного змагального пасу.

Чи дослідження за допомогою штучного інтелекту працюють так само добре турецькою мовою? Не зовсім стандартно. Точність транскрипції, класифікація настроїв та методи визначення частоти ключових слів у турецькій мові погіршуються порівняно з англійською. Вона зручна для використання, і ми використовуємо її щодня, але вона вимагає вищої частоти дискретизації, перевірених класифікаторів та дослідника, який розуміє цю мову.

Хочете отримати другу думку щодо вашого дослідницького процесу?

Якщо ви проводите дослідження за допомогою штучного інтелекту та хочете знати, чи витримають ваші висновки ретельну перевірку, або ж ви вирішуєте, що автоматизувати, а що захистити, ми переглянемо ваш поточний процес і чітко повідомимо вам, де криється ризик.

 


Чагдаш Полат

Написано

Чагдаш Полат

Чагдаш Полат є співзасновником Switas, де він очолює консалтинг з питань технологій та зростання для брендів у сфері електронної комерції, туризму, охорони здоров'я та державного сектору. Випускник факультету інформатики, який протягом останнього десятиліття пройшов шлях від розробки програмного забезпечення до керівних посад у сфері маркетингу, продуктів та стратегії, зараз він консультує компанії з питань CRO, аналітики та побудови систем зростання, які витримують вимірювання.

LinkedIn

Статті по темі

Світас, як видно на

Magnify: Масштабування інфлюенсер-маркетингу з Енгіном Юртдакулом

Перегляньте наш тематичний аналіз Microsoft Clarity

Ми відзначили Microsoft Clarity як продукт, створений з урахуванням практичних випадків використання в реальних умовах реальними розробниками, які розуміють проблеми, з якими стикаються такі компанії, як Switas. Такі функції, як кліки, що викликають гнів, та відстеження помилок JavaScript, виявилися безцінними для виявлення невдоволення користувачів та технічних проблем, що дозволило цілеспрямовано покращити роботу, що безпосередньо вплинуло на взаємодію з користувачем та коефіцієнти конверсії.