Пречката никога не е била интервюто
Всяка статия за изкуствен интелект и потребителски проучвания започва по един и същи начин: проучванията са бавни, изкуственият интелект ги прави бързи. Тази формулировка не е погрешна, но е достатъчно неточна, за да бъде безполезна, когато решавате какво всъщност да промените в понеделник сутринта.
Ето по-точната версия. Провеждането на модерирано интервю отнема шестдесет минути и винаги ще отнема, защото човек трябва да говори шестдесет минути. Това, което преди отнемаше четири дни, беше всичко... около то — транскрибиране, маркиране, намиране на момента, в който трима участници са казали едно и също нещо в три различни речника, и превръщането му в нещо, върху което продуктов мениджър може да действа преди края на спринта.
Ето къде отиде времето и точно там езиковите модели са силни. Те са проблем за съпоставяне на модели, а не на текст. Синтезът на изследвания е проблем за съпоставяне на модели, а не на текст. Съответствието е реално.
Но същото свойство, което ги прави добри в синтеза, ги прави и опасни в него. Модел, който намира модели, ще намери модели, независимо дали съществуват такива, или не, и ще опише тези, които е измислил, с абсолютно същия уверен регистър, както тези, които са налице. В изследванията, една уверена грешна тема е по-лоша от никаква тема, защото грешната тема се изгражда.
Така че въпросът не е дали да се използва изкуствен интелект в потребителските проучвания. Всички вече го правят. Въпросът е кои части от процеса предавате, какво проверявате, преди да се доверите на резултата, и какво изобщо отказвате да автоматизирате. За това е тази статия.
Където изкуственият интелект всъщност заема своето място
Ние съпоставяме ИИ с изследователския процес стъпка по стъпка, вместо да го третираме като еднократно решение. Различните етапи имат много различни рискови профили.
| Етап | Какво прави ИИ добре | Какво се обърка | Нашето правило |
|---|---|---|---|
| Набиране и подбор | Изготвяне на скринингови отговори, забелязване на противоречиви отговори в тях, маркиране на вероятни професионални респонденти | Прекалено много филтри за ясно изразени участници; отсява разочарованите потребители, от които най-много се нуждаете | Само асистент. Човек одобрява финалния панел. |
| Ръководство за дискусии | Генериране на първи вариант от изследователския въпрос, предлагане на последващи сондиращи въпроси, проверка за водещи въпроси | Създава общи ръководства, които проверяват вече познатото | Ускорител на чернови. Изследователят пренаписва поне половината. |
| Умереност | Водене на бележки в реално време, маркиране на живо, предлагане на сонди на човешки модератор | Не може да разчете колебание, дискомфорт или пауза преди учтива лъжа | Никога автономно. Инструмент за поддръжка на човешки модератор. |
| Транскрипция | Разделяне на високоговорителите, времево маркиране, почистване при първо преминаване | Точността на турската транскрипция спада рязко с жаргона на домейните, имената на марките и превключването на кодове | Автоматизирайте, след което проверете на случаен принцип 10% спрямо аудиото. |
| Кодиране и маркиране | Последователно прилагане на съществуваща кодова книга в стотици транскрипти с висока скорост | Измисляне на нови кодове в средата на корпуса; свиване на отделни проблеми в един удобен етикет | Автоматизирайте с фиксирана, създадена от човек кодова книга. |
| Синтез | Групиране, изясняване на модели на междуучастничество, изготвяне на първия наратив | Бърка честотата с важността; прикрива несъгласния участник | Само чернова. Всяка тема е проследена до източника, преди да бъде пусната. |
| Непрекъснат анализ на обратната връзка | Отзиви в App Store, заявки за поддръжка, дословни отчети за NPS, логове на чатове в обем, който никой екип не може да прочете ръчно | Оценяването на настроението разчита лошо сарказма и културната непрякост | Висококачествена автоматизация с проверки на проби. |
| Сграда с артефакти | Персони, карти на пътуванията, дървета на възможностите от валидирани входни данни | Създава правдоподобни артефакти от слаби или липсващи доказателства | Само от проверени изследвания, никога от познанията за света на модела. |
Два реда в тази таблица струват повече от останалите взети заедно.
Кодиране в голям мащаб. Ако имате кодова книга, написана от човек, прилагането ѝ последователно в 40 транскрипта е точно онзи вид досадни, следващи правила работни модели, при които са надеждни. Именно тук е по-голямата част от времето за възстановяване.
Непрекъснат анализ на обратната връзка. Повечето компании се основават на хиляди отзиви в магазини за приложения, заявки за поддръжка и стенографски анализи на проучвания, които никой не е чел, откакто са се появили. Това е използването на изкуствен интелект с най-висока възвръщаемост и най-нисък риск в цялата дисциплина, защото не замествате изследванията, които са се провеждали – вие четете данни, които са били изхвърляни. Разглеждаме това подробно в Как изкуственият интелект може да трансформира потребителската обратна връзка в практически полезни продуктови анализи.
Четирите режима на отказ, които непрекъснато улавяме
Това не са теоретични рискове. Това са специфичните неща, които се объркват в реални проекти, подредени горе-долу в низходящ ред на това колко често ги забелязваме.
1. Честота, маскирана като важност
Помолете модел да обобщи двадесет интервюта и той ще изведе на преден план това, което е било казвано най-често. Но изследователската стойност обикновено не е в модалния отговор. Тя е в единия участник, който е изоставил потока напълно, или двамата, които са описали едно и също решение независимо, или сегментът, който никога не е стигнал до стъпката, обсъждана от всички останали.
Модел, обобщаващ проучване на плащането, ще ви покаже, че прозрачността на разходите за доставка се е появявала многократно. Той няма да ви покаже, че единствените двама участници, които са завършили покупката, вече са били влезли в системата – което е действителната констатация и което се появява в корпуса само като отсъствие.
Нашата проверка: Изрично питаме за позицията на малцинството. „Кой участник не е съгласен с възникващия консенсус и какво е казал?“ Ако моделът не може да посочи такъв, ние третираме резюмето като непълно, а не като доказателство за съгласие.
2. Плавно изобретение
Моделите генерират цитати, които звучат точно като нещо, което участник би казал, приписано на участник, който не го е казал. Не често. Достатъчно често. И провалът е невидим при проверка, защото изфабрикуваният цитат се чете по-добре от истинския - истинските хора говорят на фрагменти.
Нашата проверка: Всеки цитат, който достига до клиентска колода, носи препратка към транскрипта и времева маркировка. Ако не може да бъде намерен в оригиналния аудиозапис, той не се изпраща. Това е механично правило, а не преценка, защото точно преценката е това, което тук се проваля.
3. Подлабузнически синтез
Дайте на модела вашата хипотеза, а след това данните си и синтезът ще я подкрепи. Дайте му същите данни с противоположната хипотеза и синтезът ще я подкрепи. Това е най-скъпият начин на неуспех в консултантския контекст, защото води до точно резултата, който клиентът е искал, като същевременно унищожава причината, поради която ви е наел.
Нашата проверка: Синтезните подкани никога не съдържат хипотезата. Моделът получава корпуса и изследователския въпрос, нищо друго. Когато искаме дадена хипотеза да бъде тествана, ние я изпълняваме като отделен, състезателен пропуск: „намерете най-силното доказателство в този корпус“ срещу следното твърдение“.
4. Синтетични потребители
Най-уверено предлаганото на пазара и най-малко защитимо приложение: генериране на симулирани участници и интервюиране на тях вместо на хора. То бързо генерира правдоподобни транскрипти и именно правдоподобността е проблемът. Модел, обучен в интернет, ще ви каже каква е персоната. Звучи като, което е обобщение на това как се пише за такива хора, а не как се държат, когато валидирането на формуляра ви отхвърли адреса им при третия опит.
Синтетичните потребители са полезни за едно нещо: репетиране на ръководство за дискусия, преди да се ангажира реален участник с нея. Ние ги използваме за това. Не ги използваме като доказателства и не докладваме резултатите от тях като изследователски резултати. Ако доставчик ви предлага изследователска програма без човешки участници в нея, той ви продава много скъп начин да потвърдите това, в което вече вярвате.
Нашият работен протокол
Това е действителната последователност, а не идеализирана.
1. Хората първо пишат кодовата книга. Преди който и да е модел да се докосне до транскрипт, изследователят прочита от три до пет интервюта и изгражда ръчно кодовата рамка. Рамката идва от данните от това проучване, а не от обща UX таксономия. Всичко надолу по веригата наследява качеството си от тази стъпка, поради което тя е стъпката, която никога не компресираме.
2. Моделът прилага рамката и само рамката. Фиксиран кодов наръчник, без нови категории по средата на изпълнението. Когато моделът срещне нещо, което рамката не покрива, той го маркира като некласифицирано, вместо да налага напасване. Некласифицираната купчина често е най-интересният резултат от цялото изпълнение.
3. Кодирайте двойно извадка от 15%. Същите транскрипти се кодират независимо от човек и от модела и ние измерваме процента на несъответствия. Под 10% и продължаваме. Над 20% и кодовата книга е грешна, а не моделът - връщаме се към първа стъпка. Процентът на несъответствия е диагностика на рамката и третирането му по този начин ни е спестило повече, отколкото да го третираме като индикатор за качество на инструментите.
4. Синтетичен проект без хипотеза в подканата. Моделът получава корпус и изследователски въпрос. Той генерира клъстери и първи наратив.
5. Проследимост. Всяко твърдение в черновата се свързва с поне двама участници, с времеви отметки. Твърденията, които не могат да бъдат проследени, се изтриват, а не се смекчават. Твърдение, подкрепено от точно един участник, се етикетира като единично наблюдение, което е легитимно и често ценно нещо за докладване, но не и като тема.
6. Триангулация спрямо поведенчески данни. Заявеното поведение и наблюдаваното поведение постоянно се разминават. Ние проверяваме резултатите от интервютата със записи от сесии и данни от топлинни карти – кликвания на ярост, мъртви кликвания, точки на отпадане – преди каквото и да е да достигне до клиента. Когато участниците казват, че филтърът е добре, а записите показват, че са го изоставили, записите печелят. Това е и мястото, където качествената работа, водена от изкуствен интелект, е най-вероятно да бъде хваната на заден план, защото поведенческите данни не се интересуват колко последователен е бил разказът.
7. Човек пише препоръката. Констатациите могат да бъдат събрани с помощ. Какво да се прави с тях в тази организация, с тези ограничения и тази пътна карта, е преценка, взета от някой, участвал в интервютата.
Какво не автоматизираме
Кратък списък и ние здраво го държим.
- Модериране на интервюта с уязвими или затруднени потребители. Здравеопазване, финансови затруднения, изследвания за достъпност. Работата на модератора там е отчасти задължение за полагане на грижа и това не може да бъде делегирано.
- Препоръката. Вижте стъпка седем.
- Оценка на достъпността. Автоматизирани инструменти — включително нашите собствени Инструмент за одит на WCAG — обхваща приблизително една трета от проблемите на WCAG. Останалите изискват ръчно тестване с помощни технологии. Всеки доставчик, който твърди, че покритието е напълно автоматизирано, описва сканиране, а не одит.
- Решаване какво да не се изследва. Определянето на обхвата е мястото, където се създава или унищожава по-голямата част от изследователската стойност и това е стратегически разговор, а не задача за обобщаване.
Бележка върху изследванията на турски език
Повечето публикувани насоки за изследвания, подпомогнати от изкуствен интелект, са написани и валидирани на английски език, а разликата в производителността е реална и недостатъчно обсъждана.
Турската транскрипция се влошава забележимо около имена на марки, секторен жаргон и превключването на англо-турски кодове, което е напълно нормално в екипите за продукти и електронна търговия в Истанбул. Класификацията на настроенията се справя зле с турската индиректност - учтивото ограждение, което предшества сериозно оплакване, често се чете като неутрално или положително за класификатор, обучен предимно на английски език. Аглутинативната морфология също означава, че подходите, базирани на честотата на ключовите думи, към данни от отворени проучвания се отчитат зле, защото една и съща концепция се появява в дузина спрегнати форми, които токенизаторът третира като несвързани.
Практически последици: повишете процента на случайни проверки на транскрипции над 10%, които бихте използвали за английски език, никога не разчитайте на автоматизирано определяне на настроенията като самостоятелен сигнал в турските корпуси и валидирайте всеки класификатор върху ръчно етикетиран турски образец, преди да се доверите на резултата му в голям обем. Ние използваме наш собствен набор за валидиране точно по тази причина.
Как да разбера дали работи
Скоростта е грешен показател. Всеки става по-бърз; въпросът е дали резултатът оцелява при контакт с реалността. Три показателя, които всъщност проследяваме:
Процент на оцеляване на Insight. От констатациите, представени в изследователски доклад, каква част все още се счита за валидна шест месеца по-късно? Това е неприятно за измерване и си заслужава всяка частица дискомфорт.
Процент на несъответствия между човек и модел. От трета стъпка по-горе. Проследете го във времето. Нарастващото несъгласие обикновено означава, че изследователската област се е променила, а кодовата книга не.
Време от последното интервю до първата проверима хипотеза. Това е числото, което изкуственият интелект наистина движи. Ако синтезът е отнемал осем дни, а сега два, това са два допълнителни експериментални цикъла на тримесечие – което е действителният бизнес сценарий и е добър. Просто това не е така, както го представят повечето доставчици.
Задълбочаване
Тази статия е общ преглед. Четири съпътстващи части разглеждат подробно отделните етапи:
- Създаване на потребителски персони, управлявани от данни, с изкуствен интелект — изграждане на персонни артефакти от валидирани доказателства, а не от априорни модели
- От данни до решения: Как изкуственият интелект може да рационализира синтеза на потребителски изследвания — етапът на синтез в дълбочина
- Как изкуственият интелект може да трансформира потребителската обратна връзка в практически полезни продуктови анализи — отзиви, билети и NPS дословни изявления в голям мащаб
- Оптимизиране на откриването на продукти с потребителско проучване, задвижвано от изкуствен интелект — прилагане на всичко това в рамките на цикъл на откриване
Често задавани въпроси
Може ли изкуственият интелект да замени изцяло потребителските интервюта? Не. То може да замести част от работата около интервютата – транскрипция, кодиране, синтез на първо място – и може да ви помогне да се подготвите за по-добри такива. Не може да генерира доказателства за това как се държат хората, защото няма достъп до тяхното поведение. Симулираните участници ви разказват как такива хора са описани в текста, което е различно нещо и често е подвеждащо.
Колко време всъщност спестяват изследванията, подпомогнати от изкуствен интелект? Според нашия опит, спестяванията се концентрират почти изцяло в синтеза и кодирането, където са значителни. Теренната работа, набирането на персонал и съгласуването със заинтересованите страни остават непроменени. Реалистично очакване за модерирано проучване е фазата след теренната работа да се свие значително, докато общата продължителност на проекта намалее много по-малко — защото теренната работа винаги е била с по-дълъг срок.
Легитимни ли са някога потребителите на синтетични материали? Като инструмент за репетиция на ръководства за дискусии и като начин за проверка на формулировките на анкетите под натиск, да. Като доказателство в изследователски резултат, не. Разграничението е важно: едното е помощно средство за подготовка, другото са изфабрикувани данни с етикет „изследване“ върху тях.
Какъв е най-големият риск? Уверен, плавен, грешен резултат — и по-специално версията му, която е в съответствие с това, в което екипът вече е вярвал. Изфабрикуваните цитати се улавят от правилата за проследяване. Подмазваческият синтез е по-труден, защото води до резултат, с който всички са доволни. Единствената надеждна защита е отделянето на хипотезата от подканата за синтез и прилагането на изричен състезателен пас.
Работят ли изследванията, подпомогнати от изкуствен интелект, също толкова добре на турски? Не е готово. Точността на транскрипцията, класификацията на настроенията и методите за честота на ключовите думи се влошават на турски в сравнение с английски. Използва се ежедневно и е приложим, но изисква по-високи честоти на семплиране, валидирани класификатори и изследовател, който разбира езика.
Искате второ мнение относно вашия изследователски процес?
Ако провеждате изследвания, подпомогнати от изкуствен интелект, и искате да знаете дали вашите открития биха издържали на проверка – или решавате какво да автоматизирате и какво да защитите – ние ще прегледаме текущия ви процес и ще ви кажем ясно къде се крие рискът.







