Wąskim gardłem nigdy nie była rozmowa kwalifikacyjna
Każdy artykuł o sztucznej inteligencji i badaniach użytkowników zaczyna się tak samo: badania są powolne, a sztuczna inteligencja przyspiesza je. To ujęcie nie jest błędne, ale jest na tyle nieprecyzyjne, że jest bezużyteczne, gdy w poniedziałkowy poranek zastanawiasz się, co właściwie zmienić.
Oto dokładniejsza wersja. Przeprowadzenie moderowanego wywiadu zajmuje sześćdziesiąt minut i zawsze będzie trwać, ponieważ osoba musi mówić przez sześćdziesiąt minut. To, co kiedyś zajmowało cztery dni, było wszystkim. na około to — transkrypcja, tagowanie, znalezienie momentu, w którym trzej uczestnicy powiedzieli tę samą rzecz, używając trzech różnych słów, i przekształcenie tego w coś, na co menedżer produktu mógł zareagować przed zamknięciem sprintu.
Właśnie na tym polegał upływ czasu i właśnie w tym tkwi siła modeli językowych. To one dopasowują wzorce do tekstu. Synteza badań to problem dopasowywania wzorców do tekstu. Dopasowanie jest realne.
Ale ta sama cecha, która czyni je dobrymi w syntezie, czyni je niebezpiecznymi w tej dziedzinie. Model, który znajduje wzorce, znajdzie je niezależnie od tego, czy takie istnieją, i opisze te, które sam wymyślił, z dokładnie taką samą pewnością, z jaką te, które już istnieją. W badaniach naukowych, pewny, błędny temat jest gorszy niż brak tematu, ponieważ powstaje błędny temat.
Zatem pytanie nie czy wykorzystywać sztuczną inteligencję w badaniach użytkowników. Wszyscy już to robią. Pytanie brzmi, które części procesu przekazujesz dalej, co sprawdzasz, zanim zaufasz wynikom, i czego w ogóle nie chcesz automatyzować. O tym właśnie jest ten artykuł.
Gdzie sztuczna inteligencja faktycznie zdobywa swoje miejsce
Mapujemy sztuczną inteligencję na każdym etapie procesu badawczego, zamiast traktować ją jako pojedynczą decyzję. Poszczególne etapy charakteryzują się bardzo różnymi profilami ryzyka.
| STAGE | Co sztuczna inteligencja robi dobrze | Co jest nie tak | Nasza zasada |
|---|---|---|---|
| Rekrutacja i selekcja | Tworzenie screenerów, wykrywanie sprzecznych odpowiedzi w odpowiedziach screenerów, oznaczanie prawdopodobnych profesjonalnych respondentów | Nadmierne filtry dla uczestników, którzy potrafią się wysławiać; odsiewa sfrustrowanych użytkowników, których najbardziej potrzebujesz | Tylko pomoc. Ostateczny panel zatwierdza człowiek. |
| Przewodnik do dyskusji | Tworzenie pierwszego szkicu na podstawie pytania badawczego, proponowanie dalszych badań, sprawdzanie pytań naprowadzających | Tworzy ogólne przewodniki, które testują to, co jest już znane | Przyspieszacz szkiców. Badacz przepisuje co najmniej połowę. |
| Umiar | Robienie notatek w czasie rzeczywistym, tagowanie na żywo, sugerowanie pytań moderatorowi | Nie można odczytać wahania, dyskomfortu ani pauzy przed grzecznym kłamstwem | Nigdy autonomiczne. Narzędzie wsparcia dla moderatora. |
| Transkrypcja | Separacja głośników, znaczniki czasu, czyszczenie w pierwszym przejściu | Dokładność transkrypcji w języku tureckim gwałtownie spada w przypadku żargonu domenowego, nazw marek i przełączania kodów | Zautomatyzuj, a następnie sprawdź wyrywkowo 10% pod kątem dźwięku. |
| Kodowanie i tagowanie | Konsekwentne stosowanie istniejącej książki kodowej w setkach transkryptów z dużą prędkością | Wymyślanie nowych kodów w trakcie pracy nad korpusem; łączenie odrębnych problemów w jedną wygodną etykietę | Zautomatyzuj działanie przy użyciu stałego, tworzonego przez ludzi zbioru kodów. |
| Synteza | Grupowanie, ujawnianie wzorców międzyuczestniczących, tworzenie pierwszej narracji | Myli częstotliwość z ważnością; łagodzi zdanie niezgadzającego się uczestnika | Tylko wersja robocza. Każdy motyw jest sprawdzany pod kątem kodu źródłowego przed wysyłką. |
| Ciągła analiza sprzężenia zwrotnego | Recenzje w App Store, zgłoszenia do pomocy technicznej, dosłowne raporty NPS, logi czatów o głośności, której żaden zespół nie jest w stanie odczytać ręcznie | Ocena sentymentu źle odczytuje sarkazm i pośredniość kulturową | Wysokiej jakości automatyzacja z kontrolą próbek. |
| Budynek artefaktów | Persony, mapy podróży, drzewa możliwości na podstawie zweryfikowanych danych wejściowych | Tworzy wiarygodne artefakty na podstawie słabych lub nieistniejących dowodów | Tylko na podstawie zweryfikowanych badań, nigdy na podstawie wiedzy o świecie, jaką posiada model. |
Dwa wiersze w tej tabeli są warte więcej niż wszystkie pozostałe razem wzięte.
Kodowanie na dużą skalę. Jeśli masz książkę kodową napisaną przez człowieka, konsekwentne stosowanie jej w 40 transkryptach to dokładnie ten rodzaj żmudnej, opartej na regułach pracy, w której modele są niezawodne. To właśnie na tym etapie przypada większość odzyskiwalnego czasu.
Ciągła analiza sprzężenia zwrotnego. Większość firm korzysta z tysięcy recenzji w sklepach z aplikacjami, zgłoszeń do pomocy technicznej i fragmentów ankiet, których nikt nie przeczytał od momentu ich pojawienia się. To najbardziej rentowne i najmniej ryzykowne zastosowanie sztucznej inteligencji w całej branży, ponieważ nie zastępuje ono prowadzonych badań, a jedynie odczytuje dane, które były odrzucane. Omawiamy to szczegółowo w… Jak sztuczna inteligencja może przekształcić opinie użytkowników w praktyczne informacje o produkcie.
Cztery tryby awarii, które stale wykrywamy
To nie są teoretyczne ryzyka. To konkretne rzeczy, które idą nie tak w rzeczywistych projektach, w kolejności malejącej, w zależności od częstotliwości ich występowania.
1. Częstotliwość maskująca się jako ważność
Poproś model o podsumowanie dwudziestu wywiadów, a wyeksponuje on to, co było najczęściej powtarzane. Jednak wartość badawcza zazwyczaj nie tkwi w odpowiedzi modalnej. Chodzi o jednego uczestnika, który całkowicie porzucił dany etap, dwóch, którzy niezależnie opisali to samo obejście, lub o segment, który nigdy nie dotarł do etapu omawianego przez wszystkich pozostałych.
Model podsumowujący badanie płatności pokaże, że transparentność kosztów wysyłki pojawiała się wielokrotnie. Nie powie Ci jednak, że jedyni dwaj uczestnicy, którzy dokonali zakupu, byli już zalogowani — co jest faktycznym wynikiem i pojawia się w korpusie jedynie jako nieobecność.
Nasze sprawdzenie: Pytamy wprost o stanowisko mniejszości. „Który uczestnik nie zgadzał się z wyłaniającym się konsensusem i co powiedział?”. Jeśli model nie potrafi wskazać żadnego, podsumowanie traktujemy jako niekompletne, a nie jako dowód zgody.
2. Płynna inwencja
Modele generują cytaty, które brzmią dokładnie tak, jak coś, co powiedziałby uczestnik, przypisane uczestnikowi, który tego nie powiedział. Nieczęsto. Dość często. A błąd jest niewidoczny po bliższym przyjrzeniu się, ponieważ sfabrykowany cytat czyta się lepiej niż prawdziwy – prawdziwi ludzie mówią fragmentami.
Nasze sprawdzenie: Każdy cytat, który trafia do klienta, zawiera odnośnik do transkryptu i znacznik czasu. Jeśli nie można go znaleźć w źródłowym pliku audio, nie jest on wysyłany. To mechaniczna zasada, a nie decyzja, ponieważ to właśnie ocena jest tutaj tym, co zawodzi.
3. Synteza pochlebcza
Podaj modelowi swoją hipotezę, a następnie dane, a synteza ją potwierdzi. Podaj te same dane z hipotezą przeciwną, a synteza ją potwierdzi. To najdroższy sposób na uniknięcie awarii w kontekście doradztwa, ponieważ generuje dokładnie taki produkt, jakiego oczekiwał klient, jednocześnie niwecząc powód, dla którego cię zatrudnił.
Nasze sprawdzenie: Monity syntezy nigdy nie zawierają hipotezy. Model otrzymuje korpus i pytanie badawcze, nic więcej. Kiedy chcemy przetestować hipotezę, uruchamiamy ją jako osobne, antagonistyczne przejście: „znajdź najsilniejsze dowody w tym korpusie”. przed następujące roszczenie."
4. Użytkownicy syntetyczni
Najpewniej promowane i najmniej obronione zastosowanie: generowanie symulowanych uczestników i przeprowadzanie z nimi wywiadów zamiast z ludźmi. Szybko generuje wiarygodne transkrypty, a problem tkwi właśnie w wiarygodności. Model wytrenowany w internecie powie Ci, jaką personę… brzmi jak, co stanowi podsumowanie tego, jak takie osoby są opisywane — a nie tego, jak się zachowują, gdy walidacja formularza odrzuca ich adres przy trzeciej próbie.
Użytkownicy syntetyczni są przydatni do jednego celu: do przećwiczenia przewodnika do dyskusji, zanim poświęcisz mu czas, by zaangażować w niego prawdziwego uczestnika. Wykorzystujemy ich właśnie do tego. Nie używamy ich jako dowodów i nie przedstawiamy ich wyników jako wyników badań. Jeśli dostawca oferuje Ci program badawczy bez udziału ludzi, sprzedaje Ci bardzo drogi sposób na potwierdzenie tego, w co już wierzysz.
Nasz protokół roboczy
To jest rzeczywista, a nie wyidealizowana sekwencja.
1. Ludzie jako pierwsi piszą księgę kodową. Zanim jakikolwiek model trafi do transkryptu, badacz czyta od trzech do pięciu wywiadów i ręcznie tworzy ramę kodowania. Ramy pochodzą z danych z tego badania, a nie z ogólnej taksonomii UX. Wszystko, co następuje później, dziedziczy swoją jakość z tego etapu, dlatego nigdy go nie kompresujemy.
2. Model stosuje ramkę i tylko ramkę. Stała książka kodowa, brak nowych kategorii w trakcie przebiegu. Gdy model napotka element, którego ramka nie obejmuje, oznacza go jako niesklasyfikowany, zamiast wymuszać dopasowanie. Stos niesklasyfikowanych elementów jest często najciekawszym wynikiem całego przebiegu.
3. Zakoduj podwójnie próbkę 15%. Te same transkrypty są kodowane niezależnie przez człowieka i model, a my mierzymy wskaźnik niezgodności. Poniżej 10% i kontynuujemy. Powyżej 20% – błędny jest kodownik, a nie model – wracamy do kroku pierwszego. Wskaźnik niezgodności jest diagnozą ramy i traktowanie go w ten sposób pozwoliło nam zaoszczędzić więcej niż traktowanie go jako bramki jakościowej w narzędziu.
4. Projekt syntezy bez hipotezy w zadaniu. Model otrzymuje korpus i pytanie badawcze. Tworzy klastry i pierwszą narrację.
5. Przepustka umożliwiająca śledzenie. Każde roszczenie w projekcie jest powiązane z co najmniej dwoma uczestnikami i opatrzone znacznikami czasu. Roszczenia, których nie można zlokalizować, są usuwane, a nie łagodzone. Roszczenie poparte przez dokładnie jednego uczestnika jest oznaczane jako pojedyncza obserwacja, co jest uzasadnione i często cenne w raportowaniu — ale nie jako temat.
6. Triangulacja na podstawie danych behawioralnych. Zachowania deklarowane i obserwowane stale się rozchodzą. Porównujemy wyniki wywiadów z nagraniami sesji i danymi z map cieplnych – kliknięciami wściekłości, martwymi kliknięciami, punktami odejścia – zanim cokolwiek dotrze do klienta. Kiedy uczestnicy twierdzą, że filtr działa dobrze, a nagrania pokazują, że go porzucają, nagrania wygrywają. To właśnie w tym miejscu badania jakościowe oparte na sztucznej inteligencji są najczęściej wyłapywane, ponieważ dane behawioralne nie mają znaczenia dla spójności narracji.
7. Rekomendację pisze człowiek. Wnioski można zebrać z pomocą. Co z nimi zrobić w tej organizacji, z tymi ograniczeniami i tym planem działania, to decyzja podjęta przez osobę, która uczestniczyła w wywiadach.
Czego nie automatyzujemy
Krótka lista, której się mocno trzymamy.
- Moderowanie wywiadów z użytkownikami wrażliwymi i zestresowanymi. Opieka zdrowotna, trudności finansowe, badania nad dostępnością. Obowiązki moderatora w tym obszarze to częściowo obowiązek opieki, którego nie można delegować.
- Zalecenie. Zobacz krok siódmy.
- Ocena dostępności. Zautomatyzowane narzędzia — w tym nasze własne Narzędzie audytu WCAG — wykrywa około jednej trzeciej problemów WCAG. Pozostałe wymagają ręcznego testowania z wykorzystaniem technologii wspomagających. Każdy dostawca deklarujący pełną automatyzację opisuje skanowanie, a nie audyt.
- Podejmowanie decyzji, czego nie badać. Określanie zakresu to proces, w którym powstaje lub ulega zniszczeniu większość wartości badań. Jest to strategiczna rozmowa, a nie zadanie podsumowujące.
Notatka na temat badań w języku tureckim
Większość opublikowanych wytycznych dotyczących badań wspomaganych sztuczną inteligencją jest napisana i zweryfikowana w języku angielskim, a różnica w wynikach jest faktem i rzadko omawiana.
Transkrypcja turecka wyraźnie pogarsza się w przypadku nazw marek, żargonu branżowego i przełączania kodów z języka angielskiego na turecki, co jest całkowicie normalne w zespołach ds. produktów i e-commerce w Stambule. Klasyfikacja sentymentalna słabo radzi sobie z turecką pośredniością – uprzejme zastrzeżenie poprzedzające poważną skargę często odbierane jest jako neutralne lub pozytywne przez klasyfikator wyszkolony głównie w języku angielskim. Morfologia aglutynacyjna oznacza również, że metody oparte na częstotliwości słów kluczowych w przypadku danych z ankiet otwartych są zaniżane, ponieważ pojedyncze pojęcie pojawia się w kilkunastu formach odmienionych, które tokenizator traktuje jako niepowiązane.
Praktyczne konsekwencje: zwiększ częstotliwość doraźnej kontroli transkrypcji powyżej 10%, którego użyłbyś dla języka angielskiego, nigdy nie polegaj na automatycznym pomiarze sentymentu jako samodzielnym sygnale w korpusach języka tureckiego i waliduj każdy klasyfikator na ręcznie oznakowanej próbce języka tureckiego, zanim zaufasz jego wynikom na poziomie wolumenu. Właśnie z tego powodu uruchamiamy własny zestaw walidacyjny.
Jak sprawdzić, czy działa
Prędkość to błędny miernik. Wszyscy stają się szybsi; pytanie brzmi, czy wynik przetrwa kontakt z rzeczywistością. Trzy wskaźniki, które faktycznie śledzimy:
Wskaźnik przeżycia wglądu. Jaka część ustaleń zawartych w raporcie badawczym nadal uznawana była za ważną po sześciu miesiącach? Trudno to zmierzyć, ale warto znieść ten dyskomfort.
Współczynnik rozbieżności między modelem ludzkim a modelem. Od kroku trzeciego powyżej. Śledź to w czasie. Rosnące rozbieżności zazwyczaj oznaczają, że dziedzina badań uległa zmianie, a kodeks pozostał.
Czas od ostatniego wywiadu do pierwszej sprawdzalnej hipotezy. To jest liczba, którą AI rzeczywiście osiąga. Jeśli synteza kiedyś zajmowała osiem dni, a teraz dwa, to oznacza to dwa dodatkowe cykle eksperymentów na kwartał – co jest rzeczywistym uzasadnieniem biznesowym i jest dobre. Po prostu nie jest tak, jak twierdzi większość dostawców.
Idąc głębiej
Niniejszy artykuł stanowi przegląd. Cztery artykuły towarzyszące szczegółowo opisują poszczególne etapy:
- Tworzenie profili użytkowników opartych na danych za pomocą sztucznej inteligencji — tworzenie artefaktów osobowości na podstawie zweryfikowanych dowodów, a nie modeli a priori
- Od danych do decyzji: jak sztuczna inteligencja może usprawnić syntezę badań użytkowników — etap syntezy w szczegółach
- Jak sztuczna inteligencja może przekształcić opinie użytkowników w praktyczne informacje o produkcie — recenzje, bilety i dosłowne wyniki NPS na dużą skalę
- Usprawnianie odkrywania produktów dzięki badaniom użytkowników opartym na sztucznej inteligencji — stosując wszystko w ramach cyklu odkrywania
PYTANIA I ODPOWIEDZI
Czy sztuczna inteligencja może całkowicie zastąpić wywiady z użytkownikami? Nie. Może zastąpić część pracy związanej z wywiadami – transkrypcję, kodowanie, syntezę wstępną – i pomóc w przygotowaniu lepszych wywiadów. Nie może generować dowodów na temat zachowań ludzi, ponieważ nie ma do nich dostępu. Symulowani uczestnicy mówią, jak takie osoby są opisane w tekście, co jest zupełnie inną i często mylącą kwestią.
Ile czasu faktycznie oszczędzają badania wspomagane sztuczną inteligencją? Z naszego doświadczenia wynika, że oszczędności koncentrują się niemal wyłącznie na syntezie i kodowaniu, gdzie są znaczące. Prace terenowe, rekrutacja i koordynacja z interesariuszami pozostają niezmienione. Realistycznym oczekiwaniem w przypadku badania moderowanego jest to, że faza po zakończeniu prac terenowych ulegnie znacznemu skróceniu, podczas gdy całkowity czas trwania projektu skróci się w znacznie mniejszym stopniu — ponieważ prace terenowe zawsze były najdłuższym biegunem.
Czy użytkownicy syntetyczni są kiedykolwiek legalni? Jako narzędzie do ćwiczeń w przewodnikach do dyskusji i jako sposób na testowanie sformułowań w ankietach – tak. Jako dowód w wynikach badań – nie. Ważne jest rozróżnienie: jedno to pomoc w przygotowaniu, drugie to sfabrykowane dane z etykietą badawczą.
Jakie jest największe ryzyko? Pewne, płynne, błędne wyniki – a konkretnie ta wersja, która zgadza się z tym, w co zespół już wierzył. Sfabrykowane cytaty są wychwytywane przez reguły identyfikowalności. Synteza pochlebcza jest trudniejsza, ponieważ prowadzi do rezultatu, z którego wszyscy są zadowoleni. Jedyną skuteczną obroną jest oddzielenie hipotezy od syntezy i przeprowadzenie jawnego testu kontradyktoryjnego.
Czy badania wspomagane sztuczną inteligencją działają równie dobrze w języku tureckim? Nie od razu. Dokładność transkrypcji, klasyfikacja sentymentów i metody częstotliwości słów kluczowych są gorsze w języku tureckim niż angielskim. Jest to użyteczne i używamy go codziennie, ale wymaga wyższego współczynnika próbkowania, sprawdzonych klasyfikatorów i badacza znającego język.
Chcesz uzyskać drugą opinię na temat swojego procesu badawczego?
Jeśli prowadzisz badania wspomagane sztuczną inteligencją i chcesz wiedzieć, czy wyniki Twoich badań przetrwają kontrolę — lub zastanawiasz się, co zautomatyzować, a co chronić — przeanalizujemy Twój obecny proces i jasno poinformujemy Cię, gdzie leży ryzyko.






