Tekoäly käyttäjätutkimuksessa: Mikä toimii, mikä epäonnistuu ja missä vedämme rajan

Tekoäly käyttäjätutkimuksessa: Mikä toimii, mikä epäonnistuu ja missä vedämme rajan

Pullonkaula ei koskaan ollut haastattelu

Jokainen tekoälyä ja käyttäjätutkimusta käsittelevä artikkeli alkaa samalla tavalla: tutkimus on hidasta, tekoäly tekee siitä nopeaa. Tämä muotoilu ei ole väärin, mutta se on niin epätarkka, että siitä on hyötyä, kun maanantaiaamuna päätetään, mitä oikeasti muutetaan.

Tässä on tarkempi versio. Moderoidun haastattelun tekeminen kestää kuusikymmentä minuuttia ja tulee aina kestämään, koska henkilön on puhuttava kuusikymmentä minuuttia. Se, mikä ennen kesti neljä päivää, oli kaikkea... noin se — litterointi, merkitseminen, sen hetken löytäminen, jossa kolme osallistujaa sanoi saman asian kolmella eri sanastolla, ja tämän muuttaminen joksikin, mihin tuotepäällikkö voisi ryhtyä ennen sprintin päättymistä.

Siihen se aika meni, ja juuri siinä kielimallit ovat vahvoja. Ne ovat tekstin yhteensovittajia. Tutkimussynteesi on tekstin yhteensovittamisongelma. Sopivuus on todellinen.

Mutta sama ominaisuus, joka tekee niistä hyviä synteesissä, tekee niistä siinä vaarallisia. Malli, joka löytää malleja, löytää malleja riippumatta siitä, onko niitä olemassa vai ei, ja se kuvaa keksimänsä mallit täsmälleen samalla varmalla rekisterillä kuin olemassa olevat mallit. Tutkimuksessa varma väärä teema on pahempi kuin ei teemaa ollenkaan, koska väärä teema rakentuu.

Joten kysymys ei ole onko käyttää tekoälyä käyttäjätutkimuksessa. Kaikki tekevät niin jo. Kysymys kuuluu, mitkä prosessin osat luovutat muille, mitä tarkistat ennen kuin luotat tulokseen ja mitä kieltäydyt automatisoimasta lainkaan. Tästä tässä artikkelissa on kyse.

Missä tekoäly todella ansaitsee paikkansa

Kartoitamme tekoälyn tutkimusprosessia vasten vaihe vaiheelta sen sijaan, että käsittelisimme sitä yhtenä päätöksenä. Eri vaiheilla on hyvin erilaiset riskiprofiilit.

VaiheMitä tekoäly tekee hyvinMikä siinä menee pieleenMeidän sääntömme
Rekrytointi ja seulontaSeulontakyselyiden laatiminen, ristiriitaisten vastausten havaitseminen seulontakyselyn vastauksissa, todennäköisten ammattimaisten vastaajien merkitseminenYlisuodattaa selkeästi äänteleviä osallistujia; seuloo pois turhautuneet käyttäjät, joita eniten tarvitsetVain avustaja. Ihminen hyväksyy lopullisen paneelin.
KeskusteluopasTutkimuskysymyksen pohjalta ensimmäisen luonnoksen luominen, jatkokysymysten ehdottaminen, johdattelevien kysymysten tarkistaminenTuottaa yleisiä oppaita, jotka testaavat jo tunnettuaLuonnoskiihdytin. Tutkija kirjoittaa uudelleen ainakin puolet.
EsitysReaaliaikainen muistiinpanojen tekeminen, reaaliaikainen tägäys, luotainten ehdottaminen ihmismoderaattorilleEi pysty lukemaan epäröintiä, epämukavuutta tai taukoa ennen kohteliasta valhettaEi koskaan autonominen. Tukityökalu ihmismoderaattorille.
TranscriptionKaiuttimien erottelu, aikaleimaus, ensimmäisen kierroksen puhdistusTurkin kielen transkription tarkkuus laskee jyrkästi verkkotunnusjargonin, tuotemerkkien ja koodinvaihdon vuoksiAutomatisoi ja tarkista sitten 10 % äänitiedostoista pistokokein.
Koodaus ja taggausOlemassa olevan koodikirjan soveltaminen johdonmukaisesti satoihin transkripteihin nopeastiUusien koodien keksiminen korpusten keskellä; erillisten ongelmien tiivistäminen yhdeksi mukavaksi nimikkeeksiAutomatisoi kiinteällä, ihmisen kirjoittamalla koodikirjalla.
SynteesiKlusterien muodostaminen, osallistujien välisten kuvioiden esiin nostaminen, ensimmäisen narratiivin laatiminenSekoittaa tiheyden tärkeyteen; tasoittaa eri mieltä olevan osallistujan huomionVain luonnos. Jokainen teema jäljitetään lähdekoodiin asti ennen julkaisua.
Jatkuva palautteen analysointiSovelluskauppa-arvostelut, tukipyynnöt, NPS-selvitykset, keskustelulokit niin suurella volyymilla, ettei tiimi pysty lukemaan niitä manuaalisesti.Tunnepisteytys tulkitsee sarkasmia ja kulttuurista epäsuoraa luonnetta huonostiArvokasta automaatiota otantatarkastuksilla.
Artefaktien rakentaminenPersoonia, asiakaspolkuja ja mahdollisuuspuita validoitujen syötteiden pohjaltaTuottaa uskottavia artefakteja ohuista tai puuttuvista todisteistaVain todennetusta tutkimuksesta, ei koskaan mallin maailmantietämyksestä.

Kaksi riviä tuossa taulukossa on arvokkaampia kuin muut yhteensä.

Koodaus skaalautuvasti. Jos sinulla on ihmisen kirjoittama koodikirja, sen johdonmukainen soveltaminen 40 transkriptiin on juuri sellaista työlästä, sääntöjä noudattavaa työmallia, johon luotettavasti pystytään. Suurin osa palautettavasta ajasta itse asiassa kuluu juuri tässä.

Jatkuva palautteen analysointi. Useimmat yritykset käyttävät tuhansia sovelluskauppojen arvosteluja, tukipyyntöjä ja kyselyvastauksia, joita kukaan ei ole lukenut niiden ilmestymisen jälkeen. Tämä on tekoälyn tuottoisin ja riskialttein käyttötapa koko alalla, koska et korvaa jo tehtyä tutkimusta – luet dataa, joka heitettiin pois. Käsittelemme tätä perusteellisesti… Kuinka tekoäly voi muuntaa käyttäjäpalautteen toimiviksi tuotenäkemyksiksi.

Neljä vikaantumistapaa, joita jatkuvasti havaitsemme

Nämä eivät ole teoreettisia riskejä. Ne ovat konkreettisia asioita, jotka menevät pieleen todellisissa projekteissa, suurin piirtein laskevassa järjestyksessä sen mukaan, kuinka usein ne havaitaan.

1. Tiheyden naamiointi tärkeydeksi

Pyydä mallia tiivistämään kaksikymmentä haastattelua, niin se tuo esiin useimmin sanotut asiat. Tutkimuksen arvo ei kuitenkaan yleensä ole modaalisessa vastauksessa. Se on siinä, että yksi osallistuja hylkäsi haastatteluprosessin kokonaan, tai kahdessa, jotka kuvasivat saman kiertotien toisistaan ​​riippumatta, tai siinä segmentissä, joka ei koskaan päässyt vaiheeseen, josta kaikki muut keskustelivat.

Kassatutkimusta yhteenvedon tekevä malli kertoo, että toimituskulujen läpinäkyvyys nousi esiin toistuvasti. Se ei kerro, että ainoat kaksi ostoksen suorittanutta osallistujaa olivat molemmat jo kirjautuneina sisään – mikä on varsinainen löydös ja näkyy korpuksessa vain poissaolona.

Meidän tarkistuksemme: Kysymme eksplisiittisesti vähemmistön kantaa. "Kuka osallistuja oli eri mieltä syntyneestä konsensuksesta ja mitä hän sanoi?" Jos malli ei pysty nimeämään yhtäkään, käsittelemme yhteenvetoa epätäydellisenä sen sijaan, että se olisi todiste yhteisymmärryksestä.

2. Sujuva keksiminen

Mallit tuottavat lainauksia, jotka kuulostavat täsmälleen samalta kuin jokin osallistujan sanoma, mutta jotka liitetään osallistujaan, joka ei sanonut sitä. Ei usein. Tarpeeksi usein. Ja epäonnistuminen on näkymätöntä tarkastelussa, koska keksitty lainaus on parempi kuin oikea – oikeat ihmiset puhuvat katkelmina.

Meidän tarkistuksemme: Jokaisessa asiakaspakille päätyvässä lainauksessa on transkriptioviite ja aikaleima. Jos lainausta ei löydy lähdeäänitiedostosta, sitä ei lähetetä. Tämä on mekaaninen sääntö, ei harkintakykyä vaativa vaatimus, koska juuri harkintakyky epäonnistuu tässä.

3. Sykofanttinen synteesi

Anna mallille hypoteesisi ja sitten datasi, niin synteesi tukee hypoteesiasi. Anna sama data vastakkaisella hypoteesilla, niin synteesi tukee sitä. Tämä on kallein yksittäinen epäonnistumisen tila konsultointikontekstissa, koska se tuottaa juuri sen tuotoksen, jota asiakas halusi, mutta tuhoaa samalla syyn, miksi he palkkasivat sinut.

Meidän tarkistuksemme: Synteesitehtävät eivät koskaan sisällä hypoteesia. Malli saa korpuksen ja tutkimuskysymyksen, ei mitään muuta. Kun haluamme testata hypoteesia, ajamme sen erillisenä, vastakkainasetteluisena vaiheena: "löydä vahvin näyttö tästä korpuksesta" vastaan seuraava väite."

4. Synteettiset käyttäjät

Luotettavimmin markkinoitu ja vähiten puolusteltava sovellus: simuloitujen osallistujien luominen ja heidän haastatteleminen ihmisten sijaan. Se tuottaa uskottavia transkriptioita nopeasti, ja juuri uskottavuus on ongelma. Internetissä koulutettu malli kertoo, mitä persoona... kuulostaa, joka on yhteenveto siitä, miten tällaisista ihmisistä kirjoitetaan – ei siitä, miten he käyttäytyvät, kun lomakkeen vahvistus hylkää heidän osoitteensa kolmannella yrityksellä.

Synteettiset käyttäjät ovat hyödyllisiä yhdestä asiasta: keskusteluoppaan harjoitteluun ennen kuin käytät siihen oikean osallistujan. Me käytämme heitä siihen tarkoitukseen. Emme käytä heitä todisteena emmekä raportoi heidän tuotoksiaan tutkimustuloksina. Jos toimittaja tarjoaa sinulle tutkimusohjelmaa, jossa ei ole ihmisosallistujia, he myyvät sinulle erittäin kalliin tavan vahvistaa jo olemassa olevat uskomuksesi.

Työskentelyprotokollamme

Tämä on todellinen järjestys, ei idealisoitu.

1. Ihmiset kirjoittavat koodikirjan ensin. Ennen kuin mikään malli koskettaa transkriptiota, tutkija lukee kolmesta viiteen haastattelua ja rakentaa koodauskehyksen käsin. Kehys on peräisin tämän tutkimuksen datasta, ei yleisestä käyttökokemustaksonomiasta. Kaikki myöhemmässä vaiheessa perii laatunsa tästä vaiheesta, minkä vuoksi emme koskaan pakkaa sitä.

2. Malli soveltaa kehystä ja vain kehystä. Korjattu koodikirja, ei uusia kategorioita kesken ajon. Kun malli kohtaa jotain, mitä viitekehys ei kata, se merkitsee sen luokittelemattomaksi sen sijaan, että pakottaisi sovituksen. Luokittelematon pino on usein koko ajon mielenkiintoisin tuloste.

3. Kaksoiskoodaa 15 %:n otos. Ihminen ja malli koodaavat samat transkriptit erikseen, ja mittaamme erimielisyysprosentin. Alle 10 %:n arvolla jatkamme. Yli 20 %:n arvolla koodikirja on väärä, ei malli – palaamme vaiheeseen yksi. Erimielisyysprosentti on diagnostiikka kehykselle, ja sen käsittely tällä tavalla on säästänyt meiltä enemmän rahaa kuin sen käsittely työkalujen laatuporttina.

4. Synteesiluonnos ilman hypoteesia kehotteessa. Malli saa korpusta ja tutkimuskysymyksen. Se tuottaa klustereita ja ensimmäisen narratiivin.

5. Jäljitettävyystodistus. Jokainen luonnoksen vaatimus linkitetään vähintään kahteen osallistujaan aikaleimoilla. Jäljittämättömät väitteet poistetaan, niitä ei pehmennetä. Täsmälleen yhden osallistujan tukema vaatimus merkitään yhdeksi havaituksi, mikä on oikeutettu ja usein arvokas raportoitava asia – mutta ei teemana.

6. Triangulaatio käyttäytymisdataa vasten. Ilmoitettu ja havaittu käyttäytyminen eroavat jatkuvasti toisistaan. Tarkistamme haastattelutulokset haastattelujen tallenteita ja lämpökarttatietoja vasten – raivoklikkauksia, kuolleita klikkauksia ja pudotuspisteitä – ennen kuin mitään päätyy asiakkaalle. Kun osallistujat sanovat, että suodatin on kunnossa, ja tallenteet osoittavat heidän hylkäävän suodattimen, tallenteet voittavat. Tässä kohtaa tekoälypohjainen laadullinen työ todennäköisimmin jää huomaamatta, koska käyttäytymisdata ei välitä siitä, kuinka johdonmukainen narratiivi oli.

7. Ihminen kirjoittaa suosituksen. Löydökset voidaan koota avustetusti. Se, mitä niille tehdään tässä organisaatiossa, näillä rajoituksilla ja tällä etenemissuunnitelmalla, on haastatteluihin osallistuneen henkilön harkinnan varassa.

Mitä emme automatisoi

Lyhyt lista, ja pidämme siitä tiukasti kiinni.

  • Haavoittuvien tai ahdistuneiden käyttäjien haastattelujen moderointi. Terveydenhuolto, taloudelliset vaikeudet, esteettömyystutkimus. Moderaattorin työ siellä on osittain huolenpitovelvollisuutta, eikä sitä voi delegoida.
  • Suositus. Katso vaihe seitsemän.
  • Saavutettavuuden arviointi. Automatisoidut työkalut – mukaan lukien omamme WCAG-tarkastustyökalu — havaitsee noin kolmanneksen WCAG-ongelmista. Loput vaativat manuaalista testausta avustavan teknologian avulla. Jokainen toimittaja, joka väittää täyden automaattisen kattavuuden, kuvailee skannausta, ei auditointia.
  • Päätös siitä, mitä ei tutkita. Tutkimuksen laajuuden määrittelyssä luodaan tai tuhotaan eniten arvoa, ja se on strateginen keskustelu, ei yhteenvetotehtävä.

Huomautus turkinkielisestä tutkimuksesta

Suurin osa tekoälyavusteisesta tutkimuksesta julkaistuista ohjeista on kirjoitettu ja validoitu englanniksi, ja suorituskykyero on todellinen ja siitä on keskusteltu liian vähän.

Turkin transkriptio heikkenee huomattavasti tuotemerkkien, toimialajargonin ja Istanbulin tuote- ja verkkokauppatiimeissä täysin normaalin englanti-turkki-koodinvaihdon yhteydessä. Tunneluokittelu käsittelee turkin epäsuoraa luonnetta huonosti – vakavaa valitusta edeltävä kohtelias suojaus tulkitaan usein neutraaliksi tai positiiviseksi pääasiassa englannin kielen käyttöön koulutetulle luokittelijalle. Agglutinatiivinen morfologia tarkoittaa myös sitä, että avainsanojen frekvenssimenetelmät avoimessa kyselyaineistossa aliarvioivat merkittävästi, koska yksi käsite esiintyy kymmenessä taivutetussa muodossa, jota tokenisoija käsittelee toisiinsa liittymättömänä.

Käytännön seuraukset: nosta transkriptiosi pistokoetarkistusten määrää yli englannin kielen tarkistusten 10 prosentin, älä koskaan luota automaattiseen sentimenttiin itsenäisenä signaalina turkkilaisissa korpusissa ja validoi mikä tahansa luokittelija käsin merkityllä turkkilaisella otoksella ennen kuin luotat sen tuotokseen suurella volyymilla. Suoritamme oman validointisarjamme juuri tästä syystä.

Mistä tietää, toimiiko se

Nopeus on väärä mittari. Kaikki nopeutuvat; kysymys kuuluu, selviääkö tulos kosketuksesta todellisuuteen. Kolme mittaria, joita itse asiassa seuraamme:

Insightin selviytymisaste. Kuinka monta prosenttia tutkimusraportin tuloksista pidettiin edelleen pätevinä kuusi kuukautta myöhemmin? Tämän mittaaminen on epämukavaa, mutta se on jokaisen vaivan arvoista.

Ihmisen ja mallin erimielisyyksien määrä. Yllä olevasta vaiheesta kolme. Seuraa sitä ajan kuluessa. Kasvava erimielisyys tarkoittaa yleensä, että tutkimusalue on muuttunut, mutta koodikirja ei.

Aika viimeisestä haastattelusta ensimmäiseen testattavaan hypoteesiin. Tämä on tekoälyn todellisuudessa siirtämä määrä. Jos synteesi kesti ennen kahdeksan päivää ja nyt kaksi, se tarkoittaa kahta ylimääräistä kokeilujaksoa vuosineljännestä kohden – mikä on todellinen liiketoimintatapaus, ja se on hyvä. Useimmat toimittajat eivät vain tee niin.

Syvemmälle meneminen

Tämä artikkeli on yleiskatsaus. Neljä rinnakkaista artikkelia käsittelevät yksittäisiä vaiheita yksityiskohtaisesti:

Usein kysyttyjä kysymyksiä

Voiko tekoäly korvata käyttäjähaastattelut kokonaan? Ei. Se voi korvata osan haastatteluihin liittyvästä työstä – transkription, koodauksen, ensikierron synteesin – ja se voi auttaa sinua valmistamaan parempia haastatteluja. Se ei voi tuottaa näyttöä ihmisten käyttäytymisestä, koska sillä ei ole pääsyä heidän käyttäytymiseensä. Simuloidut osallistujat kertovat sinulle, miten tällaisia ​​ihmisiä kuvaillaan tekstissä, mikä on eri asia ja usein harhaanjohtava.

Kuinka paljon aikaa tekoälyllä avustettu tutkimus todellisuudessa säästää? Kokemuksemme mukaan säästö keskittyy lähes kokonaan synteesiin ja koodaukseen, joissa se on huomattavaa. Kenttätyö, rekrytointi ja sidosryhmien yhteensovittaminen pysyvät ennallaan. Realistinen odotus moderoidulle tutkimukselle on, että kenttätyön jälkeinen vaihe supistuu huomattavasti, kun taas projektin kokonaiskesto lyhenee paljon vähemmän – koska kenttätyö oli aina pitkällä tähtäimellä.

Ovatko synteettiset käyttäjät koskaan laillisia? Keskusteluoppaiden harjoitusvälineenä ja kyselyn sanamuotojen testauskeinona kyllä. Tutkimustuloksen todisteena ei. Erottelulla on merkitystä: toinen on valmisteluapuväline, toinen on tutkimusleimalla varustettua keksittyä dataa.

Mikä on suurin riski? Varma, sujuva, väärä tuotos – ja erityisesti se versio siitä, joka on yhdenmukainen tiimin jo uskomusten kanssa. Keksinnölliset lainaukset jäävät jäljitettävyyssääntöjen kohteeksi. Mielikuvitusrikkoinen synteesi on vaikeampaa, koska se tuottaa tuotoksen, johon kaikki ovat tyytyväisiä. Ainoa luotettava puolustus on hypoteesin erottaminen synteesikehotteesta ja eksplisiittisen vastakkainasettelun suorittaminen.

Toimiiko tekoälyllä avustettu tutkimus yhtä hyvin turkiksi? Ei suoraan paketista. Transkription tarkkuus, asenteiden luokittelu ja avainsanojen ja frekvenssien vertailumenetelmät heikkenevät kaikki turkin kielellä verrattuna englantiin. Se on käyttökelpoinen ja käytämme sitä päivittäin, mutta se vaatii suurempia näytteenottotaajuuksia, validoituja luokittelijoita ja tutkijan, joka osaa kieltä.

Haluatko toisen mielipiteen tutkimusprosessistasi?

Jos suoritat tekoälyavusteista tutkimusta ja haluat tietää, kestävätkö löydöksesi tarkastelun – tai olet päättämässä, mitä automatisoida ja mitä suojata – tarkistamme nykyisen prosessisi ja kerromme sinulle selkeästi, missä riski sijaitsee.

 


Çağdaş Polat

Kirjoittanut

Çağdaş Polat

Çağdaş Polat on Switasin toinen perustaja, ja hän johtaa teknologia- ja kasvukonsultointia brändeille verkkokaupassa, matkailussa, terveydenhuollossa ja julkisella sektorilla. Tietojenkäsittelytieteen tutkinnon suorittanut Polat siirtyi ohjelmistokehityksestä markkinoinnin, tuotekehityksen ja strategian vanhempiin tehtäviin viimeisen vuosikymmenen aikana. Nykyään hän neuvoo yrityksiä CRO:ssa, analytiikassa ja kasvujärjestelmien rakentamisessa, jotka kestävät mittaamisen.

LinkedIn

Aiheeseen liittyvät artikkelit

Switas Kuten nähty

Magnify: Vaikuttajamarkkinoinnin skaalaaminen Engin Yurtdakulin avulla

Tutustu Microsoft Clarity -tapaustutkimukseemme

Nostimme esiin Microsoft Clarityn tuotteena, joka on rakennettu käytännönläheisiä, tosielämän käyttötapauksia silmällä pitäen oikeiden tuoteihmisten toimesta, jotka ymmärtävät Switasin kaltaisten yritysten kohtaamia haasteita. Ominaisuudet, kuten raivoklikkaukset ja JavaScript-virheiden seuranta, osoittautuivat korvaamattomiksi käyttäjien turhautumisen ja teknisten ongelmien tunnistamisessa, mikä mahdollisti kohdennetut parannukset, jotka vaikuttivat suoraan käyttökokemukseen ja konversiolukuihin.