Il collo di bottiglia non è mai stato il colloquio
Ogni articolo sull'intelligenza artificiale e la ricerca sugli utenti inizia allo stesso modo: la ricerca è lenta, l'IA la velocizza. Questa impostazione non è sbagliata, ma è talmente imprecisa da risultare inutile quando si tratta di decidere cosa cambiare concretamente il lunedì mattina.
Ecco la versione più accurata. Condurre un'intervista moderata richiede sessanta minuti e lo farà sempre, perché una persona deve parlare per sessanta minuti. Ciò che prima richiedeva quattro giorni era tutto circa Si tratta di trascrivere, etichettare, individuare il momento in cui tre partecipanti hanno detto la stessa cosa usando tre vocabolari diversi e trasformare queste informazioni in qualcosa su cui un product manager possa intervenire prima della chiusura dello sprint.
È lì che è finito il tempo, ed è proprio lì che i modelli linguistici eccellono. Sono strumenti di riconoscimento di pattern sul testo. La sintesi della ricerca è un problema di riconoscimento di pattern sul testo. La corrispondenza è reale.
Ma la stessa proprietà che li rende bravi nella sintesi li rende anche pericolosi in questo campo. Un modello che individua schemi li troverà a prescindere dalla loro esistenza, e descriverà quelli che ha inventato con la stessa sicurezza di quelli reali. Nella ricerca, un tema sbagliato, ma ben fondato, è peggio di nessun tema, perché il tema sbagliato viene comunque costruito.
Quindi la domanda non è se Utilizzare l'IA nella ricerca sugli utenti. Ormai tutti lo fanno. La questione è quali parti del processo delegare, cosa verificare prima di fidarsi del risultato e cosa rifiutarsi categoricamente di automatizzare. Questo articolo si propone proprio di affrontare questo argomento.
Dove l'intelligenza artificiale si guadagna davvero il suo posto
Analizziamo l'IA in relazione al processo di ricerca fase per fase, anziché considerarla come una singola decisione. Le diverse fasi presentano profili di rischio molto differenti.
| Stage | Cosa fa bene l'intelligenza artificiale | Cosa sbaglia | La nostra regola |
|---|---|---|---|
| Reclutamento e selezione | Redigere questionari di selezione, individuare risposte contraddittorie nei questionari di selezione, identificare i potenziali partecipanti professionisti. | Filtra eccessivamente i partecipanti eloquenti; esclude gli utenti frustrati di cui hai più bisogno | Solo assistenza. Il pannello finale viene approvato da un essere umano. |
| Guida alla discussione | Generare una prima bozza a partire dalla domanda di ricerca, proporre approfondimenti, verificare la presenza di domande suggestive | Produce guide generiche che mettono alla prova ciò che è già noto | Acceleratore di bozze. Il ricercatore riscrive almeno metà. |
| Moderazione | Appunti in tempo reale, etichettatura in diretta, suggerimenti di approfondimenti a un moderatore umano | Non si riesce a cogliere l'esitazione, il disagio o la pausa prima di una bugia educata. | Mai autonomo. Strumento di supporto per un moderatore umano. |
| Trascrizione | Separazione degli altoparlanti, marcatura temporale, pulizia del primo passaggio | L'accuratezza della trascrizione in turco cala drasticamente in presenza di gergo di settore, nomi di marchi e passaggi di codice. | Automatizza, poi effettua un controllo a campione del 10% confrontandolo con l'audio. |
| Codifica e etichettatura | Applicare un codice di codifica esistente in modo coerente a centinaia di trascrizioni ad alta velocità | Inventare nuovi codici a metà di un corpus; raggruppare problemi distinti in un'unica comoda etichetta | Automatizzare con un manuale di codice fisso, redatto da un essere umano. |
| Sintesi | Raggruppamento, individuazione di modelli tra i partecipanti, stesura della prima narrazione | Confonde la frequenza con l'importanza; minimizza il dissenso del partecipante | Solo bozza. Ogni tema viene tracciato alla fonte prima della pubblicazione. |
| Analisi continua del feedback | Recensioni dell'App Store, ticket di supporto, trascrizioni NPS, registri di chat in quantità tale che nessun team è in grado di leggerli manualmente | L'analisi del sentiment interpreta male il sarcasmo e l'indirettezza culturale. | Automazione di alto valore con controlli a campione. |
| Edificio dell'artefatto | Personas, mappe del percorso utente, alberi delle opportunità da input validati | Produce artefatti plausibili a partire da prove scarse o inesistenti. | Solo da ricerche verificate, mai dalla conoscenza del mondo del modello. |
In quella tabella, due righe valgono più di tutte le altre messe insieme.
Programmazione su larga scala. Se si dispone di un manuale di codifica redatto da un essere umano, applicarlo in modo coerente a 40 trascrizioni è esattamente il tipo di lavoro tedioso e basato sul rispetto delle regole in cui i modelli sono affidabili. È proprio in questo ambito che si concentra la maggior parte del tempo recuperabile.
Analisi continua del feedback. La maggior parte delle aziende si ritrova con migliaia di recensioni sugli app store, ticket di supporto e trascrizioni di sondaggi che nessuno ha letto da quando sono arrivati. Questo è l'utilizzo dell'IA con il più alto rendimento e il minor rischio in tutta la disciplina, perché non si sostituisce la ricerca che era già in corso, ma si leggono dati che venivano scartati. Approfondiamo questo argomento in Come l'intelligenza artificiale può trasformare il feedback degli utenti in informazioni utili sui prodotti.
Le quattro modalità di guasto che continuiamo a rilevare
Non si tratta di rischi teorici. Si tratta di problemi specifici che si verificano nei progetti reali, elencati approssimativamente in ordine decrescente di frequenza con cui li rileviamo.
1. La frequenza mascherata da importanza
Chiedete a un modello di riassumere venti interviste e metterà in evidenza ciò che è stato detto più spesso. Ma il valore della ricerca di solito non risiede nella risposta più frequente. Risiede nel singolo partecipante che ha abbandonato completamente il flusso, o nei due che hanno descritto la stessa soluzione alternativa in modo indipendente, o nel segmento che non è mai arrivato al passaggio di cui tutti gli altri hanno parlato.
Un modello che riassume uno studio sul processo di acquisto vi dirà che la trasparenza dei costi di spedizione è emersa ripetutamente. Non vi dirà però che gli unici due partecipanti che hanno completato l'acquisto erano entrambi già connessi, che è il vero risultato, e che appare nel corpus solo come un'assenza.
Il nostro controllo: Chiediamo esplicitamente la posizione della minoranza. "Quale partecipante non era d'accordo con il consenso emergente e cosa ha affermato?" Se il modello non riesce a indicarne uno, consideriamo il riassunto incompleto anziché come prova di accordo.
2. Invenzione fluida
I modelli producono citazioni che suonano esattamente come qualcosa che un partecipante avrebbe detto, attribuendole a un partecipante che non le ha mai pronunciate. Non spesso. Ma abbastanza spesso. E l'errore è invisibile a un esame più attento, perché una citazione inventata suona meglio di una vera: le persone reali parlano a frammenti.
Il nostro controllo: Ogni citazione che arriva a una presentazione per il cliente riporta un riferimento alla trascrizione e un timestamp. Se non è possibile trovarla nell'audio originale, non viene inviata. Questa è una regola meccanica, non una decisione discrezionale, perché è proprio la discrezionalità che fallisce in questo caso.
3. Sintesi sicofatica
Fornisci a un modello la tua ipotesi e poi i tuoi dati, e la sintesi confermerà la tua ipotesi. Fornisci gli stessi dati con l'ipotesi opposta e la sintesi confermerà quest'ultima. Questo è il tipo di errore più costoso in un contesto di consulenza, perché produce esattamente il risultato desiderato dal cliente, vanificando al contempo il motivo per cui ti ha ingaggiato.
Il nostro controllo: I prompt di sintesi non contengono mai l'ipotesi. Il modello riceve il corpus e la domanda di ricerca, nient'altro. Quando vogliamo testare un'ipotesi, la eseguiamo come un passaggio avversariale separato: "trova le prove più forti in questo corpus contro di la seguente affermazione."
4. Utenti sintetici
L'applicazione più pubblicizzata con sicurezza e meno difendibile: generare partecipanti simulati e intervistarli al posto di persone reali. Produce trascrizioni plausibili in tempi rapidi, e la plausibilità è proprio il problema. Un modello addestrato su internet ti dirà cosa è una persona suona come, che è un riassunto di come vengono descritte queste persone, non di come si comportano quando la convalida del modulo rifiuta il loro indirizzo al terzo tentativo.
Gli utenti virtuali sono utili per una sola cosa: provare una guida di discussione prima di impiegare un partecipante reale. Li usiamo per questo scopo. Non li usiamo come prova e non presentiamo i loro risultati come conclusioni di una ricerca. Se un fornitore vi offre un programma di ricerca senza partecipanti umani, vi sta vendendo un modo molto costoso per confermare ciò in cui già credete.
Il nostro protocollo di lavoro
Questa è la sequenza reale, non una versione idealizzata.
1. Gli esseri umani scrivono prima il codice. Prima che qualsiasi modello possa entrare in contatto con una trascrizione, un ricercatore legge da tre a cinque interviste e costruisce manualmente la struttura di codifica. Tale struttura deriva dai dati di questo studio, non da una tassonomia UX generica. Tutto ciò che segue eredita la sua qualità da questa fase, ed è per questo che è la fase che non comprimiamo mai.
2. Il modello applica la cornice, e solo la cornice. Codice fisso, nessuna nuova categoria a metà dell'esecuzione. Quando il modello incontra qualcosa che il riquadro non copre, lo contrassegna come non classificato anziché forzarne l'inserimento. Il mucchio di elementi non classificati è spesso il risultato più interessante dell'intera esecuzione.
3. Effettuare una doppia codifica di un campione del 15%. Le stesse trascrizioni vengono codificate in modo indipendente da un essere umano e dal modello, e misuriamo il tasso di discordanza. Se è inferiore al 10%, procediamo. Se è superiore al 20%, il codice è errato, non il modello: torniamo al primo passaggio. Il tasso di discordanza è uno strumento diagnostico per il frame, e trattarlo in questo modo ci ha permesso di risparmiare più che considerarlo un semplice controllo di qualità per gli strumenti.
4. Bozza di sintesi senza ipotesi nella traccia. Il modello riceve in input il corpus e la domanda di ricerca. Produce dei cluster e una prima narrazione.
5. Passaggio di tracciabilità. Ogni affermazione nella bozza viene collegata ad almeno due partecipanti, con indicazione temporale. Le affermazioni che non possono essere ricondotte a una fonte precisa vengono eliminate, non attenuate. Un'affermazione supportata da un solo partecipante viene etichettata come singola osservazione, che è un dato legittimo e spesso utile da segnalare, ma non come tema ricorrente.
6. Triangolazione rispetto ai dati comportamentali. Il comportamento dichiarato e quello osservato divergono costantemente. Verifichiamo i risultati delle interviste confrontandoli con le registrazioni delle sessioni e i dati delle mappe di calore (clic improvvisi, clic a vuoto, punti di abbandono) prima che qualsiasi informazione arrivi al cliente. Quando i partecipanti affermano che il filtro funziona correttamente e le registrazioni mostrano che lo stanno abbandonando, prevalgono le registrazioni. È proprio in questi casi che il lavoro qualitativo basato sull'intelligenza artificiale rischia maggiormente di essere smascherato, perché i dati comportamentali non tengono conto della coerenza della narrazione.
7. La raccomandazione viene scritta da una persona. I risultati possono essere raccolti con l'aiuto di altri. Cosa farne, in questa organizzazione, con questi vincoli e questa tabella di marcia, è una decisione che spetta a chi ha partecipato alle interviste.
Ciò che non automatizziamo
La lista è ristretta e la manteniamo ferma.
- Moderazione delle interviste con utenti vulnerabili o in difficoltà. Ricerca su assistenza sanitaria, difficoltà finanziarie e accessibilità. Il ruolo del moderatore in questo ambito è in parte un dovere di diligenza, e questo non è delegabile.
- La raccomandazione. Vedi il passaggio sette.
- Valutazione dell'accessibilità. Strumenti automatizzati, compresi i nostri Strumento di verifica WCAG — individua circa un terzo dei problemi relativi alle WCAG. Il resto richiede test manuali con tecnologie assistive. Qualsiasi fornitore che affermi di offrire una copertura completamente automatizzata sta descrivendo una scansione, non un audit.
- Decidere cosa non ricercare. La fase di definizione dell'ambito di ricerca è quella in cui si crea o si distrugge gran parte del valore della ricerca, e rappresenta una discussione strategica, non un semplice compito di sintesi.
Una nota sulla ricerca in lingua turca
La maggior parte delle linee guida pubblicate sulla ricerca assistita dall'intelligenza artificiale sono scritte e validate in inglese, e il divario di prestazioni è reale ma poco discusso.
La trascrizione turca si degrada notevolmente in presenza di marchi, gergo di settore e del code-switching inglese-turco, del tutto normale nei team di prodotto e e-commerce di Istanbul. La classificazione del sentiment gestisce male l'indirettezza del turco: la cortese attenuazione che precede una lamentela seria viene spesso interpretata come neutra o positiva da un classificatore addestrato prevalentemente sull'inglese. La morfologia agglutinante implica inoltre che gli approcci basati sulla frequenza delle parole chiave ai dati di sondaggio a risposta aperta sottostimano notevolmente il numero di elementi, poiché un singolo concetto appare in una dozzina di forme flesse che il tokenizzatore tratta come non correlate.
Conseguenze pratiche: aumentate la percentuale di controlli a campione delle trascrizioni oltre il 10% che usereste per l'inglese, non affidatevi mai all'analisi automatica del sentiment come segnale a sé stante nei corpora turchi e validate qualsiasi classificatore su un campione turco etichettato manualmente prima di fidarvi del suo output su larga scala. Noi eseguiamo il nostro set di validazione proprio per questo motivo.
Come capire se funziona
La velocità non è il parametro giusto. Tutti diventano più veloci; la questione è se il risultato regge al confronto con la realtà. Tre parametri che monitoriamo effettivamente:
Tasso di sopravvivenza di Insight. Delle conclusioni presentate in un rapporto di ricerca, quale percentuale era ancora considerata valida sei mesi dopo? Misurare questo dato è scomodo, ma vale la pena affrontare ogni difficoltà.
Tasso di discordanza tra modello umano e modello. A partire dal terzo passaggio descritto sopra. Monitoratelo nel tempo. Un aumento del disaccordo di solito significa che il campo di ricerca si è evoluto, mentre il codice di riferimento è rimasto invariato.
Tempo intercorso tra l'ultima intervista e la prima ipotesi verificabile. Questo è il numero che l'IA effettivamente sposta. Se la sintesi prima richiedeva otto giorni e ora ne richiede due, si tratta di due cicli di sperimentazione in più a trimestre, che è il vero vantaggio competitivo, ed è un vantaggio concreto. Semplicemente, non è l'argomentazione che la maggior parte dei fornitori presenta.
Andando più in profondità
Questo articolo offre una panoramica generale. Quattro articoli complementari trattano in dettaglio le singole fasi:
- Creazione di profili utente basati sui dati con l'intelligenza artificiale — costruire artefatti di persona a partire da prove validate piuttosto che da modelli preesistenti
- Dai dati alle decisioni: come l'IA può semplificare la sintesi della ricerca sugli utenti. — la fase di sintesi in dettaglio
- Come l'intelligenza artificiale può trasformare il feedback degli utenti in informazioni utili sui prodotti — recensioni, biglietti e trascrizioni integrali del NPS su larga scala
- Ottimizzazione della scoperta dei prodotti grazie alla ricerca sugli utenti basata sull'intelligenza artificiale. — applicando tutto ciò all'interno di un ciclo di scoperta
Domande frequenti
L'intelligenza artificiale può sostituire completamente le interviste agli utenti? No. Può sostituire parte del lavoro che ruota attorno alle interviste (trascrizione, codifica, sintesi preliminare) e può aiutarti a prepararne di migliori. Non può generare prove su come si comportano le persone, perché non ha accesso al loro comportamento. I partecipanti simulati ti dicono come tali persone vengono descritte nei testi, il che è una cosa diversa e spesso fuorviante.
Quanto tempo si risparmia effettivamente grazie alla ricerca assistita dall'intelligenza artificiale? Nella nostra esperienza, il risparmio si concentra quasi interamente nella sintesi e nella codifica, dove è sostanziale. Il lavoro sul campo, il reclutamento e l'allineamento delle parti interessate rimangono invariati. Un'aspettativa realistica per uno studio moderato è che la fase successiva al lavoro sul campo si riduca considerevolmente, mentre la durata totale del progetto diminuisca in misura molto minore, perché il lavoro sul campo è sempre stato il polo più lungo.
Gli utilizzatori di sostanze sintetiche possono mai essere considerati legittimi? Come strumento di prova per le guide di discussione e come metodo per testare la formulazione dei sondaggi, sì. Come prova a supporto di una conclusione di ricerca, no. La distinzione è importante: uno è un ausilio alla preparazione, l'altro sono dati fabbricati con un'etichetta di ricerca.
Qual è il rischio maggiore? Un output sicuro, fluente, ma errato, e nello specifico una versione che concorda con le convinzioni preesistenti del team. Le citazioni inventate vengono individuate dalle regole di tracciabilità. La sintesi servile è più difficile da realizzare, perché produce un risultato che soddisfa tutti. L'unica difesa affidabile consiste nel separare l'ipotesi dalla richiesta di sintesi ed eseguire un passaggio di verifica esplicita.
La ricerca assistita dall'intelligenza artificiale funziona altrettanto bene in turco? Non è utilizzabile immediatamente. L'accuratezza della trascrizione, la classificazione del sentiment e i metodi di analisi della frequenza delle parole chiave risultano meno efficaci in turco rispetto all'inglese. È utilizzabile e lo usiamo quotidianamente, ma richiede frequenze di campionamento più elevate, classificatori validati e un ricercatore che conosca la lingua.
Desideri un secondo parere sul tuo processo di ricerca?
Se state conducendo ricerche assistite dall'intelligenza artificiale e volete sapere se i vostri risultati supererebbero un esame critico, oppure se state decidendo cosa automatizzare e cosa proteggere, analizzeremo il vostro processo attuale e vi indicheremo chiaramente dove si annidano i rischi.







