AI dalam Riset Pengguna: Apa yang Berhasil, Apa yang Gagal, dan Di Mana Kita Menarik Garis Batasnya

AI dalam Riset Pengguna: Apa yang Berhasil, Apa yang Gagal, dan Di Mana Kita Menarik Garis Batasnya

Kendala utamanya bukanlah wawancara.

Setiap artikel tentang AI dan riset pengguna selalu diawali dengan cara yang sama: riset itu lambat, AI mempercepatnya. Kerangka berpikir tersebut tidak salah, tetapi cukup tidak tepat sehingga tidak berguna ketika Anda memutuskan apa yang sebenarnya perlu diubah pada Senin pagi.

Berikut versi yang lebih akurat. Menjalankan wawancara yang dimoderasi membutuhkan waktu enam puluh menit dan akan selalu begitu, karena seseorang harus berbicara selama enam puluh menit. Apa yang dulunya memakan waktu empat hari adalah segalanya. sekitar Itu — mentranskripsikan, memberi tag, menemukan momen di mana tiga peserta mengatakan hal yang sama dalam tiga kosakata yang berbeda, dan mengubahnya menjadi sesuatu yang dapat ditindaklanjuti oleh manajer produk sebelum sprint berakhir.

Di situlah waktu dihabiskan, dan di situlah tepatnya model bahasa unggul. Mereka adalah pencocok pola pada teks. Sintesis penelitian adalah masalah pencocokan pola pada teks. Kecocokannya nyata.

Namun, sifat yang sama yang membuat mereka mahir dalam sintesis juga membuat mereka berbahaya dalam hal itu. Sebuah model yang menemukan pola akan menemukan pola terlepas dari apakah pola tersebut ada atau tidak, dan model tersebut akan menggambarkan pola yang diciptakannya dengan tingkat kepercayaan yang sama persis dengan pola yang sudah ada. Dalam penelitian, tema yang salah namun penuh keyakinan lebih buruk daripada tidak memiliki tema sama sekali, karena tema yang salah akan terus berkembang.

Jadi pertanyaannya adalah tidak apakah Untuk menggunakan AI dalam riset pengguna. Semua orang sudah melakukannya. Pertanyaannya adalah bagian mana dari proses yang Anda serahkan, apa yang Anda periksa sebelum mempercayai hasilnya, dan apa yang Anda tolak untuk diotomatisasi sama sekali. Itulah yang dibahas dalam artikel ini.

Di sinilah AI benar-benar layak mendapatkan tempatnya.

Kami memetakan AI terhadap proses penelitian tahap demi tahap, alih-alih memperlakukannya sebagai keputusan tunggal. Tahap-tahap yang berbeda memiliki profil risiko yang sangat berbeda.

TahapApa yang dilakukan AI dengan baikApa yang salah di dalamnya?Aturan kami
Perekrutan & penyaringanMenyusun kuesioner penyaringan, mengidentifikasi jawaban yang kontradiktif dalam tanggapan kuesioner penyaringan, dan menandai responden yang kemungkinan besar profesional.Penyaringan berlebihan untuk peserta yang fasih berbicara; menyaring pengguna yang frustrasi yang paling Anda butuhkan.Hanya sebagai asisten. Panel akhir akan disetujui oleh manusia.
Panduan diskusiMenyusun draf pertama dari pertanyaan penelitian, mengusulkan pertanyaan lanjutan, dan memeriksa apakah ada pertanyaan yang mengarahkan jawaban.Menghasilkan panduan umum yang menguji apa yang sudah diketahui.Akselerator draf. Peneliti menulis ulang setidaknya setengahnya.
ModerasiPencatatan secara real-time, penandaan langsung, dan pemberian saran pertanyaan kepada moderator manusia.Tidak dapat membaca keraguan, ketidaknyamanan, atau jeda sebelum kebohongan yang sopan.Tidak pernah otonom. Alat pendukung untuk moderator manusia.
TurunanPemisahan speaker, penandaan waktu, pembersihan tahap pertamaAkurasi transkripsi bahasa Turki menurun tajam dengan adanya jargon bidang, nama merek, dan peralihan kode.Otomatiskan, lalu periksa secara acak 10% terhadap audio.
Pengkodean & penandaanMenerapkan buku kode yang sudah ada secara konsisten di ratusan transkrip dengan cepat.Menciptakan kode baru di tengah proses penulisan; menggabungkan berbagai masalah yang berbeda menjadi satu label yang mudah dipahami.Otomatiskan dengan buku kode tetap yang ditulis oleh manusia.
SintesaPengelompokan, mengungkap pola lintas partisipan, menyusun narasi pertamaMencampuradukkan frekuensi dengan pentingnya; meredam suara peserta yang berbeda pendapatHanya draf. Setiap tema ditelusuri ke sumber aslinya sebelum dikirim.
Analisis umpan balik berkelanjutanUlasan di App Store, tiket dukungan, transkrip NPS, log obrolan dalam jumlah yang sangat banyak sehingga tidak mungkin dibaca oleh tim mana pun secara manual.Sistem penilaian sentimen kurang akurat dalam menafsirkan sarkasme dan ketidaklangsungan budaya.Otomatisasi bernilai tinggi dengan pemeriksaan sampel.
Bangunan artefakPersona, peta perjalanan, pohon peluang dari input yang tervalidasiMenghasilkan artefak yang masuk akal dari bukti yang lemah atau tidak ada sama sekali.Hanya berdasarkan riset terverifikasi, bukan berdasarkan pengetahuan umum model tersebut.

Dua baris dalam tabel itu bernilai lebih dari gabungan nilai seluruh baris lainnya.

Pemrograman dalam skala besar. Jika Anda memiliki buku kode yang ditulis oleh manusia, menerapkannya secara konsisten di 40 transkrip adalah jenis pekerjaan membosankan dan mengikuti aturan yang dapat diandalkan oleh model. Di sinilah sebagian besar waktu yang dapat dihemat sebenarnya berada.

Analisis umpan balik berkelanjutan. Sebagian besar perusahaan menyimpan ribuan ulasan toko aplikasi, tiket dukungan, dan transkrip survei yang belum pernah dibaca siapa pun sejak diterima. Ini adalah penggunaan AI dengan pengembalian tertinggi dan risiko terendah di seluruh disiplin ilmu, karena Anda tidak menggantikan riset yang sedang berlangsung — Anda membaca data yang sebelumnya dibuang. Kami membahas ini secara mendalam di Bagaimana AI Dapat Mengubah Umpan Balik Pengguna Menjadi Wawasan Produk yang Dapat Ditindaklanjuti.

Empat modus kegagalan yang terus kita temukan

Ini bukan risiko teoretis. Ini adalah hal-hal spesifik yang salah dalam proyek nyata, kira-kira dalam urutan menurun berdasarkan seberapa sering kita menemukannya.

1. Frekuensi yang disamarkan sebagai kepentingan

Mintalah sebuah model untuk meringkas dua puluh wawancara dan model tersebut akan menyoroti apa yang paling sering dikatakan. Tetapi nilai penelitian biasanya bukan terletak pada respons yang paling sering muncul. Nilainya terletak pada satu partisipan yang sepenuhnya meninggalkan alur, atau dua partisipan yang menjelaskan solusi alternatif yang sama secara independen, atau segmen yang tidak pernah sampai pada langkah yang dibahas oleh semua orang.

Model yang merangkum studi proses pembayaran akan memberi tahu Anda bahwa transparansi biaya pengiriman muncul berulang kali. Model tersebut tidak akan memberi tahu Anda bahwa hanya dua peserta yang menyelesaikan pembelian, keduanya sudah masuk (login) — yang merupakan temuan sebenarnya, dan yang hanya muncul sebagai data yang tidak ada dalam data yang dikumpulkan.

Pemeriksaan kami: Kami secara eksplisit menanyakan posisi minoritas. "Peserta mana yang tidak setuju dengan konsensus yang muncul, dan apa yang mereka katakan?" Jika model tidak dapat menyebutkan satu pun, kami menganggap ringkasan tersebut tidak lengkap dan bukan sebagai bukti kesepakatan.

2. Inovasi yang lancar

Model menghasilkan kutipan yang terdengar persis seperti sesuatu yang akan dikatakan oleh peserta, yang dikaitkan dengan peserta yang tidak mengatakannya. Tidak sering. Cukup sering. Dan kegagalannya tidak terlihat saat diperiksa, karena kutipan yang dibuat-buat terdengar lebih baik daripada kutipan yang sebenarnya — orang sungguhan berbicara dalam fragmen.

Pemeriksaan kami: Setiap kutipan yang sampai ke klien disertai dengan referensi transkrip dan cap waktu. Jika tidak dapat ditemukan dalam audio sumber, kutipan tersebut tidak akan dikirim. Ini adalah aturan mekanis, bukan keputusan berdasarkan pertimbangan, karena pertimbangan itulah yang justru gagal di sini.

3. Sintesis penjilat

Berikan hipotesis Anda dan kemudian data Anda pada sebuah model, dan sintesisnya akan mendukung hipotesis Anda. Berikan data yang sama dengan hipotesis yang berlawanan, dan sintesisnya akan mendukung hipotesis tersebut. Ini adalah mode kegagalan paling mahal dalam konteks konsultasi, karena menghasilkan hasil yang persis seperti yang diinginkan klien sekaligus menghancurkan alasan mereka mempekerjakan Anda.

Pemeriksaan kami: Perintah sintesis tidak pernah berisi hipotesis. Model hanya menerima korpus dan pertanyaan penelitian, tidak lebih. Ketika kita ingin menguji hipotesis, kita menjalankannya sebagai proses terpisah yang bersifat antagonis: "temukan bukti terkuat dalam korpus ini". terhadap klaim berikut ini."

4. Pengguna sintetis

Aplikasi yang paling gencar dipasarkan namun paling sulit dipertahankan: menghasilkan partisipan simulasi dan mewawancarai mereka alih-alih orang sungguhan. Aplikasi ini menghasilkan transkrip yang masuk akal dengan cepat, dan justru keabsahan itulah masalahnya. Model yang dilatih di internet akan memberi tahu Anda seperti apa persona tersebut. terdengar seperti, yang merupakan ringkasan tentang bagaimana orang-orang seperti itu ditulis—bukan tentang bagaimana mereka berperilaku ketika validasi formulir Anda menolak alamat mereka pada percobaan ketiga.

Pengguna sintetis berguna untuk satu hal: melatih panduan diskusi sebelum Anda melibatkan peserta sungguhan. Kami menggunakannya untuk itu. Kami tidak menggunakannya sebagai bukti, dan kami tidak melaporkan hasil keluarannya sebagai temuan penelitian. Jika pemasok menawarkan program penelitian tanpa peserta manusia di dalamnya, mereka menjual cara yang sangat mahal untuk mengkonfirmasi apa yang sudah Anda yakini.

Protokol kerja kami

Ini adalah urutan kejadian yang sebenarnya, bukan yang diidealkan.

1. Manusia yang pertama kali menulis buku kode. Sebelum model apa pun menyentuh transkrip, seorang peneliti membaca tiga hingga lima wawancara dan membangun kerangka pengkodean secara manual. Kerangka tersebut berasal dari data studi ini, bukan dari taksonomi UX generik. Semua hal selanjutnya mewarisi kualitasnya dari langkah ini, itulah sebabnya langkah ini tidak pernah kami kompres.

2. Model ini menerapkan kerangka, dan hanya kerangkanya saja. Kode buku tetap, tidak ada kategori baru di tengah proses. Ketika model menemukan sesuatu yang tidak tercakup dalam kerangka kerja, model menandainya sebagai tidak terklasifikasi daripada memaksakan penyesuaian. Tumpukan yang tidak terklasifikasi seringkali merupakan keluaran paling menarik dari seluruh proses.

3. Lakukan pengkodean ganda pada sampel 15%. Transkrip yang sama dikodekan secara independen oleh manusia dan oleh model, dan kami mengukur tingkat ketidaksepakatan. Di bawah 10%, kami melanjutkan. Di atas 20%, buku kode salah, bukan modelnya — kami kembali ke langkah pertama. Tingkat ketidaksepakatan adalah diagnostik pada kerangka kerja, dan memperlakukannya seperti itu telah menghemat lebih banyak uang daripada memperlakukannya sebagai gerbang kualitas pada alat.

4. Draf sintesis tanpa hipotesis dalam pertanyaan. Model ini menerima korpus dan pertanyaan penelitian. Kemudian menghasilkan klaster dan narasi awal.

5. Lulus uji ketertelusuran. Setiap klaim dalam draf dikaitkan dengan setidaknya dua partisipan, dengan cap waktu. Klaim yang tidak dapat dilacak dihapus, bukan dilunakkan. Klaim yang didukung oleh tepat satu partisipan diberi label sebagai pengamatan tunggal, yang merupakan hal yang sah dan seringkali berharga untuk dilaporkan — tetapi bukan sebagai tema.

6. Triangulasi terhadap data perilaku. Perilaku yang dinyatakan dan perilaku yang diamati selalu berbeda. Kami memeriksa temuan wawancara dengan rekaman sesi dan data peta panas — klik yang menunjukkan kemarahan, klik yang tidak aktif, titik penurunan — sebelum apa pun sampai ke klien. Ketika peserta mengatakan filternya baik-baik saja dan rekaman menunjukkan mereka meninggalkan filter tersebut, rekamanlah yang menang. Di sinilah juga pekerjaan kualitatif yang didorong oleh AI kemungkinan besar akan terungkap, karena data perilaku tidak peduli seberapa koheren narasi tersebut.

7. Rekomendasi tersebut ditulis oleh manusia. Temuan dapat dikumpulkan dengan bantuan. Apa yang harus dilakukan terhadap temuan tersebut, di organisasi ini, dengan kendala dan peta jalan ini, adalah keputusan yang dibuat oleh seseorang yang ikut serta dalam wawancara.

Apa yang tidak kita otomatiskan

Daftar pendek, dan kami berpegang teguh padanya.

  • Moderasi wawancara dengan pengguna yang rentan atau mengalami kesulitan. Penelitian tentang layanan kesehatan, kesulitan keuangan, dan aksesibilitas. Tugas moderator di sana sebagian merupakan kewajiban untuk memberikan perhatian, dan itu tidak dapat didelegasikan.
  • Rekomendasi tersebut. Lihat langkah ketujuh.
  • Evaluasi aksesibilitas. Peralatan otomatis — termasuk peralatan kami sendiri Alat audit WCAG — mendeteksi sekitar sepertiga dari masalah WCAG. Sisanya memerlukan pengujian manual dengan teknologi bantu. Vendor mana pun yang mengklaim cakupan otomatis penuh sebenarnya hanya menggambarkan pemindaian, bukan audit.
  • Memutuskan apa yang tidak perlu diteliti. Penentuan ruang lingkup adalah tempat sebagian besar nilai penelitian diciptakan atau dihancurkan, dan ini adalah percakapan strategis, bukan tugas meringkas.

Catatan tentang penelitian berbahasa Turki

Sebagian besar panduan yang diterbitkan tentang penelitian berbantuan AI ditulis dan divalidasi dalam bahasa Inggris, dan kesenjangan kinerja itu nyata dan kurang dibahas.

Transkripsi bahasa Turki menurun secara signifikan di sekitar nama merek, jargon sektor, dan peralihan kode Inggris-Turki yang sepenuhnya normal di tim produk dan e-commerce Istanbul. Klasifikasi sentimen menangani ketidaklangsungan bahasa Turki dengan buruk — ungkapan sopan yang mendahului keluhan serius sering kali dibaca sebagai netral atau positif oleh pengklasifikasi yang dilatih terutama pada bahasa Inggris. Morfologi aglutinatif juga berarti bahwa pendekatan frekuensi kata kunci pada data survei terbuka sangat meremehkan, karena satu konsep muncul dalam selusin bentuk terinfleksi yang diperlakukan oleh tokenizer sebagai tidak terkait.

Konsekuensi praktis: tingkatkan tingkat pengecekan transkripsi Anda di atas 10% yang biasa Anda gunakan untuk bahasa Inggris, jangan pernah mengandalkan sentimen otomatis sebagai sinyal tunggal dalam korpus bahasa Turki, dan validasi pengklasifikasi apa pun pada sampel bahasa Turki yang diberi label secara manual sebelum Anda mempercayai hasilnya dalam jumlah besar. Kami menjalankan set validasi kami sendiri karena alasan ini.

Bagaimana cara mengetahui apakah alat tersebut berfungsi?

Kecepatan bukanlah ukuran yang tepat. Semua orang menjadi lebih cepat; pertanyaannya adalah apakah hasilnya mampu bertahan menghadapi kenyataan. Tiga ukuran yang sebenarnya kami lacak:

Tingkat kelangsungan hidup Insight. Dari temuan yang disajikan dalam laporan penelitian, berapa proporsi yang masih dianggap valid enam bulan kemudian? Mengukur hal ini memang sulit, tetapi sepadan dengan kesulitan yang dihadapi.

Tingkat ketidaksepakatan antara manusia dan model. Dari langkah ketiga di atas. Pantau perkembangannya dari waktu ke waktu. Meningkatnya perbedaan pendapat biasanya berarti domain penelitian telah bergeser dan buku kode belum berubah.

Jangka waktu dari wawancara terakhir hingga hipotesis pertama yang dapat diuji. Inilah angka yang benar-benar dihasilkan oleh AI. Jika sintesis yang dulunya memakan waktu delapan hari sekarang hanya dua hari, itu berarti dua siklus eksperimen tambahan per kuartal — yang merupakan kasus bisnis sebenarnya, dan itu adalah kasus yang bagus. Hanya saja, sebagian besar vendor tidak menyampaikan hal ini.

Pergi lebih dalam

Artikel ini merupakan gambaran umum. Empat artikel pelengkap lainnya membahas setiap tahapan secara detail:

Pertanyaan yang sering diajukan

Bisakah AI menggantikan wawancara pengguna sepenuhnya? Tidak. Ini dapat menggantikan sebagian pekerjaan seputar wawancara — transkripsi, pengkodean, sintesis awal — dan dapat membantu Anda mempersiapkan wawancara yang lebih baik. Namun, ini tidak dapat menghasilkan bukti tentang bagaimana orang berperilaku, karena tidak memiliki akses ke perilaku mereka. Partisipan simulasi memberi tahu Anda bagaimana orang-orang tersebut digambarkan dalam teks, yang merupakan hal yang berbeda dan seringkali menyesatkan.

Seberapa banyak waktu yang sebenarnya dihemat oleh penelitian yang dibantu AI? Berdasarkan pengalaman kami, penghematan hampir seluruhnya terkonsentrasi pada sintesis dan pengkodean, di mana penghematannya cukup signifikan. Kerja lapangan, perekrutan, dan penyelarasan pemangku kepentingan tetap tidak berubah. Harapan realistis untuk studi yang dimoderasi adalah bahwa fase pasca-kerja lapangan akan jauh lebih singkat sementara total durasi proyek akan berkurang jauh lebih sedikit — karena kerja lapangan selalu menjadi bagian yang paling lama.

Apakah pengguna sintetis pernah ada yang sah? Sebagai alat latihan untuk panduan diskusi dan sebagai cara untuk menguji keakuratan kata-kata dalam survei, ya. Sebagai bukti dalam temuan penelitian, tidak. Perbedaan ini penting: yang satu adalah alat bantu persiapan, yang lain adalah data yang dibuat-buat dengan label penelitian di atasnya.

Apa risiko terbesarnya? Percaya diri, lancar, tetapi menghasilkan output yang salah — dan khususnya versi yang sesuai dengan apa pun yang sudah diyakini tim. Kutipan palsu akan terdeteksi oleh aturan keterlacakan. Sintesis yang menjilat lebih sulit, karena menghasilkan hasil akhir yang membuat semua orang senang. Satu-satunya pertahanan yang andal adalah memisahkan hipotesis dari perintah sintesis dan menjalankan uji banding yang eksplisit.

Apakah penelitian yang dibantu AI juga berfungsi dengan baik di Turki? Tidak langsung siap pakai. Akurasi transkripsi, klasifikasi sentimen, dan metode frekuensi kata kunci semuanya menurun pada bahasa Turki dibandingkan dengan bahasa Inggris. Meskipun dapat digunakan dan kami menggunakannya setiap hari, hal ini membutuhkan tingkat pengambilan sampel yang lebih tinggi, pengklasifikasi yang tervalidasi, dan peneliti yang menguasai bahasa tersebut.

Ingin pendapat kedua tentang proses penelitian Anda?

Jika Anda menjalankan penelitian yang dibantu AI dan ingin mengetahui apakah temuan Anda akan lolos uji — atau Anda sedang memutuskan apa yang perlu diotomatisasi dan apa yang perlu dilindungi — kami akan meninjau proses Anda saat ini dan memberi tahu Anda secara gamblang di mana letak risikonya.

 


Çağdaş Polat
Ditulis oleh

Çağdaş Polat

Çağdaş Polat adalah salah satu pendiri Switas, di mana ia memimpin konsultasi teknologi dan pertumbuhan untuk berbagai merek di bidang e-commerce, perjalanan, perawatan kesehatan, dan sektor publik. Sebagai lulusan ilmu komputer yang beralih dari pengembangan perangkat lunak ke peran senior di bidang pemasaran, produk, dan strategi selama dekade terakhir, ia sekarang memberikan nasihat kepada perusahaan tentang CRO (Conversion Rate Optimization), analitik, dan membangun sistem pertumbuhan yang dapat diandalkan dalam hal pengukuran.


Artikel terkait

Switas Seperti yang Terlihat di

Magnify: Meningkatkan Pemasaran Influencer dengan Engin Yurtdakul

Simak Studi Kasus Microsoft Clarity Kami

Kami menyoroti Microsoft Clarity sebagai produk yang dibangun dengan mempertimbangkan kasus penggunaan praktis di dunia nyata oleh orang-orang yang benar-benar ahli di bidang produk dan memahami tantangan yang dihadapi perusahaan seperti Switas. Fitur-fitur seperti klik yang menimbulkan kekecewaan dan pelacakan kesalahan JavaScript terbukti sangat berharga dalam mengidentifikasi frustrasi pengguna dan masalah teknis, memungkinkan peningkatan yang tepat sasaran yang secara langsung berdampak pada pengalaman pengguna dan tingkat konversi.