Kullanıcı Araştırmalarında Yapay Zeka: Neler İşe Yarıyor, Neler Başarısız Oluyor ve Sınırı Nerede Çiziyoruz?

Kullanıcı Araştırmalarında Yapay Zeka: Neler İşe Yarıyor, Neler Başarısız Oluyor ve Sınırı Nerede Çiziyoruz?

Sorun asla mülakat değildi.

Yapay zekâ ve kullanıcı araştırmaları hakkındaki her makale aynı şekilde başlıyor: Araştırma yavaş, yapay zekâ onu hızlandırıyor. Bu çerçeve yanlış değil, ancak Pazartesi sabahı gerçekten neyi değiştireceğinize karar verirken işe yaramayacak kadar belirsiz.

İşte daha doğru versiyonu. Moderatörlü bir röportaj altmış dakika sürer ve her zaman da öyle olur, çünkü bir kişinin altmış dakika boyunca konuşması gerekir. Eskiden dört gün süren her şey artık tamamlandı. etrafında Bu, üç katılımcının aynı şeyi üç farklı kelime dağarcığıyla söylediği anı bulmak, yazıya dökmek ve etiketlemek ve bunu, sprint kapanmadan önce bir ürün yöneticisinin harekete geçebileceği bir şeye dönüştürmek anlamına geliyordu.

Zaman işte oraya gitti ve dil modellerinin güçlü olduğu nokta da tam olarak burası. Metin üzerinde kalıp eşleştirme yaparlar. Araştırma sentezi, metin üzerinde bir kalıp eşleştirme problemidir. Uyum gerçektir.

Ancak onları sentezde iyi yapan aynı özellik, onları sentezde tehlikeli de yapar. Desen bulan bir model, var olup olmamasına bakmaksızın desen bulur ve icat ettiği desenleri, var olanlarla tamamen aynı güvenilir üslupla tanımlar. Araştırmada, güvenilir bir yanlış tema, hiç tema olmamasından daha kötüdür, çünkü yanlış tema oluşturulur.

Yani soru değil olup olmadığını Yapay zekayı kullanıcı araştırmalarında kullanmak. Herkes zaten kullanıyor. Soru şu: Sürecin hangi kısımlarını devrediyorsunuz, çıktıyı güvenilir bulmadan önce neleri kontrol ediyorsunuz ve hangilerini otomatikleştirmeyi tamamen reddediyorsunuz? Bu makale işte bununla ilgili.

Yapay zekanın gerçekten hak ettiği yeri bulduğu yer

Yapay zekayı tek bir karar olarak ele almak yerine, araştırma sürecinin aşamalarına göre haritalandırıyoruz. Farklı aşamaların çok farklı risk profilleri vardır.

AşamaYapay zekanın iyi yaptığı şeylerNeyi yanlış anlıyor?Bizim kuralımız
İşe alım ve elemeEleme anketleri hazırlama, eleme anketi yanıtlarındaki çelişkili cevapları tespit etme, muhtemel profesyonel yanıt verenleri işaretlemeİletişim becerisi yüksek katılımcılar için aşırı filtreleme; en çok ihtiyaç duyduğunuz, hayal kırıklığına uğramış kullanıcıları eliyor.Sadece yardımcı olun. Son panel insan tarafından onaylanır.
Tartışma kılavuzuAraştırma sorusundan yola çıkarak ilk taslağı oluşturmak, takip soruları önermek, yönlendirici soruları kontrol etmek.Hali hazırda bilinenleri test eden genel kılavuzlar üretir.Taslak hızlandırıcı. Araştırmacı en az yarısını yeniden yazıyor.
IlımlılıkGerçek zamanlı not alma, canlı etiketleme, insan moderatöre soru önerileri sunmaTereddüdü, rahatsızlığı veya kibar bir yalanın öncesindeki duraksamayı okuyamıyor.Asla özerk değil. İnsan moderatör için bir destek aracı.
TranskripsiyonKonuşmacı ayrımı, zaman damgası ekleme, ilk aşama temizlemeTürkçe transkripsiyon doğruluğu, alan jargonunda, marka isimlerinde ve dil değiştirmede önemli ölçüde düşmektedir.Önce otomatikleştirin, ardından %10'unu ses kaydıyla karşılaştırarak rastgele kontrol edin.
Kodlama ve etiketlemeMevcut bir kod kılavuzunu yüzlerce transkriptte hızlı ve tutarlı bir şekilde uygulamak.Metin derlemesi sırasında yeni kodlar icat etmek; farklı sorunları tek bir rahat etiket altında birleştirmek.Sabit, insan tarafından yazılmış bir kod kitabı kullanarak otomasyon sağlayın.
SentezKümeleme, katılımcılar arası kalıpların ortaya çıkarılması, ilk anlatının taslağının hazırlanmasıSıklığı önemle karıştırıyor; muhalif katılımcının sesini yumuşatıyor.Sadece taslak. Her tema, gönderilmeden önce kaynağına kadar takip edilir.
Sürekli geri bildirim analiziUygulama mağazası yorumları, destek talepleri, NPS (Net Promoter Score) kayıtları, sohbet kayıtları; hiçbir ekibin tek tek okuyamayacağı kadar çok sayıda veri.Duygu puanlaması, alaycılığı ve kültürel dolaylılığı yanlış yorumluyor.Örnekleme kontrolleriyle yüksek değerli otomasyon.
Eser yapımıDoğrulanmış girdilerden elde edilen kullanıcı profilleri, yolculuk haritaları, fırsat ağaçları.Zayıf veya yetersiz kanıtlardan akla yatkın eserler üretir.Yalnızca doğrulanmış araştırmalardan elde edilen bilgiler, asla modelin dünya bilgisine dayanmaz.

O tablodaki iki satırın değeri, geri kalanların toplamından daha fazla.

Büyük ölçekte kodlama. Eğer bir insan tarafından yazılmış bir kod kitabınız varsa, bunu 40 transkriptte tutarlı bir şekilde uygulamak, modellerin güvenilir olduğu türden, sıkıcı ve kurala bağlı bir iştir. Kurtarılabilecek zamanın büyük kısmı aslında buradadır.

Sürekli geri bildirim analizi. Çoğu şirket, geldiklerinden beri kimsenin okumadığı binlerce uygulama mağazası yorumu, destek talebi ve anket metniyle karşı karşıya. Bu, tüm alanda yapay zekanın en yüksek getirili, en düşük riskli kullanımıdır, çünkü yapılan araştırmaların yerini almıyorsunuz; atılan verileri okuyorsunuz. Bunu ayrıntılı olarak ele alıyoruz. Yapay Zeka, Kullanıcı Geri Bildirimlerini Nasıl Eyleme Dönüştürülebilir Ürün İçgörülerine İcra Edebilir?.

Sürekli karşılaştığımız dört arıza türü

Bunlar teorik riskler değil. Bunlar, gerçek projelerde meydana gelen ve yakalanma sıklığına göre azalan sırayla sıralanmış spesifik sorunlardır.

1. Sıklık, önem gibi gösteriliyor.

Bir modelden yirmi görüşmeyi özetlemesini isterseniz, en sık söylenenleri ön plana çıkaracaktır. Ancak araştırma değeri genellikle en sık verilen yanıtta değil, tamamen akışı terk eden katılımcıda, aynı geçici çözümü birbirinden bağımsız olarak anlatan iki katılımcıda veya herkesin tartıştığı adıma hiç ulaşamayan bölümde yatmaktadır.

Bir ödeme işlemi araştırmasını özetleyen bir model, kargo ücreti şeffaflığının tekrar tekrar gündeme geldiğini söyleyecektir. Ancak, satın alma işlemini tamamlayan iki katılımcının da zaten oturum açmış olduğunu söylemeyecektir; bu, asıl bulgudur ve veri kümesinde yalnızca bir eksiklik olarak yer almaktadır.

Kontrolümüz: Azınlık görüşünü açıkça soruyoruz. "Ortaya çıkan fikir birliğine hangi katılımcı katılmadı ve ne söyledi?" Eğer model bir katılımcı belirtemezse, özeti bir anlaşmanın kanıtı olarak değil, eksik olarak değerlendiriyoruz.

2. Akıcı buluş

Modeller, katılımcının söylemiş olabileceği gibi görünen, ancak aslında söylememiş bir katılımcıya atfedilen alıntılar üretir. Çok sık değil. Ama yeterince sık. Ve bu başarısızlık incelendiğinde görünmez, çünkü uydurulmuş bir alıntı gerçek bir alıntıdan daha iyi okunur; gerçek insanlar parçalar halinde konuşur.

Kontrolümüz: Müşteri sunumuna ulaşan her alıntı, bir transkript referansı ve zaman damgası içerir. Kaynak ses dosyasında bulunamazsa, gönderilmez. Bu mekanik bir kuraldır, yargısal bir karar değildir, çünkü burada asıl başarısız olan yargısal karardır.

3. Dalkavukluk sentezi

Bir modele hipotezinizi ve verilerinizi verin, sentez hipotezinizi destekleyecektir. Aynı verileri ters hipotezle verirseniz, sentez bunu destekleyecektir. Bu, danışmanlık bağlamında en pahalı başarısızlık biçimidir, çünkü müşterinin tam olarak istediği sonucu üretirken, sizi işe alma nedenlerini de yok eder.

Kontrolümüz: Sentez komutları asla hipotezi içermez. Model, veri kümesini ve araştırma sorusunu alır, başka hiçbir şey almaz. Bir hipotezin test edilmesini istediğimizde, bunu ayrı, karşıt bir geçiş olarak çalıştırırız: "Bu veri kümesindeki en güçlü kanıtı bulun". karşı "Aşağıdaki iddia."

4. Sentetik kullanıcılar

En iddialı şekilde pazarlanan ve en az savunulabilir uygulama: simüle edilmiş katılımcılar oluşturmak ve gerçek kişiler yerine onlarla görüşme yapmak. Hızlı bir şekilde inandırıcı transkriptler üretiyor ve inandırıcılık tam olarak sorun teşkil ediyor. İnternette eğitilmiş bir model size bir persona hakkında ne söyleyeceğini anlatacaktır. gibi geliyorBu, söz konusu kişilerin nasıl yazıldığının bir özetidir; form doğrulamanız üçüncü denemede adreslerini reddettiğinde nasıl davrandıklarının değil.

Sentetik kullanıcılar tek bir amaç için faydalıdır: gerçek bir katılımcı kullanmadan önce bir tartışma kılavuzunu prova etmek. Biz de onları bu amaçla kullanıyoruz. Onları kanıt olarak kullanmıyoruz ve çıktılarını araştırma bulgusu olarak raporlamıyoruz. Eğer bir tedarikçi size içinde insan katılımcı olmayan bir araştırma programı sunuyorsa, size zaten inandığınız şeyi doğrulamanın çok pahalı bir yolunu satıyor demektir.

Çalışma protokolümüz

Bu, idealize edilmiş bir sıralama değil, gerçek sıralamadır.

1. Şifreleme kılavuzunu ilk önce insanlar yazar. Bir model metne dokunmadan önce, araştırmacı üç ila beş görüşmeyi okur ve kodlama çerçevesini elle oluşturur. Çerçeve, genel bir UX taksonomisinden değil, bu çalışmanın verilerinden gelir. Bundan sonraki her şey kalitesini bu adımdan alır; bu nedenle asla sıkıştırmadığımız adım budur.

2. Model yalnızca çerçeveyi uygular. Kod kitabı sabitlendi, çalışma sırasında yeni kategori eklenmedi. Model, çerçevenin kapsamadığı bir şeyle karşılaştığında, zorla uyum sağlamak yerine onu sınıflandırılmamış olarak işaretler. Sınıflandırılmamış çıktılar genellikle tüm çalışmanın en ilginç çıktısıdır.

3. Numunenin %15'ini çift kodlayın. Aynı transkriptler, bağımsız olarak hem bir insan hem de bir model tarafından kodlanıyor ve uyuşmazlık oranını ölçüyoruz. %10'un altındaysa devam ediyoruz. %20'nin üzerindeyse, model değil, kod kitabı hatalı demektir ve birinci adıma geri dönüyoruz. Uyuşmazlık oranı, çerçeve üzerinde bir teşhis aracıdır ve bunu bu şekilde ele almak, onu araçlar üzerinde bir kalite kontrol noktası olarak ele almaktan daha fazla zaman kazandırdı.

4. Soru metninde hipotez içermeyen sentez taslağı. Model, veri kümesini ve araştırma sorusunu alır. Kümelemeler ve ilk anlatıyı oluşturur.

5. İzlenebilirlik testi. Taslaktaki her iddia, zaman damgalarıyla birlikte en az iki katılımcıya bağlanır. İzlenemeyen iddialar yumuşatılmak yerine silinir. Tam olarak bir katılımcı tarafından desteklenen bir iddia, tek bir gözlem olarak etiketlenir; bu, raporlanması meşru ve genellikle değerli bir şeydir, ancak bir tema olarak değil.

6. Davranışsal verilere karşı üçgenleme yöntemi. Beyan edilen davranış ile gözlemlenen davranış sürekli olarak farklılık gösterir. Herhangi bir şey müşteriye ulaşmadan önce, görüşme bulgularını oturum kayıtları ve ısı haritası verileriyle (öfkeli tıklamalar, ölü tıklamalar, terk noktaları) karşılaştırıyoruz. Katılımcılar filtrenin iyi olduğunu söylediğinde ve kayıtlar filtreyi terk ettiklerini gösterdiğinde, kayıtlar geçerli olur. Bu aynı zamanda yapay zeka destekli nitel çalışmaların en çok yakalanma olasılığının olduğu yerdir, çünkü davranışsal veriler anlatının ne kadar tutarlı olduğuyla ilgilenmez.

7. Tavsiyeyi bir insan yazıyor. Bulgular yardımla bir araya getirilebilir. Bu kuruluşta, bu kısıtlamalar ve bu yol haritasıyla ilgili ne yapılacağı, görüşmelere katılan birinin vereceği bir karardır.

Otomasyona tabi tutmadığımız şeyler

Kısa liste ve biz bu listeye sıkıca bağlıyız.

  • Savunmasız veya sıkıntılı kullanıcılarla yapılan görüşmelerin moderasyonu. Sağlık hizmetleri, mali zorluklar, erişilebilirlik araştırmaları. Moderatörün buradaki görevi kısmen sorumluluktur ve bu devredilemez.
  • Öneri. Yedinci adıma bakın.
  • Erişilebilirlik değerlendirmesi. Otomatik takım tezgahları — kendi takım tezgahlarımız da dahil WCAG denetim aracı — WCAG sorunlarının yaklaşık üçte birini yakalar. Geri kalanı, yardımcı teknolojiyle manuel test gerektirir. Tam otomatik kapsama iddiasında bulunan herhangi bir satıcı, bir denetim değil, bir tarama tanımlamaktadır.
  • Araştırmama konusuna karar vermek. Araştırma değerinin büyük çoğunluğunun yaratıldığı veya yok edildiği aşama kapsam belirlemedir ve bu bir özetleme görevi değil, stratejik bir görüşmedir.

Türkçe dil araştırmaları üzerine bir not

Yapay zekâ destekli araştırmalarla ilgili yayınlanan kılavuzların çoğu İngilizce olarak yazılmış ve doğrulanmıştır ve performans açığı gerçek olup yeterince tartışılmamıştır.

Türkçe transkripsiyon, marka isimleri, sektör jargonları ve İstanbul'daki ürün ve e-ticaret ekiplerinde tamamen normal olan İngilizce-Türkçe kod değiştirme durumlarında belirgin şekilde bozulmaktadır. Duygu sınıflandırması, Türkçe dolaylı anlatımı kötü bir şekilde ele almaktadır; ciddi bir şikayetten önce gelen kibar ifadeler, ağırlıklı olarak İngilizce üzerinde eğitilmiş bir sınıflandırıcı tarafından sıklıkla nötr veya olumlu olarak algılanmaktadır. Ayrıca, birleşik morfoloji, açık uçlu anket verilerine anahtar kelime sıklığı yaklaşımlarının ciddi şekilde eksik sayım yapmasına neden olur, çünkü tek bir kavram, belirteçleyici tarafından ilgisiz olarak ele alınan bir düzine çekimli biçimde görünür.

Pratik sonuçlar: İngilizce için kullandığınız %10'luk oranın üzerine çıkarak transkripsiyon kontrolü yapın, Türkçe metinlerde otomatik duygu analizine asla tek başına bir sinyal olarak güvenmeyin ve çıktısına büyük ölçekte güvenmeden önce herhangi bir sınıflandırıcıyı elle etiketlenmiş bir Türkçe örnek üzerinde doğrulayın. Tam da bu nedenle kendi doğrulama setimizi kullanıyoruz.

Çalışıp çalışmadığını nasıl anlarsınız?

Hız yanlış bir ölçüt. Herkes hızlanıyor; önemli olan, elde edilen sonucun gerçeklikle temas ettiğinde ayakta kalıp kalmayacağı. Aslında takip ettiğimiz üç ölçüt şunlardır:

Hayatta kalma oranına dair içgörü. Bir araştırma raporunda sunulan bulguların ne kadarı altı ay sonra hala geçerli kabul ediliyordu? Bunu ölçmek zor ama her türlü zorluğa değer.

İnsan-model uyumsuzluk oranı. Yukarıdaki üçüncü adımdan devam edin. Zaman içinde takip edin. Artan görüş ayrılığı genellikle araştırma alanının değiştiği ancak kod kitabının değişmediği anlamına gelir.

Son görüşmeden ilk test edilebilir hipoteze kadar geçen süre. Yapay zekanın gerçekten fark yarattığı rakam bu. Sentez işleminin eskiden sekiz gün sürerken şimdi iki güne inmesi, çeyrek başına iki ekstra deney döngüsü anlamına geliyor; bu da gerçek iş gerekçesi ve iyi bir gerekçe. Ancak çoğu satıcının öne sürdüğü durum bu değil.

daha derine inmek

Bu makale genel bir bakış sunmaktadır. Dört tamamlayıcı makale ise her bir aşamayı ayrıntılı olarak ele almaktadır:

Sık Sorulan Sorular

Yapay zeka, kullanıcı görüşmelerinin yerini tamamen alabilir mi? Hayır. Görüşmelerle ilgili bazı işlerin (transkripsiyon, kodlama, ilk aşama sentezi) yerini alabilir ve daha iyi görüşmeler hazırlamanıza yardımcı olabilir. Ancak insanların nasıl davrandığına dair kanıt üretemez, çünkü davranışlarına erişimi yoktur. Simüle edilmiş katılımcılar, bu tür insanların metinde nasıl tanımlandığını gösterir ki bu farklı bir şeydir ve sıklıkla yanıltıcıdır.

Yapay zekâ destekli araştırmalar aslında ne kadar zaman kazandırıyor? Deneyimlerimize göre, tasarruf neredeyse tamamen sentez ve kodlama aşamalarında yoğunlaşıyor ve bu aşamalarda önemli ölçüde gerçekleşiyor. Saha çalışması, işe alım ve paydaş uyumu değişmiyor. Yönetilen bir çalışma için gerçekçi bir beklenti, saha çalışması sonrası aşamanın önemli ölçüde kısalması, toplam proje süresinin ise çok daha az azalmasıdır; çünkü saha çalışması her zaman en uzun süren aşama olmuştur.

Sentetik kullanıcılar hiç meşru olabilir mi? Tartışma kılavuzları için bir prova aracı ve anket sorularının doğruluğunu test etme yöntemi olarak evet. Araştırma bulgusunda kanıt olarak hayır. Bu ayrım önemlidir: biri hazırlık aracı, diğeri ise araştırma etiketi yapıştırılmış uydurma veridir.

En büyük risk nedir? Kendinden emin, akıcı, yanlış çıktı — ve özellikle de ekibin zaten inandığı şeyle örtüşen versiyonu. Uydurma alıntılar izlenebilirlik kurallarına takılır. Dalkavukça sentez daha zordur, çünkü herkesin memnun olduğu bir çıktı üretir. Tek güvenilir savunma, hipotezi sentez isteminden ayırmak ve açık bir karşıtlık geçişi çalıştırmaktır.

Yapay zekâ destekli araştırmalar Türkçe'de de aynı derecede başarılı oluyor mu? Hazır çözüm değil. Transkripsiyon doğruluğu, duygu sınıflandırması ve anahtar kelime sıklığı yöntemlerinin tümü, İngilizceye kıyasla Türkçede düşüş gösteriyor. Kullanılabilir ve günlük olarak kullanıyoruz, ancak daha yüksek örnekleme oranları, doğrulanmış sınıflandırıcılar ve dili okuyabilen bir araştırmacı gerektiriyor.

Araştırma süreciniz hakkında ikinci bir görüşe mi ihtiyacınız var?

Yapay zekâ destekli araştırmalar yürütüyorsanız ve bulgularınızın incelemeye dayanıp dayanmayacağını öğrenmek istiyorsanız veya neyi otomatikleştireceğinize ve neyi koruyacağınıza karar veriyorsanız, mevcut sürecinizi gözden geçireceğiz ve riskin nerede olduğunu size açıkça söyleyeceğiz.

 


Çağdaş Polat
Tarafından yazılmıştır

Çağdaş Polat

Çağdaş Polat, Switas'ın kurucu ortağıdır ve e-ticaret, seyahat, sağlık ve kamu sektörü genelindeki markalar için teknoloji ve büyüme danışmanlığı yapmaktadır. Bilgisayar bilimleri mezunu olan Polat, son on yılda yazılım geliştirmeden pazarlama, ürün ve strateji alanlarında üst düzey görevlere geçmiştir ve şu anda şirketlere CRO, analitik ve ölçüme dayalı büyüme sistemleri oluşturma konularında danışmanlık yapmaktadır.


İlgili Makaleler

Switas'ın Görüldüğü Gibi

Magnify: Engin Yurtdakul ile Etkileyici Pazarlamanın Ölçeklendirilmesi

Microsoft Clarity Vaka İncelememize Göz Atın

Microsoft Clarity'yi, Switas gibi şirketlerin karşılaştığı zorlukları anlayan gerçek ürün geliştiriciler tarafından, pratik ve gerçek dünya kullanım senaryoları göz önünde bulundurularak geliştirilmiş bir ürün olarak öne çıkardık. Öfkeli tıklamaları ve JavaScript hata izleme gibi özellikler, kullanıcı hayal kırıklıklarını ve teknik sorunları belirlemede, kullanıcı deneyimini ve dönüşüm oranlarını doğrudan etkileyen hedefli iyileştirmeler sağlamada paha biçilmez olduğunu kanıtladı.