בינה מלאכותית במחקר משתמשים: מה עובד, מה נכשל, והיכן עובר הגבול

בינה מלאכותית במחקר משתמשים: מה עובד, מה נכשל, והיכן עובר הגבול

צוואר הבקבוק מעולם לא היה הראיון

כל מאמר על בינה מלאכותית ומחקר משתמשים נפתח באותו אופן: מחקר הוא איטי, בינה מלאכותית הופכת אותו למהיר. הניסוח הזה אינו שגוי, אך הוא לא מדויק מספיק כדי להיות חסר תועלת כשמחליטים מה לשנות בפועל בבוקר יום שני.

הנה הגרסה המדויקת יותר. ניהול ראיון מנחה אורך שישים דקות ותמיד ייקח, כי אדם צריך לדבר שישים דקות. מה שלקח פעם ארבעה ימים היה הכל. סביב את זה - תמלול, תיוג, מציאת הרגע שבו שלושה משתתפים אמרו את אותו הדבר בשלושה אוצרות מילים שונים, והפיכת זה למשהו שמנהל מוצר יוכל לפעול עליו לפני סגירת הספרינט.

לשם הזמן נעלם, ודווקא שם מודלים של שפה חזקים. הם מתאימים תבניות על פני טקסט. סינתזת מחקר היא בעיית התאמת תבניות על פני טקסט. ההתאמה אמיתית.

אבל אותה תכונה שהופכת אותם לטובים בסינתזה הופכת אותם למסוכנים בה. מודל שמוצא דפוסים ימצא דפוסים בין אם קיימים ובין אם לאו, והוא יתאר את אלה שהמציא בדיוק באותו רגיסטר בטוח כמו אלה שקיימים. במחקר, נושא שגוי ובטוח גרוע יותר מהיעדר נושא, משום שנבנה נושא שגוי.

אז השאלה היא לא אם להשתמש בבינה מלאכותית במחקר משתמשים. כולם כבר עושים זאת. השאלה היא אילו חלקים בתהליך אתם מעבירים, מה אתם בודקים לפני שאתם סומכים על הפלט, ומה אתם מסרבים להפוך לאוטומטיים בכלל. על זה עוסק המאמר הזה.

היכן שבינה מלאכותית באמת מרוויחה את מקומה

אנו ממפים את הבינה המלאכותית כנגד תהליך המחקר שלב אחר שלב במקום להתייחס אליו כאל החלטה אחת. לשלבים שונים יש פרופילי סיכון שונים מאוד.

התמחותמה שבינה מלאכותית עושה טובמה זה משתבשהכלל שלנו
גיוס ומיוןניסוח בודקי סינון, איתור תשובות סותרות בתשובותיהם, סימון משיבים מקצועיים פוטנציאלייםסינון יתר על המידה עבור משתתפים רהוטים; מסנן את המשתמשים המתוסכלים שאתה הכי זקוק להםסיוע בלבד. אדם מאשר את הפאנל הסופי.
מדריך דיוןיצירת טיוטה ראשונה משאלת המחקר, הצעת בדיקות המשך, בדיקת שאלות מנחותמייצר מדריכים גנריים שבודקים את מה שכבר ידועמאיץ טיוטות. החוקר כותב מחדש לפחות חצי.
מתינותרישום הערות בזמן אמת, תיוג בזמן אמת, הצעת בדיקות למנחה אנושילא יכול לקרוא היסוס, אי נוחות או את ההשהיה שלפני שקר מנומסלעולם לא אוטונומי. כלי תמיכה למנחה אנושי.
תַעֲתוּקהפרדת רמקולים, חותמת זמן, ניקוי במעבר ראשוןדיוק התמלול הטורקי יורד בחדות עקב ז'רגון דומיין, שמות מותג והחלפת קודבצע אוטומציה, ולאחר מכן בדוק נקודתית 10% מול אודיו.
קידוד ותיוגיישום עקבי של ספר קודים קיים על פני מאות תמלילים במהירותהמצאת קודים חדשים באמצע הקורפוס; ריכוז בעיות שונות לתווית נוחה אחתאוטומציה באמצעות ספר קוד קבוע שנכתב על ידי בני אדם.
סינתזהקיבוץ, חשיפת דפוסים חוצי משתתפים, ניסוח הנרטיב הראשוןמבלבל בין תדירות לחשיבות; מחליק על המשתתף המתנגדטיוטה בלבד. כל ערכת נושא עוברת למקור לפני שהיא נשלחת.
ניתוח משוב מתמשךביקורות על חנות האפליקציות, פניות תמיכה, תיאורי NPS מילה במילה, יומני צ'אט בנפח שאף צוות לא יכול לקרוא ידניתניקוד סנטימנטים קורא סרקזם ועקיפות תרבותית בצורה גרועהאוטומציה בעלת ערך גבוה עם בדיקות דגימה.
בניית חפציםפרסונות, מפות מסע, עצי הזדמנויות מתשומות מאומתותמייצר חפצים סבירים מתוך ראיות דלות או חסרותרק ממחקר מאומת, לעולם לא מהידע של העולם של המודל.

שתי שורות בטבלה הזו שוות יותר מכל השאר ביחד.

קידוד בקנה מידה גדול. אם יש לכם ספר קודים שכתב אדם, יישום עקבי שלו על פני 40 תמלילים הוא בדיוק סוג מודלי העבודה המייגעים והעוקבים אחר כללים אמינים בהם. זה המקום שבו נמצא רוב הזמן שניתן לשחזר.

ניתוח משוב מתמשך. רוב החברות יושבות על אלפי ביקורות מחנויות אפליקציות, פניות תמיכה וסקרים מילה במילה שאף אחד לא קרא מאז שהגיעו. זהו השימוש בבינה מלאכותית בעל התשואה הגבוהה ביותר והסיכון הנמוך ביותר בכל התחום, כי אתם לא מחליפים מחקר שהתרחש - אתם קוראים נתונים שנזרקו לפח. אנו מכסים זאת לעומק ב... כיצד בינה מלאכותית יכולה להפוך משוב משתמשים לתובנות מוצר מעשיות.

ארבעת מצבי הכשל שאנחנו ממשיכים לתפוס

אלו אינם סיכונים תיאורטיים. אלו הדברים הספציפיים שמשתבשים בפרויקטים אמיתיים, בסדר יורד בערך של התדירות שבה אנו מזהים אותם.

1. תדירות במסווה של חשיבות

בקשו ממודל לסכם עשרים ראיונות והוא יבליט בחזית מה נאמר בתדירות הגבוהה ביותר. אבל ערך המחקר בדרך כלל אינו בתגובה המודאלית. הוא נמצא במשתתף האחד שנטש את הזרימה לחלוטין, או בשניים שתיארו את אותה פתרון עוקף באופן עצמאי, או בקטע שמעולם לא הגיע לשלב שכולם דנו בו.

מודל המסכם מחקר של ביצוע רכישה יגיד לכם ששקיפות עלויות המשלוח עלתה שוב ושוב. הוא לא יגיד לכם ששני המשתתפים היחידים שהשלימו את הרכישה כבר היו מחוברים - וזהו הממצא בפועל, וזה מופיע בקורפוס רק כהיעדרות.

הצ'ק שלנו: אנו מבקשים במפורש את עמדת המיעוט. "איזה משתתף לא הסכים עם הקונצנזוס המתהווה, ומה הוא אמר?" אם המודל אינו יכול לנקוב בשם של משתתף, אנו מתייחסים לסיכום כלא שלם ולא כראיה להסכמה.

2. המצאה שוטפת

מודלים מייצרים ציטוטים שנשמעים בדיוק כמו משהו שמשתתף היה אומר, מיוחסים למשתתף שלא אמר את זה. לא לעתים קרובות. לעתים קרובות מספיק. והכישלון בלתי נראה בבדיקה, כי ציטוט מפוברק נשמע טוב יותר מציטוט אמיתי - אנשים אמיתיים מדברים בקטעים.

הצ'ק שלנו: כל ציטוט שמגיע לקליינט נושא הפניה לתמלול וחותמת זמן. אם לא ניתן לאתר אותו באודיו המקורי, הוא לא יישלח. זהו כלל מכני, לא שיקול דעת, כי שיקול דעת הוא בדיוק מה שנכשל כאן.

3. סינתזה חנפנית

תנו מודל עם ההשערה שלכם ואז את הנתונים שלכם, והסינתזה תתמוך בהשערה שלכם. תנו להם את אותם נתונים עם ההשערה ההפוכה והסינתזה תתמוך בה. זהו מצב הכישלון היקר ביותר בהקשר של ייעוץ, משום שהוא מייצר בדיוק את התוצר שהלקוח רצה תוך כדי שהוא הורס את הסיבה שהוא שכר אתכם.

הצ'ק שלנו: הנחיות סינתזה לעולם אינן מכילות את ההשערה. המודל מקבל את הקורפוס ואת שאלת המחקר, שום דבר אחר. כאשר אנו רוצים שהשערה תבדק, אנו מפעילים אותה כמעבר נפרד, עוין: "מצא את הראיות החזקות ביותר בקורפוס זה". נגד הטענה הבאה".

4. משתמשים סינתטיים

היישום המשווק הכי בטוח והכי פחות ניתן להגנה: יצירת משתתפים מדומים וראיונות איתם במקום אנשים. הוא מייצר תמלילים סבירים במהירות, והסבירות היא בדיוק הבעיה. מודל שאומן באינטרנט יגיד לכם איזו פרסונה... נשמע כמו, שהוא סיכום של איך כותבים על אנשים כאלה - לא איך הם מתנהגים כאשר אימות הטופס שלך דוחה את כתובתם בניסיון השלישי.

משתמשים סינתטיים שימושיים למטרה אחת: תרגול של מדריך דיון לפני שאתם מקדישים אותו למשתתף אמיתי. אנחנו משתמשים בהם לשם כך. אנחנו לא משתמשים בהם כראיות, ואנחנו לא מדווחים על התפוקה שלהם כממצאי מחקר. אם ספק מציע לכם תוכנית מחקר ללא משתתפים אנושיים, הוא מוכר לכם דרך יקרה מאוד לאשר את מה שאתם כבר מאמינים בו.

פרוטוקול העבודה שלנו

זהו הרצף בפועל, לא רצף אידיאלי.

1. בני אדם כותבים קודם את ספר הקודים. לפני שכל מודל נוגע בתמליל, חוקר קורא שלושה עד חמישה ראיונות ובונה את מסגרת הקידוד באופן ידני. המסגרת מגיעה מנתוני המחקר הזה, ולא מטקסונומיית חוויית משתמש גנרית. כל דבר במורד הזרם יורש את איכותו משלב זה, ולכן זהו השלב שלעולם לא דוחסים אותו.

2. המודל מיישם את המסגרת, ורק את המסגרת. ספר קודים קבוע, ללא קטגוריות חדשות באמצע הריצה. כאשר המודל נתקל במשהו שהמסגרת אינה מכסה, הוא מסמן אותו כלא מסווג במקום לכפות התאמה. ערימת ה-un-savong היא לעתים קרובות הפלט המעניין ביותר של הריצה כולה.

3. קודדו פעמיים מדגם של 15%. אותם תמלילים מקודדים על ידי אדם ועל ידי המודל באופן עצמאי, ואנחנו מודדים את שיעור אי-ההסכמה. מתחת ל-10% ואנחנו ממשיכים. מעל 20% וספר הקודים שגוי, לא המודל - אנחנו חוזרים לשלב הראשון. שיעור אי-ההסכמה הוא אבחון של המסגרת, והתייחסות אליו בדרך זו חסכה לנו יותר מאשר התייחסות אליו כאל שער איכות בכלי העבודה.

4. טיוטת סינתזה ללא השערה בהנחיה. המודל מקבל קורפוס ושאלת מחקר. הוא מייצר אשכולות ונרטיב ראשון.

5. מעבר מעקב. כל טענה בטיוטה מקושרת לשני משתתפים לפחות, עם חותמות זמן. טענות שלא ניתן לאתר אותן נמחקות, לא מתרככות. טענה הנתמכת על ידי משתתף אחד בלבד מתויגת כתצפית יחידה, וזה דבר לגיטימי ולעתים קרובות בעל ערך לדיווח - אך לא כנושא.

6. טריאנגולציה מול נתונים התנהגותיים. התנהגות מוצהרת והתנהגות נצפית שונות זו מזו כל הזמן. אנו בודקים את ממצאי הראיונות מול הקלטות הפגישות ונתוני מפת חום - קליקים מזעם, קליקים ללא נוכחות, נקודות ירידה - לפני שמשהו מגיע ללקוח. כאשר משתתפים אומרים שהמסנן תקין וההקלטות מראות שהם נוטשים את המסנן, ההקלטות מנצחות. כאן גם סביר להניח שעבודה איכותנית המונעת על ידי בינה מלאכותית תיתפס, מכיוון שנתונים התנהגותיים לא אכפת להם עד כמה הנרטיב היה קוהרנטי.

7. אדם כותב את ההמלצה. ניתן לאסוף ממצאים בעזרת סיוע. מה לעשות בנידון, בארגון הזה, עם האילוצים האלה ומפת הדרכים הזו, זו החלטה שנתפסת על ידי מישהו שנכח בראיונות.

מה שאנחנו לא עושים באופן אוטומטי

רשימה קצרה, ואנחנו מחזיקים בה בתוקף.

  • ניהול ראיונות עם משתמשים פגיעים או במצוקה. שירותי בריאות, קשיים כלכליים, מחקר נגישות. תפקידו של המנחה שם הוא בחלקו חובת זהירות, וזו אינה ניתנת להאצלה.
  • ההמלצה. ראה שלב שבע.
  • הערכת נגישות. כלים אוטומטיים - כולל שלנו כלי ביקורת WCAG — תופס בערך שליש מבעיות WCAG. השאר דורשות בדיקה ידנית באמצעות טכנולוגיה מסייעת. כל ספק הטוען לכיסוי אוטומטי מלא מתאר סריקה, לא ביקורת.
  • להחליט מה לא לחקור. קביעת היקף היא המקום שבו נוצר או נהרס רוב ערך המחקר, וזוהי שיחה אסטרטגית, לא משימת סיכום.

הערה על מחקר בשפה הטורקית

רוב ההנחיות המתפרסמות בנוגע למחקר בסיוע בינה מלאכותית כתובות ומאומתות באנגלית, ופער הביצועים הוא אמיתי ולא נדון מספיק.

התעתוק הטורקי יורד באופן ניכר סביב שמות מותגים, ז'רגון מגזרי והחלפת קוד אנגלית-טורקית שהיא נורמלית לחלוטין בצוותי מוצרים ומסחר אלקטרוני באיסטנבול. סיווג סנטימנטים מטפל בצורה גרועה בעקיפות טורקית - הגידור המנומס שקודם לתלונה רצינית נקרא לעתים קרובות כניטרלי או חיובי עבור מסווג שאומן בעיקר באנגלית. מורפולוגיה אגלוטינטיבית פירושה גם שגישות תדירות מילות מפתח לנתוני סקר פתוחים נספרות בחסר, מכיוון שמושג יחיד מופיע בתריסר צורות מוטות שהמסווג מתייחס אליהן כלא קשורות.

השלכות מעשיות: העלו את שיעור בדיקות התמלול הספציפיות שלכם מעל ל-10% שהייתם משתמשים בהם לאנגלית, לעולם אל תסתמכו על סנטימנט אוטומטי כאות עצמאי בקורפוסים טורקיים, ותקפו כל מסווג על דגימה טורקית שסומנה ידנית לפני שאתם סומכים על הפלט שלה בנפח. אנו מפעילים מערך אימות משלנו בדיוק מסיבה זו.

איך לדעת אם זה עובד

מהירות היא המדד הלא נכון. כולם נהיים מהירים יותר; השאלה היא האם התפוקה שורדת את המגע עם המציאות. שלושה מדדים שאנחנו עוקבים אחריהם:

שיעור ההישרדות של תובנה. מבין הממצאים שהוצגו בדוח מחקר, איזה חלק עדיין נחשב תקף שישה חודשים לאחר מכן? זה לא נוח למדידה ושווה כל טיפת אי נוחות.

שיעור אי הסכמה בין מודלים אנושיים. משלב שלוש לעיל. עקבו אחריו לאורך זמן. חילוקי דעות גוברים בדרך כלל משמעותם שתחום המחקר השתנה וספר הקודים לא.

הזמן מהראיון האחרון ועד להשערה הראשונה הניתנת לבדיקה. זה המספר שבינה מלאכותית באמת מניעה. אם סינתזה הייתה ארכה שמונה ימים ועכשיו לוקחת יומיים, מדובר בשני מחזורי ניסוי נוספים לרבעון - וזהו הרעיון העסקי האמיתי, והוא טוב. זה פשוט לא הרעיון שרוב הספקים טוענים.

הולך עמוק יותר

מאמר זה הוא סקירה כללית. ארבעה חלקים נלווים מכסים את השלבים השונים בפירוט:

שאלות נפוצות

האם בינה מלאכותית יכולה להחליף לחלוטין ראיונות עם משתמשים? לא. זה יכול להחליף חלק מהעבודה סביב ראיונות - תמלול, קידוד, סינתזה במעבר ראשון - וזה יכול לעזור לך להכין ראיונות טובים יותר. זה לא יכול לייצר ראיות לגבי איך אנשים מתנהגים, כי אין לו גישה להתנהגות שלהם. משתתפים מדומים מספרים לך איך אנשים כאלה מתוארים בטקסט, וזה דבר שונה ולעתים קרובות מטעה.

כמה זמן חוסך מחקר בסיוע בינה מלאכותית בפועל? מניסיוננו, החיסכון מתרכז כמעט לחלוטין בסינתזה ובקידוד, שם הוא משמעותי. עבודת השטח, הגיוס והתאמה בין בעלי העניין נותרו ללא שינוי. ציפייה ריאלית ממחקר מתווך היא ששלב שלאחר עבודת השטח יתכווץ משמעותית בעוד שמשך הפרויקט הכולל יקטן בהרבה - מכיוון שעבודת השטח תמיד הייתה הקוטב הארוך.

האם משתמשים סינתטיים אי פעם לגיטימיים? ככלי חזרה עבור מדריכי דיון וכדרך לבחינת לחץ של ניסוח סקר, כן. כראיה בממצא מחקר, לא. ההבדל חשוב: האחד הוא כלי עזר להכנה, השני הוא נתונים מפוברקים עם תווית מחקר עליהם.

מהו הסיכון הגדול ביותר? פלט בטוח, שוטף, שגוי - ובמיוחד הגרסה שלו שתואמת את מה שהצוות כבר האמין בו. ציטוטים מפוברקים נתפסים על ידי כללי עקיבות. סינתזה חנפנית קשה יותר, משום שהיא מייצרת תוצר שכולם מרוצים ממנו. ההגנה האמינה היחידה היא הפרדת ההשערה מהנחיית הסינתזה והפעלת מעבר עוין מפורש.

האם מחקר בסיוע בינה מלאכותית עובד גם בטורקית? לא משהו יוצא דופן. דיוק התעתוק, סיווג הסנטימנט ושיטות תדירות מילות המפתח - כולם פוגעים בטורקית יחסית לאנגלית. היא שמישה ואנחנו משתמשים בה מדי יום, אך היא דורשת שיעורי דגימה גבוהים יותר, מסווגים מאומתים וחוקר שקורא את השפה.

רוצה חוות דעת שנייה על תהליך המחקר שלך?

אם אתם מנהלים מחקר בסיוע בינה מלאכותית ורוצים לדעת האם הממצאים שלכם יעמדו במבחן הבדיקה - או שאתם מחליטים מה להפוך לאוטומטי ועל מה להגן - נבחן את התהליך הנוכחי שלכם ונאמר לכם בבירור היכן טמון הסיכון.

 


צ'אגדאש פולאט

נכתב על ידי

צ'אגדאש פולאט

צ'אגדאש פולאט הוא מייסד שותף של Switas, שם הוא מוביל ייעוץ טכנולוגי וצמיחה עבור מותגים בתחומי המסחר האלקטרוני, התיירות, שירותי הבריאות והמגזר הציבורי. בוגר מדעי המחשב שעבר מפיתוח תוכנה לתפקידים בכירים בשיווק, מוצר ואסטרטגיה בעשור האחרון, וכיום הוא מייעץ לחברות בנושאי CRO, אנליטיקה ובניית מערכות צמיחה שעומדות במבחן הזמן.

לינקדין

מאמרים נוספים

סוויטאס כפי שנראה ב

Magnify: הרחבת שיווק משפיענים עם Engin Yurtdakul

צפו במחקר המקרה שלנו בנושא Microsoft Clarity

הדגשנו את Microsoft Clarity כמוצר שנבנה תוך מחשבה על מקרי שימוש מעשיים מהעולם האמיתי, על ידי אנשי מוצר אמיתיים שמבינים את האתגרים העומדים בפני חברות כמו Switas. תכונות כמו קליקים של זעם ומעקב אחר שגיאות ב-JavaScript הוכיחו את עצמן כבעלות ערך רב בזיהוי תסכולים ובעיות טכניות של משתמשים, מה שאפשר שיפורים ממוקדים שהשפיעו ישירות על חוויית המשתמש ועל שיעורי ההמרה.