사용자 조사에서의 AI 활용: 무엇이 효과적이고, 무엇이 실패하며, 어디까지 허용해야 할까?

사용자 조사에서의 AI 활용: 무엇이 효과적이고, 무엇이 실패하며, 어디까지 허용해야 할까?

병목 현상은 면접 자체가 아니었습니다.

AI와 사용자 연구에 관한 모든 기사는 똑같은 말로 시작합니다. 연구는 느리지만 AI는 그것을 빠르게 만든다는 것입니다. 이러한 관점 자체가 틀린 것은 아니지만, 월요일 아침에 실제로 무엇을 바꿔야 할지 결정할 때는 너무나 부정확해서 도움이 되지 않습니다.

더 정확한 설명은 다음과 같습니다. 사회자가 진행하는 인터뷰는 60분이 소요되며, 이는 항상 마찬가지입니다. 왜냐하면 인터뷰 대상자는 60분 동안 이야기해야 하기 때문입니다. 예전에는 4일이 걸리던 작업이 이제는 완전히 달라졌습니다. 그 과정은 녹취록 작성, 태그 지정, 세 명의 참가자가 서로 다른 어휘로 같은 말을 한 순간을 찾아내고, 스프린트가 종료되기 전에 제품 관리자가 조치를 취할 수 있는 정보로 바꾸는 것입니다.

시간이 흐른 곳도 바로 그곳이고, 언어 모델이 강점을 보이는 곳도 바로 그곳입니다. 언어 모델은 텍스트에서 패턴을 찾아내는 도구입니다. 연구 종합 역시 텍스트에서 패턴을 찾아내는 문제입니다. 따라서 둘 사이의 적합성은 분명합니다.

하지만 합성을 잘하게 만드는 바로 그 특성이 동시에 위험하기도 합니다. 패턴을 찾아내는 모델은 패턴이 실제로 존재하든 존재하지 않든 패턴을 찾아내고, 자신이 만들어낸 패턴을 실제 패턴과 똑같이 확신에 찬 어조로 설명합니다. 연구에서 확신에 찬 잘못된 주제는 주제가 없는 것보다 더 나쁩니다. 왜냐하면 잘못된 주제가 구축되기 때문입니다.

그래서 질문은 그렇지 않습니다. 여부 사용자 조사에 AI를 활용하는 것은 이미 모두가 하고 있는 일입니다. 문제는 프로세스의 어떤 부분을 AI에 맡길지, 결과물을 신뢰하기 전에 무엇을 확인할지, 그리고 어떤 부분을 자동화하지 않을지입니다. 이 글은 바로 그 점에 대해 다룹니다.

인공지능이 진정으로 제자리를 찾는 곳

우리는 AI 도입을 단일 결정으로 취급하는 대신 연구 프로세스의 단계별로 적용합니다. 각 단계는 위험 프로필이 매우 다르기 때문입니다.

단계인공지능이 잘하는 것무엇이 잘못되었는가우리의 규칙
채용 및 선발사전 질문지 작성, 사전 질문지 응답에서 모순되는 답변 발견, 전문 응답 가능성이 높은 사람 식별명확하게 의견을 표현하는 참여자만 선별하고, 가장 필요한 불만스러운 사용자는 걸러냅니다.보조 역할만 합니다. 최종 패널 승인은 담당자가 직접 수행합니다.
토론 가이드연구 질문에서 초안을 작성하고, 후속 탐구 질문을 제안하고, 유도 질문이 없는지 확인합니다.이미 알려진 내용을 검증하는 일반적인 가이드를 생성합니다.초안 작성 속도 향상 프로그램. 연구자는 최소 절반을 다시 작성합니다.
절도실시간 메모 작성, 실시간 태그 지정, 인간 진행자에게 질문 제안 기능망설임, 불편함, 또는 정중한 거짓말을 하기 전의 멈칫거림을 읽어낼 수 없다.자율적으로 운영되지 않습니다. 인간 운영자를 위한 보조 도구입니다.
전사화자 분리, 타임스탬핑, 1차 정리터키어 음성 인식 정확도는 전문 용어, 브랜드 이름, 코드 스위칭 등으로 인해 급격히 떨어집니다.자동화한 다음, 오디오를 기준으로 10%를 무작위로 검사합니다.
코딩 및 태깅기존 코드북을 수백 건의 녹취록에 일관되게 신속하게 적용데이터 분석 도중에 새로운 코드를 만들어내고, 서로 다른 문제들을 하나의 편리한 명칭으로 통합하는 것고정된, 사람이 직접 작성한 코드북을 사용하여 자동화하세요.
합성클러스터링, 참여자 간 패턴 파악, 첫 번째 내러티브 초안 작성빈도와 중요성을 혼동하고, 반대 의견을 제시하는 참여자를 무마시킨다.초안일 뿐입니다. 모든 테마는 출시 전에 출처를 추적합니다.
지속적인 피드백 분석앱 스토어 리뷰, 고객 만족도 조사 결과, 채팅 기록 등 팀에서 수작업으로 읽을 수 없는 방대한 양의 자료감정 분석 점수 기능은 비꼬는 말투와 문화적 간접 표현을 제대로 읽지 못합니다.샘플링 검사를 포함한 고부가가치 자동화.
유물 제작검증된 입력값을 기반으로 페르소나, 여정 지도, 기회 트리 생성증거가 부족하거나 아예 없는 상황에서도 그럴듯한 결과물을 만들어낸다.검증된 연구 결과만을 기반으로 하며, 모델의 세계관에 기반한 지식은 절대 사용해서는 안 됩니다.

그 표에서 두 행의 가치가 나머지 행들의 가치를 합친 것보다 더 큽니다.

대규모 코딩. 만약 사람이 작성한 코드북이 있다면, 40개의 녹취록에 걸쳐 일관되게 적용하는 것은 모델이 신뢰할 수 있는 지루하고 규칙에 충실한 작업입니다. 실제로 복구 가능한 시간의 대부분은 바로 이 부분에서 발생합니다.

지속적인 피드백 분석. 대부분의 기업은 수천 건의 앱 스토어 리뷰, 고객 지원 티켓, 설문 조사 데이터 등을 쌓아두고 있지만, 정작 그 누구도 제대로 읽어보지 않은 경우가 많습니다. 이는 인공지능을 가장 효과적으로 활용하면서도 위험 부담이 가장 적은 분야입니다. 기존에 진행되던 연구를 대체하는 것이 아니라, 버려지고 있던 데이터를 분석하는 것이기 때문입니다. 이 부분은 저희 콘텐츠에서 자세히 다루고 있습니다. AI가 사용자 피드백을 실행 가능한 제품 인사이트로 전환하는 방법.

우리가 계속해서 포착하는 네 가지 실패 모드

이것들은 이론적인 위험이 아닙니다. 실제 프로젝트에서 발생하는 구체적인 문제점들을 발견 빈도 순으로 나열한 것입니다.

1. 빈도가 중요성으로 위장함

모델에게 20개의 인터뷰 내용을 요약해 달라고 요청하면, 모델은 가장 자주 언급된 내용을 강조할 것입니다. 하지만 연구의 가치는 대개 가장 흔한 답변에 있는 것이 아닙니다. 오히려 몰입 상태를 완전히 포기한 참가자 한 명, 혹은 같은 해결책을 독립적으로 설명한 두 명, 또는 다른 사람들이 논의했던 단계에 전혀 도달하지 못한 참가자 한 명에게서 그 가치를 찾을 수 있습니다.

결제 과정을 요약한 모델은 배송비 투명성 문제가 반복적으로 제기되었다는 사실만 알려줄 뿐입니다. 하지만 실제 연구 결과이자 데이터 세트에서는 나타나지 않는 현상인, 구매를 완료한 단 두 명의 참가자가 모두 이미 로그인한 상태였다는 사실은 알려주지 않습니다.

저희가 확인한 내용: 우리는 소수 의견을 명시적으로 묻습니다. "어떤 참가자가 형성된 합의에 동의하지 않았으며, 그들은 무엇을 말했습니까?" 만약 모델이 소수 의견을 제시한 참가자를 특정할 수 없다면, 우리는 그 요약을 합의의 증거가 아니라 불완전한 것으로 간주합니다.

2. 유창한 발명

모델은 참여자가 실제로 하지 않은 말을 마치 한 것처럼 들리는 인용구를 만들어냅니다. 이런 경우는 드물지만, 종종 발생합니다. 그리고 이러한 오류는 육안으로 확인하기 어렵습니다. 조작된 인용구가 실제 인용구보다 더 자연스럽게 읽히기 때문입니다. 실제 사람들은 단편적인 말만 하는 경향이 있습니다.

저희가 확인한 내용: 클라이언트에게 전달되는 모든 견적서에는 녹취록 참조 번호와 타임스탬프가 포함됩니다. 원본 오디오에서 해당 정보를 찾을 수 없는 경우, 견적서는 발송되지 않습니다. 이는 판단의 문제가 아니라 기계적인 규칙입니다. 왜냐하면 바로 여기서 판단력이 부족하기 때문입니다.

3. 아첨꾼의 합성

모델에 가설과 데이터를 입력하면, 분석 결과는 가설을 뒷받침할 것입니다. 반대로, 동일한 데이터에 반대되는 가설을 입력하면 분석 결과는 반대되는 가설을 뒷받침할 것입니다. 이는 컨설팅 업계에서 가장 비용이 많이 드는 실패 유형인데, 고객이 원하는 결과물을 내놓으면서도 고객이 당신을 고용한 근본적인 이유를 무너뜨리기 때문입니다.

저희가 확인한 내용: 합성 프롬프트에는 가설이 절대 포함되지 않습니다. 모델은 코퍼스와 연구 질문만 입력받습니다. 그 외에는 아무것도 입력받지 않습니다. 가설 검증이 필요할 때는 별도의 적대적 검증 단계로 실행합니다. 즉, "이 코퍼스에서 가장 강력한 증거를 찾아라"와 같이 실행합니다. 반대 다음 주장을 하십시오.

4. 합성 사용자

가장 자신감 넘치게 홍보되지만 가장 방어력이 떨어지는 활용법은 가상 참가자를 생성하고 실제 사람 대신 이들을 인터뷰하는 것입니다. 이 방법은 그럴듯한 녹취록을 빠르게 생성하지만, 바로 그 그럴듯함이 문제입니다. 인터넷에서 학습된 모델은 특정 인물이 어떤 사람인지 알려줄 수 있습니다. ~처럼 들리다이는 그러한 사람들에 대해 글이 어떻게 쓰여지는지를 요약한 것이지, 세 번째 시도에서 주소 유효성 검사가 실패했을 때 그들이 어떻게 행동하는지를 보여주는 것이 아닙니다.

가상 사용자는 단 한 가지 용도로 유용합니다. 바로 실제 참가자를 투입하기 전에 토론 가이드를 미리 연습해 보는 것입니다. 저희는 이러한 목적으로 가상 사용자를 활용합니다. 하지만 가상 사용자를 증거로 사용하거나 그 결과를 연구 결과로 보고하지는 않습니다. 만약 공급업체가 실제 참가자가 없는 연구 프로그램을 제안한다면, 그들은 여러분이 이미 믿고 있는 것을 확인하는 매우 값비싼 방법을 제공하는 것입니다.

우리의 업무 프로토콜

이것은 이상화된 순서가 아니라 실제 순서입니다.

1. 인간이 먼저 코드북을 작성합니다. 모델이 녹취록을 사용하기 전에 연구원은 3~5개의 인터뷰를 읽고 코딩 프레임을 직접 구축합니다. 이 프레임은 일반적인 UX 분류 체계가 아닌 해당 연구의 데이터를 기반으로 합니다. 이후의 모든 과정은 이 단계의 품질을 계승하기 때문에 이 단계를 절대 단축하지 않습니다.

2. 이 모델은 프레임만을 적용합니다. 고정된 코드북을 사용하며, 실행 도중에 새로운 범주를 추가하지 않습니다. 모델은 프레임에 포함되지 않은 항목을 만나면 강제로 분류하는 대신 미분류로 표시합니다. 미분류 항목들은 전체 실행 결과 중 가장 흥미로운 경우가 많습니다.

3. 15% 샘플을 이중 코딩합니다. 동일한 녹취록을 사람과 모델이 각각 독립적으로 코딩하고, 불일치율을 측정합니다. 불일치율이 10% 미만이면 다음 단계로 진행하고, 20% 이상이면 모델이 아닌 코드북에 오류가 있는 것이므로 1단계로 돌아갑니다. 불일치율은 프레임워크에 대한 진단 지표이며, 이를 도구의 품질 검사 기준으로 사용하는 것보다 진단 기준으로 사용하는 것이 더 많은 시간을 절약할 수 있습니다.

4. 질문에 가설이 없는 종합 초안. 이 모델은 코퍼스와 연구 질문을 입력받아 클러스터와 초기 서술을 생성합니다.

5. 추적성 검증 통과. 초안의 모든 주장은 최소 두 명의 참여자와 타임스탬프가 기록됩니다. 추적할 수 없는 주장은 완화되지 않고 삭제됩니다. 단 한 명의 참여자만 지지하는 주장은 단일 관찰로 분류되는데, 이는 보고할 만한 가치가 있는 합법적인 사항이지만 주제로는 간주되지 않습니다.

6. 행동 데이터를 이용한 삼각측량. 진술된 행동과 관찰된 행동은 끊임없이 차이를 보입니다. 우리는 인터뷰 결과를 세션 녹음 파일과 히트맵 데이터(불쾌한 클릭, 비활성 클릭, 이탈 지점)와 대조하여 확인한 후 고객에게 전달합니다. 참가자가 필터에 문제가 없다고 말했는데 녹음 파일에서 필터를 사용하지 않는 모습이 나타난다면, 녹음 파일의 내용이 우선합니다. 행동 데이터는 진술의 일관성을 고려하지 않기 때문에, AI 기반 정성적 연구는 바로 이 부분에서 오류를 범하기 쉽습니다.

7. 사람이 추천 사항을 작성합니다. 조사 결과는 도움을 받아 취합할 수 있습니다. 하지만 이러한 제약 조건과 로드맵을 고려하여 이 조직에서 이러한 결과에 대해 어떻게 조치할지는 인터뷰에 참여했던 사람이 판단해야 할 문제입니다.

우리가 자동화하지 않는 것

짧은 목록이지만, 우리는 그것을 확고히 고수합니다.

  • 취약하거나 심리적으로 힘든 상황에 있는 사용자와의 인터뷰 진행. 의료, 재정적 어려움, 접근성 연구. 이러한 분야에서 중재자의 역할은 부분적으로는 보호 의무이며, 이는 위임할 수 없는 부분입니다.
  • 권고 사항입니다. 7단계를 참조하세요.
  • 접근성 평가. 자동화된 도구 - 당사 자체 도구 포함 WCAG 감사 도구 — 이는 WCAG 위반 사항의 약 3분의 1을 잡아냅니다. 나머지는 보조 기술을 사용한 수동 테스트가 필요합니다. 완전 자동화 테스트를 제공한다고 주장하는 업체는 단순한 스캔을 설명하는 것이지 감사를 설명하는 것이 아닙니다.
  • 무엇을 조사하지 않을지 결정하기. 연구 범위 설정은 연구 가치가 창출되거나 소멸되는 가장 중요한 단계이며, 단순히 요약 작업이 아니라 전략적인 대화입니다.

터키어 연구에 관한 참고 사항

인공지능 지원 연구에 관한 대부분의 지침은 영어로 작성되고 검증되었지만, 성능 격차는 실제로 존재하며 이에 대한 논의는 부족합니다.

터키어 전사는 브랜드 이름, 업계 전문 용어, 그리고 이스탄불의 제품 및 전자상거래 팀에서 흔히 볼 수 있는 영어-터키어 코드 스위칭 주변에서 품질이 현저히 떨어집니다. 감정 분류는 터키어의 간접적인 표현을 제대로 처리하지 못하는데, 심각한 불만 앞에 붙는 완곡한 표현이 영어에 주로 훈련된 분류기에게는 중립적이거나 긍정적으로 인식되는 경우가 많습니다. 또한, 교착어 형태론 때문에 개방형 설문 조사 데이터에 대한 키워드 빈도 분석 방식은 과소평가되는 경향이 있는데, 하나의 개념이 토큰화 프로그램이 서로 관련 없는 것으로 간주하는 수십 가지의 활용형으로 나타나기 때문입니다.

실질적인 결과: 영어 텍스트에 사용하는 10%보다 더 높은 전사 검증률을 적용하고, 터키어 코퍼스에서 자동 감정 분석 결과를 단독 신호로 절대 신뢰하지 않으며, 대량으로 사용하기 전에 수동으로 레이블링된 터키어 샘플로 분류기를 검증하십시오. 저희는 바로 이러한 이유로 자체 검증 세트를 운영하고 있습니다.

제대로 작동하는지 어떻게 알 수 있을까요?

속도는 잘못된 측정 기준입니다. 누구나 더 빨라지지만, 문제는 그 결과물이 현실에 얼마나 잘 부합하느냐입니다. 우리가 실제로 추적하는 세 가지 측정 기준은 다음과 같습니다.

인사이트 생존율. 연구 보고서에 제시된 결과 중 6개월 후에도 여전히 유효한 것으로 간주된 비율은 얼마나 될까요? 이를 측정하는 것은 다소 불편하지만, 그 불편함을 감수할 만한 가치가 충분히 있습니다.

인간과 모델 간의 불일치율. 위의 3단계에서 설명한 대로 시간 경과에 따른 변화를 추적하십시오. 의견 불일치가 커지는 것은 일반적으로 연구 영역이 바뀌었지만 코드북은 바뀌지 않았다는 것을 의미합니다.

마지막 인터뷰 시점부터 검증 가능한 첫 번째 가설을 세우기까지의 시간. 이것이 바로 AI가 실제로 변화시키는 수치입니다. 만약 합성 작업에 8일이 걸리던 것이 이제 2일로 단축되었다면, 분기당 실험 주기가 두 번 더 늘어나는 셈입니다. 이것이 바로 실제 비즈니스 타당성 분석이며, 충분히 가치 있는 분석입니다. 다만 대부분의 벤더들이 주장하는 바와는 다를 뿐입니다.

더 깊이

이 글은 개요이며, 네 편의 관련 글에서 각 단계를 자세히 다룹니다.

자주하는 질문

인공지능이 사용자 인터뷰를 완전히 대체할 수 있을까요? 아니요. 모의 참여는 인터뷰 관련 작업(녹취, 코딩, 1차 요약) 중 일부를 대체할 수 있고, 더 나은 인터뷰를 준비하는 데 도움을 줄 수 있습니다. 하지만 사람들의 행동에 접근할 수 없기 때문에 그들의 행동 방식에 대한 증거를 생성할 수는 없습니다. 모의 참여는 텍스트에서 사람들이 어떻게 묘사되는지를 보여주는데, 이는 실제 행동과는 다른 것이며 종종 오해의 소지가 있습니다.

인공지능을 활용한 연구는 실제로 얼마나 많은 시간을 절약해 줄까요? 경험상 비용 절감은 거의 전적으로 데이터 종합 및 코딩 단계에 집중되며, 그 효과는 상당합니다. 현장 조사, 참가자 모집, 이해관계자 조율은 변함이 없습니다. 조정된 연구에서 현실적으로 기대할 수 있는 것은 현장 조사 이후 단계의 소요 시간이 상당히 단축되는 반면, 전체 프로젝트 기간은 그만큼 줄어들지 않는다는 것입니다. 왜냐하면 현장 조사는 항상 가장 긴 과정이었기 때문입니다.

가상 사용자는 과연 합법적인 사용자일까요? 토론 가이드 연습 도구나 설문 문항의 타당성 검증 도구로는 사용할 수 있습니다. 하지만 연구 결과의 증거로는 사용할 수 없습니다. 이 차이는 중요합니다. 전자는 준비 보조 도구이고, 후자는 연구라는 이름만 붙인 인위적인 데이터일 뿐입니다.

가장 큰 위험은 무엇인가요? 자신감 넘치고 유창하지만 틀린 결과물, 특히 팀이 이미 믿고 있는 내용과 일치하는 결과물을 만들어내는 것. 조작된 인용문은 추적성 규칙에 의해 적발된다. 아첨하는 듯한 합성은 모두가 만족할 만한 결과물을 만들어내기 때문에 적발하기가 더 어렵다. 유일하게 확실한 방어책은 가설과 합성 프롬프트를 분리하여 명시적인 공격자 테스트를 실행하는 것이다.

AI 기반 연구는 터키어에서도 잘 작동할까요? 기본적으로는 적합하지 않습니다. 전사 정확도, 감정 분류, 키워드 빈도 분석 방법 모두 영어에 비해 터키어에서 성능이 저하됩니다. 물론 사용은 가능하고 저희도 매일 사용하고 있지만, 더 높은 샘플링 속도, 검증된 분류기, 그리고 해당 언어를 읽을 수 있는 연구자가 필요합니다.

연구 과정에 대한 다른 의견을 원하시나요?

인공지능 기반 연구를 진행 중이고 그 결과가 검증을 통과할 수 있을지 알고 싶거나, 어떤 부분을 자동화하고 어떤 부분을 보호해야 할지 고민하고 있다면, 저희가 현재 프로세스를 검토하여 위험 요소를 명확하게 알려드리겠습니다.

 


차그다쉬 폴라트

Written by

차그다쉬 폴라트

차그다쉬 폴라트는 스위타스의 공동 창립자로서 전자상거래, 여행, 의료 및 공공 부문 브랜드에 기술 및 성장 컨설팅을 제공하고 있습니다. 컴퓨터 공학 학사 학위를 취득한 그는 지난 10년간 소프트웨어 개발자에서 마케팅, 제품 및 전략 분야의 고위직으로 경력을 쌓아왔으며, 현재는 기업들에게 전환율 최적화(CRO), 분석 및 측정 가능한 성장 시스템 구축에 대한 자문을 제공하고 있습니다.

링크드인

관련 기사

스위타스, 방송 출연

Magnify: Engin Yurtdakul과 함께 인플루언서 마케팅 확장하기

Microsoft Clarity 사례 연구를 확인해 보세요.

저희는 Microsoft Clarity를 ​​Switas와 같은 기업이 직면한 어려움을 이해하는 실제 제품 담당자들이 실용적이고 현실적인 사용 사례를 염두에 두고 개발한 제품으로 강조했습니다. 분노 클릭 및 JavaScript 오류 추적과 같은 기능은 사용자 불만과 기술적 문제를 파악하는 데 매우 유용했으며, 이를 통해 사용자 경험과 전환율에 직접적인 영향을 미치는 맞춤형 개선이 가능했습니다.