人工智能在用户研究中的应用:哪些有效,哪些无效,以及我们的界限在哪里

人工智能在用户研究中的应用:哪些有效,哪些无效,以及我们的界限在哪里

瓶颈从来不在于面试。

所有关于人工智能和用户研究的文章开头都千篇一律:研究进展缓慢,人工智能让研究加速。这种说法本身没错,但它不够精确,以至于当你周一早上决定真正需要改进的地方时,它就毫无用处了。

以下是更准确的版本。进行一次有主持人的访谈需要六十分钟,而且永远如此,因为受访者必须说完六十分钟。过去需要四天才能完成的事情,现在全部都耗时了。 围绕 它——转录、标记、找到三个参与者用三种不同的词汇表达相同意思的时刻,并将其转化为产品经理在冲刺结束前可以采取行动的内容。

时间就这么过去了,而这恰恰是语言模型的优势所在。它们是文本模式匹配器。研究综合本质上就是一个文本模式匹配问题。两者契合度很高。

但正是这种使其擅长综合的特性,也使其在综合方面变得危险。一个能够发现模式的模型,无论模式是否存在,都会找到模式,并且它会用与描述实际存在的模式完全相同的自信语气来描述它所臆造的模式。在研究中,一个自信的错误主题比没有主题更糟糕,因为错误的主题会被构建出来。

所以问题不是 是否 在用户研究中使用人工智能,几乎人人都已经这么做了。问题在于,哪些环节需要交给人工智能处理,哪些环节在信任输出结果前需要检查,以及哪些环节完全拒绝自​​动化。本文将探讨这些问题。

人工智能真正赢得一席之地的地方

我们将人工智能与研究流程逐阶段进行比对,而不是将其视为单一决策。不同阶段的风险状况截然不同。

阶段人工智能的优势它错在哪里?我们的规则
招聘与筛选起草筛选问卷,识别筛选问卷回答中的矛盾答案,标记可能的职业受访者过度筛选,只留下能言善辩的参与者;过滤掉你最需要的那些沮丧的用户。仅作协助。最终评审小组由人工审核。
讨论指南根据研究问题生成初稿,提出后续探究方向,并检查是否存在诱导性问题。生成通用指南,用于测试已知内容。草稿加速器。研究人员至少重写一半的内容。
介绍实时笔记、实时标记、向人工审核员提出调查建议无法解读犹豫、不安,或是礼貌撒谎前的停顿。绝非自主运行。它是人工审核员的辅助工具。
转录说话人分离、时间戳、初步清理土耳其语转录准确率会因领域术语、品牌名称和语码转换而急剧下降。实现自动化,然后抽查 10% 的音频数据。
编码和标签快速地将现有编码手册一致地应用于数百份转录稿。在语料库构建过程中创建新的代码;将不同的问题合并成一个方便的标签。使用固定的、人工编写的代码簿实现自动化。
综合聚类分析、揭示跨参与者模式、撰写第一份叙述混淆了频率和重要性;对持不同意见的参与者进行粉饰。仅供参考。所有主题在发布前都会追溯到源头。
持续反馈分析应用商店评论、支持工单、NPS 反馈、聊天记录等等,数量庞大,任何团队都无法手动阅读。情感评分对讽刺和文化隐晦表达的解读存在偏差。高价值自动化,带抽样检查功能。
人工制品制造基于已验证输入的用户画像、用户旅程图和机会树根据薄弱或缺失的证据,伪造出看似合理的假象。仅来自经过验证的研究,绝不来自模型的世界知识。

表格中两行的价值超过了其余行的总和。

大规模编码。 如果你有一本人工编写的编码手册,要在40份笔录中始终如一地应用它,这正是那种枯燥乏味、墨守成规的工作模式的强项。而这恰恰是大部分可节省时间的地方。

持续反馈分析。 大多数公司都积压着成千上万条应用商店评论、支持工单和调查问卷,自发布以来就无人问津。这是人工智能在整个领域中回报最高、风险最低的应用,因为你并非在取代之前的研究,而是在解读那些被丢弃的数据。我们在下文中对此进行了深入探讨。 人工智能如何将用户反馈转化为可执行的产品洞察.

我们不断发现的四种失效模式

这些并非理论上的风险,而是实际项目中确实会出错的具体情况,大致按我们发现它们的频率降序排列。

1. 频率伪装成重要性

如果让模型总结二十次访谈,它会突出显示出现频率最高的内容。但研究价值通常不在于最常见的回答,而在于那些完全放弃既定流程的参与者,或是那些分别描述了相同变通方法的两位参与者,又或是那些从未讨论到其他参与者都在讨论的步骤的片段。

总结结账研究的模型会告诉你,运费透明度被反复提及。但它不会告诉你,完成购买的两名参与者都已登录——这才是实际发现,而这一发现仅在语料库中以缺失值的形式出现。

我们的核查: 我们明确询问少数派观点。“哪位参与者不同意逐渐形成的共识,他们说了什么?”如果模型无法指出,我们将摘要视为不完整,而不是同意的证据。

2. 流畅的发明

模型生成的引语听起来完全像是某个参与者会说的话,但却被归于一个实际上并未说过这句话的参与者名下。这种情况并不常见,但也时有发生。而且,这种错误在仔细检查时很难察觉,因为捏造的引语比真实的引语读起来更流畅——毕竟,真实的人说话往往是片段式的。

我们的核查: 每一条提交给客户的引文都带有文字稿编号和时间戳。如果无法在源音频中找到,则不会交付。这是一条硬性规定,而非主观判断,因为主观判断在这里恰恰失效了。

3. 谄媚式综合

给模型提供你的假设和数据,综合分析结果会支持你的假设。如果提供相同的数据但假设相反,综合分析结果也会支持相反的假设。这是咨询领域最昂贵的失败模式,因为它虽然交付了客户想要的成果,却破坏了他们聘请你的初衷。

我们的核查: 合成提示中从来不包含假设。模型只会接收到语料库和研究问题,仅此而已。当我们想要检验某个假设时,我们会单独运行一次对抗性测试:“在这个语料库中找到最有力的证据”。 以下说法:“

4. 合成用户

最自信地推销却最站不住脚的应用:生成模拟参与者并对他们进行采访,而不是采访真人。它能快速生成看似合理的访谈记录,而这种合理性恰恰是问题所在。一个在互联网上训练的模型会告诉你一个人物角色应该具备哪些特质。 听起来好像这段文字总结了人们对这类人的描述,而不是当你的表单验证在第三次尝试中拒绝他们的地址时他们的行为。

虚拟用户只有一个用途:在正式启用真实参与者之前,用来演练讨论指南。我们正是出于这个目的使用它们。我们不会将它们作为证据,也不会将它们的输出结果作为研究成果进行报告。如果供应商向您提供的研究项目不包含任何人类参与者,那么他们实际上是在向您兜售一种极其昂贵的、用来验证您已有观点的方法。

我们的工作流程

这是实际的顺序,而不是理想化的顺序。

1. 人类首先编写了代码簿。 在任何模型应用于访谈记录之前,研究人员会阅读三到五份访谈记录,并手工构建编码框架。该框架源自本研究的数据,而非通用的用户体验分类法。后续所有步骤的质量都取决于此,因此我们绝不压缩此步骤。

2. 该模型应用框架,且仅应用框架。 代码簿已固定,运行过程中不会新增类别。当模型遇到框架未涵盖的内容时,会将其标记为未分类,而不是强制拟合。未分类的内容往往是整个运行过程中最有价值的输出。

3. 对 15% 的样本进行双重编码。 同一份文本记录分别由人工和模型独立编码,我们测量不一致率。低于 10% 则继续进行。高于 20% 则说明编码手册出错,而非模型出错——我们需要返回第一步。不一致率是对框架的诊断,将其作为框架的诊断指标,比将其作为工具的质量门控指标更为有效。

4. 题目中不包含假设的综合性草稿。 该模型接收语料库和研究问题,生成聚类结果和初步叙述。

5. 可追溯性通过。 草稿中的每一项主张都会关联至少两位参与者,并附上时间戳。无法追溯的主张将被删除,而非弱化。仅由一位参与者支持的主张会被标记为“单条观察结果”,这本身是合法且通常有价值的信息,但不能作为主题进行报告。

6. 利用行为数据进行三角测量。 陈述行为与观察到的行为之间总是存在差异。在将任何内容提交给客户之前,我们会将访谈结果与会话录音和热图数据(例如愤怒点击、无效点击、流失点)进行比对。如果参与者表示过滤器没问题,而录音显示他们放弃了使用过滤器,那么录音结果优先。这也是人工智能驱动的定性研究最容易出错的地方,因为行为数据并不关心叙述是否连贯。

7. 由人撰写推荐信。 调查结果可以在协助下整理。至于在这个组织、在这些限制条件和现有路线图下,如何处理这些结果,则需要参与访谈的人员做出判断。

我们不自动化的部分

入围名单,我们坚决保留。

  • 对弱势或情绪低落的用户进行访谈的引导。 医疗保健、经济困难、无障碍研究。主持人的职责之一是尽到应有的注意义务,这是不可推卸的。
  • 建议。 参见第七步。
  • 无障碍评估。 自动化工具——包括我们自己的 WCAG 审核工具 ——大约能发现三分之一的 WCAG 问题。其余问题需要借助辅助技术进行人工测试。任何声称能提供完全自动化覆盖的供应商,描述的都只是扫描,而非审核。
  • 决定哪些内容不去研究。 研究范围界定是大多数研究价值产生或丧失的地方,它是一项战略性对话,而不是一项总结任务。

关于土耳其语研究的一点说明

目前已发布的 AI 辅助研究指南大多以英文撰写和验证,而性能差距是真实存在的,但却鲜有讨论。

土耳其语转录在品牌名称、行业术语以及伊斯坦布尔产品和电商团队中常见的英土语转换方面表现明显下降。情感分类对土耳其语的间接表达处理不佳——在严肃抱怨之前常用的礼貌性缓和语,对于主要基于英语训练的分类器来说,往往会被解读为中性或正面。黏着语形态也意味着,由于同一个概念会以十几种词形变化出现,而分词器会将其视为互不相关,因此使用关键词频率方法分析开放式调查数据会严重低估结果。

实际后果:将转录抽查率提高到高于英语的 10%;切勿将自动情感分析作为土耳其语语料库的独立信号;在大量使用任何分类器的输出结果之前,务必先用人工标注的土耳其语样本对其进行验证。我们正是出于这个原因运行了自己的验证集。

如何判断它是否有效

速度并非衡量标准。每个人都会进步,关键在于这种进步能否经受住现实的考验。我们实际追踪的三项指标是:

洞察力存活率。 在研究报告中公布的发现中,有多少比例在六个月后仍然有效?衡量这一点虽然令人不适,但绝对值得。

人机模型不一致率。 从上述第三步开始。持续跟踪。分歧的增加通常意味着研究领域发生了变化,而编码手册却没有相应更新。

从上次访谈到提出第一个可检验假设所花费的时间。 这才是人工智能真正发挥作用的数字。如果合成过程以前需要八天,现在只需要两天,那么每个季度就能多出两个实验周期——这才是真正的商业价值所在,而且理由充分。只是大多数供应商并没有这样宣传。

更深入

本文为概述。另有四篇姊妹文章详细介绍了各个阶段:

常见问题

人工智能能否完全取代用户访谈? 不。它可以替代一些访谈相关的工作——转录、编码、初步综合——并且可以帮助你更好地准备访谈。但它无法提供关于人们行为方式的证据,因为它无法获取他们的实际行为数据。模拟参与者会告诉你文字是如何描述这类人的,但这与实际行为截然不同,而且往往会产生误导。

人工智能辅助研究究竟能节省多少时间? 根据我们的经验,节省的时间几乎全部集中在综合和编码环节,而且节省幅度相当可观。实地考察、招募和利益相关者协调等环节则保持不变。对于一项有主持人的研究而言,一个合理的预期是,实地考察后的阶段会大幅缩短,而整个项目的持续时间缩短的幅度则相对较小——因为实地考察一直是耗时最长的部分。

虚拟用户有可能合法吗? 作为讨论指南的练习工具和测试调查问卷措辞的方法,可以。但作为研究结果的证据,则不行。区别在于:前者是准备辅助工具,后者是贴着研究标签的捏造数据。

最大的风险是什么? 自信流畅却错误的输出——尤其是那些与团队既有认知相符的版本——会被追溯规则所识别。谄媚式的合成更难防范,因为它能产出人人满意的成果。唯一可靠的防御方法是将假设与合成提示分开,并进行显式的对抗测试。

人工智能辅助研究在土耳其也能同样有效吗? 并非开箱即用。与英语相比,土耳其语的转录准确率、情感分类和关键词频率方法均有所下降。虽然它可用且我们每天都在使用,但它需要更高的采样率、经过验证的分类器以及一位精通该语言的研究人员。

想就你的研究过程寻求第二意见吗?

如果您正在进行人工智能辅助研究,并且想知道您的研究结果是否经得起审查——或者您正在决定哪些部分需要自动化,哪些部分需要保护——我们将审查您当前的流程,并清楚地告诉您风险在哪里。

 


恰达什·波拉特
作者

恰达什·波拉特

Çağdaş Polat 是 Switas 的联合创始人,负责为电子商务、旅游、医疗保健和公共部门等行业的品牌提供技术和增长咨询服务。他拥有计算机科学学位,过去十年间从软件开发转型至高级市场营销、产品和战略职位。如今,他为企业提供转化率优化 (CRO)、数据分析以及构建经得起衡量的增长体系方面的咨询服务。


相关文章

Switas 见闻

Magnify:利用 Engin Yurtdakul 扩大影响力营销

查看我们的微软 Clarity 案例研究

我们重点介绍了 Microsoft Clarity,它是一款由真正了解像 Switas 这样的公司所面临挑战的产品开发人员,以实际应用场景为导向打造的产品。诸如“愤怒点击”和 JavaScript 错误跟踪等功能,在识别用户痛点和技术问题方面发挥了至关重要的作用,从而能够进行有针对性的改进,直接提升用户体验和转化率。