L'IA dans la recherche utilisateur : ce qui fonctionne, ce qui ne fonctionne pas et où tracer la limite

L'IA dans la recherche utilisateur : ce qui fonctionne, ce qui ne fonctionne pas et où tracer la limite

Le goulot d'étranglement n'a jamais été l'entretien.

Tous les articles sur l'IA et les études utilisateurs commencent de la même façon : la recherche est lente, l'IA l'accélère. Ce raisonnement n'est pas faux en soi, mais il est suffisamment imprécis pour être inutile lorsqu'il s'agit de décider concrètement des changements à apporter le lundi matin.

Voici la version la plus précise. Un entretien modéré dure soixante minutes, et ce sera toujours le cas, car une personne doit parler pendant soixante minutes. Ce qui prenait auparavant quatre jours était… autour Il s'agit de transcrire, d'étiqueter, de trouver le moment où trois participants ont dit la même chose dans trois vocabulaires différents, et de transformer cela en quelque chose sur lequel un chef de produit pourrait agir avant la fin du sprint.

C’est là que le temps a filé, et c’est précisément là que les modèles de langage excellent. Ce sont des outils de reconnaissance de formes appliqués au texte. La synthèse de la recherche est un problème de reconnaissance de formes appliqué au texte. L’adéquation est indéniable.

Mais cette même propriété qui les rend performants en synthèse les rend aussi dangereux. Un modèle qui repère des régularités en repérera, qu'il en existe ou non, et il décrira celles qu'il aura inventées avec la même assurance que celles qui existent réellement. En recherche, un thème erroné et affirmé est pire que l'absence de thème, car il finit par se construire.

La question n'est donc pas que L’utilisation de l’IA dans les études utilisateurs est devenue monnaie courante. La question est de savoir quelles étapes du processus déléguer, quels contrôles effectuer avant de valider les résultats et quelles tâches refuser d’automatiser. C’est le sujet de cet article.

Là où l'IA mérite réellement sa place

Nous intégrons l'IA au processus de recherche étape par étape, plutôt que de la considérer comme une décision unique. Chaque étape présente un profil de risque très différent.

StageCe que l'IA fait bienCe qu'il ne fait pasNotre règle
Recrutement et sélectionRédaction des questionnaires de sélection, repérage des réponses contradictoires, identification des répondants potentiellement professionnelsFiltres surdimensionnés pour les participants éloquents ; élimine les utilisateurs frustrés dont vous avez le plus besoinAssistance uniquement. Un humain approuve la version finale.
Guide de discussionÉlaboration d'une première ébauche à partir de la question de recherche, proposition de pistes de réflexion complémentaires, vérification de l'absence de questions orientéesÉlabore des guides génériques qui testent ce qui est déjà connu.Accélérateur de rédaction. Le chercheur réécrit au moins la moitié du texte.
ModérationPrise de notes en temps réel, étiquetage en direct, suggestion de questions à un modérateur humainImpossible de déceler l'hésitation, le malaise ou la pause qui précède un mensonge poli.Jamais autonome. Outil d'assistance à un modérateur humain.
TranscriptionSéparation des intervenants, horodatage, premier nettoyageLa précision de la transcription turque chute fortement avec le jargon technique, les noms de marques et l'alternance codique.Automatisez, puis effectuez un contrôle ponctuel de 10 % par rapport à l'audio.
Codage et balisageAppliquer un manuel de codage existant de manière cohérente à des centaines de transcriptions à grande vitesseInventer de nouveaux codes au milieu d'un corpus ; regrouper des problèmes distincts sous une seule étiquette rassuranteAutomatisez avec un manuel de codage fixe, rédigé par un humain.
SynthèseRegroupement, mise en évidence de schémas communs aux participants, élaboration du premier récitConfond fréquence et importance ; occulte les opinions dissidentes du participantVersion préliminaire uniquement. Chaque thème est vérifié à sa source avant sa diffusion.
Analyse continue des retours d'informationAvis sur l'App Store, tickets d'assistance, analyses NPS, historiques de conversations : un volume qu'aucune équipe ne peut lire manuellement.L'analyse des sentiments interprète mal le sarcasme et les nuances culturelles indirectes.Automatisation à haute valeur ajoutée avec contrôles par échantillonnage.
Construction d'artefactsPersonas, parcours utilisateurs, arbres d'opportunités à partir de données validéesProduit des artefacts plausibles à partir de preuves minces ou inexistantesUniquement à partir de recherches vérifiées, jamais à partir des connaissances du monde du mannequin.

Deux lignes de ce tableau valent plus que toutes les autres réunies.

Programmation à grande échelle. Si vous disposez d'un dictionnaire de codage rédigé par un humain, son application uniforme à 40 transcriptions correspond exactement au type de tâche fastidieuse et répétitive pour laquelle les modèles sont fiables. C'est là que se situe la majeure partie du temps récupérable.

Analyse continue des retours d'information. La plupart des entreprises laissent dormir des milliers d'avis sur les plateformes de téléchargement d'applications, de tickets d'assistance et de comptes rendus d'enquêtes que personne n'a consultés depuis leur publication. C'est là l'utilisation de l'IA la plus rentable et la moins risquée de toute la discipline, car il ne s'agit pas de remplacer des recherches existantes, mais d'exploiter des données qui étaient jetées. Nous abordons ce sujet en détail dans [référence manquante]. Comment l'IA peut transformer les commentaires des utilisateurs en informations exploitables sur les produits.

Les quatre modes de défaillance que nous constatons régulièrement

Il ne s'agit pas de risques théoriques. Ce sont les problèmes concrets qui surviennent sur des projets réels, classés approximativement par ordre décroissant de leur fréquence de détection.

1. La fréquence se faisant passer pour de l'importance

Demandez à un modèle de résumer vingt entretiens et il mettra en avant les propos les plus fréquents. Or, la valeur de la recherche ne réside généralement pas dans la réponse la plus courante. Elle réside plutôt dans le participant qui a complètement abandonné le processus, dans les deux qui ont décrit indépendamment la même solution de contournement, ou encore dans le segment qui n'a jamais atteint l'étape pourtant abordée par tous les autres.

Un modèle synthétisant une étude sur le processus de paiement vous indiquera que la transparence des frais de livraison est un sujet récurrent. Il ne vous précisera pas que les deux seuls participants ayant finalisé leur achat étaient déjà connectés – ce qui constitue la véritable conclusion, et qui apparaît dans le corpus uniquement comme une absence.

Notre chèque : Nous demandons explicitement la position minoritaire : « Quel participant était en désaccord avec le consensus émergent, et qu’a-t-il dit ? » Si le modèle ne peut en identifier un, nous considérons le résumé comme incomplet plutôt que comme une preuve d’accord.

2. Invention fluide

Les modèles produisent des citations qui ressemblent trait pour trait à ce qu'un participant aurait dit, mais qui lui sont attribuées à tort. Trop rarement. Trop souvent. Et l'erreur est imperceptible à l'examen, car une citation fabriquée sonne mieux qu'une vraie – les gens s'expriment par fragments.

Notre chèque : Chaque citation transmise au client comporte une référence de transcription et un horodatage. Si elle est introuvable dans le fichier audio source, elle n'est pas incluse. Il s'agit d'une règle technique, et non d'une question d'appréciation, car c'est précisément le jugement qui fait défaut dans ce cas.

3. Synthèse sycophante

Si vous soumettez à un modèle votre hypothèse puis vos données, la synthèse confirmera votre hypothèse. Si vous lui soumettez les mêmes données avec l'hypothèse inverse, la synthèse confirmera cette dernière. C'est le mode d'échec le plus coûteux dans le cadre d'une mission de conseil, car il produit exactement le livrable attendu par le client tout en anéantissant la raison même pour laquelle il vous a engagé.

Notre chèque : Les consignes de synthèse ne contiennent jamais l'hypothèse. Le modèle reçoit le corpus et la question de recherche, rien d'autre. Lorsque nous souhaitons tester une hypothèse, nous l'exécutons comme une étape distincte et contradictoire : « trouver les preuves les plus convaincantes dans ce corpus ». à opposer à l'affirmation suivante.

4. Utilisateurs synthétiques

L'application la plus vantée et la moins défendable : générer des participants simulés et les interviewer à la place de vraies personnes. Elle produit rapidement des transcriptions plausibles, et c'est précisément cette plausibilité qui pose problème. Un modèle entraîné sur Internet vous dira quel type de personne… sonne comme, ce qui résume la façon dont ces personnes sont décrites — et non leur comportement lorsque la validation de votre formulaire rejette leur adresse à la troisième tentative.

Les utilisateurs synthétiques sont utiles pour une seule chose : répéter un guide d’entretien avant d’y impliquer un participant réel. C’est à cette fin que nous les utilisons. Nous ne les utilisons pas comme preuves et nous ne présentons pas leurs résultats comme des conclusions de recherche. Si un fournisseur vous propose un programme de recherche sans participants humains, il vous vend un moyen très coûteux de confirmer vos propres convictions.

Notre protocole de travail

Il s'agit de la séquence réelle, et non d'une séquence idéalisée.

1. Ce sont les humains qui écrivent le livre de codes en premier. Avant même qu'un modèle ne soit appliqué à une transcription, un chercheur examine trois à cinq entretiens et élabore manuellement la grille de codage. Cette grille est issue des données spécifiques à cette étude, et non d'une taxonomie UX générique. La qualité de toutes les étapes suivantes repose sur cette étape, c'est pourquoi nous ne la raccourcissons jamais.

2. Le modèle applique le cadre, et seulement le cadre. Dictionnaire de codage fixe, aucune nouvelle catégorie n'est ajoutée en cours d'exécution. Lorsqu'un élément n'est pas couvert par le dictionnaire, il est signalé comme non classifié plutôt que de forcer une classification. La liste des éléments non classifiés constitue souvent le résultat le plus intéressant de l'exécution.

3. Double codage d'un échantillon de 15 %. Les mêmes transcriptions sont codées indépendamment par un humain et par le modèle, et nous mesurons le taux de discordance. Si ce taux est inférieur à 10 %, nous poursuivons le processus. S'il est supérieur à 20 %, c'est le guide de codage qui est erroné, et non le modèle ; nous reprenons alors le processus depuis le début. Le taux de discordance constitue un outil de diagnostic pour le cadre de codage, et son utilisation à cette fin nous a permis de réaliser des économies par rapport à son traitement comme simple critère de qualité pour l'outil.

4. Brouillon de synthèse sans hypothèse dans la consigne. Le modèle reçoit un corpus et une question de recherche. Il produit des regroupements et un premier récit.

5. Passage de traçabilité. Chaque affirmation du brouillon est associée à au moins deux participants, avec horodatage. Les affirmations non vérifiables sont supprimées, et non atténuées. Une affirmation étayée par un seul participant est considérée comme une observation isolée, ce qui est légitime et souvent utile à signaler, mais ne constitue pas un thème.

6. Triangulation avec les données comportementales. Les comportements déclarés et observés divergent constamment. Nous comparons les résultats des entretiens aux enregistrements des sessions et aux données de cartographie thermique (clics intempestifs, clics inutiles, points d'abandon) avant toute transmission au client. Si les participants affirment que le filtre leur convient et que les enregistrements montrent qu'ils l'abandonnent, ce sont les enregistrements qui prévalent. C'est également là que les études qualitatives pilotées par l'IA risquent le plus d'être mises en difficulté, car les données comportementales ne tiennent pas compte de la cohérence du récit.

7. Un humain rédige la recommandation. Les résultats peuvent être compilés avec de l'aide. Quant à savoir comment les exploiter, au sein de cette organisation, compte tenu de ces contraintes et de cette feuille de route, c'est à l'une des personnes ayant participé aux entretiens d'en décider.

Ce que nous n'automatisons pas

Liste restreinte, et nous la maintenons fermement.

  • Animation d'entretiens avec des utilisateurs vulnérables ou en détresse. Recherche sur les soins de santé, les difficultés financières et l'accessibilité. Le rôle du modérateur relève en partie d'un devoir de diligence, et celui-ci n'est pas délégable.
  • La recommandation. Voir l'étape sept.
  • Évaluation de l'accessibilité. Outils automatisés — y compris les nôtres Outil d'audit WCAG — détecte environ un tiers des problèmes liés aux WCAG. Le reste nécessite des tests manuels avec des technologies d'assistance. Tout fournisseur prétendant offrir une couverture entièrement automatisée décrit en réalité une analyse, et non un audit.
  • Décider de ce qu'il ne faut pas étudier. La phase de cadrage est l'étape où la plus grande valeur de la recherche est créée ou détruite ; il s'agit d'une conversation stratégique, et non d'une tâche de synthèse.

Note sur la recherche en langue turque

La plupart des guides publiés sur la recherche assistée par l'IA sont rédigés et validés en anglais, et l'écart de performance est réel et insuffisamment abordé.

La transcription turque se dégrade sensiblement autour des noms de marques, du jargon sectoriel et de l'alternance codique anglais-turc, pourtant courante dans les équipes produit et e-commerce d'Istanbul. L'analyse des sentiments gère mal l'indirectité du turc : la formule de politesse qui précède une plainte sérieuse est souvent interprétée comme neutre ou positive par un classificateur entraîné principalement sur l'anglais. La morphologie agglutinante fait également que les méthodes d'analyse de la fréquence des mots-clés appliquées aux données d'enquêtes ouvertes sous-estiment fortement le nombre de réponses, car un même concept peut apparaître sous une douzaine de formes fléchies que le tokenizer considère comme non liées.

Conséquences pratiques : augmentez votre taux de vérification ponctuelle des transcriptions au-delà des 10 % que vous utilisez pour l’anglais, ne vous fiez jamais à l’analyse automatique des sentiments comme seul signal dans les corpus turcs et validez tout classificateur sur un échantillon turc étiqueté manuellement avant d’utiliser ses résultats à grande échelle. C’est précisément pour cette raison que nous utilisons notre propre ensemble de validation.

Comment savoir si cela fonctionne

La vitesse n'est pas le bon indicateur. Tout le monde progresse ; la question est de savoir si les résultats obtenus résistent à l'épreuve du temps. Trois indicateurs sont réellement suivis :

Taux de survie de l'intuition. Parmi les conclusions présentées dans un rapport de recherche, quelle proportion était encore considérée comme valide six mois plus tard ? Mesurer cela est délicat, mais cela en vaut largement la peine.

Taux de désaccord entre l'humain et le modèle. À partir de l'étape trois ci-dessus, suivez l'évolution de la situation au fil du temps. Une augmentation des désaccords signifie généralement que le domaine de recherche a évolué tandis que le guide de codage est resté le même.

Délai entre le dernier entretien et la première hypothèse vérifiable. Voici le gain réel que l'IA apporte. Si la synthèse prenait huit jours et n'en prend plus que deux, cela représente deux cycles d'expérimentation supplémentaires par trimestre — ce qui constitue le véritable argument commercial, et il est convaincant. Or, la plupart des fournisseurs ne le mettent pas en avant.

Aller plus loin

Cet article donne un aperçu général. Quatre articles complémentaires détaillent chaque étape :

Foire aux questions

L'IA peut-elle remplacer entièrement les entretiens avec les utilisateurs ? Non. Il peut remplacer certaines tâches liées aux entretiens (transcription, codage, première synthèse) et vous aider à mieux préparer ces derniers. Il ne peut cependant pas fournir de données probantes sur le comportement humain, car il n'y a pas accès. Les participants simulés vous indiquent comment ces personnes sont décrites par écrit, ce qui est différent et souvent trompeur.

Combien de temps la recherche assistée par l'IA permet-elle réellement de gagner ? D'après notre expérience, les économies réalisées se concentrent presque exclusivement sur la synthèse et le codage, où elles sont substantielles. Le travail de terrain, le recrutement et la mobilisation des parties prenantes restent inchangés. Dans le cadre d'une étude modérée, il est réaliste de s'attendre à ce que la phase post-terrain se raccourcisse considérablement, tandis que la durée totale du projet diminue beaucoup moins, car le travail de terrain a toujours constitué la part la plus importante.

Les utilisateurs synthétiques sont-ils jamais légitimes ? Comme outil de préparation aux entretiens et pour tester la pertinence des formulations d'un questionnaire, oui. Comme preuve dans un résultat de recherche, non. La distinction est importante : l'un est un outil de préparation, l'autre des données fabriquées et présentées comme des données de recherche.

Quel est le plus grand risque ? Un résultat erroné, obtenu avec assurance et fluidité – et plus précisément une version qui conforte les convictions de l'équipe – est inacceptable. Les citations falsifiées sont détectées par les règles de traçabilité. La synthèse complaisante est plus difficile à mettre en œuvre, car elle produit un livrable satisfaisant pour tous. La seule défense fiable consiste à dissocier l'hypothèse de la consigne de synthèse et à mener une analyse critique explicite.

La recherche assistée par l'IA fonctionne-t-elle aussi bien en turc ? Ce n'est pas une solution prête à l'emploi. La précision de la transcription, la classification des sentiments et les méthodes d'analyse de fréquence des mots-clés sont toutes moins performantes en turc qu'en anglais. L'outil est utilisable et nous l'utilisons quotidiennement, mais il nécessite des taux d'échantillonnage plus élevés, des classificateurs validés et un chercheur maîtrisant la langue.

Vous souhaitez un deuxième avis sur votre processus de recherche ?

Si vous menez des recherches assistées par l'IA et souhaitez savoir si vos résultats résisteraient à un examen approfondi — ou si vous devez décider ce qu'il faut automatiser et ce qu'il faut protéger —, nous examinerons votre processus actuel et vous indiquerons clairement où se situe le risque.

 


Çağdaş Polat
Écrit par

Çağdaş Polat

Çağdaş Polat est cofondateur de Switas, où il dirige des services de conseil en technologie et en croissance pour des marques des secteurs du e-commerce, du voyage, de la santé et du secteur public. Diplômé en informatique, il a évolué du développement logiciel à des postes de direction en marketing, produit et stratégie au cours de la dernière décennie. Il conseille désormais les entreprises en matière d'optimisation du taux de conversion (CRO), d'analyse de données et de mise en place de systèmes de croissance performants et mesurables.


Articles Relatifs

Switas vu sur

Magnify : Développer le marketing d'influence avec Engin Yurtdakul

Découvrez notre étude de cas Microsoft Clarity

Nous avons mis en avant Microsoft Clarity comme un produit conçu pour répondre à des cas d'utilisation concrets, par des experts produits qui comprennent les défis rencontrés par des entreprises comme Switas. Des fonctionnalités telles que la détection des clics indésirables et le suivi des erreurs JavaScript se sont révélées précieuses pour identifier les frustrations des utilisateurs et les problèmes techniques, permettant ainsi des améliorations ciblées qui ont eu un impact direct sur l'expérience utilisateur et les taux de conversion.