La IA en la investigación de usuarios: qué funciona, qué falla y dónde trazamos la línea.

La IA en la investigación de usuarios: qué funciona, qué falla y dónde trazamos la línea.

El cuello de botella nunca fue la entrevista

Todos los artículos sobre IA e investigación de usuarios comienzan de la misma manera: la investigación es lenta, la IA la acelera. Este planteamiento no es incorrecto, pero es lo suficientemente impreciso como para resultar inútil a la hora de decidir qué cambios implementar el lunes por la mañana.

Aquí está la versión más precisa. Realizar una entrevista moderada lleva sesenta minutos y siempre será así, porque una persona tiene que hablar durante sesenta minutos. Lo que antes llevaba cuatro días era todo en torno a Transcribir, etiquetar, encontrar el momento en que tres participantes dijeron lo mismo con tres vocabularios diferentes y convertir eso en algo sobre lo que un gerente de producto pudiera actuar antes de que finalizara el sprint.

Ahí es donde se fue el tiempo, y precisamente ahí es donde los modelos de lenguaje son fuertes. Son sistemas de reconocimiento de patrones en texto. La síntesis de investigación es un problema de reconocimiento de patrones en texto. La compatibilidad es real.

Pero la misma propiedad que los hace buenos en síntesis los hace peligrosos en ella. Un modelo que encuentra patrones los encontrará independientemente de si existen o no, y describirá los que inventó con la misma seguridad con la que describe los que ya existen. En investigación, un tema erróneo y seguro es peor que ningún tema, porque el tema erróneo se consolida.

Entonces la pregunta no es sean Utilizar la IA en la investigación de usuarios es algo común. De hecho, ya se hace. La cuestión es qué partes del proceso se delegan, qué se verifica antes de confiar en el resultado y qué se rechaza automatizar por completo. De eso trata este artículo.

Donde la IA realmente se gana su lugar

Analizamos la IA paso a paso en el proceso de investigación, en lugar de considerarla como una decisión única. Las diferentes etapas presentan perfiles de riesgo muy distintos.

FaseLo que la IA hace bienEn qué se equivocaNuestra regla
Reclutamiento y selecciónElaboración de cuestionarios de selección, detección de respuestas contradictorias en las respuestas a los cuestionarios de selección, identificación de posibles encuestados profesionales.Filtros excesivos para participantes elocuentes; descarta a los usuarios frustrados que más necesitasSolo asistencia. Un humano aprueba el panel final.
Guía de discusiónElaborar un primer borrador a partir de la pregunta de investigación, proponer preguntas de seguimiento y comprobar si hay preguntas capciosas.Produce guías genéricas que ponen a prueba lo que ya se sabe.Acelerador de borradores. El investigador reescribe al menos la mitad.
ModeraciónToma de notas en tiempo real, etiquetado en vivo, sugerencia de preguntas a un moderador humano.No puede leer la vacilación, la incomodidad o la pausa antes de una mentira cortés.Nunca es autónomo. Es una herramienta de apoyo para un moderador humano.
TranscripciónSeparación de oradores, marcas de tiempo, limpieza de primera pasada.La precisión de la transcripción en turco disminuye drásticamente con la jerga especializada, los nombres de marcas y la alternancia de códigos.Automatice y, a continuación, realice una comprobación aleatoria del 10 % con respecto al audio.
Codificación y etiquetadoAplicar un libro de códigos existente de forma consistente en cientos de transcripciones a gran velocidad.Inventar nuevos códigos a mitad del corpus; agrupar problemas distintos en una etiqueta cómoda.Automatice el proceso con un libro de códigos fijo, creado por un humano.
SíntesisAgrupación, identificación de patrones entre participantes, redacción del primer relatoConfunde frecuencia con importancia; minimiza la opinión del participante disidente.Borrador únicamente. Cada tema se analiza hasta su origen antes de su lanzamiento.
Análisis de retroalimentación continuaReseñas de la tienda de aplicaciones, tickets de soporte, transcripciones textuales de NPS, registros de chat en un volumen que ningún equipo puede leer manualmente.La evaluación del sentimiento no capta bien el sarcasmo ni la indirecta cultural.Automatización de alto valor con controles de muestreo.
Construcción de artefactosPersonas, mapas de recorrido del cliente, árboles de oportunidades a partir de datos validados.Produce artefactos plausibles a partir de evidencia escasa o inexistente.Solo a partir de investigaciones verificadas, nunca del conocimiento del mundo que posee el modelo.

Dos filas de esa tabla valen más que el resto juntas.

Programación a gran escala. Si dispones de un manual de codificación escrito por una persona, aplicarlo de forma coherente en 40 transcripciones es precisamente el tipo de trabajo tedioso y basado en reglas en el que los modelos de trabajo son fiables. Aquí es donde reside la mayor parte del tiempo recuperable.

Análisis continuo de la retroalimentación. La mayoría de las empresas acumulan miles de reseñas de tiendas de aplicaciones, tickets de soporte y transcripciones de encuestas que nadie ha leído desde su creación. Este es el uso de la IA con mayor rentabilidad y menor riesgo en toda la disciplina, porque no se reemplaza la investigación que se estaba realizando, sino que se leen datos que se estaban descartando. Abordamos esto en profundidad en Cómo la IA puede transformar los comentarios de los usuarios en información procesable sobre el producto.

Los cuatro modos de fallo que seguimos detectando

No se trata de riesgos teóricos. Son los problemas concretos que surgen en proyectos reales, ordenados aproximadamente de mayor a menor frecuencia con la que los detectamos.

1. Frecuencia disfrazada de importancia

Si se le pide a un modelo que resuma veinte entrevistas, destacará lo que se dijo con más frecuencia. Pero el valor de la investigación no suele residir en la respuesta más frecuente, sino en el participante que abandonó el hilo de la conversación por completo, en los dos que describieron la misma solución alternativa de forma independiente, o en el segmento que nunca llegó al paso que todos los demás discutieron.

Un modelo que resume un estudio sobre el proceso de compra indicará que la transparencia en los costos de envío surgió repetidamente. Sin embargo, no mencionará que los dos únicos participantes que completaron la compra ya habían iniciado sesión, lo cual es el hallazgo real y que aparece en el corpus únicamente como una ausencia.

Nuestro cheque: Preguntamos explícitamente por la postura minoritaria. "¿Qué participante no estuvo de acuerdo con el consenso emergente y qué expresó?" Si el modelo no puede identificar a ninguno, consideramos el resumen incompleto en lugar de como evidencia de acuerdo.

2. Invención fluida

Los modelos generan citas que suenan exactamente como algo que habría dicho un participante, pero atribuidas a alguien que no las pronunció. No ocurre a menudo. O sí, con bastante frecuencia. Y el fallo pasa desapercibido al analizarlo, porque una cita inventada se lee mejor que una real: la gente real habla en fragmentos.

Nuestro cheque: Cada cita que llega a la presentación del cliente incluye una referencia a la transcripción y una marca de tiempo. Si no se encuentra en el audio original, no se incluye. Esta es una regla mecánica, no una decisión subjetiva, ya que precisamente el criterio es lo que falla en este caso.

3. Síntesis aduladora

Proporcione a un modelo su hipótesis y luego sus datos, y la síntesis respaldará su hipótesis. Proporciónele los mismos datos con la hipótesis opuesta y la síntesis la respaldará. Este es el modo de fallo más costoso en el contexto de la consultoría, porque produce exactamente el resultado que el cliente deseaba, pero destruye la razón por la que lo contrataron.

Nuestro cheque: Las indicaciones de síntesis nunca contienen la hipótesis. El modelo recibe el corpus y la pregunta de investigación, nada más. Cuando queremos probar una hipótesis, la ejecutamos como una pasada adversaria separada: "encuentra la evidencia más fuerte en este corpus en contra la siguiente afirmación."

4. Usuarios sintéticos

La aplicación más promocionada y menos defendible: generar participantes simulados y entrevistarlos en lugar de personas reales. Produce transcripciones plausibles rápidamente, y la plausibilidad es precisamente el problema. Un modelo entrenado en internet te dirá qué tipo de persona... suena como, que es un resumen de cómo se escribe sobre esas personas, no de cómo se comportan cuando la validación de tu formulario rechaza su dirección al tercer intento.

Los usuarios sintéticos son útiles para una sola cosa: ensayar una guía de debate antes de utilizar un participante real. Los usamos para eso. No los usamos como evidencia ni presentamos sus resultados como hallazgos de investigación. Si un proveedor le ofrece un programa de investigación sin participantes humanos, le está vendiendo una forma muy costosa de confirmar lo que usted ya cree.

Nuestro protocolo de trabajo

Esta es la secuencia real, no una idealizada.

1. Los humanos escriben primero el libro de códigos. Antes de que cualquier modelo analice una transcripción, un investigador lee de tres a cinco entrevistas y elabora manualmente el marco de codificación. Este marco se basa en los datos de este estudio, no en una taxonomía genérica de UX. Todo lo que sigue hereda su calidad de este paso, por lo que nunca lo simplificamos.

2. El modelo aplica el marco, y solo el marco. Libro de códigos fijo, sin nuevas categorías durante la ejecución. Cuando el modelo encuentra algo que el marco no cubre, lo marca como no clasificado en lugar de forzar un ajuste. El conjunto de elementos no clasificados suele ser el resultado más interesante de toda la ejecución.

3. Codifique doblemente una muestra del 15%. Las mismas transcripciones son codificadas de forma independiente por un humano y por el modelo, y medimos la tasa de discrepancia. Si es inferior al 10 %, continuamos. Si supera el 20 %, el problema está en el libro de códigos, no en el modelo; volvemos al principio. La tasa de discrepancia sirve como diagnóstico del marco de trabajo, y tratarla de esta manera nos ha ahorrado más que usarla como un control de calidad de la herramienta.

4. Borrador de síntesis sin hipótesis en el enunciado. El modelo recibe el corpus y la pregunta de investigación. Produce grupos y una primera narrativa.

5. Pase de trazabilidad. Cada afirmación del borrador se vincula con al menos dos participantes, con sus respectivas marcas de tiempo. Las afirmaciones que no se pueden rastrear se eliminan, no se modifican. Una afirmación respaldada por un solo participante se etiqueta como una observación individual, lo cual es legítimo y a menudo valioso para reportar, pero no como un tema central.

6. Triangulación con respecto a datos de comportamiento. El comportamiento declarado y el comportamiento observado difieren constantemente. Verificamos los resultados de las entrevistas con las grabaciones de las sesiones y los datos de los mapas de calor (clics de frustración, clics inactivos, puntos de abandono) antes de que la información llegue al cliente. Cuando los participantes afirman que el filtro funciona correctamente, pero las grabaciones muestran que lo abandonan, prevalecen las grabaciones. Es aquí donde el trabajo cualitativo impulsado por IA tiene más probabilidades de fallar, ya que a los datos de comportamiento no les importa la coherencia de la narrativa.

7. La recomendación la redacta una persona. Los hallazgos pueden recopilarse con ayuda. Qué hacer con ellos, en esta organización, con estas limitaciones y esta hoja de ruta, es una decisión que tomará alguien que participó en las entrevistas.

Lo que no automatizamos

Hemos preseleccionado a los candidatos y mantenemos nuestra postura firme.

  • Moderación de entrevistas con usuarios vulnerables o en situación de angustia. Investigación sobre atención médica, dificultades financieras y accesibilidad. El trabajo del moderador en este ámbito implica, en parte, un deber de diligencia, y eso no es delegable.
  • La recomendación. Ver paso siete.
  • Evaluación de accesibilidad. Herramientas automatizadas, incluidas las nuestras. Herramienta de auditoría WCAG — detecta aproximadamente un tercio de los problemas de WCAG. El resto requiere pruebas manuales con tecnología de asistencia. Cualquier proveedor que afirme una cobertura totalmente automatizada está describiendo un escaneo, no una auditoría.
  • Decidir qué no investigar. La fase de definición del alcance es donde se crea o se destruye la mayor parte del valor de la investigación, y se trata de una conversación estratégica, no de una tarea de resumen.

Una nota sobre la investigación en lengua turca

La mayoría de las guías publicadas sobre investigación asistida por IA están escritas y validadas en inglés, y la brecha de rendimiento es real y poco discutida.

La transcripción turca se degrada notablemente en torno a nombres de marcas, jerga del sector y la alternancia de códigos inglés-turco, algo habitual en los equipos de producto y comercio electrónico de Estambul. La clasificación de sentimientos no maneja bien la indirecta del turco: la cortesía que precede a una queja seria suele interpretarse como neutral o positiva para un clasificador entrenado principalmente en inglés. La morfología aglutinante también implica que los métodos de frecuencia de palabras clave aplicados a datos de encuestas abiertas subestiman considerablemente la frecuencia, ya que un mismo concepto aparece en una docena de formas flexionadas que el tokenizador trata como no relacionadas.

Consecuencias prácticas: aumente la tasa de verificación aleatoria de transcripciones por encima del 10 % que usaría para el inglés, nunca confíe en el análisis automático de sentimientos como señal independiente en corpus turcos y valide cualquier clasificador en una muestra turca etiquetada manualmente antes de confiar en sus resultados a gran escala. Nosotros utilizamos nuestro propio conjunto de validación precisamente por este motivo.

Cómo saber si funciona

La velocidad no es la métrica adecuada. Todos se vuelven más rápidos; la cuestión es si el resultado resiste el contacto con la realidad. Tres medidas que sí monitoreamos:

Tasa de supervivencia de Insight. De los hallazgos presentados en un informe de investigación, ¿qué proporción seguía considerándose válida seis meses después? Medir esto resulta incómodo, pero merece la pena el esfuerzo.

Tasa de discrepancia entre humanos y modelos. A partir del paso tres anterior, realice un seguimiento a lo largo del tiempo. Un desacuerdo creciente generalmente significa que el ámbito de investigación ha cambiado, pero el libro de códigos no.

Tiempo transcurrido desde la última entrevista hasta la primera hipótesis comprobable. Esta es la cifra que la IA realmente impulsa. Si la síntesis solía tardar ocho días y ahora tarda dos, eso supone dos ciclos de experimentación adicionales por trimestre, que es la justificación comercial real, y es una buena justificación. Simplemente, no es la justificación que suelen presentar la mayoría de los proveedores.

Profundizando

Este artículo ofrece una visión general. Cuatro artículos complementarios cubren las etapas individuales en detalle:

Preguntas frecuentes

¿Puede la IA reemplazar por completo las entrevistas con los usuarios? No. Puede reemplazar parte del trabajo relacionado con las entrevistas —transcripción, codificación, síntesis inicial— y puede ayudarte a preparar mejores entrevistas. No puede generar evidencia sobre cómo se comportan las personas, porque no tiene acceso a su comportamiento. Los participantes simulados te indican cómo se describe a esas personas en un texto, lo cual es diferente y, con frecuencia, engañoso.

¿Cuánto tiempo ahorra realmente la investigación asistida por IA? En nuestra experiencia, el ahorro se concentra casi exclusivamente en la síntesis y la codificación, donde resulta sustancial. El trabajo de campo, el reclutamiento y la alineación de las partes interesadas permanecen inalterados. Una expectativa realista para un estudio moderado es que la fase posterior al trabajo de campo se comprima considerablemente, mientras que la duración total del proyecto disminuya mucho menos, dado que el trabajo de campo siempre fue el factor más prolongado.

¿Existe alguna vez una legitimidad para los usuarios sintéticos? Como herramienta de ensayo para guías de debate y para poner a prueba la redacción de encuestas, sí. Como evidencia en un hallazgo de investigación, no. La distinción es importante: una es una ayuda para la preparación, la otra son datos fabricados con una etiqueta de investigación.

¿Cuál es el mayor riesgo? Confiado, fluido, pero con resultados erróneos —y específicamente la versión que coincide con lo que el equipo ya creía—. Las citas inventadas se detectan mediante reglas de trazabilidad. La síntesis aduladora es más difícil, porque produce un resultado con el que todos están satisfechos. La única defensa fiable consiste en separar la hipótesis de la consigna de síntesis y realizar un análisis crítico explícito.

¿La investigación asistida por IA funciona igual de bien en turco? No es una solución inmediata. La precisión de la transcripción, la clasificación de sentimientos y los métodos de frecuencia de palabras clave se degradan en turco en comparación con el inglés. Es utilizable y lo usamos a diario, pero requiere tasas de muestreo más altas, clasificadores validados y un investigador que domine el idioma.

¿Quieres una segunda opinión sobre tu proceso de investigación?

Si lleva a cabo investigaciones asistidas por IA y quiere saber si sus hallazgos resistirían un análisis exhaustivo, o si está decidiendo qué automatizar y qué proteger, revisaremos su proceso actual y le diremos claramente dónde reside el riesgo.

 


Çağdaş Polat

Escrito por

Çağdaş Polat

Çağdaş Polat es cofundador de Switas, donde lidera la consultoría tecnológica y de crecimiento para marcas de comercio electrónico, viajes, sanidad y el sector público. Graduado en informática, durante la última década pasó del desarrollo de software a puestos de alta responsabilidad en marketing, producto y estrategia. Actualmente, asesora a empresas en materia de optimización de la tasa de conversión (CRO), análisis de datos y creación de sistemas de crecimiento eficaces.

LinkedIn

Artículos Relacionados

Switas como se ve en

Magnify: Escalando el marketing de influencers con Engin Yurtdakul

Consulte nuestro caso práctico de Microsoft Clarity

Destacamos Microsoft Clarity como un producto diseñado con casos de uso prácticos y reales, por expertos en productos que comprenden los desafíos que enfrentan empresas como Switas. Funciones como los clics de ira y el seguimiento de errores de JavaScript resultaron invaluables para identificar las frustraciones y los problemas técnicos de los usuarios, lo que permitió mejoras específicas que impactaron directamente en la experiencia del usuario y las tasas de conversión.