Una cifra de ahorro no cuenta toda la historia

La promesa de que la IA generativa ahorra tiempo suele reducir una cuestión compleja a una cifra sencilla. Pero hacer una tarea más rápido no equivale automáticamente a aumentar la productividad: también importa si el resultado es correcto, útil y aceptable, y cuánto trabajo posterior exige. Si se mide solo el tiempo de ejecución, pueden quedar fuera la revisión, las correcciones y las consecuencias de un error.

La evidencia disponible apunta a resultados vinculados a contextos concretos, no a una tasa común para todas las ocupaciones. Por eso, una afirmación sobre productividad debe leerse preguntando qué tarea se estudió, quién la realizó y qué resultado se contó. Las publicaciones académicas y los resúmenes de investigación pueden ayudar a contestarlo, pero no sustituyen la descripción del método ni autorizan a extrapolar a cualquier herramienta o empresa.

Qué tareas y personas se evaluaron

Un estudio de campo titulado Generative AI at Work examina el uso de asistencia de IA generativa en un entorno laboral. Su propio título y su condición de investigación sobre el trabajo lo distinguen de una prueba abstracta de capacidades: el tema es la interacción entre una herramienta y tareas realizadas por trabajadores. Aun así, un resultado de un entorno específico no representa por sí solo a todas las profesiones, organizaciones ni sistemas de IA.

Otra investigación, disponible como prepublicación en arXiv, informa de un experimento aleatorizado en línea con 1.174 adultos de 25 a 45 años. Las personas realizaron una tarea de resolución de problemas de estilo laboral con o sin asistente de IA y luego una actividad sin asistencia. El resumen reporta mejoras en el desempeño con IA para participantes de distintos niveles educativos y una reducción de la diferencia de resultados entre grupos en la tarea asistida. Eso describe una prueba delimitada, no una medición del ahorro de horas en una jornada real. La ficha identifica el artículo como enviado en agosto de 2026 y sus conclusiones deben leerse teniendo presente que es una prepublicación, no una garantía de consenso científico.

Desempeño, tiempo y calidad son medidas distintas

Al comparar estudios, conviene separar al menos tres preguntas: ¿se completó más trabajo?, ¿se completó en menos tiempo?, ¿mejoró su calidad? Un resultado favorable en una medida no responde automáticamente a las demás. En particular, una puntuación superior en una tarea experimental no permite afirmar que los participantes tardaron menos, salvo que el estudio mida y reporte ese tiempo. El resumen del experimento de arXiv citado aquí informa de desempeño y de una actividad posterior sin IA; no ofrece en el extracto suministrado una cifra de minutos ahorrados.

También es relevante distinguir el rendimiento con ayuda del aprendizaje o la capacidad de trabajar sin ella. En el experimento citado, el resumen señala que parte de la mejora de los participantes con menor nivel educativo se mantuvo en la actividad posterior sin asistencia, aunque volvió a aparecer una diferencia considerable entre grupos. Los autores también relacionan la mejora posterior con el uso intensivo combinado con esfuerzo sostenido. No es lo mismo recibir una respuesta útil en el momento que desarrollar una habilidad transferible; y un resultado en una tarea concreta no demuestra que ese efecto se reproduzca en otras funciones laborales.

Cómo interpretar las cifras sin generalizarlas

Antes de convertir un resultado en una expectativa para un equipo, comprueba estos puntos en el estudio original:

  • Tarea: si reproduce un trabajo real o una actividad experimental y acotada.
  • Participantes: cuántas personas participaron y qué experiencia o formación tenían.
  • Comparación: qué grupo o situación sirve de referencia.
  • Resultado: si se midieron tiempo, cantidad, calidad, correcciones o desempeño posterior.
  • Entorno: qué herramienta se utilizó y si el resultado dependía de instrucciones o supervisión específicas.

No todos esos detalles aparecen en los extractos de investigación reunidos aquí, así que no corresponde rellenarlos con suposiciones. El documento de Microsoft Research sobre adopción de IA en el trabajo, por ejemplo, presenta un título centrado en cambios de adopción y en actividades de productividad y comunicación. El material disponible no detalla aquí sus resultados ni su método; por tanto, sirve para identificar un tema de investigación, pero no para atribuirle una cifra concreta de productividad. Cuando falte información metodológica, la conclusión correcta es acotar lo que se afirma, no completar el relato por analogía.

Una decisión práctica: medir el flujo de trabajo propio

Para una organización que quiera evaluar una herramienta, el enfoque útil no es prometer de antemano un porcentaje, sino definir una comparación que incluya la tarea completa. Puede registrar cuánto tarda el proceso de principio a fin, qué proporción requiere corrección y si el resultado satisface criterios de calidad acordados. Conviene comparar trabajos equivalentes y anotar cuándo interviene la IA, quién revisa y qué pasos se añadieron.

La interpretación debería considerar también el coste de supervisión y los riesgos de una salida incorrecta o inadecuada. Una mejora de velocidad puede no traducirse en una ganancia neta si la revisión se alarga o si aumentan los fallos. A la inversa, una herramienta puede aportar valor al mejorar resultados o facilitar tareas difíciles aunque no reduzca mucho el tiempo. Estos son criterios para diseñar una evaluación local, no hallazgos cuantificados por las fuentes citadas.

La conclusión responsable

La investigación examinada no justifica un titular universal del tipo «la IA ahorra X tiempo a los trabajadores». Sí permite una conclusión más limitada: algunos estudios evalúan mejoras de desempeño en tareas concretas, y un experimento en línea informa de beneficios con asistencia y cambios en las diferencias entre grupos educativos. El alcance de cada conclusión termina donde dejan de parecerse la tarea, la población y las condiciones del estudio.

Para quien usa o evalúa estas herramientas, la pregunta más productiva no es si la IA aumenta la productividad en abstracto, sino qué resultado mejora en una tarea definida, para qué personas y con qué trabajo adicional de verificación. Si una fuente comunica solo una cifra promocional o un resultado sin explicar su medida, no basta para estimar el efecto en otro puesto. La cautela no niega que pueda haber beneficios: evita presentar como hecho general lo que la evidencia disponible solo respalda en condiciones específicas.