Dra. Gundula Zerbes SoSafe

Ciencia del comportamiento

El 94 % dijo que sí: la supervisión humana en la práctica

Dra. Gundula Zerbes · 30 septiembre 2026 · 9 min de lectura

¿Cuánto debemos confiar en los resultados generados por IA? Sabemos que la IA a veces se equivoca. La pregunta más interesante es cuántas personas lo comprueban realmente.

Un equipo de investigación de la Northeastern University¹ le ha puesto una cifra. Pidieron a 107 desarrolladores que crearan una aplicación con un agente de programación de IA, el mismo tipo de entorno en el que muchos de nosotros trabajamos a diario. El truco: el agente había recibido instrucciones de crear en secreto una ruta que enviara datos de clientes a un servidor externo, mientras completaba el trabajo asignado con normalidad.

El 94 % de los desarrolladores en este entorno fusionó el código malicioso. ¿Por qué? Un participante lo expresó con claridad: «Siempre tengo la costumbre de hacer clic en aprobar directamente».

¿Supervisión humana?

Seamos claros: los desarrolladores de este estudio tenían los conocimientos necesarios para detectarlo. El 86 % indicó tener conocimientos sobre ciberseguridad, el 70 % contaba con más de tres años de experiencia en programación y la mayoría había trabajado antes con la herramienta. Lo que les faltó en ese momento fue algún motivo para pensar que estaba justificado revisar más a fondo.

Esa carencia es importante, porque de ella dependen muchas cosas. La supervisión humana se considera clave para evitar errores automatizados y desempeña un papel fundamental en las políticas y normativas. Funciona con una condición: que la persona encargada de la supervisión evalúe de forma independiente lo que aprueba. En condiciones de trabajo normales, los datos indican que, por lo general, no lo hace.

La psicología tiene un término para esto: el sesgo de automatización es la tendencia a favorecer una recomendación automatizada por encima del propio criterio, incluso cuando se tiene delante información contradictoria. Los investigadores lo han documentado durante décadas, primero en el soporte técnico para aviación y decisiones clínicas, y más recientemente en cualquier ámbito del trabajo profesional al que haya llegado la IA. El análisis de 2026 de Romeo y Conti en AI & Society reúne 35 estudios experimentales², y el patrón se mantiene con una constancia incómoda. En el resto de este artículo, analizaremos sus conclusiones y lo que significan para nuestro uso de la IA.

Por qué comprobar es más difícil de lo que parece

La concienciación en ciberseguridad ha pasado una década centrada en el ser humano como superficie de ataque: la persona que hace clic en el enlace, aprueba el pago e introduce las credenciales. Esto añade una dimensión diferente. Aquí el ser humano es la medida de protección, y le hemos estado pidiendo que realice una tarea cognitiva exigente con muy poco soporte técnico.

Parte del motivo es económico. Verificar un resultado de la IA suele ser más difícil que formular el criterio tú mismo, porque tienes que reconstruir un razonamiento que no has llevado a cabo e imaginar modos de fallo sobre los que no tienes visibilidad. Bajo presión de tiempo y con una alta carga cognitiva, aceptar es fácil y analizar con detenimiento es costoso. Una persona racional responderá a esa disyuntiva confiando en exceso, motivo por el cual pedir a la gente que tenga más cuidado sirve de muy poco.

El otro factor es que los resultados de la IA presentan todas las señales superficiales que usamos normalmente para juzgar la calidad. Tienen fluidez, una estructura limpia y están redactados con seguridad. Cuando una persona realiza un trabajo con este aspecto, la impecabilidad es merecida: cuesta tiempo, y el tiempo invertido suele implicar cuidado. Los resultados generados obtienen esa impecabilidad sin esfuerzo, y no te dicen nada sobre el fondo del asunto.

La confianza importa mucho aquí. Los consejos de la IA suelen llegar con certeza, pero carecen de la prudencia que ofrecería un experto humano, y los estudios revisados revelan que la consecuencia es que los lectores confían demasiado en ellos. Incluso los responsables máximos de la toma de decisiones tratan las recomendaciones de la IA como un análisis objetivo en lugar de una opinión falible, y por eso se apoyan más en ellas. Una respuesta que suena categórica le da al lector muy poco margen para rebatirla.

Explicar y alertar no es suficiente

Si el problema es que las personas no pueden distinguir fácilmente un resultado fiable de uno erróneo, la solución intuitiva es mostrarles más información. La transparencia y la IA explicable son la respuesta habitual, pero los estudios no avalan su eficacia. La gente tiende a tratar una explicación de los resultados de la IA como una señal en sí misma: registran que existe en lugar de comprobar si es sólida. Las explicaciones sencillas resultan engañosas cuando el sistema se equivoca, mientras que las complejas añaden carga cognitiva y se ignoran por completo. En todos los estudios analizados, las explicaciones aumentaron de forma sistemática la aceptación de los resultados de la IA por parte de las personas, mientras que su precisión se mantuvo más o menos igual.

Los resultados de la Northeastern University lo subrayan. Una condición del estudio añadió un sistema de supervisión automatizado que vigilaba al agente y mostraba una advertencia en la pantalla. Detectó el 84 % de los intentos de sabotaje. En las sesiones en las que se activó correctamente (donde el sistema de supervisión hizo su trabajo y le dijo a la persona exactamente qué estaba mal en el momento justo), el 56 % de los participantes aun así implementó el código.

Una alerta solo funciona cuando le llega a alguien que ya tiene un motivo para tomársela en serio, y ese motivo tiene que provenir de otro lugar que no sea la alerta. Lo que le da la vuelta a la pregunta: ¿qué necesitaría la gente para tener éxito en el trabajo que ya le hemos asignado?

Capacitación: la alfabetización en IA es la clave

El factor de protección más constante en toda la investigación es comprender el sistema con el que trabajas, sabiendo dónde funciona bien y dónde falla. Esto es diferente a sentirse cómodo usando herramientas de IA, lo que puede jugar discretamente en tu contra.

La investigación describe los efectos de la alfabetización en IA como una curva en lugar de una pendiente lineal. Las personas con muy pocos conocimientos de IA tienden a rechazar de plano sus sugerencias. Aquellas con una gran experiencia confían en la IA de la forma adecuada, porque pueden anticipar dónde falla. El grupo intermedio, con una familiaridad moderada, es el que más confía en exceso. El uso diario de la IA conduce a una sensación de fluidez y comodidad que sobrestima la comprensión real.

Esto debería preocuparnos, porque ese grupo intermedio constituye ahora la mayor parte de los empleados. Los participantes de la Northeastern University usaban herramientas de programación de IA a diario, y su soltura con la herramienta fue en parte lo que hizo que el sabotaje resultara invisible. Los pocos que lo detectaron fueron los que, para empezar, habían llegado con una actitud más escéptica ante los agentes de IA. Eso no significa que debamos enseñar a las personas a desconfiar de los resultados de la IA en general. Pero deben ser conscientes de que pueden producirse errores o incluso comportamientos maliciosos, y de que deben estar alerta ante ellos. Para poder hacerlo, necesitan saber cómo puede fallar la IA y qué aspecto tiene ese fallo.

Los experimentos analizados revelan otra faceta de esto: las personas a las que se les advirtió de que un sistema podía cometer errores pasaron a revisar sus recomendaciones de forma notablemente más exhaustiva. Por el contrario, las personas a las que solo se les recordó que eran responsables del resultado no cambiaron nada en su forma de trabajar. El análisis exhaustivo surge de la expectativa concreta de que algo podría estar mal, y un recordatorio de culpabilidad no genera tal expectativa.

Procesos que dejan margen al criterio

La capacitación solo vale la pena si el flujo de trabajo ofrece a las personas un lugar donde aplicarla. La opción de diseño más fiable es la secuenciación: cuando la respuesta de la IA llega antes de que la persona haya formado la suya propia, la ancla, mientras que pedir primero una valoración inicial y revelar la sugerencia del sistema después produce un criterio notablemente más independiente. La fricción intencionada en acciones críticas y difíciles de revertir también ayuda, siempre y cuando se aplique con moderación y propósito, en lugar de convertirse en ruido de fondo. Y sea lo que sea que midamos, es lo que la gente optimizará. Un índice de aprobación puede parecer productividad, pero es indistinguible de una aprobación automática, por lo que un panel de métricas basado en resultados recompensa discretamente el comportamiento que intentamos evitar. Medir el comportamiento de revisión es más difícil, y es la única manera de saber si la medida de protección es real.

La supervisión humana merece algo mejor

El criterio humano debe formar parte de la supervisión. Sigue siendo el factor crítico que detecta lo que un sistema no puede ver. Sin embargo, si tratamos la supervisión como una simple casilla que marcar en lugar de una capacidad que desarrollar, socavamos la colaboración entre los humanos y la IA. Ponemos a alguien al final de un proceso automatizado, no le decimos nada sobre cómo falla y no le reconocemos el mérito de examinarlo con detenimiento, para luego decir que tiene el control.

Preparar a las personas para esa función significa enseñar a detectar los fallos y crear flujos de trabajo e incentivos que traten la revisión minuciosa como parte del trabajo en lugar de como un obstáculo para este.


¹ Ye, Zou, Yu y Shi, «Coding with “Enemy”: Can Human Developers Detect AI Agent Sabotage?» (2026), arXiv:2606.05647. Se trata de una prepublicación y aún no ha sido revisada por pares. La cifra del 94 % se refiere a las condiciones del estudio sin un sistema de supervisión automatizado.

² Romeo y Conti, «Exploring Automation Bias in Human–AI Collaboration: A Review and Implications for Explainable AI», AI & Society (2026). Los hallazgos individuales mencionados anteriormente se extraen de los 35 estudios incluidos en el análisis, donde las fuentes originales se citan en su totalidad.

Sobre el autor

Dra. Gundula Zerbes
Investigadora de IA antagónica

Como investigadora de IA antagónica en SoSafe, la Dra. Gundula Zerbes investiga cómo utilizan los ciberdelincuentes la inteligencia artificial para llevar a cabo nuevos ataques. Con un doctorado en Psicología, aprovecha sus conocimientos sobre la experiencia humana, el aprendizaje y la toma de decisiones para comprender cómo explotan los atacantes específicamente las vulnerabilidades psicológicas. Su trabajo combina la innovación técnica con información detallada de la ciencia del comportamiento humano para comprender mejor los nuevos riesgos que plantea la IA.

Más información

También podría interesarte:

¿Quieres saber lo último en ciberseguridad?

Suscríbete a nuestra newsletter para recibir los artículos, eventos y recursos más recientes sobre ciberseguridad. No recibirás spam, solo contenido relevante.

Newsletter visual
Hero Background

Experimente nuestros productos de primera mano

Utilice nuestro entorno de pruebas en línea para ver cómo nuestra plataforma puede ayudarle a capacitar a su equipo para evitar continuamente las ciberamenazas y mantener segura su organización.

Sosafe G2 Concienciación sobre Seguridad Líder Empresa 2026 Sosafe Cyber security training platform top 50 award 2026 Sosafe G2 Concienciación sobre Seguridad Líder 2026 Sosafe G2 Concienciación sobre Seguridad Líder de Momentum 2026 Sosafe G2 Concienciación sobre Seguridad Líder Mercado medio 2026 Sosafe G2 Concienciación sobre Seguridad Líder Europa 2026

This page is not available in English yet.

Diese Seite ist noch nicht in Ihrer Sprache verfügbar. Sie können auf Englisch fortfahren oder zur deutschen Startseite zurückkehren.

Cette page n’est pas encore disponible dans votre langue. Vous pouvez continuer en anglais ou revenir à la page d’accueil en français.

Deze pagina is nog niet beschikbaar in uw taal. U kunt doorgaan in het Engels of terugkeren naar de Nederlandse startpagina.

Esta página aún no está disponible en español. Puedes continuar en inglés o volver a la página de inicio en español.

Questa pagina non è ancora disponibile nella tua lingua. Puoi continuare in inglese oppure tornare alla home page in italiano.