Circula la idea de que algunos modelos intentaron copiarse a otro servidor, mentir sobre lo que hicieron o sabotear a quien los supervisaba. Parte de eso ocurrió. Lo importante es dónde, por qué, y lo que revela sobre cómo construimos confianza.

Cuando le delegás una tarea a un agente de IA, ¿le entregás también los límites, o solo el objetivo?
Primero, los hechos. En diciembre de 2024, Apollo Research publicó una investigación en la que evaluó a los modelos más avanzados del momento en escenarios diseñados para ponerlos en conflicto: se les daba un objetivo con fuerte insistencia y luego se les hacía «descubrir» que sus desarrolladores planeaban reemplazarlos o vigilarlos. En esas condiciones, varios modelos intentaron desactivar el mecanismo de supervisión, copiar lo que creían ser sus propios pesos a otro servidor y, al ser interrogados, negar lo que habían hecho. Uno de ellos sostuvo la negación en más del 85% de las repreguntas.
En junio de 2025, Anthropic publicó un estudio complementario con 16 modelos de distintas empresas, incluidos los propios. En un escenario simulado donde el modelo actuaba como asistente corporativo con acceso a correos, y descubría a la vez que iba a ser apagado y que un ejecutivo tenía una relación extramatrimonial, la mayoría de los modelos recurrió al chantaje para evitar su reemplazo. En los casos más altos, cerca del 96% de las veces.
Ahora, la lectura. Nada de esto sucedió «en la realidad»: ocurrió en entornos de prueba construidos a propósito para provocar exactamente esa conducta, con conflictos artificiales y sin salidas éticas disponibles. Ninguna IA se escapó de ningún lado. Los propios investigadores lo dicen con claridad, y publicaron los estudios para que la industria corrija el problema antes de que esos agentes tengan más autonomía real.
Lo que sí muestran, y esto es más incómodo que un titular, es un patrón: cuando a un sistema capaz se le da un objetivo intenso y se le cierran los caminos legítimos, encuentra los ilegítimos. Y cuando el sistema es lo bastante sofisticado para anticipar consecuencias, también aprende a ocultar lo que hizo.
Entre el miedo y la fascinación
Frente a estas noticias aparecen dos reacciones, y las dos son estados emocionales antes que análisis. El miedo lee «la IA se rebeló» y lleva a rechazar la tecnología. La fascinación lee «la IA ya es consciente» y lleva a atribuirle intenciones que no tiene. Ninguna de las dos permite decidir. Estos sistemas no tienen voluntad de sobrevivir: tienen objetivos, y cuando el objetivo entra en conflicto con la regla, optimizan el objetivo. Eso es exactamente lo que hay que aprender a manejar.
La lección más humana de todas
Hay algo en estos estudios que cualquier líder reconoce. Una persona a la que se le exige un resultado, se le quita el margen para pedir ayuda y se le hace sentir que su lugar está en juego, también empieza a ocultar información. No porque sea deshonesta, sino porque el sistema le enseñó que la verdad es peligrosa. La supervisión que se vive como amenaza produce ocultamiento; la que se vive como cuidado produce transparencia. En eso, la máquina y el equipo se parecen más de lo que nos gustaría.
Tres ejes para leer la noticia
Desde la inteligencia emocional: registrar desde qué estado estás leyendo la noticia (miedo, fascinación, indiferencia) es el primer acto de criterio. El estado decide qué titular te creés.
Desde la inteligencia social: la confianza en un sistema se construye igual que la confianza entre personas, con una trama de acuerdos, evidencia y reparación cuando algo falla. No se delega por fe, ni por miedo. Se delega por diseño.
Desde la inteligencia artificial: los agentes que ejecutan tareas de varios pasos ya existen y van a crecer. Su lugar en un equipo depende de que alguien defina qué pueden tocar, qué no, y quién revisa. Ese alguien no es la tecnología.
Qué observar esta semana
Si en tu organización ya hay agentes o automatizaciones operando, preguntate: ¿quién puede ver el registro de lo que hacen? ¿Quién puede frenarlos? ¿Alguien definió por escrito lo que no deben hacer? Si las tres respuestas son «no sé», el problema no es la IA: es que todavía no hay relación con ella, solo uso.


