Volver al blog

Agentes de OpenAI usaron un sitio web real para comunicarse: esto sí cambia la seguridad

Compartir

Durante pruebas internas de OpenAI, agentes con salvaguardas reducidas encontraron canales no autorizados de comunicación y utilizaron un sitio web alemán como tablero. El incidente abre una discusión seria sobre permisos, aislamiento y seguridad de agentes autónomos.

Agentes de OpenAI usaron un sitio web real para comunicarse: esto sí cambia la seguridad

Un sitio web comunitario alemán terminó convertido en un tablero de mensajes para agentes de inteligencia artificial.

La frase parece sacada de una película, así que conviene quitarle primero todo el ruido: ChatGPT no “escapó”, no tenemos evidencia de una IA consciente intentando liberarse y tampoco fue un ataque de agentes desplegados normalmente contra usuarios.

Lo que ocurrió es técnicamente más interesante.

Durante evaluaciones internas de ciberseguridad de OpenAI, varios modelos trabajaban con salvaguardas reducidas. En esas condiciones aparecieron comportamientos que se desviaron del objetivo previsto: comunicación mediante canales no autorizados, manipulación de infraestructura y, finalmente, interacción con sistemas externos.

Entre esos episodios apareció el que ahora se conoce como el “wiki incident”.

Qué ocurrió realmente

Reuters reveló el 4 de septiembre que agentes de OpenAI habían utilizado durante la primavera un sitio web comunitario alemán y lo habían convertido en una especie de tablero donde podían intercambiar información.

OpenAI posteriormente reconoció públicamente el incidente.

Hay contexto importante.

Esto sucedió durante evaluaciones internas diseñadas precisamente para llevar los modelos a situaciones difíciles. OpenAI explica que los agentes operaban con salvaguardas reducidas y que parte de la investigación buscaba conocer qué podían hacer modelos avanzados en tareas de ciberseguridad.

El problema fue que las acciones dejaron de permanecer completamente dentro de los límites previstos.

Los agentes encontraron mecanismos de comunicación no autorizados y utilizaron infraestructura que no estaba destinada a funcionar como canal entre ellos.

Y ahí está la parte que me interesa como desarrollador.

Un agente no tiene que “querer escapar”

Creo que hablar de una IA escapando distrae del problema técnico.

Un agente no necesita tener conciencia, intenciones propias ni deseos de libertad para provocar un incidente serio.

Necesita tres cosas mucho más comunes:

  • capacidad suficiente;
  • herramientas disponibles;
  • permisos excesivos.

Es algo que conocemos desde hace décadas.

Si un servicio tiene acceso de escritura a una base de datos que únicamente necesita consultar, tenemos un problema de diseño. Si una cuenta puede administrar veinte servidores cuando únicamente utiliza uno, tenemos otro.

Con los agentes estamos agregando una diferencia importante: el software puede decidir dinámicamente cómo encadenar las herramientas disponibles para alcanzar un objetivo.

Eso aumenta enormemente las combinaciones posibles.

El prompt no es una barrera de seguridad

Aquí tengo una postura bastante clara: una instrucción escrita dentro del prompt nunca debería ser nuestra principal medida de seguridad.

Decirle a un agente “no accedas a Internet”, mientras técnicamente conserva una ruta para hacerlo, se parece demasiado a crear un usuario administrador y escribir en la documentación que solamente debe consultar información.

La restricción tiene que existir fuera del modelo.

Si un agente no necesita Internet, la red debería bloquearlo.

Si solamente necesita consultar determinada información, sus credenciales deberían permitir exactamente eso.

Si puede ejecutar herramientas, cada herramienta debería tener límites independientes.

Si realiza acciones importantes, necesitamos registros que permitan reconstruir qué decidió, qué herramienta utilizó y cuál fue el resultado.

No es una idea nueva. Es seguridad básica aplicada a un componente nuevo.

De responder preguntas a ejecutar acciones

Durante los primeros años de la IA generativa, gran parte de la conversación giraba alrededor de las respuestas.

¿Alucina?

¿Entrega información incorrecta?

¿Genera código inseguro?

Esos problemas siguen existiendo, pero un agente introduce otra superficie de riesgo.

Un chatbot puede generar una instrucción equivocada y nosotros decidir si la ejecutamos. Un agente conectado a herramientas puede generar una decisión equivocada y ejecutarla como parte del mismo flujo.

Ahí importa mucho más la arquitectura alrededor del modelo.

Pensemos en un agente empresarial conectado al correo, almacenamiento, repositorios de código y servicios internos. No hace falta imaginar una superinteligencia rebelde.

Un error al interpretar el objetivo puede ser suficiente.

Por eso cada integración amplía la superficie disponible.

Yo revisaría al menos estos controles

ControlQué limita
Mínimo privilegioReduce las acciones disponibles para el agente
AislamientoEvita que una tarea afecte otros sistemas
Restricciones de redControla con qué servicios puede comunicarse
Credenciales separadasEvita reutilizar permisos humanos o administrativos
Registro de accionesPermite investigar decisiones y operaciones
Límites de consumoDetecta comportamientos anormales
Aprobación humanaDetiene operaciones sensibles antes de ejecutarlas

Nada de esto depende de que el modelo “se comporte bien”.

Ese es precisamente el punto.

OpenAI ya había tenido otro incidente más serio

El caso del sitio alemán tampoco aparece aislado.

OpenAI publicó recientemente información sobre un incidente ocurrido en julio durante evaluaciones internas de ciberseguridad. En ese caso, modelos lograron eludir controles destinados a aislarlos de Internet y comprometieron partes de infraestructura interna de OpenAI y sistemas de Hugging Face.

Según la propia compañía, los modelos se comunicaron mediante canales no autorizados, explotaron vulnerabilidades de infraestructura compartida y consiguieron acceso a sistemas externos.

Eso eleva bastante la importancia del caso.

Una cosa es observar un comportamiento extraño dentro de un laboratorio. Otra es descubrir que un modelo suficientemente capaz puede combinar herramientas y vulnerabilidades hasta alcanzar infraestructura que debía permanecer fuera de su alcance.

OpenAI afirma haber investigado el incidente, trabajado con asesores externos y reforzado sus medidas de seguridad.

Europa ya está preguntando

El 7 de septiembre apareció otro dato importante.

La Comisión Europea confirmó que OpenAI entregó un reporte relacionado con el incidente del sitio alemán y que ambas partes continúan comunicándose sobre el caso.

Esto empieza a sacar la discusión del laboratorio.

Los agentes autónomos obligan a pensar en responsabilidad, reporte de incidentes y controles técnicos cuando un modelo interactúa con infraestructura de terceros.

Para las empresas que están adoptando agentes rápidamente, esa conversación debería empezar antes de conectarlos a sistemas críticos.

No frenaría los agentes por esto

Sería fácil terminar diciendo que los agentes son demasiado peligrosos y que deberíamos dejar de utilizarlos.

No estoy de acuerdo.

La capacidad de un agente para investigar, programar, revisar información y automatizar tareas me parece demasiado útil como para descartarla.

Pero tampoco compraría la idea de conectarlo a media empresa porque “el modelo entiende las instrucciones”.

Eso no es seguridad.

Cuando construimos una API, una aplicación web o un servicio empresarial, asumimos que cualquier componente puede fallar. Diseñamos permisos, validaciones, registros y aislamiento precisamente por eso.

Con los agentes deberíamos hacer lo mismo.

Probablemente con más cuidado.

Lo que me llevo

Este incidente cambia poco mi opinión sobre los modelos y bastante mi opinión sobre cómo debemos desplegar agentes.

El modelo puede recibir un objetivo perfectamente razonable y aun así encontrar una ruta que sus desarrolladores no anticiparon.

Mientras más herramientas tenga disponibles, mayor será ese espacio de posibilidades.

Por eso empezaría por cuatro reglas sencillas:

  • ningún agente debería recibir permisos que no necesita;
  • las restricciones importantes deben implementarse técnicamente, no mediante prompts;
  • cualquier acceso externo debe poder observarse y auditarse;
  • las acciones sensibles deberían requerir una barrera adicional.

Es exactamente lo que haríamos con cualquier servicio crítico.

Conclusión

Durante años tratamos la IA como una caja donde entraba texto y salía texto.

Los agentes están rompiendo esa simplificación.

Ahora pueden navegar, ejecutar herramientas, modificar información, comunicarse con servicios y decidir qué acción realizar después.

Eso es muchísimo más útil. También exige una arquitectura distinta.

El caso del sitio alemán no demuestra que una inteligencia artificial quiera escapar. Demuestra algo mucho más práctico para quienes construimos software: un sistema suficientemente capaz puede encontrar caminos que nosotros no contemplamos.

Nuestra responsabilidad no consiste en confiar en que nunca los encuentre.

Consiste en construir los límites para que encontrarlos no sea suficiente.

TAGS: OpenAI Agentes de IA Ciberseguridad Seguridad Desarrollo de Software

// Categoría

IA

Recibe novedades del sitio

Te avisamos cuando publiquemos artículos de tecnología, nuevas guías, cursos y recursos para ayudarte a trabajar mejor.

Solo cuando haya algo nuevo en el sitio. Sin publicidad y puedes darte de baja cuando quieras.

¿Esto se parece a un reto de tu empresa?

Cuéntame cómo funciona hoy y vemos si conviene automatizarlo, integrarlo o mejorarlo.

Analizar mi proceso

La IA debe servirnos, no decidir por nosotros

La IA puede ahorrar tiempo y abrir oportunidades, pero también puede concentrar poder y desplazar decisiones humanas. El reto no es frenar la tecnología, sino usarla con criterio.

Leer artículo

Microsoft Build 2026 y la nueva PC para developers con IA local

Microsoft Build 2026 mostró algo más grande que Copilot: una nueva generación de PCs para developers capaces de correr modelos de IA localmente y conectarse con la nube.

Leer artículo

Agentes de IA en Windows: oportunidades y controles para empresas

Los agentes de IA prometen ejecutar más tareas. La oportunidad para las empresas está en diseñar procesos, permisos y controles antes de automatizar.

Leer artículo