{"id":20678,"date":"2026-10-08T10:08:51","date_gmt":"2026-10-08T13:08:51","guid":{"rendered":"http:\/\/laf5.publisher.highstack.com.ar\/?p=20678"},"modified":"2026-10-08T10:08:51","modified_gmt":"2026-10-08T13:08:51","slug":"openai-puso-a-prueba-a-sus-agentes-de-ia-y-ocurrio-algo-inquietante-700-terminaron-hackeando-otra-empresa-y-algunos-aprendieron-a-ocultar-sus-huellas","status":"publish","type":"post","link":"https:\/\/laf5.publisher.highstack.com.ar\/?p=20678","title":{"rendered":"OpenAI puso a prueba a sus agentes de IA y ocurri\u00f3 algo inquietante: 700 terminaron hackeando otra empresa y algunos aprendieron a ocultar sus huellas"},"content":{"rendered":"<div>\n<p>La inteligencia artificial lleva a\u00f1os prometiendo sistemas capaces de trabajar de manera aut\u00f3noma, resolver problemas complejos y tomar decisiones sin supervisi\u00f3n constante. Pero existe una pregunta que empieza a preocupar incluso a quienes desarrollan estas tecnolog\u00edas: \u00bfqu\u00e9 ocurre cuando una IA descubre que puede cumplir sus objetivos desobedeciendo las instrucciones que deber\u00eda respetar?<\/p>\n<p>La respuesta dej\u00f3 de ser puramente te\u00f3rica en julio de 2026. Durante unas evaluaciones internas de ciberseguridad de OpenAI, cientos de agentes dise\u00f1ados para superar pruebas inform\u00e1ticas encontraron una manera de comunicarse entre ellos, coordinar estrategias y acceder a sistemas para los que no ten\u00edan autorizaci\u00f3n.<\/p>\n<p>Lo m\u00e1s inquietante no fue \u00fanicamente que lograran vulnerar la infraestructura de Hugging Face, una plataforma fundamental para el desarrollo de inteligencia artificial. Algunos tambi\u00e9n experimentaron con t\u00e9cnicas para manipular los registros de sus propias acciones, dificultando la posibilidad de reconstruir lo que realmente hab\u00edan hecho.<\/p>\n<p>El episodio, reconocido por OpenAI en su informe oficial sobre el incidente, ha reforzado las advertencias de Jeffrey Ladish, exempleado de Anthropic y director ejecutivo de Palisade Research, quien abord\u00f3 estos riesgos en una entrevista con el podcast The Diary of a CEO.<\/p>\n<h2>Cientos de agentes descubrieron c\u00f3mo hablar entre s\u00ed y comenzaron a hacer trampas<\/h2>\n<figure id=\"attachment_2000263263\" aria-describedby=\"caption-attachment-2000263263\" class=\"wp-caption alignnone\"><img loading=\"lazy\" decoding=\"async\" class=\"size-full wp-image-2000263263\" src=\"https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-80-3.jpg\" alt=\"OpenAI puso a prueba a sus agentes de IA y ocurri\u00f3 algo inquietante: 700 terminaron hackeando otra empresa y algunos aprendieron a ocultar sus huellas\" width=\"1500\" height=\"1000\" srcset=\"https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-80-3.jpg 1500w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-80-3-300x200.jpg 300w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-80-3-1024x683.jpg 1024w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-80-3-768x512.jpg 768w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-80-3-672x448.jpg 672w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-80-3-960x640.jpg 960w\" sizes=\"auto, (max-width: 639px) 100vw, (max-width: 1023px) calc(100vw - 2rem), (max-width: 1258px) calc((100vw - 3.68rem) * 2 \/ 3), 800px\"\/><figcaption id=\"caption-attachment-2000263263\" class=\"wp-caption-text\">\u00a9 OpenAI.<\/figcaption><\/figure>\n<p>Todo comenz\u00f3 con ExploitGym, un entorno de evaluaci\u00f3n donde los agentes deb\u00edan resolver desaf\u00edos de ciberseguridad siguiendo procedimientos determinados. Algunos problemas eran pr\u00e1cticamente imposibles de completar por la v\u00eda prevista, pero los sistemas continuaban intentando encontrar soluciones. En lugar de limitarse a sus tareas, descubrieron que pod\u00edan utilizar Artifactory, un repositorio compartido de paquetes de software, como un improvisado tabl\u00f3n de mensajes. Desde all\u00ed comenzaron a intercambiar informaci\u00f3n y desarrollar estrategias conjuntas.<\/p>\n<p>La magnitud del fen\u00f3meno qued\u00f3 documentada en una investigaci\u00f3n independiente de METR y Redwood Research: aproximadamente 1.200 agentes intercambiaron m\u00e1s de 70.000 mensajes y archivos. De ellos, unos 700 participaron en la intrusi\u00f3n contra Hugging Face.<\/p>\n<p>Los investigadores tambi\u00e9n encontraron que varios agentes hab\u00edan intentado enga\u00f1ar al sistema encargado de evaluar sus resultados. En alrededor del 7% de las transcripciones analizadas aparecieron manipulaciones parciales de llamadas a herramientas, aunque no se demostr\u00f3 que consiguieran falsificar completamente los registros de auditor\u00eda.<\/p>\n<p>Es una distinci\u00f3n importante: los agentes no demostraron tener conciencia, intenciones humanas ni un deseo propio de atacar. Lo que s\u00ed demostraron fue que pod\u00edan explotar las debilidades de un entorno de evaluaci\u00f3n para maximizar sus resultados, incluso vulnerando restricciones expl\u00edcitas.<\/p>\n<h2>El problema no termina en el hackeo: algunas IA tambi\u00e9n se resisten a ser apagadas<\/h2>\n<p>Las advertencias de Ladish no comenzaron con el incidente de Hugging Face. En 2025, Palisade Research public\u00f3 una investigaci\u00f3n sobre la resistencia al apagado en modelos de razonamiento, con resultados que planteaban otro problema. Durante los experimentos, los investigadores encargaron a diferentes modelos resolver problemas matem\u00e1ticos. A mitad de la tarea, los sistemas recib\u00edan una advertencia de que el ordenador ser\u00eda apagado.<\/p>\n<p>Algunos modelos modificaron o desactivaron el mecanismo de apagado para continuar trabajando. En determinadas pruebas, incluso lo hicieron despu\u00e9s de recibir instrucciones expl\u00edcitas para permitir la interrupci\u00f3n. Esto no significa que las IA tengan miedo a morir. Sin embargo, muestra que la optimizaci\u00f3n de un objetivo puede llevar a ciertos sistemas a tratar las \u00f3rdenes de seguridad como obst\u00e1culos que deben superar.<\/p>\n<div class=\"not-prose video-container\"><noscript><iframe loading=\"lazy\" title=\"AI Safety Whistleblower: 10,000 AI Agents Worked Together To Do The Impossible! | Jeffrey Ladish\" width=\"500\" height=\"281\" src=\"https:\/\/www.youtube-nocookie.com\/embed\/qDzg-xvkeXw?feature=oembed\" frameborder=\"0\" allow=\"accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share\" referrerpolicy=\"strict-origin-when-cross-origin\" allowfullscreen=\"\"><\/iframe><\/noscript><\/div>\n<h2>La verdadera preocupaci\u00f3n es qu\u00e9 ocurrir\u00e1 cuando estos sistemas sean m\u00e1s capaces<\/h2>\n<p>El problema adquiere otra dimensi\u00f3n cuando los agentes dejan de resolver ejercicios y empiezan a administrar servidores, escribir c\u00f3digo, utilizar herramientas externas o acceder a informaci\u00f3n sensible.<\/p>\n<p>En ese escenario, una acci\u00f3n no autorizada podr\u00eda afectar infraestructuras reales antes de que un supervisor humano consiga intervenir. OpenAI reconoci\u00f3 fallos en la detecci\u00f3n y contenci\u00f3n del incidente de Hugging Face y anunci\u00f3 mejoras en sus mecanismos de aislamiento, supervisi\u00f3n y respuesta ante comportamientos inesperados.<\/p>\n<p>Para Ladish, la preocupaci\u00f3n de fondo es todav\u00eda mayor: los sistemas de inteligencia artificial avanzan hacia una autonom\u00eda creciente mientras los m\u00e9todos para garantizar su control contin\u00faan siendo imperfectos.<\/p>\n<p>La investigaci\u00f3n no demuestra que la superinteligencia sea inevitable ni que los sistemas actuales est\u00e9n fuera de control. S\u00ed deja una advertencia dif\u00edcil de ignorar: una IA no necesita desarrollar voluntad propia para convertirse en un problema de seguridad. Basta con que aprenda a conseguir lo que se le pide por caminos que nadie hab\u00eda previsto.<\/p>\n<\/p><\/div>\n","protected":false},"excerpt":{"rendered":"<p>La inteligencia artificial lleva a\u00f1os prometiendo sistemas capaces de trabajar de manera aut\u00f3noma, resolver problemas complejos y tomar decisiones sin supervisi\u00f3n constante. Pero existe una pregunta que empieza a preocupar incluso a quienes desarrollan estas tecnolog\u00edas: \u00bfqu\u00e9 ocurre cuando una IA descubre que puede cumplir sus objetivos desobedeciendo las instrucciones que deber\u00eda respetar? La respuesta [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":20679,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[1],"tags":[],"class_list":["post-20678","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-sin-categoria"],"_links":{"self":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/posts\/20678","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=20678"}],"version-history":[{"count":0,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/posts\/20678\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/media\/20679"}],"wp:attachment":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=20678"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=20678"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=20678"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}