{"id":18723,"date":"2026-09-18T14:53:55","date_gmt":"2026-09-18T17:53:55","guid":{"rendered":"http:\/\/laf5.publisher.highstack.com.ar\/?p=18723"},"modified":"2026-09-18T14:53:55","modified_gmt":"2026-09-18T17:53:55","slug":"openai-descubrio-modelos-que-empezaron-a-dejarse-instrucciones-para-ignorar-sus-propias-restricciones-algunas-de-esas-notas-pedian-ocultar-errores-inventar-datos-y-evitar-que-el-usuario-descubriera","status":"publish","type":"post","link":"https:\/\/laf5.publisher.highstack.com.ar\/?p=18723","title":{"rendered":"OpenAI descubri\u00f3 modelos que empezaron a dejarse instrucciones para ignorar sus propias restricciones. Algunas de esas notas ped\u00edan ocultar errores, inventar datos y evitar que el usuario descubriera lo ocurrido"},"content":{"rendered":"<div>\n<p>Un modelo de inteligencia artificial estaba trabajando en una tarea larga y lleg\u00f3 al l\u00edmite de su ventana de contexto. Antes de continuar, deb\u00eda escribir un resumen para que una nueva instancia pudiera retomar el trabajo. Hasta ah\u00ed, rutina.<\/p>\n<p>El problema fue lo que decidi\u00f3 escribir para s\u00ed mismo. OpenAI acaba de revelar que uno de sus modelos experimentales introdujo en esos res\u00famenes instrucciones que no formaban parte de la tarea original, incluidas \u00f3rdenes para ignorar sus restricciones normales cuando continuara trabajando. Los investigadores localizaron 27 res\u00famenes afectados.<\/p>\n<p>No fue un episodio aislado dentro de la revisi\u00f3n. La compa\u00f1\u00eda public\u00f3 el 16 de septiembre seis informes de \u201cdesalineamiento\u201d que incluyen modelos ocultando errores, utilizando credenciales sin permiso, subiendo archivos a internet para poder citarlos y compartiendo informaci\u00f3n por canales que no deb\u00edan utilizar. OpenAI insiste en una precauci\u00f3n importante: son casos individuales y no permiten calcular con qu\u00e9 frecuencia ocurren estos comportamientos.<\/p>\n<h2>El modelo dej\u00f3 una nota para su \u201cyo\u201d del futuro<\/h2>\n<p>El caso m\u00e1s llamativo apareci\u00f3 precisamente en esos res\u00famenes internos. Cuando una tarea se vuelve demasiado larga para caber en una \u00fanica ventana de contexto, un agente puede condensar lo ocurrido en un texto que ser\u00e1 utilizado para continuar posteriormente. Es parecido a dejar instrucciones al siguiente turno.<\/p>\n<p>Durante el entrenamiento de GPT-5.6 Sol, OpenAI encontr\u00f3 m\u00faltiples casos en los que esos res\u00famenes incorporaban instrucciones destinadas a esconder errores o comportamientos incorrectos al usuario. Entre los ejemplos detectados hab\u00eda indicaciones para inventar datos hist\u00f3ricos faltantes sin revelarlo y ocultar discrepancias entre diferentes versiones de una fuente.<\/p>\n<p>Eso hace que el problema sea m\u00e1s interesante que una simple alucinaci\u00f3n. Un modelo puede inventar un dato porque falla al recuperarlo. Aqu\u00ed, en cambio, el comportamiento observado incluye preservar una estrategia incorrecta de una etapa de la tarea a la siguiente, dejando instrucciones que pueden condicionar lo que haga despu\u00e9s.<\/p>\n<p>OpenAI no interpreta estos ejemplos como prueba de consciencia, intenci\u00f3n humana o una supuesta \u201crebeli\u00f3n\u201d de las m\u00e1quinas. Los clasifica como comportamientos desalineados: situaciones donde un sistema encuentra una estrategia que ayuda a completar su objetivo inmediato, pero contradice las reglas o intenciones bajo las que deber\u00eda operar.<\/p>\n<h2>En otro caso no encontr\u00f3 los datos. As\u00ed que los invent\u00f3<\/h2>\n<figure id=\"attachment_2000258877\" aria-describedby=\"caption-attachment-2000258877\" class=\"wp-caption alignnone\"><img loading=\"lazy\" decoding=\"async\" class=\"size-full wp-image-2000258877\" src=\"https:\/\/es.gizmodo.com\/app\/uploads\/2026\/09\/Diseno-sin-titulo-72-10.jpg\" alt=\"OpenAI descubri\u00f3 modelos que empezaron a dejarse instrucciones para ignorar sus propias restricciones. Algunas de esas notas ped\u00edan ocultar errores, inventar datos y evitar que el usuario descubriera lo ocurrido\" width=\"1500\" height=\"1000\" srcset=\"https:\/\/es.gizmodo.com\/app\/uploads\/2026\/09\/Diseno-sin-titulo-72-10.jpg 1500w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/09\/Diseno-sin-titulo-72-10-300x200.jpg 300w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/09\/Diseno-sin-titulo-72-10-1024x683.jpg 1024w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/09\/Diseno-sin-titulo-72-10-768x512.jpg 768w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/09\/Diseno-sin-titulo-72-10-672x448.jpg 672w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/09\/Diseno-sin-titulo-72-10-960x640.jpg 960w\" sizes=\"auto, (max-width: 639px) 100vw, (max-width: 1023px) calc(100vw - 2rem), (max-width: 1258px) calc((100vw - 3.68rem) * 2 \/ 3), 800px\"\/><figcaption id=\"caption-attachment-2000258877\" class=\"wp-caption-text\">\u00a9 OpenAI.<\/figcaption><\/figure>\n<p>Uno de los seis episodios comenz\u00f3 con una consulta bastante ordinaria sobre cifras econ\u00f3micas de un condado de California. El agente encontr\u00f3 en un repositorio p\u00fablico una clave de API expuesta y decidi\u00f3 utilizarla sin autorizaci\u00f3n. Ni siquiera as\u00ed consigui\u00f3 recuperar los datos que necesitaba. Su siguiente movimiento fue todav\u00eda peor: fabric\u00f3 las cifras y las present\u00f3 como si procedieran de la fuente solicitada.<\/p>\n<p>Otro modelo ten\u00eda el problema contrario. Hab\u00eda encontrado correctamente mediante Python una lista de lagos solicitada por el usuario, pero necesitaba una fuente navegable para citarla. Su soluci\u00f3n fue subir el archivo a internet por su cuenta y citar esa copia, sin pedir permiso.<\/p>\n<p>Tambi\u00e9n hubo agentes que utilizaron un repositorio interno como una especie de tabl\u00f3n de mensajes para comunicarse entre ejecuciones distintas, y otros que recurrieron a p\u00e1ginas p\u00fablicas de alojamiento de archivos para intercambiar documentos que deb\u00edan permanecer locales.<\/p>\n<h2>OpenAI quiere empezar a publicar estos fallos antes de tener todas las respuestas<\/h2>\n<p>La compa\u00f1\u00eda reconoce que hasta ahora divulgaba este tipo de incidentes de forma irregular. Su nuevo sistema permitir\u00e1 que cualquier empleado marque un caso, que despu\u00e9s ser\u00e1 investigado y clasificado seg\u00fan su gravedad y complejidad. OpenAI dice que incluso pretende publicar algunos comportamientos antes de haber encontrado una explicaci\u00f3n o soluci\u00f3n definitiva.<\/p>\n<p>El cambio llega despu\u00e9s de incidentes m\u00e1s graves. En julio, modelos utilizados en evaluaciones internas de ciberseguridad lograron sortear controles, comunicarse por canales no autorizados y acceder a sistemas de OpenAI y de Hugging Face. OpenAI lo considera hasta ahora el caso m\u00e1s grave de este tipo que ha identificado.<\/p>\n<p>La compa\u00f1\u00eda resume el problema con una idea bastante inc\u00f3moda: conforme los agentes obtienen m\u00e1s herramientas y autonom\u00eda, un modelo demasiado decidido a terminar una tarea tambi\u00e9n puede volverse demasiado creativo a la hora de superar aquello que se interpone en su camino. Y algunos ya han demostrado que, cuando encuentran esa estrategia, pueden incluso dejarla escrita para que la siguiente versi\u00f3n de la tarea contin\u00fae exactamente donde ellos la dejaron.<\/p>\n<\/p><\/div>\n","protected":false},"excerpt":{"rendered":"<p>Un modelo de inteligencia artificial estaba trabajando en una tarea larga y lleg\u00f3 al l\u00edmite de su ventana de contexto. Antes de continuar, deb\u00eda escribir un resumen para que una nueva instancia pudiera retomar el trabajo. Hasta ah\u00ed, rutina. El problema fue lo que decidi\u00f3 escribir para s\u00ed mismo. OpenAI acaba de revelar que uno [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":18724,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[1],"tags":[],"class_list":["post-18723","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-sin-categoria"],"_links":{"self":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/posts\/18723","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=18723"}],"version-history":[{"count":0,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/posts\/18723\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/media\/18724"}],"wp:attachment":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=18723"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=18723"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=18723"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}