{"id":20466,"date":"2026-10-06T09:13:00","date_gmt":"2026-10-06T12:13:00","guid":{"rendered":"http:\/\/laf5.publisher.highstack.com.ar\/?p=20466"},"modified":"2026-10-06T09:13:00","modified_gmt":"2026-10-06T12:13:00","slug":"la-ia-tiene-un-problema-que-no-se-arregla-comprando-mas-chips-el-proximo-gran-ahorro-esta-escondido-en-el-software","status":"publish","type":"post","link":"https:\/\/laf5.publisher.highstack.com.ar\/?p=20466","title":{"rendered":"La IA tiene un problema que no se arregla comprando m\u00e1s chips: el pr\u00f3ximo gran ahorro est\u00e1 escondido en el software"},"content":{"rendered":"<div>\n<p>Durante buena parte de la carrera por la inteligencia artificial, la respuesta a casi cualquier problema de capacidad parec\u00eda ser la misma: m\u00e1s GPUs, m\u00e1s servidores y centros de datos m\u00e1s grandes. Sin embargo, hay un l\u00edmite evidente a esa estrategia. Alimentar toda esa infraestructura cuesta cada vez m\u00e1s dinero. Y las propias empresas est\u00e1n empezando a notarlo.<\/p>\n<p>McKinsey estima que el 89% de las organizaciones ya utiliza IA regularmente en al menos una funci\u00f3n, pero tambi\u00e9n encontr\u00f3 una se\u00f1al menos c\u00f3moda: alrededor de una de cada cinco limita su utilizaci\u00f3n debido a los costes operativos, incluidos los tokens que consumen los modelos.<\/p>\n<p>Eso est\u00e1 convirtiendo una vieja disciplina inform\u00e1tica en algo mucho m\u00e1s importante: hacer que el software necesite menos m\u00e1quina para conseguir el mismo resultado.<\/p>\n<h2>El nuevo objetivo de la IA es aprender a hacer m\u00e1s con menos<\/h2>\n<figure id=\"attachment_2000262689\" aria-describedby=\"caption-attachment-2000262689\" class=\"wp-caption alignnone\"><img loading=\"lazy\" decoding=\"async\" class=\"size-full wp-image-2000262689\" src=\"https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-4-3.jpg\" alt=\"La IA tiene un problema que no se arregla comprando m\u00e1s chips: el pr\u00f3ximo gran ahorro est\u00e1 escondido en el software\" width=\"1500\" height=\"1000\" srcset=\"https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-4-3.jpg 1500w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-4-3-300x200.jpg 300w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-4-3-1024x683.jpg 1024w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-4-3-768x512.jpg 768w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-4-3-672x448.jpg 672w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-4-3-960x640.jpg 960w\" sizes=\"auto, (max-width: 639px) 100vw, (max-width: 1023px) calc(100vw - 2rem), (max-width: 1258px) calc((100vw - 3.68rem) * 2 \/ 3), 800px\"\/><figcaption id=\"caption-attachment-2000262689\" class=\"wp-caption-text\">\u00a9 Unsplash \/ Alex Shuper.<\/figcaption><\/figure>\n<p>La eficiencia puede aparecer en lugares sorprendentemente b\u00e1sicos. Uno de ellos es la precisi\u00f3n num\u00e9rica. Un modelo no necesariamente necesita realizar todos sus c\u00e1lculos utilizando n\u00fameros representados con enorme precisi\u00f3n. T\u00e9cnicas como el entrenamiento en FP16, BF16 o FP8 permiten reducir la cantidad de memoria y operaciones necesarias frente a formatos de mayor precisi\u00f3n.<\/p>\n<p>La clave consiste en decidir d\u00f3nde esa p\u00e9rdida de precisi\u00f3n puede aceptarse y d\u00f3nde no. Un sistema que recomienda una pel\u00edcula, por ejemplo, tiene un margen de error completamente distinto al de una aplicaci\u00f3n m\u00e9dica. Pero hay muchas m\u00e1s posibilidades.<\/p>\n<p>Los desarrolladores pueden reutilizar modelos ya entrenados, reducir par\u00e1metros, destilar modelos grandes en otros m\u00e1s peque\u00f1os, cuantizarlos o dise\u00f1ar arquitecturas que directamente eviten realizar c\u00e1lculos innecesarios.<\/p>\n<p>Ah\u00ed aparece una de las t\u00e9cnicas que mejor representa esta nueva carrera: Mixture of Experts (MoE). En lugar de activar todo el modelo cada vez que llega una consulta, esta arquitectura divide parte de la red neuronal en distintos \u00abexpertos\u00bb y activa solamente los necesarios para procesar cada token.<\/p>\n<p>DeepSeek-V3 es un buen ejemplo. Tiene 671.000 millones de par\u00e1metros, pero aproximadamente 37.000 millones se activan para cada token. Su informe t\u00e9cnico asegura adem\u00e1s que el entrenamiento completo necesit\u00f3 unos 2,788 millones de horas de GPU H800. El truco, en otras palabras, no consiste \u00fanicamente en construir una m\u00e1quina m\u00e1s potente. Tambi\u00e9n en evitar encender partes de ella cuando no hacen falta.<\/p>\n<h2>DeepSeek convirti\u00f3 una necesidad en una ventaja<\/h2>\n<figure id=\"attachment_2000262688\" aria-describedby=\"caption-attachment-2000262688\" class=\"wp-caption alignnone\"><img loading=\"lazy\" decoding=\"async\" class=\"size-full wp-image-2000262688\" src=\"https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-5-3.jpg\" alt=\"La IA tiene un problema que no se arregla comprando m\u00e1s chips: el pr\u00f3ximo gran ahorro est\u00e1 escondido en el software\" width=\"1500\" height=\"1000\" srcset=\"https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-5-3.jpg 1500w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-5-3-300x200.jpg 300w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-5-3-1024x683.jpg 1024w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-5-3-768x512.jpg 768w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-5-3-672x448.jpg 672w, https:\/\/es.gizmodo.com\/app\/uploads\/2026\/10\/Diseno-sin-titulo-5-3-960x640.jpg 960w\" sizes=\"auto, (max-width: 639px) 100vw, (max-width: 1023px) calc(100vw - 2rem), (max-width: 1258px) calc((100vw - 3.68rem) * 2 \/ 3), 800px\"\/><figcaption id=\"caption-attachment-2000262688\" class=\"wp-caption-text\">\u00a9 Unsplash \/ Taylor Vick.<\/figcaption><\/figure>\n<p>La llegada de DeepSeek a la primera l\u00ednea de la IA dej\u00f3 precisamente esa lecci\u00f3n. Su arquitectura combina MoE con otras t\u00e9cnicas destinadas a reducir memoria y c\u00f3mputo, incluido entrenamiento de baja precisi\u00f3n FP8. Investigaciones posteriores sobre su infraestructura describieron precisamente el proyecto como un ejemplo de codise\u00f1o entre hardware y software, donde ambos se optimizan conjuntamente en lugar de tratarse como piezas independientes.<\/p>\n<p>No significa que exista una soluci\u00f3n m\u00e1gica. Los modelos MoE tambi\u00e9n introducen problemas de comunicaci\u00f3n, memoria y distribuci\u00f3n de las cargas entre expertos. De hecho, investigaciones recientes siguen buscando maneras de reducir incluso el n\u00famero de expertos que deben activarse durante la inferencia.\u00a0Pero econ\u00f3micamente el incentivo es enorme.<\/p>\n<p>Cada operaci\u00f3n que desaparece significa menos tiempo de GPU. Menos GPU significa menos electricidad. Y menos electricidad significa una factura menor por cada mill\u00f3n (o miles de millones) de tokens procesados.<\/p>\n<h2>El problema es que la IA no deja de crecer<\/h2>\n<p>Toda esa eficiencia llega justo cuando la infraestructura empieza a convertirse en un problema energ\u00e9tico. La Agencia Internacional de la Energ\u00eda calcul\u00f3 que los centros de datos consumieron alrededor de 415 TWh de electricidad en 2024, aproximadamente el 1,5% del total mundial. Su escenario central proyecta alrededor de 945 TWh para 2030, aunque estimaciones actualizadas sit\u00faan la cifra cerca de los 950 TWh. Eso supone pr\u00e1cticamente duplicar el consumo en pocos a\u00f1os.<\/p>\n<p>La paradoja es que los modelos pueden volverse much\u00edsimo m\u00e1s eficientes mientras el consumo total sigue aumentando. Cuanto m\u00e1s baratos son, m\u00e1s lugares encuentran para utilizarlos: chatbots, programaci\u00f3n, buscadores, generaci\u00f3n multimedia y, cada vez m\u00e1s, agentes capaces de ejecutar cadenas enteras de tareas. Por eso la carrera por el \u00abalgoritmo verde\u00bb tiene algo de econ\u00f3mico antes que ecol\u00f3gico. La industria necesita descubrir cu\u00e1nto c\u00f3mputo puede eliminar sin que el usuario note la diferencia.<\/p>\n<p>Durante a\u00f1os, la competici\u00f3n de la IA consisti\u00f3 en descubrir qui\u00e9n pod\u00eda construir el modelo m\u00e1s grande. La siguiente podr\u00eda decidir qui\u00e9n consigue evitar que todo ese modelo tenga que trabajar cada vez que alguien hace una pregunta.<\/p>\n<\/p><\/div>\n","protected":false},"excerpt":{"rendered":"<p>Durante buena parte de la carrera por la inteligencia artificial, la respuesta a casi cualquier problema de capacidad parec\u00eda ser la misma: m\u00e1s GPUs, m\u00e1s servidores y centros de datos m\u00e1s grandes. Sin embargo, hay un l\u00edmite evidente a esa estrategia. Alimentar toda esa infraestructura cuesta cada vez m\u00e1s dinero. Y las propias empresas est\u00e1n [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":20467,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[1],"tags":[],"class_list":["post-20466","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-sin-categoria"],"_links":{"self":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/posts\/20466","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=20466"}],"version-history":[{"count":0,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/posts\/20466\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=\/wp\/v2\/media\/20467"}],"wp:attachment":[{"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=20466"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=20466"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/laf5.publisher.highstack.com.ar\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=20466"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}