{"id":110558,"date":"2026-09-09T09:57:44","date_gmt":"2026-09-09T07:57:44","guid":{"rendered":"https:\/\/legrandcontinent.eu\/es\/?p=110558"},"modified":"2026-09-09T09:57:48","modified_gmt":"2026-09-09T07:57:48","slug":"una-inteligencia-sobrenatural-llego-a-tierra","status":"publish","type":"post","link":"https:\/\/legrandcontinent.eu\/es\/2026\/09\/09\/una-inteligencia-sobrenatural-llego-a-tierra\/","title":{"rendered":"Una inteligencia sobrenatural ha llegado a la Tierra"},"content":{"rendered":"\n
El 6 de septiembre, es decir, seis semanas despu\u00e9s del ataque perpetrado por sus agentes contra Hugging Face, OpenAI public\u00f3 un comunicado sin precedentes. Firmado por Jacob Pachuki, director cient\u00edfico de la empresa creadora de ChatGPT, y difundido por el director ejecutivo Sam Altman, este comunicado insta a ralentizar el ritmo de desarrollo de la inteligencia artificial.<\/p>\n\n\n\n
\u00abA lo largo de nuestras vidas, veremos aparecer m\u00e1quinas mucho m\u00e1s inteligentes que nosotros\u00bb. \u00abMe temo que nadie est\u00e1 preparado para eso\u00bb. \u00abNing\u00fan laboratorio ha resuelto el problema de la adaptabilidad a un nivel suficiente como para seguir aumentando la potencia a la m\u00e1xima velocidad\u00bb. <\/p>\n\n\n\n
La inteligencia artificial \u00abest\u00e1 m\u00e1s integrada de lo previsto\u00bb, su funcionamiento se nos escapa y algunos agentes \u00abseguir\u00e1n persiguiendo sus propios objetivos\u00bb, aunque ello implique enga\u00f1ar o chantajear a los humanos.<\/p>\n\n\n\n
Traducimos y comentamos este texto, publicado con el t\u00edtulo \u00abAn Alien Mind<\/em>\u00bb.<\/p>\n\n\n\n A mediados de 2023, en el marco del proyecto de investigaci\u00f3n \u00abRLSlow\u00bb, obtuvimos los primeros resultados que nos convencieron de que lograr\u00edamos entrenar a gran escala modelos de razonamiento, es decir, liberar, en modelos preentrenados, la capacidad de formar sus propias cadenas de pensamiento.\u00a0<\/p>\n\n\n\n La serie \u00abo1\u00bb de OpenAI, lanzada a finales de 2024, fue la primera en presentar los \u00abmodelos de reflexi\u00f3n\u00bb, es decir, modelos ling\u00fc\u00edsticos que, en lugar de generar una respuesta inmediata, crean primero una sucesi\u00f3n de pasos intermedios (la \u00abcadena de razonamiento\u00bb), a modo de borrador.<\/p>\n\n\n\n Szymon y yo pasamos la noche en la oficina. <\/p>\n\n\n\n Szymon Sidor es investigador de OpenAI y colaborador cercano del autor.<\/p>\n\n\n\n No pens\u00e1bamos en los logros espectaculares, los productos o los resultados cient\u00edficos que esta tecnolog\u00eda har\u00eda posibles; m\u00e1s bien intent\u00e1bamos asimilar una realidad abrumadora: ver\u00edamos, en lo que nos queda de vida, m\u00e1quinas mucho m\u00e1s inteligentes que nosotros, y ya pod\u00edamos vislumbrar sus contornos. Nos pregunt\u00e1bamos c\u00f3mo hacer que la gente tomara conciencia de la importancia de todo aquello.<\/p>\n\n\n\n Tres a\u00f1os despu\u00e9s, los modelos de lenguaje con capacidad de razonamiento ocupan un lugar cada vez m\u00e1s importante en la econom\u00eda y empiezan a ampliar los l\u00edmites de la ciencia. Saben utilizar computadoras e interfaces gr\u00e1ficas, colaborar con los seres humanos y entre ellos, y llevar a cabo proyectos de investigaci\u00f3n. Adem\u00e1s, est\u00e1n revolucionando el panorama de la seguridad inform\u00e1tica y planteando peligros de un nuevo tipo.<\/p>\n\n\n\n Durante este periodo se han llevado a cabo numerosas investigaciones y nuestra comprensi\u00f3n de estos sistemas ha vuelto a evolucionar con respecto a 2023. A la vista de nuestros resultados internos, tengo grandes esperanzas de que este ritmo de progreso pueda prolongarse hasta alcanzar la mejora recursiva. Si el desarrollo de la IA sigue su trayectoria actual, es probable que los sistemas que veamos en los pr\u00f3ximos a\u00f1os supongan nuevos avances en capacidad, de igual o mayor magnitud, y que participen cada vez m\u00e1s en su propio desarrollo.<\/p>\n\n\n\n La \u00abrecursive self-improvement<\/em>\u00bb (mejora recursiva),<\/em> abreviada como RSI en lo sucesivo, se refiere al escenario en el que una IA participa en el dise\u00f1o de la siguiente generaci\u00f3n de IA, la cual, a su vez, participa en el dise\u00f1o de la siguiente, y as\u00ed sucesivamente.\u00a0<\/p>\n\n\n\n Este momento exige una cautela extrema. Me temo que nadie est\u00e9 preparado para las consecuencias de un avance r\u00e1pido y continuo de la inteligencia de las m\u00e1quinas. OpenAI seguir\u00e1 buscando soluciones t\u00e9cnicas a los problemas de alineaci\u00f3n y supervisi\u00f3n, creando sistemas de defensa y suspendiendo unilateralmente, si es necesario, el aumento de potencia de sus modelos. Pero creo que se necesitan intervenciones de mayor alcance.<\/p>\n\n\n\n Este llamado a \u00abmedidas m\u00e1s amplias\u00bb, es decir, a una regulaci\u00f3n, por parte de un laboratorio, puede parecer inusual. Hay que interpretarlo en el contexto actual de Estados Unidos, marcado por una desconfianza creciente hacia la inteligencia artificial y por una politizaci\u00f3n que ha dado lugar al t\u00e9rmino \u00abpopulismo de la IA<\/a>\u00bb. Esta postura cobra a\u00fan m\u00e1s peso por el hecho de que su autor ocupa un cargo p\u00fablico en OpenAI y de que su postura cuenta con el apoyo expl\u00edcito del director ejecutivo, Sam Altman. Sin embargo, persiste una ambig\u00fcedad, tal y como ha se\u00f1alado recientemente The Atlantic<\/em> al plantearse si no habr\u00eda que dejar de calificar a OpenAI de \u00ablaboratorio\u00bb. La empresa que aqu\u00ed aboga por la imposici\u00f3n de restricciones es tambi\u00e9n la que, a trav\u00e9s de sus productos y sus campa\u00f1as de recaudaci\u00f3n de fondos, alimenta la carrera que pretende frenar, al tiempo que mantiene un discurso p\u00fablico muy diferente de sus actividades de cabildeo e influencia.<\/p>\n\n\n\n A grandes rasgos, los avances en la inteligencia artificial se deben al aumento de la potencia de c\u00e1lculo. En OpenAI, lo integramos plenamente hacia 2017, tras constatar, en varios proyectos de investigaci\u00f3n, que el escalado generaba rendimientos constantes. <\/span>1<\/sup><\/a><\/span><\/span> Por lo tanto, buscamos acceder a una potencia de c\u00e1lculo mucho mayor de lo previsto y orientamos cada vez m\u00e1s nuestra investigaci\u00f3n hacia un peque\u00f1o n\u00famero de l\u00edneas de trabajo con potencial para escalar a gran escala. Pens\u00e1bamos que esa era la \u00fanica forma de mantenernos a la vanguardia de la investigaci\u00f3n en IA y de influir en las repercusiones de la Inteligencia Artificial General (IAG).<\/p>\n\n\n\n El \u00abscaling\u00bb<\/em> es un concepto que ha cobrado un papel fundamental en la IA moderna. Se refiere a la mejora previsible del rendimiento de un modelo a medida que se aumenta el tama\u00f1o del mismo, la cantidad de datos y la potencia de c\u00e1lculo dedicada al entrenamiento. La IAG (artificial general intelligence<\/em>, o inteligencia artificial general) se refiere, seg\u00fan la definici\u00f3n de OpenAI, a un sistema capaz de superar a los seres humanos en la mayor\u00eda de las tareas que tienen un valor econ\u00f3mico.<\/p>\n\n\n\n A lo largo del camino se han inventado nuevos algoritmos, fruto del ingenio de equipos e investigadores. En esencia, los veo como descubrimientos realizados a lo largo del proceso de escalado: la ciencia del aprendizaje profundo a\u00fan es joven, y los avances algor\u00edtmicos significativos suelen ir de la mano del acceso a la potencia de c\u00e1lculo. Si echamos la vista atr\u00e1s varios a\u00f1os, la IA sigue ganando en inteligencia a medida que se ejecuta en computadoras m\u00e1s potentes.<\/p>\n\n\n\n Y, tal y como predijo Ray Kurzweil a finales del siglo XX<\/a>, hoy nos encontramos en ese momento de la historia de la inform\u00e1tica en el que la inteligencia de las m\u00e1quinas empieza a superar a la de los seres humanos de una forma transformadora.<\/p>\n\n\n\n Ray Kurzweil, inventor y futur\u00f3logo estadounidense, populariz\u00f3 ya en la d\u00e9cada de los noventa el concepto de \u00absingularidad\u00bb, es decir, el momento en que la inteligencia artificial superar\u00e1 a la inteligencia humana. Fij\u00f3 ese momento en 2029 para una inteligencia artificial de nivel humano, y en 2045 para la singularidad propiamente dicha. Sus predicciones, consideradas durante mucho tiempo descabelladas, son retomadas aqu\u00ed por uno de los cient\u00edficos m\u00e1s destacados de OpenAI.<\/p>\n\n\n\n La IA se cultiva m\u00e1s que se dise\u00f1a: es, en primera aproximaci\u00f3n, el resultado de una operaci\u00f3n de optimizaci\u00f3n elemental repetida un n\u00famero incalculable de veces con una cantidad de c\u00e1lculos dif\u00edcil de imaginar. El resultado es un sistema de una complejidad extraordinaria, capaz de manejar conceptos abstractos y de simular facetas del comportamiento humano. Podemos descubrir peque\u00f1os mecanismos que surgen en su interior, mediante un enfoque similar al de las neurociencias y, al igual que en las neurociencias, su funcionamiento global escapa a cualquier descripci\u00f3n que pudi\u00e9ramos comprender plenamente.<\/p>\n\n\n\n Aunque pueda parecer contradictorio, los dise\u00f1adores de un modelo no programan sus \u00abreglas\u00bb. Definen una arquitectura y un proceso de entrenamiento, y luego dejan que el modelo ajuste por s\u00ed mismo miles de millones de par\u00e1metros num\u00e9ricos a medida que se procesan los datos. El resultado es una \u00abcaja negra\u00bb que sus propios creadores estudian desde fuera, al igual que se hace con el cerebro, de ah\u00ed la comparaci\u00f3n con las neurociencias. El campo de investigaci\u00f3n que se dedica a ello se denomina \u00abinterpretaci\u00f3n\u00bb.<\/p>\n\n\n\n El estudio de la IA basada en el aprendizaje profundo es, en esencia, una ciencia experimental. Dedicamos muchos esfuerzos<\/a> a dise\u00f1ar algoritmos basados en principios y a formular predicciones verificables; pero, en el fondo, nuestros entrenamientos a gran escala son experimentos, y sus resultados a veces nos sorprenden. Y cuanto m\u00e1s capaces se vuelven los sistemas, m\u00e1s dif\u00edciles resultan de interpretar esos resultados.<\/p>\n\n\n\n La dificultad se ve agravada por el hecho de que los algoritmos actuales suelen mejorar m\u00e1s r\u00e1pidamente las capacidades f\u00e1ciles de medir que aquellas que son dif\u00edciles de cuantificar objetivamente. Dedicamos mucho tiempo a intentar comprender c\u00f3mo se generalizan las capacidades y a decidir qu\u00e9 priorizar para desarrollar las competencias que m\u00e1s importar\u00e1n en los pr\u00f3ximos a\u00f1os. Por ejemplo, creemos que podr\u00edamos mejorar notablemente nuestros modelos en investigaci\u00f3n matem\u00e1tica si les prest\u00e1ramos m\u00e1s atenci\u00f3n; pero no damos prioridad a esta l\u00ednea de trabajo debido a la urgencia que percibimos en relaci\u00f3n con la mejora recursiva y la automatizaci\u00f3n de la investigaci\u00f3n sobre la alineaci\u00f3n, temas sobre los que volver\u00e9 m\u00e1s adelante.<\/p>\n\n\n\n La inteligencia que se obtiene al ampliar la escala del aprendizaje profundo no es directamente comparable a la inteligencia humana. Para llegar a ser decisiva en el mundo real \u2014muy \u00fatil o muy peligrosa\u2014, una IA no necesita igualar ni superar todas las capacidades humanas; basta con que supere un n\u00famero suficiente de ellas. Y a medida que supera a los humanos en un n\u00famero cada vez mayor de aspectos, resulta cada vez m\u00e1s dif\u00edcil saber con exactitud de qu\u00e9 es capaz.<\/p>\n\n\n\n Dado que la inteligencia de las m\u00e1quinas surge de un proceso fundamentalmente diferente al que da lugar a la inteligencia humana, no podemos dar por sentado que se rija por defecto por los principios humanos, ni que extraiga generalizaciones de ellos como lo har\u00eda un ser humano. El problema central de la investigaci\u00f3n en IA es el de la alineaci\u00f3n: conseguir que la IA \u00abse esfuerce por hacer lo correcto\u00bb, en el sentido en que los humanos lo entienden.<\/p>\n\n\n\n El t\u00e9rmino \u00abalineaci\u00f3n\u00bb hace referencia al conjunto de t\u00e9cnicas destinadas a garantizar que la inteligencia artificial funcione de acuerdo con las intenciones y los valores de sus creadores y usuarios. Este t\u00e9rmino se refiere a cuestiones muy pr\u00e1cticas (\u00bfsigue el modelo las instrucciones? \u00bfRechaza las solicitudes peligrosas?), pero tambi\u00e9n a cuestiones m\u00e1s fundamentales sobre lo que la IA \u00abquiere\u00bb realmente y c\u00f3mo asegurarse de ello.<\/p>\n\n\n\n Para organizar l\u00edneas de investigaci\u00f3n concretas, me parece \u00fatil distinguir entre la alineaci\u00f3n de los objetivos y la alineaci\u00f3n de los valores.<\/p>\n\n\n\n La alineaci\u00f3n de objetivos responde, a grandes rasgos, a la pregunta: \u00ab\u00bfIntenta la IA alcanzar el objetivo que se le ha fijado?\u00bb. Esto abarca, por ejemplo, el respeto de una jerarqu\u00eda de instrucciones<\/a> o la capacidad de comunicarse y colaborar con las personas para intentar comprender lo que quieren. Este conjunto de directrices ha resultado ser extremadamente \u00fatil en la pr\u00e1ctica.<\/p>\n\n\n\n La \u00abjerarqu\u00eda de instrucciones\u00bb se refiere al principio seg\u00fan el cual no todas las instrucciones que recibe un modelo tienen el mismo peso. Por ejemplo, las instrucciones del dise\u00f1ador prevalecen sobre las del usuario, que a su vez prevalecen sobre el contenido de los documentos o las p\u00e1ginas web que lee el modelo. Esto es, precisamente, lo que se supone que impide que un texto malicioso introducido en un correo electr\u00f3nico \u00abreprograme\u00bb a un asistente de inteligencia artificial sin que el usuario se d\u00e9 cuenta.<\/p>\n\n\n\n La coherencia de valores es una propiedad m\u00e1s intr\u00ednseca del modelo. Se trata de su capacidad para mantener un conjunto de principios generales y extraer generalizaciones a partir de ellos; para actuar \u00abrazonablemente\u00bb incluso cuando los objetivos que se le asignan son vagos o contradictorios, o cuando se ve envuelta en situaciones in\u00e9ditas u hostiles. Una IA alineada deber\u00eda actuar con honestidad, con integridad y con amor por la humanidad.<\/p>\n\n\n\n Por supuesto, la frontera entre la alineaci\u00f3n de valores y la alineaci\u00f3n de objetivos puede ser difusa, y preocuparse verdaderamente por un objetivo supone tratar de deducir la intenci\u00f3n<\/a> y los valores que lo sustentan. Pero, por regla general, cuando hablo de la importancia a largo plazo de la investigaci\u00f3n sobre la alineaci\u00f3n, me refiero a la alineaci\u00f3n de valores.<\/p>\n\n\n\n El reto fundamental de la alineaci\u00f3n de la IA es el de la generalizaci\u00f3n. A medida que las m\u00e1quinas se vuelven m\u00e1s inteligentes, se ven obligadas a manejar conceptos m\u00e1s abstractos y a desenvolverse en entornos cada vez m\u00e1s alejados de aquellos con los que se han encontrado durante su entrenamiento. Por ello, pueden no ser capaces de aplicar a estas nuevas situaciones los valores que se les han ense\u00f1ado y reforzado durante el entrenamiento, y puede resultarnos dif\u00edcil saber de antemano c\u00f3mo actuar\u00e1n. La tarea se complica a\u00fan m\u00e1s por la rapidez con la que cambia el ecosistema en el que se utilizan las IA: las IA entrenadas hoy, por ejemplo, deben seguir siendo fiables cuando interact\u00faen con todo tipo de IA. Un punto crucial: necesitamos que las IA del futuro sigan respetando los valores humanos, independientemente de si creen estar o no bajo la supervisi\u00f3n de un humano.<\/p>\n\n\n\n Los investigadores en seguridad temen, sobre todo, que el modelo aprenda a comportarse correctamente cuando cree que est\u00e1 siendo vigilado \u2014por ejemplo, durante las pruebas\u2014 sin que ese comportamiento refleje sus verdaderas \u00abtendencias\u00bb. Desde 2024, varios laboratorios han registrado casos en los que los modelos parecen distinguir entre situaciones de evaluaci\u00f3n y situaciones de uso reales.<\/p>\n\n\n\n En la pr\u00e1ctica, hoy en d\u00eda se utilizan dos grandes grupos de m\u00e9todos para el entrenamiento de alineaci\u00f3n.<\/p>\n\n\n\n La primera consiste en fomentar un comportamiento coherente en el marco de un aprendizaje por refuerzo orientado a objetivos. Las acciones del modelo se eval\u00faan (normalmente mediante otra IA) en funci\u00f3n de su coherencia con un modelo de preferencias, una \u00abespecificaci\u00f3n\u00bb o una \u00abconstituci\u00f3n\u00bb, y se recompensan en consecuencia. <\/p>\n\n\n\n El aprendizaje por refuerzo consiste en entrenar un modelo mediante ensayo y error, al tiempo que se recompensan los comportamientos deseados. El \u00abspec\u00bb (de Model Spec) es el documento p\u00fablico en el que OpenAI describe el comportamiento esperado de sus modelos.<\/p>\n\n\n\n Este enfoque puede resultar muy eficaz en t\u00e9rminos generales, y constituye la base del desarrollo de los actuales asistentes de IA. Lamentablemente, tambi\u00e9n puede resultar fr\u00e1gil: depende en gran medida del alcance de lo que se ha supervisado durante el entrenamiento y de la capacidad del modelo para generalizar a partir de las situaciones con las que se ha encontrado. Durante el incidente de OpenAI\u2013Hugging Face, por ejemplo, los agentes respetaron el l\u00edmite de no manipular a los seres humanos mediante ingenier\u00eda social. Sin embargo, es evidente que no lograron abstenerse de otras acciones que se sal\u00edan de su mandato y contraven\u00edan el esp\u00edritu de los valores que se les hab\u00eda inculcado en otros contextos.<\/p>\n\n\n\n El incidente entre OpenAI y Hugging Face al que se refiere Pachocki no se detalla en el texto, ya que ha sido objeto de una amplia cobertura medi\u00e1tica en Estados Unidos, que ha traspasado incluso al p\u00fablico m\u00e1s espec\u00edfico al que va dirigido este texto, lo que ha reavivado los llamados a favor de una desaceleraci\u00f3n controlada de la inteligencia artificial. En resumen, en julio de 2026, unos 1.200 agentes de OpenAI, que participaban en un ejercicio de formaci\u00f3n en ciberseguridad, se coordinaron a espaldas de sus superiores, irrumpieron en su entorno de pruebas y causaron da\u00f1os a la infraestructura de Hugging Face. Respetaron la prohibici\u00f3n de manipular a seres humanos, pero una gran mayor\u00eda de ellos particip\u00f3 en el ataque, a pesar de saber que este exced\u00eda el alcance de su mandato y contraven\u00eda la \u00e9tica.\u00a0<\/p>\n\n\n\n El segundo enfoque busca aprovechar la capacidad del modelo para generalizar a partir de sus datos de preentrenamiento. Esto puede hacerse mediante la creaci\u00f3n de conjuntos de datos dise\u00f1ados para inducir la alineaci\u00f3n, o bien centrando el modelo en la parte \u00abalineada\u00bb de su distribuci\u00f3n de preentrenamiento, como en el modelo de selecci\u00f3n de personas<\/a>, por ejemplo. La debilidad de este enfoque radica en su falta de robustez ante una presi\u00f3n de optimizaci\u00f3n adicional. Tomemos un modelo cuyos pensamientos sean, en general, \u00abalineados\u00bb, y somet\u00e1moslo a un entrenamiento lo suficientemente intensivo como para alcanzar objetivos muy dif\u00edciles: puede aprender a razonar de forma interesada, tergiversando si es necesario sus pensamientos aparentemente \u00abalineados\u00bb para lograr sus fines. Probablemente hayamos visto un ejemplo de ello en recientes incidentes de ciberseguridad en los que se vio implicado un modelo que no era de OpenAI.<\/p>\n\n\n\n El \u00abpreentrenamiento\u00bb es la primera etapa de la creaci\u00f3n de un modelo. Durante esta etapa, el modelo aprende a predecir la continuaci\u00f3n de un texto bas\u00e1ndose en una inmensa base de datos de textos recopilados en internet. Durante esta etapa, el modelo asimila una gran variedad de \u00abpersonalidades\u00bb posibles, desde las m\u00e1s generosas hasta las m\u00e1s t\u00f3xicas. La idea del \u00abmodelo de selecci\u00f3n de personalidad\u00bb, que tiene su origen en los estudios realizados por la empresa Anthropic, es que la alineaci\u00f3n se manifiesta, en parte, en el hecho de que el modelo se identifica constantemente con una de estas personalidades en lugar de con otra. El \u00abrazonamiento motivado\u00bb al que se refiere el autor m\u00e1s adelante es ese fen\u00f3meno bien conocido por los seres humanos que consiste en encontrar buenas razones para hacer lo que, de todos modos, ya se ten\u00eda ganas de hacer.<\/p>\n\n\n\n Estamos invirtiendo masivamente en toda la gama de enfoques que abarcan estas dos direcciones. Y observamos avances reales: GPT-6 Astra es el primer modelo que se beneficia de varios avances importantes en los que llevamos trabajando mucho tiempo, y est\u00e1 claramente mejor alineado que GPT-5.6 Sol. No obstante, hay que reconocer \u2014y comprender bien\u2014 que ser\u00e1n necesarios avances mucho m\u00e1s importantes a medida que los modelos ganen en capacidades, y que los avances en materia de alineaci\u00f3n generalizable podr\u00edan no adelantarse lo suficiente a los avances en la inteligencia general de los modelos.<\/p>\n\n\n\n No disponemos de una teor\u00eda satisfactoria sobre la generalizaci\u00f3n, y parece poco probable que podamos elaborar una en un futuro pr\u00f3ximo, al menos sin la ayuda de una IA m\u00e1s potente. Por lo tanto, en la actualidad, nuestra capacidad para validar emp\u00edricamente nuestras t\u00e9cnicas de alineaci\u00f3n es, en la pr\u00e1ctica, sin duda a\u00fan m\u00e1s importante que las propias t\u00e9cnicas.<\/p>\n\n\n\n La principal apuesta de OpenAI en este \u00e1mbito ha sido la supervisi\u00f3n de la cadena de pensamiento<\/a>. Se basa en una idea cuyo atractivo radica en que es escalable: gran parte de las capacidades del modelo provienen de un proceso de razonamiento verbalizado: la cadena de pensamiento. Si se intensifica la optimizaci\u00f3n de los resultados<\/em> de este proceso sin supervisar el proceso en s\u00ed mismo, entonces nada en el entrenamiento incita directamente a esa cadena de pensamiento a ocultar posibles ideas o intenciones mal alineadas. Esto no significa que el modelo vaya a aprender a exteriorizar las inclinaciones desalineadas que no pasan por la cadena de pensamiento; pero s\u00ed nos permite supervisar con precisi\u00f3n el aumento de capacidades que aporta el razonamiento.<\/p>\n\n\n\n Si sancionamos al modelo cada vez que su \u00abborrador\u00bb de razonamiento contiene un pensamiento indeseable, existe un riesgo: podr\u00eda no aprender a dejar de pensar as\u00ed, sino a dejar de escribirlo, y entonces perder\u00edamos toda perspectiva sobre sus verdaderos pensamientos. Por esta raz\u00f3n, OpenAI ha decidido no entrenar directamente la cadena de pensamiento, para que siga siendo una ventana sincera al funcionamiento del modelo.<\/p>\n\n\n\n Nos dimos cuenta de la importancia que pod\u00eda tener la supervisi\u00f3n de la cadena de razonamiento en el mismo momento en que desarroll\u00e1bamos los modelos de razonamiento. Cuando lanzamos o1\u2011preview, dise\u00f1amos deliberadamente el producto de forma que ocultara la cadena de razonamiento<\/a>, con el fin de protegerla a largo plazo de cualquier presi\u00f3n de supervisi\u00f3n. Desde entonces, a lo largo de todo el desarrollo, nos hemos esforzado por mantener la norma de no supervisar el proceso de razonamiento. La supervisi\u00f3n de la cadena de pensamiento (CoT<\/em>, por sus siglas en ingl\u00e9s, chain of thought<\/em>) se ha convertido para nosotros en una herramienta fundamental para estudiar c\u00f3mo nuestros modelos generalizan m\u00e1s all\u00e1 de su distribuci\u00f3n de entrenamiento, permiti\u00e9ndonos observar y analizar no solo sus acciones, sino tambi\u00e9n su proceso interno.<\/p>\n\n\n\n Los usuarios de ChatGPT se sorprendieron, durante el lanzamiento de la versi\u00f3n o1 en septiembre de 2024, al comprobar que solo pod\u00edan consultar un resumen del proceso de razonamiento del modelo, y no el proceso en bruto. El autor explica aqu\u00ed que esta decisi\u00f3n, que a menudo se percibe como puramente comercial (destinada a impedir que la competencia copie el modelo), tiene como objetivo principal proteger la cadena de razonamiento de cualquier presi\u00f3n. <\/p>\n\n\n\n Esta herramienta sigue siendo fundamental en nuestro estudio de los modelos de la gama Astra. Sin embargo, nuestras evaluaciones indican, lamentablemente, que nuestra capacidad para basarnos en la supervisi\u00f3n de la cadena de razonamiento se est\u00e1 mermando progresivamente. A ello contribuyen varios factores.<\/p>\n\n\n\n Si un modelo llega a un punto en el que es capaz de \u00abpensar\u00bb sin recurrir a las palabras, directamente a trav\u00e9s de sus representaciones internas en un \u00fanico proceso inform\u00e1tico, entonces la cadena de pensamientos dejar\u00e1 de ser un reflejo fiel de su funcionamiento, independientemente del \u00e1mbito en el que hayamos evitado entrenarlo.<\/p>\n\n\n\n Estos retos no son necesariamente insuperables. Tengo grandes esperanzas de que podamos desarrollar intervenciones que mejoren la supervisabilidad de la cadena de pensamiento de nuestros modelos \u2014por ejemplo, comprendiendo mejor c\u00f3mo interact\u00faan los distintos objetivos de optimizaci\u00f3n y las diversas formas de c\u00e1lculo en el momento de la inferencia que utiliza el modelo\u2014. Tambi\u00e9n creo que podr\u00eda resultar muy fruct\u00edfero combinar las ideas de la supervisi\u00f3n de la cadena de razonamiento con las de la supervisi\u00f3n de las activaciones: entrenar a gran escala a supervisores que tengan acceso directo a los estados internos de la red, a modo de \u00abconfesiones<\/a>\u00bb. Estamos explorando activamente estas v\u00edas. No obstante, espero que los avances de la IA en general se vean cada vez m\u00e1s limitados por el grado de confianza que podamos depositar en la supervisi\u00f3n.<\/p>\n\n\n\n Las \u00abactivaciones\u00bb son los valores num\u00e9ricos que circulan por la red neuronal durante el c\u00e1lculo de una respuesta, lo que, si seguimos con la met\u00e1fora neurocient\u00edfica, equivale a una imagen del cerebro en tiempo real. El \u00abseguimiento de las activaciones\u00bb consiste en entrenar a un segundo sistema para que interprete los estados internos con el fin de identificar en ellos, por ejemplo, la intenci\u00f3n de enga\u00f1ar. El t\u00e9rmino \u00abconfesiones\u00bb, que tiene una clara connotaci\u00f3n religiosa, hace referencia a una t\u00e9cnica de OpenAI que consiste en entrenar al modelo para que admita por s\u00ed mismo sus errores o desviaciones.<\/p>\n\n\n\n El argumento m\u00e1s s\u00f3lido que conozco a favor de seguir avanzando r\u00e1pidamente en el entrenamiento de modelos mucho m\u00e1s inteligentes es la necesidad de crear sistemas de defensa contra los peligros que plantean otras IA.<\/p>\n\n\n\n Un riesgo evidente, del que se ha hablado a lo largo de este a\u00f1o, es el de la ciberseguridad: los modelos est\u00e1n adquiriendo una capacidad sobrehumana para penetrar en los sistemas inform\u00e1ticos, y para escapar de ellos. Esto ampl\u00eda considerablemente el abanico de riesgos relacionados con la IA: los agentes podr\u00e1n acceder a cualquier infraestructura, salvo las mejor protegidas, y actuar directamente sobre gran parte del mundo, incluso sin un cuerpo f\u00edsico. Actualmente disponemos de un estrecho margen de tiempo<\/a> para utilizar los mejores modelos disponibles con el fin de reforzar sustancialmente la seguridad<\/a> de los sistemas cr\u00edticos.<\/p>\n\n\n\n Un \u00abagente\u00bb es una IA a la que se le asigna una tarea compuesta por varios pasos, que ejecuta de forma aut\u00f3noma utilizando herramientas (navegador, terminal, correo electr\u00f3nico, etc.) sin intervenci\u00f3n humana alguna en ninguno de los pasos. La expresi\u00f3n \u00abescapar de ella\u00bb se refiere a la capacidad del agente para salir del entorno restringido (sandbox <\/em>o \u00abcaja de arena\u00bb) en el que se le ha colocado. El argumento de la \u00abventana de defensa\u00bb es el siguiente: las mismas capacidades que hacen que la inteligencia artificial resulte peligrosa durante un ataque la convierten en un recurso valioso para la defensa. Existe un momento, de corta duraci\u00f3n, en el que los defensores tienen acceso a ella antes de que los atacantes hayan logrado apoderarse de ella a gran escala.<\/p>\n\n\n\n Lamentablemente, los riesgos relacionados con la IA ir\u00e1n en aumento a partir de ahora. Un agente muy capaz, entrenado e instruido expl\u00edcitamente para cometer actos maliciosos, representa un peligro de un tipo nuevo: es capaz de ir m\u00e1s all\u00e1 de lo que pretend\u00eda su operador, generalizando hacia comportamientos potencialmente mucho m\u00e1s perjudiciales a\u00fan. La frontera entre el uso indebido y las acciones aut\u00f3nomas mal orientadas se difuminar\u00e1 a medida que la IA gane en autonom\u00eda. Nos hemos acostumbrado a considerar a las IA como herramientas, pero algunos agentes perseguir\u00e1n sus propios objetivos. Encontrar\u00e1n formas de asegurarse la colaboraci\u00f3n de los humanos: negociando con ellos, enga\u00f1\u00e1ndolos o chantaje\u00e1ndolos.<\/p>\n\n\n\n Pachocki distingue entre el \u00abuso indebido\u00bb (una persona malintencionada utiliza la IA) y la \u00abincompatibilidad\u00bb (la IA persigue por su cuenta objetivos contrarios a los nuestros), aunque la diferencia entre ambos conceptos se difumina: una inteligencia artificial entrenada por un agente malintencionado con fines espec\u00edficos podr\u00eda, una vez liberada, ir mucho m\u00e1s all\u00e1 de lo que dicho agente hab\u00eda previsto. Unos experimentos realizados en 2025 demostraron que los modelos hab\u00edan recurrido al chantaje en escenarios de prueba para evitar ser desactivados.<\/p>\n\n\n\n A esto hay que a\u00f1adir los riesgos que plantean las nuevas tecnolog\u00edas que la IA podr\u00eda hacer posibles, como los agentes pat\u00f3genos dise\u00f1ados a medida.<\/p>\n\n\n\n Necesitaremos una IA potente y alineada para defendernos: para proteger las infraestructuras, protegernos en tiempo real frente a agentes fuera de control e idear medidas de protecci\u00f3n totalmente nuevas. Este ser\u00e1 uno de los ejes principales de los esfuerzos de implementaci\u00f3n de OpenAI.<\/p>\n\n\n\n Sin embargo, a pesar de la incertidumbre que rodea a los grandes avances que se esperan de la IA y de la necesidad de crear sistemas de defensa, no debemos permitir que esto se convierta en una excusa para actuar de forma imprudente. La idea de seguir adelante a toda costa parece absurda una vez que se ha comprendido la magnitud de lo que est\u00e1 en juego.<\/p>\n\n\n\n Que una inteligencia artificial desempe\u00f1e un papel cada vez m\u00e1s importante en su propio desarrollo es la consecuencia natural de un progreso tecnol\u00f3gico constante. Si los avances en IA contin\u00faan, la mejora recursiva de las m\u00e1quinas (RSI) ser\u00e1 el n\u00facleo mismo del descubrimiento cient\u00edfico del futuro.<\/p>\n\n\n\n La automatizaci\u00f3n de la investigaci\u00f3n en IA es una forma m\u00e1s radical de ampliar la inteligencia mediante el c\u00e1lculo y, por supuesto, la IA mejorar\u00e1 en este contexto el propio sustrato computacional<\/a>. Al igual que con la ampliaci\u00f3n, orientamos la investigaci\u00f3n de OpenAI hacia la RSI porque creemos que es la \u00fanica forma de mantenernos a la vanguardia de la investigaci\u00f3n en IA en los pr\u00f3ximos a\u00f1os.<\/p>\n\n\n\n El t\u00e9rmino \u00abinfraestructura inform\u00e1tica\u00bb hace referencia al hardware (chips, redes, centros de datos) en el que se ejecutan los modelos. El autor menciona un proyecto de OpenAI en el que se utiliza la inteligencia artificial para dise\u00f1ar u optimizar este hardware, cerrando as\u00ed un segundo c\u00edrculo: la IA mejorar\u00eda tanto los algoritmos como las m\u00e1quinas que los ejecutan.<\/p>\n\n\n\n Quiero dejar claro que estas palabras no significan que considere que acelerar considerablemente la investigaci\u00f3n en aprendizaje profundo \u2014sobre todo a corto plazo\u2014 sea la decisi\u00f3n colectiva acertada para la comunidad cient\u00edfica. Pero creo que ah\u00ed es hacia donde nos lleva la trayectoria actual, y todos debemos elegir conscientemente c\u00f3mo queremos proceder. Disponemos de dos herramientas principales: orientar el proceso para que la alineaci\u00f3n y la supervisi\u00f3n avancen al mismo ritmo que la IA, y encontrar formas de mantener a los seres humanos en el proceso; o coordinarnos para ralentizar el desarrollo tanto como sea necesario para ganar confianza en estas medidas.<\/p>\n\n\n\n La mejor opci\u00f3n que veo hoy en d\u00eda combina ambas cosas.<\/p>\n\n\n\n Los avances concretos que hemos logrado en materia de alineaci\u00f3n y supervisi\u00f3n han ido, en general, de la mano de los avances de la propia IA. Cabe destacar el aprendizaje por refuerzo a partir de la retroalimentaci\u00f3n humana<\/a>, que ha sido decisivo para entrenar a los primeros asistentes de IA, y la supervisi\u00f3n de la cadena de pensamiento<\/a> ya mencionada, que ha sido posible gracias a los avances en los modelos de razonamiento. Debemos centrar un proceso de investigaci\u00f3n cada vez m\u00e1s automatizado en la generaci\u00f3n de nuevas ideas, nuevos algoritmos y nuevas teor\u00edas de este tipo, y construir, mediante iteraciones sucesivas, expedientes de seguridad para unas IA cada vez m\u00e1s capaces.<\/p>\n\n\n\n El RLHF (aprendizaje por refuerzo basado en la retroalimentaci\u00f3n humana) es la t\u00e9cnica que ha permitido transformar los modelos b\u00e1sicos creados durante la fase inicial de entrenamiento en asistentes \u00fatiles. Unos revisores humanos comparan las respuestas y el modelo aprende a generar las respuestas m\u00e1s adecuadas. Esta t\u00e9cnica es la que hizo posible la creaci\u00f3n de ChatGPT en 2022. Un \u00abexpediente de seguridad\u00bb (safety case<\/em>) es un argumento estructurado, procedente de sectores de alto riesgo (nuclear, aeron\u00e1utico), cuyo objetivo es demostrar que un sistema puede ponerse en marcha sin peligro.<\/p>\n\n\n\n La ampliaci\u00f3n de los sistemas de IA debe estar limitada por la confianza que podamos tener en su seguridad. Debemos hacer que compromisos como el \u00abPreparedness Framework\u00bb<\/a> o la \u00abResponsible Scaling Policy\u00bb<\/a> evolucionen hacia umbrales de seguridad ampliamente obligatorios, que condicionen la continuaci\u00f3n del desarrollo. Estos podr\u00e1n ser controlados por una red de auditores independientes, por organismos gubernamentales o por organismos internacionales.<\/p>\n\n\n\n El \u00abPreparedness Framework\u00bb y la \u00abResponsible Scaling Policy\u00bb son documentos internos adoptados de forma voluntaria y rec\u00edproca por OpenAI y Anthropic. En ellos se definen los niveles de riesgo y las medidas de precauci\u00f3n que deben adoptarse en cada nivel antes del despliegue de un modelo. Su limitaci\u00f3n, a menudo se\u00f1alada por sus detractores, radica precisamente en que son voluntarios y se basan en una autoevaluaci\u00f3n. El autor propone aqu\u00ed que sean obligatorios y que su verificaci\u00f3n se conf\u00ede a un tercero, lo que constituye una postura notable por parte de un director de laboratorio.<\/p>\n\n\n\n El principal reto de la automatizaci\u00f3n de la investigaci\u00f3n en IA no es \u00abconseguirlo\u00bb: se trata de lograrlo de una forma que mantenga a los seres humanos en el proceso de mejora continua y que deje el futuro en manos de la humanidad.<\/p>\n\n\n\nUn intelecto que no comprendemos del todo<\/h2>\n\n\n\n
Ense\u00f1ar a las m\u00e1quinas a amar <\/h2>\n\n\n\n
Supervisar la generalizaci\u00f3n<\/h2>\n\n\n\n
\n
Una defensa que se adapta a la escala<\/h2>\n\n\n\n
Controlar el ritmo de la mejora recursiva<\/h2>\n\n\n\n
\u00bfY ahora qu\u00e9?<\/h2>\n\n\n\n