{"id":109069,"date":"2026-08-22T11:02:58","date_gmt":"2026-08-22T09:02:58","guid":{"rendered":"https:\/\/legrandcontinent.eu\/es\/?p=109069"},"modified":"2026-08-22T11:03:06","modified_gmt":"2026-08-22T09:03:06","slug":"podemos-todavia-marcar-las-maquinas","status":"publish","type":"post","link":"https:\/\/legrandcontinent.eu\/es\/2026\/08\/22\/podemos-todavia-marcar-las-maquinas\/","title":{"rendered":"\u00bfTodav\u00eda podemos marcar lo que hacen las m\u00e1quinas?"},"content":{"rendered":"\n
Cuando Scott Aaronson fue contratado en OpenAI, Ilya Sutskever, el cient\u00edfico en jefe, le propuso que reflexionara sobre \u00abuna definici\u00f3n matem\u00e1tica de lo que significar\u00eda, para la IA, amar a la humanidad\u00bb. Aaronson casi se r\u00ede cuando cuenta esta an\u00e9cdota. Viene de otro mundo.<\/em><\/p>\n\n\n\n Te\u00f3rico de la inform\u00e1tica, fue durante mucho tiempo profesor en el MIT y actualmente es profesor en la Universidad de Texas en Austin. Es uno de los principales especialistas en teor\u00eda de la complejidad y computaci\u00f3n cu\u00e1ntica. Galardonado con el Premio ACM de Inform\u00e1tica en 2020, fue elegido miembro de la Academia Nacional de Ciencias en 2026. <\/em><\/p>\n\n\n\n Desde el 2 de agosto, <\/em>la Ley de IA<\/a> obliga a los proveedores que operan en la Uni\u00f3n a indicar que los contenidos generados por sus modelos han sido creados o manipulados espec\u00edficamente por una inteligencia artificial. A ra\u00edz de ello, Anthropic ha anunciado la introducci\u00f3n de una<\/em> <\/em>marca de agua invisible<\/em><\/a> en los textos generados por Claude, lo que<\/em> ha reavivado debates ya antiguos: \u00bfes deseable este tipo de marca? \u00bfSe puede introducir sin mermar la calidad de las respuestas? \u00bfQu\u00e9 grado de resistencia ofrece frente al desarrollo de t\u00e9cnicas dise\u00f1adas para borrarla? \u00bfNo sirve, ante todo, para que los laboratorios reconozcan los textos generados por los LLM y, de este modo, entrenen los modelos \u00fanicamente con textos escritos por humanos, por temor a que entrenar un modelo con contenidos generados por la IA conduzca precisamente a una disminuci\u00f3n de la fiabilidad y la calidad? \u00bfPlantear\u00e1, a la larga, la cuesti\u00f3n de la propiedad intelectual?\u00a0<\/em><\/p>\n\n\n\n Le hemos pedido a Scott Aaronson, que lleva trabajando en estos temas desde antes incluso del lanzamiento de ChatGPT, que empiece por el principio. Nos ha contado c\u00f3mo concibi\u00f3 el \u00abwatermarking\u00bb y nos ha revelado los motivos por los que se separ\u00f3 de Sam Altman, al tiempo que ha compartido sus inquietudes y sus dudas sobre lo que, en su opini\u00f3n, parece ser el fin de la era de la investigaci\u00f3n matem\u00e1tica \u00abtal y como la conoc\u00edamos\u00bb.<\/em><\/p>\n\n\n\n Para recibir nuestras entrevistas y an\u00e1lisis directamente en tu correo electr\u00f3nico, pruebe una suscripci\u00f3n al<\/em> Grand Continent, a partir de 8 euros al mes.<\/em><\/a><\/p>\n\n\n\n La idea de las marcas de agua textuales consiste en modificar muy ligeramente el funcionamiento de un modelo de lenguaje, sin mermar su calidad. Los usuarios obtienen respuestas que se parecen exactamente a las que est\u00e1n acostumbrados con Claude, ChatGPT u otros modelos, pero se incorpora una se\u00f1al estad\u00edstica en el generador de aleatoriedad (la funci\u00f3n criptogr\u00e1fica pseudoaleatoria) que se utiliza para elegir las palabras. De este modo, resulta mucho m\u00e1s f\u00e1cil determinar no solo que un texto ha sido generado por una IA, sino tambi\u00e9n que procede de un modelo concreto.<\/p>\n\n\n\n Mucha gente ha reflexionado sobre esta idea. Que yo sepa, fui el primero en pensar espec\u00edficamente en las marcas de agua de los LLM. Fue poco despu\u00e9s de mi llegada a OpenAI, en el verano de 2022. Me contrataron Ilya Sutskever y Jan Leike, que por entonces dirig\u00edan la investigaci\u00f3n sobre alineaci\u00f3n. Supongo que eran lectores de mi blog. As\u00ed fue como me encontraron y me propusieron unirme a ellos. Fue justo antes del lanzamiento de ChatGPT, el 30 de noviembre de 2022.\u00a0<\/p>\n\n\n\n Era consciente de lo que estaba pasando. Hab\u00eda probado el GPT-3. Me hab\u00eda impresionado much\u00edsimo, ya en 2020 o 2021, y me preguntaba por qu\u00e9 no hab\u00eda m\u00e1s gente que le prestara m\u00e1s atenci\u00f3n. <\/p>\n\n\n\n Pero por aquel entonces, OpenAI a\u00fan dec\u00eda: \u00abMiren, no somos m\u00e1s que una peque\u00f1a organizaci\u00f3n sin \u00e1nimo de lucro. Intentamos hacer las cosas bien por el bien de la humanidad y de forma segura\u00bb.\u00a0<\/p>\n\n\n\n He aprendido a ser extremadamente cauteloso con lo que leo en internet y a no dar nunca por sentado que un mensaje proviene realmente de la persona que dice ser.<\/p>Scott Aaronson<\/cite><\/blockquote><\/figure>\n\n\n\n En aquella \u00e9poca me ofrecieron un a\u00f1o durante el cual pod\u00eda pasar la mayor parte del tiempo en Texas, junto a mis alumnos y mi familia, y limitarme a viajar a San Francisco una vez al mes para reflexionar, entre otras cosas, sobre c\u00f3mo la inform\u00e1tica te\u00f3rica pod\u00eda contribuir a la seguridad de la IA.<\/p>\n\n\n\n En aquel momento, ya hab\u00eda un grupo de personas trabajando en estas cuestiones. De hecho, una buena parte de ellos se hab\u00eda reunido en torno a Paul Christiano, un antiguo alumno que hab\u00eda tenido en el MIT y que, cuando llegu\u00e9, acababa de dejar OpenAI para crear su propia organizaci\u00f3n, el Alignment Research Center (ARC).<\/p>\n\n\n\n Paul hab\u00eda logrado demostrar que la clave para garantizar la seguridad de la IA pod\u00eda encontrarse en la teor\u00eda de la complejidad. En parte, eso fue lo que les llev\u00f3 a interesarse por m\u00ed. Pero yo ya ve\u00eda una dificultad importante: los avances logrados en el control de la IA, la asignaci\u00f3n de objetivos y la garant\u00eda de su seguimiento fiable eran casi totalmente emp\u00edricos. <\/p>\n\n\n\n Eso no era suficiente: hab\u00eda que enunciar expl\u00edcitamente los valores y principios que quer\u00edamos que respetara la IA, un poco al estilo de las novelas de Isaac Asimov. Para ello, se elaboraron lo que hoy denominamos \u00abconstituciones\u00bb. <\/p>\n\n\n\n\n Partiendo de estos principios, se puede evaluar emp\u00edricamente el efecto de los diferentes enfoques y publicar resultados que demuestren, por ejemplo, que una intervenci\u00f3n concreta reduce en un 20 % los comportamientos de trampa, o en un 30 % la propensi\u00f3n del modelo a aceptar ayudar a un usuario a fabricar armas qu\u00edmicas. Tambi\u00e9n se probaban otras v\u00edas, como el aprendizaje por refuerzo.<\/p>\n\n\n\n Todo ello sin entender realmente lo que estaba pasando. As\u00ed que, en el verano de 2022, me puse a pensar en qu\u00e9 pod\u00eda aportar la teor\u00eda a la seguridad de la IA. Me pregunt\u00e9 si era posible hacer algo que tuviera un impacto concreto en el producto. Ese verano fui objeto de una campa\u00f1a de acoso especialmente violenta en mi blog, llevada a cabo sobre todo por personas que se hac\u00edan pasar por mis compa\u00f1eros de trabajo u otros interlocutores. Entonces aprend\u00ed a ser extremadamente cauteloso con lo que le\u00eda en internet y a no dar nunca por sentado que un mensaje proced\u00eda realmente de la persona cuya identidad afirmaba tener.<\/p>\n\n\n\n He barajado varias opciones. Una de ellas habr\u00eda consistido en pedir a las grandes empresas tecnol\u00f3gicas que conservaran un registro de todos los contenidos generados por sus modelos, para poder luego enviarles un texto y plantearles la siguiente pregunta: \u00ab\u00bfHan generado ya este contenido?\u00bb Una soluci\u00f3n as\u00ed plantear\u00eda, evidentemente, cuestiones relacionadas con el respeto a la privacidad. Y aunque pudiera aplicarse sin vulnerar realmente la confidencialidad de los usuarios, seguir\u00eda siendo muy dif\u00edcil convencer al p\u00fablico en general.\u00a0<\/p>\n\n\n\n Otra idea era abordarlo como un problema m\u00e1s de inteligencia artificial, es decir, entrenar una red neuronal para que distinguiera lo mejor posible entre un texto escrito por un ser humano y uno generado por una IA. Esto ya se ha hecho en gran medida. Una empresa, GPTZero, trabajaba precisamente en ello. Una herramienta que goza hoy en d\u00eda de gran notoriedad se llama Pangram y muchos profesores la utilizan para intentar determinar si sus alumnos han recurrido a la IA.<\/p>\n\n\n\n Pero ya hac\u00eda cuatro a\u00f1os que estaba claro que todas estas herramientas generar\u00edan inevitablemente falsos positivos. Sin embargo, incluso con una tasa relativamente baja, de solo un peque\u00f1o porcentaje, el problema sigue siendo considerable: cuando una universidad acusa a un estudiante de hacer trampa, debe poder hacerlo con un grado de certeza extremadamente alto. Por lo tanto, es necesario reducir la tasa de falsos positivos a un nivel del orden de un caso por cada mil, o incluso menos.<\/p>\n\n\n\n Eso fue lo que me llev\u00f3 a pensar en la marca de agua.\u00a0<\/p>\n\n\n\n El funcionamiento de los LLM es intr\u00ednsecamente probabil\u00edstico. Todo el mundo puede comprobarlo: puedes enviar varias veces exactamente la misma indicaci\u00f3n y obtener una respuesta diferente cada vez. \u00bfPor qu\u00e9? Porque la red neuronal Transformer no calcula directamente la siguiente palabra de una frase. Calcula una distribuci\u00f3n de probabilidad sobre las diferentes palabras posibles, o m\u00e1s bien los tokens, que podr\u00edan seguir a la anterior.<\/p>\n\n\n\n A continuaci\u00f3n, en condiciones normales, simplemente extrae un token al azar de esa distribuci\u00f3n. Esto proporciona una nueva entrada, que se vuelve a introducir en el LLM. A su vez, este genera una distribuci\u00f3n para el siguiente token, extrae uno al azar y as\u00ed sucesivamente, de forma autorregresiva.<\/p>\n\n\n\n La generaci\u00f3n de texto mediante un LLM conlleva intr\u00ednsecamente entrop\u00eda. Incluso es posible medir su cantidad. La incertidumbre efectiva a la hora de elegir el siguiente token suele ser del orden de un bit por token. En otras palabras, el modelo dispone, en promedio, de un peque\u00f1o margen de maniobra para elegir entre varias secuencias plausibles.<\/p>\n\n\n\n Sin embargo, si le pides a ChatGPT que enumere los primeros cien n\u00fameros, puede hacerlo, pero pr\u00e1cticamente no habr\u00e1 entrop\u00eda, salvo que juegue con los espacios o los saltos de l\u00ednea. Por lo tanto, no es un contenido al que realmente se le pueda aplicar una marca de agua. Lo mismo ocurre si le pedimos, por ejemplo, el texto de la Declaraci\u00f3n de Independencia.<\/p>\n\n\n\n Pero, en general, cuando le pedimos algo a una IA, aunque en cierto sentido exista una \u00fanica respuesta correcta, hay varias formas diferentes de expresarla, cuyo n\u00famero crece exponencialmente con la longitud del texto. Cuanto m\u00e1s largo es el texto, m\u00e1s posibilidades hay, por tanto, de incorporar una se\u00f1al en \u00e9l.<\/p>\n\n\n\n Cuando intentas detectar la marca de agua, no tienes acceso a las probabilidades. Tampoco ves la indicaci\u00f3n que ha dado lugar a ese texto. Solo ves el texto en s\u00ed. A partir de \u00e9l \u00fanicamente, debes ser capaz de calcular si hay una marca de agua. Mejor a\u00fan, deber\u00edas poder detectar qu\u00e9 partes del texto contienen una marca de agua y cu\u00e1les no.<\/p>\n\n\n\n\n He dise\u00f1ado un m\u00e9todo concreto que permite hacer todo esto. Entre otras cosas, se planteaban cuestiones estad\u00edsticas: dada la entrop\u00eda contenida en esta secuencia de tokens, \u00bfqu\u00e9 hay que hacer para maximizar la potencia estad\u00edstica de la marca de agua obtenida por token? Existe un equilibrio entre la probabilidad de un falso positivo y la de un falso negativo. Pero lo que queremos es minimizar la probabilidad de error, y hacerlo con el menor n\u00famero posible de tokens.<\/p>\n\n\n\n Desarroll\u00e9 parte de la teor\u00eda b\u00e1sica estableciendo una regla para elegir el siguiente token, aplicando un poco de an\u00e1lisis y estad\u00edstica que tuve que desempolvar de mis a\u00f1os de estudios. Posteriormente, unos investigadores en aprendizaje autom\u00e1tico me explicaron que hab\u00eda redescubierto una regla ya conocida en su campo: la regla de Gumbel-Softmax. As\u00ed que llam\u00e9 a mi m\u00e9todo el esquema de Gumbel-Softmax. Nunca se hab\u00eda utilizado con este fin.<\/p>\n\n\n\n De inmediato, algunas personas plantearon esta objeci\u00f3n sobre el compromiso entre la marca de agua y la calidad del texto, al considerar que las probabilidades se ver\u00edan sesgadas en una determinada direcci\u00f3n, lo que alterar\u00eda la calidad de la respuesta.<\/p>\n\n\n\n Me di cuenta de que ese compromiso no exist\u00eda. Basta con sustituir la entrop\u00eda utilizada para elegir el siguiente token por un generador pseudoaleatorio de un tipo concreto, que favorezca ciertas combinaciones extra\u00f1as de tokens en lugar de otras. Se favorecer\u00e1n ciertos n-gramas, por ejemplo, una secuencia de cinco tokens consecutivos, mientras que otros quedar\u00e1n en desventaja.<\/p>\n\n\n\n En OpenAI me dec\u00edan: \u00abNuestra misi\u00f3n es evitar que la IA destruya a la humanidad. \u00bfDe verdad nos preocupan tanto los estudiantes que copian las tareas?\u00bb.<\/p>Scott Aaronson<\/cite><\/blockquote><\/figure>\n\n\n\n Pero, dado que esta elecci\u00f3n se basa en una funci\u00f3n pseudoaleatoria, resulta imperceptible para un lector com\u00fan. Incluso se puede afirmar algo m\u00e1s contundente: la respuesta puede hacerse criptogr\u00e1ficamente indistinguible de una respuesta normal del LLM. Yo no lo hab\u00eda demostrado del todo, pero investigadores como Sam Gunn, Miranda Christ u Or Zamir, muchos de los cuales estaban en Berkeley, continuaron posteriormente mi trabajo para demostrar que era posible obtener una verdadera indistinguibilidad criptogr\u00e1fica.<\/p>\n\n\n\n A continuaci\u00f3n, quedaba por resolver un interesante problema matem\u00e1tico para determinar exactamente c\u00f3mo seleccionar de forma pseudoaleatoria el siguiente token, de modo que se mantuviera la misma distribuci\u00f3n aparente, al tiempo que se incorporaba una se\u00f1al que pudiera detectarse posteriormente.<\/p>\n\n\n\n OpenAI me hab\u00eda asignado a un ingeniero, Hendrik Kirchner. \u00c9l desarroll\u00f3 una implementaci\u00f3n de mi m\u00e9todo y la probamos. Parec\u00eda funcionar exactamente como predec\u00eda la teor\u00eda. Por mi parte, impart\u00eda conferencias p\u00fablicas para dar a conocer el tema.<\/p>\n\n\n\n Fue precisamente en ese momento cuando se lanz\u00f3 ChatGPT. Entonces surgi\u00f3 la duda de si OpenAI iba a implementar realmente esa tecnolog\u00eda. Nunca lleg\u00f3 a hacerlo. Durante el resto de mi estancia en OpenAI, a veces volv\u00eda a insistir en el tema. Incluso le plante\u00e9 el tema directamente a Sam Altman.<\/p>\n\n\n\n Para empezar, mis compa\u00f1eros de la universidad me insist\u00edan en que lo hiciera. En 2023, preve\u00edan una avalancha de trabajos de estudiantes generados por IA, y la situaci\u00f3n no ha hecho m\u00e1s que empeorar desde entonces.\u00a0<\/p>\n\n\n\n Se me ocurr\u00edan todo tipo de usos indebidos que se podr\u00edan dar a los grandes modelos de lenguaje (LLM). El fraude acad\u00e9mico era quiz\u00e1 el m\u00e1s evidente, pero tambi\u00e9n estaban la suplantaci\u00f3n de identidad o el phishing<\/em>.\u00a0<\/p>\n\n\n\n Las cosas no siempre son tan simples. En OpenAI se repet\u00eda con frecuencia un argumento en el que yo no hab\u00eda pensado: \u00abHay muchas personas cuyo ingl\u00e9s no es su lengua materna y que utilizan GPT para mejorar su fluidez en este idioma. Si todas las respuestas llevaran una marca de agua, incluso se podr\u00eda considerar que es discriminatorio imponerles eso\u00bb.<\/p>\n\n\n\n As\u00ed pues, s\u00ed que hubo una decisi\u00f3n de este tipo. Pero ten\u00eda la sensaci\u00f3n de que, para la gran mayor\u00eda de mis colegas universitarios, una vez explicado el problema, la respuesta era obvia: claro que hab\u00eda que hacerlo.<\/p>\n\n\n\n Le plante\u00e9 el tema de la marca de agua directamente a Sam Altman. OpenAI nunca lo ha implementado.\u00a0<\/p>Scott Aaronson<\/cite><\/blockquote><\/figure>\n\n\n\n Los equipos comerciales de OpenAI han realizado encuestas entre los usuarios y una proporci\u00f3n nada desde\u00f1able simplemente detesta la idea de las marcas de agua. Aplicarlas supon\u00eda correr el riesgo de que se marcharan a un gran modelo de lenguaje (LLM) de la competencia. Creo que fue este argumento el que finalmente inclin\u00f3 la balanza en OpenAI.<\/p>\n\n\n\n El equipo encargado de la seguridad y la alineaci\u00f3n nunca se mostr\u00f3 especialmente entusiasmado, porque razonaba as\u00ed: \u00abNuestra misi\u00f3n es evitar que la IA se salga de control y destruya a la humanidad. \u00bfDe verdad nos preocupan tanto los estudiantes que copian las tareas? Quiz\u00e1 las tareas tengan que cambiar de todos modos, o incluso desaparecer\u00bb.<\/p>\n\n\n\n Mucha gente intu\u00eda que la batalla estaba perdida de antemano. \u00bfPara qu\u00e9 siquiera intentarlo? Pero yo pensaba que el costo social era muy bajo y que, si logr\u00e1bamos convencer a las empresas de IA para que se coordinaran en este tema, eso enviar\u00eda una se\u00f1al positiva.<\/p>\n\n\n\n La otra pregunta que nos planteamos fue la siguiente: \u00bfrealmente vale la pena hacerlo? En cuanto lo hagamos, la gente tomar\u00e1 contramedidas. Encontrar\u00e1n formas de eliminar la marca de agua. No ten\u00eda una respuesta muy convincente, porque es cierto que, con un m\u00ednimo de esfuerzo, se pueden eliminar.<\/p>\n\n\n\n La forma m\u00e1s sencilla de hacerlo ser\u00eda pedirle a ChatGPT: \u00abEscribe mi trabajo, pero en espa\u00f1ol o en franc\u00e9s\u00bb, o en cualquier otro idioma. A continuaci\u00f3n, introduce el resultado en Google Translate. As\u00ed obtendr\u00e1s un documento completamente diferente al que llevaba incorporada la marca de agua.<\/p>\n\n\n\n\nCuando empez\u00f3 a trabajar para OpenAI en 2022, desarroll\u00f3 la t\u00e9cnica del \u00abwatermarking\u00bb.<\/em> Su enfoque influye hoy en d\u00eda en la mayor\u00eda de los grandes laboratorios de IA. \u00bfCu\u00e1l es el principio general y c\u00f3mo lleg\u00f3 a trabajar en este tema?<\/h3>\n\n\n\n
\u00bfQu\u00e9 visi\u00f3n ten\u00eda entonces sobre el desarrollo de la IA?<\/h3>\n\n\n\n
\u00bfEn qu\u00e9 punto se encontraba la investigaci\u00f3n sobre estas cuestiones? \u00bfEra una prioridad garantizar la seguridad de la IA?<\/h3>\n\n\n\n
\u00bfEn qu\u00e9 consist\u00eda el problema?<\/h3>\n\n\n\n
\n <\/picture>\n
\n <\/picture>\n As\u00ed pues, ha pasado de su \u00e1mbito de especializaci\u00f3n inicial, la inform\u00e1tica, a lo que podr\u00edamos llamar psicolog\u00eda experimental\u2026<\/h3>\n\n\n\n
\u00bfDe qu\u00e9 manera ha influido este acontecimiento en su investigaci\u00f3n?<\/h3>\n\n\n\n
\u00bfA partir de qu\u00e9 caracter\u00edstica del funcionamiento de los LLM ha desarrollado la t\u00e9cnica de la marca de agua?<\/h3>\n\n\n\n
\u00bfCu\u00e1l es la relaci\u00f3n entre la longitud de una respuesta, su entrop\u00eda y el nivel de confianza estad\u00edstica que permite determinar que procede de un modelo concreto?<\/h3>\n\n\n\n
\n <\/picture>\n
\n <\/picture>\n Mucha gente piensa que, necesariamente, existe un compromiso entre la marca de agua y la calidad de la respuesta. \u00bfPor qu\u00e9 es err\u00f3nea esta intuici\u00f3n?<\/h3>\n\n\n\n
\u00bfC\u00f3mo han abordado las grandes empresas farmac\u00e9uticas la cuesti\u00f3n de la marca de agua?\u00a0<\/h3>\n\n\n\n
\u00bfPor qu\u00e9 defendi\u00f3 la implantaci\u00f3n de la marca de agua?<\/h3>\n\n\n\n
Tras el anuncio de Anthropic, un repositorio de GitHub titulado \u00abWatermarks Remover for AI Content\u00bb ha alcanzado unas 11.000 estrellas. \u00bfEstamos condenados a entrar en un juego del gato y el rat\u00f3n entre la inserci\u00f3n y la eliminaci\u00f3n de marcas de agua?<\/h3>\n\n\n\n
\n <\/picture>\n