La start-up estadounidense de robótica Generalist AI presentó ayer, miércoles 19 de agosto, la última versión de su modelo de IA diseñado para ayudar a los robots a aprender y realizar tareas físicas. 1 Según varios ingenieros, esto podría marcar la entrada de la robótica en su «momento GPT-3».
- A diferencia de la mayoría de los robots industriales, programados para realizar de forma repetitiva una tarea o un conjunto definido de tareas, el GEN-1.5 puede aprender una nueva tarea en pocos segundos a partir de una sola demostración, lo que la start-up denomina «prompting físico».
- El modelo presenta una tasa de éxito media del 59 % en un conjunto de 10 tareas manuales sencillas —marcar un pliegue en un papel, apilar tazas, dar la vuelta a un teléfono…—, pero esta cifra asciende hasta el 83 % tras un breve reentrenamiento de 5 minutos con datos, es decir, unas cincuenta demostraciones.
- Tras un breve proceso de ajuste —un ligero ajuste de los pesos internos del modelo a partir de unos minutos de datos—, GEN-1.5 logró barrer los residuos con un cepillo sin cometer prácticamente ningún error (99 % de aciertos).
Generalist AI es una start-up fundada en 2024 por antiguos ingenieros de Google DeepMind y de Boston Dynamics, una de las empresas de robótica más innovadoras del mundo. Esta empresa es conocida, sobre todo, por su robot Spot, un cuadrúpedo que hoy en día utilizan ejércitos y empresas para misiones de reconocimiento e inspección, como en los túneles del metro de París desde 2021.
- Según Generalist AI, la comparación entre GEN-1.5 y GPT-3 se debe a la capacidad del modelo para aprender rápidamente nuevas tareas a partir de uno o varios ejemplos, una de las principales características que marcaron la llegada del modelo lingüístico de OpenAI.
- Sin embargo, para Yu Xiang, investigador en robótica de la Universidad de Texas en Dallas, la comparación con GPT-3 sigue siendo prematura: el lenguaje ofrece a este último una representación unificada, utilizada por todos para interactuar con el modelo, mientras que los robots presentan arquitecturas, pinzas y manos muy diversas.
- Según él, la verdadera prueba consistirá en saber si GEN-1.5 puede transferirse a robots muy diferentes sin perder sus capacidades. 2
Una de las características más sorprendentes de GEN-1.5 es que el preentrenamiento del modelo no contiene ningún dato de simulación. De hecho, este se ha llevado a cabo exclusivamente a partir de datos de interacción física real, captados en entornos cotidianos —hogares, almacenes, fábricas— a través del «motor de datos» desarrollado por la empresa.
En cuanto a GEN-1, su modelo anterior presentado en abril, Generalist AI indicaba que se basaba en unas 500.000 horas de datos reales.
- La start-up reconoce que es «difícil determinar con precisión por qué surgen estas capacidades» del preentrenamiento de GEN-1.5. Plantea la hipótesis de que el modelo podría haber aprendido a detectar y reproducir patrones repetitivos propios del trabajo físico, de forma similar a como los modelos de lenguaje identifican patrones en secuencias genéricas.
La capacidad de los robots para aprender y realizar nuevas tareas tras tan solo unos minutos de entrenamiento podría suponer un aumento considerable de la productividad. China, que por sí sola concentra el 43 % del parque mundial de robots industriales, sería uno de los países mejor posicionados para beneficiarse de ello.
- Pekín instala más robots industriales que el resto del mundo, según el último informe de la Federación Internacional de Robótica (IFR), publicado en septiembre.
- En 2024, más de la mitad de los robots instalados en las fábricas chinas se fabricaban en el propio país.
Notas al pie
- GEN-1.5: Embodied Foundation Models are One-Shot Learners, Generalist AI, 19 de agosto de 2026.
- Publicación de Yu Xiang en X, 20 de agosto de 2026.