Google esboza nuevos métodos para entrenar robots con vídeo y grandes modelos lingüísticos

A light, positive scene depicting an animated, small, cute robot assistant against a background of a room lit up by the ethereal glow of a night sky visible through a window. In one claw-like hand, the robot holds a smartphone with a screen displaying lines of code representing neural networks. Around the robot, floating holographic images coming from the smartphone show different tasks it could accomplish. In a corner of the room, a computer screen shows a video with an overlay of a robotic arm in action. The scene is subtly tinged with the warm golden tones of dusk creeping in.

Los investigadores de DeepMind Robotics de Google están explorando el potencial de la IA generativa y los grandes modelos fundacionales en robótica. Su objetivo es que los robots comprendan mejor los deseos humanos. Tradicionalmente, los robots se han limitado a tareas singulares, pero el sistema AutoRT, anunciado recientemente, aprovecha grandes modelos fundacionales para ampliar sus capacidades. AutoRT utiliza un modelo de lenguaje visual (VLM) para el conocimiento de la situación y gestiona una flota de robots equipados con cámaras. Un gran modelo de lenguaje sugiere tareas que pueden realizar los robots. El sistema se ha probado con hasta 20 robots y 52 dispositivos diferentes, recopilando más de 77.000 ensayos. Otro desarrollo es RT-Trajectory, que utiliza la entrada de vídeo y superpone un boceto del brazo en acción para entrenar a los robots. Este método ha duplicado la tasa de éxito de los métodos de entrenamiento anteriores. RT-Trajectory también utiliza conjuntos de datos de robots existentes para desbloquear conocimientos y mejorar las políticas de control de los robots. En conjunto, estos avances tienen como objetivo permitir que los robots se muevan con precisión y eficacia en situaciones novedosas.

Artículo completo

Deja una respuesta