Los investigadores de DeepMind Robotics de Google están explorando el potencial de la IA generativa y los grandes modelos fundacionales en robótica. Su objetivo es que los robots comprendan mejor los deseos humanos. Tradicionalmente, los robots se han limitado a tareas singulares, pero el sistema AutoRT, anunciado recientemente, aprovecha grandes modelos fundacionales para ampliar sus capacidades. AutoRT utiliza un modelo de lenguaje visual (VLM) para el conocimiento de la situación y gestiona una flota de robots equipados con cámaras. Un gran modelo de lenguaje sugiere tareas que pueden realizar los robots. El sistema se ha probado con hasta 20 robots y 52 dispositivos diferentes, recopilando más de 77.000 ensayos. Otro desarrollo es RT-Trajectory, que utiliza la entrada de vídeo y superpone un boceto del brazo en acción para entrenar a los robots. Este método ha duplicado la tasa de éxito de los métodos de entrenamiento anteriores. RT-Trajectory también utiliza conjuntos de datos de robots existentes para desbloquear conocimientos y mejorar las políticas de control de los robots. En conjunto, estos avances tienen como objetivo permitir que los robots se muevan con precisión y eficacia en situaciones novedosas.
