Google, robotları video ve büyük dil modelleriyle eğitmek için yeni yöntemler belirledi

A light, positive scene depicting an animated, small, cute robot assistant against a background of a room lit up by the ethereal glow of a night sky visible through a window. In one claw-like hand, the robot holds a smartphone with a screen displaying lines of code representing neural networks. Around the robot, floating holographic images coming from the smartphone show different tasks it could accomplish. In a corner of the room, a computer screen shows a video with an overlay of a robotic arm in action. The scene is subtly tinged with the warm golden tones of dusk creeping in.

Google’ın DeepMind Robotics araştırmacıları, robotikte üretken yapay zekanın ve büyük temel modellerin potansiyelini araştırıyor. Robotlara insan arzularını daha iyi anlamalarını sağlamayı amaçlıyorlar. Geleneksel olarak robotlar tekil görevlerle sınırlıydı, ancak yeni duyurulan AutoRT sistemi, yeteneklerini genişletmek için büyük temel modellerden yararlanıyor. AutoRT durumsal farkındalık için bir Görsel Dil Modeli (VLM) kullanıyor ve kameralarla donatılmış bir robot filosunu yönetiyor. Büyük bir dil modeli, robotlar tarafından gerçekleştirilebilecek görevler önermektedir. Sistem 20’ye kadar robot ve 52 farklı cihazla test edilmiş ve 77.000’in üzerinde deneme gerçekleştirilmiştir. Bir başka gelişme de, robotları eğitmek için video girdisi kullanan ve hareket halindeki kolun bir taslağını üst üste bindiren RT-Trajectory’dir. Bu yöntem, önceki eğitim yöntemlerine kıyasla iki kat daha fazla başarı oranı göstermiştir. RT-Trajectory ayrıca bilginin kilidini açmak ve robot kontrol politikalarını iyileştirmek için mevcut robot veri kümelerini kullanır. Genel olarak, bu ilerlemeler robotların yeni durumlarda doğru ve verimli bir şekilde hareket etmesini sağlamayı amaçlamaktadır.

Makalenin tamamı

Bir yanıt yazın