Meta, metin, görüntü/video, ses, derinlik, termal ve atalet ölçüm birimleri (IMU) dahil olmak üzere altı modaliteden gelen bilgileri bağlayabilen bir yapay zeka modeli olan ImageBind’ı tanıttı. Model, tüm modaliteler için tek bir gömme veya ortak temsil alanı öğrenerek makinelerin farklı bilgi biçimlerini birlikte daha iyi analiz etmesini sağlar. ImageBind, belirli bir modalite için ayrı ayrı eğitilen önceki uzman modellerden daha iyi performans gösterebilir. Model, Meta’nın çevrelerindeki olası tüm veri türlerinden öğrenen çok modlu yapay zeka sistemleri oluşturma çabalarının bir parçasıdır. ImageBind, görüntü eşleştirilmiş verilerin bu altı modaliteyi birbirine bağlamak için yeterli olduğunu göstererek, diğer modellerin herhangi bir kaynak yoğun eğitim olmadan yeni modaliteleri anlamasını sağlar. Modelin güçlü ölçeklendirme davranışı, diğer modaliteleri kullanmalarını sağlayarak birçok yapay zeka modelini ikame etmesine veya geliştirmesine olanak tanır. ImageBind ayrıca, modaliteler arasında ortaya çıkan sıfır çekim tanıma görevlerinde yeni bir son teknoloji performans elde etti. YZ araştırma topluluğu henüz yalnızca daha büyük modellerde görülen ölçeklendirme davranışlarını etkili bir şekilde ölçmüş ve uygulamalarını anlamış değil. Meta, araştırma topluluğunun ImageBind ve beraberindeki yayınlanmış makaleyi keşfederek görme modellerini değerlendirmek için yeni yollar bulmasını ve yeni uygulamalara yol açmasını umuyor.
