Meta telah memperkenalkan ImageBind, sebuah model AI yang mampu mengikat informasi dari enam modalitas, termasuk teks, gambar / video, audio, kedalaman, termal, dan unit pengukuran inersia (IMU). Model ini mempelajari satu penyematan, atau ruang representasi bersama, untuk semua modalitas, sehingga memungkinkan mesin untuk menganalisis berbagai bentuk informasi secara bersama-sama dengan lebih baik. ImageBind dapat mengungguli model spesialis sebelumnya yang dilatih secara individual untuk satu modalitas tertentu. Model ini merupakan bagian dari upaya Meta untuk menciptakan sistem AI multimodal yang dapat belajar dari semua jenis data yang ada di sekitarnya. ImageBind menunjukkan bahwa data yang dipasangkan dengan gambar sudah cukup untuk mengikat keenam modalitas ini, sehingga memungkinkan model lain untuk memahami modalitas baru tanpa pelatihan yang intensif. Perilaku penskalaan yang kuat dari model ini memungkinkannya untuk menggantikan atau meningkatkan banyak model AI dengan memungkinkan mereka menggunakan modalitas lain. ImageBind juga mencapai kinerja baru yang canggih pada tugas pengenalan tanpa bidikan yang muncul di seluruh modalitas. Komunitas penelitian AI belum secara efektif mengukur perilaku penskalaan yang hanya muncul dalam model yang lebih besar dan memahami aplikasinya. Meta berharap komunitas peneliti akan mengeksplorasi ImageBind dan makalah yang telah diterbitkan untuk menemukan cara baru dalam mengevaluasi model penglihatan dan menghasilkan aplikasi baru.
