Meta predstavila ImageBind, model umelej inteligencie, ktorý dokáže spájať informácie zo šiestich modalít vrátane textu, obrazu/videa, zvuku, hĺbky, tepelných a inerciálnych meracích jednotiek (IMU). Model sa učí jediné vloženie alebo zdieľaný reprezentačný priestor pre všetky modality, čo umožňuje strojom lepšie analyzovať rôzne formy informácií spoločne. ImageBind dokáže prekonať predchádzajúce špecializované modely vyškolené samostatne pre jednu konkrétnu modalitu. Model je súčasťou úsilia spoločnosti Meta’o vytvorenie multimodálnych systémov umelej inteligencie, ktoré sa učia zo všetkých možných typov údajov vo svojom okolí. ImageBind ukazuje, že na spájanie týchto šiestich modalít postačujú údaje spárované s obrazom, čo umožňuje ďalším modelom porozumieť novým modalitám bez toho, aby bolo potrebné trénovať ich náročné na zdroje. Silné škálovacie správanie modelu’umožňuje nahradiť alebo vylepšiť mnohé modely umelej inteligencie tým, že im umožní používať iné modality. ImageBind tiež dosiahol nový špičkový výkon v úlohách rozpoznávania emergentných nulových snímok v rôznych modalitách. Výskumná komunita AI ešte musí efektívne kvantifikovať škálovacie správanie, ktoré sa objavuje len vo väčších modeloch, a pochopiť jeho aplikácie. Meta dúfa, že výskumná komunita preskúma ImageBind a ich sprievodný publikovaný článok, aby našla nové spôsoby hodnotenia modelov videnia a viedla k novým aplikáciám.
