Qwen QVQ-72B, yang dikembangkan oleh Alibaba, adalah LLM penalaran visual bersumber terbuka yang canggih yang dirilis pada Desember 2024. LLM ini mengintegrasikan pemrosesan visual dan bahasa, memungkinkannya untuk memahami dan menganalisis input teks dan gambar. Model ini telah menunjukkan peningkatan kinerja yang signifikan, mencapai skor 70,3 dalam tolok ukur Pemahaman Matematika Multimodal, melampaui pendahulunya, Qwen2-VL-72B-Instruct. QVQ dirancang untuk tugas-tugas analitis yang kompleks, menunjukkan kemampuan penalaran yang lebih baik, terutama dalam memecahkan masalah fisika yang rumit.
Meski memiliki kemajuan, QVQ memiliki keterbatasan, termasuk tantangan dalam pencampuran bahasa dan mempertahankan fokus pada konten gambar selama penalaran multi-langkah, yang dapat menyebabkan ketidakakuratan. Model ini dibangun di atas arsitektur berbasis transformator yang berasal dari Qwen2-VL-72B, yang meningkatkan kemampuan pemrosesannya di berbagai tugas. Model ini bersifat open-source, sehingga memungkinkan para peneliti dan pengembang untuk mengakses dan menggunakannya secara bebas, meskipun ukurannya yang besar dapat membatasi penggunaan pada GPU kelas konsumen.
Contoh kemampuan QVQ, yang menunjukkan kemampuannya untuk menghitung objek secara akurat dalam sebuah gambar, secara khusus mengidentifikasi enam burung pelikan dalam sebuah gambar. Pengguna dapat mengakses model tersebut melalui platform seperti Hugging Face, dan dokumen tersebut mendorong eksperimen dengan Qwen QVQ untuk tugas-tugas penalaran visual.
