JPMorgan Kurumsal Belge Analizi için Üretken Dil Modeli DocLLM’yi Geliştirdi

A sun-filled, cheerful drawing in cartoon style featuring a detailed, friendly robot assistant. The 3:2 aspect ratio image should show the robot busily examining and analyzing a complex business document in an office setting, with visual elements highlighting the structure and different segments of the document. The robot should be showcasing its 'disentangled spatial attention' by focusing on specific areas of the document. Scattered around are multiple documents with varying layouts and content types, indicating the ability of the assistant to deal with diverse documents. The scene should carry a positive vibe that reflects the innovation and efficiency brought about by the language model DocLLM.

JPMorgan, çeşitli iş belgelerini anlamak için tasarlanmış akıllı bir dil modeli olan DocLLM adlı yeni bir araç geliştirdi. Diğer modellerden farklı olarak DocLLM pahalı görüntü teknolojisine dayanmıyor, bunun yerine önemli metin bölümlerinin etrafındaki dikdörtgenleri belirleyip tanımlayarak belgelerin yapısını anlamaya odaklanıyor. Ayrıştırılmış uzamsal dikkat adı verilen benzersiz bir özelliğe sahiptir, bu da bir belgenin belirli alanlarındaki bilgileri verimli bir şekilde işlemesine olanak tanır. DocLLM özellikle düzensiz düzenlere ve farklı içerik türlerine sahip belgelerin işlenmesinde etkilidir. Modeli eğitmek için JPMorgan iki ana kaynaktan gelen verileri kullandı: IIT-CDIP Test Koleksiyonu 1.0 ve DocBank. Testler DocLLM’nin belgelerle ilgili çeşitli görevlerde diğer benzer modellerden daha iyi performans gösterdiğini ortaya koymuştur. JPMorgan, DocLLM’yi görme ile ilgili özellikleri hafif bir şekilde dahil ederek daha da geliştirmeyi planlıyor.

Makalenin tamamı

Bir yanıt yazın