JPMorgan Mengembangkan Model Bahasa Generatif DocLLM untuk Analisis Dokumen Perusahaan

A sun-filled, cheerful drawing in cartoon style featuring a detailed, friendly robot assistant. The 3:2 aspect ratio image should show the robot busily examining and analyzing a complex business document in an office setting, with visual elements highlighting the structure and different segments of the document. The robot should be showcasing its 'disentangled spatial attention' by focusing on specific areas of the document. Scattered around are multiple documents with varying layouts and content types, indicating the ability of the assistant to deal with diverse documents. The scene should carry a positive vibe that reflects the innovation and efficiency brought about by the language model DocLLM.

JPMorgan telah mengembangkan alat baru yang disebut DocLLM, sebuah model bahasa pintar yang dirancang untuk memahami berbagai jenis dokumen bisnis. Tidak seperti model lainnya, DocLLM tidak bergantung pada teknologi gambar yang mahal, melainkan berfokus pada pemahaman struktur dokumen dengan mengidentifikasi dan mendefinisikan persegi panjang di sekitar segmen teks yang penting. Ia memiliki fitur unik yang disebut perhatian spasial terurai, yang memungkinkannya memproses informasi secara efisien di dalam area tertentu pada dokumen. DocLLM sangat efektif dalam menangani dokumen dengan tata letak yang tidak beraturan dan jenis konten yang berbeda. Untuk melatih model ini, JPMorgan menggunakan data dari dua sumber utama: IIT-CDIP Test Collection 1.0 dan DocBank. Pengujian telah menunjukkan bahwa DocLLM mengungguli model serupa lainnya dalam berbagai tugas terkait dokumen. JPMorgan berencana untuk meningkatkan DocLLM lebih lanjut dengan memasukkan fitur-fitur yang berhubungan dengan visi dengan cara yang ringan.

Artikel lengkap

Tinggalkan Balasan