JPMorgan telah mengembangkan alat baru yang disebut DocLLM, sebuah model bahasa pintar yang dirancang untuk memahami berbagai jenis dokumen bisnis. Tidak seperti model lainnya, DocLLM tidak bergantung pada teknologi gambar yang mahal, melainkan berfokus pada pemahaman struktur dokumen dengan mengidentifikasi dan mendefinisikan persegi panjang di sekitar segmen teks yang penting. Ia memiliki fitur unik yang disebut perhatian spasial terurai, yang memungkinkannya memproses informasi secara efisien di dalam area tertentu pada dokumen. DocLLM sangat efektif dalam menangani dokumen dengan tata letak yang tidak beraturan dan jenis konten yang berbeda. Untuk melatih model ini, JPMorgan menggunakan data dari dua sumber utama: IIT-CDIP Test Collection 1.0 dan DocBank. Pengujian telah menunjukkan bahwa DocLLM mengungguli model serupa lainnya dalam berbagai tugas terkait dokumen. JPMorgan berencana untuk meningkatkan DocLLM lebih lanjut dengan memasukkan fitur-fitur yang berhubungan dengan visi dengan cara yang ringan.
