JPMorgan hat ein neues Tool namens DocLLM entwickelt, ein intelligentes Sprachmodell zum Verständnis verschiedener Arten von Geschäftsdokumenten. Im Gegensatz zu anderen Modellen stützt sich DocLLM nicht auf teure Bildtechnologie, sondern konzentriert sich auf das Verständnis der Struktur von Dokumenten, indem es Rechtecke um wichtige Textsegmente identifiziert und definiert. Es verfügt über eine einzigartige Funktion, die sogenannte “disentangled spatial attention”, die es ihm ermöglicht, Informationen innerhalb bestimmter Bereiche eines Dokuments effizient zu verarbeiten. DocLLM ist besonders effektiv bei der Verarbeitung von Dokumenten mit unregelmäßigem Layout und verschiedenen Arten von Inhalten. Um das Modell zu trainieren, verwendete JPMorgan Daten aus zwei Hauptquellen: IIT-CDIP Test Collection 1.0 und DocBank. Tests haben gezeigt, dass DocLLM andere ähnliche Modelle bei verschiedenen dokumentenbezogenen Aufgaben übertrifft. JPMorgan plant, DocLLM weiter zu verbessern, indem es bildverarbeitungsbezogene Funktionen in einer leichtgewichtigen Art und Weise einbezieht.
