JPMorgan entwickelt das generative Sprachmodell DocLLM für die Analyse von Unternehmensdokumenten

A sun-filled, cheerful drawing in cartoon style featuring a detailed, friendly robot assistant. The 3:2 aspect ratio image should show the robot busily examining and analyzing a complex business document in an office setting, with visual elements highlighting the structure and different segments of the document. The robot should be showcasing its 'disentangled spatial attention' by focusing on specific areas of the document. Scattered around are multiple documents with varying layouts and content types, indicating the ability of the assistant to deal with diverse documents. The scene should carry a positive vibe that reflects the innovation and efficiency brought about by the language model DocLLM.

JPMorgan hat ein neues Tool namens DocLLM entwickelt, ein intelligentes Sprachmodell zum Verständnis verschiedener Arten von Geschäftsdokumenten. Im Gegensatz zu anderen Modellen stützt sich DocLLM nicht auf teure Bildtechnologie, sondern konzentriert sich auf das Verständnis der Struktur von Dokumenten, indem es Rechtecke um wichtige Textsegmente identifiziert und definiert. Es verfügt über eine einzigartige Funktion, die sogenannte “disentangled spatial attention”, die es ihm ermöglicht, Informationen innerhalb bestimmter Bereiche eines Dokuments effizient zu verarbeiten. DocLLM ist besonders effektiv bei der Verarbeitung von Dokumenten mit unregelmäßigem Layout und verschiedenen Arten von Inhalten. Um das Modell zu trainieren, verwendete JPMorgan Daten aus zwei Hauptquellen: IIT-CDIP Test Collection 1.0 und DocBank. Tests haben gezeigt, dass DocLLM andere ähnliche Modelle bei verschiedenen dokumentenbezogenen Aufgaben übertrifft. JPMorgan plant, DocLLM weiter zu verbessern, indem es bildverarbeitungsbezogene Funktionen in einer leichtgewichtigen Art und Weise einbezieht.

Ganzer Artikel

Einen Kommentar hinterlassen