UDOP model The UDOP model was proposed in Unifying Vision, Text, and Layout for Universal Document Processing by Zineng Tang, Ziyi Yang, Guoxin Wang, Yuwei Fang, Yang Liu, Chenguang Zhu, Michael Zeng, Cha Zhang, Mohit Bansal. Model description UDOP adopts an encoder decoder Transformer architecture based on T5 for document AI tasks like document image classification, document parsing and document visual question answering. Intended uses & limitations You can use the model for document image classification, document parsing and document visual question answering (DocVQA). How to use Here's how to use the model on a document image: Refer to the demo notebooks for fine tuning/inference. BibTeX entry and citation info Data Summary https://huggingface.co/microsoft/udop large/blob/main/data summary card.md
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy