default author photo

Qi Fu

affiliation not provided to SSRN

SCHOLARLY PAPERS

1

DOWNLOADS

8

TOTAL CITATIONS

0

Scholarly Papers (1)

1.

Multimodal OCR: Parse Anything from Documents

Number of pages: 29 Posted: 27 Jun 2026
Huazhong University of Science and Technology, affiliation not provided to SSRN, Huazhong University of Science and Technology, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, affiliation not provided to SSRN, Huazhong University of Science and Technology, affiliation not provided to SSRN, affiliation not provided to SSRN, Huazhong University of Science and Technology and Huazhong University of Science and Technology - School of Artificial Intelligence and Automation
Downloads 8

Abstract:

Loading...

multimodal OCR, document parsing, structured graphics parsing, image-to-SVG, vision-language model, multimodal pretraining