affiliation not provided to SSRN
multimodal OCR, document parsing, structured graphics parsing, image-to-SVG, vision-language model, multimodal pretraining