affiliation not provided to SSRN
computer vision, Cultural Heritage, Instance Segmentation, Dataset, 3D Scene Estimation, Multimodal LLM Image Captioning