[EMNLP] RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction | Yuchi Wang (王宇驰)
Image recaptioning is widely used to generate training datasets with enhanced quality for various multimodal tasks. Existing recaptioning methods typically rely on powerful multimodal large language models (MLLMs) to enhance textual descrip…