Recherche cross-modale pour répondre à des questions visuelles

Paul Lerner, Ferret Olivier, Camille Guinaudeau


Abstract
Répondre à des questions visuelles à propos d’entités nommées (KVQAE) est une tâche difficile qui demande de rechercher des informations dans une base de connaissances multimodale. Nous étudions ici comment traiter cette tâche avec une recherche cross-modale et sa combinaison avec une recherche mono-modale, en se focalisant sur le modèle CLIP, un modèle multimodal entraîné sur des images appareillées à leur légende textuelle. Nos résultats démontrent la supériorité de la recherche cross-modale, mais aussi la complémentarité des deux, qui peuvent être combinées facilement. Nous étudions également différentes manières d’ajuster CLIP et trouvons que l’optimisation cross-modale est la meilleure solution, étant en adéquation avec son pré-entraînement. Notre méthode surpasse les approches précédentes, tout en étant plus simple et moins coûteuse. Ces gains de performance sont étudiés intrinsèquement selon la pertinence des résultats de la recherche et extrinsèquement selon l’exactitude de la réponse extraite par un module externe. Nous discutons des différences entre ces métriques et de ses implications pour l’évaluation de la KVQAE.
Anthology ID:
2023.jeptalnrecital-coria.5
Volume:
Actes de CORIA-TALN 2023. Actes de la 18e Conférence en Recherche d'Information et Applications (CORIA)
Month:
6
Year:
2023
Address:
Paris, France
Editor:
Haïfa Zargayouna
Venue:
JEP/TALN/RECITAL
SIG:
Publisher:
ATALA
Note:
Pages:
74–92
Language:
French
URL:
https://aclanthology.org/2023.jeptalnrecital-coria.5
DOI:
Bibkey:
Cite (ACL):
Paul Lerner, Ferret Olivier, and Camille Guinaudeau. 2023. Recherche cross-modale pour répondre à des questions visuelles. In Actes de CORIA-TALN 2023. Actes de la 18e Conférence en Recherche d'Information et Applications (CORIA), pages 74–92, Paris, France. ATALA.
Cite (Informal):
Recherche cross-modale pour répondre à des questions visuelles (Lerner et al., JEP/TALN/RECITAL 2023)
Copy Citation:
PDF:
https://aclanthology.org/2023.jeptalnrecital-coria.5.pdf