Researchers from Florida Atlantic University (FAU) have developed a system for the ImageCLEF 2026 task on Multimodal Reasoning, focusing on Visual Multiple Choice Question Answering (Visual MCQ) and Visual Open Question Answering (Visual OpenQA). Their approach emphasizes robust output control and inference engineering over task-specific model training. For Visual MCQ, they utilized direct candidate label scoring and score fusion, while for Visual OpenQA, they employed image enhancement, concise prompting, and deterministic decoding. These methods secured third place in Visual MCQ with 0.7108 accuracy and first place in Visual OpenQA with a 0.6488 COMET score. AI
IMPACT Demonstrates the effectiveness of inference engineering techniques in improving multimodal reasoning performance without task-specific training.
RANK_REASON The cluster describes a research paper detailing a system's performance in a specific academic competition. [lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Bleu
- Comet
- Florida Atlantic University
- ImageCLEF 2026
- Meteor
- Multimodal Reasoning
- Rõuge Lakes
- Visual Multiple Choice Question Answering
- Visual Open Question Answering
AI-generated summary · Google Gemini · from 1 sources. How we write summaries →