两篇新研究论文探讨了在真实世界复杂场景下视觉问答(VQA)的高级技术。第一篇论文介绍了DocIntent,一个旨在通过根据问题可回答性选择性应用恢复工具来改进退化文档上VQA的框架。第二篇论文提出了一个基于决策的智能体,它学习搜索和精炼外部知识,通过将过程建模为多步决策程序来提高基于知识的VQA任务的性能。 AI
影响 这些论文推进了VQA的智能体方法,有望提高在复杂真实世界文档和基于知识的任务上的性能。
排序理由 两篇在arXiv上发表的学术论文,详细介绍了视觉问答的新方法。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- DocIntent
- E-VQA
- Gotit.pub
- Hugging Face
- Influence Flower
- Infoseek
- Knowledge-based visual question answering
- Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond
- retrieval-augmented generation
- ScienceCast
- WildDoc
- Zhuohong Chen
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →