三篇新研究论文探讨了视觉工具在多模态AI模型中的使用效果。ToolVision和OpenVisTool提出了新的方法,通过关注工具生成信息的因果效用和必要性来训练模型使用视觉工具,而不是仅仅模仿工具调用模式。第三篇论文TextCall提出一个假设,即工具调用的文本脚手架,包括其意图和参数,比返回的像素本身对视觉推理更为关键。这些方法旨在改进AI模型学习和利用视觉证据以获得更好推理能力的方式。 AI
影响 这些论文表明,关注工具调用的文本脚手架,而不仅仅是返回的像素,可以带来更有效和高效的AI模型视觉推理能力。
排序理由 三篇在arXiv上发表的学术论文,详细介绍了AI模型视觉工具使用的新方法和假设。
- arXiv
- CodeDance-7B
- CodeVision-8B
- LoRA+
- OpenVisTool
- OpenVisTool-42K
- OpenVisTool-Bench
- Qwen3-VL-32B-Thinking
- reinforcement learning
- TextCall
- Thyme-7B
- ToolVision
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →