研究人员开发了Perception-RFT,一种用于多模态文档问答的新型训练框架,该框架绕过了中间推理步骤。该方法直接将视觉特征与接地输出对齐,与以推理为中心的方法相比,推理代币成本显著降低了60%以上。在Qwen3-VL-4B模型上的实验表明,启用推理的模型会收敛到基于感知的策略,优于基于推理的强化学习,并证明了从监督微调到强化学习的早期过渡可以以更少的数据实现相当的精度。 AI
影响 通过减少计算开销,这种方法可能带来更高效、更具成本效益的多模态AI系统。
排序理由 该集群包含一篇详细介绍多模态文档问答新训练框架的研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →