Qwen2.5-VL-32B
PulseAugur coverage of Qwen2.5-VL-32B — every cluster mentioning Qwen2.5-VL-32B across labs, papers, and developer communities, ranked by signal.
-
新的CriterAlign框架提高了AI代码判断的准确性
研究人员推出CriterAlign,一个旨在提高AI评判系统评估代码生成系统准确性的新框架。传统方法通常独立评分响应,这对于成对偏好预测可能不是最优的。CriterAlign通过直接纳入标准级判断并通过一致性检查来完善标准,从而将基于评分标准的判断方法应用于成对评估。该框架还利用人类偏好对齐指南(HPAG)将人类偏好的见解注入AI评判器,增强其理解推理差距的能力。
-
新方法提升小型 LLM GUI 代理的规划能力
研究人员开发了一种名为 PEEU(Planning Experience Exploration and Utilization,规划经验探索与利用)的新方法,以增强小型开源多模态大语言模型(MLLMs)在 GUI 代理任务规划方面的能力。该方法通过自主探索环境以收集经验,并利用事后经验创建高级训练数据,解决了这些模型在规划和跨网站泛化方面的局限性。实验表明,PEEU 显著提高了性能,一个 7B 模型达到了 30.6% 的准确率,超过…
-
新的RAG方法用于医学QA,结果喜忧参半,多模态方法在大规模上优于微调
研究人员开发了MED-VRAG,一个新颖的迭代多模态检索增强生成框架,该框架处理医学文档页面图像,包括表格和图形,而不仅仅是文本。该系统在四个医学QA基准测试中的平均准确率为78.6%,比基线高5.8个百分点,比MedRAG + GPT-4的比较高1.8个百分点。另外,一项在4B参数模型上比较领域微调与RAG在医学问答中的研究发现,微调带来了显著的6.8个百分点的准确率提升,而RAG未显示统计学上的显著改进。