PulseAugur
实时 09:18:54
实体 OpenEval

OpenEval

PulseAugur coverage of OpenEval — every cluster mentioning OpenEval across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_165206 ·

    新的FBA方法增强了遥感大语言模型在专业任务上的能力

    研究人员开发了一种名为填补后推进(FBA)的新型后训练方法,以提高遥感多模态大语言模型(RS-MLLMs)在专业场景下的性能。FBA通过在进行场景专业化之前先填补先决能力差距,来解决高质量数据稀缺的挑战。当应用于海岸港口理解时,FBA显著提升了在HarborEval基准测试上的性能,LLaVA-v1.5的分数从57.95提升到70.29,Qwen3-VL的分数从81.09提升到83.37,优于其他方法。

  2. TOOL · CL_48786 ·

    论文认为AI评估需要标准化的项目级数据

    一份新的立场文件主张在AI评估中标准化项目级数据发布,以提高透明度和可复现性。作者认为,当前的汇总分数掩盖了项目选择不明确和构建错位等关键问题,导致能力声明夸大和信任错位。为解决此问题,他们提议将项目级数据视为核心基础设施,并推出了OpenEval,一个包含大量基准测试中1000万个响应的存档,旨在促进对AI评估进行更深入的分析和验证。