Reddit 上的一篇讨论质疑了人类学习评估 (HLE) 基准测试为何尚未达到饱和状态,而其他基准测试的前沿模型通常能达到 90% 以上的准确率。用户指出,即使是困难的数学基准测试也会随着时间的推移而饱和,但 HLE 的最高分数仍保持在 60% 左右,这引起了人们对这一异常现象的好奇。 AI
排序理由 Reddit 讨论关于基准测试饱和特性的内容。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →
Reddit 上的一篇讨论质疑了人类学习评估 (HLE) 基准测试为何尚未达到饱和状态,而其他基准测试的前沿模型通常能达到 90% 以上的准确率。用户指出,即使是困难的数学基准测试也会随着时间的推移而饱和,但 HLE 的最高分数仍保持在 60% 左右,这引起了人们对这一异常现象的好奇。 AI
排序理由 Reddit 讨论关于基准测试饱和特性的内容。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →
完整方法见我们的编辑标准。
<!-- SC_OFF --><div class="md"><p>Every benchmarks get saturated after certain period of time where several frontier models often secure over 90%.</p> <p>But, HLE - this benchmark is so old but have not yet been saturated. How is that even possible?</p> <p>I have seen several tou…