通过挖掘调查文章,开发了一个新的研究问答基准,无需手动创建问题。该基准从75个领域的调查中提炼出21,000个查询和评分标准,可作为AI系统的压力测试。即使是表现最佳的模型,也只能达到75%的评分标准覆盖率,并且引用的文献不足11%。 AI
影响 该基准可以揭示当前LLM的局限性,并指导AI评估和问答能力方面的未来研究。
排序理由 该集群描述了一个用于AI评估的新基准的创建,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →