研究人员推出了ESF-Bench,这是一个旨在评估大型语言模型(LLM)在与企业应用相关的挑战性槽填充场景中性能的新基准。该基准包含8个领域的810个多轮样本和6530个槽,重点关注57个困难的真实企业部署场景。初步测试显示,当前LLM存在显著局限性,GPT-OSS-120b在槽提取方面的成功率仅为20.7%。该数据集、分类法和评估代码已在GitHub上公开,以促进进一步研究。 AI
影响 突显了LLM在真实企业数据提取能力方面的关键差距,可能指导未来的模型开发。
排序理由 该集群描述了一个用于评估LLM的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →