PulseAugur
实时 10:32:44
English(EN) ESF-Bench: Benchmarking Challenging Slot-Filling Scenarios for Real-World Enterprise Applications

新的ESF-Bench突显了LLM在企业槽填充方面的局限性

研究人员推出了ESF-Bench,这是一个旨在评估大型语言模型(LLM)在与企业应用相关的挑战性槽填充场景中性能的新基准。该基准包含8个领域的810个多轮样本和6530个槽,重点关注57个困难的真实企业部署场景。初步测试显示,当前LLM存在显著局限性,GPT-OSS-120b在槽提取方面的成功率仅为20.7%。该数据集、分类法和评估代码已在GitHub上公开,以促进进一步研究。 AI

影响 突显了LLM在真实企业数据提取能力方面的关键差距,可能指导未来的模型开发。

排序理由 该集群描述了一个用于评估LLM的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的ESF-Bench突显了LLM在企业槽填充方面的局限性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Toby Liang, Gopal Sarda, Sagar Davasam, Vikas Yadav ·

    ESF-Bench: Benchmarking Challenging Slot-Filling Scenarios for Real-World Enterprise Applications

    arXiv:2607.23326v1 Announce Type: new Abstract: The rapid rise of large language models (LLMs) has driven transformative adoption across enterprises. However, deploying these models in real-world settings presents unique challenges due to complex system constraints and unexpected…