一项名为CorporateBench (CB) 的新基准测试已被引入,用于评估大型语言模型 (LLM) 在回答来自大型、随时间演变的企业文档集合中的复杂问题的能力。CB旨在解决现有基准测试的局限性,包含超过230,000份文档,并在信息提取和知识库查询方面评估LLM。对五种LLM的初步评估显示,当输入规模接近实际企业规模时,性能显著下降,这凸显了当前LLM在企业沟通方面推理能力的重大差距。 AI
影响 凸显了LLM在处理企业数据方面的性能差距,可能推动开发更适合企业知识管理的模型。
排序理由 该集群描述了一篇介绍用于评估LLM的新型基准测试的学术论文。
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →