一项名为TeleTables的新基准测试已被开发出来,用于评估大语言模型(LLMs)在解读电信工程规范中复杂表格方面的性能。该基准测试包含来自3GPP标准的2,220个表格和500个选择题,结果显示,在不提供外部信息的情况下,当前的大语言模型在领域特定知识方面存在困难,没有通用模型能达到超过41%的准确率。当表格作为上下文提供时,性能会显著提高,但随着推理深度和结构复杂性的增加,准确率会下降,这凸显了大语言模型在技术表格解读方面需要增强推理能力。 AI
影响 强调了大语言模型在技术文档解读方面的推理能力和领域知识局限性,可能为未来模型开发提供指导。
排序理由 该集群描述了一个用于评估大语言模型在特定技术任务上性能的新学术基准测试,已在arXiv上发布。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →