研究人员开发了 OrderProbe,这是一个旨在评估大型语言模型 (LLM) 重建文本精确结构顺序能力的新基准。与允许多种正确重排的先前方法不同,OrderProbe 使用固定的四字符中文、日文和韩文字符串来实现精确匹配评分。对十二个 LLM 的实验显示,即使是先进的模型也难以胜任这项任务,在零样本恢复中的准确率通常低于 35%,这表明语义理解与精确结构重建之间存在差距。 AI
影响 突出了当前 LLM 的一个关键局限性,表明需要改进专注于结构完整性的架构设计。
排序理由 该集群包含一篇介绍 LLM 评估新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →