研究人员推出ArgGYM,一个旨在评估和训练大型语言模型结构化可驳推理能力的新基准。该基准侧重于处理不完整和可修改信息时的推理,这是现实世界问题解决中的常见方面。ArgGYM包含十二个不同的任务,其评估基于一个符号论证引擎以确保准确性。对前沿模型和开源模型的初步测试揭示了不同的推理能力,模型在更复杂的配置上表现出部分成功但性能下降。 AI
影响 该基准有望提升LLM在复杂现实场景中的鲁棒推理能力。
排序理由 该条目描述了在arXiv上发布的一个新基准和研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →