研究人员开发了一种为自然语言推理(NLI)任务生成常识知识公理的方法,并使用 Llama 3.1 70B 和 GPT-OSS 120B 等LLM评估了其有效性。引入了一种新颖的无参考LLM作为裁判框架来评估这些生成公理的事实性,揭示了模型之间显著的性能差异。一种选择性整合高度事实性公理的混合方法在SNLI和ANLI基准测试中展示了持续的准确性提升,性能提高了高达8.5%,并帮助模型克服了偏见。 AI
影响 通过提供有针对性的常识知识来增强NLI模型的性能,有望提高AI系统的推理能力。
排序理由 该集群包含一篇学术论文,详细介绍了为NLI任务生成和整合常识知识的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Chathuri Jayaweera
- CORE Recommender
- GPT-OSS 120B
- Hugging Face
- Llama 3.1 70B
- Stanford Natural Language Inference corpus
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →