研究人员开发了 Project Auto-World 系统,该系统利用大型语言模型 (LLM) 为神经关系推理器自动生成具有挑战性的基准实例。这种方法通过基于 Datalog 规则和 Edge Transformer 评估器创建日益复杂的问题,解决了评估这些模型泛化能力的难题。该系统采用 LLM 驱动的进化和代理搜索来发现产生困难实例的采样函数,并利用生成的数据来提高 Edge Transformer 的泛化能力。这种自动基准测试框架还可以应用于 LLM 提出的新世界,从而促进神经关系推理领域的自主研究。 AI
影响 自动化创建具有挑战性的基准测试,有可能加速神经关系推理领域的研究和开发。
排序理由 该集群描述了一篇研究论文,其中详细介绍了一种用于神经模型自动化基准测试的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →