PulseAugur
实时 01:22:47
English(EN) Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners

Project Auto-World 使用 LLM 自动化神经关系推理基准测试

研究人员开发了 Project Auto-World 系统,该系统利用大型语言模型 (LLM) 为神经关系推理器自动生成具有挑战性的基准实例。这种方法通过基于 Datalog 规则和 Edge Transformer 评估器创建日益复杂的问题,解决了评估这些模型泛化能力的难题。该系统采用 LLM 驱动的进化和代理搜索来发现产生困难实例的采样函数,并利用生成的数据来提高 Edge Transformer 的泛化能力。这种自动基准测试框架还可以应用于 LLM 提出的新世界,从而促进神经关系推理领域的自主研究。 AI

影响 自动化创建具有挑战性的基准测试,有可能加速神经关系推理领域的研究和开发。

排序理由 该集群描述了一篇研究论文,其中详细介绍了一种用于神经模型自动化基准测试的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Project Auto-World 使用 LLM 自动化神经关系推理基准测试

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Anirban Das, Joanne Boisson, Irtaza Khalid, Sumita Garai, Steven Schockaert ·

    Project Auto-World:迈向量化神经网络关系推理器的基准测试

    arXiv:2606.24965v1 Announce Type: cross Abstract: Reasoning about relational structures remains a significant challenge for neural models, particularly when they must systematically apply learned knowledge to problem instances that are harder than those seen in training. Progress…