研究人员推出Mr.LHDR,这是一个新的基准,旨在评估深度研究代理处理长期、复杂和多模态研究任务的能力。该基准包含需要平均12.1个中间结论和10.4个依赖深度的问题,并整合了图像、图表和PDF等多种证据类型。目前领先的AI系统在此基准上面临挑战,总体准确率仅为43.1%,凸显了AI代理在持续、依赖一致的证据整合方面存在的重大挑战。 AI
影响 凸显了AI代理在执行复杂、多模态推理方面的现有局限性,表明在长期任务执行方面需要取得进展。
排序理由 该项目描述了一个新的AI代理基准,属于研究范畴。
- alphaXiv
- arXivLabs
- CatalyzeX Code Finder for Papers
- Checklist Score
- Connected Papers
- CORE Recommender
- DagsHub
- Dependency-Aware Checklist Score
- Gotit.pub
- Hugging Face
- Influence Flower
- Litmaps
- Mr.LHDR
- Node-Relation
- ScienceCast
- scite Smart Citations
- Strict Accuracy
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →