研究人员推出Telco-GAIA,一个旨在评估电信领域内使用工具的AI智能体的新的双语基准。该基准包含100个英语和阿拉伯语的问答任务,需要跨越多种数据源(包括HTML、PDF、SQL数据库和网络存档)进行多跳推理。初步评估显示,即使是表现最好的模型也面临挑战,在成本限制下准确率显著下降,尤其是在视觉基础任务中,这表明企业智能体在文档和图像理解方面仍有很大的改进空间。 AI
影响 该基准有望推动企业AI智能体的发展,特别是在需要多模态理解和复杂推理的专业领域。
排序理由 该集群描述了一个用于评估AI智能体的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →