研究人员推出了scBench-Long,这是一个旨在评估AI代理在复杂、多步骤单细胞生物学分析中能力的新基准测试。与之前侧重于广泛知识或局部任务的基准测试不同,scBench-Long要求代理从原始数据中推导出科学结论,而无需预定义的方法。该基准测试包括21项多样化评估,例如分析黑色素瘤细胞反应性和COVID-19病理学,表现最佳的模型在1,068条轨迹上的成功率仅为25.4%。 AI
影响 该基准测试有望推动能够进行更复杂生物学科学发现的AI代理的发展。
排序理由 该集群描述了一个用于科学研究中AI的新基准测试,已在arXiv上发布。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →