PulseAugur
实时 06:06:09
English(EN) scBench-Long: Verifiable Benchmarking of Long-Horizon Single-Cell Biology

新的scBench-Long基准测试用于评估AI在复杂的单细胞生物学分析中的能力

研究人员推出了scBench-Long,这是一个旨在评估AI代理在复杂、多步骤单细胞生物学分析中能力的新基准测试。与之前侧重于广泛知识或局部任务的基准测试不同,scBench-Long要求代理从原始数据中推导出科学结论,而无需预定义的方法。该基准测试包括21项多样化评估,例如分析黑色素瘤细胞反应性和COVID-19病理学,表现最佳的模型在1,068条轨迹上的成功率仅为25.4%。 AI

影响 该基准测试有望推动能够进行更复杂生物学科学发现的AI代理的发展。

排序理由 该集群描述了一个用于科学研究中AI的新基准测试,已在arXiv上发布。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的scBench-Long基准测试用于评估AI在复杂的单细胞生物学分析中的能力

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Ian Diks, Zhen Yang, Arjun Banerjee, Tim Proctor, Kenny Workman ·

    scBench-Long:长视域单细胞生物学的可验证基准测试

    arXiv:2606.26563v1 Announce Type: cross Abstract: Single-cell studies require analysts to convert raw measurements into specific biological claims through multi-step workflows and integration of metadata, assay context, and auxiliary evidence. Existing AI-biology benchmarks large…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    scBench-Long:长视野单细胞生物学的可验证基准测试

    Single-cell studies require analysts to convert raw measurements into specific biological claims through multi-step workflows and integration of metadata, assay context, and auxiliary evidence. Existing AI-biology benchmarks largely measure broad knowledge, executable workflows, …