研究人员开发了一个新的基于LLM的评估系统,用于评估AI代理在药物发现中的性能,解决了传统指标的局限性和人类评估的可扩展性问题。该系统在AstraZeneca的ChatInvent助手上进行了测试,定义了四个质量维度,并使用LLM裁判来评估输出。一项人类对齐研究发现,Gemini-3.1 Pro、Claude Opus 4.7、GPT-5和Llama 3.1 70B被评估为潜在裁判,通过少样本演示优化表现最佳的裁判,以实现与人类专家的0.86对齐。该框架旨在为评估科学领域的代理系统提供一个可重用的模板。 AI
影响 该框架为评估科学研究中的复杂AI代理提供了一种可扩展且与人类对齐的方法,有望加速药物发现和其他领域的开发。
排序理由 该集群包含一篇学术论文,详细介绍了评估AI系统的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →