一项新的研究论文介绍 DR. INFO,一个基于代理 RAG 的临床助手,在 HealthBench 基准测试中表现显著优于领先的 LLM。DR. INFO 在具有挑战性的 HealthBench Hard 子集上取得了 0.68 的分数,超过了 GPT-5 (0.46)、Grok 3 (0.23)、Gemini 2.5 Pro (0.19) 和 Claude 3.7 Sonnet (0.02) 等模型。评估突出了 DR. INFO 在准确性和指令遵循方面的优势,同时也指出了在上下文感知和响应完整性方面的改进空间,强调了在构建值得信赖的 AI 医疗助手时需要基于评分标准的评估。 AI
影响 为 AI 临床助手设定了新的基准,强调了超越多项选择题的先进评估方法的必要性。
排序理由 该集群是一篇研究论文,详细介绍了一个新的人工智能模型及其在基准测试上的表现。 [lever_c_demoted from research: ic=1 ai=1.0]
- Claude 3.7 Sonnet
- DR. INFO
- Gemini 2.5 Pro
- GPT-5
- GPT-5.1
- GPT-5.2
- Grok 3
- HealthBench
- OpenAI
- Valentine Emmanuel Gnanapragasam VmeG
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →