mamabench
PulseAugur coverage of mamabench — every cluster mentioning mamabench across labs, papers, and developer communities, ranked by signal.
-
新的MamaBench基准揭示了LLM在母婴健康诊断中的鲁棒性差距 · 跟踪2个来源
研究人员开发了MamaBench,这是一个旨在评估大语言模型(LLM)在母婴健康诊断中鲁棒性的新型基准。该基准利用反事实临床叙述来评估LLM区分需要不同干预措施的相似病症的能力,结果显示标准准确性指标可能高估模型真实性能16-28个百分点。该研究还引入了证据锚定RAG(EA-RAG),一种可提高鲁棒准确性的检索方法,在Claude Sonnet 4.6上将偏见陷阱率降低了5.5个百分点,但临床AI的反事实鲁棒性仍面临重大挑战。
-
发布新的孕产、新生儿和生殖健康领域 RAG 基准 mamabench 和 mamaretrieval
研究人员推出了两个新的基准,mamabench 和 mamaretrieval,专门用于评估孕产、新生儿和生殖健康领域的检索增强生成(RAG)系统。这些基准通过关注该领域医疗保健专业人员面临的独特问题,弥补了现有医学问答数据集的不足。mamabench 包括一个大型问答集和一个用于 LLM 裁判校准的 HealthBench 重新范围界定版本,而 mamaretrieval 则为孕产健康指南语料库提供了详细的相关性标签。
-
新的基准和设备端AI系统旨在改善孕产健康信息获取 · 跟踪4个来源
研究人员推出了两个新的基准,mamabench和mamaretrieval,旨在评估专门针对孕产、新生儿和生殖健康领域的检索增强生成(RAG)系统。这些基准通过关注助产士的独特查询并为孕产健康指南提供块级相关性基准,填补了现有医学问答数据集的空白。此外,一篇配套论文详细介绍了MAM-AI,一个为桑给巴尔的助产士设计的设备端RAG系统,该系统可完全离线运行,证明即使是小型设备端模型也能实现具有竞争力的检索性能。