PulseAugur
实时 10:38:19
实体 EA-RAG

EA-RAG

PulseAugur coverage of EA-RAG — every cluster mentioning EA-RAG across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_147798 ·

    新的MamaBench基准揭示了LLM在母婴健康诊断中的鲁棒性差距 · 跟踪2个来源

    研究人员开发了MamaBench,这是一个旨在评估大语言模型(LLM)在母婴健康诊断中鲁棒性的新型基准。该基准利用反事实临床叙述来评估LLM区分需要不同干预措施的相似病症的能力,结果显示标准准确性指标可能高估模型真实性能16-28个百分点。该研究还引入了证据锚定RAG(EA-RAG),一种可提高鲁棒准确性的检索方法,在Claude Sonnet 4.6上将偏见陷阱率降低了5.5个百分点,但临床AI的反事实鲁棒性仍面临重大挑战。