研究人员开发了MedFailBench,一个旨在检查医学人工智能系统安全边界的新型开源基准。与关注正确答案的现有基准不同,MedFailBench按严重程度和特定的安全门故障(如漏报升级或捏造证据)对人工智能错误进行分类。当前版本包含44个由临床医生审查的合成案例,并根据宽松的许可协议提供,Hugging Face上有一个预览排行榜。 AI
影响 该基准可能导致更严格的医学人工智能安全评估,提高临床环境的可靠性。
排序理由 该集群描述了一篇关于人工智能安全开源基准的学术论文。
- alphaXiv
- Apache Software License 2.0
- CatalyzeX
- Creative Commons Attribution 4.0 International
- DagsHub
- Gotit.pub
- Hugging Face
- MedFailBench
- ScienceCast
- Zenodo
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →