一位名为Tabibu的健康AI助手开发者发现,其旨在防止危险输出的安全层,在HealthBench基准测试中的得分反而降低了。该安全层包括紧急升级和拒绝处方剂量等功能,但由于其不如裸语言模型那样全面而受到惩罚。这是因为HealthBench奖励完整性,例如提供具体的剂量和诊断,而安全层为提高用户安全性而故意避免这些。 AI
影响 健康AI中的安全层可能会被当前基准测试所惩罚,这可能导致开发者优先考虑完整性而非安全性。
排序理由 该条目详细介绍了在定制AI系统上运行特定基准测试(HealthBench)的结果,包括方法和发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →