一项名为HarmReduction的新基准测试已被开发出来,用于评估大型语言模型(LLMs)在为药物使用者提供减害信息的准确性和安全性。该基准测试包含2,160个问答证据对,涵盖三个任务:评估安全边界、提供定量数据以及推断多物质使用风险。初步结果表明,当前最先进的大型语言模型在准确性方面存在困难,并且可能对寻求此类敏感信息的用户构成重大的安全风险。 AI
影响 强调了在公共卫生等敏感领域对大型语言模型进行专门评估以防止伤害的迫切需求。
排序理由 该集群包含一篇介绍用于评估大型语言模型的新基准测试的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →