PulseAugur
实时 06:41:34
实体 HealthBench-Psych-Hard

HealthBench-Psych-Hard

PulseAugur coverage of HealthBench-Psych-Hard — every cluster mentioning HealthBench-Psych-Hard across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_221053 ·

    新基准评估大语言模型在心理健康场景下的表现

    研究人员开发了 HealthBench-Psych,这是 OpenAI HealthBench 的一个新子集,专门用于评估大语言模型在心理健康环境下的表现。该子集包含 610 场对话,使用大语言模型应用的评分标准进行整理,并由临床医生进行验证以确保相关性。对 20 个前沿模型和开源模型的初步评估显示,顶级模型之间的表现统计学上持平,其中一些模型表现出可衡量的拒绝行为,并且在多个大语言模型裁判之间排名一致。