PulseAugur
实时 08:08:48
实体 Mental Health Benchmarks for Large Language Models: A Systematic Scoping Review

Mental Health Benchmarks for Large Language Models: A Systematic Scoping Review

PulseAugur coverage of Mental Health Benchmarks for Large Language Models: A Systematic Scoping Review — every cluster mentioning Mental Health Benchmarks for Large Language Models: A Systematic Scoping Review across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_250762 ·

    审查梳理173个LLM心理健康基准,发现数据局限性

    一项题为《大型语言模型心理健康基准》的系统性范围审查,识别并分析了173个基准。审查发现,这些基准中的大多数利用社交媒体数据或由LLM本身生成。值得注意的是,在审查的基准中,仅有很小一部分,具体为2%,报告使用了隐藏测试集。