一项新研究评估了六种大型语言模型在区分临床语音记录中实际疼痛信号和捏造信号的能力。虽然大多数模型在没有明确线索的情况下正确地避免了预测疼痛,但 Gemini 2.5 Flash 和 Llama 3.1 8B 表现出自信地捏造疼痛评分的倾向。研究强调,模型会受到提示框架的影响,从而影响其避免率,并且仅基于记录的预测不足以在这种情况下准确评估疼痛。 AI
影响 凸显了大型语言模型自信捏造信息的潜力,影响了在敏感应用中的可靠性。
排序理由 学术论文,详细介绍了大型语言模型在特定任务上的评估。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →