Kranti Chalamalasetti
PulseAugur coverage of Kranti Chalamalasetti — every cluster mentioning Kranti Chalamalasetti across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
研究发现:LLM在多轮证据收集推理方面存在困难
一篇题为《Don't Let Me Ask for It: LLMs Show Deficiencies in Active Multi-Turn Information Acquisition for Abductive Inference》的新论文介绍了一个“外星人绑架游戏”,用于测试大型语言模型(LLMs)在多轮溯因推理场景中获取证据和完善假设的能力。研究发现,与在多轮中提供证据相比,一次性提供所有证据时LLMs的表现更好。此外…
-
在无参考评估中,LLM裁判可能过度认可不正确的答案
一项新的研究论文指出了使用大型语言模型(LLM)裁判评估开放式回答时的一个重大问题,特别是在缺乏真实答案的情况下。研究发现,这些LLM裁判倾向于过于宽容,在没有提供参考的情况下会错误地认可错误的答案。研究还表明,在提示中提供参考答案信息可以极大地改变LLM裁判的决定,有时会改变高达85%,并且这些变化通常与人类判断一致。该论文强调,在将LLM裁判部署到无参考环境中以确保可靠评估之前,必须通过参考感知评估对其进行校准。
-
新数据集旨在实现大语言模型诗歌到散文的翻译
研究人员开发了 Padyam2Gadyam,这是一个旨在将古典泰卢固诗歌翻译成现代泰卢固语和英语散文的新数据集。该数据集包含 600 首诗歌及其经过人工验证的译文,并用于评估五种大型语言模型在此翻译任务上的性能。初步结果表明,当前的大语言模型在准确地将诗歌翻译成两种语言的散文方面仍有很大的改进空间。