实体
Mario Sanz-Guerrero
Mario Sanz-Guerrero
PulseAugur coverage of Mario Sanz-Guerrero — every cluster mentioning Mario Sanz-Guerrero across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
LLM推理对齐提升非英语任务中的RAG性能 · 研究论文
一篇新研究论文探讨了大型语言模型(LLM)的推理语言与其检索文档语言的对齐方式,如何影响检索增强生成(RAG)任务的性能。研究发现,当使用德语查询和检索到的证据时,强制LLM用德语进行推理,相比强制其用法语(一种其基准测试中表现更高的语言)进行推理,提高了准确性。这种优势在更丰富、结构化的检索上下文中更为明显。然而,对齐推理后的性能并未超过模型原生的英语推理能力,这表明真正的多语言推理仍然是必要的。
-
研究发现大语言模型提示中的隐藏日期会影响评估 · 已追踪2个来源
一项新的研究论文强调了一个先前被忽视的、影响大语言模型(LLM)评估的重要因素:当前日期被自动注入系统提示中。这个隐藏的日期变量导致在数学推理和代码生成等各种任务上的性能波动高达14%,甚至可能改变排行榜上的模型排名。研究发现,诸如思维链(chain-of-thought)等标准提示技术并不能缓解这种日期敏感性,在某些情况下甚至会加剧它,这凸显了在大语言模型研究中需要更稳健的评估协议。