研究人员推出LUNAR,一个新颖的基准测试,旨在评估大型语言模型(LLM)根据纵向用户行为日志进行个性化响应的能力。与依赖简单用户画像或孤立信号的先前基准测试不同,LUNAR整合了跨越服装、食品、住房和出行等领域的异构日常生活活动。该基准测试采用多阶段合成管道构建,以解决数据稀疏性和隐私问题,与真实行为分布的契合度比其他合成基准测试更高。对19个主流LLM进行的实验表明,虽然行为日志的访问至关重要,但不足以实现深度个性化,证据选择和跨领域整合成为关键挑战。 AI
影响 该基准测试有望推动LLM在理解和响应个体用户行为方面的改进,从而带来更具针对性和实用性的AI应用。
排序理由 该集群包含一篇介绍用于评估LLM的新基准测试的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Large Language Models
- Litmaps
- LUNAR
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →