开发了一个新框架来评估大型语言模型(LLM)在推荐品牌方面的表现,解决了生成多样化响应和缺乏明确候选集等挑战。该框架引入了品牌推荐概率(BRP@k)和平均倒数排名(MRR@k)等指标,通过重复采样和竞争集独立定义来评估推荐。初步研究结果表明,LLM 经常忽略知名品牌,并且推荐的突出性与更广泛的市场可见性信号(如搜索兴趣)相关,而不是传统的品牌受欢迎程度。 AI
影响 这项研究提供了一种评估 LLM 推荐系统的新方法,可以提高其在产品发现方面的可靠性和有效性。
排序理由 学术论文,介绍 LLM 推荐的新评估框架。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
- alphaXiv
- arXivLabs
- Brand Recommendation Probability
- BRP@k
- CatalyzeX Code Finder for Papers
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- large-language models
- Litmaps
- mean reciprocal rank
- MRR@k
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →