Judge-LLM
PulseAugur coverage of Judge-LLM — every cluster mentioning Judge-LLM across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的基于大型语言模型的系统可自动评估创意
研究人员开发了CreaEval,一个专为复杂、多步任务设计的新型自动化创意评估系统。该系统将传统的“大型语言模型即评委”方法分解为两个不同的阶段:增强记忆的分析和基于证据的评判。分析阶段使用最先进的大型语言模型,将多步响应转换为结构化的评估证据,并整合跨步记忆。然后,评判阶段利用提取的证据进行评判,而无需直接访问原始响应。实验表明,CreaEval在各种创意任务上的评估性能得到了显著提升。
-
新研究探索了本体驱动的检索和基于LLM的本体生成
两篇研究论文探讨了信息检索和本体生成的先进方法。第一篇已撤回的论文提出了一种本体驱动的方法,通过整合语义资源和用户配置文件,实现从XML文档中个性化信息检索。第二篇论文介绍了RIGOR,一个检索增强的迭代生成管道,它使用LLM将关系数据库模式转换为语义丰富的OWL2DL本体,只需最少的人工干预。两篇论文都强调了语义网技术和LLM在增强数据理解和可访问性方面的潜力。
-
开源语言模型在隐私保护的临床决策制定评估方面展现出潜力
一项新研究 LLM4SDM 调查了使用开源小型语言模型 (OS-sLLMs) 来评估临床咨询中的共同决策制定 (SDM)。与以往使用大型商业模型的研究不同,本研究侧重于隐私保护、本地部署的模型以及荷兰黑色素瘤咨询记录。研究结果表明,通用 OS-sLLMs 的表现优于医学领域模型,其中 Gemma3:12b 与人类标注者的一致性最强。虽然目前的 OS-sLLMs 尚不能取代人类标注者,但它们为隐私保护、以人为中心的 SDM 评估奠定了可行基础。