实体
evaluator agent
evaluator agent
PulseAugur coverage of evaluator agent — every cluster mentioning evaluator agent across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的三方智能体框架评估LLM问题澄清能力
研究人员开发了一个新的三方智能体框架,用于评估和改进大型语言模型(LLMs)的问题澄清能力。该框架包括一个问题澄清智能体(QCA),用于识别歧义并提问;一个响应智能体(RA),用于模拟用户交互;以及一个评估智能体(EA),用于评估对话质量。该系统使用来自供应链领域的合成数据进行演示,并提出了歧义处理、问题质量、对话效率和意图对齐的指标。
-
新框架解决简历改写中LLM幻觉问题
研究人员开发了一个名为Grounded Optimization的新框架,以解决大型语言模型(LLM)在应用于自动化个人文档改写(如简历)时出现的幻觉问题。该五层框架包含时间上下文验证、确定性污染检测、结构不变性强制执行、提示级接地和评估代理。实验表明幻觉显著减少,每份简历检测到的总体幻觉率降至0.04-0.24,时间幻觉减少了50-95%。该研究还发布了其污染分类法、评估代码和数据,其中提示级接地本身已被证明对某些模型和条件有效。