实体
Agent as a Judge
Agent as a Judge
PulseAugur coverage of Agent as a Judge — every cluster mentioning Agent as a Judge across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
研究发现,AI代理的评估排名因评委语言而异
一篇新的研究论文探讨了用于评估AI代理的语言如何显著影响其性能排名。该研究将“代理即评委”框架的提示本地化为五种不同的语言,发现GPT-4o和Gemini等不同的AI骨干网络在特定语言中表现最佳。这表明语言应被视为代理基准中的一个关键变量,因为它甚至可以改变一个模型相对于另一个模型的感知优势。
-
CyberAgent 通过人机协作分析和评判反馈来增强编码代理
CyberAgent 正在探索通过分析人机协作决策模式和实施“代理作为评判者”系统来改进编码代理的方法。第一种方法侧重于衡量和审查编码代理中的人类判断模式,以确定干预的关键点。第二种策略涉及集成“代理作为评判者”反馈循环,以验证这些编码代理的执行过程,旨在提高其可靠性和性能。