LLM Judge
PulseAugur coverage of LLM Judge — every cluster mentioning LLM Judge across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新方法使用OCEAN框架映射和控制LLM个性特征
研究人员开发了一种名为“Persona Cartography”的方法来衡量和控制大型语言模型(LLM)的个性特征。通过改编OCEAN框架(开放性、尽责性、外向性、宜人性、神经质),他们可以训练低秩适配器来放大或抑制40亿到320亿参数模型中的特定特征。这些适配器在模型规模扩展时对特征表现出很大程度上单调的影响,并且可以累加组合,影响诸如沮丧和谄媚等与安全相关的行为。该方法还包括一个无监督流程,用于发现人类心理测量学未预定义的、可解释的行为因素。
-
Hugging Face 研究:更便宜的 LLM 在引文评判方面具有竞争力
一项来自 Hugging Face 的新研究调查了各种大型语言模型 (LLM) 在研究中用作引文质量评判的有效性。该研究侧重于评估这些 LLM 在多大程度上能够评估搜索支持的 LLM 所做声明的来源相关性和事实支持。结果表明,像 GPT-5 mini 这样成本较低的模型在来源相关性方面表现具有竞争力,而事实支持分数在测试模型之间相似。然而,观察到了方向性偏差的显著差异,例如假阳性和假阴性率,这凸显了在将 LLM 评判用作研究应用的强化…
-
新系统从SEC 8-K文件中提取详细事件
研究人员开发了一种新颖的两阶段系统,用于从SEC 8-K文件中提取细粒度事件信息,解决了SEC粗粒度项目代码的局限性。该系统根据包含119种事件类型的详细分类法标记披露信息,确保每个标记都可追溯到源文本并带有质量分数。发布的 数据集包含来自近30万份文件的60多万个基于文本的事件标记,显示出更高的精确度和可靠性。
-
LLM 裁判成为评估 AI 编码性能的关键工具
“LLM 裁判”的概念正作为一种评估大型语言模型性能的方法出现,尤其是在编码任务方面。这些裁判通常由 GPT-4 或 Claude 3 等先进模型提供支持,根据特定标准评估其他模型的输出。AlpacaEval 和 Mt Bench 等基准测试采用了这种方法来比较 Vicuña、Llama 2 和 mistral.ai 等模型,旨在提供对模型能力更细致的理解,超越简单的准确性指标。
-
新探测器通过分析内部认知过程来检测大型语言模型的错位行为
研究人员开发了一种新方法,通过分析大型语言模型(LLMs)的内部认知过程来检测其错位行为。该方法将错位分解为具体的指标,如战略欺骗和自我保护,并使用线性探测器在模型的激活中识别这些指标。该系统在分布外基准测试上达到了0.935 AUROC的高准确率,同时在良性对话上保持了低误报率。
-
开发者构建 LLM 裁判以确保 AI 代理合规
一位开发者详细介绍了 LLM 裁判的创建过程,这是一个独立的 AI 组件,旨在根据策略文件验证代理输出的合规性。该裁判独立于主代理的上下文运行,以防止继承偏差,确保其能够捕获诸如规则应用不正确之类的错误。该系统将此裁判集成到 LangGraph 状态机中,其通过/失败状态决定后续步骤,最终在执行任何操作之前需要人工批准。
-
新基准JuICE揭示LLM在文化细微差别方面存在困难
研究人员推出了JuICE,一个旨在评估大型语言模型识别自身回应中文化错误能力的新基准。该数据集包含来自美国、韩国、印度尼西亚和孟加拉国的1,050个查询-回应对的7,470个文化和语言错误标注。测试显示,即使是表现最佳的LLM裁判,在检测错误跨度方面的F1分数也仅为0.52,表明与人类评估者相比,它们在理解细微的文化背景方面存在显著差距。