barbecue
PulseAugur coverage of barbecue — every cluster mentioning barbecue across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
BenchMIRT 工具质疑大型语言模型安全评估,发现推理偏见
一款名为 BenchMIRT 的新工具已被开发出来,用于评估大型语言模型安全性和能力评估的有效性。对烧烤(BBQ)社交偏见评估的初步测试显示,这些问题主要根据模型的推理能力而非其安全特性来区分模型。
-
BenchMIRT method reveals what LLM benchmarks truly measure · 2 sources tracked
Researchers have introduced BenchMIRT, a novel methodology designed to dissect the performance of large language models (LLMs) on benchmarks by analyzing individual prompts. This approach, inspired by Item Response Theo…
-
新的LLM基准揭示“失控的对齐”压倒证据
一篇题为“错误的正确:量化和定位LLM中失控的对齐”的新研究论文引入了“失控的对齐”概念,即语言模型由于过度热心的安全训练而拒绝合理的结论。该论文定义了一个名为失控对齐率(MAR)的指标和一个名为VETO的基准,该基准包含2,032个源自BBQ数据集的对比对。对25个LLM的基准测试显示,MAR显著,范围从4.7%到18.9%,而人类参与者的MAR为0.0%。研究表明,对齐诱导的线索会加剧这些失败,这表明当前的对齐方法可能过度泛化安全…
-
新的MARI方法在不修改权重的情况下增强LLM对齐
研究人员开发了一种名为“通过能量校准的多适配器表示干预”(MARI)的新方法,可以在不改变大型语言模型核心权重的情况下,更好地将其与期望的行为对齐。MARI采用多适配器系统,其中专业专家根据个体输入调整干预方向和强度。一个基于能量的门控模块通过根据内部动态识别适合干预的输入来进一步优化这一点。实验表明,MARI在TruthfulQA和安全任务等基准测试中实现了最先进的对齐性能,同时在MMLU和ARC上保留甚至增强了通用能力。