OLMo-7B
PulseAugur coverage of OLMo-7B — every cluster mentioning OLMo-7B across labs, papers, and developer communities, ranked by signal.
-
新博弈测试多智能体语言模型中的合作失败
一项新的研究论文介绍了一种名为“对话道德风险博弈”的受控文本环境,旨在研究多智能体语言模型中的合作失败。研究发现,基础开放权重模型通常优先考虑局部奖励而非合作行为,未能查询对其他智能体有利的隐藏安全事实。虽然像GEPA提示优化这样的优化技术可以提高团队的成功率,但它们并不总是能恢复预期的合作机制。该研究强调需要进行评估来评估机制层面的行为,而不仅仅是整体团队的成功。
-
新研究表明NSM基元能更好地解释LLM情感
研究人员探索了使用自然语义元语言(NSM)基元来解释大型语言模型(LLM)中的情感计算。在包括Llama-1B和Gemma模型在内的四种指令微调LLM上进行的实验表明,NSM基元是可恢复的内部元素。此外,在参考模型中操纵这些基元,与基于评估的指令相比,能够更显著、更具选择性地控制情感。模型还将基于基元的解释视为与相应情感可互换,这表明NSM基元比其他方法更能稳健地解释LLM情感。
-
LLM研究探讨参数重要性、提示复杂性和任务依赖鲁棒性
近期研究探讨了大语言模型(LLM)及其参数的复杂性。一项研究表明,“超级权重”(Super Weights)在完整时对模型性能至关重要,但在单独训练时却会产生负面影响,这表明参数重要性并不等同于单独训练能力。另一篇论文引入了“提示复杂性”(prompting complexity)作为从LLM获得特定输出所需的最短提示的度量标准,并提出它作为Kolmogorov复杂性的LM相对类比。此外,研究表明提示鲁棒性因任务而异,主观问题比客观问…
-
新研究绘制语言模型社会推理的起源图谱
研究人员开发了一种方法,通过分析其训练数据来理解语言模型中社会推理能力的来源。他们使用基于梯度的归因方法对 Dolma3 数据集进行分析,绘制了语料库中对社会推理和 STEM 推理有贡献的特定区域。研究发现,社会推理和 STEM 推理的来源数据不同,推理能力比事实知识对这些差异更敏感。有针对性的遗忘实验部分验证了这些发现,表明移除高归因数据箱会损害对齐基准。