OpenBookQA
PulseAugur coverage of OpenBookQA — every cluster mentioning OpenBookQA across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的矩阵乘法方法确保了大型语言模型的前缀不变性
研究人员开发了低精度设置下快速矩阵乘法的新方法,特别解决了语言模型中的前缀不变性问题。标准的快速矩阵乘法技术会通过混合标记行来引入错误,从而损害前缀不变性——这是多项选择任务中准确计算似然得分的关键属性。研究表明,即使在看似准确的FP8实现中,OpenBookQA等基准测试中的模型答案也可能发生重大变化。为了解决这个问题,他们提出了经过认证的实现,保证与规定的整数运算符的比特级相等性,确保实现的选择不会改变得分的似然性,从而使决策纯粹基于成本。
-
新AI框架整合知识图谱和多智能体系统以增强推理能力
多篇研究论文介绍了用于增强AI系统与知识图谱和多智能体协作的新型框架。这些方法旨在提高推理能力,减少幻觉,并增加AI生成信息的可靠性。MAGG和RACER等系统专注于受控记忆和协作推理,以在知识图谱构建和问答等任务上取得更好的性能。ASKS和MaCTG等其他框架分别利用大型语言模型和图结构进行科学知识编译和自动编程,并强调可解释性和效率。
-
新的 Credal LLM 改进了不确定性表示并减少了幻觉
研究人员引入了 Credal 大型语言模型 (CLLM),以解决 LLM 生成自信但错误的答案的问题。与使用单一预测分布的标准 LLM 不同,CLLM 采用 LoRA 适配器集成来创建 Credal 集。该集合暴露了一系列合理的分布,从而可以推导出更好地反映不确定性的承诺分数。所提出的方法,Credal Token Commitment (CTC) 和 Semantic Commitment Consistency (SCC),在 G…
-
新型 Daedalus-150M 模型通过混合架构实现更快的 CPU 推理
研究人员开发了 Daedalus-150M,这是一种针对高效 CPU 推理进行了优化的新型语言模型。该混合模型结合了稀疏注意力和短卷积,使其三分之二的架构能够避免重新读取广泛的上下文缓存。尽管 Daedalus-150M 在比同类模型少得多的数据上进行了训练,但在五任务基准测试中,其表现优于 GPT-2 124M 和 Pythia-160M 等大型模型,得分达到 47.31,目标是 42.20。该模型在解码速度方面也表现出更快的速度,…
-
基于模拟器的LLM用于工业因果推理
研究人员开发了将大型语言模型(LLM)与特定工业模拟器相结合以进行因果推理的方法,特别是在废水处理领域。他们比较了三种方法:实时模拟器Oracle、结构化参数注入以及解耦检索-推理(DRR)检索器。DRR检索器是一个小型模型,训练速度快,并且可以迁移到不同的工厂,在因果基准测试和反事实问题上取得了最高的准确率,优于检索增强基线和其他结合方法。
-
新的SPARD框架防御LLM免受有害微调攻击
研究人员开发了一个名为SPARD的新防御框架,以对抗大型语言模型上的有害微调攻击。这些攻击旨在移除安全对齐并诱导不安全行为。SPARD将安全投影交替优化与相关性-多样性感知数据选择相结合,使用一种名为SPAG的方法,该方法在效用更新和具有安全数据的显式安全投影之间交替进行。实验表明,SPARD在防止攻击的同时保持任务准确性方面,显著优于现有的防御方法。
-
新技术循环 Transformer 层以提升模型性能
研究人员开发了一种名为训练免费循环 Transformer 的新颖技术,该技术可以在不进行任何额外训练或架构修改的情况下增强现有冻结语言模型的性能。该方法在推理时应用一个轻量级包装器,将连续的层块循环起来,将其视为常微分方程近似的改进,而不是直接更新。该方法已在不同模型系列中展示了性能提升,包括在 Qwen3 和 Moonlight 等模型上,在 MMLU-Pro、CommonsenseQA 和 OpenBookQA 等基准测试上取得…