Nolima
PulseAugur coverage of Nolima — every cluster mentioning Nolima across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
人工智能在法律文件摘要方面表现出色,但在版本比较方面滞后
Vals AI 的一项最新基准测试显示,虽然人工智能工具擅长总结冗长的法律文件并提供带引用的答案,但它们在比较合同的不同版本时却遇到了困难。在识别文件修订之间细微差异方面,人类律师的表现优于人工智能,这项任务需要精确的位置上下文保留。这凸显了当前人工智能模型的一个局限性,即长上下文窗口并不总是能转化为红线标记等复杂任务的准确性能,CLAUSE 基准测试和斯坦福 RegLab 的研究证明了这一点。
-
新的TRSP方法解决了大型语言模型中的表示坍塌问题
研究人员引入了一种名为拓扑正则化侧通路(TRSP)的新方法,以解决大型语言模型(LLMs)中的表示坍塌问题,该问题会随着上下文的增加而降低性能。TRSP使用一种无参数的三角盒机制来平衡注意力动态的光谱特性,从而提高混合效率和信息容量。实验证明了TRSP的有效性,在通用能力和长上下文基准测试中取得了显著的提升,尤其是在扩展训练长度的情况下,在NoLiMa上保持了83%的准确率,并且优于Differential Transformer和G…
-
新方法 LOCOS 识别大型语言模型中的非字面检索头
研究人员开发了一种名为 Logit-Contribution Scoring (LOCOS) 的新方法,用于识别大型语言模型中的非字面检索头。与以往关注字面词元匹配的方法不同,LOCOS 分析注意力头的输出值电路,以了解它们如何从上下文中综合信息。这种方法在检测负责非字面检索的头方面显示出更大的有效性,涵盖了 Qwen3、Gemma-3 和 OLMo-3.1 等各种模型家族,当这些已识别的头被消融时,会导致需要综合的任务性能显著下降。
-
新的EXACT方法提升LLM长上下文理解能力
研究人员开发了一种名为EXACT的新监督目标,以改进语言模型的长上下文适应性。该方法通过为依赖更长有效上下文的目标分配额外权重来解决打包训练中的不匹配问题。在Qwen和LLaMA模型上的实验表明,在NoLiMa和RULER等基准测试中取得了显著改进,特别是在证据位于数千个标记之外时,同时保持了在标准问答和推理任务上的性能。