PulseAugur
实时 13:10:30
实体 AlphaEdit

AlphaEdit

PulseAugur coverage of AlphaEdit — every cluster mentioning AlphaEdit across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_160707 ·

    新的Moir方法利用模型自身数据改进LLM知识编辑

    研究人员开发了一种名为Moir的新方法,用于语言模型的知识编辑,解决了编辑后推理能力下降的问题。Moir直接从模型自身的解码分布中估计保留协方差,无需依赖Wikipedia等外部静态语料库。该方法在保留OLMo-2、Llama-3.1和Qwen-3等各种模型的数学和编程推理能力方面表现出显著的改进,优于基线方法。

  2. TOOL · CL_117729 ·

    研究:微调大型语言模型会显著侵蚀知识编辑

    一篇新的研究论文探讨了大型语言模型(LLMs)中知识编辑(KE)与微调的相互作用。研究表明,对已编辑模型进行微调通常会导致所应用编辑的显著衰减,其中像GPT-J上的AlphaEdit等方法会损失超过25%的有效性。研究表明,仅微调已编辑的层可以消除这些编辑,同时对整体性能的影响最小,并且令人惊讶的是,微调未编辑的层会导致更大的编辑衰减。这项工作强调了在完整的LLM应用流程中评估知识编辑技术的重要性,以确保编辑的持久性并解决潜在的安全问题。

  3. RESEARCH · CL_103038 ·

    新研究在多语言、长上下文和推理任务中推进大语言模型效率

    研究人员正在开发新方法来提高大语言模型(LLMs)在各种应用中的效率和有效性。Google DeepMind 推出了 ATLAS,一个用于缩放多语言模型的框架,该框架在数据混合和模型大小方面提供了指导,以提高非英语语言的性能。Hugging Face 发布了 LFM2.5-Encoders,针对 CPU 上的快速长上下文推理进行了优化,在文本分类等任务的速度和效率方面优于现有模型。此外,几篇 arXiv 论文探讨了大语言模型解码和推理…