Radio ffn
PulseAugur coverage of Radio ffn — every cluster mentioning Radio ffn across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的Mobius-v0架构解耦知识与推理,加速AI推理
研究人员推出了一种新颖的基础模型架构Mobius-v0,它将知识存储与推理过程解耦。该设计利用共享内存组件存储知识向量,并使用多个推理模块迭代访问该内存。Mobius-v0架构展示了改进的知识压缩和推理效率,一个7B参数的模型在下游任务得分上可与Transformer基线模型媲美,但使用的训练数据更少。此外,基于Qwen3.5-35B构建的Intern-S2-Mobius变体,在性能相似的情况下,推理速度提高了近四倍。
-
新的MoE方法增强了用于私有数据的联邦LLM调优
研究人员开发了用于混合专家(MoE)大型语言模型(LLM)的联邦指令调优的新方法,以处理去中心化和私有数据。一种方法ClientMorpher使用MoE路由器签名对协作客户端进行分组,通过防止负迁移来提高个性化性能。另一种方法DistMoE为客户端特定的专家增强了LLM层以进行域适应,采用公共锚定的组合阶段来管理专家合并并实现模块化路由,而无需显式域标签。
-
研究论文揭示前馈网络(FFN)主动引导长上下文检索
一篇新的研究论文探讨了前馈网络(FFN)在长上下文检索任务中的作用,打破了其仅作为参数记忆的传统观点。研究表明,FFN通过将检索状态推向或远离正确答案来主动影响检索状态,这种功能是任务条件化且层特定的。研究人员发现,FFN可以充当抑制器或放大器,其作用会根据检索模式而变化。一种基于FFN写入方向导数的诊断工具可以有效预测这种抑制行为,在Qwen2.5-7B和Qwen3.5-9B等模型上显示出显著的准确性,并在用于指导FFN缩放时提高了检索裕度。
-
DomLoRA方法将单个适配器放置在主导模块以实现高效微调
研究人员开发了一种名为DomLoRA的新方法,用于大型语言模型的参数高效微调。该技术识别模型中的单个“主导性适配模块”,在该模块中放置低秩适配器可带来最显著的性能提升。通过将适配集中在该特定模块上,DomLoRA在可训练参数数量仅为传统LoRA方法一小部分的情况下,取得了更优异的结果。
-
State Stream Transformer V2 通过并行训练和潜状态流增强 LLM 推理能力
研究人员开发了 State Stream Transformer (SST) V2,这是一种旨在增强语言模型潜空间推理能力的架构创新。与在每一步重置上下文的标准 Transformer 不同,SST V2 采用非线性递归机制,在整个序列中维护和演化连续的潜状态。这使得参数使用更有效,并在生成 token 前进行更深入的思考,从而在推理任务上取得显著改进。
-
新的诊断工具探查LLM的电路,以获得安全性和行为见解
一篇新的研究论文介绍了一种名为“扰动探测”(Perturbation Probing)的诊断方法,用于理解大型语言模型(LLMs)的内部工作机制。该技术使用每个提示(prompt)进行两次前向传播(forward passes)来识别和分析模型前馈网络(FFNs)中的“行为电路”。研究发现了两种主要的电路结构:对立电路(opposition circuits),当人类反馈强化学习(RLHF)改变预训练倾向时出现;以及路由电路(rout…
-
Hugging Face 推出 Graph Memory Transformer,用学习到的内存图替换 FFN
研究人员开发了一种图内存 Transformer (GMT),它用显式的学习内存图替换了仅解码器 Transformer 中的标准前馈网络 (FFN) 子层。这种新架构保持了因果自注意力,但使用内存单元通过由有向转移矩阵连接的质心库来路由 token 表示。虽然具有 8220 万个参数的 GMT 模型训练稳定并提供可检查的组件,但它在验证损失和困惑度方面目前表现不如密集 GPT 风格的基线,尽管它在零样本基准测试中的行为相当。
-
图记忆Transformer用学习到的记忆图替换FFN,以提高可解释性
研究人员开发了一种图记忆Transformer (GMT),它用显式的学习记忆图替换了仅解码器语言模型中的标准前馈网络 (FFN) 子层。这种新架构 GMT v7 在其 16 个 Transformer 块中的每一个块内使用了 128 个质心和一个有向转移矩阵。虽然参数量为 8220 万的 GMT 模型在零样本基准测试性能上与更大的 GPT 风格基线相当,但在验证损失和困惑度方面落后,这表明未来有优化的潜力和扩展性。