Manifold-Constrained Hyper-Connections
PulseAugur coverage of Manifold-Constrained Hyper-Connections — every cluster mentioning Manifold-Constrained Hyper-Connections across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的PEFT方法mHC与LoRA结合可增强Transformer微调
研究人员推出了一种新颖的参数高效微调(PEFT)方法——流形约束超连接(mHC),用于Transformer模型。该方法修改了残差连接,这是其他PEFT技术通常保持不变的组件。虽然mHC本身并不总是优于LoRA,但在1B和7B参数的模型上,mHC与LoRA的组合在语言建模损失和特定任务基准测试中均有所提高。
-
人工智能技术探索:记忆、推理、微调与Token
一篇博文综合了当前和新兴的人工智能技术,重点关注记忆、推理、微调和Token化。文章强调了诸如Manifold-Constrained Hyper-Connections (mHC) 等进展以及既有方法。文章引用了包括The Turing Post在内的各种来源,以提供对人工智能格局的全面概述。
-
DeepSeek发布V4模型,支持1M上下文和MoE架构
DeepSeek发布了其DeepSeek-V4系列混合专家(MoE)语言模型的预览版,包括DeepSeek-V4-Pro(1.6T参数)和DeepSeek-V4-Flash(284B参数)。这两个模型都支持前所未有的百万级token上下文长度,这得益于混合注意力架构和优化的残差连接方法。这些模型在超过32万亿token上进行训练,在长上下文场景中展现出显著的效率提升,与前代模型相比,DeepSeek-V4-Pro在推理时所需的FLOP…
-
KromHC 使用克罗内克积改进神经网络训练
研究人员推出 KromHC,一种用于提高神经网络训练稳定性和可扩展性的新颖方法。KromHC 通过使用较小的双重随机矩阵的克罗内克积来参数化残差矩阵,从而解决了现有超连接 (HC) 的局限性。这种方法保证了精确的双重随机性,同时与以前的方法相比,显著减少了可训练参数的数量。实验表明,KromHC 在参数数量大大减少的情况下,性能与最先进的变体相当或更好。
-
新的mHC架构改变了AI模型中注意力头的行为
研究人员调查了流形约束超连接(mHC)这一在Deepseek v4中实现的新型架构对模型可解释性的影响。实验显示,mHC模型中的先前标记注意力头表现出不同的行为,出现在更早的层中,并与高峰度分数相关,这与在标准模型中通过对角条纹分数可检测到的情况不同。研究还观察到,mHC-lite模型倾向于在其残差流中输出多样化的标记,而mHC模型在标记预测方面表现出更强的统一性。
-
Qwen发布27B多模态模型,用于高级编码
Qwen发布了Qwen3.6-27B,这是一款为高级编码任务设计的、参数量为270亿的密集多模态模型。该模型旨在提供旗舰级的智能体编码性能,超越了该类别中先前的开源模型。社区成员已在Hugging Face上提供了Qwen3.6-27B的各种量化版本,方便其在不同平台和库中使用。