实体
Memit Nadill
Memit Nadill
PulseAugur coverage of Memit Nadill — every cluster mentioning Memit Nadill across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
研究人员手动编码MLP权重以探究LLM序列记忆
研究人员为单层多层感知机(MLP)手动编码了权重,以探索高效的序列记忆。他们的发现表明,模型可以记忆的事实数量与其参数数量呈线性关系,与训练模型类似,尽管缩放因子仍有差距。这项工作挑战社区开发更好的构造,以用更少的权重存储更多的事实,旨在增进对LLM如何编码信息以及在MLP层中存储记忆事实的理解。
-
AWS 训练阿塞拜疆模型,Tether 简化 LLM 微调
AWS 正在其 SageMaker 平台上为阿塞拜疆语开发语言模型,旨在提高人工智能对代表性不足语言的可及性。Tether 发布了 Bitnet,一个简化大型语言模型微调的框架,使其更易于初创公司和小型团队适应。此外,开源模拟器 QEMU 正在探索在非关键领域使用人工智能进行代码贡献,而 Vidai 推出了基于 Rust 的人工智能网关,强调性能和安全性。
-
新研究识别出AI模型中知识编辑的通用机制
研究人员开发了一种方法,用于识别Transformer模型中对知识编辑至关重要的通用功能子空间。通过在编辑后的权重上训练一个紧凑的二元掩码,他们发现该掩码可以逆转相当一部分编辑,这表明多样化的事实修改针对的是同一子集权重。这种机制似乎是抑制而非覆盖知识,解释了为何编辑可能不会传播到相关事实,并为检测和防御不受欢迎的编辑提供了见解。