Aether-7B-5Attn
PulseAugur coverage of Aether-7B-5Attn — every cluster mentioning Aether-7B-5Attn across labs, papers, and developer communities, ranked by signal.
- 2026-07-19 product_launch VIDRAFT released the Aether-7B-5Attn foundation model under the Apache 2.0 license. 来源
2 天有情绪数据
-
Aether-6B-11Attn-base: 训练中期模型作为研究产物发布
一项新的研究产物 Aether-6B-11Attn-base 在训练中期发布,独特地展示了一个结合了包括传统注意力、状态空间、卷积和线性时间组件在内的十一(11)种异构混合器的模型的发展过程。该模型具有 121 层、57.9 亿参数的深而窄的架构,未针对服务进行优化,并且生成 token 的速度很慢。此次发布强调了透明度,承认训练代码未存档,模型是从分片检查点重建的,并通过参数匹配和困惑度检查进行了验证。
-
Aether-7B-5Attn 模型名称审计,揭示 6 种不同的机制
对 Aether-7B-5Attn 模型架构的技术审计发现,其名称与其实际实现之间存在差异。尽管该模型命名为 '5Attn',暗示有五个注意力机制,但对其权重的分析表明,其各层之间存在六种不同的参数签名。进一步调查显示,'compress' 和 'sliding' 机制是 'full' 注意力的变体,导致对数字五有不同的解释。此次审计凸显了验证开源模型架构声明的挑战,以及模型命名约定中潜在的歧义。
-
VIDRAFT发布完全开源的Aether-7B-5Attn模型
VIDRAFT发布了Aether-7B-5Attn,一个完全开源的Apache 2.0许可基础模型。与许多仅提供权重的“开放”模型不同,Aether-7B-5Attn包含了其架构、训练数据配方、代码、超参数和日志,实现了完全可复现性。该模型在其49层中采用了一种新颖的异构注意力机制,以拉丁方阵排列,以控制深度偏差。一个关键的操作注意事项是,推理必须以批处理大小1进行,以避免由于特定的注意力分支未处理填充掩码而导致的输出损坏。