PulseAugur
实时 14:02:52
实体 FSDPC

FSDPC

PulseAugur coverage of FSDPC — every cluster mentioning FSDPC across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_152134 ·

    Aether-6B-11Attn-base: 训练中期模型作为研究产物发布

    一项新的研究产物 Aether-6B-11Attn-base 在训练中期发布,独特地展示了一个结合了包括传统注意力、状态空间、卷积和线性时间组件在内的十一(11)种异构混合器的模型的发展过程。该模型具有 121 层、57.9 亿参数的深而窄的架构,未针对服务进行优化,并且生成 token 的速度很慢。此次发布强调了透明度,承认训练代码未存档,模型是从分片检查点重建的,并通过参数匹配和困惑度检查进行了验证。

  2. TOOL · CL_121996 ·

    AI工作站配置:4x RTX 5090 对比 1x RTX 6000 Blackwell

    一位用户正在为YouTube自动化和数据蒸馏等商业应用寻求高端AI工作站的配置建议。他们正在权衡两种GPU配置:四块RTX 5090显卡,总计128GB显存,或一块RTX 6000 Blackwell显卡,拥有96GB显存。用户担心多GPU分片用于视频生成和微调的实际操作性,以及单块大显存显卡的简便性,尤其是在成本相似的情况下。

  3. RESEARCH · CL_90893 ·

    新的优化技术出现,可实现更快、更高效的 AI 模型训练 · 跟踪 8 个来源

    几篇最新的 arXiv 论文探讨了机器学习优化技术的进展。研究人员提出了新的方法,如权重自适应 ASNG (WA-ASNG) 以提高进化算法的并行性能,以及通过子空间获取函数实现的可扩展批量贝叶斯优化,以提高大批量处理的效率。其他工作引入了 MGUP,一种用于随机优化的动量梯度对齐更新策略,以及 OptEMA,一种用于无噪声最优化的自适应指数移动平均。此外,Gefen 等新的优化器旨在减少内存占用同时保持性能,理论分析也为随机梯度下降…

  4. TOOL · CL_62640 ·

    新内核确保跨张量并行大小的确定性LLM推理

    研究人员开发了基于树的不变内核(TBIK),以确保大型语言模型(LLM)的确定性推理,无论张量并行(TP)大小如何。这解决了由于TP大小和浮点算术的差异导致相同输入产生不同输出的关键问题。TBIK通过分层二叉树结构对齐归约顺序,保证了逐位可复现性,这对于LLM作为裁判和强化学习等应用至关重要。

  5. RESEARCH · CL_50652 ·

    Google 的 Gemma 4 31B 在 TPU 上进行了微调和部署优化

    一篇新的研究论文详细介绍了在 Google Cloud TPU 上微调和部署 Google 的 Gemma 4 31B 模型的首个端到端演示。该研究对大型语言模型适配的 TPU 和 GPU 平台进行了实证比较,记录了将 GPU 原生训练配方移植到基于 JAX 的堆栈所需的代码级适配。结果表明,与 GPU 基线相比,TPU 训练速度快 1.61 倍,成本低 2.12 倍,推理吞吐量几乎相同,并且 TPU 的首次令牌时间降低了 2 倍。