PulseAugur
实时 10:02:42
实体 Chinchilla

Chinchilla

PulseAugur coverage of Chinchilla — every cluster mentioning Chinchilla across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 11
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_167135 ·

    Seesaw方法通过优化批次大小和学习率调度来加速LLM训练

    研究人员开发了一种名为Seesaw的新方法,通过优化批次大小和学习率的调度来加速大型语言模型的训练。该方法在理论上证明了SGD的学习率衰减与批次大小增长之间的等价性,并将其扩展到Adam的代理。实证表明,Seesaw在FLOPs方面与余弦衰减相当,同时将Chinchilla规模模型的训练时间缩短了约36%。

  2. TOOL · CL_141608 ·

    M+Adam 优化器改进低精度大语言模型训练

    研究人员推出 M+Adam,这是一种新颖的优化方法,旨在提高低精度权重下大语言模型训练的准确性。标准优化器在低精度下可能会遇到困难,导致进展停滞,尤其是在权重幅度较大时。M+Adam 通过结合加法和乘法更新类型来解决这个问题,利用它们互补的优势来确保在各种权重幅度和符号变化下都能取得持续的进展。使用 LLaMA 类型模型和不同精度级别(包括 BF16、FP8 和 FP4)进行的实验表明,M+Adam 持续提高了低精度训练的成果。

  3. MEME · CL_134756 ·

    Mastodon 上分享的提及“龙猫”和“蓝莓玛芬”的梗图

    此集群包含一项内容,似乎是在 Mastodon 上分享的梗图或幽默帖子,提及了“龙猫”和“蓝莓玛芬”。内容不足以形成新闻摘要。

  4. RESEARCH · CL_133208 ·

    新的GRAM方法为双重用途能力提供模块化AI访问控制

    研究人员开发了梯度路由辅助模块(GRAM),这是一种新颖的预训练方法,旨在解决AI开发中的双重用途困境。GRAM允许在单个AI模型中选择性地禁用特定能力,以极低的成本近似训练经过筛选数据的独立模型的效果。这种方法实现了细粒度的访问控制,允许将敏感知识限制在受信任的部署中,同时保持通用性能。实验表明,GRAM能够有效地隔离病毒学和网络安全等各个领域的特定能力,并且即使在微调后也能保持这种隔离。

  5. SIGNIFICANT · CL_130107 ·

    科大讯飞医疗推出多智能体系统的AI辅助诊断2.0

    在2026年北京数字智能医学大会上,科大讯飞医疗发布了其新一代AI辅助诊断2.0。该更新系统基于公司专有的Spark Medical Large Model V3.5构建,旨在通过整合文档生成、质量控制、诊断决策支持和循证推理等多个AI智能体,成为“超级医生助手”。该先进工具在顶级医院的试点项目中已显示出显著的效率提升,减轻了医生的工作负担并提高了诊断准确性。

  6. TOOL · CL_109943 ·

    研究发现数据重复严重损害语言模型性能

    一篇新发表在arXiv上的研究论文探讨了数据重复对语言模型的有害影响,尤其是在Chinchilla缩放定律时代。该研究量化了与重复相关的“计算等效增益”和“计算等效损失”,揭示了性能在中间重复次数时达到峰值。这种有害的重复次数随模型大小而扩展,表明随着模型增大,最佳重复次数的增长速度快于计算量。研究表明,即使10%的重复文档预算也会导致显著的性能下降,对于一个3.44亿参数的模型而言,相当于在无重复场景下使用了少67%的计算量。这些发…

  7. SIGNIFICANT · CL_96714 ·

    九章云计算推出AI工厂,赋能智能化生产标准化

    九章云计算发布“AI工厂”战略及Alaya NeW Cloud 3.0,旨在通过构建智能化计算的工程体系,解决当前AI部署面临的挑战。公司的方法侧重于通过“DCU”(标准化计算单元)标准化算力,并通过提供分层专业Token的“Token Factory”来交付专业化智能。该系统旨在使AI部署成本可预测,提高智能交付效率,并通过反馈循环实现持续的模型迭代,从而将AI从算力到智能的一次性转换转变为一个自优化的生产系统。

  8. TOOL · CL_93634 ·

    研究论文详述深度学习中Schatten-p范数的最佳用法

    一篇新研究论文探讨了Schatten-p范数在深度学习中的最佳用法,特别是在与Muon等优化器相关的方面。研究表明,这些范数的有效性取决于特定机制,在低维设置(包括与Chinchilla缩放相关的设置)中,较小的Schatten-p几何结构被证明是最佳的。该分析还深入探讨了为何类似Muon的方法倾向于使用大批量,并为不同p值下的批量大小提供了缩放规则。

  9. TOOL · CL_79862 ·

    AI缩放定律由新的数据混合框架解释

    研究人员开发了一个新的理论框架来解释数据混合如何影响AI模型的缩放定律。该框架将现有的神经缩放定律理论扩展到多领域数据,将“容量竞争”和“噪声降低”确定为影响模型在不同数据混合中性能的关键因素。所提出的模型不仅比以前的基线更准确地拟合了损失曲线,而且还成功地根据小规模数据的训练情况,使用更少的参数预测了大规模模型的有效训练混合。

  10. TOOL · CL_15922 ·

    新的缩放定律优化数据受限环境下的AI训练

    研究人员为数据受限环境下的LLM训练开发了新的缩放定律,挑战了传统的Chinchilla定律。他们的模型包含一个加性过拟合惩罚,以便在高质量数据有限时更好地指导决策。新定律表明,超过一定点后,增加模型容量比重复数据更有益,并为在这些场景中使用更强的权重衰减提供了理论基础。

  11. TOOL · CL_38547 ·

    Anthropic 的 Claude Code 重大更新,修复多项错误

    Anthropic 发布了其 AI 驱动的编码助手 Claude Code 的多项更新。最新版本,包括 v2.1.179、v2.1.178 和 v2.1.176,修复了大量错误并引入了新功能。这些更新侧重于提高稳定性、改善用户体验和扩展功能,例如改进的子代理能力、更好的权限规则语法以及对 Windows Subsystem for Linux 和 macOS 等各种操作系统环境的更好支持。