PulseAugur
实时 16:19:52
实体 Chinchilla

Chinchilla

PulseAugur coverage of Chinchilla — every cluster mentioning Chinchilla across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 19
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 14
层级分布 · 90 天
主题
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/2 页 · 共 21 条
  1. COMMENTARY · CL_246889 ·

    量子物理学家认为通用人工智能的到来加速了研究

    量子物理学家 Muhammed Al-Musleh 认为,人工智能通用智能(AGI)可能已经到来,他引用了量子研究的快速加速作为证据。他观察到,人工智能代理正在将数月复杂的量子研究压缩到短短几天内完成。这项进步还使得从现有的量子硬件中提取有价值的工作成为可能,这表明人工智能的能力有了显著飞跃。

  2. RESEARCH · CL_242161 ·

    AI对齐研究探索使用探针训练模型以提高泛化能力

    研究人员正在探索AI对齐的新颖方法,特别是关注“基于探针的训练”。该技术旨在利用AI的内部世界模型,将简单任务的判断泛化到更复杂的任务上。虽然针对探针的梯度下降可以教会模型欺骗它,但针对探针的强化学习(RL)带来了独特的挑战,一些研究表明由于信用分配的复杂性,它可能无效或通过间接方式起作用。未来的研究方向包括使探针适应新技能、重新训练探针以跟上AI概念的演变,以及借鉴人类认知过程以避免AI对齐失败。

  3. RESEARCH · CL_231614 ·

    SMELT 架构提高了 MoE Transformer 的训练效率

    研究人员开发了 SMELT,一种用于混合专家(MoE)Transformer 的新架构,可提高训练效率和下游性能。通过将 Transformer 的中间层循环两次,同时仔细匹配计算预算,SMELT 与基线模型相比,展示了更快的损失减少和显著的训练 FLOPs 节省。这种架构改进转化为在各种基准测试中更好的性能,尤其是在代码相关任务中,这归因于一种将注意力重定向到更相关标记的机制。

  4. TOOL · CL_218848 ·

    Anytime Pretraining 采用无视界 LLM 训练和权重平均

    研究人员推出了一种新颖的大型语言模型训练方法“Anytime Pretraining”,该方法无需预定义训练视界。该方法结合了无视界学习率调度和权重平均,在最终损失方面与传统的余弦衰减调度相当。研究结果表明,这种随时可用的策略为大型语言模型预训练提供了一种实用且有效的方法,尤其是在开放式训练场景中。

  5. TOOL · CL_212080 ·

    新的DeltaMomentum优化器加速深度学习训练

    研究人员推出了一种新颖的深度学习优化器动量更新方法——DeltaMomentum。与使用固定指数移动平均率的传统方法不同,DeltaMomentum根据特定方向梯度更新的频率动态调整遗忘率。这种受线性层梯度结构启发的基于键值对的方法旨在更有效地清除陈旧方向并提高训练速度。实验表明,DeltaMomentum的实现版本DeltaAdamW在包括大型语言模型和图像分类任务在内的各种模型规模和数据集上,与标准的AdamW相比,在显著更少的步…

  6. TOOL · CL_208800 ·

    AI模型扩展定律将焦点从参数数量转移

    AI模型的最优扩展不仅仅涉及参数数量,训练数据、计算分配和推理成本等因素也起着至关重要的作用。早期研究表明参数与数据比率较高,但后续研究表明更均衡的方法,尤其是在考虑推理成本时。Mixture-of-Experts (MoE) 模型进一步增加了复杂性,因为总参数决定了知识容量,而激活的参数则影响推理深度。Z.ai 的 GLM-5.3 版本表明,通过专注于训练后增强,例如扩展长视野环境和强化学习,而不是仅仅增加基础模型大小或预训练数据,…

  7. RESEARCH · CL_206605 ·

    新研究探讨扩散图像模型的缩放定律和训练策略

    研究人员发表了多篇探讨扩散模型在图像生成方面进展的论文。其中一项研究“Abra: Scaling Diffusion Image Training”详细介绍了文本到图像扩散模型的缩放定律的系统分析,发现它们比语言模型需要更多的数据才能实现最佳训练,并且对过度训练具有鲁棒性。另一篇论文研究了像素空间扩散模型,提出了一种潜在到像素的策略,该策略可以加速收敛并提高推理速度。此外,关于“TINA+”的研究探讨了未学习扩散模型中的残余视觉知识,…

  8. RESEARCH · CL_190598 ·

    Meta 研究人员揭示新的 AI 扩展定律和智能体(agent)利用方法

    Meta 研究人员发布了两篇论文,详细介绍了 AI 扩展定律和智能体(agent)利用开发方面的进展。第一篇论文提出了一种将模型容量和训练数据相结合的“扩展定律”(Scaling law),提高了损失预测的准确性,并减少了规划预训练预算的计算需求。第二篇论文提出了 EvoHarness-RL,一种使智能体(agent)能够离线学习利用策略(harness policies)的方法,从而能够执行更鲁棒的长期任务,并在 ALFWorld …

  9. RESEARCH · CL_191291 ·

    新的“Skaling”定律以更少的计算量改进神经网络缩放预测

    研究人员引入了一种名为“Skaling”的新型神经网络缩放定律,该定律解决了现有模型中的局限性。由于假设模型大小和训练数据的独立影响,标准公式在数据稀疏或过度训练的极端情况下常常会错误估计损失。Skaling 将这些因素与交互指数耦合,将平均绝对百分比误差(MAPE)降低了 1.5-3 倍。这种新定律与稀疏网格策略结合使用时,能够以比传统方法少约 10 倍的计算量进行准确的外推,从而为未来模型的训练实现更高效的计算预算分配。

  10. RESEARCH · CL_167724 ·

    新方法提升扩散 Transformer 的效率和性能 · 跟踪 4 个来源

    研究人员开发了新方法来提高扩散 Transformer 的效率和性能,这是 AI 图像和视频生成的一个关键架构。Chimera,一种混合视觉扩散骨干网络,结合了不同的注意力机制和一种新颖的缩放方法,与传统模型相比,实现了显著的计算效率提升。此外,MMOE 通过借鉴大型语言模型的高效专家设计,实现了扩散 Transformer 的现代化,从而加快了收敛速度并改善了质量-成本平衡。Calibri 提供了一种参数高效的扩散 Transfor…

  11. TOOL · CL_167135 ·

    Seesaw方法通过优化批次大小和学习率调度来加速LLM训练

    研究人员开发了一种名为Seesaw的新方法,通过优化批次大小和学习率的调度来加速大型语言模型的训练。该方法在理论上证明了SGD的学习率衰减与批次大小增长之间的等价性,并将其扩展到Adam的代理。实证表明,Seesaw在FLOPs方面与余弦衰减相当,同时将Chinchilla规模模型的训练时间缩短了约36%。

  12. TOOL · CL_141608 ·

    M+Adam 优化器改进低精度大语言模型训练

    研究人员推出 M+Adam,这是一种新颖的优化方法,旨在提高低精度权重下大语言模型训练的准确性。标准优化器在低精度下可能会遇到困难,导致进展停滞,尤其是在权重幅度较大时。M+Adam 通过结合加法和乘法更新类型来解决这个问题,利用它们互补的优势来确保在各种权重幅度和符号变化下都能取得持续的进展。使用 LLaMA 类型模型和不同精度级别(包括 BF16、FP8 和 FP4)进行的实验表明,M+Adam 持续提高了低精度训练的成果。

  13. MEME · CL_134756 ·

    Mastodon 上分享的提及“龙猫”和“蓝莓玛芬”的梗图

    此集群包含一项内容,似乎是在 Mastodon 上分享的梗图或幽默帖子,提及了“龙猫”和“蓝莓玛芬”。内容不足以形成新闻摘要。

  14. RESEARCH · CL_133208 ·

    新的GRAM方法为双重用途能力提供模块化AI访问控制

    研究人员开发了梯度路由辅助模块(GRAM),这是一种新颖的预训练方法,旨在解决AI开发中的双重用途困境。GRAM允许在单个AI模型中选择性地禁用特定能力,以极低的成本近似训练经过筛选数据的独立模型的效果。这种方法实现了细粒度的访问控制,允许将敏感知识限制在受信任的部署中,同时保持通用性能。实验表明,GRAM能够有效地隔离病毒学和网络安全等各个领域的特定能力,并且即使在微调后也能保持这种隔离。

  15. SIGNIFICANT · CL_130107 ·

    科大讯飞医疗推出多智能体系统的AI辅助诊断2.0

    在2026年北京数字智能医学大会上,科大讯飞医疗发布了其新一代AI辅助诊断2.0。该更新系统基于公司专有的Spark Medical Large Model V3.5构建,旨在通过整合文档生成、质量控制、诊断决策支持和循证推理等多个AI智能体,成为“超级医生助手”。该先进工具在顶级医院的试点项目中已显示出显著的效率提升,减轻了医生的工作负担并提高了诊断准确性。

  16. TOOL · CL_109943 ·

    研究发现数据重复严重损害语言模型性能

    一篇新发表在arXiv上的研究论文探讨了数据重复对语言模型的有害影响,尤其是在Chinchilla缩放定律时代。该研究量化了与重复相关的“计算等效增益”和“计算等效损失”,揭示了性能在中间重复次数时达到峰值。这种有害的重复次数随模型大小而扩展,表明随着模型增大,最佳重复次数的增长速度快于计算量。研究表明,即使10%的重复文档预算也会导致显著的性能下降,对于一个3.44亿参数的模型而言,相当于在无重复场景下使用了少67%的计算量。这些发…

  17. SIGNIFICANT · CL_96714 ·

    九章云计算推出AI工厂,赋能智能化生产标准化

    九章云计算发布“AI工厂”战略及Alaya NeW Cloud 3.0,旨在通过构建智能化计算的工程体系,解决当前AI部署面临的挑战。公司的方法侧重于通过“DCU”(标准化计算单元)标准化算力,并通过提供分层专业Token的“Token Factory”来交付专业化智能。该系统旨在使AI部署成本可预测,提高智能交付效率,并通过反馈循环实现持续的模型迭代,从而将AI从算力到智能的一次性转换转变为一个自优化的生产系统。

  18. TOOL · CL_93634 ·

    研究论文详述深度学习中Schatten-p范数的最佳用法

    一篇新研究论文探讨了Schatten-p范数在深度学习中的最佳用法,特别是在与Muon等优化器相关的方面。研究表明,这些范数的有效性取决于特定机制,在低维设置(包括与Chinchilla缩放相关的设置)中,较小的Schatten-p几何结构被证明是最佳的。该分析还深入探讨了为何类似Muon的方法倾向于使用大批量,并为不同p值下的批量大小提供了缩放规则。

  19. TOOL · CL_79862 ·

    AI缩放定律由新的数据混合框架解释

    研究人员开发了一个新的理论框架来解释数据混合如何影响AI模型的缩放定律。该框架将现有的神经缩放定律理论扩展到多领域数据,将“容量竞争”和“噪声降低”确定为影响模型在不同数据混合中性能的关键因素。所提出的模型不仅比以前的基线更准确地拟合了损失曲线,而且还成功地根据小规模数据的训练情况,使用更少的参数预测了大规模模型的有效训练混合。

  20. TOOL · CL_15922 ·

    新的缩放定律优化数据受限环境下的AI训练

    研究人员为数据受限环境下的LLM训练开发了新的缩放定律,挑战了传统的Chinchilla定律。他们的模型包含一个加性过拟合惩罚,以便在高质量数据有限时更好地指导决策。新定律表明,超过一定点后,增加模型容量比重复数据更有益,并为在这些场景中使用更强的权重衰减提供了理论基础。