gradient
PulseAugur coverage of gradient — every cluster mentioning gradient across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
Gradient-based learning remains a core focus in AI research.
The recent cluster evidence highlights the continued importance of gradient-based learning, with an article detailing the chain rule in backpropagation for neural networks. This suggests that fundamental concepts in gradient computation and application are still a significant area of research and education within the AI community.
Novel optimization frameworks beyond standard gradient descent will gain traction.
The introduction of the Generalized Quadratic Gradient (GQG) framework, which unifies and extends existing second-order optimization methods, indicates a move towards more sophisticated optimization techniques. This could lead to the development and adoption of new optimizers that offer advantages over traditional methods in complex deep learning scenarios.
AI-driven personalization in e-commerce and dating will increasingly leverage intent-aware models.
Startups like Malachyte and Ditto are focusing on AI that understands real-time user intent and deeper personality traits, rather than just historical data. This suggests a trend towards more dynamic and context-aware AI applications in consumer-facing platforms, aiming for higher engagement and conversion rates.
-
新公式校准差分隐私随机梯度下降噪声以对抗成员推断攻击
研究人员开发了一种新的闭式公式,用于校准差分隐私随机梯度下降(DP-SGD)的噪声水平。DP-SGD 是一种通过向梯度添加噪声来保护训练数据的方法。该公式特别适用于具有随机分配的 DP-SGD,其中每个记录在每个 epoch 中随机使用一次。推导出的公式提供了对使用此方法训练的模型的成员推断攻击(MIA)准确度的上限,与传统的数值隐私会计方法相比,提供了一种更有效的方法来确定必要的噪声乘数。
-
新算法提高了变分不等式的收敛速率
研究人员开发了一种新的随机算法,该算法结合了Halpern锚定技术,以解决约束凸凹问题和单调变分不等式。该算法采用单循环、单调用方式,在每次迭代中使用梯度算子的无偏样本,适用于具有噪声反馈的单调博弈。该算法在梯度映射范数和受限差距方面均实现了O(t^{-1/4})的任意最后迭代收敛速率,优于先前受限差距的O(t^{-1/5})最佳速率。
-
AI训练基础:梯度下降与AdamW详解
《Towards AI》的两篇文章深入探讨了机器学习训练的基础概念。第一篇文章解释了梯度在训练大型模型时的局限性,强调了像AdamW这样的优化器的必要性。第二篇文章探讨了梯度下降背后的直觉,揭示了机器学习模型如何通过数学过程进行学习。
-
个人现在可以将闲置算力出租用于AI推理
新兴公司允许个人出租其闲置计算能力用于AI推理任务,这与网约车和住宿共享平台有相似之处。这种方法旨在去中心化计算资源,为大型、资源密集型数据中心提供替代方案。Far Labs和Evolving Edge等平台正在推出服务,将拥有闲置硬件的个人与需要推理能力的AI公司联系起来,重点关注计算提供商的安全和隐私。
-
理解反向传播:神经网络中的链式法则
本文解释了链式法则的数学概念及其在反向传播中的关键作用,反向传播是用于训练人工智能神经网络的算法。文章演示了如何手动计算导数并通过微小的数值扰动进行验证,这是一种对基于梯度的学习至关重要的调试技术。解释涵盖了一个简单的两层网络,详细介绍了计算输出的前向传播和计算每个参数的梯度的后向传播,并强调了该过程对大型模型的效率。
-
Z世代约会应用Ditto利用人工智能促进线下约会,融资920万美元
Ditto是加州大学伯克利分校辍学生Allen Wang和Eric Liu创立的一款新的约会应用,正逐渐摆脱传统的滑动式约会应用。取而代之的是,它使用一个人工智能聊天机器人,每周三匹配大学生进行线下约会。该人工智能分析更深层次的个性特征和偏好,而非仅仅是表面兴趣,以预测化学反应。该平台已有15万用户注册,匹配成功率(匹配到约会)为20%,并已获得920万美元的种子轮融资。
-
前Spotify AI工程师筹集1000万美元,用于意图感知型电商个性化
由前Spotify员工创立的初创公司Malachyte已筹集到1000万美元的种子资金,将其先进的推荐AI应用于电商领域。该系统名为“双头向量AI”(two-headed Vector AI),专注于预测购物者的实时意图和偏好,而不是仅仅依赖于过去的购买行为。这项技术旨在为新老顾客创造更个性化的购物体验,通过单次会话和跨访问的用户互动进行持续学习。Malachyte的平台已通过API集成向Shopify商家和大型零售商提供。
-
MinMax H3 Turbo LoRA 以早期成果给 Stable Diffusion 用户留下深刻印象
Reddit 用户正在分享他们对新的 MinMax H3 Turbo LoRA 的体验和成果,该工具旨在增强 Stable Diffusion 中的视频生成能力。尽管该 LoRA 仍处于早期开发阶段,并被标记为实验性,但它已经产生了“惊人”和“出色”的效果,用户强调了它在生成的片段中创造平滑、自然运动的能力。一些用户分享了 ComfyUI(Stable Diffusion 的一个流行界面)的兼容版本和设置,这表明了社区的快速采纳和发展。
-
广义二次梯度框架统一优化方法
研究人员引入了广义二次梯度(GQG),一个统一和扩展现有二阶优化方法的新型优化框架。GQG抽象了二次梯度(QG)和简化二次梯度(SQG)的核心原理,证明了满足局部二次模型平稳条件的正定曲率矩阵足以进行构建。这种泛化允许开发超越传统Hessian近似的新型感知曲率的优化算法,在深度学习中具有潜在应用。
-
新的动力学理论正式化了零阶牛顿方法
研究人员为零阶牛顿型方法开发了正式的动力学理论,这在梯度和Hessian不可用时很有用。该框架包括一个高斯-斯坦(Gaussian-Stein)校正,用于准确估计平滑目标函数的Hessian。分析揭示了影响更新的两个噪声通道:一个来自梯度噪声,另一个来自Hessian噪声,在有噪声的Oracle条件下,后者携带一个重要的因子。动力学提升将有限步牛顿更新与欠阻尼相空间模型联系起来,产生了一个Lyapunov界限,突出了曲率与方差在步长、…
-
符号回归发现了新颖的神经网络优化器
研究人员探索了使用符号回归为前馈神经网络发现新颖的权重更新规则。在30个基准和神经网络组合的实验中,符号回归方法产生的更新规则在25个实例中优于已建立的优化器,平均均方误差(MSE)降低了44.47%。新发现的规则通常包含自适应归一化、类似动量的元素和非线性变换,这表明符号回归在创建高效优化器变体方面具有潜力,但建议进行更大规模的验证。
-
新的Transformer设计分离状态预测以提高效率
研究人员提出了状态预测分离假说,认为在Transformer中区分下一个词预测和状态存储的作用可以提高语言建模性能。一种采用两个独立计算流来执行这些功能的新型Transformer变体,展示了改进的数据和计算效率。实验表明,与标准Transformer相比,这种方法在下游任务上持续降低了验证损失,平均性能提高了2-3个百分点。
-
MiniMax AI 展示本地、离线人工智能开发,配备 428B 模型
MiniMax AI 展示了一个可在个人硬件上运行的本地人工智能设置,演示了一个结合了 4280 亿参数模型的自进化代理。该系统包含 Gradient、Parallax 和 GA agent ai 的组件,完全离线运行,无需依赖云或支付 API 费用。演示内容包括创建一个五只股票的投资组合并将输出写入磁盘,突显了去中心化人工智能发展的潜力。
-
Asana 以 7500 万美元收购 Stack AI,以管理人类-智能体团队
工作场所管理公司 Asana 以 7500 万美元收购 Stack AI,旨在将其 AI 智能体集成到其平台中,以大规模管理人类-智能体协作。此举正值 Asana 的股价因市场对 AI 对传统 SaaS 商业模式影响的担忧而大幅下跌之际。此次收购预计将加速 Asana 向企业智能体团队操作系统转型,并预计在三个月内完成全面集成。
-
Asana 以 7500 万美元收购无代码 AI 代理构建器 Stack AI
Asana 已以 7500 万美元的价格收购了专注于无代码 AI 代理构建的公司 Stack AI。此次收购是 Asana 巩固其作为原生 AI 工作场所平台地位的战略举措,旨在成为“人机协作团队的操作系统”。Stack AI 技术有望加速 Asana 在 AI 驱动的工作流自动化和预构建自动化方面的路线图,从而实现更复杂的端到端业务流程自动化。
-
Anduril 首席执行官 Brian Schimpf 详细介绍国防科技公司的增长和不断变化的战争形态
Anduril 首席执行官 Brian Schimpf 自公司成立以来一直领导这家国防科技公司,他讨论了公司早期开发自主监控塔的经历。这家公司目前的估值为 305 亿美元,正面临日益增长的审查和在战斗及测试中交付成果的压力。这篇报道标志着对 Schimpf 的首次深入了解,恰逢一份可能使 Anduril 估值翻倍的融资传闻,而此时地缘政治紧张局势加剧。
-
新工具通过优化优化器状态来减少AI训练中的GPU内存使用量
研究人员开发了一种预算感知优化器配置器(BAOC),以解决大规模模型训练过程中显著的GPU内存消耗问题。BAOC根据梯度行为以及指定的内存和时间预算,智能地为不同的网络块分配不同的优化器配置。该方法旨在在不影响训练质量的情况下减少内存使用量,并在视觉、语言和扩散模型上的实验中得到了证明。
-
新研究分析二阶优化器中的机器学习遗忘
一篇新论文分析了机器学习遗忘技术,特别是针对二阶优化器,发现当前定义可能不足。研究比较了一阶和二阶优化器在数据删除任务中的表现,指出虽然两种方法都显示出性能和梯度对齐,但二阶优化器表现出状态波动性。这种波动性表明存在一阶分析可能忽略的残余信息,表明需要受控的状态扰动来完全擦除几何信息。