PulseAugur
实时 06:00:59
实体 diffusion

diffusion

PulseAugur coverage of diffusion — every cluster mentioning diffusion across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 21
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 18
层级分布 · 90 天
主题
时间线
  1. 2026-05-26 funding Victor Lazarte and Kris Fredrickson are raising an $800 million AI-focused fund named Diffusion. 来源
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 21 条
  1. RESEARCH · CL_207584 ·

    Etched 以 210 亿美元估值完成 7 亿美元融资,一个月内估值翻倍

    AI 硬件初创公司 Etched 已获得 7 亿美元融资,估值为 210 亿美元,较数月前 103 亿美元的估值大幅增长。该公司估值快速增长归因于其创新的 AI 推理硬件,该硬件采用定制设计的组件,可实现更快、更高效的 AI 模型处理。Etched 的技术旨在加速 AI 推理的提示理解和输出生成阶段,为包括 Jane Street 在内的知名投资者提供更高的速度和更低的成本。

  2. RESEARCH · CL_206266 ·

    新的AI模型提升视频生成质量和效率 · 跟踪4个来源

    研究人员开发了新的方法来提高AI生成视频的质量和效率。Stream4D通过使用显式建模场景动态的4D重建奖励来解决自回归扩散模型中的几何漂移问题,从而实现更好的运动保持和更高的人类偏好度。FrescoDiffusion通过结合平铺去噪和预计算的潜在先验来维持全局一致性和精细细节,解决了生成4K等超高分辨率视频的挑战。此外,Spectral Progressive Diffusion提供了一个用于高效图像和视频生成的框架,通过在扩散模型…

  3. TOOL · CL_206055 ·

    Equilibrium Forcing 实现了无需噪声条件即可进行自适应视频生成

    研究人员推出了一种新颖的自适应视频生成框架 Equilibrium Forcing (EqF),该框架无需噪声条件即可运行。该方法将去噪场的学习与采样过程解耦,从而实现了更灵活和数据依赖的推理。与传统的噪声条件方法相比,EqF 在具有挑战性的基准测试中展示了改进的视频质量和一致性。

  4. RESEARCH · CL_198297 ·

    新研究通过增强的控制力和质量推进视频到音频生成

    两篇新研究论文介绍了视频到音频(V2A)生成的先进方法。ControlFoley 专注于通过更有效地整合视觉和文本信息以及解耦音频的时间和音色方面来增强可控性。HarmoniDPO 通过使用双视频表示和偏好优化(类似于人类反馈强化学习)来解决同步和质量问题,使生成的音频与人类感知保持一致。

  5. TOOL · CL_183481 ·

    新研究探讨图像分割模型中的不确定性

    一篇新的arXiv论文探讨了图像分割中的不确定性量化(UQ),这是安全敏感应用的关键领域。研究调查了偶然不确定性(数据相关)和认知不确定性(模型相关)之间的相互作用,并指出它们之间存在显著的纠缠,这会降低可解释性。该研究提出了一种量化这种纠缠的度量方法,并发现集成模型在纠缠度较低时通常表现更好,而softmax模型的结果则因数据集和校准任务而异。

  6. TOOL · CL_174351 ·

    DinoLizer模型以20%的更高准确率识别生成性修复伪影

    研究人员开发了DinoLizer,一种用于识别生成性修复中被操纵区域的新方法。这种基于DINOv2的本地化器通过关注语义改变的区域,比现有方法实现了20%更高的交并比(Intersection over Union)分数。DinoLizer使用LORA在Transformer块上进行训练,并证明了其对JPEG压缩的鲁棒性,其代码已公开提供。

  7. RESEARCH · CL_180897 ·

    LeapTalk框架实现200 FPS的实时说话人头像生成

    研究人员开发了LeapTalk,一个旨在克服说话人头像生成中延迟-质量权衡的新型框架。这种新方法能够通过单次前向传播实现稳定、实时的视频生成,并能处理任意长度的视频。LeapTalk利用基于布朗桥的数据到数据传输公式和异构蒸馏框架来确保时间稳定性和平滑的知识转移。该系统实现了高保真唇形同步,视频生成速度最高可达200 FPS,显著提高了效率和稳定性,优于现有方法。

  8. RESEARCH · CL_129076 ·

    新研究通过改进的时间一致性和效率来增强视频生成

    研究人员正在开发新的方法来改进视频生成模型,重点关注效率和时间一致性。一种方法,Hamiltonian Generative Networks (HGNs),旨在实现与帧率无关的连续时间预测,并提出了解决潜在幅度增长和截断误差累积等问题的修复方案。另一个重点领域是使用扩散模型统一视频生成和理解,Gen4U 等框架将生成表示重新用于视频分类和深度估计等任务。效率也通过诸如少步蒸馏和动态计算等技术得到解决,如 Dynamic-in-Few…

  9. TOOL · CL_123347 ·

    新的数据策略提升了VLA模型在机器人领域的空间泛化能力

    研究人员开发了一种新的数据收集策略,以提高用于机器人操作的视觉-语言-动作(VLA)模型的空间泛化能力。研究认为,仅仅增加视点数量是不够的,模型常常会因为关注虚假关联而陷入捷径学习。通过采用一种结合连续摄像机运动和多样化静态视点的混合方法,所提出的方法显著减少了这些虚假关联,从而提高了性能和训练稳定性。该策略已被证明有利于各种VLA模型架构,使其能够更好地泛化到未见的摄像机姿态和物体配置。

  10. RESEARCH · CL_117176 ·

    新的arXiv论文探讨流匹配和最优传输在生成模型中的应用

    两篇新的arXiv论文深入探讨了先进的生成模型技术。第一篇论文“Notes on generative modeling: flow matching, diffusion, optimal transport and Schrödinger bridge”由Titouan Vayer撰写,探讨了最优传输与Schrödinger bridge和流匹配等方法之间的数学联系。第二篇论文“Robustness and Structure P…

  11. COMMENTARY · CL_108803 ·

    AI 模型解析:LLM、Transformer、Diffusion 等

    本文解释了各种类型的 AI 模型,区分了大型语言模型 (LLM) 的密集模型和专家混合 (MoE) 模型。文章详细介绍了 Transformer 架构,该架构因其自注意力机制而成为现代 LLM 的基础。文章还涵盖了较旧的技术,如用于图像处理的 RNN/LSTM、卷积神经网络 (CNN),以及用于生成图像和其他媒体的扩散模型。最后,文章介绍了多模态模型,这类模型可以处理文本和图像等多种类型的数据。

  12. RESEARCH · CL_107850 ·

    NeuroSonic框架从脑电图信号重建语音

    研究人员开发了NeuroSonic,一个用于从脑电图(EEG)信号重建语音的新框架。该方法利用条件流匹配来学习一个确定性的速度场,该速度场在EEG数据的指导下将噪声声学状态转换为清晰的语音。NeuroSonic通过将EEG和音频嵌入共享的token空间并采用时间条件Transformer来解决EEG信号微弱和多变性的挑战。在CineBrain和EAV基准上的评估表明,NeuroSonic通过提高分布真实性、频谱保真度和感知质量,在伪影…

  13. TOOL · CL_98010 ·

    Ghost Attractor Networks 为高效顺序生成和稳定的潜在结构提供了可能

    研究人员推出了一种新颖的动态解码器 Ghost Attractor Networks (GANs),旨在提高大型模型中顺序生成的效率和控制能力。GANs 利用具有盆地吸引子结构的学习势能,实现闭环控制,例如相位条件动作生成和跨步潜在信息传递。经验表明,与 Diffusion Transformer 相比,GAN 模型在参数量和延迟方面显著减少,同时在机器人动作解码任务和闭环基准测试中实现了相当或更优的准确性。

  14. TOOL · CL_74160 ·

    流匹配模型学习速度更快,泛化能力优于扩散模型

    一位用户训练了两个生成图像模型,一个使用扩散模型,另一个使用流匹配模型,采用相同的架构和数据集来比较它们的性能。流匹配模型在训练初期表现出更快的学习速度,在训练过程的早期就能生成可识别的图像。此外,尽管使用了相同的文本编码器,流匹配模型在全局结构、提示遵循能力和零样本生成能力方面均优于扩散模型。

  15. TOOL · CL_56409 ·

    新研究探索检测人工智能生成的时间序列数据

    研究人员探索了检测扩散模型生成的时间序列数据的方法,特别是在未知具体生成器的情况下。一种需要访问生成器的白盒检测方法在分布内场景中被证明是有效的,但在生成器偏移方面遇到了困难。相比之下,一个简单的黑盒分类器表现明显更好,平均F1分数达到79.2,比白盒方法高出22.1%。这表明扩散生成时间序列的检测与其在图像领域的对应物有所不同。

  16. RESEARCH · CL_53083 ·

    前 Benchmark 投资人目标为新 AI 基金 Diffusion 募集 8 亿美元

    前 Benchmark 投资人 Victor Lazarte 和 Kris Fredrickson 正在推出一家名为 Diffusion 的新 AI 专注于风险投资基金。他们计划募集约 8 亿美元,这将是今年规模最大的首次基金募集之一。两位投资人在离开 Benchmark 后都曾募集过规模较小的个人基金,他们支持 Mercor 和 Harvey 等成功 AI 初创公司的综合往绩预计将吸引投资者。

  17. RESEARCH · CL_53609 ·

    Kan Extension Transformers 统一了注意力、扩散和自条件化

    研究人员推出了一种名为 Kan Extension Transformers (KETs) 的新框架,该框架通过范畴论的视角统一了各种 Transformer 实现。KETs 将 Transformer 层视为加权的结构化扩展算子,涵盖了标准注意力、Geometric Transformers 和高阶单纯形情况。该框架还连接到扩散式补全,并通过作用于分离的预测载体来引入自条件机制,从而在不泄露未来 token 的情况下揭示非因果结构。…

  18. TOOL · CL_45042 ·

    新型扩散模型增强多智能体运动预测

    研究人员开发了一个新的基于扩散的框架,以改进多智能体运动预测。该方法利用历史轨迹的上下文信息来增强预测运动的多样性和表现力。为了确保交互式智能体之间的一致性,基于能量的公式在保持个体轨迹合理性的同时,对联合轨迹分布进行优化。在基准数据集上的实验表明,该方法在边际和联合指标上均优于现有方法。

  19. RESEARCH · CL_42453 ·

    新的HITL-D框架将人类控制与AI融合,用于机器人操作

    研究人员开发了HITL-D,一个结合人类输入和基于扩散的AI策略用于机器人操作的新共享控制框架。该系统旨在通过提供末端执行器方向的自主更新,减少对操纵杆的广泛控制需求,并降低心智负荷,从而提高用户在复杂任务中的表现。一项包含12名参与者的用户研究表明,与传统遥操作相比,HITL-D将任务完成时间缩短了40%,感知工作量降低了37%。

  20. RESEARCH · CL_20517 ·

    新工具通过优化优化器状态来减少AI训练中的GPU内存使用量

    研究人员开发了一种预算感知优化器配置器(BAOC),以解决大规模模型训练过程中显著的GPU内存消耗问题。BAOC根据梯度行为以及指定的内存和时间预算,智能地为不同的网络块分配不同的优化器配置。该方法旨在在不影响训练质量的情况下减少内存使用量,并在视觉、语言和扩散模型上的实验中得到了证明。