PulseAugur
实时 09:06:48
实体 diffusion model

diffusion model

PulseAugur coverage of diffusion model — every cluster mentioning diffusion model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
12
90 天内 61
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 56
层级分布 · 90 天
主题
关系
时间线
  1. 2026-08-18 research_milestone A diffusion model was trained to run on a microcontroller with limited RAM. 来源
情绪 · 30 天

9 天有情绪数据

最近 · 第 1/4 页 · 共 61 条
  1. TOOL · CL_208695 ·

    Know3D 框架使用 VLM 来改进可控的 3D 资产生成

    研究人员开发了 Know3D,一个通过整合来自视觉语言模型 (VLM) 的知识来增强 3D 资产生成的新框架。该方法使用 VLM 来理解语义指令并指导扩散模型,然后将这些知识转化为 3D 生成过程。Know3D 旨在将 3D 模型中未见区域的生成从随机过程转变为语义可控过程,从而提高与用户意图的对齐度和几何合理性。

  2. TOOL · CL_206907 ·

    训练了一个能在264KB内存上运行的扩散模型

    一位开发者成功训练了一个图像生成扩散模型,该模型可以在只有264KB内存的微控制器上运行。该项目使用了Shrike lite微控制器,并在板载FPGA上创建了定制的INT8 MAC引擎来加速计算。尽管遇到了内存限制,导致FPGA加速版本最终比仅使用MCU的模型慢,但开发者认为该项目很有趣,并生成了一些有趣的、尽管有些噪点的32x32像素图像。

  3. RESEARCH · CL_206633 ·

    新框架应对电子商务图像文本生成和编辑

    两篇新研究论文介绍了处理电子商务图像中文本的新颖框架。TransAnyText 提出了一种结构化视觉代码方法,生成可渲染的 HTML 补丁,将语义理解与像素渲染分离,并采用包括监督微调和强化学习在内的多阶段训练过程。PosterText 通过将文本补丁视为原子单元,为电子商务海报的生成和编辑提供了统一的任务表述,并采用了包括文本渲染预训练和用于偏好对齐的强化学习在内的四阶段课程。

  4. TOOL · CL_203906 ·

    新型扩散模型可根据组织学图像预测基因表达

    研究人员开发了一种新方法,通过将任务重新构建为转录程序空间中的条件生成问题,从组织学图像预测基因表达。该方法利用共识非负矩阵分解 (cNMF) 来识别关键转录程序,然后采用条件扩散模型根据形态学数据生成程序激活。该方法旨在通过利用已建立的转录组学建模实践并降低生成任务的维度,来克服当前空间转录组学技术的成本和可扩展性限制。

  5. TOOL · CL_195930 ·

    新的DURA攻击使用扩散模型操纵机器人

    研究人员开发了一种名为DURA的新方法,该方法使用扩散模型为视觉-语言-动作(VLA)模型创建视觉上自然的对抗性补丁。这些补丁可以操纵机器人执行非预期操作,对实际应用构成重大安全风险。DURA在白盒和黑盒场景中都有效,在模拟和物理测试中均优于现有攻击方法,凸显了VLA系统改进防御的必要性。

  6. RESEARCH · CL_194032 ·

    新的 MRI 定图技术利用扩散模型和不确定性传播 · 跟踪 2 个来源

    arXiv 上的两篇新研究论文探讨了用于定量 MRI 定图的先进方法,重点关注不确定性量化和校准。第一篇论文介绍了一个用于定量 MRI 的扩散模型衍生的不确定性框架,展示了其在错误意识和选择性预测方面的潜力,尽管它需要校准才能精确解释区间。第二篇论文提出了 CUPA-T2*,一个将不确定性从加速 MRI 重建传播到 T2* 拟合的框架,实现了不确定性感知的分析,并提供了体素级不确定性图以获得更好的解释,特别是在更高加速率下的白质。

  7. RESEARCH · CL_196087 ·

    新的量化方法旨在降低LLM的计算成本

    两篇新的研究论文介绍了一种量化大型语言模型(LLM)的新颖方法,以减少其计算足迹。LoRAQuant专注于低秩自适应(LoRA)适配器的混合精度量化,使用奇异值分解将重要信息集中到更高精度的组件中,同时将其余部分量化为超低比特宽度。ReRound通过采用具有条件扩散模型的重构舍入技术来解决无校准量化中的中点歧义,特别有利于较小的LLM,并优于标准的四舍五入到最近的方法。

  8. RESEARCH · CL_183051 ·

    UniNav模型统一视觉预测和导航轨迹

    研究人员推出UniNav,这是一种新颖的扩散模型,专为具身智能体的视觉导航而设计。该模型将未来的视觉预测和连续航点轨迹生成统一到单个扩散过程中。UniNav利用Transformer++架构并结合了感知几何的相机令牌来增强空间定位。研究还探讨了在没有明确航点标注的情况下,在多样化的视频数据上进行训练,并引入了两个变体:UniNav-Full用于详细预测,UniNav-Fast用于高效、低延迟的轨迹生成。

  9. TOOL · CL_178135 ·

    在 Mac 上部署扩散模型面临 NumPy 障碍

    作者尝试在 Mac 上部署一个扩散模型,遇到了 NumPy 库的重大挑战。具体来说,将 Stable Diffusion XL (SDXL) 模型导出到 Core ML 的过程出现了问题,NumPy 错误阻止了数组转换为标量值。

  10. TOOL · CL_174338 ·

    纳米卫星利用人工智能进行自主飞机监视

    研究人员开发了一种新颖的从纳米卫星进行自主飞机监视的工作流程,解决了下行链路预算和稀缺训练数据的限制。该系统利用具有低功耗边缘张量加速器的CubeSat上的板载推理,并结合通过低秩自适应微调的扩散模型来为稀有飞机类别生成合成图像。这种方法显著提高了检测精度,增加了全局平均精度,并提高了少数类别的F1分数,同时还实现了实时处理能力。

  11. RESEARCH · CL_165231 ·

    新研究探索使用扩散模型进行高级图像修复

    两篇新研究论文探讨了使用扩散模型进行高级图像修复的技术。第一篇论文介绍了一种无噪声、单步LoRA方法,该方法通过利用预训练的扩散先验来改进任务驱动的图像修复,其性能优于多步扩散方法,并在分类、分割和检测任务中有所提升。第二篇论文提出了TDiR,一个基于Transformer的扩散模型,旨在增强降级图像在去噪和去雨等各种任务中的表现,在多个基准测试中展现出优于现有最先进技术的性能。

  12. TOOL · CL_158763 ·

    新AI模型学习紧凑型脑图谱表示以解码认知状态

    研究人员开发了一种新颖的方法,利用图Transformer自编码器为功能性脑图谱创建紧凑型表示。该方法将领域特定的几何信息作为归纳偏置来指导学习过程。该无监督方法能够区分认知状态和解码视觉刺激,并在包含神经动力学时提高性能。此外,还为学习到的潜在表示拟合了一个扩散模型,以生成合成脑图谱。

  13. RESEARCH · CL_154509 ·

    新的AI方法增强三维渲染、重建和动画 · 已追踪4个来源

    研究人员正在开发新的方法,通过整合扩散模型和先进的优化技术来增强三维渲染和重建。一种名为特征引导扩散演化(FIDE)的方法,使用Vision Transformers提取的视觉特征来指导扩散模型和CMA演化策略进行不可微逆渲染,其性能优于传统的基于梯度的方法。另一项开发是FutureSurf,它提出了一个用于动态表面重建的基准和数据集,并指出当前方法在预测观察时间窗口之外的未来几何形状方面存在困难。此外,Texture++提出了一种用…

  14. RESEARCH · CL_128456 ·

    新的DUPO方法利用扩散模型改进强化学习

    研究人员推出了一种新方法,称为扩散引导的不确定性感知延迟策略优化(DUPO),以解决由延迟反馈引起的强化学习性能下降问题。DUPO使用扩散模型显式地建模延迟状态与当前状态之间的关系,从而能够估计差异并相应地加权延迟策略。在机器人控制任务上的实验表明,DUPO在超越现有方法方面非常有效,尤其是在具有长期和随机延迟的场景中。

  15. RESEARCH · CL_128382 ·

    新方法利用流形假设和VAE进行缺失数据填充

    研究人员开发了一种新颖的缺失数据填充方法,该方法利用了流形假设,即高维数据位于低维流形上。所提出的技术利用混合变分自编码器(VAEs)来捕捉底层数据结构,然后采用采样-重要性重采样(SIR)程序,并可能由联合扩散模型增强。这种方法不仅在填充缺失值时尊重数据几何结构,还能量化填充不确定性并允许即时填充。

  16. TOOL · CL_118134 ·

    EraseLoRA框架使用MLLM进行无数据集对象移除

    研究人员开发了EraseLoRA,一种用于图像无数据集对象移除的新型框架。该方法利用多模态大语言模型来区分目标前景、其他前景元素和背景。然后,它采用一种感知背景的重建过程,聚合各种背景子类型以确保忠实集成,在背景保真度方面优于以前的无数据集技术,并减少了不希望的前景再生。

  17. RESEARCH · CL_117604 ·

    流匹配研究推动生成模型和逆问题发展 · 跟踪10个来源

    近期研究探索了用于生成模型和逆问题的流匹配技术的进展。论文介绍了用于高效多模态基于仿真的后验估计的FUSE,用于具有不确定性量化的稳定逆设计的对角流匹配(Diag-CFM),以及用于约束生成的拉格朗日对偶流。其他工作侧重于用于改进期望估计的得分正则化联合采样以及扩散和流匹配采样器的渐近保持分析。此外,流匹配正应用于稀疏视图CT重建和地球物理反演,展示了其在各种科学和工程领域的通用性。

  18. TOOL · CL_112589 ·

    AI 从汉堡数据中发现巨无霸配方,并生成新式汉堡

    据报道,一个在汉堡配方上训练的扩散模型在没有明确指令的情况下“发现”了巨无霸。该 AI 系统还可以生成针对特定标准(如口味、可持续性或营养)进行优化的新式汉堡概念。AI 在烹饪艺术中的应用,特别是在食谱生成和优化方面,被强调为一项重要的用例。

  19. TOOL · CL_110053 ·

    新型扩散模型应对影片修复挑战

    研究人员开发了HaineiFRDM,这是一种新颖的扩散模型,专为影片修复而设计,在快速运动和多样化缺陷等挑战性条件下尤其有效。该模型通过利用内容建模能力来解决结构失真和肢体消失等问题。为了实现高分辨率修复,HaineiFRDM采用了具有全局融合模块的块状策略以实现跨块一致性,一个基于频率的模块以实现纹理一致性,以及一个块一致推理框架以最小化伪影。该团队还创建了一个新的影片修复数据集,并证明他们的方法在具有强大结构一致性的同时实现了卓越…

  20. TOOL · CL_110009 ·

    新CCUA方法提升了稀有类别AI图像生成能力

    研究人员开发了一种名为对比条件-无条件对齐(CCUA)的新方法,以提高扩散模型生成的图像的质量和多样性,特别是在训练数据有限的类别上。CCUA结合了对齐损失(AL),使去噪过程在早期阶段对类别条件的敏感度降低,促进了头部和尾部类别之间的知识共享,以及无监督对比损失(UCL),以增加合成图像之间的差异性。该方法在不损害头部类别质量的情况下增强了尾部类别的生成能力,并在ImageNet-LT等数据集上显示出优于现有方法的性能。